Поделиться в MAX

PostgreSQL as an open data format_ 100x TPC-H queries through direct storage reads (PConf.dev 2026)

Аватар автора
PostgreSQL как открытый формат данных: 100-кратное ускорение запросов TPC-H за счет прямого чтениz=я с диска PostgreSQL обычно не рассматривается как аналитическая система. Исторически сложилось так, что разработчики создавали форки и переупаковывали PostgreSQL, добавляя аналитические возможности, включая собственные столбцовые форматы, распределенную массивно-параллельную обработку и векторизованные исполнители запросов. Однако эти системы значительно отличались от ядра PostgreSQL и стали несовместимы со стандартными инструментами PostgreSQL. В последнее время несколько проектов использовали систему расширений PostgreSQL для ускорения запросов в стиле OLAP посредством федерации и интеграции с DuckDB, но они все еще отстают по масштабируемости от специализированных аналитических систем. Одной из проблем современных подходов к ускорению запросов OLAP являются ограничения, накладываемые архитектурой PostgreSQL, которая лучше оптимизирована для запросов в стиле OLTP. Хотя несколько расширений PostgreSQL добавили поддержку столбцового формата, исполнитель PostgreSQL по-прежнему не обладает возможностями, необходимыми для крупномасштабной аналитики, включая массовую параллельную обработку и векторизованное выполнение. Что если мы перевернем модель с ног на голову: вместо того, чтобы проходить через слой выполнения PostgreSQL, мы будем считывать данные непосредственно из хранилища? Современная аналитика движется в сторону архитектур типа «озеро-база», которые используют...

0/0


0/0

0/0

0/0

0/0