Andy Pavlo 加入 ClickHouse,创建 ClickHouse Labs
文章摘要
2026 年 8 月 3 日,卡内基梅隆大学(CMU)著名数据库教授 Andy Pavlo 在 ClickHouse 官方博客上宣布,他将加入 ClickHouse,创建并领导一个名为 ClickHouse Labs 的全新研究团队。对数据库圈子来说这是个不小的新闻——Pavlo 是 CMU 15-445 / 15-721 数据库课程的主讲人,这套公开在 YouTube 上的课程堪称全球数据库爱好者的入门圣经,他还维护着数据库百科站点 dbdb.io。
Pavlo 在文中回顾了自己与 ClickHouse 的渊源。他 2013 年成为 CMU 计算机系教授,职业生涯一直致力于理解现代数据库管理系统(DBMS)内核的科学原理,并把追踪工业界和学术界每一个新系统当作日常功课。他从 2016 年 6 月 ClickHouse 开源之日起就知道这个系统,当时的第一反应是”这肯定是画大饼,好得不像真的”——因为 ClickHouse 具备的那些特性,在 2016 年只有极少数闭源商业分析型数据库才有。比如它用 C++ 编写,并且在 2016 年就支持基于 SIMD 的向量化查询执行;而当时主流的开源分析型数据库大多基于 JVM,直到数年后才支持 SIMD 优化。他还提到 2020 年疫情迫使数据库课程转为线上时,自己在第一批远程讲座里穿的就是那件最早的 ClickHouse T 恤。
关于 ClickHouse Labs 的定位,Pavlo 说目标是建立一个业界一流的数据库研究组织,但明确不会成为一个”把想法扔过墙给工程团队”的孤立研究部门,而是与 ClickHouse 工程师、客户、合作者和行业伙伴紧密协作。他们还会与 ClickHouse 的 PostgreSQL 团队合作,帮助其新兴的托管服务在性能与可靠性上成为市场领导者——PostgreSQL 与 ClickHouse 服务不同的负载需求,两者结合为同时研究事务型和分析型数据库问题提供了广阔基础。他明确把 IBM Research(Almaden)和 Microsoft Research 列为效仿对象,认为这些机构证明了工业实验室可以同时推动基础计算机科学、影响商业产品、并培养一代代数据库研究者。
至于下一步,Pavlo 指出 ClickHouse 团队已有发表深度技术材料的优良传统,包括 2024 年那篇描述其核心架构的 VLDB 论文——这些材料详尽到他直接布置给 CMU 学生当阅读作业。同时,ClickHouse 工程团队积压了一批已经探索过但尚未完成验证和产品化的有趣想法与优化,加速这一过程是他的当务之急,并以此为跳板探索更前沿的方向。他还提出一个更宏大的研究问题:像 ClickHouse 和 PostgreSQL 这样的数据库如何融入新兴的 AI 与智能体技术。这个问题有两面:一是数据库应该长成什么样才能更好地支持智能体;二是智能体如何改进和自动化数据库软件自身的开发。他表示一切都在考虑范围内——新硬件、新算法、新数据结构、新执行策略、以及构建和运维数据库软件的新方式——虽然目前还没有答案(”这正是它叫研究的原因”),但他确信 ClickHouse 扎实的关系模型基础使其能够与这些数据密集型负载共同演进。
HN 评论精华
Pavlo 本人(用户名 apavlo)在帖子里全程回复,这是本次讨论最有价值的部分之一。 当 tomsanbear 表示希望他的 CMU 课程系列能以 ClickHouse 赞助的形式继续时,Pavlo 回复”会继续,新的研讨会系列下个月开始(本周就会发公告)”。用户 AbbeFaria 讲了一个动人的故事:他在 2026 年 4 月旁听了 15-445 课程,完成了缓冲池管理器、并发 B 树、事务支持等作业,然后冷启动私信微软 Azure Hyperscale 数据库团队的招聘经理推销自己,虽然最终因为 C++ 经验不足而面试失败,但他说这门课让他在完全没有数据库工作经验的情况下也能在面试中站住脚,感谢 Pavlo 把课程开源。remywang 则借机呼吁:”既然 Andy 在这里——也请你去说服 ClickHouse 考虑资助学术界的数据库研究。所有的钱都涌向了 AI,政府经费又一片混乱,数据库研究现在几乎什么都拿不到。” Pavlo 回复:”Remy,很高兴听到你的消息。是的,现在情况一团糟。等我先把实验室建起来,我们再想想怎么和学术界互动。” HackerThemAll 挑刺说 dbdb.io 上 BigQuery 的条目把数据模型写成了”文档/XML”,Pavlo 坦承站里有好几条过时条目——过去是让学生帮忙写的,今年夏天做了一次大改版,还需要逐条梳理更新。
帖子里最长、最激烈的一条支线,是关于”数据库算不算 deep tech(硬科技)”的语义论战。 起因是 sghiassy 的调侃:”ClickHouse Labs 就是给 ClickHouse 自己工程师和自己数据库产品做的研究实验室?随你怎么高兴吧。听起来你只是在一家数据库公司当工程师。” Pavlo 直接回复:”我不太确定你以为’研究实验室’是什么意思?就像我在文章里说的,我们看的是 IBM Research(Almaden)和 Microsoft Research。”
lumost 解释说,深科技领域与学术界的关系比其他行业更复杂——工程师常常需要一张”许可证”去验证那些可能多年后才被采用、或者需要几千万美元投入才能落地的想法,研究部门正是这张许可证,代价则是可能扼杀公司其余部分的创新。ForHackernews 强烈反对:”数据库很棒,但它绝不是’硬科技’领域。硬科技指的是核聚变、固态电池、量子计算机这类东西。我知道大家都想让自己显得酷,但你那个还要 beta 十年的 JavaScript 框架并不会因此成为硬科技。”两人为此拉锯了十几层,ForHackernews 的核心论点是:硬科技的定义是”创造前所未有的东西”,做出第一块集成电路是硬科技,做出更好的集成电路不是。
jandrewrogers 给出了本帖技术含量最高的反驳,值得完整转述。他认为今天生产环境里用的数据库有严重局限,远未触及理论上的可能性;数据库的许多传统组成部分(索引、缓存、调度等)本质上都是 AI-complete 的算法问题;整类数据库(如图数据库、空间数据库)之所以长期存在可扩展性和性能低下的问题,正是因为基础计算机科学中的开放问题。他说,仅”提升数据库的通用性、可扩展性与性能,其渐进终点收敛于设计 AGI”这一事实,就说明它确实算硬科技。在被 bedman12345 追问”到底还有什么实用的研究可做”时,他列出了几个他认为重要的开放问题:理想情况下一张表应该在所有相关列上都是索引组织的,但没有任何公开系统能做到这一点——我们没有一种索引结构能同时应付一组任意类型、分布不可预测、还混杂时间型和几何型等困难类型的列,深入下去就能看出索引的 AI-complete 本质;可计算的缓存替换算法对许多负载和数据模型已经失效,而且随着存储与内存的解耦,存储增长与 RAM 容量脱钩,问题进一步恶化;在 EB(艾字节)量级下,传统数据库内核里那些”连很小的内部控制结构都常驻内存”之类的隐含假设不再成立,原本无聊的内核细节必须从第一性原理重新设计;此外,空间局部性与时间局部性传统上被当作两个独立的架构关切,单独优化任何一个都对另一个不利,规模一大就会显现——把这两者收敛成一个”东西”,几乎必然以解决上述所有问题为前提,眯着眼看,这大概是数据库变成真正 AI 之前的最后一步。
dgacmu(他透露论文作者的导师是他和 Andy 从前的学生)补充说,最优连接算法(optimal join algorithms)方面近期有很多有趣的实用工作,并贴出了一篇让 Yannakakis 算法真正变得实用的清华论文。andriy_koval 则持相反意见,认为大部分数据库问题十年前理论上就已解决,难点在于把碎片组装成符合特定性能/简洁性/功能权衡的系统而不过度设计;在被问及”哪里能找到真正可实现的学术论文”时,他回答自己更倾向于不通过论文学数据库——PG、Cassandra、RocksDB、DuckDB、ClickHouse 这些主流开源项目里,所有重要的数据结构和算法都已实现且描述得更好。
bedman12345 提出一个现实质疑:到底哪些数据库公司真有研究实验室?据他所知亚马逊、Snowflake、Databricks、谷歌和 SAP 都没有专门的数据库研究实验室,只有一些被雇来做研究的人,世界上并不存在第二个 IBM Almaden。senderista 补充说 MongoDB Labs 算一个,Oracle Labs 也在(但那基本是 Sun Labs 换了个招牌),而且他看到 Oracle Labs 出的多是并发方面的论文而非数据库论文。pjmlp 半开玩笑地说这就是”秘方”——与普遍认知相反,Oracle、SQL Server、DB2 上至今仍有 Postgres 没有的特性,不发数据库论文正是 Oracle 保持这种状态的一种方式。
pphysch 的感慨引出了另一条支线:”这很酷,但也有点苦涩——公共研究基础设施(大学)已经不再适合支撑这类高影响力研究了。” Ar-Curunir 反驳说学术界的数据库研究依然活跃(包括 Andy 自己在 CMU 的组),并提醒那段引文里有一部分是营销文案;bootwoot 冷冷地补了一句:”我理解这条公告的意思是他要走了。所以他就是个完美例证。” adi2907 则表示:”看到 AI 之外的领域还有企业研究实验室,挺让人耳目一新。ClickHouse 从 AI 浪潮里获益巨大,看到其中一部分价值回流到基础设施基础研究上是好事。”
关于”用 C++ 编写”算不算特性,也起了小小的争执。 astrange 说:”性能是特性,’用 C++ 写的’是个奇怪的特性定义。” bijowo1676 回怼说零成本抽象是 C++ 的众多特性之一,只是你不熟悉这门语言;astrange 只回了一句”我熟悉 C++”。
关于 ClickHouse 技术走向,a34729t 提了个有见地的问题:最好的快速 OLAP 产品(StarRocks、ClickHouse)与 Trino 的融合走向如何?大家似乎都在走存算分离、拿 S3 当存储层的路子,也因此放弃了同位连接(colocated joins)——那这对数据摄入和索引意味着什么?Iceberg V3?Paimon?还是通过数据库引擎做定制摄入来完成索引?mrits 回应说 ClickHouse 的 join 这两年几乎每个月都在改进,”也许还是不行,但差得少多了”。hodgesrm 给出了一个反直觉的数据点:在 ClickHouse 上,端到端查询 Iceberg 实际上比查磁盘上的原生 MergeTree 格式更快,主要看你投多少算力;原生 MergeTree 仍在那些依赖索引来减少 I/O 的场景中胜出,但扫描速度已不再是问题。mrlongroots 提出了一个”有偏见的看法”:数据摄入应当被当作流式重组织(streaming reorganization)负载来处理,与”数据库”本身分离;甚至不需要改 Iceberg 规范,只要调整一下以产生更好的统计信息(类似 liquid clustering,但在写入路径上做),就能在写入同样数据集、同样查询方式的前提下自动获得更好的查询性能。
最后是几条花絮:bhickey 说”Andy 教会了我很多关于钓鱼(trolling)的知识,我还听说他被巴尔的摩方圆 50 英里内的每一家邮局列入了黑名单”,被追问后他讲了 Andy 在布朗大学读博期间的往事——曾经从 Craigslist 上雇了个魔术师来系里活动,结果那人喝醉着来了,还把自己的鸟弄丢在了楼里;此外还有他跑 BitTorrent-over-MediaWiki 惹恼了一群人的事迹。gavinray 评论说”ClickHouse 刚刚成了市场上最热的人才吸铁石”。而 jefecoon 抓住了原文里那个最妙的比喻——Pavlo 把这次合作比作 Killer Mike 与 El-P 组成嘻哈超级组合 Run the Jewels——回了一句”Andy,你说到 Killer Mike + El-P 我就已经心动了。祝你和 CH 在数据库世界里 running the jewels”。