数据系统的未来——Flink、Snowflake 与 AI 时代的挑战
从 Flink 3.0 到 Snowflake AI 数据云,从 Agentic Streaming 到统一智能底座——数据系统正在被 AI 彻底重塑,我们正站在一个范式跃迁的临界点上。
这是 DDIA 精读系列的最后一篇。
前十三篇文章,我们走完了 DDIA 的完整知识体系——从三大目标到数据模型,从存储引擎到数据编码,从复制分区到事务一致性,从共识算法到批处理流处理。
但这本书不是终点。DDIA 的最后一章,标题就叫 “数据系统的未来” 。它告诉我们:技术会过时,但理解技术演进底层逻辑的能力永远不会过时。
今天,我们就站在 2026 年的时间点上,看看数据系统正在发生怎样的范式跃迁——以及 DDIA 的思维框架,如何帮我们理解这一切。
一、范式跃迁:从“数据驱动”到“AI原生”
一个根本性的转变
过去十年,数据系统的演进主线是:如何更高效地存储、处理、分析数据。数据是“原料”,系统是“工厂”,人是“决策者”。
但 AI 大模型的出现,改变了这个关系。
Snowflake CEO Ramaswamy 在 Snowflake Summit 2026 上指出:即便 AI 将软件开发成本压至趋近于零,大规模数据集的管理需求仍将持续存在,数据平台的核心价值不会消失。但数据平台的形态,正在被 AI 彻底重塑。
信息系统的核心逻辑正在从 “面向数据的计算” 转向 “面向计算的数据” 。换句话说:过去是“把数据喂给计算”,现在是“把计算搬到数据旁边” 。
数据底座的三重压力
AI 时代的数据系统,面临三重前所未有的压力:
- 数据规模:AI 训练和推理需要的数据量,远超传统 BI 分析。数百块 GPU 同时等待数据输入,存储端的任何延迟都会被持续放大——问题不在于存储容量,而是架构不对。
- 数据模态:从结构化文本扩展到视频、音频、图像等多模态数据。
- 数据时效:AI Agent 需要实时感知、实时理解、实时回应,批处理的天级延迟已经不够用了。
这三重压力叠加在一起,倒逼数据基础设施完成一次 范式跃迁。
二、Flink 的“AI Native”进化
从 Cloud Native 到 AI Native
Apache Flink 从一款专注于流式处理的分布式计算引擎,已逐步成长为实时计算领域的事实标准。而 2026 年,Flink 正站在一个历史性的技术拐点上——从 Cloud Native 迈向 AI Native。
2026 年 6 月,在 Flink Forward Asia 上,阿里云公布了 Flink 3.0 的规划。Flink 3.0 的核心理念是:为 Agent 全面升级,进入 Agentic Streaming For AI 时代。
这意味着什么?Flink 不再只是一个“流式计算引擎”,而是 AI Agent 的实时数据供给系统。
全模态数据流处理
Flink 3.0 最引人注目的新能力是:全模态数据流处理。
这是业界首个把视频、音频、图像、文本全模态数据统一在同一条 GPU+CPU 流式流水线调度的实时计算框架。在数据模型层面,Flink 将引入 Tensor 等原生类型,直接支持 AI 工作负载。
一个具体的例子:在足球赛事直播中,Flink 可以实时抓取直播画面,进行多模态数据处理,实时理解球员状态及传球、接球等信息,交给大模型实时推理,最终生成解说词进行实时讲解。
真实场景测试显示,全新的 Flink 在处理性能、结构化算子、实时增量处理等维度的表现,均显著优于 Ray、Daft 等开源技术栈。
Agentic Lake:为 AI Agent 而生的数据湖
Flink 生态还在构建一个更宏大的图景:Agentic Lake——为 AI Agent 设计的统一数据存储系统。
Agentic Lake 建立在 Apache Paimon 2.0 和 Apache Fluss(孵化中)1.0 两个开源项目之上。它的目标是:用同一份数据,同时支撑分析、AI 训练和实时 Agent 记忆。
这回应了当前 AI 数据架构的一个核心痛点:数据湖与向量数据库的“双系统”架构——一边是数据湖保存原始数据,另一边是向量数据库承担在线检索,两者之间是一组不断变长的 ETL 管线。这种“两份真相”的架构,在规模扩大后变得难以维护。Agentic Lake 的目标正是把存储、治理、发现与服务整合为一体。
三、Snowflake 的“AI 数据云”战略
Snowflake 正在经历的转型,是另一个观察数据系统未来的绝佳窗口。
从数据仓库到 AI 数据云
Snowflake 已不再将自己定义为“云数据仓库”,而是 “AI 数据云公司” (AI Data Cloud company)。
在 Snowflake Summit 2026 上,Snowflake 展示了其 “智能 AI”战略,该战略整合了编码、业务和数据治理。Snowflake 的核心战略是:将数据平台定位为“可信信息的流转中枢”,同时叠加智能体 AI 层。
三个关键产品
Snowflake 的 AI 战略围绕三个核心产品展开:
1. Snowflake CoCo:AI 编码代理
CoCo 是一个 AI 编码代理,能够自动执行复杂的数据工作流任务。数据工程师可以用自然语言提示构建数据管道、自动化工作流程、开发应用程序。相比 Claude Code,CoCo 使用 51% 更少的 Token,步骤减少 8% 。
这标志着数据工程正在从“手写代码”走向“声明式 + AI 辅助”。工程师的角色从“写代码的人”变成“定义意图的人”。
2. Snowflake CoWork:个人工作代理
CoWork 是一个面向知识工作者的个人 AI 代理。它能全面分析企业内部的结构化和非结构化数据,解释洞察的“原因”,并通过用户技能和多代理编排支持业务自动化。
3. Horizon Catalog:AI 治理与信任
Horizon Catalog 将数据治理、安全性和业务上下文整合在一起。它的核心功能包括:用统一的语义系统连接整个组织的数据,使 AI 能够根据一致的标准做出决策;通过代理身份、AI 安全态势管理和零信任安全功能,在大规模 AI 环境中实现数据保护。
当 AI Agent 开始“自主行动”,企业 AI 的可信度最终还是要回到数据平台本身。治理不是 AI 的“附加功能”,而是 AI 能够规模化的前提条件。
实时化与互操作性
Snowflake 还在两个方向上发力:
- 实时化:通过 Snowflake Datastream 直接收集和处理基于 Kafka 的数据,无需单独的流式基础设施。这标志着 Snowflake 正在从“批处理哲学”走向“流处理能力”。
- 互操作性:增强基于 Apache Iceberg 的技术,使数据能够在各种平台和系统之间使用,而无需数据移动或复制。2026 年,Snowflake 还发布了 Iceberg v3,支持双向写入。
四、三条核心趋势
综合 Flink、Snowflake 以及更广泛的数据系统演进,我们可以提炼出三条核心趋势。
趋势一:AI Native——数据系统为 AI 而生
这是最根本的趋势。
数据处理的对象正在从结构化数据扩展至文本、图像、音视频、传感器信号等全模态数据。用户的核心工作负载正在从传统的 BI 分析快速演进为以模型推理为中心的全模态数据处理。
数据系统不再只是“存储数据的工具”,而是 AI 的“感知器官” ——让 AI 能实时感知、实时理解、实时回应。
正如 Martin Kleppmann 在 DDIA 第二版访谈中所说:“没人再手写 MapReduce 了。它的继任者——Spark 和 Flink,用更高级的抽象解决了一切。我们不应该再让读者把精力浪费在过时的工具上,而应该去理解流处理与批处理融合后的新世界。”
趋势二:流批一体与实时分析
2026 年,大数据技术领域呈现出两大主线并行演进的特征:
- 从传统数仓向 Lakehouse(湖仓一体)架构的深度迁移
- 从批处理向流批一体实时分析的全面升级
这两大趋势正在重新定义数据工程师的能力模型。DDIA 第二版的核心更新之一,就是将“构建在云服务之上”作为一切讨论的新起点——对象存储(如 S3)正在取代本地磁盘,成为新的架构基础。
2026 年正成为核心系统从 “多库拼凑”向“融合架构”跃迁的关键分水岭。单一关系型数据库已难以满足复杂业务需求,多模融合成为必然。
趋势三:智能数据治理与安全
当 AI Agent 开始自主操作数据,治理和安全变得前所未有的重要。
Snowflake 的 Horizon Catalog、Confluent 的私有链接、以及各种 AI 安全态势管理工具,都在回应同一个问题:当数据的使用者从“人”变成“AI”时,如何确保数据被正确地使用?
Gartner 预测,2026 年超过 60% 的 AI 项目会被企业放弃,问题往往不在模型,而在数据——数据接不进来,处理不充分,语义也无法对齐。数据治理不是锦上添花,而是 AI 项目成败的关键。
五、DDIA 的遗产:不变的分析框架
在所有这些变化中,DDIA 的价值不仅没有减弱,反而更加凸显了。
Martin Kleppmann 在最近的一次访谈中指出:DDIA 第二版之所以需要“重写”,是因为分布式系统的物理基石已经发生了根本性的位移。从本地磁盘到对象存储,从自建复制到云原生服务——“云原语”正在取代物理硬件,成为新的架构单元。
但 DDIA 的核心思维框架没有变:
- 可靠性、可扩展性、可维护性——这三个目标在任何时代都是评价数据系统的元标准
- 权衡(Trade-off) ——没有银弹,只有适合你场景的取舍
- 理解底层原理——无论上层工具如何变化,理解“为什么”的能力永远不会过时
正如一位评论者所说:“DDIA 不是发明了什么新理论,而是为一个快速演进且日益复杂的领域,建立了共同的认知框架和分析语言。”
还有一个有趣的预言:Martin Kleppmann 认为,AI 将让“形式化验证”这门古老的高端技术回归主流。以往,用 TLA+ 进行形式化验证代价极高,只有顶级研究员才玩得转。但现在,LLM 改变了一切。AI 不仅能写代码,还能帮我们验证代码的正确性——这正是分布式系统最需要的能力。
六、写在最后
十四篇文章,从可靠性到共识算法,从 B-Tree 到 Flink,从 ACID 到 AI Agent——我们走完了一段漫长的旅程。
回顾这个系列,有几件事值得记住:
- 数据系统的核心挑战从未改变:如何在不可靠的硬件、网络和人之上,构建可靠、可扩展、可维护的系统
- 解决方案一直在演化:从 B-Tree 到 LSM-Tree,从主从复制到共识算法,从批处理到流处理——每一次演化都在回应新的场景和新的需求
- AI 正在重塑一切:数据系统从“数据驱动”走向“AI 原生”,从“面向数据的计算”走向“面向计算的数据”
- 底层原理永远不会过时:无论上层工具如何变化,理解“为什么”的能力,是工程师最持久的竞争力
“大数据”时代已经结束——即管理数据量。取而代之的是“上下文时代”——即管理意义。我们不再仅仅是数据工程师,我们是认知层的架构师。
DDIA 给了我们一套思考数据系统的语言和框架。这套框架不会因为 Flink 3.0 的出现而失效,也不会因为 AI Agent 的流行而过时。
相反,理解这套框架的人,才能在 AI 时代的浪潮中,看清什么是本质,什么是泡沫。
下一篇预告: 系列到这里就结束了。如果你想知道 DDIA 读完后该读什么,可以参考这个系列的第 20 篇(延伸阅读指南)。感谢你一路读到这里!
