> **来源:[研报客](https://pc.yanbaoke.cn)** # Apache Fluss™ (Incubating) 白皮书总结 ## 核心内容 Apache Fluss 是一款**流式优先、湖仓原生**的列式存储引擎,旨在为实时分析、特征工程与 AI 上下文工程提供统一的数据基座。它通过将事件传输、KV 服务、列式分析与 AI 上下文等能力收敛到一个系统,解决了传统架构中因多系统拼接而产生的“多系统税”问题。 Fluss 通过**主键表与日志表的双表模型**、**三级存储架构**、**复合数据裁剪机制**与**状态外置**等技术特性,实现了流批一体、无状态计算、统一数据视图与高效数据处理。 ## 主要观点 - **统一架构**:Fluss 作为统一存储底座,服务流式写入、在线查询、分析与 AI 场景,消除了多系统架构的复杂性与一致性维护成本。 - **湖流一体**:实时与批处理层共享同一份数据,元数据自动同步,避免了数据复制与格式转换。 - **存算分离**:将状态外置至存储层,使计算层无状态、弹性、恢复迅速,显著降低系统复杂度与成本。 - **列式分析优化**:基于 Apache Arrow 的列式存储与裁剪机制,显著减少网络传输与计算开销。 - **状态归属**:状态应归属于存储层,而非流计算引擎,以提升系统稳定性与运维效率。 - **AI 原生支持**:Fluss 支持 LLM、RAG 与 Agent 工作流,为实时上下文工程提供统一存储与访问路径。 ## 关键信息 ### 1. Fluss 的架构设计 - **集群拓扑**:由 CoordinatorServer、TabletServer 与元数据存储组成,对外呈现为一致的逻辑系统。 - **日志与 KV 存储**:日志存储支持两种格式(Arrow 列式、Compacted 行式),KV 存储基于 RocksDB,仅在 Leader 上维护。 - **写入路径**:数据写入经由预写缓冲区、日志追加与 ISR 复制,主键表还需将数据物化至 RocksDB。 - **读取路径**:支持三种模式(KV 点查、流式日志读取、列式批量扫描),并通过 Union Read 跨越冷热边界。 ### 2. 三级存储机制 - **Tier 1(热层)**:本地磁盘存储实时日志与 Leader 的 RocksDB 当前态,服务低延迟查询。 - **Tier 2(远程存储)**:Fluss 原生日志与快照存储于对象存储,用于故障转移与训练读取。 - **Tier 3(开放湖仓)**:支持 Iceberg、Paimon 或 Lance 等开放湖仓格式,供外部计算引擎读取。 ### 3. 数据裁剪机制 - **列裁剪**:仅传输所需列,减少网络传输与反序列化开销。 - **谓词下推**:在存储层完成过滤,避免无效数据进入计算层。 - **分区裁剪**:仅读取所需数据分区,提升查询效率。 - **复合效应**:三种裁剪机制叠加,实现数量级的数据缩减与性能提升。 ### 4. 状态外置与无状态计算 - **状态外置**:状态存储于 Fluss 主键表,Flink 作业无需管理状态。 - **Delta Join**:通过 Fluss 的主键表实现无状态双流 Join,显著降低内存与恢复成本。 - **聚合合并引擎(AME)**:在写入时执行字段级聚合,避免状态驻留与延迟恢复。 - **部分更新(Partial Updates)**:通过列子集更新,实现宽表数据的无 Join 组装。 - **消除训练-服务偏差**:训练与服务从同一存储读取,确保特征一致性。 ### 5. Fluss 在 AI 场景中的价值 - **上下文存储**:支持会话记忆、实体记忆、行为信号与语义记忆,为 LLM 与 Agent 系统提供统一存储底座。 - **虚拟表**:同一物理表可被投影为多个逻辑视图,满足不同读取需求。 - **自增列与 Roaring Bitmap**:支持实体标识符的映射与高效集合操作,用于实时画像与特征聚合。 ## 技术价值 - **降低系统复杂度**:将多个系统整合为一个统一基座,减少运维成本与数据一致性问题。 - **提升性能**:通过列裁剪、谓词下推与分区裁剪,减少网络与计算资源消耗。 - **增强弹性与恢复能力**:状态外置使 Flink 作业无状态,恢复时间从分钟级降至秒级。 - **支持 AI 原生数据流**:为 LLM、RAG 与 Agent 系统提供统一、可追溯、可查询的上下文存储。 ## 附录参考 - **三级存储运维**:了解各层的持久性、新鲜度与受众,有助于运维决策。 - **写入流水线**:包含客户端批处理、预写缓冲区、日志追加、KV 物化与分层传播。 - **配置选项**:包括 ISR 法定数、KV 快照节奏、合并引擎选择、Bucket 大小与分层服务 Checkpoint 节奏。 ## 结语 Apache Fluss 为实时 AI 基础设施提供了一种新的设计思路:通过统一存储底座与无状态计算模型,实现流式数据、分析与 AI 上下文的一体化处理,从而降低系统复杂性、提升性能与运维效率。