2026KimiK3技术报告_47页_2mb
报告摘要
Kimi K3: Open Frontier in Intelligence
核心内容
Kimi K3 是一个先进的 Mixture-of-Experts (MoE) 模型,具有 2.8 万亿参数,1040 亿激活参数,以及最多 100 万 token 的上下文窗口。它结合了多种创新技术,包括 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 和 Stable LatentMoE,显著提升了模型的扩展效率和性能。Kimi K3 在多个领域(包括编码、代理、知识、推理和视觉任务)表现出前沿级别的能力,并且通过基础设施优化支持大规模训练和推理。
主要观点
- 模型规模:Kimi K3 是一个 2.8T 参数的多模态 MoE 模型,是目前开放模型中参数量最大的之一。
- 架构创新:KDA 和 AttnRes 改进了信息流动,而 Stable LatentMoE 提供了高效的稀疏通道混合。
- 扩展效率:与 Kimi K2 相比,Kimi K3 的整体扩展效率提高了约 2.5 倍。
- 推理能力:Kimi K3 支持 100 万 token 上下文长度的推理,能够处理长序列和复杂任务。
- 训练与优化:模型经过多任务和多领域强化学习训练,涵盖编码、代理、知识、推理和视觉任务。
- 开放性:Kimi K3 的完整模型权重已发布,促进未来研究和广泛应用。
关键信息
模型参数与上下文窗口
- 总参数量:2.8 万亿
- 激活参数量:1040 亿
- 上下文窗口:100 万 token
架构设计
- Hybrid Attention:每个块包含 3 个 KDA 层和 1 个 Gated MLA 层,比例为 3:1。
- KDA:结合了通道遗忘门和递归机制,用于高效处理长序列。
- AttnRes:允许每个层选择性地访问所有前层的表示,而非统一累积。
- Stable LatentMoE:通过分离全宽和路由专家的宽度,支持 896 个专家,每个 token 激活 16 个专家,实现 56% 的稀疏性。
训练与推理
- 强化学习:覆盖通用、代理和编码领域,支持多推理努力层级。
- 训练环境:包括可验证搜索、专业知识工作、软件工程、视频编码、持久化代理工作流等。
- 推理支持:支持百万 token 上下文长度,通过持久化沙箱和高效内存管理实现长交互。
基础设施创新
- KDA 系统设计:包括融合内核、KDA 上下文并行和状态感知前缀缓存。
- MoonEP:为 2.8T 参数 MoE 预训练提供平衡的专家执行和高效的内存管理。
- 百万 token 代理 RL:使用部分 rollout、外部 KV 缓存保留、自适应节流和可恢复微虚拟机沙箱。
- 生产部署:通过专用内核和缓存/预算感知的舰队调度实现可预测的生产服务。
性能与比较
- 性能表现:在长序列编码、代理、知识、推理和视觉任务上达到前沿水平。
- 与私有模型对比:虽然整体性能仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在开放模型中表现最佳。
技术细节
Kimi Delta Attention (KDA)
- 使用通道遗忘门和递归机制。
- 每个 token 的衰减因子 $\alpha_{t}^{h}$ 通过 sigmoid 函数限制,避免数值溢出。
- 采用低秩门控和全秩输出门,提升计算效率。
Gated MLA
- 将每个 token 的键值表示压缩为低维向量 $c_t$。
- 使用 NoPE,避免对位置编码的修改。
- 引入输入依赖的全秩输出门,提升全局内容交互的灵活性。
Stable LatentMoE
- 分离全宽和路由专家宽度,减少通信和计算开销。
- 使用 RMSNorm 和 SiTU-GLU 以控制激活爆炸和保持数值稳定性。
- 采用 Quantile Balancing 实现负载均衡,避免专家过热或死亡。
Quantile Balancing
- 通过调整路由权重和偏置,实现负载均衡。
- 在每个 token 上选择 Top-k 专家,确保计算资源合理分配。
总结
Kimi K3 是一个在参数规模、推理能力和扩展效率方面都达到前沿的开放模型。它通过创新的架构设计和训练方法,实现了对复杂任务的高效处理,并在多个任务上表现出色。模型的开放性为研究和应用提供了新的可能性,推动了开放源码智能的发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载