> **来源:[研报客](https://pc.yanbaoke.cn)** # Kimi K3: Open Frontier in Intelligence ## 核心内容 Kimi K3 是一个先进的 Mixture-of-Experts (MoE) 模型,具有 2.8 万亿参数,1040 亿激活参数,以及最多 100 万 token 的上下文窗口。它结合了多种创新技术,包括 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 和 Stable LatentMoE,显著提升了模型的扩展效率和性能。Kimi K3 在多个领域(包括编码、代理、知识、推理和视觉任务)表现出前沿级别的能力,并且通过基础设施优化支持大规模训练和推理。 ## 主要观点 - **模型规模**:Kimi K3 是一个 2.8T 参数的多模态 MoE 模型,是目前开放模型中参数量最大的之一。 - **架构创新**:KDA 和 AttnRes 改进了信息流动,而 Stable LatentMoE 提供了高效的稀疏通道混合。 - **扩展效率**:与 Kimi K2 相比,Kimi K3 的整体扩展效率提高了约 2.5 倍。 - **推理能力**:Kimi K3 支持 100 万 token 上下文长度的推理,能够处理长序列和复杂任务。 - **训练与优化**:模型经过多任务和多领域强化学习训练,涵盖编码、代理、知识、推理和视觉任务。 - **开放性**:Kimi K3 的完整模型权重已发布,促进未来研究和广泛应用。 ## 关键信息 ### 模型参数与上下文窗口 - 总参数量:2.8 万亿 - 激活参数量:1040 亿 - 上下文窗口:100 万 token ### 架构设计 - **Hybrid Attention**:每个块包含 3 个 KDA 层和 1 个 Gated MLA 层,比例为 3:1。 - **KDA**:结合了通道遗忘门和递归机制,用于高效处理长序列。 - **AttnRes**:允许每个层选择性地访问所有前层的表示,而非统一累积。 - **Stable LatentMoE**:通过分离全宽和路由专家的宽度,支持 896 个专家,每个 token 激活 16 个专家,实现 56% 的稀疏性。 ### 训练与推理 - **强化学习**:覆盖通用、代理和编码领域,支持多推理努力层级。 - **训练环境**:包括可验证搜索、专业知识工作、软件工程、视频编码、持久化代理工作流等。 - **推理支持**:支持百万 token 上下文长度,通过持久化沙箱和高效内存管理实现长交互。 ### 基础设施创新 - **KDA 系统设计**:包括融合内核、KDA 上下文并行和状态感知前缀缓存。 - **MoonEP**:为 2.8T 参数 MoE 预训练提供平衡的专家执行和高效的内存管理。 - **百万 token 代理 RL**:使用部分 rollout、外部 KV 缓存保留、自适应节流和可恢复微虚拟机沙箱。 - **生产部署**:通过专用内核和缓存/预算感知的舰队调度实现可预测的生产服务。 ### 性能与比较 - **性能表现**:在长序列编码、代理、知识、推理和视觉任务上达到前沿水平。 - **与私有模型对比**:虽然整体性能仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在开放模型中表现最佳。 ## 技术细节 ### Kimi Delta Attention (KDA) - 使用通道遗忘门和递归机制。 - 每个 token 的衰减因子 $\alpha_{t}^{h}$ 通过 sigmoid 函数限制,避免数值溢出。 - 采用低秩门控和全秩输出门,提升计算效率。 ### Gated MLA - 将每个 token 的键值表示压缩为低维向量 $c_t$。 - 使用 NoPE,避免对位置编码的修改。 - 引入输入依赖的全秩输出门,提升全局内容交互的灵活性。 ### Stable LatentMoE - 分离全宽和路由专家宽度,减少通信和计算开销。 - 使用 RMSNorm 和 SiTU-GLU 以控制激活爆炸和保持数值稳定性。 - 采用 Quantile Balancing 实现负载均衡,避免专家过热或死亡。 ### Quantile Balancing - 通过调整路由权重和偏置,实现负载均衡。 - 在每个 token 上选择 Top-k 专家,确保计算资源合理分配。 ## 总结 Kimi K3 是一个在参数规模、推理能力和扩展效率方面都达到前沿的开放模型。它通过创新的架构设计和训练方法,实现了对复杂任务的高效处理,并在多个任务上表现出色。模型的开放性为研究和应用提供了新的可能性,推动了开放源码智能的发展。