7月27日晚,月之暗面举办Kimi K3开放日活动,正式发布K3模型权重及技术报告,同时开源三项关键基础设施:面向超大规模混合专家模型(MoE)通信的MoonEP、针对线性注意力优化的FlashKDA,以及支持长周期智能体强化学习的AgentEnv。此次开放引发行业对K3技术突破路径的广泛讨论,尤其是其能力提升是否源于对竞品模型的“工业级蒸馏”。
K3采用混合专家架构,总参数规模达2.8万亿,实际激活参数约1042亿。通过896个路由专家与2个共享专家的组合设计,其单次计算调用的参数量较前代K2增长两倍以上。技术团队通过重构注意力机制,将原生上下文窗口扩展至百万Token级别,同时引入注意力残差结构解决深层模型的信息稀释问题。Stable LatentMoE技术则通过动态专家调度,在保持模型知识容量的同时降低计算开销,整体扩展效率较K2提升约2.5倍。
行业分析指出,K3的技术突破不仅体现在参数规模扩张,更在于底层架构的创新。例如,Kimi Delta Attention与Gated MLA的混合设计平衡了长上下文处理效率与全局信息交互需求;MoonEP通信框架解决了超大规模MoE训练中的专家负载均衡难题;FlashKDA则通过优化GPU内存管理,使线性注意力机制得以高效运行。这些技术共同支撑起K3在编程、智能体等复杂任务上的表现跃升。
针对外界质疑的“蒸馏Claude”问题,技术报告披露了K3的后训练流程:先通过监督微调建立基础模型,再在通用任务、通用智能体、编程智能体三个方向进行强化学习,每个方向设置低、中、高三级推理强度,形成九个专业教师策略。最终通过多教师在线策略蒸馏(MOPD)技术,将九套策略整合为统一模型。报告强调,MOPD阶段的教师模型均基于K3冷启动模型训练,未直接使用外部模型输出。
此前,Anthropic及美国官员曾指控月之暗面通过虚假账户获取Claude输出数据,涉及超340万次交互。中国商务部回应称,美方指控缺乏证据支撑,且模型蒸馏为行业通用技术。有行业人士指出,Fable 5公开发布与K3上线时间间隔较短,若完全依赖外部模型输出完成训练,不符合超大模型研发周期规律。目前,昇腾等硬件厂商已宣布完成对K3的适配优化,但社区尚未独立复现其宣称的扩展效率与任务吞吐能力。



