Kimi K3: Open Frontier Intelligence
Kimi K3 是一个拥有 2.8 万亿参数(激活 1040 亿)的混合专家(MoE)模型,通过创新的注意力机制、专家路由算法和全流程强化学习训练,在编程、智能体、推理和视觉等任务上达到前沿水平,并开源全部权重。
阅读精读 →MODULE // PAPERS
按发布月份归档 · 高影响力精选 · 左下角可就本篇提问
6 篇 · 2 个月份
Kimi K3 是一个拥有 2.8 万亿参数(激活 1040 亿)的混合专家(MoE)模型,通过创新的注意力机制、专家路由算法和全流程强化学习训练,在编程、智能体、推理和视觉等任务上达到前沿水平,并开源全部权重。
阅读精读 →该论文通过多模型实验证明,在医疗互操作性场景中,大型语言模型(LLMs)输出的模式合规率基线仅为 85.9%–91.6%,而引入闭环验证-修复框架后,合规率可提升至 99.0%,且绝大多数错误在 1–2 次迭代内解决。
阅读精读 →本文报告了在昇腾 NPU 超大规模集群上对万亿参数级 MoE 模型 DeepSeek-V4 家族进行全参数后训练的系统优化实践,实现了 34.22% 的模型算力利用率(MFU)和 2.93 倍的性能提升,并基于此构建了面向运筹优化(OR)任务的持续预训练与微调流程,最终在零样本推理任务上达到 71.81% 的 Pass
阅读精读 →Athena-Brain-8B 是一个 8B 参数的大语言模型,通过多阶段后训练流水线(通用监督微调、通用强化学习、具身专家训练、模型合并),在保持通用智能的同时获得高效的高层具身交互能力,并在具身基准测试中超越多个更大规模的模型。
阅读精读 →这篇论文发现,前沿大语言模型在输出无意义的填充词(如点号“......”或数字序列“1,2,3,4”)时,内部其实在进行结构化的多步推理,并且这种“隐藏计算”可以通过分析残差流中的隐藏状态被直接解码出来,准确率高达80-95%。
阅读精读 →这篇论文通过一个巧妙的图像替换实验(VisualSwap),揭示了当前主流视觉语言模型(VLM)在推理过程中声称“再看一眼图片”时,实际上并没有真正重新关注视觉信息,而是仅仅在生成文本模式——模型“说”自己会看,但并没有真正“看”。
阅读精读 →