作者:互联网 时间: 2026-07-29 07:47:56
智东西7月28日报道,刚刚,月之暗面发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术:MoonEP、FlashKDA和AgentEnv。
Hugging Face CEO Clem Delangue发文后,Kimi 趋势榜首被K3拿下时,距离上线仅30分钟,点赞数已超过4000个。创下迄今最快的发布增长速度!
拥有2.8万亿参数的Kimi由月之暗面在此前7月17日发布 K3,很快赢得不少网友的“中国的Fable 5时刻”评价,依据是它在基准测试与实际体验中的出色表现。
Kimi K3开源后,北美AI基础设施创企OsmanticAI的创始人兼CEO Ahmad发文,将Kimi K3称为“本地版Fable 5”,并“强烈建议大家下载体验”,这样“他们永远也夺不走我的Fable 5”了。
数字员工Devin开发主体、美国知名AI创企Cognition宣布,Kimi K3现已接入Devin桌面客户端与命令行工具(CLI),并称:“在FrontierCode 1.1评测基准上,Kimi K3是我们测试过首款性能逼近前沿水准的开源模型。”
Nebius、Baseten、Fireworks等海外AI基础设施厂商随即宣布Day 0适配Kimi K3。Nebius称:“Kimi K3是首个达到前沿性能水平的开放权重模型,是开放模型发展历程中的一大进步。”
华 为昇腾CANN宣布对模型MXFP4量化实现Day0原生支持,并提供在昇腾950PR/DT系列和Atlas A3系列集群部署实践。同时,趋境科技宣布,基于开源大模型推理引擎SGLang,完成了Kimi K3在华 为昇腾910C超节点上的Day0适配,并同步开源相关适配成果。
网友围绕Kimi K3上线展开的讨论同样十分热烈。还有网友发帖调侃,Hugging Face甚至专门为Kimi K3制作了一个预热网页。
截至Kimi 近3700名开发者在K3上线前半小时便已等待;等到上线仅剩10分钟时,Kimi K3的发布页面还曾短暂出现404。
模型权重地址: https://huggingface.co/moonshotai/Kimi-K3
Kimi K3采用混合专家(MoE)架构,拥有2.8万亿参数,不仅具备原生视觉理解能力,还支持100万token上下文窗口。
如今,任何人都能够下载和部署Kimi K3模型可被自由使用,既适用于内部研发,也能嵌入面向终端用户的产品。
Kimi 训练系统也随K3此次发布一同开源,开放内容包括Infra基础设施层的三项Infra技术:AgentEnv、MoonEP以及FlashKDA。
面向超大细粒度MoE,MoonEP被设计为高性能通信库,是三项开源Infra技术之一;即便专家并行通信并不均衡,它仍能让通信维持极致效率。
FlashKDA是Kimi 在英伟达H20上,相比flash-linear-attention基线,prefill速度获得提升的是Delta Attention的高性能算子1.72-2.22倍,并且可以直接替换后端使用。
为支撑大规模并行的Agent工作流,AgentEnv提供快速快照、恢复和分叉能力,并以高保真、强隔离的运行环境服务大规模Agent训练。这个沙箱系统由其与KVCache.ai合作开发。三项技术中,FlashKDA此前已完成开源,随本次发布正式开源的则是AgentEnv和MoonEP。
块级注意力残差被KDA+AttnRes用于加强跨层信息流动,而KDA与Gated MLA在模型架构中按3:1比例混合,实现高效长上下文建模。
面对极高稀疏度,Stable LatentMoE依靠SiTU-GLU与Quantile Balancing维持训练稳定;其机制是让每个token在896个路由专家里激活16个。
无需对比预训练,MoonViT-V2视觉编码器以next-token prediction从零启动训练;在取得基线效果的同时,优化过程也更稳定。
近20个内部评测集均已完成完整评估。后训练期间,模型还在通用推理、通用Agent和编程Agent三大领域合成大规模任务,并采用百万token上下文的强化学习基建。
根据官方发布的评测结果,Kimi 编程、Agent任务与视觉理解等方向,都体现了K3的较强能力。
编程能力方面,Kimi 超长时序持续开发、软件逆向和终端运维等能力,在SWE Marathon、Program Bench、Terminal Bench 2.1测试中均被K3突出展现。
其中,SWE Marathon、Program Bench均取得第一,Terminal Bench 2.1达到88.3分,与GPT-5.6 Sol接近;在高难度软件工程任务FrontierSWE中,Kimi K3以81.2分位列第二,仅次于Claude Fable 5。
在Agent和知识工作场景中,Kimi K3同样展现出较强的任务执行能力。在网页深度调研BrowseComp、办公自动化Automation Bench、Excel财务建模SpreadsheetBench 2等测试中取得领先,其中BrowseComp达到91.2分,Automation Bench和SpreadsheetBench 2均排名第一。
更贴近真实办公流程的综合白领任务评测,则呈现不同结果,例如GDPval-AA v2、APEX-Agents等项目中,Kimi 与Claude Fable 5等顶级闭源模型相比,K3仍处于弱势。
在视觉能力方面,Kimi K3在图表理解CharXiv、文档分析OmniDocBench等任务中表现较强,其中OmniDocBench达到91.1分,超过参与对比的多款模型;但在部分视觉推理任务中,Kimi K3仍存在差距,例如零样本视觉工具任务Zerobench低于Claude Fable 5。
Kimi内部也测试了Kimi K3的工程能力。在GPU内核优化测试中,Kimi K3需自主完成代码分析、内核重写和性能验证,覆盖AttnRes、KDA、MLA等GPU计算任务。结果显示,在最高推理强度下,Kimi K3表现接近Claude Fable 5(含回退机制),并超过Claude Opus 4.8、GPT-5.6 Sol和GPT-5.5。
在知识工作方面,Kimi内部Internal Knowledge Work Bench测试显示,在统一开启最高深度思考模式后,Kimi K3在通用推理、深度文档分析和金融专项三类任务中的表现均超过GPT-5.5和Claude Opus 4.8。
Kimi K3发布后,智东西在Kimi K3 Max模式下实测了该模型的多模态与代码生成能力。在要求生成3D横版格斗游戏的测试中,提示词涉及“被霸天虎入侵的破败城市地图”、“低多边形风格”、“5种擎天柱阵营角色”、“5种霸天虎变种敌人”等复杂设定。Kimi K3仅用一次就完成了游戏创建,没有出现错误。
海外开发者@He1s_Sammy在游戏设计场景下对比测试Kimi K3、GPT-5.6 Sol、Fable 5三款模型,向三者输入完全相同的提示词,围绕方案质量、游玩体验、调用成本综合评估。
测试结果表明,Kimi K3在游戏设计上的表现最佳,既能把握核心玩法,又能让产出内容保持自然节奏;Fable 5和GPT-5.6 Sol生成的游戏则普遍节奏过快。
在价格方面Kimi K3:9.5/10,调用成本0.030美元(约合rmb0.2元)、Fable 5:7.5/10,调用成本0.38美元(约合rmb2.57元)、GPT-5.6 Sol:7/10,调用成本0.11美元(约合rmb0.74元)。
在官方公布的案例里,Kimi K3表现出了更强的长程任务执行能力。在芯片设计任务中,K3使用开源EDA工具与Nangate 45nm工艺库,连续自主运行48小时,独立完成芯片构建、优化和验证。
科研领域的一次任务中,K3调动20多个并发子智能体分析391个GWTC-5引力波事件,最终形成7张科学可视化图和2张表格,同时汇总了10多篇论文的文献内容。
从开发者编写的程序到GPU可执行代码,可由它从零打造的MiniTriton完成转换。这款类似Triton的编译器用于GPU编程,部分场景下的性能甚至优于现有工具。
对于Kimi K3,海外开发者的反应和半年前已经不太一样了。半年前,DeepSeek-V3开源时,海外社区的讨论更多是“又一个中国模型”。而到了Kimi K3,话题变成了“它比Claude Opus强”、“开发者正在把Fable换成K3”。
影响力不断扩大,也会带来更高的受关注风险。就在Kimi 美国参议员蒂姆·斯科特和比尔·哈格蒂在K3开源引发热议之际提出议案,希望扩大商务部权限,从而限制外国对手接触AI技术。月之暗面、DeepSeek、阿里Qwen团队等中国AI实验室,去年曾被美国商务部考虑列入实体清单。白宫也曾酝酿行政令,让使用中国模型的美国企业承担安全事件责任;禁用中国开源模型的提案,则曾由OpenAI、Anthropic等美国闭源AI企业提出。
对此,商务部将其定性为“典型的人工智能霸权主义行径”。近200家美国初创企业也曾向政府发出呼吁,要求不要切断中国开源模型的访问;这些企业认为,美国企业的竞争力会因此被削弱。
美国企业自身也在使用中国开源模型,制裁因此难具合理性。AI能力正从少数企业掌握的技术优势,转变为全球开发者都能调用的基础工具,而这一趋势不会被一纸制裁令扭转。