Kimi K3 正式发布:2.8 万亿参数全开源,这次真的不一样
月之暗面发布 Kimi K3:2.8 万亿参数、全球首个开源 3T 级模型、100 万 token 上下文、原生多模态。本文深度解读 KDA 与 AttnRes 架构创新、Artificial Analysis 全球第四的评测成绩、对齐 Claude Sonnet 5 的定价信号,以及开源前沿模型对整个行业的四层长远影响。

English Version: Kimi K3 Is Here: 2.8 Trillion Parameters, Fully Open Source — This Time It’s Different
史上最大开源模型 · 前沿智能 · 开源生态的分水岭时刻
7 月 16 日,月之暗面(Moonshot AI)正式发布 Kimi K3——2.8 万亿参数,全球首个开源 3T 级模型,权重将在 7 月 27 日前全部放出。这篇文章不只聊参数和跑分,更想聊聊:把一个前沿级模型的权重直接开放出来,对整个行业意味着什么。
先说发生了什么
7 月 16 日周四,月之暗面上线了 Kimi K3,同步开放了 API 和开发者文档。官方博客的措辞很克制,但几个数字放在一起,分量不轻:
- 2.8 万亿总参数:全球首个开源 3T 级模型,比 DeepSeek V4 Pro(约 1.6T)大 75%
- 100 万 token 上下文:一整个大型代码库塞进去都够
- 原生多模态:文本、图像、视频在同一个模型里处理,不是外挂视觉编码器
- 7 月 27 日前开源全部权重:不是”阉割版”,是完整模型
发布时间点也很微妙——正好卡在 2026 上海世界人工智能大会(WAIC)之前。前一天 DeepSeek V4 刚刷完屏,这边 K3 直接跟上。中国开源模型的”军备竞赛”,已经卷到了以周为单位。
💡 官方博客里有一句挺有意思的话:过去 12 个月里,有 9 个月开源模型的”尺寸上限”是由 Kimi 系列保持的。K3 是这条路线的延续,也是目前的顶点。
技术上到底新在哪
2.8T 参数听起来吓人,但 K3 真正值得聊的不是”大”,而是它怎么把”大”变得可训练、可部署、可负担。
极致稀疏的 MoE:896 选 16
K3 用了 896 个专家的混合专家(MoE)架构,每个 token 只激活其中 16 个。说白了,虽然总参数 2.8T,但每次推理真正”干活”的只是一小部分。这个稀疏度在业界是相当激进的,为此月之暗面配套了 Stable LatentMoE 框架和一套叫 Quantile Balancing 的路由均衡方法,直接从路由分数的分位数推导专家分配,砍掉了一个特别难调的超参数。
两个架构杀手锏:KDA 和 AttnRes
Kimi Delta Attention(KDA) 负责让注意力在超长序列上跑得动——据 The Decoder 报道,KDA 让百万 token 上下文的解码速度最高提升 6.3 倍。Attention Residuals(AttnRes) 则改变了信息在模型深度方向的流动方式:不是逐层均匀累积,而是有选择地跨层检索表征。官方数据是训练效率提升约 25%,额外计算开销不到 2%。
这些加起来的结果:K3 相比 K2 的整体 scaling 效率提升了约 2.5 倍。同样的算力,换来更多的智能。这一点后面聊行业影响时还会再提。
为开源部署提前铺路
还有一个容易被忽略的细节:K3 从 SFT 阶段就开始做量化感知训练(QAT),用 MXFP4 权重加 MXFP8 激活。翻译一下:模型出厂就是为低精度推理设计的,硬件兼容性直接拉满。月之暗面还提前给 vLLM 社区贡献了 KDA 的 prefix cache 实现,会随模型一起发布。
🔍 这个动作值得细品:一般公司是”先发模型,社区自己想办法跑”。月之暗面是”发模型之前先把推理框架的适配代码写好”。开源不只是扔权重,是把整个可用性链路都准备好。当然,官方也说了,推荐用 64 卡以上的超节点部署——这个门槛对个人玩家还是太高了,K3 的开源红利主要属于企业和云厂商。
性能:离最强还差一点,但已经够吓人
先说官方自己的定调,这点我觉得月之暗面挺实诚:K3 整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在其余所有被测模型中稳定领先。
独立评测机构 Artificial Analysis 的结果也印证了这个说法。在它的智能指数上,K3 拿了 57 分,排全球第四:
| 模型 | 智能指数 | 是否开源 |
|---|---|---|
| Claude Fable 5 | 60 | 否 |
| GPT-5.6 Sol | 59 | 否 |
| Kimi K3 | 57 | 是 |
| Claude Opus 4.8 | 56 | 否 |
注意这个排名的含义:一个即将完全开源的模型,超过了 Anthropic 的 Opus 4.8。开源和闭源最前沿之间的差距,从”代差”缩到了”半个身位”。
单项上更有看头。K3 在 Terminal Bench 2.1(88.3)、BrowseComp(91.2)、SWE Marathon(42.0)、OmniDocBench(91.1)等多个基准上直接做到了第一梯队甚至榜首。最出圈的是 Arena.ai 的前端代码竞技场——K3 排名第一,把发布仅六周的 Claude Fable 5 挑落马下。
官方编程基准对比:K3 在 Terminal Bench、Program Bench、SWE Marathon 上领跑 | 图源:月之暗面官方博客
✦ Arena CEO 的原话:Arena 首席执行官 Anastasios Angelopoulos 在 X 上说:“这可能是年度最大的一次发布,标志着中国开源模型超越美国模型的时刻。在 Code Arena 上,Kimi K3 击败了 Fable——距离 Fable 发布仅仅六周。“前白宫 AI 政策顾问 Sriram Krishnan 也评价这是”一个大时刻,对整个行业有多重影响”。
在 agentic(智能体)任务上,进步幅度更夸张。GDPval v2 的 Elo 分从上一代 K2.6 的 1190 直接跳到 1668;长程知识工作评测 AA-Briefcase 上涨了 732 个 Elo 点。这不是”迭代”,这是”换代”。
通用/视觉智能体基准:K3 在 Automation Bench、BrowseComp、SpreadsheetBench 2 上排第一 | 图源:月之暗面官方博客
它想干什么:不是聊天,是”长程干活”
从产品定位看,K3 瞄准的完全不是”聊天机器人”,而是长时间自主工作的智能体:读大型代码库、编排终端工具、在最少人工干预下持续推进任务。几个官方案例挺能说明问题:
- 48 小时自主设计芯片:K3 用开源 EDA 工具在 Nangate 45nm 工艺库上,独立完成了一颗 AI 推理芯片的构建、优化和验证——4 平方毫米、146 万标准单元、仿真解码吞吐超 8700 tokens/s。官方的说法很妙:“一颗由模型设计、为模型服务的芯片。”
- 从零写了个 GPU 编译器:K3 开发的 MiniTriton,带自己的 IR 层、优化 pass 和 PTX 代码生成,在多个基准上追平甚至超过 Triton 和 torch.compile,还能撑住 nanoGPT 端到端训练。
- 2 小时复现天体物理研究:交叉验证 20 多篇论文、评估 300 多个状态方程、写了 3000 多行 Python,复现 I-Love-Q 普适关系——这活儿一个有经验的研究员通常要干一到两周。
另一个关键词是 “vision in the loop”:K3 能看截图、改代码、再看结果,形成闭环。这让它在游戏开发、前端、CAD 这类”眼见为实”的场景里特别能打——前面说的 Code Arena 击败 Fable,靠的就是这个。
官方内部知识工作评测:在线体验、幻灯片制作、金融分析三项 K3 均居首 | 图源:月之暗面官方博客
定价:超便宜中国 AI 的时代,结束了
这可能是这次发布里最值得玩味的信号。K3 的 API 定价:输入 3 美元/百万 token(缓存命中 0.3 美元),输出 15 美元/百万 token。对比一下:
| 模型 | 输入 $/M | 输出 $/M |
|---|---|---|
| Kimi K3 | 3.00 | 15.00 |
| Kimi K2.6(上一代) | 0.95 | 4.00 |
| Claude Sonnet 5 | 3.00 | 15.00 |
| GPT-5.6 Sol | 5.00 | 30.00 |
| Claude Fable 5 | 10.00 | 50.00 |
看出来了吗?K3 的定价和 Claude Sonnet 5 一分不差,比自家上一代贵了三倍多。The Decoder 给这个现象下了个判断:中国厂商也不再用地板价卖前沿模型了,“超便宜中国 AI 的时代”正在结束。
但换个角度看,这个定价其实很聪明。按 Artificial Analysis 的测算,K3 每任务成本约 0.94 美元,和 GPT-5.6 Sol(1.04 美元)基本持平,只有 Opus 4.8(1.80 美元)的一半——用中端的价格,卖准前沿的能力。而且 K3 的 token 效率也提升了:完成同样的评测,输出 token 比 K2.6 少 21%,分数反而高 13 分。
每任务成本对比与”智能 vs 成本”散点图:K3 落在准前沿智能、中端价格的位置 | 图源:Artificial Analysis
⚠️ 提醒一句:K3 定价”不分上下文长度”,一百万 token 的超长上下文也是这个价。再加上官方 API 在编码场景下缓存命中率超过 90%(背后是 Mooncake 分离式推理架构),实际用起来的成本可能比表价低不少。做 agent 应用的同学可以重点算算这笔账。
开源 3T 级模型,长远看意味着什么
好,重头戏来了。参数、跑分、价格都是”当下”,但把 2.8T 权重放出来这件事,影响是”长期”的。我想分四层来说。
第一层:前沿能力不再是少数公司的专属
过去两年,行业里有一条默认的鄙视链:最强的模型永远是闭源的,开源模型能追到”上一代闭源水平”就算胜利。K3 把这条线打破了——它在智能指数上压过了 Opus 4.8,在前端代码上击败了当打之年的 Fable 5,然后说:十天后,权重归大家。
这意味着任何有算力的机构——大学实验室、主权 AI 项目、对数据合规有硬要求的银行和医院——都可以在自己的机房里跑一个准前沿模型,不用把数据交给任何一家 API 厂商。对闭源厂商来说,“能力领先”这个护城河的折旧速度,从按年计变成了按月计。Fable 5 领先了六周,就在一个单项上被追平了。
第二层:研究生态拿到了一份”前沿模型解剖图”
KDA、AttnRes、Stable LatentMoE、Quantile Balancing、Per-Head Muon……这些不只是营销名词,它们随权重和技术报告开放之后,会变成全世界研究者可以复现、魔改、证伪的对象。DeepSeek 当年开源 MLA 和 GRPO 之后,多少论文和后续模型直接站在了它的肩膀上?K3 这套”如何把 MoE 撑到 3T 而不训崩”的完整工程答案,价值可能比模型本身还大。
而且别忘了那个细节:月之暗面提前把 KDA 的 prefix cache 实现贡献给了 vLLM。开源基础设施(vLLM、SGLang 这些)每接住一个新架构,整个社区消化下一个新架构的速度就更快。这是复利。
第三层:又一个”DeepSeek 时刻”?地缘牌桌重新洗牌
很多外媒把 K3 和 2025 年初的 DeepSeek R1 相提并论。当年 R1 发布后美股科技板块一度蒸发约万亿美元市值,白宫因此收紧对华技术出口。这次 K3 发布,SiliconANGLE 的判断是:“美国 AI 公司领先中国同行几个月”这个共识,已经站不住脚了。
更微妙的是背景:几个月前 Anthropic 刚指控过月之暗面、DeepSeek 和 MiniMax 违规”蒸馏”Claude 的能力。K3 发布后,围绕蒸馏、出口管制、开源模型安全审查的争论大概率会再起一轮。但有一个事实很难反驳——在算力受限的条件下,中国团队正在用架构创新和工程效率把差距补回来。K3 相比 K2 那个 2.5 倍的 scaling 效率提升,就是最直接的证据。
第四层:开源的商业模式正在自证
“都开源了还怎么赚钱?“K3 给了一个越来越清晰的答案:权重开放,但官方 API 靠 Mooncake 推理架构做到 90% 以上的缓存命中率,成本和体验别人短期抄不走;上层还有 Kimi Work、Kimi Code、Kimi Enterprise 企业版和托管 Agent 平台。模型开源引流建生态,基础设施和产品收钱——这套打法跟当年的 Linux/Red Hat 越来越像了。
给同行的四点思考
不管你是做模型的、做应用的,还是在大厂里做 AI 战略的,K3 这次发布有几个信号值得认真想想。
✦ 思考一:卷参数的前提是先卷架构。K3 敢上 2.8T,不是因为算力多,而是因为 KDA + AttnRes + 极稀疏 MoE 把单位算力的产出提高了 2.5 倍。反过来说:没有架构和训练方法的突破,堆参数只是烧钱。“Scaling 没死,但裸奔的 Scaling 死了。”
✦ 思考二:模型竞争的主战场已经换到”长程 Agent”。K3 的所有肌肉展示——48 小时设计芯片、从零写编译器、两小时复现科研——全都是”长时间自主干活”。聊天体验的差异化空间越来越小,谁能让模型独立、可靠地跑完一个几天的工程任务,谁才有下一轮的定价权。做应用的同学,护城河也要往这个方向重新想。
✦ 思考三:开源不是慈善,是战略武器。对追赶者来说,开源是最锋利的进攻手段:用免费权重瓦解领先者的 API 溢价,用生态占领换取标准制定权。Meta 当年用 Llama 打过这张牌,现在轮到中国公司把这张牌打到前沿级别。如果你是闭源阵营的,就得回答一个难题:当”够好的开源”只落后你半个身位、价格还打三折时,客户为什么留下?答案只能在模型之外——工具链、可靠性、合规、服务。
✦ 思考四:低价内卷正在退潮,价值定价回归。K3 定价对齐 Claude Sonnet 5、较上一代涨三倍,说明头部中国厂商不打价格战了——能力到了,就按能力收钱。对下游应用公司,这是个提醒:把”模型便宜”当商业模式的窗口正在关闭,真正的成本优化要靠缓存、token 效率、任务编排这些工程能力。
冷静一下:它不是没有短板
吹完了,也得泼点冷水。有几个问题官方和第三方都摆在了台面上:
- 幻觉率不降反升:Artificial Analysis 测出 K3 的幻觉率从上一代的 39% 涨到了 51%——答对的更多了,但瞎编的也更多了。对严肃场景,这是硬伤,必须靠工程手段兜底。
- “过度主动”:官方自己承认,K3 遇到模糊指令时爱替用户做决定。做严肃业务的 agent,得在系统提示里给它上紧箍咒。
- 对思考历史敏感:K3 要求 harness 完整回传历史思考内容,中途从别的模型切过来会不稳定。生态适配需要时间。
- 综合体验仍有差距:官方原话——与 Claude Fable 5 和 GPT-5.6 Sol 相比,用户体验上仍有”可感知的差距”。
- 部署门槛极高:推荐 64 卡以上超节点。“开源”不等于”人人可用”,普通开发者短期内还是得走 API 或云厂商。
写在最后
K3 不是”最强模型”,官方自己都没这么说。但它可能是最重要的一次开源发布:它证明了开源模型可以站到前沿俱乐部的门口,证明了架构效率能对冲算力劣势,也宣告了开源 AI 从”平替”走向”正面竞争”的时代。
7 月 27 日权重放出之后,真正的故事才开始:谁来接住这 2.8T 参数?会长出什么样的微调模型、蒸馏模型、行业模型?闭源巨头会用降价还是加速迭代来回应?这些问题的答案,会比任何一张跑分表都更能定义 2026 下半年的 AI 行业。
技术报告发布后,我会跟进一篇 KDA 和 AttnRes 的架构详解。感兴趣的话,别走远。
文中性能数据以官方博客与第三方评测发布时点为准,部分基准由不同 harness 测得,横向对比请留意口径差异。
参考资料
- Kimi K3: Open Frontier Intelligence — Moonshot AI 官方博客
- China's Moonshot throws down the gauntlet with Kimi K3 — SiliconANGLE
- Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 — The Decoder
- Artificial Analysis Intelligence Index — Artificial Analysis