没人把顶级大模型真的开源过,直到 Kimi K3
2026.07.29·一手技术报告拆解·约 2200 字在2026年7月29号之前开源模型和顶级模型之间一直隔着一条心照不宣的线。开源社区能拿到的一直是够用的模型——参数规模停在千亿级能力落后旗舰闭源模型一到两代大家心里都清楚真正站在能力顶端的那几个模型GPT、Claude从来不会把权重放出来。这不是技术问题是选择问题——没有一家公司愿意把自己最强的东西白送出去。7 月 27 日晚上 11 点 13 分这条线第一次被跨过去了。月之暗面把 Kimi K3 的权重、47 页技术报告、连同背后的核心基础设施全部开源而这个模型的能力水平第一次真正逼近甚至超过了 GPT-5.6 Sol 和 Claude Fable 5 这两个最新的闭源旗舰。这不是开源模型又追近了一点这是第一次顶级水平和开源权重同时出现在了同一个模型身上。1同等水平不是营销话术是可以摆数字对比的事实先把最容易被忽略、也最容易被夸大的一点说清楚K3 到底强到什么程度不需要用形容词直接看它和两个闭源旗舰的对比。编程能力上K3 在 SWE-Marathon 这个长程编程基准上拿到 42.0%比 Claude Fable 5 的 35% 高出 7 个百分点ProgramBench 上以 77.8% 拿到全场最高分。Agent 能力上BrowseComp真实网页浏览与信息检索任务K3 拿到 91.2%同样是第一名而且完成每个任务的成本只要 GPT-5.6 Sol 的一半。更直接的对比是 Kimi Code BenchK3 的得分只比 Claude Fable 5 低 4 分但花费只要对方的 38%。放到企业采购最关心的 GDPval 场景里K3 比 GPT 便宜 13%比 Claude 便宜 2.6 倍。图 1K3 在多个关键指标上对齐甚至超过闭源旗舰这些数字共同说明一件事K3 不是在某个细分任务上偏科式地跑赢了一次而是在 编程、Agent、多模态这几条主线上同时站到了和两大闭源旗舰同一个量级——而且是以对方三分之一到一半的成本做到的。2能做到这一步靠的不是堆参数是把两条路一起走到头硅星人Pro 拆解了 K3 的 47 页技术报告后指出了一个此前被大多数人忽略的关键判断大模型的能力提升其实有两条完全不同的轴——一条是部署前投入更多算力和数据把模型做大另一条是部署后投入更多算力做长时间推理和强化学习。过去两年开源社区几乎只在第二条轴上使劲模型规模始终停留在千亿级别而 K3 是第一个把两条轴同时推到前沿的开源模型——总参数达到 2.78 万亿是上一代 K2 的两倍多同时相比 K2 整体 scaling 效率还提升了约 2.5 倍。图 2规模 × 推理双轴驱动重新定义开源模型的能力上限这背后是一整套架构上的重新设计用 KDA 线性注意力和门控 MLA 混合的方式处理长上下文把位置编码整个去掉让模型能稳定处理 100 万 token 的上下文专家网络用到 896 个但每次只激活 16 个把计算成本死死摁住。这套设计不只是让 K3 变强还反过来影响了整个开源生态——K3 团队把 DeepSeek V4 的核心算子 DSA 又提速了 55.1%这在过去是开源社区向头部模型学习的方向这次反过来了。3真正的门槛不是答得好是能不能一直做下去AI科技评论的技术拆解点出了另一个更容易被忽略、但可能是这次最重要的变化当一个模型需要连续工作几个小时去完成一个真实任务时决定它上限的已经不是下一句话说得好不好而是它能不能记住已经做到哪一步、能不能看到真实的执行结果、能不能在出错之后接着把任务做完。图 3长程 Agent 能力的突破让模型像真正能顶岗的员工这才是长程 Agent 能力真正难的地方也是过去开源模型普遍卡住的地方。K3 为此专门设计了一套叫 AgentENV 的基础设施用轻量虚拟机跑任务沙箱累计创建了超过 5100 万个单个沙箱的存档只要 133 毫秒、恢复只要 49 毫秒。配合partial rollout这种异步执行机制长任务不会因为要等一整批任务同时完成而被卡住。这套东西解决的不是模型聪不聪明而是 “模型能不能像一个真正能顶岗的员工一样扛得住一整段不被打断的工作”——这恰恰是企业愿意为 Agent 付费的核心诉求。4这次行业反应有多大看这几个数字就知道不是自嗨K3 上线一小时内就冲到 Hugging Face 趋势榜第一30 分钟内拿到超过 4000 个点赞Hugging Face 联合创始人称这是他们见过增长最快的一次模型发布。真正说明这件事分量的是随后的连锁反应。7 月 24 日黄仁勋发出了他人生的第一条 X 帖子牵头发起《开放权重与美国 AI 领导力》公开信首发只有 25 家机构签署到周末暴涨到 77 家最终签署机构超过 100 家——微软、Meta、IBM、AMD、Hugging Face、Linux 基金会甚至此前一直是闭源阵营代表的 OpenAI 和 Google 也加入了进来。英伟达同时牵头成立了 Open Secure AI Alliance联合近 40 家科技公司围绕开放权重模型搭建安全基础设施。另一边由 YC、Replit、Proton 等近 200 家硅谷创业公司组成的 Little Tech 联盟公开警告如果封禁中国开源模型会有数百家美国初创公司在短时间内失去赖以生存的技术底座。而 Anthropic 则被卷入了不太舒服的位置——不得不专门发长文回应解释自己没有跟进开源的原因。图 4从模型开源到生态共振K3 撬动了整个行业的连锁反应这场反应之所以这么大是因为它触碰到了每家公司都很清楚、但很少被摆到台面上的一个变化黄仁勋自己给出的判断是前沿智能正在第一次变成一种可以下载、可以迁移的基础资产。当能力和权重开始同时开源模型层本身的稀缺性就在下降行业的价值开始往算力、Agent 框架、企业数据这些环节转移——这对所有靠模型能力独家赚钱的公司都是一次真实的地基松动。值得一提的是K3 的许可证设计也很清楚地表明了这不是一次公益行为而是一步算好的商业棋普通开发者和公司可以免费使用、修改、商用几乎没有门槛只有当一家公司靠 K3 提供模型服务、连续 12 个月总收入超过 2000 万美元或者商业产品月活超过 1 亿、单月收入超过 2000 万美元时才需要额外签协议或者在产品里显著展示 Kimi K3。换句话说月之暗面愿意把顶级能力免费送给绝大多数人但真正靠这个模型赚到大钱的少数公司需要付出代价——这是一次精确计算过的开放不是一时冲动。5分水岭真正的意义是往前看回头看这条一直没人跨过的线会发现它之所以一直没被跨过不是因为技术做不到而是因为没有一家真正站在能力顶端的公司愿意承担把自己最强模型开源出去的商业风险。K3 这次给出的答案是这笔账是可以算得过来的。免费开放绝大多数使用场景换来的是生态位——开发者的信任、开源社区的贡献、以及在下一轮竞争里谁的技术底座被更多人依赖这个更长远的筹码。往后看这件事至少会推着行业往两个方向走。一是闭源模型的定价逻辑会被迫改变——当一个成本只要三分之一到一半的开源选项在能力上打平甚至反超闭源阵营很难再靠我们更强这一条理由维持原有的价格黄仁勋自己也说过开源模型未必会终结闭源模型但正在倒逼它们开始节流。二是接下来的竞争焦点会从谁的模型分数更高转移到谁能把开源出来的能力更快地嵌进真实的工作流里——模型本身不再是稀缺资源之后怎么用好它才是真正拉开差距的地方。这大概就是分水岭这个词该配得上的分量不是一次跑分的胜利而是一条原来被认为不会被跨过的线被真正跨过去了。我会持续跟踪大模型、AI 生态这些方向的一手信息读技术报告、拆产业逻辑尽量把行业里正在发生但还没被讲清楚的判断说明白。—— 欢迎关注我的公众号一起看接下来会发生什么。

相关新闻