
AI 第一次在信息学奥赛中超过最强人类但这个成绩还不能直接封神文半熟AI蒸馏室9 月 3 日凌晨一篇来自 NVIDIA Nemotron 团队的论文出现在 arXiv 上。论文里最醒目的数字只有三个IOI 2026 金牌分数线361.12 分。当届最高分人类选手498.27 分。Nemotron‑3‑Ultra‑CC535.4 分。满分是 600 分。按照论文作者的说法这是第一次有 AI 系统在一届国际信息学奥林匹克竞赛的题目上超过当届最高分人类选手。如果只看这张柱状图很容易把它理解成编程领域又一个“AlphaGo 时刻”。但把论文脚注和部署规模读完以后事情会变得复杂一些。这套系统不是 IOI 官方参赛者运行过程没有受到 IOI 官方监督成绩也没有进入官方排名。现场推理时它最多使用了 760 张 NVIDIA GB300 GPU。成绩值得认真看但还不能只凭一句“AI 打败人类”就下结论。535.4 分究竟是什么水平IOI全称国际信息学奥林匹克竞赛是面向中学生的国际编程竞赛之一。比赛分两天举行每天 5 个小时。2026 年的参赛者一共需要解决 6 道算法题每道题满分 100 分总分 600 分。它不是普通的“写一段能运行的代码”。选手需要自己理解题目、设计算法、处理复杂边界条件再把程序提交给隐藏测试。答案即使没有完整解决一道题也可能通过部分子任务获得分数。IOI 官方成绩页面显示2026 年金牌分数线是 361.12 分最高分选手获得 498.27 分。NVIDIA 团队报告的 535.4 分比金牌线高出 174.28 分也比最高分人类选手高出 37.13 分。从分数本身看它不是刚刚越过金牌线而是超过了当届所有正式参赛者。更值得注意的是这不是拿已经公开的题目进行事后测试。论文称团队在 IOI 2026 正式比赛期间运行了这套系统。当时题目尚未公开系统不能访问互联网并且遵守与人类选手相同的比赛时间和提交次数限制。这降低了模型提前见过题目或直接从网上寻找答案的可能性也是这项结果最有分量的部分。这不是“一次回答”而是一套解题工厂Nemotron‑3‑Ultra‑CC 并不是读完题目后直接输出一份代码就结束。它背后是一整套专门为竞赛编程搭建的系统。团队首先整理了约 2.2 万道竞赛题通过监督微调等方式把基础模型调整成更擅长算法竞赛的版本。用于 IOI 2026 现场测试的 Competition Ultra‑CC建立在 Nemotron‑3‑Ultra‑550B‑A55B 之上模型总参数约 5500 亿实际激活参数约 550 亿。为了在比赛时间内生成足够多的答案团队还对模型进行了量化和推理加速。现场运行的峰值资源是最多 760 张 NVIDIA GB300 GPU。真正拉开分数的环节叫 GenCorrect。面对一道题它会先并行生成最多 200 份候选程序在本地编译、测试再按照代码行为和多样性进行筛选选出 10 份提交给比赛评测系统。评测系统返回各个子任务的得分后模型把这些结果带入下一轮继续生成和修改答案。前四轮都是“生成 200 份、提交 10 份”。到了最后一轮候选程序数量被扩大到 1000 份系统再从中选出最可能得分的 10 份。IOI 允许每道题最多提交 50 次。GenCorrect 正好把这些机会分成 5 轮每轮使用 10 次。也就是说535.4 分不是某一次“灵光一现”的答案。它来自大模型、并行采样、本地执行、候选聚类、评测反馈和提交策略共同组成的搜索过程。把它叫作“AI 模型的成绩”没有错但更严谨的说法是这是一套以 Nemotron 为核心的竞赛编程系统所取得的成绩。论文里最容易被忽略的两句话第一句话藏在论文脚注里这套系统不是 IOI 的官方参赛者运行过程没有受到 IOI 官方监督因此成绩没有进入官方排名。这不代表 535.4 分一定有问题。论文公布了比赛设置、模型配置和每道题的成绩IOI 官方页面也能独立确认最高人类分数和金牌线。但 AI 系统具体如何运行、是否完全遵守所有现场条件目前主要来自论文作者自己的记录。截至 9 月 3 日公开信息中还没有看到 IOI 官方或独立研究团队对这次运行进行完整复核。第二句话是峰值使用最多 760 张 GB300 GPU。论文强调 AI 遵守了与人类相同的时间、互联网和提交限制但没有让双方使用相同的计算资源。一名选手坐在一台比赛电脑前思考AI 系统则可以在后台同时生成数百份方案用大量 GPU 把搜索空间迅速铺开。这依然是一项工程能力但它回答的问题更接近如果给 AI 足够多的计算资源和反馈机会它能不能在规定时间内搜索出比所有人类选手更高分的解法论文给出的答案是可以。它并不能直接证明同等硬件条件下的一个模型已经拥有超过顶尖选手的算法直觉。为什么这项结果仍然很重要限制很多不等于成绩没有意义。首先IOI 2026 是一次前瞻性测试。团队是在题目公开前、正式比赛期间运行系统而不是在题目进入互联网以后反复调试。其次赛后使用通用 GenCorrect 流程进行的 5 次独立运行平均得到 521.72 分范围是 495.0 至 545.8 分。虽然这些仍然是论文作者自己的评测但至少表明高分并不只出现过一次。更关键的是它展示了后训练和测试时计算可以把同一个底座推到什么程度。在 IOI 2025 上较小的 Nemotron‑3‑Nano 基础模型只有 130 分。经过监督微调后提高到 280 分强化学习后达到 291 分再经过 5 轮 GenCorrect最终得到 468 分超过当年的金牌线。这说明决定结果的已经不只是模型参数和一次生成能力。训练数据怎样筛选、模型如何微调、能否运行代码、怎样利用评测反馈、在有限提交次数内如何选择候选答案都可能比“第一次回答对不对”更重要。从这个角度看这篇论文真正展示的不是一款单独的聊天模型而是一条工业化的自动解题流水线。真正被改写的是“会编程”的定义过去我们说一个模型“会编程”通常指它能够补全代码、解释报错或者按照要求写出一个函数。Nemotron‑3‑Ultra‑CC 展示的是另一种能力同时生成大量方案把程序放进执行环境根据测试结果筛选和修改再把有限的提交机会分配给最有希望的答案。它未必像人一样理解一道题却已经可以利用计算资源把“提出方案—运行验证—接受反馈—继续修正”做成自动循环。这对真实软件开发的影响可能比一张竞赛排名图更直接。因为许多工程任务本来就有清晰的反馈代码能不能编译、测试是否通过、性能有没有提升、漏洞能不能复现。只要反馈可以机器化Agent 就能不断尝试和修正而不必要求第一次就给出完美答案。当然现在这套系统的成本距离普通开发者很远。最多 760 张 GB300 GPU也不是一个可以随手打开的编程助手。论文团队表示未来计划公开比赛版本的 Nemotron‑3‑Ultra‑CC 检查点以及可以运行的推理和评测方案。只有等模型、代码和运行细节真正公开外部团队才能判断这项结果能否复现以及需要付出多高的成本。