ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

拳打 Claude、脚踢 ChatGPT?Gemini 4 这次真有底气

拳打 Claude、脚踢 ChatGPT?Gemini 4 这次真有底气 GEMINI 4 ARGON · 2026-10-01AI 生成的像素风创意示意Gemini × Claude × CodexGoogle 把 Gemini 4 的战书递过来了。2026 年 9 月 30 日Google 公布Gemini 4 Argon重点瞄准复杂编程、企业知识工作和网络安全。“拳打 Claude、脚踢 ChatGPT”听上去够狠。翻完成绩单我的判断是这次谷歌确实有底气。底气在哪先看一张独立榜单再看它赢了什么、还输在哪。封面是 AI 生成的像素风创意示意。画面里的 Codex 是 OpenAI 的编程产品下面的分数比较落到具体 GPT 和 Claude 模型不能当作 Codex 产品实测。第一拳拿下这张榜的第一名截至本次核查独立评测机构 Vals AI 的Vals Index排名中Gemini 4 Argon 以68.90%排在第一。紧随其后的是 Claude Sonnet 5.567.04%Claude Opus 5.566.97%。GPT‑6 Astra 为 63.13%GPT‑6.1 Sol 为 61.15%。这里甚至包括刚发布的 Sonnet 5.5 和 GPT‑6.1 Sol。谷歌这次交出的成绩能在这份榜单里压过最新对手。这张榜把金融、编程、法律和税务任务合在一起并按相关行业的美国 GDP 占比加权。 对想让 AI 承担工作任务的人来说它提供了一个有用的观察角度。不过Gemini 与两款 Claude 的领先幅度约为 1.9 个百分点。榜单还列有误差范围适合写“当前排名第一”凭这一项就宣布所有任务都拉开巨大差距证据还不够。Vals AI · 依据 Vals Index 原榜数据重绘保留排名与误差范围第二拳复杂代码和业务流程它真能打Google 公布的对比表里有两项成绩值得单独拎出来。DeepSWE v1.1Gemini 4 为 77.9%GPT‑6 Astra 为 74.1%Claude Opus 5.5 为 74.2%。这项评测关注真实代码库中的复杂、长流程软件工程任务。AutomationBenchGemini 4 为 51.3%GPT‑6 Astra 为 41.4%Claude Opus 5.5 为 42.5%。它关注多步骤业务流程的端到端执行能力。对普通读者来说可以把这两项理解为面对复杂代码任务或者需要连续完成多个步骤的工作Gemini 4 已经拿出了有竞争力的成绩。但这些结果也有各自的测试条件。Google 的说明写明DeepSWE 的 Gemini 成绩由其自测竞品成绩来自公开榜单或系统卡不同项目也可能使用不同运行环境。 本文据公开资料解读未进行作者实测。Google DeepMind · 依据官方成绩表选取正文四项评测重绘含落后项目价格也够狠但得看脚注Google 公布的首发价格是每百万输入 token 2 美元、每百万输出 token 10 美元。GPT‑6 Astra 的标准输入、输出单价为 10 和 50 美元。 对照这两项Gemini 4 的首发单价确实只有 Astra 的五分之一。不过首发期结束后Gemini 4 将按4 和 20 美元计价。Claude Sonnet 5.5 和 GPT‑6.1 Sol 的标准输入、输出单价也已经是2 和 10 美元。所以谷歌把首发价格打得很有吸引力真正完成一项工作的费用还要看消耗多少 token、重试多少次以及工具和缓存成本。Google、Anthropic 与 OpenAI · 官方定价整理包含首发期结束后的单价对手也能还手Google 自己的表里就保留了 Gemini 4 落后的项目。在Terminal‑Bench 4.0上Gemini 4 为 57.4%Claude Opus 5.5 为 66.4%在Terminal‑Bench Science 0.1上Gemini 4 为 57.6%GPT‑6 Astra 为 68.1%。这几项评测已经足够提醒我们编程、科学工作流、知识工作各有赛场换一个任务领先者就可能换人。至于封面中的 CodexOpenAI 官方确认 GPT‑6.1 Sol 已在 Codex 中提供。模型分数能帮助判断能力整个产品的体验还要单独验证。最后的悬念现在还没全面开放Gemini 4 Argon 目前通过 Fairwind 项目向部分受信任的网络安全伙伴开放。Google 表示后续将向开发者、企业和消费者推出并从付费 API 客户及 Google AI Ultra 订阅者开始。本次核查没有找到明确的全面开放日期。Google · 根据官方公告整理开放范围普通用户尚未全面开放成绩单有了首发价格有了普通用户的实际体验仍要等进一步开放。我的结论很简单“Gemini 4 这次真有底气”成立“Claude 和 GPT 已经全面输掉”还远远谈不上。等它开放你会先试 Gemini还是继续用顺手的 Claude、ChatGPT 和 Codex数据核查日期2026-10-01。榜单、价格与开放范围可能变化以官方页面及评测机构后续更新为准。
返回列表