英伟达AI首超人类夺国际信息学奥赛冠军,535分碾压金牌线破纪录

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

英伟达研究人员在9月2日发布于预印本平台的一篇论文中宣布,其打造的Nemotron-3-Ultra-CC系统在第37届国际信息学奥林匹克竞赛题集上取得535.4分,超过人类最高参赛者498.27分的成绩,也远超361.12分的金牌线,成为有史以来第一个在完整奥赛题集上超越最高分人类的AI系统。这场竞赛于8月9日至16日在乌兹别克斯坦塔什干举行,系统在官方技术委员会的监督下,与来自97个国家的386名学生选手遵守完全相同的比赛规则。

一块机器判卷的试金石为何含金量十足

信息学奥赛之所以成为检验大模型推理能力的残酷标尺,根源在于其客观的自动判卷机制。选手需要在两个比赛日内用C++解决六道高难度算法题,每一份提交都会由机器评测器对照隐藏测试用例判断对错,超时或内存越界同样会被判失败,不存在人工评卷可被说服的空间。英伟达系统提交的代码与人类选手面对的是同一套自动测试,这让535.4分这一结果在方法论上难以被轻易驳倒。

奥赛题目考验的并非单纯的知识记忆,而是短时间内的建模能力、算法设计与工程实现功底。过去几年,DeepMind的AlphaCode系列、OpenAI的推理模型以及DeepSeek的竞赛变体都曾逼近金牌线,而英伟达此次直接跨过了人类最高分这条更高的门槛。意大利代表团领队吉奥尔吉奥·奥德里托对欧洲新闻台表示,AI正在迫使竞赛组织方重新思考办赛方式,学生们如今普遍能接触到这类工具,编程经验依然是引导和修正AI输出所必需的。

双模型管线与GenCorrect:赢在测试时计算

支撑这一成绩的不是单一模型的蛮力,而是一套端到端的专业化训练管线。英伟达团队以2.2万道精选竞赛题为基础,用DeepSeek-V4-Flash生成上百万条合成推理轨迹,训练出两个专用变体:30B总参数、3B激活参数的Nemotron-3-Nano-CC采用监督微调加强化学习;550B总参数、55B激活参数的Nemotron-3-Ultra-CC则仅用监督微调,未使用强化学习。这种刻意的不对称设计,是为了对照研究不同训练策略在大规模下的实际收益。

真正让分数起飞的是名为GenCorrect的测试时策略。系统会并行生成多份候选解答,先运行公开测试信号捕捉失败案例,再把失败反馈给模型进行针对性修正,如此循环直到预算耗尽或找到通过全部测试的答案。回顾性测试显示,在IOI 2025题集上,Nano-CC从130分起步,经后训练升至291分,配合GenCorrect跃升至468分,超过当年438.3分的金牌线,Ultra-CC则达到502分。这套生成、评测、修正的闭环,本质上是把人类选手调试代码的过程自动化并大规模并行。

超越人类之后:能复制的胜利与边界

英伟达论文给出了谨慎的定性,称这是已知首个在IOI题集上超越最高分人类选手的AI系统,同时坦承结果来自自家团队对自家模型的评测,尚未经过完全独立的第三方裁决。论文也未披露逐题得分与完整算力预算,这些留白给外界提供了进一步验证的空间。需要指出的是,竞赛场景存在一个关键前提,机器判卷能以零成本提供二元化的对错信号,这正是GenCorrect闭环能够运转的基础。

在缺少即时验证信号的法律文书撰写、临床诊断或原创科研等领域,这套方法无法直接迁移。但这不妨碍此次成绩成为AI编程能力演进的分水岭事件,它证明在目标明确、验证廉价的领域,AI已经具备稳定超越人类顶尖选手的能力。随着更多实验室跟进竞赛专属模型的研发,围绕AI竞赛成绩的独立复现、算力公平性与人才评价体系的讨论,也将被推向台前。

对仍以奥赛成绩作为升学与招聘重要参考的体系而言,这一变化带来的冲击是结构性的。过去几年,AI在编程竞赛中的成绩快速爬升,从偶尔解出简单题,到稳定逼近国际金牌线,再到如今整体超越人类冠军,突破间隔不断缩短。当机器能在正式比赛时间内击败最顶尖的人类选手,竞赛的筛选功能、训练方法乃至题目设计逻辑都需要被重新审视,而答案或许不在于限制AI的使用,而在于重新定义什么才是人类独有的编程能力。

竞赛之外的算盘:模型也是芯片的广告

英伟达下场做竞赛模型,并非纯粹的学术兴趣。这家公司在推理芯片市场正与AMD以及云厂商自研芯片正面竞争,一个能在全世界面前击败人类顶尖选手的模型,就是最直观的算力广告。论文特别提到,训练阶段的上百万条合成推理轨迹由DeepSeek-V4-Flash等模型批量生成,芯片巨头用竞争对手的开源模型充当数据引擎,既说明开源生态已经深度嵌入前沿训练管线,也透露出英伟达在软件层的紧迫感,它需要向开发者证明,自家的模型、工具链与硬件组合同样能拿出顶尖战绩,而不只是卖出一块块GPU。

从产业视角看,竞赛模型带来的商业回报并不直接,战略价值却相当清晰。当推理需求取代训练成为AI算力增长的主引擎,芯片厂商亲自下场做模型,本质上是在打造自家的推理负载样板间,让客户看到瓶颈究竟在哪里、需要多少卡才能复现同样的成绩。英伟达论文还披露了系统在IOI 2025题集上的对照结果,Nano-CC配合GenCorrect从基线130分一路提升至468分,超过当年438.3分的金牌线,Ultra-CC更是达到502分。这种逐年可复现的进步轨迹,比任何营销话术都更有说服力,可以预见,竞赛成绩单将越来越多地出现在芯片厂商的发布会上,成为算力叙事中颇具分量的一环。

素材来源:Tech Times、AlphaSignal、AI Weekly、arXiv 发布时间:2026-09-06