发布时间:2026/9/5 7:25:19
AI 第一次在信息学奥赛中超过最强人类,但这个成绩还不能直接封神 AI 第一次在信息学奥赛中超过最强人类但这个成绩还不能直接封神文半熟AI蒸馏室9 月 3 日凌晨一篇来自 NVIDIA Nemotron 团队的论文出现在 arXiv 上。论文里最醒目的数字只有三个IOI 2026 金牌分数线361.12 分。当届最高分人类选手498.27 分。Nemotron‑3‑Ultra‑CC535.4 分。满分是 600 分。按照论文作者的说法这是第一次有 AI 系统在一届国际信息学奥林匹克竞赛的题目上超过当届最高分人类选手。如果只看这张柱状图很容易把它理解成编程领域又一个“AlphaGo 时刻”。但把论文脚注和部署规模读完以后事情会变得复杂一些。这套系统不是 IOI 官方参赛者运行过程没有受到 IOI 官方监督成绩也没有进入官方排名。现场推理时它最多使用了 760 张 NVIDIA GB300 GPU。成绩值得认真看但还不能只凭一句“AI 打败人类”就下结论。535.4 分究竟是什么水平IOI全称国际信息学奥林匹克竞赛是面向中学生的国际编程竞赛之一。比赛分两天举行每天 5 个小时。2026 年的参赛者一共需要解决 6 道算法题每道题满分 100 分总分 600 分。它不是普通的“写一段能运行的代码”。选手需要自己理解题目、设计算法、处理复杂边界条件再把程序提交给隐藏测试。答案即使没有完整解决一道题也可能通过部分子任务获得分数。IOI 官方成绩页面显示2026 年金牌分数线是 361.12 分最高分选手获得 498.27 分。NVIDIA 团队报告的 535.4 分比金牌线高出 174.28 分也比最高分人类选手高出 37.13 分。从分数本身看它不是刚刚越过金牌线而是超过了当届所有正式参赛者。更值得注意的是这不是拿已经公开的题目进行事后测试。论文称团队在 IOI 2026 正式比赛期间运行了这套系统。当时题目尚未公开系统不能访问互联网并且遵守与人类选手相同的比赛时间和提交次数限制。这降低了模型提前见过题目或直接从网上寻找答案的可能性也是这项结果最有分量的部分。这不是“一次回答”而是一套解题工厂Nemotron‑3‑Ultra‑CC 并不是读完题目后直接输出一份代码就结束。它背后是一整套专门为竞赛编程搭建的系统。团队首先整理了约 2.2 万道竞赛题通过监督微调等方式把基础模型调整成更擅长算法竞赛的版本。用于 IOI 2026 现场测试的 Competition Ultra‑CC建立在 Nemotron‑3‑Ultra‑550B‑A55B 之上模型总参数约 5500 亿实际激活参数约 550 亿。为了在比赛时间内生成足够多的答案团队还对模型进行了量化和推理加速。现场运行的峰值资源是最多 760 张 NVIDIA GB300 GPU。真正拉开分数的环节叫 GenCorrect。面对一道题它会先并行生成最多 200 份候选程序在本地编译、测试再按照代码行为和多样性进行筛选选出 10 份提交给比赛评测系统。评测系统返回各个子任务的得分后模型把这些结果带入下一轮继续生成和修改答案。前四轮都是“生成 200 份、提交 10 份”。到了最后一轮候选程序数量被扩大到 1000 份系统再从中选出最可能得分的 10 份。IOI 允许每道题最多提交 50 次。GenCorrect 正好把这些机会分成 5 轮每轮使用 10 次。也就是说535.4 分不是某一次“灵光一现”的答案。它来自大模型、并行采样、本地执行、候选聚类、评测反馈和提交策略共同组成的搜索过程。把它叫作“AI 模型的成绩”没有错但更严谨的说法是这是一套以 Nemotron 为核心的竞赛编程系统所取得的成绩。论文里最容易被忽略的两句话第一句话藏在论文脚注里这套系统不是 IOI 的官方参赛者运行过程没有受到 IOI 官方监督因此成绩没有进入官方排名。这不代表 535.4 分一定有问题。论文公布了比赛设置、模型配置和每道题的成绩IOI 官方页面也能独立确认最高人类分数和金牌线。但 AI 系统具体如何运行、是否完全遵守所有现场条件目前主要来自论文作者自己的记录。截至 9 月 3 日公开信息中还没有看到 IOI 官方或独立研究团队对这次运行进行完整复核。第二句话是峰值使用最多 760 张 GB300 GPU。论文强调 AI 遵守了与人类相同的时间、互联网和提交限制但没有让双方使用相同的计算资源。一名选手坐在一台比赛电脑前思考AI 系统则可以在后台同时生成数百份方案用大量 GPU 把搜索空间迅速铺开。这依然是一项工程能力但它回答的问题更接近如果给 AI 足够多的计算资源和反馈机会它能不能在规定时间内搜索出比所有人类选手更高分的解法论文给出的答案是可以。它并不能直接证明同等硬件条件下的一个模型已经拥有超过顶尖选手的算法直觉。为什么这项结果仍然很重要限制很多不等于成绩没有意义。首先IOI 2026 是一次前瞻性测试。团队是在题目公开前、正式比赛期间运行系统而不是在题目进入互联网以后反复调试。其次赛后使用通用 GenCorrect 流程进行的 5 次独立运行平均得到 521.72 分范围是 495.0 至 545.8 分。虽然这些仍然是论文作者自己的评测但至少表明高分并不只出现过一次。更关键的是它展示了后训练和测试时计算可以把同一个底座推到什么程度。在 IOI 2025 上较小的 Nemotron‑3‑Nano 基础模型只有 130 分。经过监督微调后提高到 280 分强化学习后达到 291 分再经过 5 轮 GenCorrect最终得到 468 分超过当年的金牌线。这说明决定结果的已经不只是模型参数和一次生成能力。训练数据怎样筛选、模型如何微调、能否运行代码、怎样利用评测反馈、在有限提交次数内如何选择候选答案都可能比“第一次回答对不对”更重要。从这个角度看这篇论文真正展示的不是一款单独的聊天模型而是一条工业化的自动解题流水线。真正被改写的是“会编程”的定义过去我们说一个模型“会编程”通常指它能够补全代码、解释报错或者按照要求写出一个函数。Nemotron‑3‑Ultra‑CC 展示的是另一种能力同时生成大量方案把程序放进执行环境根据测试结果筛选和修改再把有限的提交机会分配给最有希望的答案。它未必像人一样理解一道题却已经可以利用计算资源把“提出方案—运行验证—接受反馈—继续修正”做成自动循环。这对真实软件开发的影响可能比一张竞赛排名图更直接。因为许多工程任务本来就有清晰的反馈代码能不能编译、测试是否通过、性能有没有提升、漏洞能不能复现。只要反馈可以机器化Agent 就能不断尝试和修正而不必要求第一次就给出完美答案。当然现在这套系统的成本距离普通开发者很远。最多 760 张 GB300 GPU也不是一个可以随手打开的编程助手。论文团队表示未来计划公开比赛版本的 Nemotron‑3‑Ultra‑CC 检查点以及可以运行的推理和评测方案。只有等模型、代码和运行细节真正公开外部团队才能判断这项结果能否复现以及需要付出多高的成本。

相关新闻

2026/9/5 7:25:19

智能工厂边缘物联与网络架构:从洛马实践看数据采集与现场部署

1. 从一张对外公开的工厂照片说起:洛马的智能工厂底层长什么样 做智能制造这一行的人,多多少少都看过洛克希德马丁(以下简称洛马)工厂的公开影像资料。很多人第一眼注意的是F-35的总装线、导弹舱段的对接工位,但我更关…

2026/9/5 7:25:19

Linux内核页表深度解析:多级结构、TLB与缺页异常全链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/5 7:25:19

海外电商平台高并发治理实录

看图掌握核心要点👇写在前面:带着这个框架读下去在看具体案例之前,先抛出四年下来最核心的一个判断:线上性能问题从来不是单点问题,每一次告警的直接现象背后,都隐藏着一个更深的架构或设计缺陷。Redis 内存…

2026/9/5 8:10:21

OpenMAIC实战:多智能体交互模式、模型接入与MCP集成指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/5 8:10:21

QQ音乐mgg/mflac加密文件转MP3:工具选择与批量转换实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/5 8:10:21

企业内部评优,评委名单和结果怎么一次整理好

企业做年度评优、项目评比,参评的人多,评委来自不同部门。每次评比前,行政要先把评委名单和参评人名单整理出来,会后又要手工汇总分数、排定名次,再把结果发给各部门。这套流程一年走几次,每次都要占用半天…

2026/9/5 8:10:21

【Harness Loop Engineering】评测体系:Agent Benchmark设计与评估框架

【Harness Loop Engineering】评测体系:Agent Benchmark设计与评估框架 导读:你的Agent在SWE-bench上跑出了45%的通过率,团队欢欣鼓舞——但上线后真实用户反馈却说"改了A又坏了B"、"token烧得飞快还修不对"。问题出在哪?答案是:你在Benchmark上优化,…

2026/9/5 8:10:21

【Prometheus·Exporter 篇】Blackbox Exporter:黑盒监控与网络探测

前言 前面讲的 Exporter 都是"白盒"监控——需要在被监控方安装 Agent。但有些场景你无法在目标上安装任何东西:外部 API、第三方服务、网络设备。Blackbox Exporter 从外部探测目标,属于"黑盒"监控。 一、白盒 vs 黑盒监控 白盒监…

2026/9/5 2:46:54

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/9/5 2:46:52

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/9/5 2:44:34

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/9/5 0:04:47

流式背压机制:避免前端渲染卡死与内存暴涨的滑动窗口限流

流式背压机制:避免前端渲染卡死与内存暴涨的滑动窗口限流在大模型流式输出(Streaming)与智能体实时推流的架构中,生产环境中经常出现一种“上下游生产消费速率严重失衡”的极端情况: 生产端极速产出:大模型…

2026/9/5 2:45:13

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/5 2:30:42

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/5 2:46:50

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…