发布时间:2026/8/12 14:40:13
ICML 2026 Oral论文复现率仅7.6%:当顶会论文不可验证时,研究者该怎么办? 从SAI复现报告看AI学术圈的信任危机与结构性困境OpenAI研究员Keller Jordan最近在X上发了一句话把AI学术圈炸了锅“大多数大实验室的人现在几乎不读论文了ICLR/ICML/NeurIPS上的论文大多是夸大其词和造假。”如果只是嘴炮这顶多算一个圈内人的情绪发泄。但问题是数据站在他这边。今年7月芝加哥大学谭宸浩教授联合创办的SAIScience of AI做了一件非常得罪人的事他们把ICML 2026的全部168篇Oral论文拿来实验复现。结果相当难看——105篇完成复现的论文中只有8篇复现率超过80%。中位数复现得分在28%-30%之间。也就是说两万多篇投稿里筛出来的最顶层论文绝大多数经不起跑一遍代码的检验。一、比造假更可怕的是系统性不可验证先澄清一点SAI报告里暴露的问题大部分不是故意造假那么戏剧化。真正普遍的情况是代码跑不通关键文件缺失依赖环境损坏实验结果和论文对不上模型已经下线后人无法复现这些问题听起来像是疏忽但累积起来造成的结果是一篇论文声称的成果外人几乎无法验证。这就形成了一个危险的灰色地带——论文作者可以说我开源了但你就是跑不出来他说可能是环境配置问题你也没办法证伪。更讽刺的是那篇ICLR 2026的论文效果好得反常开源代码一看原来是用测试集标签调参。这种低级错误能被顶会接收说明审稿流程本身已经很难识别看起来合理的陷阱。二、为什么实验审稿这么难做SAI的报告里有一个数字让我印象很深完整重跑一篇ICML Oral论文成本中位数约为8,900美元17篇超过10万美元最贵的一篇接近220万美元。这意味着什么意味着可复现性正在成为AI领域的阶级壁垒。只有资金充裕的大实验室或公司才付得起复现一篇论文的成本。普通高校研究者、独立研究者、学生根本没有资源去验证顶会论文的真实性。于是大家只能选择**“相信”**——相信审稿人把关了相信同行评议有效。但SAI的数据告诉我们这个信任链已经断裂了。而且那些没有开源代码的64篇Oral论文168篇中104篇开源直接就是无懈可击——你无法验证只能默认它是对的。正如一位评论者说的“之所以能发现这个漏洞是因为代码是开源的。又有多少类似的测试漏洞仅仅因为代码不是开源的而被忽视了”三、不读论文是傲慢还是无奈回到Keller Jordan那句话。很多人批评他上岸后抽梯子——OpenAI从学术界招人、用学术界的成果、抢学术界的GPU最后说学术界基本都是欺诈。这个批评有道理但也忽略了一个事实在大模型时代真正重要的进展确实越来越不依赖论文了。GPT-4的技术细节没有论文Gemini的核心训练方法不会公开各家的Agent架构只在内部迭代。当产业界的算力、数据、工程能力远超学术界时论文作为知识传播媒介的价值确实在衰减。但这里有一个更深层的问题产业界的人可以不读论文但想进入产业界的人还是要靠论文敲门。申请PhD、找教职、进OpenAI——这些都需要论文做凭证。论文在知识传播上的可信度在下降在人才筛选中的价值却丝毫未减。这就造成了一个荒诞的局面论文变成了一个你必须参与但不必相信的游戏。你写论文不是为了传播知识而是为了拿到门票你读论文不是为了学习而是为了跟进哪些方向还在被审稿人接受。四、这对普通研究者意味着什么如果你是正在投顶会的学生或者刚入行的研究者这个数据可能让人沮丧。但我想提供几个务实的视角1. 可复现正在成为差异化竞争力当大部分论文都跑不通时一篇真正能复现的论文反而更稀缺。如果你能在开源代码、实验细节、环境配置上做到别人能跑通这已经超过了大多数Oral论文。这不是底线要求这是竞争优势。2. 小模型、小实验是独立研究者的机会SAI报告显示越依赖大规模算力的论文复现成本越高可信度越难验证。反过来在小模型、小数据集上做的扎实分析反而更容易被社区验证和认可。独立研究者不必盲目追逐大精和真更有长期价值。3. 论文之外建立可验证的个人品牌在GitHub上维护一个稳定的开源项目、在社交媒体上分享可复现的实验过程、写技术博客时附上完整的运行记录——这些可验证的积累比一篇可能跑不通的顶会论文更能建立长期信任。五、论文制度会崩溃吗短期内不会有人可能会问既然论文复现率这么低那论文制度是不是该被淘汰了我的判断是短期内不会。因为论文制度解决的不只是知识传播问题它还解决了**“人才筛选和资源分配”**问题。在没有更好的替代机制之前PhD录取委员会、招聘团队、基金评审人依然需要论文作为可量化的信号。但长期来看如果不可验证成为常态论文的信号价值也会衰减。也许未来的评价体系会更看重开源项目的实际影响力技术博客的社区反馈可复现的实验记录真实的工程落地能力六、写在最后那位说希望学生能写出夸大其词的论文的教授其实是在自嘲——大多数学生连造假的能力都没有还在挣扎LaTeX排版。这句话背后是一个被忽视的事实顶会论文的门槛看起来很高23918篇投稿选168篇Oral但实际上**“写好一篇论文和做好一项研究正在变成两件事**。很多人把精力花在怎么让论文看起来 impressive”而不是让研究真正可靠。这不是某个人的道德问题这是激励机制的系统性扭曲。当发表的回报远大于被揭穿的风险时理性人都会选择优化前者。SAI的实验审稿之所以重要不是因为它抓出了几个坏人而是它用数据证明了一件事AI学术圈需要一场关于可信度的重建。而重建的起点可能是每个人都先问自己一个问题我写的这篇论文别人能复现吗参考与延伸阅读SAI实验审稿完整报告how-much-science-is-verifiableKeller Jordan原推文及讨论Mathew Shen关于ICLR论文测试集泄露的发现

相关新闻

2026/8/12 14:40:13

【Bug已解决】consistency_models model/pipeline review 解决方案

【Bug已解决】consistency_models model/pipeline review 解决方案 一、现象长什么样 对 diffusers 的 Consistency Models(consistency_models model/pipeline review,即一致性模型——一类可通过单步或多步采样生成图像的蒸馏扩散模型)做审…

2026/8/12 14:40:13

Visual Studio驱动开发:从环境搭建到内核调试实战指南

1. 项目概述:为什么选择Visual Studio进行驱动开发? 如果你问一个老派的Windows驱动开发者,他们最熟悉的开发环境是什么,很多人会脱口而出“WDK 文本编辑器 命令行”。确实,在过去很长一段时间里,驱动开发…

2026/8/12 14:40:13

Git LFS实战:突破GitHub 25MB限制,优雅管理大文件

1. 项目概述:为什么我们需要绕开25M的限制? 如果你在Github上提交过代码,大概率都遇到过那个恼人的提示:“Yowza, that’s a big file.” 然后告诉你,文件大小超过了25MB,无法直接推送。这几乎是每个开发者…

2026/8/12 15:55:24

痛风饮食安全算法:精准管理海鲜嘌呤摄入

1. 痛风患者的饮食困境与算法化思路作为一个长期与高尿酸作斗争的痛风患者,我深刻理解那种面对美食时的纠结——特别是当一盘新鲜肥美的海鲜摆在面前时。传统饮食建议往往简单粗暴地给出"避免高嘌呤食物"的结论,但实际生活中我们需要更精细的决…

2026/8/12 15:55:24

第19届成图大赛国赛复盘:从CAD建模到创新设计的实战指南

1. 背景与核心概念全国大学生先进成图技术与产品信息建模创新大赛(简称“成图大赛”)是国内工程图学领域最具影响力的学科竞赛之一。它不仅是检验学生制图、建模、创新设计能力的试金石,更是连接高校教学与企业需求的桥梁。然而,随…

2026/8/12 15:55:24

COMSOL光纤仿真:有效折射率与损耗计算全解析

1. 项目概述:光纤仿真中的关键参数解析 在光纤设计与优化领域,COMSOL Multiphysics作为一款强大的多物理场仿真软件,已经成为研究光子晶体光纤(PCF)和反谐振光纤(ARF)的标配工具。这两种特殊光纤凭借其独特的结构设计,在通信、传感…

2026/8/12 15:55:24

电商产品组合策略:引流品与利润品的黄金配比

1. 项目概述:电商产品组合策略的核心逻辑"盟接之桥说制造"这个标题乍看有些抽象,但拆解后其实讲的是电商领域一个非常实战的话题——如何通过引流品和利润品的组合策略,在全球电商平台上实现高效运营。我在跨境电商行业摸爬滚打8年…

2026/8/12 15:50:23

AI音视频技术演进:从信号处理到语义理解,重塑实时交互新范式

1. 从“能听见”到“能听懂”:AI如何重塑音视频交互的底层逻辑最近和几个做社交、在线教育、远程协作产品的朋友聊天,大家不约而同地提到了一个共同的痛点:音视频通话的“天花板”似乎到了。过去十年,我们解决了“能不能通”的问题…

2026/8/12 10:37:12

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/12 5:35:25

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/12 9:34:08

Ubuntu 23.10中双击运行.sh文件的完整指南:从权限原理到桌面配置

1. 项目概述:从一次“双击”引发的权限探索在Ubuntu桌面环境下,我们习惯了双击运行那些带有.exe后缀的Windows程序安装包,但当你拿到一个以.sh结尾的Shell脚本文件时,满怀期待地双击它,却很可能只看到一个文本编辑器窗…

2026/8/12 9:34:08

NumPy条件索引实战:np.where与np.argwhere高效数据筛选指南

1. 从一次数据筛选的“笨办法”说起 前几天,我帮一个刚入行的数据分析师同事看代码,他正在处理一批传感器数据,需要找出所有温度超过阈值的数据点,然后进行后续分析。我一看他的实现,好家伙,一个 for 循环…

2026/8/12 9:34:08

基于Docker与Selenium Grid构建高可用浏览器自动化测试环境

1. 项目概述:为什么需要容器化的浏览器自动化?在软件开发和测试领域,浏览器自动化早已不是新鲜事。无论是日常的UI回归测试、数据抓取,还是复杂的业务流程模拟,Selenium都是我们绕不开的利器。然而,但凡在团…

2026/8/10 11:20:30

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/11 17:06:59

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/11 3:05:11

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…