谁是AI化学家?深势开源RxnBench,用Nature真题“考问”大模型推理极限

发布时间:2026/9/26 10:44:58

谁是AI化学家?深势开源RxnBench,用Nature真题“考问”大模型推理极限 1. 当大模型遇上化学文献为什么“读得懂字”却“看不懂反应”RxnBench 是深势科技开源的一个多模态基准专门用来评测大模型从真实科研文献里理解化学反应的能力。它适合三类人做 AI for Science 的研究者、想验证多模态模型化学推理极限的工程师、以及正在搭建“AI 化学家”类 Agent 的开发者。它要回答的核心问题是——当模型面对 Nature Chemistry、JACS 这类顶刊里的反应图示、机理箭头和实验表格时到底能推理到什么程度。我先把结论摆出来RxnBench 把评测分成了两层。第一层是单图问答 SF-QA305 张有机反应图示、1525 个四选一 QA考的是模型对单张图的细粒度感知第二层是全文问答 FD-QA108 篇开放获取文献题目需要跨正文、图表、表格整合信息而且是不定项选择可以多选、单选甚至不选专门惩罚“瞎猜”。实测数据里SF-QA 上 Gemini-3-Flash-preview 能到 96.23%但结构识别这一类所有模型都掉到 74% 左右FD-QA 更狠目前没有模型超过 50%没有显式推理能力的模型普遍低于 20%。这意味着什么模型能提取事实、能读机理描述但一旦要求它把分子结构图像和文本逻辑对齐短板立刻暴露。你要做的不是感叹差距而是自己跑一遍看你的模型或你的 Agent 在哪个维度崩掉。下面我就按“拿到 Key → 配环境 → 跑评测 → 看结果 → 排错”的顺序把可复制的骨架交给你。2. 前置准备用 TaoToken 统一 Key 打通模型调用通道RxnBench 本身是评测框架它不绑定某一家模型。你要跑评测得先有一个能稳定调用多模态模型的通道。我试过直接对接各家 API光是 Key 管理和不同 SDK 的请求格式就够折腾半天。后来换成 TaoToken 的统一 Key一个 Key 走 OpenAI 兼容接口切换模型只改 model 字段评测脚本不用动。TaoToken 在这里的角色是“模型调用通道”不是替代你的评测逻辑。你仍然需要自己拉 RxnBench 数据集、自己写推理循环但它帮你把“调哪个模型、怎么鉴权、怎么计费”这件事收敛成一套配置。官网入口在 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content API 基址是 https://taotoken.net/api 注意 API 地址不带 UTM 参数别拼错。你需要先做两件事第一在控制台创建一个 API Key第二确认你要评测的模型名。控制台地址是 https://taotoken.net/console?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content Key 管理页在 https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。如果你只是想先验证模型能不能读懂一张反应图可以直接用模型对话页 https://taotoken.net/chat?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 手动传图试一次确认通道通了再写脚本。注意RxnBench 的 FD-QA 需要模型同时处理长文本和图像选模型时优先选支持多模态、上下文窗口足够大的版本。纯文本模型在 SF-QA 上就会直接失败。3. 可复制配置settings.json 与 config.toml 骨架RxnBench 的 GitHub 仓库里评测入口通常依赖配置文件来指定数据集路径、模型参数和输出目录。下面这套骨架是我按它的双层结构整理的你可以直接改成自己的路径。先看settings.json它负责运行时参数{ benchmark: { name: RxnBench, split: sf_qa, data_dir: ./data/RxnBench, image_dir: ./data/RxnBench/images, output_dir: ./runs/sf_qa }, model: { provider: openai_compatible, base_url: https://taotoken.net/api, api_key_env: TAOTOKEN_API_KEY, model_name: gemini-3-flash-preview, max_tokens: 2048, temperature: 0.0, timeout: 120 }, eval: { batch_size: 1, save_raw_response: true, resume: true } }几个关键点split在sf_qa和fd_qa之间切换temperature设 0 是为了可复现化学推理不需要随机性resume打开后中断了不用从头跑。api_key_env指向环境变量不要把 Key 写进文件。再看config.toml它更适合放数据集元信息和评测维度权重[dataset] name RxnBench version v1 source huggingface repo_id UniParser/RxnBench local_path ./data/RxnBench [dataset.sf_qa] num_images 305 num_questions 1525 question_types [ fact_extraction, reagent_role, mechanism, comparative_reasoning, structure_recognition, global_understanding ] [dataset.fd_qa] num_documents 108 allow_multi_select true allow_no_answer true [scoring] exact_match true partial_credit false report_by_dimension truereport_by_dimension一定要开否则你只看到一个总分不知道模型是结构识别崩了还是机理推理崩了。数据集从 HuggingFace 拉仓库地址是UniParser/RxnBench论文在 arXiv 2512.23565GitHub 在uni-parser/RxnBench。环境变量这样设export TAOTOKEN_API_KEY你的Key export RxnBench_DATA_DIR./data/RxnBench如果你用 Python 脚本直接调核心请求长这样import os, base64, requests def encode_image(path): with open(path, rb) as f: return base64.b64encode(f.read()).decode() url https://taotoken.net/api/v1/chat/completions headers { Authorization: fBearer {os.environ[TAOTOKEN_API_KEY]}, Content-Type: application/json } payload { model: gemini-3-flash-preview, temperature: 0, messages: [{ role: user, content: [ {type: text, text: 根据反应图示回答该步骤中催化剂的作用是什么A... B... C... D...}, {type: image_url, image_url: {url: fdata:image/png;base64,{encode_image(rxn_001.png)}}} ] }] } resp requests.post(url, headersheaders, jsonpayload, timeout120) print(resp.json()[choices][0][message][content])这段代码就是 SF-QA 单题推理的最小闭环。你把它套进循环遍历 1525 个 QA 对把回答和标准答案比对就能得到单图问答的准确率。4. 跑通一次评测从单图问答到全文问答的验证请求先跑 SF-QA因为它快、反馈直接。把上面脚本包成run_sf_qa.py读settings.json逐题请求结果写进runs/sf_qa/results.jsonl。跑 20 题左右就能看出模型有没有基本的多模态理解能力。如果前 20 题准确率低于 60%先别急着跑全量去排错章节看图像编码和 prompt 格式。成功的结果长这样{ qid: sf_qa_0042, type: mechanism, pred: B, gold: B, correct: true, raw: 该步骤中催化剂通过配位活化羰基... }跑完 SF-QA 后切split到fd_qa。FD-QA 的请求体不一样它要把整篇 PDF 的文本和关键图像一起送进去而且选项可能多选。你的 payload 里content数组会包含多个文本块和多张图prompt 要明确写“本题为不定项选择可选 0 到 4 个选项无正确答案时选 NONE”。这一步 token 消耗大建议先拿 5 篇文献试确认模型不会因为上下文超限直接报错。验证通道是否真的通了最省事的办法是去模型对话页手动传一张反应图问一个结构识别问题。如果那边能答对说明 Key、模型名、多模态能力都没问题脚本报错就纯是代码问题。模型对话入口在 https://taotoken.net/chat?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。如果你打算长期跑评测、甚至把 RxnBench 接进自己的 Agent 做持续评估那按次调 API 不如用 Coding Plan 包周期入口在 https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。接入文档在 https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 里面写了 OpenAI 兼容接口的完整参数。5. 本篇常见错排查图像、选项、超限与评分第一个坑是图像编码。RxnBench 的图是 PDF 里裁出来的有些是 CMYK 色彩空间直接 base64 送进去模型可能读不出。先用 PIL 转成 RGB 再编码from PIL import Image img Image.open(path).convert(RGB) img.save(tmp_path, formatPNG)第二个坑是选项格式。SF-QA 是四选一但 FD-QA 允许不选。如果你在 FD-QA 里还按单选解析准确率会虚高。评分脚本要区分allow_multi_select和allow_no_answer多选漏选都算错。第三个坑是上下文超限。FD-QA 一篇文献的文本加图像很容易超过 128k token。解决办法是只送与问题相关的页面或者用 Uni-Parser 先做版面分析把反应图示和对应段落抽出来再送。别硬塞整篇 PDF。第四个坑是模型名写错。TaoToken 的模型名要和控制台里列出的完全一致大小写、连字符都不能差。报 404 先查模型名报 401 查 Key报 429 查额度。第五个坑是评分维度丢失。如果你只统计总准确率会误以为模型“还行”。按question_types分组统计后你会发现结构识别类题目准确率明显低一截这才是 RxnBench 想让你看到的推理极限。提示跑全量前先用--limit 50跑子集确认流程通了再放开。FD-QA 单篇成本高别一上来就全量。6. 把评测接进你的 AI 化学家工作流跑通一次 RxnBench 只是起点。真正有用的是把它变成你模型迭代的回归测试每次换模型、改 prompt、加工具调用都跑一遍 SF-QA 和 FD-QA 的子集看结构识别和跨页推理这两个短板有没有改善。TaoToken 的统一 Key 让你可以在同一套脚本里切换不同模型做对比不用为每家写适配层。API Key 在 https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 管理接入细节看 https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content 。如果你要搭的是长期运行的化学 AgentCoding Plan 的周期额度比按次调用更可控。先把 SF-QA 的 1525 题跑完拿到你当前模型的分维度报告再决定下一步是换模型还是补结构识别模块。
延伸阅读

更多相关文章

2026/9/26 10:44:58

用VScode做PPT:marp插件配TaoToken,Markdown一键出稿

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/26 11:50:01

沥青路面缺陷目标检测:LabelMe标注到YOLOv8训练全流程

简介:这套沥青路面缺陷目标检测数据集Part2分卷,面向需要训练道路缺陷检测模型的算法工程师与科研人员,旨在缓解道路养护领域标注数据稀缺、缺陷类别不均衡的突出问题。全量数据集包含6000张道路图像,本分卷含2000张图片对应的Lab…

2026/9/26 11:50:01

【赵渝强老师】崖山数据库的控制文件

崖山数据库的物理存储结构就是指的YashanDB数据库在硬盘上存储的各种文件,包括:数据文件、联机日志文件、控制文件、归档日志文件、参数文件、告警日志文件、跟踪文件和备份文件等。下面重点讨论一下崖山数据库的控制文件,视频讲解如下&#…

2026/9/26 11:50:01

yolov8本地cpu版本环境配置:TaoToken统一Key接入与config.toml骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/26 11:50:01

蓝牙音量控制的统一语言:VCP规范深度解析

在蓝牙音频设备普及的今天,你是否遇到过这样的困扰:手机连接蓝牙耳机时音量调节响应迟缓,切换到蓝牙音箱后音量记忆功能失效,甚至不同品牌设备间无法实现精细化的声道平衡控制?这些问题的根源,在于早期蓝牙…

2026/9/26 11:45:01

WIN10-2004下SafeNet/HASP加密狗驱动安装与签名问题排查指南

简介:SafeNet 加密狗驱动更新包聚焦 Windows 10 2004 系统下的兼容性修复,针对 HASP/Sentinel 加密狗旧驱动触发的蓝屏(BSOD)问题提供官方升级方案,适合企业 IT 管理员及依赖加密狗授权软件的终端用户。硬件加密狗作为…

2026/9/25 21:00:17

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/25 20:59:52

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/26 0:04:28

画质修复APP怎么选?Wink影像修复能力与产品实力解析

现如今手机拍摄场景愈发丰富,演唱会直拍、漫展记录、老视频翻新、日常vlog录制,都会遇到画面模糊、噪点多、曝光失衡等问题,不少用户在挑选工具时比较在意一款画质修复APP能够兼顾修复效果与自然质感。Wink作为美图公司推出的全球化AI影像增强…

2026/9/26 0:04:28

超低能耗建筑K值要求能否满足?浙东铝业建筑型材解析

核心摘要浙东铝业的超低能耗系统门窗产品,资料显示保温性能可达 K≤1.4W/(㎡K),能够对应上海地区超低能耗住宅对门窗保温性能的应用需求。判断建筑是否满足超低能耗要求,不能只看铝型材本身,还需要结合玻璃、隔热条、密封系统、开…

2026/9/25 20:55:38

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/25 18:41:36

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/25 18:34:56

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑