面试-在Math、LiveCodeBench、IFBench上的评测

发布时间:2026/9/12 20:46:02

面试-在Math、LiveCodeBench、IFBench上的评测 project-3:Faker-1-0.5B / MiniCPM5-2B 在 MATH-500 / LiveCodeBench v6 / IFBench 上的官方口径评测对象:Faker-1-0.5B(基座,Qwen2.5-0.5B 全参数复刻)+ MiniCPM5-2B(chat)。所有 prompt 与判分逻辑均为官方仓库逐行移植(硬编码),无自创口径;全部为确定性规则判分,不需要大模型 judge。统一口径(6 个脚本逐项核对一致)项口径依据解码greedy(do_sample=False,等价官方温度 0)IFBench 官方 README:生成用温度 0加载faker=fp16 基座直接续写;minicpm=bf16 + chat template +enable_thinking=False+ 过滤token_type_idsdemo-1 已验证路径;官方对思考模型即"多生成后剥离思考链",关链等价且为本机稳定路径生成长度max_new_tokens=1024(IFBench / MATH-500)、2000(LCB,官方--max_tokens默认值)官方默认停止符LCB=###(官方--stop默认);MATH-500 faker=Problem:(官方 minerva until);其余自然 EOS官方默认;另在文本层再截一次(官方 vllm stop 语义:输出不含停止符)批量batch=1 单流为基准口径;3 个支持--batch_size N(左 padding、pad=eos、greedy 不变,结果 json 记录 batch_size)PPU 批量路径历史不稳,batch=1 保底可回退断点续跑生成逐条落盘results/gen/*.jsonl,重跑只补缺;生成完毕则跳过模型加载、纯 CPU 判分—判分全部确定性规则(程序验证器 / 正则+sympy / 沙箱执行),无 LLM judge—一、IFBench 评估方法(300 题,指令遵循)官方来源:allenai/IFBench 仓库(commit 1c40f0c1)的ifbench/验证器包 +evaluation_lib.py;数据 allenai/IFBench_test。1. 数据与 prompt每条样本 ={prompt, instruction_id_list, kwargs}:prompt 是 WildChat 改写出的完整指令(约束文字已嵌在 prompt 里),instruction_id_list是该 prompt 附带的 1~3 个可验证约束 id(如keywords:existence、count:word_count_range),kwargs是各约束的参数(如{"keywords": ["cat","dog"]})。prompt 原样输入:faker 直接续写;minicpm 作为单条 user 消息(官方 generate_responses 的 chat 用法)。共 300 条,25 类经典 IFEval 约束 + 58 类 OOD 约束。2. 判分流程(逐条 prompt)对每条 prompt: 对其每个约束 (instruction_id, kwargs): 1. checker = INSTRUCTION_DICT[instruction_id](instruction_id) # 83 个官方验证器类 2. checker.build_description(**kwargs) # 注入参数; parquet 空位为 null, 先过滤
延伸阅读

更多相关文章

2026/9/12 20:46:02

PFC中的二极管反向恢复电流

摘要:本文以爆闪灯产品开发为背景,介绍 PFC 与 APFC 的基本原理。文章先说明 PFC 用于改善电源输入端的功率因数,再介绍 APFC 通过主动控制开关管使输入电流跟踪电压波形,将功率因数提升到 0.95 以上;随后结合 UCC2818…

2026/9/12 21:36:05

iOS: RunLoop入门

文章目录RunLoopRunLoop 和 线程的关系为什么 RunLoop 能让线程休眠RunLoop Mode (运行模式)Timer 在滚动的时候会失效NSRunLoopCommonModesRunLoop 的 SourceTimerObserverRunLoop 一次完整运行过程RunLoop 和 线程保活为什么必须要有 addPort?没有 addPort 的情况…

2026/9/12 21:36:05

BERT模型原理与实践指南:从架构到应用

1. BERT模型概述BERT(Bidirectional Encoder Representations from Transformers)是2018年由Google提出的革命性自然语言处理模型。作为首个真正实现双向上下文理解的预训练语言模型,它彻底改变了NLP领域的技术格局。我在实际项目中多次使用B…

2026/9/12 21:36:05

豌豆肉末:CookLikeHOC 蒸菜系列的标准化豌豆类小碗蒸配方拆解

豌豆肉末:CookLikeHOC 蒸菜系列的标准化豌豆类小碗蒸配方拆解 【免费下载链接】CookLikeHOC 🥢像老乡鸡🐔那样做饭。已添加2026年发布的《老乡鸡菜品溯源报告 2.0中新出现的菜品。主要部分于2024年完工,非老乡鸡官方仓库。文字来自…

2026/9/12 2:05:33

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/12 3:55:12

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/12 10:09:03

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/12 0:04:17

MATLAB仿生优化框架:长鼻浣熊算法多策略融合实现

简介:本资源是一份面向智能优化算法研究者与MATLAB初学者的仿生智能算法实践代码包,聚焦于长鼻浣熊优化算法(COA)的多策略改进与性能验证。针对传统COA易陷局部最优、收敛精度不足等问题,作者融合Circle映射初始化提升…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 JavaWeb 的校园一卡通管理系统的设计与实现 基于 JavaWeb 的校园卡业务管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 Java 的图书馆借阅管理平台的搭建与实现 基于 Java 的图书馆综合管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 6:29:36

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/12 14:32:17

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/12 6:37:43

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码