小模型为何能胜过大模型?Ornith-1.5-35B-A3B端到端自我改进训练原理全解析

发布时间:2026/10/11 3:16:50

小模型为何能胜过大模型?Ornith-1.5-35B-A3B端到端自我改进训练原理全解析 小模型为何能胜过大模型Ornith-1.5-35B-A3B端到端自我改进训练原理全解析【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3BOrnith-1.5-35B-A3B 是一款 35B 总参数、每 token 仅激活约 3B 参数的 MoE 小模型。它最大的亮点不是参数规模而是一套端到端自我改进训练体系模型自己生成任务、自己搭建解题脚手架、自己产出解答再用强化学习闭环迭代最终在编程与智能体基准上全面超过更大、更密的模型。什么是 Ornith-1.5-35B-A3B一句话定位Ornith-1.5-35B-A3B 是面向编程与智能体Agentic场景的推理型 MoE 语言模型。命名中的A3B表示 Activated 3B——35B 总参数里每个 token 只激活约 3B 参数推理成本低bf16 权重约 70 GB2 张 80GB 显卡即可部署。它是 Ornith-1.5 家族的中型成员Ornith-1.0 基于 Qwen3.5 与 Gemma4 做了继续预训练、中期训练和后训练1.5 则把自我改进从脚手架与轨迹优化扩展到全链路联合优化。原生支持 256K 上下文配合 YaRN 扩展可达约 1M token内置视觉与视频模块也支持工具调用与推理链think块。架构细节可查阅模型配置config.json40 层隐藏层、每层 256 个专家、每 token 激活 8 个专家并采用线性注意力 全注意力交错布局每 4 层 1 次全注意力这也是它能兼顾长上下文与推理效率的关键。小模型胜过大模型的第一个秘密MoE 架构 传统稠密大模型每次前向都要动用全部参数而 MoE混合专家模型像一家大型医院——256 位专家坐诊但每个 token 只分诊给 8 位最对口的专家。特性Ornith-1.5-35B-A3B传统 35B 稠密模型总参数量约 35B约 35B每 token 激活参数约 3B全部 35B单 token 推理开销≈ 1/10100%256K 长上下文原生支持通常更贵配合每 4 层 1 个全注意力层、其余为线性注意力的混合结构见config.json中的layer_types模型在长文本上的注意力成本进一步下降。参数多不等于算得动激活少 注意力省就是小模型能打赢大模型的第一块基石。核心原理端到端自我改进训练闭环 这才是本文的重头戏。过去训练会用工具的智能体任务和评测脚手架基本靠人工设计人出题、人写评测脚本、模型负责做。Ornith-1.5 把这个闭环整体交给模型自己完成任务自生成Task Generation模型持续生成新的训练任务替代固定的人工题集。题库随模型能力自动扩容永远刚刚好难避免学完就过时。脚手架自搭建Scaffold Construction解题用的脚手架harness——如何调用工具、组织多步执行、验证结果——也由模型自己发现和优化而不是沿用人工写死的评测脚本。解答轨迹自优化Rollout Optimization模型在生成的任务上实际执行、产出完整解答轨迹轨迹质量作为强化学习的奖励信号。三者联合优化任务更难 → 逼出更好的解题策略 → 更好的策略反过来生成更有价值的任务。这是一个出题—解题—评分全自主的飞轮模型在整个过程中持续通过强化学习更新策略即官方所称从 Self-Scaffolding 走向 Self-Improvement。对新手来说可以这样理解传统训练是老师带着学生刷题自我改进训练是让学生自己当老师——自己出题、自己批卷、自己进步而模型在编程这类开放任务上的进步速度远快于静态题库能提供的上限。成绩单3B 激活参数 vs 更大模型 Ornith-1.5-35B-A3B 在全部编程与智能体基准上超过同尺寸竞品并在智能体编程上大幅领先 Gemma 4-31B、Muse Glimmer-30B 等稠密模型完整数据见 README.md 中的评测表格基准Ornith-1.5-35B-A3BQwen3.6-35B-A3BGemma-4-31B稠密SWE-bench Verified7973.452Terminal-Bench 2.167.852.542.1SWE-bench Pro59.649.535.7DeepSWE220—GPQA Diamond推理89.286.084.3几个值得注意的信号DeepSWE 上其他同尺寸模型几乎为 0它拿到 22——深度软件工程任务正是自我改进训练主攻的方向相比 1.0 版本SWE-bench Verified 75.6 → 79仅靠扩大自我改进闭环就带来明显提升甚至压过了参数多一个数量级的 Qwen3.5-397B 在多个智能体基准上的成绩——这回答了标题之问小模型靠每 token 更聪明的参数使用方式 更对口的自我改进训练取胜而不是单纯堆参数。如何快速上手 Ornith-1.5-35B-A3B 部署门槛并不高。以下是最小可用路径详细命令见 README.md准备 2 张 80GB 显卡安装 vLLM ≥ 0.19.1或 SGLang ≥ 0.5.9一条vllm serve ornith-ai/Ornith-1.5-35B-A3B命令起服务记得开启--enable-auto-tool-choice与--reasoning-parser qwen3工具调用会自动解析成 OpenAI 风格tool_calls推理链输出到reasoning_content字段任意 OpenAI 兼容客户端接入即可通用任务推荐temperature0.6, top_p0.95, top_k20见generation_config.json与 README 说明。作为智能体大脑它可直接对接 Ollama、OpenCode 等编程 CLI——ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF一行命令就能让本地终端 Agent 跑起来。模型权重按 16 个分片存放model-00001-of-00016.safetensors等分片索引在model.safetensors.index.json对话行为由chat_template.jinja定义复现官方评测时需按 README 提示调整模板以保证训练/推理一致。写在最后这套方法意味着什么 Ornith-1.5 给出的信号很明确下一代模型竞争的关键可能不是更大而是更会自我练习。当任务生成、脚手架构建、解答优化全部纳入同一强化学习闭环训练数据上限被彻底打开——静态数据集训练模型的上限是数据集自我改进训练模型的上限是它自己的想象力。对普通用户和开发者而言这意味着一台双卡工作站就能获得一个越用越懂你的编程智能体大脑对研究者而言Ornith-1.5 展示了从人工驱动到自主驱动的训练范式跃迁。Chirp Chirp! 【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/8 16:56:25

大气层整合包新手教程:3 步装机,emummc 虚拟系统一次跑通

大气层整合包新手教程:3 步装机,emummc 虚拟系统一次跑通 【免费下载链接】Atmosphere-stable 大气层整合包系统稳定版 项目地址: https://gitcode.com/gh_mirrors/at/Atmosphere-stable 想给 Switch 多开一份游戏存档,或给大型游戏提…

2026/10/11 5:02:42

国产CAD软件哪个上手快?应届生适配参考

刚接触CAD的新手,打开软件后常面对这样的场景:工具栏、命令行、图层管理器都在眼前,却不知道先点哪个;想画一条直线,找不到命令入口;看到别人的图纸里图层、标注、块井井有条,自己却不知道从何建…

2026/10/11 5:02:42

MindSpore并行训练Loss剧烈波动?梯度同步排查指南

做MindSpore并行训练的小伙伴丢给我一段运行日志,日志里别的都正常,唯独Loss曲线刺眼:10个step里,从0.25抖到1.56,来回跳,就像踩了弹簧。这种波动绝对不是正常训练该有的样子——如果你也在MindSpore并行训…

2026/10/11 5:02:42

为Claude Code接入Google搜索MCP:破解AI知识过期问题的实战指南

最近一个月我几乎每天都要在 Claude Code 里处理代码任务,最难受的不是模型理解不了需求,而是它的知识停在某个训练截止日期之前——遇到新发布的框架版本、刚出现的报错、昨天才更新的文档,它只能靠猜。试了几种思路之后,我最终把…

2026/10/11 5:02:42

GitHub Issue智能分诊系统:构建人机协同的开源协作过滤网

1. 为什么 Issue 分诊是开发者团队里最沉默的“时间黑洞”你有没有过这样的经历:周一早上打开 GitHub,收件箱里躺着 27 条新 Issue——其中 8 条是用户把 README 拉到底都没点开就直接问“怎么安装”;5 条是复制粘贴了报错日志但没附任何复现…

2026/10/11 5:02:42

YOLO26涨点改进 | 独家创新,特殊场景检测篇 | TGRS 2025 | 引入FAENet特征自适应增强网络、频域分层自适应修复、专项攻克低光/雾天/雨雪/沙尘复杂退化、恶劣天气特征自适应还原增

目录 一、研究背景与YOLO26恶劣场景检测核心缺陷 二、FAENet特征自适应增强网络核心创新原理 2.1 FAENet五大核心单元架构详解 2.1.1 多尺度频域分层分解单元(基础核心) 2.1.2 场景自适应判别单元(核心创新) 2.1.3 低频全局修复单元(RFEM) 2.1.4 高频细节补强单元…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑