10B规模最强空间推理VLM:ZDTaichu5.0-9B凭什么在ViewSpatial、MindCube榜单登顶

发布时间:2026/10/4 13:26:40

10B规模最强空间推理VLM:ZDTaichu5.0-9B凭什么在ViewSpatial、MindCube榜单登顶 10B规模最强空间推理VLMZDTaichu5.0-9B凭什么在ViewSpatial、MindCube榜单登顶【免费下载链接】ZDTaichu5.0-9B项目地址: https://gitcode.com/gh_mirrors/zd/ZDTaichu5.0-9BZDTaichu5.0-9B 是一个面向通用视觉理解、空间推理与具身智能的多模态基础模型VLM结合 Qwen3.5-9B 语言骨干与 C-RADIOv4-H 视觉编码器支持文本、图像和视频输入。在本发布对比的 10B 规模通用 VLM 中它以 62.50 分登顶 ViewSpatial、以 78.27 分登顶 MindCube-tiny甚至超过 Gemini 3 Pro 与 GPT-5.2成为 10B 空间推理VLM中当之无愧的头部选手。为什么空间推理能力值得单独关注多数视觉语言模型认识物体但想不清物体基础感知判断左右、远近、遮挡关系复杂推理多视角关联、3D 场景理解、视角转换与心智变换比如想象自己站在对面看同一张桌子具身交互机器人要抓东西、避障碍依赖可供性affordance理解和空间规划。这类任务正是具身智能Embodied AI和 VLA视觉—语言—动作系统的底座。ZDTaichu5.0-9B 的卖点在于不牺牲通用视觉能力把空间、具身、Agent 三大能力叠满。空间推理榜单ZDTaichu5.0-9B 登顶多项评测先看官方基准测试的核心成绩对比对象包括开源与闭源旗舰模型能力维度基准测试ZDTaichu5.0-9BQwen3.5-9BGemini 3 ProGPT-5.2基础空间感知3DSRBench60.9656.7868.9260.20基础空间感知SparBench51.8250.7948.7444.76复杂空间推理ViewSpatial62.5048.2050.3647.30复杂空间推理MMSI-Bench47.2038.7045.2041.30复杂空间推理MindCube-tiny78.2757.6070.8760.38具身交互VSI-Bench59.6955.6852.5154.49具身交互ERQA48.0041.5066.0059.80几个关键看点ViewSpatial62.50与 MindCube-tiny78.27为全场最高领先第二名 10 分以上属于断崖式领先复杂空间推理四项ViewSpatial、MMSI-Bench、MindCube-tiny、VSI-Bench全部包揽最高分且多数领先 Gemini 3 Pro、GPT-5.2 等闭源旗舰 518 分通用视觉能力同样保持第一梯队MathVista Mini 84.5、OCRBench 85.5、AI2D 91.48说明它是全面型选手而非偏科生。下图是一个典型的空间推理题样例模型需要从两个视角的 3D 渲染图中推断几何体的俯视形状——这类多视角 心智变换正是 ViewSpatial 的核心考点。更多对比演示素材可在 docs/assets/demos/comparisons/ 目录中查看。凭什么强架构与熵门控自适应循环推理两大支柱支柱一Qwen3.5-9B 语言骨干 C-RADIOv4-H 视觉编码器语言侧继承 Qwen3.5-9B 的强推理与工具调用能力视觉侧采用 C-RADIOv4-H 编码器支持任意分辨率图像与视频输入9B 参数规模即可跑在单卡部署成本远低于闭源 API。支柱二EARR——只让难 token多算一会儿ZDTaichu5.0-9B 内置了熵门控自适应循环推理Entropy-Gated Adaptive Recurrent ReasoningEARR一次标准前向传播后模型用输出分布的熵衡量不确定性——低熵的 token 直接输出高熵的难 token则在潜空间里重复计算一个中间层块对隐藏表示做进一步细化最后由轨迹读出机制择优并支持回滚。可以理解为模型遇到简单的词秒答遇到空间关系这类难点会再想一想且思考发生在模型内部不需要额外发起外部调用。启用 EARR 后实测成绩进一步上涨基准测试基础版启用 EARRViewSpatial0.5410.5427MMSI-Bench0.3680.374MindCube-tiny0.74040.75RoboSpatial0.680.70实现代码见 recurrent_reasoning/recurrent_reasoning.py 与 recurrent_reasoning/modeling.py使用方式与超参数说明在 recurrent_reasoning/README_zh.md。从榜单到真实场景具身仿真与 Agent 能力分数之外ZDTaichu5.0-9B 在真实仿真场景中同样能打。下图是 LIBERO 仿真中的汤罐与奶酪入篮任务模型同时接入斜俯视、外部相机与腕部相机三路画面输出select_object等直接工具控制指令并完成抓取、放置、松爪撤退的完整闭环。在 Agent 任务上它在 TAU2-Bench87.7与 Claw-Eval71.4的对比中也是 10B 规模最强IFEval 达 93.7。下图展示其调用网络搜索、Bash 等工具自主求解阻尼振子轨迹的完整过程快速上手如何部署 ZDTaichu5.0-9B部署有 Docker 与源码两种方式官方推荐 Dockerdocker run -d \ --gpus all -p 18050:8000 \ registry-dx.wair.ac.cn/taichu-public/vllm-openai:v0.26.0.zdtaichu_5_0 \ TaichuAI/ZDTaichu5.0-9B --max-model-len 220000 --served-model-name zdtaichu服务启动后暴露 OpenAI 兼容接口/v1/chat/completions文本、图片、视频输入方式与主流 Chat 模型一致。几个实用提示空间推理与定位任务temperature 设为 0top_p 0.95、top_k 20其他任务temperature 1.0需要思考输出与工具调用时启动参数追加--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder。完整安装与调用示例见 README_zh.md。适合谁用具身智能研究者直接用它做 VLA 的空间感知与规划底座Agent 开发者多步工具调用 强指令遵循适合做复杂 Agent 的大脑自部署用户9B 规模单卡可跑OpenAI 兼容接口迁移成本低多模态应用团队文档、图表、OCR、视觉数学等通用任务不掉队。延伸资料完整模型介绍与基准测试README_zh.md中文/ README.md英文EARR 循环推理详解recurrent_reasoning/README_zh.md仿真演示素材docs/assets/simulation/模型权重协议LICENSENVIDIA 开放模型许可 Qwen3.5 Apache-2.0一句话总结10B 参数、单卡可跑、空间推理登顶、具身 Agent 全能——这就是 ZDTaichu5.0-9B 在 ViewSpatial 与 MindCube 登顶的底气。【免费下载链接】ZDTaichu5.0-9B项目地址: https://gitcode.com/gh_mirrors/zd/ZDTaichu5.0-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/4 13:26:40

COMSOL解的继承:多步仿真中初始条件传递的核心机制

1. 什么是“COMSOL解的继承”?它不是功能菜单里的按钮,而是你建模逻辑的生命线在COMSOL Multiphysics里,“解的继承”这四个字听起来像一个技术术语,但其实它描述的是一个非常具体、高频、且极易被新手忽略的操作行为——把前一个…

2026/10/4 13:26:40

Wind Excel插件与Python接口:债券估值数据批量自动化实战

做债券数据活的人,应该都有过这段经历:月初拿到一张几百行的持债清单,要求补全中债估值收益率、修正久期、票面利率、待偿期限,还得按主体评级筛一遍。最早我靠Wind终端一只一只点开,复制粘贴到Excel,做完差…

2026/10/4 13:26:40

插件系统本质:运行时契约与TypeScript SDK工程化实践

1. 插件系统不是“附加功能”,而是现代开发工具的神经中枢你打开 Cursor、VS Code、JetBrains IDE,甚至某些新一代终端或设计工具,第一眼看到的“扩展市场”“插件商店”界面,绝不是锦上添花的装饰——它是整套开发环境的可编程骨…

2026/10/4 14:21:42

Auto-Formulating Dynamic Programming Problems with Large Language Models

文章主要内容总结 本文聚焦于利用大型语言模型(LLMs)实现动态规划(DP)问题的自动建模,旨在解决传统DP建模依赖专家知识、现有LLM方法在DP任务中表现不佳的问题。主要内容包括: 问题背景:DP作为运筹学中的核心方法,其建模涉及多阶段决策和随机过渡,且现实场景中的DP问…

2026/10/4 14:21:42

Bootstrap 5表格实战指南:响应式、状态色与Sass变量定制技巧

表格这玩意儿,在Bootstrap 5里看着简单,真正在项目里用顺手,其实没那么“无脑”。我见过不少团队,明明用了Bootstrap,表格最后还是自己写了一堆覆盖样式,代码丑、维护累,移动端一塌糊涂。这篇我…

2026/10/4 14:16:42

插件机制详解:从加载原理到 did not activate 报错排查实战

写了一天代码,晚上刷手机看到好几个人都在问同一件事。有人问 IAR 里的插件到底有什么用,有人贴出 Harness 启动时刷出的报错日志failed to load plugins web boot: 2 entries did not activate linxin666/dsh-p,还有人问 MusicFree 的插件装…

2026/10/4 0:01:02

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/4 0:01:02

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/4 1:01:05

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 0:01:02

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/4 0:01:02

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/4 1:01:05

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑