GPT-6 Astra测评成绩亮眼,大模型与具身模型结合或成具身智能发展方向

发布时间:2026/9/17 20:35:34

GPT-6 Astra测评成绩亮眼,大模型与具身模型结合或成具身智能发展方向 什么是引发具身智能圈震动的测评报告近日一份发表在GitHub上匿名的仿真测评报告在具身智能圈引起了巨大反响。混合GPT-6 Astra的架构获得62.6分而第二名仅38.26分存在64%的性能差距这无疑是架构层面的降维打击。研究并未用GPT-6 Astra直接操控机械臂而是采用了更巧妙的方法用GPT-6 Astra提供语义层面的判断与修正与π₀.₅的物理空间交互及动作先验形成互补架构。这份测评是如何开展的该报告的撰写者是银河通用团队的研究员第一作者是银河通用创始人兼CTO王鹤教授的博士生。这并非随意的演示而是一套严格对齐的闭环控制对比实验。研究运用两种用于仿真双臂操作的闭环控制架构进行分析Direct模式下不运行π0.5GPT-6 Astra直接查看三路相机画面和机器人状态输出双臂末端位姿和夹爪开合每次执行1到5个控制步混合模式中每个决策时刻π0.5先生成50步候选动作GPT-6 Astra查看同一份画面、执行历史以及候选动作对应的双臂轨迹然后二选一要么沿用π0.5的前1到15步要么自己给出1到5步末端位姿修正完成这一段后再根据新画面重新决定。这种“候选动作挑选”的TopK思路在业内交流中已多次被讨论但真正跑出量级差异的这还是首次。结果显示混合模式取得了48%的成功率和62.60的平均分平均分甚至大幅超出第二名64%。RoboDojo实验有何结果在RoboDojo实验中团队选取了10类复杂机器人操作任务包括整理桌面、根据语言分类物体、排序数字、装箱、搭塔、麻将杠牌、叠衣服和瓶子入桶等每个任务进行5次测试共50次。实验设置了两种方案一种是GPT-6 Astra Direct由Astra直接根据视觉、本体状态和任务目标生成机器人动作另一种是π0.5Astra由机器人VLA模型π0.5提供动作Astra观察环境和候选动作并在必要时进行修正。结果差异显著Astra Direct在50次任务中成功13次成功率为26%48个具有完整原生评分的任务平均得分为37.81接入π0.5后成功次数提高到24次成功率达到48%平均得分升至62.60。值得注意的是Astra只修改了全部执行控制步骤中的14.4%这表明大部分动作仍由π0.5完成Astra主要在关键节点负责理解任务、判断当前状态以及决定是否需要修正。这组实验表明两类模型具有明显的互补性。Astra擅长语义理解、视觉识别、空间关系判断和任务规划在“物体分类”等任务中Astra Direct甚至取得100分面对抓取失败、物体遗漏或环境发生变化它还能重新观察现场再决定下一步行动。然而在搭塔、麻将杠牌等需要精细接触、稳定抓取和连续控制的任务中大模型的短板迅速暴露Astra Direct在搭塔任务中平均只有12分麻将杠牌为0分模型虽能知道木块应放的位置却未必能稳定控制落点、摩擦和碰撞。加入π0.5之后搭塔从12分提高到64分麻将杠牌从0提高到40叠衣服和瓶子入桶等任务也明显改善。这说明大模型已能进入机器人策略层但对物理世界的理解和操作仍是不同的能力。RoboLab实验展示了什么RoboLab实验进一步展示了Astra在另一类任务上的优势考察通用机器人策略对视觉、物体关系、任务指令和空间结构的理解。团队从中选取10类任务每类进行5次评测共50次包括将方块放入容器、在杂物中寻找并移动南瓜、按照指定顺序堆叠积木、调整杯子朝向以及把不同物体放入指定位置等。结果十分突出GPT-6 Astra Direct在50次实验中成功49次成功率98%Astraπ0.5完成46次成功率92%。作为参考同一组统计中的π0.5完成18次Cosmos3 - Nano - Policy完成18次DreamZero完成17次。尤其值得注意的是Astra没有针对这些具体任务额外训练模型根据当前画面、机器人状态和自然语言任务描述持续判断下一步该如何操作。从逐任务结果看Astra在多个任务中实现5次全部成功包括方块入箱、杂物中处理南瓜、按照关系摆放物体、按指定顺序堆叠、重新调整杯子方向等唯一没有全部成功的是“大号葡萄干盒放入容器”5次完成4次。这组实验展示出的核心能力是零样本泛化模型能够识别目标、理解空间关系将语言要求转化为动作并在环境变化后继续调整策略。不过这一数字需要结合实验口径理解报告明确说明RoboLab实验只选取了10个任务、每种方法每个任务5个最终评测槽位并非完整RoboLab排行榜复现历史基线与Astra也没有严格保证完全相同的初始状态和控制配置部分Astra实验包含授权重试。因此98%更适合用来观察Astra在这些任务上的能力上限不能简单作为严格同条件排行榜成绩。Astra究竟强在哪里回到RoboDojo的逐任务结果能进一步看清Astra的优势所在。在“物体分类”任务中Astra Direct得到100分5次全部成功“按语言分类”平均得分达到60成功率40%“排出最大数字”得分57。这些任务高度依赖语言理解、视觉识别、关系推理和目标规划恰好是大模型擅长的能力。实验中还出现了大量传统机器人策略较少展示的行为例如模型发现一次抓取姿态不理想后会主动改变接近方式物体大致摆好后它会重新观察环境发现任务实际上尚未完成并继续调整在装箱过程中它能够发现箱子后面还有遗漏物体当原计划执行受阻时也会根据新的视觉反馈重新规划。数字摆放任务中也有精彩的恢复表现模型在运动受阻后重新理解机械臂的控制反馈调整动作并继续执行展示了GPT-6 Astra对控制约束的局部适应能力而非被动地重复失败命令。这些现象说明Astra并非机械执行一条预先生成的轨迹而是形成了一个“观察—决策—执行—重新观察”的闭环模型甚至会主动选择一些训练数据中未必常见的策略例如在“瓶子入桶”任务中Astra Direct曾尝试不逐个抓取瓶子而是将瓶子扫向垃圾桶虽该方案最终失败但展示了模型能够根据目标自行寻找新的解决路径。Astra的弱点是什么研究报告也揭示了Astra的弱点。在“搭塔”任务中Astra Direct平均得分只有12成功率为0“麻将杠牌”得分为0这些任务要求精确接触、稳定抓取、碰撞控制以及对物体受力状态的持续判断相比语义和视觉任务大模型明显力不从心。一个典型问题是理解目标并不等于能够稳定完成动作模型可能知道木块应放的位置却无法保证放下时塔不会倒知道物体应进入容器也可能因夹爪与容器边缘发生碰撞导致失败。当前控制采用分段执行模型通常需等一个动作段结束后才能重新观察因此动作执行过程中发生的滑落、碰撞等问题有时直到下一轮反馈才被发现。这也是π0.5产生价值的地方加入π0.5后“搭塔”得分从12提高到64成功率达到60%“麻将杠牌”从0提高到40“叠衣服”从40提高到100“瓶子入桶”也从36提高到100。π0.5提供机器人动作数据训练形成的运动先验Astra则在更高层负责识别任务、判断进展和修正错误两者结合后一些单独依赖Astra难以完成的任务明显改善。研究还分析了一些在GPT-6 Astra模式下出现的有趣但不一定鲁棒或物理不可实现的情况由于缺少具身Policy提供的成熟动作与物体交互先验模型需要自行解决抓取、支撑、接触、释放及双臂协调中的细节一些看似合理且有趣的方案在实际执行时并不稳定。例如GPT-6 Astradirect会尝试用机械臂把瓶子扫进桶、单手抓取搭塔板或以单臂完成原本适合双臂协作的操作这些都是对同一目标的不同实现方式而非单纯的任务理解错误。问题在于提出一种可能有效的操作与稳定地执行该操作是两个不同层次的能力缺少成熟动作先验的支撑时方案可能忽略可靠的抓取姿态、足够的支撑或适当的释放时机使局部可行的动作难以转化为稳定的任务完成。具身Policy的价值不只在于提供一个动作答案还在于提供经过交互经验形成的执行模式让语义层面的方案建立在更可靠的操作基础上。当前方案存在哪些问题报告同时强调当前方案距离真正部署仍有明显距离。首先是推理成本RoboDojo实验中π0.5Astra累计消耗约6.25亿TokenAstra Direct则超过11.3亿TokenAstra需要反复读取视觉和历史上下文并进行较长推理这与机器人需要的低延迟、高频控制存在天然矛盾。其次当前实验主要发生在仿真环境中真实世界还会增加相机噪声、机械误差、延迟、摩擦力变化以及安全约束。因此这份报告更接近一次能力边界测试即在暂时不严格限制Token、时间和推理成本的条件下大模型究竟能把机器人控制推进到什么程度。从报告中能得出什么结论从这份报告最终来看可以得到两个关键结论。第一大规模训练带来的泛化能力正在具身任务中展现出明显优势。GPT-6 Astra在语义理解、视觉感知和任务规划等“认知层”任务上大幅抬高了端到端具身模型的能力上限。RoboLab中Astra直接控制机器人取得49/50的结果说明通用模型通过大规模预训练获得的能力已经能够迁移到机器人决策环节这也验证了王鹤教授此前的判断随着数据规模扩大模型能够获得更强的语义理解和视觉泛化能力过去在语言和视觉模型中被反复验证的Scaling Law正在向具身智能延伸。第二认知泛化能力再强也无法自动解决物理世界中的精细操作问题。在搭塔、麻将杠牌等高度依赖接触稳定性和精细控制的任务中Astra Direct的得分只有12和0模型可以理解目标却未必能稳定处理摩擦、碰撞、夹爪状态和连续接触。π0.5的价值正在这里体现加入π0.5后搭塔得分从12提高到64杠牌从0提高到40叠衣服、瓶子入桶等任务也明显改善机器人交互数据训练出的动作先验仍然是大模型无法直接替代的能力。但π0.5自身也受到数据规模和任务覆盖范围的限制在RoboLab中π0.5单独zero - shot成功率只有36%与Astra组合后达到92%仍低于Astra Direct的98%这说明动作模型如果缺乏足够的泛化能力也可能成为整个系统的约束。GPT-6 Astraπ0.5未必是最终形态但这份报告已经让一条路径变得更清楚通用模型扩大认知和泛化边界具身模型补足动作与物理交互能力。无论是语义泛化还是物理交互其能力根源都是数据数据规模越大、质量越高模型的能力边界就越宽随着数据与算力的进一步放大或许才能真正期待具身智能价值的释放。中国具身智能面临什么问题GPT-6 Astra带来的压力让国内具身产业面临一个更现实的问题OpenAI已购买上千万小时类具身数据在具身模型上投入超百亿人民币的数据与算力资源超过中国任何一家具身公司剑指“具身ChatGPT”。压力之下中国必须扩大数据和算力投入。GPT-6 Astra成功率虽高但轨迹质量一般软硬件不一体模型太大、部署几乎不可能、成本极高这说明它的路线也还不完美。但现有的能力已经验证了大规模数据大规模算力正在攻入机器人技术腹地。中国制造业、物流、零售等领域拥有大量机器人应用环境也具备完整的硬件供应链。但场景不等于优势只有把现场问题变成数据把数据送进训练再把模型放回真实环境验证形成闭环场景才能变成模型能力这个闭环的燃料就是数据和算力。中国很难复制前沿模型公司的每一轮资源投入但拥有更密集的真实应用场景和完整产业链接下来真正决定竞争结果的是能否把这些场景持续转化成高质量数据再把数据转化成模型能力。
延伸阅读

更多相关文章

2026/9/17 20:35:34

三菱FX2N顺序控制与机械臂大小球分拣步进编程

简介:本资源为一套面向自动化、机电一体化专业学生及PLC初学者的课程设计与毕业设计参考文档,围绕三菱FX2N系列PLC实现大小球自动分拣展开,解决机械臂上下左右移动与抓取释放动作的编程控制问题,适合作为课程设计模板、答辩备查材…

2026/9/17 20:30:34

城市智慧排水信息化管控平台建设:从感知接入到内涝预警联动

简介:这份PPT资源面向城市水务管理、市政信息化建设及智慧城市解决方案从业人员,围绕城市智慧排水信息化管控平台的建设方案展开。内容涵盖平台建设目标与意义、核心技术选型、主要功能设计与实施路径等模块,可帮助读者理解如何借助物联网、3…

2026/9/17 21:25:42

激光技术课件自动化:python-pptx、M²拟合与交付自检

简介:这份《专题一 激光技术.ppt》面向物理、光电信息、电子工程等专业的学生与初入激光领域的自学者,用于系统梳理激光原理与技术脉络。课件从爱因斯坦1916年提出受激辐射讲起,串联汤斯与肖洛的经典论文、梅曼的红宝石激光器、He-Ne气体激光…

2026/9/17 21:20:41

Agent技能体系实战:从碎片化工具到可复用技能包

近两年只要在搞大模型应用,基本绕不开一个词:Agent。而我在本地搭建并维护了一个叫agent-skills的项目之后,最大的感受是----大家平时聊 Agent 时都喜欢强调模型推理、记忆、规划,但真正让 Agent 从“聊天机器人”变成“能干活的人…

2026/9/16 12:52:37

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/17 0:03:13

WiFi密码安全测试:从原理到实战的字典暴力破解指南

1. 写在前面:我为什么要研究WiFi密码这件事先交代一下背景。我身边有不少朋友,家里的WiFi密码常年是"12345678"或者"88888888",问就是"好记"。直到有一次,隔壁邻居蹭网蹭到我家路由器后台都进不去&…

2026/9/17 0:03:13

redis-py服务控制与监控函数实战:从ping到slowlog的巡检指南

我用 redis-py 写了快五年的业务代码,坦白说,真正让我觉得这个客户端“像一个成熟工具箱”的,不是 get/set 那套基本操作,而是它那批专门做服务控制与状态监控的辅助函数。日常开发里,大家把redis.Redis(host..., deco…

2026/9/17 0:03:13

SpringBoot+Vue3实现中小企业设备管理系统开发实践

1. 项目概述与核心价值中小企业设备管理系统是制造业、服务业等领域的基础信息化工具。传统设备管理往往依赖Excel表格或纸质记录,存在数据孤岛、流程混乱、维护成本高等痛点。这套基于Java SpringBootVue3MyBatis的技术方案,通过前后端分离架构实现了设…

2026/9/16 22:55:57

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/16 22:56:09

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/16 22:56:16

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码