Palm-E 模型详解

发布时间:2026/10/9 5:34:47

Palm-E 模型详解 Palm-E 模型详解Palm-E基本信息项目内容全称Pathways Language to Action with Embodied机构Google DeepMind论文[Palm-E](https://palm-e.github.io/)架构Transformer (PaLM ViT)动作类型离散/连续 Token训练方式模仿学习 语言数据模型架构输入图像 ──→ ViT Encoder ──┐├──→ PaLM LLM ──→ 动作Token文本指令 ──→ Text Embed ────┤机器人状态 ──→ State Embed ──┘动作Token ──→ 映射 ──→ 连续动作核心思想Palm-E 是 Google 的具身多模态大模型•结合 PaLM 大语言模型•融入视觉和机器人状态•输出动作序列数据格式输入字段格式说明多视角图像[N, H, W, 3]多个相机文本指令字符串任务描述机器人状态向量关节角度等输出字段格式说明动作Token离散ID预测的动作核心公式1. 多模态输入融合$$x [\text{ViT}(I_1); ...; \text{ViT}(I_n); \text{Text}; \text{State}]$$2. LLM 生成动作$$P(a_{t1} | I, s, \text{instr}) \text{PaLM-E}(I, s, \text{instr})$$3. 动作解码$$a_{continuous} \text{ActionHead}^{-1}(a_{token})$$与 RT-2 的区别方面Palm-ERT-2LLMPaLMRT-2 自己的状态输入有无视觉编码ViTRT-2 自己优点1.多模态融合视觉 文本 状态2.LLM 能力推理能力强3.具身理解理解物理世界缺点1.动作精度离散 Token 有量化误差2.计算资源PaLM 参数量大3.Google 内部完整模型未公开使用场景核心场景场景说明**具身AI研究**学术研究语言-视觉-动作的融合**复杂推理任务**需要多步推理的操作任务**长期任务规划**复杂的多阶段任务**Google 生态**在 Google 技术栈上开发典型任务1. 复杂推理任务- 如果物体A在物体B上面就把它们一起放到C上面- 先打开盒子再把红色积木放进去- 按照从左到右的顺序排列物体2. 长期任务- 整理厨房先洗碗再擦台面最后归位- 布置餐桌先放盘子再放餐具- 清洁房间先收集杂物再擦拭表面3. 语义理解任务- 把最重的物体放到最低的架子上- 把容易碎的物品放到安全位置- 把所有圆形的东西放到一个组适用条件条件要求硬件高端机械臂 多相机计算TPU / 高端 GPU技术能力熟悉 Google 技术栈研发资源大规模模型训练能力与 RT-2 的选择条件推荐需要机器人状态输入Palm-E强调泛化能力RT-2计算资源有限RT-2学术研究用途两者皆可
延伸阅读

更多相关文章

2026/10/9 5:34:47

GitHub热榜深度拆解:从日榜捕捉技术趋势到建立项目筛选SOP

1. 为什么我每天都会花半小时刷一遍热榜:日榜的真实价值早上打开电脑,先不看邮件、不看IM,习惯性点开 GitHub Trending,刷一遍今天的日榜。这个习惯我保持了快五年,期间换过工作、跨过技术栈,但刷日榜这个动…

2026/10/9 5:34:47

【免Root】一款适用于Android安卓手机的网络渗透测试工具(汉化版)| 一台安卓手机,就是你的随身无线渗透测试工作站 - Stryker

📌 前言一、关于这个工具,先把一件事说清楚strykerapp 是它的官方原版仓库;stryker-backzh是它的中文汉化分支——同一个 App、同一个包名 com.zalexdev.stryker、同一套底层 chroot 运行环境,区别只在界面语言和安装资源的分发方…

2026/10/9 5:34:47

Web功能测试怎么测?从输入框到兼容性的完整实战清单

大家好,我是陪你系统复习的老周。 前面讲了测试基础认知、用例设计方法、缺陷管理,今天进入实战篇——Web 功能测试。很多刚入行的同学拿到一个页面不知道从哪下手测,东点一下西点一下,漏测一堆;已经入行的同学呢&…

2026/10/9 6:39:50

AI应用架构图解:从单模型到弹性伸缩的系统建模方法

1. 为什么“图解”是AI应用架构设计的第一道门槛我第一次在某高校实验室带学生做AI系统集成时,发现一个反直觉现象:90%的学员能熟练调用PyTorch训练模型,但当被要求画出“用户上传图片→后端接收→预处理→模型推理→结果返回前端”这整条链路…

2026/10/9 6:39:50

C# Emgu.CV模板匹配与行人检测实战指南

简介:本资源是一份面向C#开发者与计算机视觉初学者的实战项目包,聚焦人工智能基础应用落地,通过Emgu.CV实现模板匹配、行人检测与特征点识别等核心功能,适用于智能监控、图像检索、教学实验等场景。压缩包共35个文件,含…

2026/10/9 6:39:50

基于PyQt5与OpenCV的水果识别系统:源码解析与HSV调试实战

简介:这份基于PyQt5、OpenCV与Python实现的水果识别系统源码,完整包含GUI界面与详细代码注释,主要面向计算机相关专业学生及开发者。项目覆盖了图像采集、预处理、特征提取与识别等基础流程,可直接用于毕业设计、课程设计或大作业…

2026/10/9 6:39:50

JavaWeb医院挂号系统:Servlet+JDBC全流程实战

简介:本资源是一套完整可用的JavaWeb医院预约挂号管理系统毕业设计项目,面向计算机专业本科生及Java初学者,解决课程设计、期末大作业与毕业设计选题落地难的问题。压缩包共2000个文件,涵盖412个JavaScript前端交互脚本、446个CSS…

2026/10/9 6:34:50

v-model进阶用法:搞定复杂父子组件数据通信

v-model 的进阶用法:搞定复杂的父子组件数据通信前阵子接手一个后台管理系统,几十个表单和数据表格轮着改。最让我头疼的不是业务逻辑本身,而是那套复杂到让人怀疑人生的组件通信——每个弹窗都带着表单,表单里塞下拉、日期、级联…

2026/10/8 10:03:18

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/8 10:03:20

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/8 6:05:44

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 0:04:27

毕业论文初稿完成后首次进行AIGC疑似度自查的摸底与分流策略

毕业论文初稿完成后首次进行AIGC疑似度自查的摸底与分流策略当数万字的学位论文初稿经历开题、实验、问卷与多轮文献梳理最终成形时,绝大多数研究生都会面临一道全新的形式审查关卡:AIGC 疑似度排查。在高校毕业审核流程中,盲审前的文本检测通…

2026/10/9 0:04:27

食堂节能改造源头工厂,商用厨房设备焕新方案广受好评

商用厨房作为餐饮经营、单位供餐的核心后勤阵地,其设备配置、动线规划与运维体系直接决定后厨作业效率、运营成本与合规性。从基础的灶具、制冷存储设备,到油烟净化、水处理等配套系统,每一个环节的合理性都与食品安全、能耗管控、消防安全挂…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑