让机器人听懂人话并动手执行:openpi 的 VLA 模型完整上手指南

发布时间:2026/9/12 3:39:41

让机器人听懂人话并动手执行:openpi 的 VLA 模型完整上手指南 让机器人听懂人话并动手执行openpi 的 VLA 模型完整上手指南【免费下载链接】openpi项目地址: https://gitcode.com/GitHub_Trending/op/openpiopenpi 是 Physical Intelligence 团队开源的机器人 VLA视觉-语言-动作模型即看图听指令→出动作的那套模型工具包内置了用上万小时机器人数据预训练的基础检查点。它解决的核心难题是你不必从零攒数据、搭集群就能让一台机器人听懂把叉子捡起来这样的自然语言指令并真的把动作做出来。从想让它干活到真的干起来的痛点想象一下这个场景你手里有一台 ALOHA 或 DROID 平台想让它完成折叠毛巾、开容器这类桌面任务但手边没有任何现成模型自己训练又得先花数月采数据、再烧钱跑大规模预训练。这条路对绝大多数团队和实验室来说太贵也太慢。openpi 把预训练这一步拆掉了——它直接给出一批开箱即用的检查点你要么拿来直接推理要么在自己几十到几百条数据上做轻量微调就能得到一个能上手干活的策略。这也是它区别于只给论文不放开源权重那类工作最关键的一点。它是什么、又凭什么不一样一句话定位openpi 是一个基础模型 微调配方 部署管线三件套齐全的工具箱而不是单个模型文件。它的独特处有三处。第一同时提供基础检查点拿来微调和专家检查点拿来直接跑覆盖了我想改和我想用两条路线。第二同一套 API 既支持 JAX 也支持 PyTorch后者虽还在补齐 LoRA、FSDP 等特性但推理和 LIBERO 微调都已验证可用。第三它把模型推理与机器人本体解耦模型可以跑在另一台高显存服务器上通过 WebSocket 把动作流推回机器人让你不必在本机上折腾依赖。可以把整个 openpi 理解成一个已经读完上万小时操作视频的机器人老手你要做的只是带它认一认你手上的新任务。用最短路径把环境跑通仓库只提供了经过验证的 Ubuntu 22.04 环境其它操作系统暂不支持动手前先确认这一点。下面按克隆→装依赖→可选 Docker三步走每一步都标清目的。克隆仓库并同步子模块子模块里放着 ALOHA、LIBERO 等平台的第三方代码漏了它后面跑例子会直接缺文件所以克隆时必须带上--recurse-submodulesgit clone --recurse-submodules https://gitcode.com/GitHub_Trending/op/openpi.git # 已经克隆过、只是子模块没同步 git submodule update --init --recursive用 uv 装好 Python 依赖依赖由 uv 管理装好 uv 后执行下面两条。⚠️ 别漏掉GIT_LFS_SKIP_SMUDGE1它是正确拉取 LeRobot 这个 git 依赖所必需的环境变量漏了会卡住GIT_LFS_SKIP_SMUDGE1 uv sync GIT_LFS_SKIP_SMUDGE1 uv pip install -e .用 Docker 跳过配置地狱如果本机是裸环境、装 ROS 又容易污染系统官方更推荐 Docker 路线。装好 rootless 版 Docker 和 NVIDIA 容器工具链后Ubuntu 22.04 上还有现成脚本scripts/docker/install_docker_ubuntu22.sh一条命令就能起镜像docker compose -f scripts/docker/compose.yml up --build首次构建会比较久之后有缓存就快了。细节见 docs/docker.md。核心能力几行代码跑通一次推理装好环境后最有说服力的验证是调用一个预训练检查点。以下以 π₀.₅-DROID 为例核心逻辑只保留四行其余省略from openpi.training import config as _config from openpi.policies import policy_config from openpi.shared import download config _config.get_config(pi05_droid) # 选模型配置 checkpoint_dir download.maybe_download(gs://openpi-assets/checkpoints/pi05_droid) policy policy_config.create_trained_policy(config, checkpoint_dir) action_chunk policy.infer(example)[actions] # example 含图像与 prompt这里example是一个字典塞入外景相机、腕部相机的图像以及prompt: pick up the fork这样的文本指令infer返回一段(动作步长, 动作维度)的动作块。完整可交互示例在 examples/inference.ipynb。没有机器人也能空跑测试手上暂时没有真机时simple_client会生成随机观测去跑一遍推理专门用来确认链路通不通uv run examples/simple_client/main.py --env DROID # 终端 1客户端 uv run scripts/serve_policy.py --env DROID # 终端 2策略服务器启动远程策略服务器真正连机器人时模型通常跑在另一台 GPU 较强的机器上本体只装依赖极少的openpi-client去查询它。服务器默认监听 8000 端口客户端只需WebsocketClientPolicy(host, port)建个连接、每若干步取一次动作块即可客户端与服务端如何对接的完整代码见 docs/remote_inference.md。想改模型微调的三条路想让自己的数据集上场openpi 以 LIBERO 为例给出了一套标准动作先把原始数据转成 LeRobot 数据集再定义处理与训练配置最后起服务器推理。转换脚本可以照着 examples/libero/convert_libero_data_to_lerobot.py 改成你自己的格式数据到模型的字段映射在 src/openpi/policies/libero_policy.py训练超参则集中在 src/openpi/training/config.py。真正开训前必须先算一次归一化统计量否则训练会直接报错uv run scripts/compute_norm_stats.py --config-name pi05_libero XLA_PYTHON_CLIENT_MEM_FRACTION0.9 uv run scripts/train.py pi05_libero --exp-namemy_experiment --overwrite uv run scripts/serve_policy.py policy:checkpoint --policy.configpi05_libero --policy.dircheckpoints/pi05_libero/my_experiment/20000如果走 PyTorch 路线先用 examples/convert_jax_model_to_pytorch.py 把 JAX 权重转成 PyTorch 格式再用scripts/train_pytorch.py起训。下一步该读什么想理解输入长什么样读 transforms.py想让数据归一化更稳参考 docs/norm_stats.md想在全量 DROID 上训通才模型翻 examples/droid/README_train.md。生态与资源导航平台示例DROID 推理、ALOHA 真机、LIBERO 微调、UR5部署文档远程推理、Docker 安装、归一化统计客户端 SDKpackages/openpi-client/贡献与提交规范CONTRIBUTING.md问题反馈在仓库 issue 区提交附复现步骤与显存型号维护者会先查 README 的故障表再处理常见问题openpi 支持哪些机器人平台官方给出了 DROID、ALOHA、UR5 以及 LIBERO 仿真环境的完整推理与微调示例。这些专家检查点是在较常见的平台上微调出来的迁移到你自己的装置不保证成功官方在 README 里也明确提示可能不一定 work。π₀ 模型推理和微调各需要多大显存按官方单卡估算推理 8GBRTX 4090 即可、LoRA 微调 22.5GB、全参微调 70GB需 A100/H100。多卡可通过训练配置里的fsdp_devices分摊显存但当前训练脚本尚不支持多节点。没有 NVIDIA GPU 能跑吗不能仓库只测试并支持 NVIDIA GPU 环境且操作系统限定为 Ubuntu 22.04。装 CUDA 库时不必在系统层单独装它们会随 uv 依赖一起进入虚拟环境。PyTorch 版本现在缺哪些功能PyTorch 版已支持 π₀ 与 π₀.₅ 的推理和微调在 LIBERO 上验证但暂不支持 π₀-FAST、混合精度、FSDP、LoRA 训练以及训练期 EMA 权重部分能力后续可能补齐。【免费下载链接】openpi项目地址: https://gitcode.com/GitHub_Trending/op/openpi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/12 3:34:41

MATLAB通信仿真实战:OFDM与数字信号处理

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 3:34:41

程序员AI语音输入法:重构技术文档工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 4:29:47

PyMC 采样与推断方法实战指南:MCMC、变分推断与诊断调优

PyMC 采样与推断方法实战指南:MCMC、变分推断与诊断调优 【免费下载链接】scientific-agent-skills Turn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills…

2026/9/12 4:29:47

bd recall 命令深度指南:用 Beads 按 key 检索持久记忆

bd recall 命令深度指南&#xff1a;用 Beads 按 key 检索持久记忆 【免费下载链接】beads Beads - A memory upgrade for your coding agent 项目地址: https://gitcode.com/GitHub_Trending/beads1/beads 导读 bd recall <key> 是 Beads 持久记忆体系&#xff…

2026/9/12 4:29:46

ToF相机全链路解析:从光子到点云的硬件-驱动-应用协同

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 4:29:46

风光储并网系统Simulink建模与协同控制策略

1. 项目背景与核心价值风光储并网系统作为新能源电力领域的重要研究方向&#xff0c;其仿真建模对实际工程应用具有关键指导意义。这个Simulink模型研究项目聚焦永磁风机、光伏阵列与储能系统的协同运行机制&#xff0c;正是当前微电网和智能电网技术发展的前沿课题。在实际工程…

2026/9/12 2:05:33

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊&#xff01;#雷神 #复联”这类调侃式短标题&#xff0c;第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里&#xff0c;但细想一下就能发现&#xff0c;它真正碰到的根本不是…

2026/9/12 3:55:12

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊&#xff0c;可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”&#xff0c;你会发现&#xff0c;这场比较本质上是两个不同 IP 策略的长期结果对比&#xff1a;超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介&#xff1a;本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案&#xff0c;聚焦调制信号自动检测与识别这一典型无线通信任务&#xff0c;解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件&#xff08;10.73MB&#xff09;&…

2026/9/12 0:04:17

MATLAB仿生优化框架:长鼻浣熊算法多策略融合实现

简介&#xff1a;本资源是一份面向智能优化算法研究者与MATLAB初学者的仿生智能算法实践代码包&#xff0c;聚焦于长鼻浣熊优化算法&#xff08;COA&#xff09;的多策略改进与性能验证。针对传统COA易陷局部最优、收敛精度不足等问题&#xff0c;作者融合Circle映射初始化提升…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 JavaWeb 的校园一卡通管理系统的设计与实现 基于 JavaWeb 的校园卡业务管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍&#xff1a;✌️码农一枚 &#xff0c;专注于大学生项目实战开发、讲解和毕业&#x1f6a2;文撰写修改等。全栈领域优质创作者&#xff0c;博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围&#xff1a;&am…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 Java 的图书馆借阅管理平台的搭建与实现 基于 Java 的图书馆综合管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍&#xff1a;✌️码农一枚 &#xff0c;专注于大学生项目实战开发、讲解和毕业&#x1f6a2;文撰写修改等。全栈领域优质创作者&#xff0c;博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围&#xff1a;&am…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行&#xff0c;Type-C接口算是典型的“看着简单&#xff0c;做起来全坑”的东西。光引脚就24个&#xff0c;高低速信号、电源、控制线全部塞在一个小小的连接器里&#xff0c;如果PCB布局不做规划&#xff0c;打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码