Jetson 上的 Microduck 强化学习

本演示在一台由 NVIDIA Jetson Orin NX 16GB 驱动的 Seeed reComputer 上,为 Microduck 构建了一套完整的机器人学习工作流。内容涵盖 GPU 环境部署、基于 MuJoCo 的 PPO 训练、本地检查点可视化、使用官方 ONNX 策略的键盘控制推理,以及新自定义动作的开发。
经验证的参考平台使用 JetPack 7.2、Ubuntu 24.04、CUDA 13.2、Python 3.12 和 MuJoCo 3.10。本教程基于 jjjadand/microduck_rl 仓库,该仓库包含本指南中使用的源代码、部署脚本、官方 ONNX 策略以及在 Jetson 上训练得到的检查点。
硬件选项
本教程在 Jetson Orin NX 16GB 上复现。以下 Seeed Studio 系统提供了适合跟随本工作流的 Jetson 平台。reComputer Classic J5011 提供了更高的 GPU 和内存容量,而实际训练吞吐量取决于所选功耗模式和并行环境数量。
选择章节
点击卡片打开对应章节。Physical AI 侧边栏中只列出此落地页;三个章节保持为从这里访问的聚焦页面。
01
部署环境
准备 JetPack 7.2,部署启用 CUDA 的 Python 环境,理解项目目录结构,并验证 GPU 训练。
打开章节 ➜
02
训练并运行官方动作
运行训练冒烟测试、可视化 PT 检查点、启动官方多策略 ONNX 演示,并通过键盘进行控制。
打开章节 ➜
03
创建自定义动作
选择任务模板,定义动作阶段和奖励,注册新任务,在 MuJoCo 中测试、训练,并导出 ONNX。
打开章节 ➜
你将复现的内容
- 在 Jetson Orin NX 上启用 CUDA 的 Microduck 训练环境。
- 使用并行 MuJoCo 环境的 PPO 训练。
- 原生和基于浏览器的仿真可视化。
- 针对行走、站立、坐/站、地面拾取、翻滚、踢腿和滚轮动作的官方 ONNX 推理。
- 键盘指令输入和实时行为切换。
- 一套可复用的工作流,用于创建如鞠躬等基于阶段的自定义动作。
演示架构
Jetson Orin NX
├── JetPack 7.2 / CUDA 13.2
├── uv project environment
├── mjlab + MuJoCo Warp + rsl_rl
├── Microduck task configurations
├── PPO checkpoint (.pt)
└── Exported policy (.onnx)
├── MuJoCo inference rehearsal
└── Microduck runtime deployment
tip
为了最快速地完成验证,请先部署环境,运行 64 个环境、5 次迭代的冒烟测试,然后启动官方的 ONNX 键盘演示。你可以在之后再完成自定义动作章节。

