在 Jetson 上部署 AI 模型:能运行什么以及如何运行
本页回答在 NVIDIA Jetson 上运行 AI 模型时最常见的问题——LLM、视觉语言模型、生成式模型、具身/VLA 模型、语音和计算机视觉:
- 我的设备可以运行多大(以 B、十亿参数计)的模型?
- 我可以部署哪些模型?
- 我该如何部署它们?
三种部署方式:
- 在线平台(推荐): 从 reComputer AI Lab 浏览并部署——为 reComputer Jetson 优化的 100+ CV / LLM / VLM 模型,支持一键 Docker 部署和基准测试。在页面上选择一个模型,复制命令并运行即可。
- 一键命令行: jetson-examples —
reComputer run <model>。 - 手动: 你自行选择引擎(Ollama、llama.cpp、MLC、TensorRT Edge-LLM、TensorRT-Model-Connect),并按照下方列出的教程操作。
1. 我的设备可以运行多大模型?
“模型大小”用 B(十亿参数) 表示——一个 7B 模型有 70 亿参数,B 数越大,需要的内存越多。关键是你的 Jetson 模块的统一内存(是模块,而不是载板)。对于一个**量化(Q4_K_M)**模型:
8 GB · Orin Nano
1B – 4B 模型
Llama 3.2 1B/3B、Qwen3.5-4B、Gemma4 E4B、Live VLM WebUI
16 GB · Orin NX
7B – 8B 模型
Llama3 8B、DeepSeek-R1 7B、Llama2-7B(MLC)、LLaVA 7B、LocateAnything
32 GB · AGX Orin
最高可达 27B(量化)
Qwen3.5-27B Q4_K_M(见下方 JetPack 6.2 与 7.2 的基准对比)
64 GB · AGX Orin
30B – 35B+
Nemotron-3-Nano-30B(Q4_K_M)、Qwen3.6-35B(UD-Q6_K)、GPT-OSS
128 GB · Jetson Thor
35B+ 及更大
Nemotron3 33B、JoyAI VLM / ASR / TTS 栈
内存使用包括 KV 缓存和系统开销,因此权重几乎占满 RAM 的模型无法稳定运行。在 AGX Orin 32 GB 上实测,一个 Qwen3.5-27B Q4_K_M 模型在加载后使用了约 24.6 GB、而可用内存为 30 GB——这就是 32 GB 设备的现实上限。
2. 我可以部署哪些模型?
2.1 一键部署(jetson-examples)
安装一次,然后用一条命令运行任意受支持的模型:
sudo apt install python3-pip
pip3 install jetson-examples
Qwen 系列
reComputer run qwen3.5-4breComputer run qwen3.6-35bLlama 家族
reComputer run llama3reComputer run llama3.2reComputer run llavaGemma 家族
reComputer run gemma4NVIDIA 模型(64 GB)
reComputer run nemotron-3-nanoreComputer run gpt-ossVLM(视觉-语言)
reComputer run live-vlm-webuireComputer run locateanythingYOLO 与检测
reComputer run ultralytics-yoloreComputer run yolo11reComputer run yolo26reComputer run yolo26-tensorrtreComputer run yolov10reComputer run depth-anything-v2reComputer run depth-anything-v3reComputer run nanoowl工具链
reComputer run ollamareComputer run whisperreComputer run llama-factory注意: 上述大小针对所示量化配置。更高精度(Q8 / FP16)会使权重大小大约翻倍或更多。每个示例还需要足够的可用磁盘空间(镜像 + 模型)——LLaVA FP16 总共大约需要 27.4 GB。请在 jetson-examples README 中查看示例列表以获取精确的镜像大小。
2.2 手动部署:完整教程索引
下面每个类别都链接到本 wiki 上的完整教程。选择与你任务匹配的教程,并在设备上按步骤操作。
引擎一览
简单易用的部署
Q4 量化
GGUF,完全可控
生产环境 · JP 6.2
设备端构建 · JP 7.2
1. 通用 LLM
显存估算: 可靠 — params × bits/8 + KV cache + system。Q4:7B ≈ 4-5 GB,27B ≈ 15-18 GB。
2. VLM(视觉-语言)
显存估算: 粗略 — LLM 部分 + 视觉编码器(0.3-4B)+ 输入分辨率/切片。更高分辨率会以非线性方式增加显存占用。
- 在 reComputer 上运行 VLM
- 实时 VLM WebUI 7 个 VLM · 实时
- JoyAI-VL-Interaction Thor · 语音/视频
- 带语音交互的 VLM
- LLaVA 仓库守卫 Ollama llava-llama3 8B
- 零样本检测
3. 生成式与世界模型
显存预估:不能只看参数数量——DiT 的 patch/帧数、时序注意力、U-Net 与 DiT 以及 MoE 的差异,会在相同规模下让实际显存变化 3-5 倍。请在设备上实测。
- Stable Diffusion(文生图)
- ComfyUI
reComputer run comfyui - AudioCraft(音乐生成)
reComputer run audiocraft - Wan / 视频生成、世界模型——目前尚无经过验证的 Jetson 部署;显存必须按模型逐一实测
4. 具身智能 / VLA
显存预估:不能只看参数——视觉编码器 + 相机数量 + 控制频率 + 动作分块。请在设备上实测。
- GR00T N1.5 + LeRobot SO-101(Thor)
- GR00T N1.6 + LeRobot SO-101(AGX Orin)
- GR00T N1.7 + reBot 机械臂(J601)
- GraspNet 视觉抓取(reBot-DM)
- 通过 OpenClaw 控制 SO-Arm(Thor)
- 通过 NemoClaw 控制 reBot(Thor)
- Jetson-Claw 入门(8 GB)
- GR00T N1.7 全量 TensorRT(JP 7.2)
- 语音控制 reBot 机械臂 B601
- Microduck 强化学习(Jetson 上)
- Microduck 强化学习环境
- Microduck 强化学习官方策略
- Microduck 强化学习自定义动作
5. 语音(ASR / TTS)
显存预估:小模型——通常在 8 GB 上就没问题。Whisper/Riva 通常与 LLM 组成流水线一起运行。
6. 计算机视觉(YOLO 与检测)
显存预估:较小——YOLO 模型通常可以在 8 GB 上配合 TensorRT 运行,并随输入分辨率扩展。请参见 2.1 小节中的一键命令列表。
3. 我该如何部署?
AI Lab(在线平台)
- 打开 reComputer AI Lab Models(已预先筛选 Jetson)
- 按设备筛选(例如 Jetson Orin Nano),并浏览带有基准测试的 CV / LLM / VLM 模型
- 复制一键 Docker 命令并在你的设备上运行
100+ 已优化模型,无需配置,包含基准测试数据。
一键命令行工具(CLI)
安装 jetson-examples,然后从 2.1 小节部署任意模型:
sudo apt install python3-pip
pip3 install jetson-examples
# Deploy a model (example)
reComputer run qwen3.5-4b暴露一个兼容 OpenAI 的 API 端点,可直接通过 curl 或任意 OpenAI SDK 使用。
手动部署
从 2.2 小节选择一个引擎,并在你的设备上按照其教程操作:
- Ollama — 最简单的入门方式,拥有大型模型库
- MLC LLM — 量化(Q4)编译模型
- llama.cpp — 轻量级、GGUF、完全可控
- TensorRT Edge-LLM / Model-Connect — 生产级速度
所有教程都已在 reComputer Jetson 设备上验证。
4. 性能基准:JetPack 6.2 vs 7.2
相同的 Qwen3.5-27B Q4_K_M 模型(llama.cpp),在 AGX Orin 级别硬件上,JetPack 6.2 与 7.2 对比:
| 指标 | JetPack 6.2 | JetPack 7.2 | 变化 |
|---|---|---|---|
| 模型加载后内存占用 | 24.6 GB / 30 GB | 14.7 GB / 30 GB | 约降低 40% |
| 推理时 GPU 频率 | 930 MHz | 1.36 GHz | 更高的加速频率 |
| Prompt 处理速度 | 18.2 tok/s | 25.8 tok/s | 约快 41.8% |
| Token 生成速度 | 4.3 tok/s | 5.5 tok/s | 约快 27.9% |
详情:JetPack 7.2 深度解析。
5. 常见问题(FAQ)
我的模型对单个设备来说太大了——我该怎么办?
- 使用更小的量化等级(用 Q4_K_M 替代 Q8/FP16)。
- 限制上下文长度(
--max-sequence-length)以缩小 KV 缓存。 - 通过 llama.cpp RPC 在多个 reComputer 设备之间分布式推理(教程)。
我需要云端 GPU 吗?
不需要。上述所有内容都完全在本地设备上运行。数据保留在边缘侧,也没有持续的 API 费用。
更多资源
面向 reComputer-Jetson 的 GenAI 主题概览
数据集 → 训练 → 导出 → 部署
故障排查与使用相关问题
一键部署示例仓库
技术支持与产品讨论
感谢你选择我们的产品!我们将为你提供多种支持,确保你在使用我们产品的过程中尽可能顺畅。我们提供多种沟通渠道,以满足不同的偏好和需求。