Skip to main content

在 Jetson 上部署 AI 模型:能运行什么以及如何运行

本页回答在 NVIDIA Jetson 上运行 AI 模型时最常见的问题——LLM、视觉语言模型、生成式模型、具身/VLA 模型、语音和计算机视觉:

  1. 我的设备可以运行多大(以 B、十亿参数计)的模型?
  2. 我可以部署哪些模型?
  3. 我该如何部署它们?

三种部署方式:

  • 在线平台(推荐): 从 reComputer AI Lab 浏览并部署——为 reComputer Jetson 优化的 100+ CV / LLM / VLM 模型,支持一键 Docker 部署和基准测试。在页面上选择一个模型,复制命令并运行即可。
  • 一键命令行: jetson-examples — reComputer run <model>。
  • 手动: 你自行选择引擎(Ollama、llama.cpp、MLC、TensorRT Edge-LLM、TensorRT-Model-Connect),并按照下方列出的教程操作。

1. 我的设备可以运行多大模型?​

“模型大小”用 B(十亿参数) 表示——一个 7B 模型有 70 亿参数,B 数越大,需要的内存越多。关键是你的 Jetson 模块的统一内存(是模块,而不是载板)。对于一个**量化(Q4_K_M)**模型:

8 GB · Orin Nano

1B – 4B 模型

Llama 3.2 1B/3B、Qwen3.5-4B、Gemma4 E4B、Live VLM WebUI

16 GB · Orin NX

7B – 8B 模型

Llama3 8B、DeepSeek-R1 7B、Llama2-7B(MLC)、LLaVA 7B、LocateAnything

32 GB · AGX Orin

最高可达 27B(量化)

Qwen3.5-27B Q4_K_M(见下方 JetPack 6.2 与 7.2 的基准对比)

64 GB · AGX Orin

30B – 35B+

Nemotron-3-Nano-30B(Q4_K_M)、Qwen3.6-35B(UD-Q6_K)、GPT-OSS

128 GB · Jetson Thor

35B+ 及更大

Nemotron3 33B、JoyAI VLM / ASR / TTS 栈

内存使用包括 KV 缓存和系统开销,因此权重几乎占满 RAM 的模型无法稳定运行。在 AGX Orin 32 GB 上实测,一个 Qwen3.5-27B Q4_K_M 模型在加载后使用了约 24.6 GB、而可用内存为 30 GB——这就是 32 GB 设备的现实上限。

2. 我可以部署哪些模型?​

2.1 一键部署(jetson-examples)​

安装一次,然后用一条命令运行任意受支持的模型:

sudo apt install python3-pip
pip3 install jetson-examples

Qwen 系列

Qwen3.5-4B约 2.5 GB(Q4_K_M)· Orin Nano 8 GB · JP 6.1/6.2/6.2.1
reComputer run qwen3.5-4b
Qwen3.6-35B约 24 GB+(UD-Q6_K)· AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run qwen3.6-35b

Llama 家族

Llama3 8B约 4.9 GB(Ollama Q4)· Orin NX 16 GB · JP 5.1.1-6.0
reComputer run llama3
Llama 3.2 1B/3B约 1.3 / 2.0 GB(Ollama Q4)· Orin Nano 8 GB · JP 5.1.1-6.x
reComputer run llama3.2
LLaVA 7B(VLM) 总计约 15 GB(FP16)· Orin NX 16 GB · JP 5.1.1-6.0
reComputer run llava

Gemma 家族

Gemma4 E4B约 2.5 GB(Q4_K_M)· Orin Nano 8 GB · JP 6.1/6.2/6.2.1
reComputer run gemma4

NVIDIA 模型(64 GB)

Nemotron-3-Nano-30B约 24.5 GB(Q4_K_M)· AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run nemotron-3-nano
GPT-OSS约 39 GB(Q4_K)· AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run gpt-oss

VLM(视觉-语言)

Live VLM WebUI7 个 VLM(Ollama Q4)· 最低 8 GB · JP 6.0-7.1
reComputer run live-vlm-webui
LocateAnything约 7.3 GB 权重(BF16)· Orin NX 16 GB · JP 6.x
reComputer run locateanything

YOLO 与检测

Ultralytics YOLO检测 / 分割 / 姿态 / 分类 · 8 GB + · JP 4.6-6.2
reComputer run ultralytics-yolo
YOLO11· 8 GB + · JP 5.1.1-6.x
reComputer run yolo11
YOLO26· 8 GB + · JP 5.1.1-7.1
reComputer run yolo26
YOLO26 TensorRT C++原生,无 Docker · JP 6.0-7.2
reComputer run yolo26-tensorrt
YOLOv10· 8 GB + · JP 5.1.1-6.0
reComputer run yolov10
Depth Anything V2单目深度 · 16 GB · JP 5.1.1-5.1.3
reComputer run depth-anything-v2
Depth Anything V3· 16 GB · JP 6.1-6.2.1
reComputer run depth-anything-v3
NanoOWL开放词汇检测 · 8 GB + · JP 5.1.1-6.x
reComputer run nanoowl

工具链

Ollama(任意模型) 大小取决于模型和量化(通常为 Q4)· 8 GB + · JP 5.1.1-6.x
reComputer run ollama
Whisper(STT) 大小取决于 Whisper 变体(small/base/large)· 8 GB + · JP 5.1.1-6.x
reComputer run whisper
Llama-Factory(微调) 训练占用取决于模型和 LoRA/QLoRA · 16 GB + · JP 5.1.1-5.1.3
reComputer run llama-factory

注意: 上述大小针对所示量化配置。更高精度(Q8 / FP16)会使权重大小大约翻倍或更多。每个示例还需要足够的可用磁盘空间(镜像 + 模型)——LLaVA FP16 总共大约需要 27.4 GB。请在 jetson-examples README 中查看示例列表以获取精确的镜像大小。

2.2 手动部署:完整教程索引​

下面每个类别都链接到本 wiki 上的完整教程。选择与你任务匹配的教程,并在设备上按步骤操作。

引擎一览

Ollama
简单易用的部署
MLC LLM
Q4 量化
llama.cpp
GGUF,完全可控
TensorRT Edge-LLM
生产环境 · JP 6.2
TensorRT-Model-Connect
设备端构建 · JP 7.2

2. VLM(视觉-语言)

显存估算: 粗略 — LLM 部分 + 视觉编码器(0.3-4B)+ 输入分辨率/切片。更高分辨率会以非线性方式增加显存占用。

3. 生成式与世界模型

显存预估:不能只看参数数量——DiT 的 patch/帧数、时序注意力、U-Net 与 DiT 以及 MoE 的差异,会在相同规模下让实际显存变化 3-5 倍。请在设备上实测。

5. 语音(ASR / TTS)

显存预估:小模型——通常在 8 GB 上就没问题。Whisper/Riva 通常与 LLM 组成流水线一起运行。

3. 我该如何部署?​

AI Lab(在线平台)

  1. 打开 reComputer AI Lab Models(已预先筛选 Jetson)
  2. 按设备筛选(例如 Jetson Orin Nano),并浏览带有基准测试的 CV / LLM / VLM 模型
  3. 复制一键 Docker 命令并在你的设备上运行

100+ 已优化模型,无需配置,包含基准测试数据。

一键命令行工具(CLI)

安装 jetson-examples,然后从 2.1 小节部署任意模型:

sudo apt install python3-pip
pip3 install jetson-examples

# Deploy a model (example)
reComputer run qwen3.5-4b

暴露一个兼容 OpenAI 的 API 端点,可直接通过 curl 或任意 OpenAI SDK 使用。

手动部署

从 2.2 小节选择一个引擎,并在你的设备上按照其教程操作:

  • Ollama — 最简单的入门方式,拥有大型模型库
  • MLC LLM — 量化(Q4)编译模型
  • llama.cpp — 轻量级、GGUF、完全可控
  • TensorRT Edge-LLM / Model-Connect — 生产级速度

所有教程都已在 reComputer Jetson 设备上验证。

4. 性能基准:JetPack 6.2 vs 7.2​

相同的 Qwen3.5-27B Q4_K_M 模型(llama.cpp),在 AGX Orin 级别硬件上,JetPack 6.2 与 7.2 对比:

指标JetPack 6.2JetPack 7.2变化
模型加载后内存占用24.6 GB / 30 GB14.7 GB / 30 GB约降低 40%
推理时 GPU 频率930 MHz1.36 GHz更高的加速频率
Prompt 处理速度18.2 tok/s25.8 tok/s约快 41.8%
Token 生成速度4.3 tok/s5.5 tok/s约快 27.9%

详情:JetPack 7.2 深度解析。

5. 常见问题(FAQ)​

我可以在 Jetson 上运行 DeepSeek 吗?

可以。DeepSeek-R1 7B 可以通过 Ollama 在 Orin NX 16 GB 设备上良好运行(教程);MLC 量化的 1.5B 变体在 Orin NX 上可达到约 60 tok/s(教程)。

我的模型对单个设备来说太大了——我该怎么办?

  • 使用更小的量化等级(用 Q4_K_M 替代 Q8/FP16)。
  • 限制上下文长度(--max-sequence-length)以缩小 KV 缓存。
  • 通过 llama.cpp RPC 在多个 reComputer 设备之间分布式推理(教程)。

我需要云端 GPU 吗?

不需要。上述所有内容都完全在本地设备上运行。数据保留在边缘侧,也没有持续的 API 费用。

更多资源​

生成式 AI 入门

面向 reComputer-Jetson 的 GenAI 主题概览

使用 Llama-Factory 进行微调

数据集 → 训练 → 导出 → 部署

Jetson 常见问题

故障排查与使用相关问题

jetson-examples

一键部署示例仓库

技术支持与产品讨论​

感谢你选择我们的产品!我们将为你提供多种支持,确保你在使用我们产品的过程中尽可能顺畅。我们提供多种沟通渠道,以满足不同的偏好和需求。

Loading Comments...