Implantar modelos de IA no Jetson: o que pode rodar e como
Esta página aborda as perguntas que surgem com mais frequência ao executar modelos de IA no NVIDIA Jetson — LLMs, modelos visão-linguagem, modelos generativos, modelos incorporados/VLA, fala e visão computacional:
- Que tamanho de modelo (em B, bilhões de parâmetros) meu dispositivo pode rodar?
- Quais modelos posso implantar?
- Como faço para implantá-los?
Três maneiras de implantar:
- Plataforma online (recomendado): navegue e implante a partir do reComputer AI Lab — mais de 100 modelos otimizados de CV / LLM / VLM para reComputer Jetson com implantação via Docker em um comando e benchmarks. Escolha um modelo na página, copie o comando e execute.
- CLI com um comando: jetson-examples —
reComputer run <model>. - Manual: você escolhe o mecanismo (Ollama, llama.cpp, MLC, TensorRT Edge-LLM, TensorRT-Model-Connect) e segue os tutoriais listados abaixo.
1. Que tamanho de modelo meu dispositivo pode rodar?
"Tamanho de modelo" é expresso em B (bilhões de parâmetros) — um modelo 7B tem 7 bilhões de parâmetros, e números B maiores precisam de mais memória. O que importa é a memória unificada do seu módulo Jetson (o módulo, não a placa carrier). Para um modelo quantizado (Q4_K_M):
8 GB · Orin Nano
Modelos de 1B – 4B
Llama 3.2 1B/3B, Qwen3.5-4B, Gemma4 E4B, Live VLM WebUI
16 GB · Orin NX
Modelos de 7B – 8B
Llama3 8B, DeepSeek-R1 7B, Llama2-7B (MLC), LLaVA 7B, LocateAnything
32 GB · AGX Orin
até 27B (quantizado)
Qwen3.5-27B Q4_K_M (veja o benchmark JetPack 6.2 vs 7.2 abaixo)
64 GB · AGX Orin
30B – 35B+
Nemotron-3-Nano-30B (Q4_K_M), Qwen3.6-35B (UD-Q6_K), GPT-OSS
128 GB · Jetson Thor
35B+ e maiores
Nemotron3 33B, pilha JoyAI VLM / ASR / TTS
O uso de memória inclui o cache KV e a sobrecarga do sistema, então um modelo cujos pesos quase preenchem a RAM não rodará de forma estável. Medido em um AGX Orin 32 GB, um modelo Qwen3.5-27B Q4_K_M usou cerca de 24,6 GB dos 30 GB disponíveis após o carregamento — esse é um limite realista para dispositivos de 32 GB.
2. Quais modelos posso implantar?
2.1 Implantação com um comando (jetson-examples)
Instale uma vez e depois execute qualquer modelo compatível com um comando:
sudo apt install python3-pip
pip3 install jetson-examples
Série Qwen
reComputer run qwen3.5-4breComputer run qwen3.6-35bFamília Llama
reComputer run llama3reComputer run llama3.2reComputer run llavaFamília Gemma
reComputer run gemma4Modelos NVIDIA (64 GB)
reComputer run nemotron-3-nanoreComputer run gpt-ossVLM (Visão-Linguagem)
reComputer run live-vlm-webuireComputer run locateanythingYOLO & Detecção
reComputer run ultralytics-yoloreComputer run yolo11reComputer run yolo26reComputer run yolo26-tensorrtreComputer run yolov10reComputer run depth-anything-v2reComputer run depth-anything-v3reComputer run nanoowlFerramentas
reComputer run ollamareComputer run whisperreComputer run llama-factoryNota: os tamanhos acima são para a quantização mostrada. Maior precisão (Q8 / FP16) aproximadamente dobra ou mais o tamanho dos pesos. Cada exemplo também precisa de espaço livre suficiente em disco (imagem + modelo) — LLaVA FP16 precisa de cerca de 27,4 GB no total. Verifique a lista de exemplos no README do jetson-examples para tamanhos exatos das imagens.
2.2 Implantação manual: índice completo de tutoriais
Cada categoria abaixo aponta para um tutorial completo neste wiki. Escolha aquele que corresponde à sua tarefa e siga-o no dispositivo.
Visão geral do mecanismo
Configuração fácil
Quantizado em Q4
GGUF, controle total
Produção · JP 6.2
Build no dispositivo · JP 7.2
1. LLM geral
Estimativa de VRAM: confiável — params × bits/8 + KV cache + system. Q4: 7B ≈ 4-5 GB, 27B ≈ 15-18 GB.
- DeepSeek-R1 7B com Ollama
- DeepSeek 1.5B com MLC ~60 tok/s
- Llama2-7B Q4 com MLC
- GPT-OSS 20B com llama.cpp
- Saída estruturada de LLM com Langchain
- RAG com LlamaIndex + ChromaDB
- Assistente de IA local (AnythingLLM)
- OpenClaw local (Clawdbot)
- Fine-tune com Llama-Factory
- Desenvolver reComputer com Clawdbot
- Controle de interface de hardware com LLM
- Controlar motor por voz com LLM
2. VLM (Visão-Linguagem)
Estimativa de VRAM: aproximada — parte de LLM + codificador de visão (0.3-4B) + resolução/blocos de entrada. Resoluções mais altas escalam a VRAM de forma não linear.
- Executar VLM no reComputer
- WebUI VLM em tempo real 7 VLMs · em tempo real
- JoyAI-VL-Interaction Thor · voz/vídeo
- VLM com interação por voz
- Guarda de armazém LLaVA Ollama llava-llama3 8B
- Detecção Zero-Shot
3. Modelos generativos e de mundo
Estimativa de VRAM: não apenas pelos parâmetros — contagem de patches/quadros DiT, atenção temporal, U-Net vs DiT vs MoE mudam a VRAM real em 3–5x no mesmo tamanho. Meça no dispositivo.
- Stable Diffusion (texto para imagem)
- ComfyUI
reComputer run comfyui - AudioCraft (geração de música)
reComputer run audiocraft - Wan / geração de vídeo, modelos de mundo — ainda sem implantação verificada em Jetson; a VRAM deve ser medida por modelo
4. Embodied / VLA
Estimativa de VRAM: não pelos parâmetros — codificador de visão + quantidade de câmeras + taxa de controle + divisão de ações. Meça no dispositivo.
- GR00T N1.5 + LeRobot SO-101 (Thor)
- GR00T N1.6 + LeRobot SO-101 (AGX Orin)
- GR00T N1.7 + reBot Arm (J601)
- Apreensão visual GraspNet (reBot-DM)
- Controlar SO-Arm com OpenClaw (Thor)
- Controlar reBot com NemoClaw (Thor)
- Introdução ao Jetson-Claw (8 GB)
- GR00T N1.7 TensorRT de peso completo (JP 7.2)
- Controle por voz do reBot Arm B601
- Microduck RL no Jetson
- Ambiente Microduck RL
- Políticas oficiais Microduck RL
- Movimento personalizado Microduck RL
5. Fala (ASR / TTS)
Estimativa de VRAM: modelos pequenos — geralmente funcionam bem em 8 GB. Whisper/Riva rodam junto com um LLM em um pipeline.
6. Visão computacional (YOLO e detecção)
Estimativa de VRAM: pequena — modelos YOLO normalmente rodam em 8 GB com TensorRT e escalam com a resolução de entrada. Veja a lista de um comando na seção 2.1.
- YOLOv8 com TensorRT
- YOLOv8 com DeepStream + TensorRT
- Treinar e implantar YOLOv8
- Classificação personalizada com YOLOv8
- Detecção de objetos YOLOv5
- YOLOv11 + câmera de profundidade
- Sistema de câmera dupla YOLOv26
- Depth Anything V3
- MaskCam
- Gerenciamento de tráfego (DeepStream)
- DashCamNet multicâmera
- Câmeras Multi-GMSL
- Visão surround olho de peixe com quatro câmeras
- Motor de inferência de visão multitarefa
- Agente de visão em streaming (Qwen3-VL)
- Frigate NVR
- Escaneamento de raio X de segurança
- Monitoramento de visão industrial
- Mapeamento 3D NVBlox
- NVR com IA
3. Como faço o deploy?
AI Lab (plataforma online)
- Abra reComputer AI Lab Models (Jetson pré-filtrado)
- Filtre por dispositivo (por exemplo, Jetson Orin Nano) e navegue por modelos de CV / LLM / VLM com benchmarks
- Copie o comando Docker de uma linha e execute-o no seu dispositivo
Mais de 100 modelos otimizados, sem configuração, inclui números de benchmark.
CLI de um comando
Instale jetson-examples e então faça o deploy de qualquer modelo da seção 2.1:
sudo apt install python3-pip
pip3 install jetson-examples
# Deploy a model (example)
reComputer run qwen3.5-4bExpõe um endpoint de API compatível com OpenAI, utilizável diretamente com curl ou qualquer SDK OpenAI.
Deploy manual
Escolha um engine da seção 2.2 e siga o tutorial correspondente no seu dispositivo:
- Ollama — início mais fácil, grande biblioteca de modelos
- MLC LLM — modelos quantizados (Q4) compilados
- llama.cpp — leve, GGUF, controle total
- TensorRT Edge-LLM / Model-Connect — velocidade de produção
Todos os tutoriais são verificados em dispositivos reComputer Jetson.
4. Benchmark de desempenho: JetPack 6.2 vs 7.2
Mesmo modelo Qwen3.5-27B Q4_K_M (llama.cpp) em hardware classe AGX Orin, JetPack 6.2 vs 7.2:
| Métrica | JetPack 6.2 | JetPack 7.2 | Mudança |
|---|---|---|---|
| Memória após carregamento do modelo | 24.6 GB / 30 GB | 14.7 GB / 30 GB | ~40% menor |
| Frequência da GPU durante inferência | 930 MHz | 1.36 GHz | boost maior |
| Processamento do prompt | 18.2 tok/s | 25.8 tok/s | ~41.8% mais rápido |
| Geração de tokens | 4.3 tok/s | 5.5 tok/s | ~27.9% mais rápido |
Detalhes: JetPack 7.2 Deep Dive.
5. FAQ
Meu modelo é grande demais para um dispositivo — o que posso fazer?
- Use uma quantização menor (Q4_K_M em vez de Q8/FP16).
- Limite o tamanho do contexto (
--max-sequence-length) para reduzir o cache KV. - Distribua a inferência entre vários dispositivos reComputer com llama.cpp RPC (tutorial).
Eu preciso de uma GPU na nuvem?
Não. Tudo acima roda totalmente no dispositivo. Os dados permanecem na borda e não há taxas recorrentes de API.
Mais recursos
Visão geral de GenAI para reComputer-Jetson
Dataset → treino → exportação → deploy
Perguntas de solução de problemas e uso
Repositório de deploy com um comando
Suporte Técnico e Discussão de Produtos
Obrigado por escolher nossos produtos! Estamos aqui para oferecer diferentes tipos de suporte para garantir que sua experiência com nossos produtos seja a mais tranquila possível. Oferecemos vários canais de comunicação para atender a diferentes preferências e necessidades.