Pular para o conteúdo principal

Implantar modelos de IA no Jetson: o que pode rodar e como

Esta página aborda as perguntas que surgem com mais frequência ao executar modelos de IA no NVIDIA Jetson — LLMs, modelos visão-linguagem, modelos generativos, modelos incorporados/VLA, fala e visão computacional:

  1. Que tamanho de modelo (em B, bilhões de parâmetros) meu dispositivo pode rodar?
  2. Quais modelos posso implantar?
  3. Como faço para implantá-los?

Três maneiras de implantar:

  • Plataforma online (recomendado): navegue e implante a partir do reComputer AI Lab — mais de 100 modelos otimizados de CV / LLM / VLM para reComputer Jetson com implantação via Docker em um comando e benchmarks. Escolha um modelo na página, copie o comando e execute.
  • CLI com um comando: jetson-examples — reComputer run <model>.
  • Manual: você escolhe o mecanismo (Ollama, llama.cpp, MLC, TensorRT Edge-LLM, TensorRT-Model-Connect) e segue os tutoriais listados abaixo.

1. Que tamanho de modelo meu dispositivo pode rodar?​

"Tamanho de modelo" é expresso em B (bilhões de parâmetros) — um modelo 7B tem 7 bilhões de parâmetros, e números B maiores precisam de mais memória. O que importa é a memória unificada do seu módulo Jetson (o módulo, não a placa carrier). Para um modelo quantizado (Q4_K_M):

8 GB · Orin Nano

Modelos de 1B – 4B

Llama 3.2 1B/3B, Qwen3.5-4B, Gemma4 E4B, Live VLM WebUI

16 GB · Orin NX

Modelos de 7B – 8B

Llama3 8B, DeepSeek-R1 7B, Llama2-7B (MLC), LLaVA 7B, LocateAnything

32 GB · AGX Orin

até 27B (quantizado)

Qwen3.5-27B Q4_K_M (veja o benchmark JetPack 6.2 vs 7.2 abaixo)

64 GB · AGX Orin

30B – 35B+

Nemotron-3-Nano-30B (Q4_K_M), Qwen3.6-35B (UD-Q6_K), GPT-OSS

128 GB · Jetson Thor

35B+ e maiores

Nemotron3 33B, pilha JoyAI VLM / ASR / TTS

O uso de memória inclui o cache KV e a sobrecarga do sistema, então um modelo cujos pesos quase preenchem a RAM não rodará de forma estável. Medido em um AGX Orin 32 GB, um modelo Qwen3.5-27B Q4_K_M usou cerca de 24,6 GB dos 30 GB disponíveis após o carregamento — esse é um limite realista para dispositivos de 32 GB.

2. Quais modelos posso implantar?​

2.1 Implantação com um comando (jetson-examples)​

Instale uma vez e depois execute qualquer modelo compatível com um comando:

sudo apt install python3-pip
pip3 install jetson-examples

Série Qwen

Qwen3.5-4B~2,5 GB (Q4_K_M) · Orin Nano 8 GB · JP 6.1/6.2/6.2.1
reComputer run qwen3.5-4b
Qwen3.6-35B~24 GB+ (UD-Q6_K) · AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run qwen3.6-35b

Família Llama

Llama3 8B~4,9 GB (Ollama Q4) · Orin NX 16 GB · JP 5.1.1-6.0
reComputer run llama3
Llama 3.2 1B/3B~1,3 / 2,0 GB (Ollama Q4) · Orin Nano 8 GB · JP 5.1.1-6.x
reComputer run llama3.2
LLaVA 7B(VLM) ~15 GB no total (FP16) · Orin NX 16 GB · JP 5.1.1-6.0
reComputer run llava

Família Gemma

Gemma4 E4B~2,5 GB (Q4_K_M) · Orin Nano 8 GB · JP 6.1/6.2/6.2.1
reComputer run gemma4

Modelos NVIDIA (64 GB)

Nemotron-3-Nano-30B~24,5 GB (Q4_K_M) · AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run nemotron-3-nano
GPT-OSS~39 GB (Q4_K) · AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run gpt-oss

VLM (Visão-Linguagem)

Live VLM WebUI7 VLMs (Ollama Q4) · 8 GB mín · JP 6.0-7.1
reComputer run live-vlm-webui
LocateAnything~7,3 GB de pesos (BF16) · Orin NX 16 GB · JP 6.x
reComputer run locateanything

YOLO & Detecção

Ultralytics YOLOdetecção / segmentação / pose / classificação · 8 GB + · JP 4.6-6.2
reComputer run ultralytics-yolo
YOLO11· 8 GB + · JP 5.1.1-6.x
reComputer run yolo11
YOLO26· 8 GB + · JP 5.1.1-7.1
reComputer run yolo26
YOLO26 TensorRT C++nativo, sem Docker · JP 6.0-7.2
reComputer run yolo26-tensorrt
YOLOv10· 8 GB + · JP 5.1.1-6.0
reComputer run yolov10
Depth Anything V2profundidade monocular · 16 GB · JP 5.1.1-5.1.3
reComputer run depth-anything-v2
Depth Anything V3· 16 GB · JP 6.1-6.2.1
reComputer run depth-anything-v3
NanoOWLdetecção de vocabulário aberto · 8 GB + · JP 5.1.1-6.x
reComputer run nanoowl

Ferramentas

Ollama(qualquer modelo) o tamanho depende do modelo + quantização (geralmente Q4) · 8 GB + · JP 5.1.1-6.x
reComputer run ollama
Whisper(STT) o tamanho depende da variante do Whisper (small/base/large) · 8 GB + · JP 5.1.1-6.x
reComputer run whisper
Llama-Factory(fine-tune) a pegada de treinamento depende do modelo + LoRA/QLoRA · 16 GB + · JP 5.1.1-5.1.3
reComputer run llama-factory

Nota: os tamanhos acima são para a quantização mostrada. Maior precisão (Q8 / FP16) aproximadamente dobra ou mais o tamanho dos pesos. Cada exemplo também precisa de espaço livre suficiente em disco (imagem + modelo) — LLaVA FP16 precisa de cerca de 27,4 GB no total. Verifique a lista de exemplos no README do jetson-examples para tamanhos exatos das imagens.

2.2 Implantação manual: índice completo de tutoriais​

Cada categoria abaixo aponta para um tutorial completo neste wiki. Escolha aquele que corresponde à sua tarefa e siga-o no dispositivo.

Visão geral do mecanismo

Ollama
Configuração fácil
MLC LLM
Quantizado em Q4
llama.cpp
GGUF, controle total
TensorRT Edge-LLM
Produção · JP 6.2
TensorRT-Model-Connect
Build no dispositivo · JP 7.2

2. VLM (Visão-Linguagem)

Estimativa de VRAM: aproximada — parte de LLM + codificador de visão (0.3-4B) + resolução/blocos de entrada. Resoluções mais altas escalam a VRAM de forma não linear.

3. Modelos generativos e de mundo

Estimativa de VRAM: não apenas pelos parâmetros — contagem de patches/quadros DiT, atenção temporal, U-Net vs DiT vs MoE mudam a VRAM real em 3–5x no mesmo tamanho. Meça no dispositivo.

5. Fala (ASR / TTS)

Estimativa de VRAM: modelos pequenos — geralmente funcionam bem em 8 GB. Whisper/Riva rodam junto com um LLM em um pipeline.

3. Como faço o deploy?​

AI Lab (plataforma online)

  1. Abra reComputer AI Lab Models (Jetson pré-filtrado)
  2. Filtre por dispositivo (por exemplo, Jetson Orin Nano) e navegue por modelos de CV / LLM / VLM com benchmarks
  3. Copie o comando Docker de uma linha e execute-o no seu dispositivo

Mais de 100 modelos otimizados, sem configuração, inclui números de benchmark.

CLI de um comando

Instale jetson-examples e então faça o deploy de qualquer modelo da seção 2.1:

sudo apt install python3-pip
pip3 install jetson-examples

# Deploy a model (example)
reComputer run qwen3.5-4b

Expõe um endpoint de API compatível com OpenAI, utilizável diretamente com curl ou qualquer SDK OpenAI.

Deploy manual

Escolha um engine da seção 2.2 e siga o tutorial correspondente no seu dispositivo:

  • Ollama — início mais fácil, grande biblioteca de modelos
  • MLC LLM — modelos quantizados (Q4) compilados
  • llama.cpp — leve, GGUF, controle total
  • TensorRT Edge-LLM / Model-Connect — velocidade de produção

Todos os tutoriais são verificados em dispositivos reComputer Jetson.

4. Benchmark de desempenho: JetPack 6.2 vs 7.2​

Mesmo modelo Qwen3.5-27B Q4_K_M (llama.cpp) em hardware classe AGX Orin, JetPack 6.2 vs 7.2:

MétricaJetPack 6.2JetPack 7.2Mudança
Memória após carregamento do modelo24.6 GB / 30 GB14.7 GB / 30 GB~40% menor
Frequência da GPU durante inferência930 MHz1.36 GHzboost maior
Processamento do prompt18.2 tok/s25.8 tok/s~41.8% mais rápido
Geração de tokens4.3 tok/s5.5 tok/s~27.9% mais rápido

Detalhes: JetPack 7.2 Deep Dive.

5. FAQ​

Posso rodar DeepSeek no Jetson?

Sim. DeepSeek-R1 7B roda bem em dispositivos Orin NX 16 GB via Ollama (tutorial); a variante MLC quantizada de 1.5B atinge cerca de 60 tok/s no Orin NX (tutorial).

Meu modelo é grande demais para um dispositivo — o que posso fazer?

  • Use uma quantização menor (Q4_K_M em vez de Q8/FP16).
  • Limite o tamanho do contexto (--max-sequence-length) para reduzir o cache KV.
  • Distribua a inferência entre vários dispositivos reComputer com llama.cpp RPC (tutorial).

Eu preciso de uma GPU na nuvem?

Não. Tudo acima roda totalmente no dispositivo. Os dados permanecem na borda e não há taxas recorrentes de API.

Mais recursos​

Introdução à IA Generativa

Visão geral de GenAI para reComputer-Jetson

Fine-tuning com Llama-Factory

Dataset → treino → exportação → deploy

Jetson FAQ

Perguntas de solução de problemas e uso

jetson-examples

Repositório de deploy com um comando

Suporte Técnico e Discussão de Produtos​

Obrigado por escolher nossos produtos! Estamos aqui para oferecer diferentes tipos de suporte para garantir que sua experiência com nossos produtos seja a mais tranquila possível. Oferecemos vários canais de comunicação para atender a diferentes preferências e necessidades.

Loading Comments...