Saltar al contenido principal

Desplegar modelos de IA en Jetson: qué puede ejecutarse y cómo

Esta página cubre las preguntas que surgen con más frecuencia al ejecutar modelos de IA en NVIDIA Jetson — LLM, modelos visión-lenguaje, modelos generativos, modelos incorporados/VLA, voz y visión por computadora:

  1. ¿Qué tamaño de modelo (en B, mil millones de parámetros) puede ejecutar mi dispositivo?
  2. ¿Qué modelos puedo desplegar?
  3. ¿Cómo los despliego?

Tres formas de desplegar:

  • Plataforma en línea (recomendado): explora y despliega desde el reComputer AI Lab: más de 100 modelos optimizados de CV / LLM / VLM para reComputer Jetson con despliegue Docker con un solo comando y benchmarks. Elige un modelo en la página, copia el comando y ejecútalo.
  • CLI de un solo comando: jetson-examples — reComputer run <model>.
  • Manual: tú eliges el motor (Ollama, llama.cpp, MLC, TensorRT Edge-LLM, TensorRT-Model-Connect) y sigues los tutoriales listados abajo.

1. ¿Qué tamaño de modelo puede ejecutar mi dispositivo?​

El "tamaño del modelo" se expresa en B (mil millones de parámetros): un modelo de 7B tiene 7 mil millones de parámetros, y los números B más grandes necesitan más memoria. Lo que importa es la memoria unificada de tu módulo Jetson (el módulo, no la placa portadora). Para un modelo cuantizado (Q4_K_M):

8 GB · Orin Nano

Modelos de 1B – 4B

Llama 3.2 1B/3B, Qwen3.5-4B, Gemma4 E4B, Live VLM WebUI

16 GB · Orin NX

Modelos de 7B – 8B

Llama3 8B, DeepSeek-R1 7B, Llama2-7B (MLC), LLaVA 7B, LocateAnything

32 GB · AGX Orin

hasta 27B (cuantizado)

Qwen3.5-27B Q4_K_M (ver benchmark de JetPack 6.2 vs 7.2 abajo)

64 GB · AGX Orin

30B – 35B+

Nemotron-3-Nano-30B (Q4_K_M), Qwen3.6-35B (UD-Q6_K), GPT-OSS

128 GB · Jetson Thor

35B+ y mayores

Nemotron3 33B, pila JoyAI VLM / ASR / TTS

El uso de memoria incluye la caché KV y la sobrecarga del sistema, por lo que un modelo cuyos pesos casi llenan la RAM no se ejecutará de forma estable. Medido en AGX Orin 32 GB, un modelo Qwen3.5-27B Q4_K_M usó alrededor de 24.6 GB de los 30 GB disponibles después de la carga: ese es un límite realista para dispositivos de 32 GB.

2. ¿Qué modelos puedo desplegar?​

2.1 Despliegue con un solo comando (jetson-examples)​

Instala una vez y luego ejecuta cualquier modelo compatible con un solo comando:

sudo apt install python3-pip
pip3 install jetson-examples

Serie Qwen

Qwen3.5-4B~2.5 GB (Q4_K_M) · Orin Nano 8 GB · JP 6.1/6.2/6.2.1
reComputer run qwen3.5-4b
Qwen3.6-35B~24 GB+ (UD-Q6_K) · AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run qwen3.6-35b

Familia Llama

Llama3 8B~4.9 GB (Ollama Q4) · Orin NX 16 GB · JP 5.1.1-6.0
reComputer run llama3
Llama 3.2 1B/3B~1.3 / 2.0 GB (Ollama Q4) · Orin Nano 8 GB · JP 5.1.1-6.x
reComputer run llama3.2
LLaVA 7B(VLM) ~15 GB en total (FP16) · Orin NX 16 GB · JP 5.1.1-6.0
reComputer run llava

Familia Gemma

Gemma4 E4B~2.5 GB (Q4_K_M) · Orin Nano 8 GB · JP 6.1/6.2/6.2.1
reComputer run gemma4

Modelos NVIDIA (64 GB)

Nemotron-3-Nano-30B~24.5 GB (Q4_K_M) · AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run nemotron-3-nano
GPT-OSS~39 GB (Q4_K) · AGX Orin 64 GB · JP 6.1/6.2/6.2.1
reComputer run gpt-oss

VLM (visión-lenguaje)

Live VLM WebUI7 VLM (Ollama Q4) · 8 GB mín. · JP 6.0-7.1
reComputer run live-vlm-webui
LocateAnything~7.3 GB de pesos (BF16) · Orin NX 16 GB · JP 6.x
reComputer run locateanything

YOLO y detección

Ultralytics YOLOdetección / segmentación / pose / clasificación · 8 GB + · JP 4.6-6.2
reComputer run ultralytics-yolo
YOLO11· 8 GB + · JP 5.1.1-6.x
reComputer run yolo11
YOLO26· 8 GB + · JP 5.1.1-7.1
reComputer run yolo26
YOLO26 TensorRT C++nativo, sin Docker · JP 6.0-7.2
reComputer run yolo26-tensorrt
YOLOv10· 8 GB + · JP 5.1.1-6.0
reComputer run yolov10
Depth Anything V2profundidad monocular · 16 GB · JP 5.1.1-5.1.3
reComputer run depth-anything-v2
Depth Anything V3· 16 GB · JP 6.1-6.2.1
reComputer run depth-anything-v3
NanoOWLdetección de vocabulario abierto · 8 GB + · JP 5.1.1-6.x
reComputer run nanoowl

Herramientas

Ollama(cualquier modelo) el tamaño depende del modelo + cuantización (normalmente Q4) · 8 GB + · JP 5.1.1-6.x
reComputer run ollama
Whisper(STT) el tamaño depende de la variante de Whisper (small/base/large) · 8 GB + · JP 5.1.1-6.x
reComputer run whisper
Llama-Factory(fine-tune) la huella de entrenamiento depende del modelo + LoRA/QLoRA · 16 GB + · JP 5.1.1-5.1.3
reComputer run llama-factory

Nota: los tamaños anteriores corresponden a la cuantización mostrada. Una mayor precisión (Q8 / FP16) aproximadamente duplica o más el tamaño de los pesos. Cada ejemplo también necesita suficiente espacio libre en disco (imagen + modelo): LLaVA FP16 necesita alrededor de 27.4 GB en total. Consulta la lista de ejemplos en el README de jetson-examples para conocer los tamaños exactos de las imágenes.

2.2 Despliegue manual: índice completo del tutorial​

Cada categoría a continuación enlaza a un tutorial completo en este wiki. Elige el que coincida con tu tarea y síguelo en el dispositivo.

Motor de un vistazo

Ollama
Configuración sencilla
MLC LLM
Cuantizado Q4
llama.cpp
GGUF, control total
TensorRT Edge-LLM
Producción · JP 6.2
TensorRT-Model-Connect
Compilación en el dispositivo · JP 7.2

2. VLM (Visión-Lenguaje)

Estimación de VRAM: aproximada — parte LLM + codificador de visión (0.3-4B) + resolución/baldosas de entrada. Una mayor resolución escala la VRAM de forma no lineal.

3. Modelos generativos y del mundo

Estimación de VRAM: no solo por parámetros: el recuento de parches/cuadros de DiT, la atención temporal y U-Net vs DiT vs MoE cambian la VRAM real 3-5x con el mismo tamaño. Mide en el dispositivo.

5. Voz (ASR / TTS)

Estimación de VRAM: modelos pequeños: normalmente bien en 8 GB. Whisper/Riva se ejecutan junto con un LLM en una canalización.

3. ¿Cómo hago el despliegue?​

AI Lab (plataforma en línea)

  1. Abre reComputer AI Lab Models (Jetson prefiltrado)
  2. Filtra por dispositivo (p. ej. Jetson Orin Nano) y explora modelos de CV / LLM / VLM con benchmarks
  3. Copia el comando Docker de una sola orden y ejecútalo en tu dispositivo

Más de 100 modelos optimizados, sin configuración, incluye cifras de benchmark.

CLI de un solo comando

Instala jetson-examples y luego despliega cualquier modelo de la sección 2.1:

sudo apt install python3-pip
pip3 install jetson-examples

# Deploy a model (example)
reComputer run qwen3.5-4b

Expone un endpoint de API compatible con OpenAI, utilizable directamente con curl o cualquier SDK de OpenAI.

Despliegue manual

Elige un motor de la sección 2.2 y sigue su tutorial en tu dispositivo:

  • Ollama — inicio más sencillo, gran biblioteca de modelos
  • MLC LLM — modelos cuantizados (Q4) compilados
  • llama.cpp — ligero, GGUF, control total
  • TensorRT Edge-LLM / Model-Connect — velocidad de producción

Todos los tutoriales están verificados en dispositivos reComputer Jetson.

4. Benchmark de rendimiento: JetPack 6.2 vs 7.2​

Mismo modelo Qwen3.5-27B Q4_K_M (llama.cpp) en hardware de clase AGX Orin, JetPack 6.2 vs 7.2:

MétricaJetPack 6.2JetPack 7.2Cambio
Memoria después de cargar el modelo24.6 GB / 30 GB14.7 GB / 30 GB~40% menos
Frecuencia de la GPU durante la inferencia930 MHz1.36 GHzmayor boost
Procesamiento del prompt18.2 tok/s25.8 tok/s~41.8% más rápido
Generación de tokens4.3 tok/s5.5 tok/s~27.9% más rápido

Detalles: JetPack 7.2 Deep Dive.

5. Preguntas frecuentes (FAQ)​

¿Puedo ejecutar DeepSeek en Jetson?

Sí. DeepSeek-R1 7B funciona bien en dispositivos Orin NX de 16 GB mediante Ollama (tutorial); la variante cuantizada con MLC de 1.5B alcanza alrededor de 60 tok/s en Orin NX (tutorial).

Mi modelo es demasiado grande para un solo dispositivo, ¿qué puedo hacer?

  • Usa una cuantización más pequeña (Q4_K_M en lugar de Q8/FP16).
  • Limita la longitud de contexto (--max-sequence-length) para reducir la caché KV.
  • Distribuye la inferencia entre varios dispositivos reComputer con llama.cpp RPC (tutorial).

¿Necesito una GPU en la nube?

No. Todo lo anterior se ejecuta completamente en el dispositivo. Los datos permanecen en el edge y no hay tarifas recurrentes de API.

Más recursos​

Introducción a la IA generativa

Resumen del tema GenAI para reComputer-Jetson

Ajuste fino con Llama-Factory

Dataset → entrenamiento → exportación → despliegue

Jetson FAQ

Preguntas de solución de problemas y uso

jetson-examples

Repositorio de despliegue con un solo comando

Soporte técnico y debate sobre productos​

Gracias por elegir nuestros productos. Estamos aquí para ofrecerte diferentes tipos de soporte y garantizar que tu experiencia con nuestros productos sea lo más fluida posible. Ofrecemos varios canales de comunicación para adaptarnos a distintas preferencias y necesidades.

Loading Comments...