Desplegar modelos de IA en Jetson: qué puede ejecutarse y cómo
Esta página cubre las preguntas que surgen con más frecuencia al ejecutar modelos de IA en NVIDIA Jetson — LLM, modelos visión-lenguaje, modelos generativos, modelos incorporados/VLA, voz y visión por computadora:
- ¿Qué tamaño de modelo (en B, mil millones de parámetros) puede ejecutar mi dispositivo?
- ¿Qué modelos puedo desplegar?
- ¿Cómo los despliego?
Tres formas de desplegar:
- Plataforma en línea (recomendado): explora y despliega desde el reComputer AI Lab: más de 100 modelos optimizados de CV / LLM / VLM para reComputer Jetson con despliegue Docker con un solo comando y benchmarks. Elige un modelo en la página, copia el comando y ejecútalo.
- CLI de un solo comando: jetson-examples —
reComputer run <model>. - Manual: tú eliges el motor (Ollama, llama.cpp, MLC, TensorRT Edge-LLM, TensorRT-Model-Connect) y sigues los tutoriales listados abajo.
1. ¿Qué tamaño de modelo puede ejecutar mi dispositivo?
El "tamaño del modelo" se expresa en B (mil millones de parámetros): un modelo de 7B tiene 7 mil millones de parámetros, y los números B más grandes necesitan más memoria. Lo que importa es la memoria unificada de tu módulo Jetson (el módulo, no la placa portadora). Para un modelo cuantizado (Q4_K_M):
8 GB · Orin Nano
Modelos de 1B – 4B
Llama 3.2 1B/3B, Qwen3.5-4B, Gemma4 E4B, Live VLM WebUI
16 GB · Orin NX
Modelos de 7B – 8B
Llama3 8B, DeepSeek-R1 7B, Llama2-7B (MLC), LLaVA 7B, LocateAnything
32 GB · AGX Orin
hasta 27B (cuantizado)
Qwen3.5-27B Q4_K_M (ver benchmark de JetPack 6.2 vs 7.2 abajo)
64 GB · AGX Orin
30B – 35B+
Nemotron-3-Nano-30B (Q4_K_M), Qwen3.6-35B (UD-Q6_K), GPT-OSS
128 GB · Jetson Thor
35B+ y mayores
Nemotron3 33B, pila JoyAI VLM / ASR / TTS
El uso de memoria incluye la caché KV y la sobrecarga del sistema, por lo que un modelo cuyos pesos casi llenan la RAM no se ejecutará de forma estable. Medido en AGX Orin 32 GB, un modelo Qwen3.5-27B Q4_K_M usó alrededor de 24.6 GB de los 30 GB disponibles después de la carga: ese es un límite realista para dispositivos de 32 GB.
2. ¿Qué modelos puedo desplegar?
2.1 Despliegue con un solo comando (jetson-examples)
Instala una vez y luego ejecuta cualquier modelo compatible con un solo comando:
sudo apt install python3-pip
pip3 install jetson-examples
Serie Qwen
reComputer run qwen3.5-4breComputer run qwen3.6-35bFamilia Llama
reComputer run llama3reComputer run llama3.2reComputer run llavaFamilia Gemma
reComputer run gemma4Modelos NVIDIA (64 GB)
reComputer run nemotron-3-nanoreComputer run gpt-ossVLM (visión-lenguaje)
reComputer run live-vlm-webuireComputer run locateanythingYOLO y detección
reComputer run ultralytics-yoloreComputer run yolo11reComputer run yolo26reComputer run yolo26-tensorrtreComputer run yolov10reComputer run depth-anything-v2reComputer run depth-anything-v3reComputer run nanoowlHerramientas
reComputer run ollamareComputer run whisperreComputer run llama-factoryNota: los tamaños anteriores corresponden a la cuantización mostrada. Una mayor precisión (Q8 / FP16) aproximadamente duplica o más el tamaño de los pesos. Cada ejemplo también necesita suficiente espacio libre en disco (imagen + modelo): LLaVA FP16 necesita alrededor de 27.4 GB en total. Consulta la lista de ejemplos en el README de jetson-examples para conocer los tamaños exactos de las imágenes.
2.2 Despliegue manual: índice completo del tutorial
Cada categoría a continuación enlaza a un tutorial completo en este wiki. Elige el que coincida con tu tarea y síguelo en el dispositivo.
Motor de un vistazo
Configuración sencilla
Cuantizado Q4
GGUF, control total
Producción · JP 6.2
Compilación en el dispositivo · JP 7.2
1. LLM general
Estimación de VRAM: fiable — params × bits/8 + KV cache + system. Q4: 7B ≈ 4-5 GB, 27B ≈ 15-18 GB.
- DeepSeek-R1 7B con Ollama
- DeepSeek 1.5B con MLC ~60 tok/s
- Llama2-7B Q4 con MLC
- GPT-OSS 20B con llama.cpp
- Salida estructurada de LLM con Langchain
- RAG con LlamaIndex + ChromaDB
- Asistente de IA local (AnythingLLM)
- OpenClaw local (Clawdbot)
- Ajuste fino con Llama-Factory
- Desarrollar reComputer con Clawdbot
- Control de interfaz de hardware con LLM
- Controlar motor por voz con LLM
2. VLM (Visión-Lenguaje)
Estimación de VRAM: aproximada — parte LLM + codificador de visión (0.3-4B) + resolución/baldosas de entrada. Una mayor resolución escala la VRAM de forma no lineal.
- Ejecutar VLM en reComputer
- WebUI VLM en vivo 7 VLMs · en tiempo real
- JoyAI-VL-Interaction Thor · voz/vídeo
- VLM con interacción por voz
- Guardia de almacén LLaVA Ollama llava-llama3 8B
- Detección Zero-Shot
3. Modelos generativos y del mundo
Estimación de VRAM: no solo por parámetros: el recuento de parches/cuadros de DiT, la atención temporal y U-Net vs DiT vs MoE cambian la VRAM real 3-5x con el mismo tamaño. Mide en el dispositivo.
- Stable Diffusion (texto a imagen)
- ComfyUI
reComputer run comfyui - AudioCraft (generación de música)
reComputer run audiocraft - Wan / generación de vídeo, modelos del mundo — aún sin despliegue verificado en Jetson; la VRAM debe medirse por modelo
4. Embodied / VLA
Estimación de VRAM: no por parámetros: codificador de visión + número de cámaras + frecuencia de control + segmentación de acciones. Mide en el dispositivo.
- GR00T N1.5 + LeRobot SO-101 (Thor)
- GR00T N1.6 + LeRobot SO-101 (AGX Orin)
- GR00T N1.7 + reBot Arm (J601)
- Agarre visual GraspNet (reBot-DM)
- Controlar SO-Arm con OpenClaw (Thor)
- Controlar reBot con NemoClaw (Thor)
- Inicio con Jetson-Claw (8 GB)
- GR00T N1.7 TensorRT de peso completo (JP 7.2)
- Control por voz del brazo reBot B601
- Microduck RL en Jetson
- Entorno Microduck RL
- Políticas oficiales de Microduck RL
- Movimiento personalizado de Microduck RL
5. Voz (ASR / TTS)
Estimación de VRAM: modelos pequeños: normalmente bien en 8 GB. Whisper/Riva se ejecutan junto con un LLM en una canalización.
6. Visión por computador (YOLO y detección)
Estimación de VRAM: pequeña: los modelos YOLO normalmente se ejecutan en 8 GB con TensorRT y escalan con la resolución de entrada. Consulta la lista de un solo comando en la sección 2.1.
- YOLOv8 con TensorRT
- YOLOv8 con DeepStream + TensorRT
- Entrenar y desplegar YOLOv8
- Clasificación personalizada con YOLOv8
- Detección de objetos con YOLOv5
- YOLOv11 + cámara de profundidad
- Sistema de doble cámara YOLOv26
- Depth Anything V3
- MaskCam
- Gestión de tráfico (DeepStream)
- DashCamNet multicámara
- Cámaras Multi-GMSL
- Vista envolvente de ojo de pez con cuatro cámaras
- Motor de inferencia de visión multitarea
- Agente de visión en streaming (Qwen3-VL)
- Frigate NVR
- Escaneo de rayos X de seguridad
- Supervisión de visión industrial
- Mapeo 3D con NVBlox
- NVR de IA
3. ¿Cómo hago el despliegue?
AI Lab (plataforma en línea)
- Abre reComputer AI Lab Models (Jetson prefiltrado)
- Filtra por dispositivo (p. ej. Jetson Orin Nano) y explora modelos de CV / LLM / VLM con benchmarks
- Copia el comando Docker de una sola orden y ejecútalo en tu dispositivo
Más de 100 modelos optimizados, sin configuración, incluye cifras de benchmark.
CLI de un solo comando
Instala jetson-examples y luego despliega cualquier modelo de la sección 2.1:
sudo apt install python3-pip
pip3 install jetson-examples
# Deploy a model (example)
reComputer run qwen3.5-4bExpone un endpoint de API compatible con OpenAI, utilizable directamente con curl o cualquier SDK de OpenAI.
Despliegue manual
Elige un motor de la sección 2.2 y sigue su tutorial en tu dispositivo:
- Ollama — inicio más sencillo, gran biblioteca de modelos
- MLC LLM — modelos cuantizados (Q4) compilados
- llama.cpp — ligero, GGUF, control total
- TensorRT Edge-LLM / Model-Connect — velocidad de producción
Todos los tutoriales están verificados en dispositivos reComputer Jetson.
4. Benchmark de rendimiento: JetPack 6.2 vs 7.2
Mismo modelo Qwen3.5-27B Q4_K_M (llama.cpp) en hardware de clase AGX Orin, JetPack 6.2 vs 7.2:
| Métrica | JetPack 6.2 | JetPack 7.2 | Cambio |
|---|---|---|---|
| Memoria después de cargar el modelo | 24.6 GB / 30 GB | 14.7 GB / 30 GB | ~40% menos |
| Frecuencia de la GPU durante la inferencia | 930 MHz | 1.36 GHz | mayor boost |
| Procesamiento del prompt | 18.2 tok/s | 25.8 tok/s | ~41.8% más rápido |
| Generación de tokens | 4.3 tok/s | 5.5 tok/s | ~27.9% más rápido |
Detalles: JetPack 7.2 Deep Dive.
5. Preguntas frecuentes (FAQ)
Mi modelo es demasiado grande para un solo dispositivo, ¿qué puedo hacer?
- Usa una cuantización más pequeña (Q4_K_M en lugar de Q8/FP16).
- Limita la longitud de contexto (
--max-sequence-length) para reducir la caché KV. - Distribuye la inferencia entre varios dispositivos reComputer con llama.cpp RPC (tutorial).
¿Necesito una GPU en la nube?
No. Todo lo anterior se ejecuta completamente en el dispositivo. Los datos permanecen en el edge y no hay tarifas recurrentes de API.
Más recursos
Resumen del tema GenAI para reComputer-Jetson
Dataset → entrenamiento → exportación → despliegue
Preguntas de solución de problemas y uso
Repositorio de despliegue con un solo comando
Soporte técnico y debate sobre productos
Gracias por elegir nuestros productos. Estamos aquí para ofrecerte diferentes tipos de soporte y garantizar que tu experiencia con nuestros productos sea lo más fluida posible. Ofrecemos varios canales de comunicación para adaptarnos a distintas preferencias y necesidades.