Compatibilidad de modelos y formatos de salida
Esta página resume qué se ejecuta en la NPU de reCamera Pro (Rockchip RV1126B, 3 TOPS, INT8/INT16 mixto) y qué produce la canalización de inferencia. Úsala como una comprobación rápida antes de invertir tiempo en convertir o entrenar un modelo.
Formato de modelo compatible
| Elemento | Valor |
|---|---|
| Formato de modelo en el dispositivo | RKNN (.rknn), compilado para RV1126B |
| Plataforma de destino requerida | target_platform='rv1126b' al compilar con RKNN-Toolkit2 |
| Kit de conversión | RKNN-Toolkit2 2.3.2, en el host (Linux x86_64 o WSL 2, Python 3.6–3.12) |
| Alineación del runtime | Mantén la versión del Toolkit alineada con el RKNN Runtime incluido en el firmware de reCamera Pro |
| Precisión | FP16 (base no cuantizada) e INT8 (cuantizada con un conjunto de datos de calibración) |
| Formatos de origen | ONNX (a través de RKNN-Toolkit2 o conversión SenseCraft); los checkpoints de Ultralytics YOLO (.pt) pueden exportar directamente a RKNN |
- No uses
rknn-toolkit-lite2para la conversión: es una biblioteca de runtime en el dispositivo, no un conversor. - Un modelo compilado para otro SoC de Rockchip (por ejemplo, RK3566/RK3588) no se ejecutará en RV1126B.
Guías paso a paso de conversión: Conversión con RKNN-Toolkit2 (en host, scriptable) y SenseCraft ONNX-a-RKNN (en navegador, sin código).
Familias de modelos integrados y probados
El firmware se entrega con modelos de detección integrados, y la lista de Gestión de Modelos en la interfaz web expone estos atributos por modelo:
| Campo | Valores típicos |
|---|---|
| Framework | RKNN |
| Algoritmo | YOLO, nanodet |
| Tipo | Detección |
Los casos de uso probados/incluidos abarcan detección de personas, detección de cascos, detección de seguridad en construcción y detección de vehículos.
Requisitos del contrato de entrada
Tu modelo ONNX debe tener un contrato de entrada conocido y estático antes de la conversión. RKNN aplica (input − mean) / std una sola vez; si la normalización ya está dentro del grafo ONNX, usa valores identidad (mean=[0,0,0], std=[1,1,1]).
| Elemento | Requisito |
|---|---|
| Forma de entrada | Estática, lote 1 preferido (por ejemplo, [1, 3, 640, 640]) |
| Disposición | NCHW o NHWC, coincidiendo con el grafo exportado |
| Orden de canales | RGB frente a BGR debe coincidir con el entrenamiento: un intercambio reduce gravemente la precisión |
| Política de redimensionado | Estirar, recortar o letterbox deben ser idénticos en tiempo de ejecución |
| Operadores no compatibles | Vuelve a exportar el modelo ONNX o usa un operador compatible semánticamente equivalente |
Inspecciona el contrato con Netron o model-inspect antes de convertir. Detalles y resolución de problemas: Conversión con RKNN-Toolkit2.
Clases personalizadas y postprocesamiento
Los modelos cargados se configuran en la interfaz web (Subir y configurar un modelo RKNN, Configurar detección):
- Categorías de detección: define manualmente los nombres de las clases de salida o importa en bloque una lista de categorías desde un archivo TXT; los resultados de inferencia mostrarán entonces tus propias etiquetas
- Parámetros de postprocesamiento:
IOU(umbral de NMS),Confidence(umbral de detección),max_obj(máximo de objetos por fotograma)
Formatos de salida de inferencia
La salida de inferencia en tiempo real (monitorización en la interfaz web, registros) usa estos campos:
| Campo | Descripción |
|---|---|
timestamp | Marca de tiempo del resultado de inferencia |
task_type | Tipo de tarea actual |
class_id | ID de la clase detectada |
class_name | Nombre de la clase detectada |
score | Confianza de la detección |
bbox | Coordenadas de la caja delimitadora |
detection_count | Número de objetos detectados en el fotograma actual |
Los resultados pueden enviarse a sistemas externos por tres canales, con plantilla de salida y tipo de tarea configurables:
| Canal | Guía |
|---|---|
| HTTP | Enviar resultados de detección por HTTP/UART |
| UART | Enviar resultados de detección por HTTP/UART |
| MQTT | Enviar resultados de detección por MQTT |
Las grabaciones también pueden activarse directamente mediante los resultados de inferencia (categorías, rango de confianza, áreas de activación): Configurar grabación de eventos.
Inferencia nativa (C/C++)
Para aplicaciones personalizadas fuera de la interfaz web, los modelos se cargan a través del RKNN Runtime C API. Configuración de la compilación cruzada y una aplicación mínima: Configuración del SDK, Desarrollo nativo. Un flujo de trabajo asistido por agente de IA con una plantilla en C++: Desarrollar con agentes de programación de IA.
Modelos de sonido
La detección de eventos de sonido utiliza una canalización independiente: los modelos se visualizan, entrenan y cambian en el Sound Lab (interfaz web), y las categorías de sonido seleccionadas pueden activar la grabación. Consulta Entrenar un modelo de sonido y Captura activada por sonido.
Soporte técnico y debate sobre el producto
Gracias por elegir nuestros productos. Estamos aquí para ofrecerte distintos tipos de soporte y garantizar que tu experiencia con nuestros productos sea lo más fluida posible. Ofrecemos varios canales de comunicación para adaptarnos a diferentes preferencias y necesidades.