Con el rápido avance de las aplicaciones de visión artificial, las soluciones con múltiples cámaras (estéreo, cuádruple cámara e incluso más canales de cámara) se han adoptado ampliamente en escenarios como adquisición de datos, vigilancia de seguridad, inspección industrial, percepción robótica y computación periférica. Muchos proyectos caen en una trampa común durante la selección de hardware: centrarse únicamente en la potencia de cómputo del chip y pasar por alto la configuración de memoria. Esto termina provocando problemas como pérdida de fotogramas, retrasos en la inferencia de IA y bloqueos del sistema.
¿Es siempre mejor una memoria DDR mayor? Sí, desde la perspectiva del rendimiento y la estabilidad. Sin embargo, el inconveniente es evidente: afecta negativamente al presupuesto, especialmente dada la reciente subida de los precios de la DDR. Equilibrar el costo con los requisitos reales del proyecto se vuelve fundamental para la selección de la solución.

Analicemos la trampa más común en el dimensionamiento de DDR: el uso de memoria puede parecer bajo en condiciones normales, pero puede aumentar bruscamente hasta valores máximos durante ráfagas de tareas simultáneas, provocando directamente bloqueos del sistema. Muchos equipos utilizan el consumo medio de memoria para la evaluación del hardware. Tomemos como ejemplo el sensor ampliamente utilizado AR0234: una sola cámara 1080P consume una cantidad modesta de memoria en estado de espera inactivo. Sin embargo, al ejecutar la canalización completa de captura-ISP-inferencia IA-codificación, su pico de memoria puede alcanzar decenas de MB por canal. En una cámara 4K, el uso máximo por canal puede superar los 100 MB. Incluso una solicitud HTTP habitual consume varios MB por conexión. Estas sobrecargas individuales parecen menores, pero se acumulan rápidamente cuando se activan simultáneamente múltiples cámaras y tareas. Esto puede desencadenar un error OOM (Out-of-Memory), lo que provoca la terminación forzosa de procesos y el fallo del sistema.

La memoria en los dispositivos de visión periférica no se utiliza exclusivamente para modelos de inteligencia artificial. Se comparte entre la captura de imágenes, el preprocesamiento, la inferencia de IA, los servicios del sistema y las cargas de trabajo de aplicaciones. La sobrecarga de memoria aumenta con cada canal adicional de cámara.
1. Buffers de imagen (la fuente más grande de sobrecarga) Las imágenes en bruto, los fotogramas YUV y los fotogramas escalados generados por cada cámara consumen memoria. Para un sensor AR0234 que opera a 1080P@30fps, un solo fotograma YUV ocupa varios MB. Para evitar la pérdida de fotogramas, el sistema mantiene buffers circulares de múltiples fotogramas, lo que incrementa aún más la huella de memoria. La generación de múltiples variantes de imagen (original, miniatura, fotogramas recortados) crea buffers adicionales de fotogramas. El consumo de memoria se multiplica cuando varias cámaras transmiten simultáneamente.
2. Sobrecarga del ISP y del preprocesamiento de imágenes El ISP es un acelerador de hardware independiente que realiza reducción de ruido, corrección de color, corrección de distorsión, rotación, recorte y conversión de formato. El ISP solo contiene una caché limitada integrada, sin almacenamiento de fotogramas de gran capacidad. Por lo tanto, se deben asignar búferes temporales en la memoria DDR para muchas operaciones. Más canales de cámara implican cargas de trabajo más intensas para el ISP y mayores requisitos de capacidad de la memoria DDR.
3. Memoria para la inferencia de modelos de IA La inferencia de IA consume memoria en dos partes. La primera son los pesos del modelo: unos parámetros de modelo más grandes generan un mayor consumo de memoria. Afortunadamente, los pesos se cargan una sola vez durante la inicialización del modelo; su huella de memoria no aumenta con más canales de cámara ni con más escenarios durante la ejecución.
¿La memoria no se ve afectada durante la fase de ejecución de la inferencia? En absoluto. Esto nos lleva al segundo componente: los búferes de características intermedias generados durante la inferencia. Cada canal de cámara requiere su propio búfer de cómputo, lo que incrementa el consumo total de memoria. La inferencia sincronizada de IA en múltiples cámaras exige múltiples búferes de cómputo independientes. Por tanto, más canales equivalen a una mayor sobrecarga de memoria para los búferes de inferencia.
4. Sobrecarga del sistema, el controlador y el software intermedio Tomemos como ejemplo nuestra solución de visión RK3576. La memoria del sistema base es consumida por el núcleo Linux, los controladores multimedia RK, el marco multimedia RKMPP, los controladores de la NPU, los registros del sistema y los procesos en ejecución. En despliegues con múltiples cámaras, los marcos multimedia y la codificación de vídeo (grabación en H.264 / H.265) añaden una carga sustancial de memoria. Habilitar la codificación y grabación multicanal provoca aumentos bruscos adicionales en la presión sobre la memoria.
Nota importante: esto hace referencia a la memoria de trabajo (RAM DDR), no al almacenamiento eMMC. El eMMC solo almacena los archivos de vídeo codificados.
5.Aplicación - Capa de memoria empresarial La lógica de aplicación, que incluye el análisis de los resultados de inferencia, el seguimiento multiobjetivo, la generación de informes de datos, la memoria caché local y el almacenamiento de instantáneas, consume memoria. Por ejemplo, los algoritmos de seguimiento almacenan datos del objetivo en múltiples fotogramas. Un mayor número de cámaras y de objetos seguidos genera conjuntos de datos más grandes y un mayor consumo de memoria a nivel de aplicación.
El RK3576 es un procesador doméstico de inteligencia artificial periférica (edge AI) de gama media, con un rendimiento de 6 TOPS en su unidad de procesamiento neuronal (NPU), muy adecuado para despliegues de visión artificial con múltiples cámaras. Nuestra empresa dispone de varios productos maduros en producción en masa que soportan de 1 a 6 canales de cámara, adaptándose así a diversos requisitos de proyecto. La configuración estándar en producción en masa es de 4 GB de DDR, aunque se admiten tamaños alternativos de DDR según las cargas de trabajo específicas.
La tabla siguiente se aplica a los sensores comunes de cámaras de 1080p a 4K disponibles en el mercado:
Escenario de Aplicación |
Modo de operación de IA |
Capacidad recomendada de DDR |
Observaciones |
|
cámara monoculares |
Inferencia local de IA: detección de cruces de líneas, conteo de personas, conteo de materiales, con codificación de vídeo y captura instantánea de eventos; ejecuta modelos YOLO ligeros |
4 GB |
Admite operación completa de extremo a extremo para un canal. Adecuado para dispositivos independientes; no se recomienda la expansión a múltiples canales. |
|
Vigilancia estéreo / Control de acceso estéreo |
Transmisión y codificación simultáneas en dos canales; inferencia IA en modo compartido por tiempo y en serie |
4 GB |
Vista previa de vídeo disponible en dos canales. La IA se ejecuta de forma no simultánea, sacrificando parcialmente la respuesta en tiempo real. |
|
Puerta de enlace de adquisición de vídeo multicanal |
Captura local de imágenes, procesamiento ISP y transmisión codificada únicamente. Sin inferencia IA local; la inferencia se descarga a servidores de backend o a la nube |
4 GB–16 GB |
La IA concurrente local debe desactivarse en configuraciones multicanal. La presión sobre la memoria aumenta significativamente con varias cámaras de alta resolución de 4 MP. |
|
IA concurrente multicanal + grabación codificada multicanal |
Inferencia simultánea en múltiples canales mediante NPU, seguimiento de objetos, captura de instantáneas, grabación local, lógica empresarial compleja y soporte para la incorporación futura de modelos |
8 GB–16 GB |
Evalúe según la complejidad empresarial; debe reservarse una memoria intermedia suficiente. |
|
Si no está seguro de la configuración de memoria adecuada, póngase en contacto con [email protected]. Le proporcionaremos una evaluación personalizada de soluciones basada en la cantidad de canales de cámara, la resolución, la lógica empresarial y la carga de trabajo en tiempo de ejecución.
Noticias de actualidad2026-08-19
2025-08-21
2025-08-16
2025-08-15