Recibo esta pregunta con frecuencia de los integradores de sistemas que necesitan datos de coordenadas en vivo en sus transmisiones de video. Es importante porque una configuración incorrecta puede arruinar su evidencia o interrumpir su flujo de trabajo.
Sí, las coordenadas de seguimiento XY en tiempo real se pueden superponer directamente en la transmisión RTSP. Hay dos métodos principales: la superposición OSD a nivel de hardware, que graba permanentemente las coordenadas en cada fotograma de video, y la superposición de metadatos dinámicos, que envía los datos de coordenadas como una pista separada junto con el video. Cada método se adapta a diferentes necesidades del proyecto.

La elección correcta depende de su objetivo final. Si necesita evidencia a prueba de manipulaciones, la graba permanentemente. Si necesita datos flexibles e interactivos para su VMS o software personalizado, utiliza metadatos. A continuación, detallo las preguntas más comunes que mis clientes hacen sobre este tema. También comparto los desafíos del mundo real que resolvemos en nuestras implementaciones de PTZ solares 4G.
Índice
¿Se grabarán permanentemente los cuadros delimitadores de IA en la evidencia de video 4K grabada?
Esta es una preocupación que escucho de casi todos los gerentes de proyecto. Nadie quiere descubrir después de un despliegue de seis meses que las imágenes de evidencia no tienen datos críticos o están abarrotadas de cuadros que no pueden eliminar.
Si habilita la opción “Grabar información de eventos inteligentes” en el firmware de la cámara, sí, los cuadros delimitadores de IA y las coordenadas XY se incrustarán permanentemente en cada fotograma grabado. Esto significa que los datos se convierten en parte del contenido de los píxeles. Nadie puede eliminarlos o alterarlos después de la grabación. Esto es ideal para evidencia forense pero irreversible.

Cómo funciona realmente la superposición OSD grabada permanentemente
Permítame explicarle lo que sucede dentro de la cámara cuando activa esta función. El ISP (Procesador de Señal de Imagen)8 es el chip que procesa la imagen cruda del sensor. Antes de que el ISP entregue la imagen al codificador H.265, dibuja el cuadro delimitador y el texto de coordenadas directamente sobre los píxeles de la imagen. Para cuando el codificador comprime el fotograma, esos cuadros son solo parte de la imagen. No son diferentes de la marca de tiempo en la esquina.
Esto significa que todos los dispositivos que reproduzcan el video verán los cuadros. No importa si usa VLC5, un DVR barato o un VMS de alta gama como Hito4. Los datos siempre son visibles.
Cuándo usar la grabación permanente y cuándo evitarla
Aquí está la pregunta clave: ¿Quién es su usuario final?
Si su cliente es una agencia de aplicación de la ley, una unidad de control fronterizo o un operador de infraestructura crítica, a menudo requieren que los eventos de detección se documenten visualmente en la propia grabación. En el tribunal, un abogado puede señalar la pantalla y decir: “El sistema detectó un intruso en las coordenadas de píxeles (1423, 876) a las 02:14:07 AM”. Esa es evidencia poderosa.
Pero si su cliente es un operador de ciudad inteligente que alimenta video a una plataforma centralizada de IA para análisis secundario, las cajas "quemadas" se convierten en ruido. El sistema de IA secundario podría intentar detectar el cuadro delimitador como un objeto. He visto que esto sucede. Crea falsos positivos.
Integridad de la evidencia frente a flexibilidad analítica
| Factor | OSD "quemado" en la imagen | Video limpio (sin "quemado") |
|---|---|---|
| Admisibilidad en el tribunal | Alto: los datos son a prueba de manipulaciones | Requiere un registro de metadatos separado como prueba |
| Análisis de IA secundario | Pobre: las cajas interfieren con la detección | Excelente: fotogramas limpios para reprocesamiento |
| Impacto en el almacenamiento | Aumento mínimo (~1-2%) | Sin impacto |
| Control del usuario | Ninguno después de la grabación | Control total a través del VMS |
| Compatibilidad de reproducción | Universal | Depende del soporte de metadatos de VMS |
Mi recomendación: si su proyecto tiene un doble propósito (evidencia + análisis), grabe dos flujos. Use el flujo principal con quemado para el almacenamiento de evidencia. Use el subflujo limpio para su backend de IA. Nuestro firmware admite esta configuración de doble flujo de fábrica.
¿Puedo activar/desactivar la superposición de coordenadas XY a través de la configuración OSD de la cámara?
Tuve un cliente en Texas el año pasado que quería que las coordenadas fueran visibles durante la monitorización en vivo pero completamente ocultas durante la reproducción para la revisión de privacidad de su cliente. Supuso que un simple interruptor lo manejaría. La realidad es más matizada.
Sí, puede activar o desactivar la superposición de coordenadas XY a través del menú OSD de la cámara, pero solo si está utilizando el método de superposición de metadatos. Si eligió el método de quemado duro, el interruptor solo afecta a los fotogramas futuros. No puede eliminar las coordenadas de los fotogramas ya grabados. Para una flexibilidad total de encendido/apagado, el enfoque de metadatos es la opción correcta.

Comprensión de los dos comportamientos del interruptor
Cuando accede a la configuración OSD de la cámara y encuentra la opción “Superposición inteligente” o “Pantalla de IA”, lo que sucede cuando la activa depende completamente de qué método de superposición está utilizando su firmware.
Escenario A — Modo de quemado duro: Desactiva el interruptor. La cámara deja de dibujar cuadros en los nuevos fotogramas. Pero cada fotograma grabado antes de ese momento todavía tiene los cuadros incrustados. No hay vuelta atrás. Piénselo como escribir con un marcador permanente en una fotografía. Puede dejar de escribir, pero no puede borrar lo que ya está allí.
Escenario B — Modo de metadatos: Desactiva el interruptor. La cámara todavía envía el flujo de metadatos (las coordenadas XY en formato XML o JSON). Pero la propia vista previa de la cámara deja de renderizar la superposición. Su VMS puede decidir de forma independiente si mostrar o no las coordenadas. Esto le da control capa por capa.
Opciones del menú OSD en nuestro firmware
Nuestro Cámaras PTZ7 proporciona un control granular sobre lo que se muestra. Aquí tiene lo que puede configurar:
- Visualización de cuadro delimitador: Activado / Desactivado
- Texto de coordenadas (X, Y): Activado / Desactivado
- Etiqueta de clasificación de objetos (Persona, Vehículo, etc.): Activado / Desactivado
- Puntuación de Confianza: Activado / Desactivado
- Número de ID de Seguimiento: Activado / Desactivado
Cada uno de estos se puede activar/desactivar de forma independiente. Por lo tanto, si su cliente solo quiere ver el ID de seguimiento y el cuadro delimitador, pero no las coordenadas sin procesar, esa es una configuración simple del firmware.
Un error común que veo en el campo
Muchos integradores configuran la superposición OSD durante las pruebas de banco y olvidan ajustarla antes de la implementación. Luego, el usuario final se queja: “¿Por qué veo números por toda mi pantalla?”. O peor aún, apagan todo durante la configuración y luego, seis meses después, preguntan: “¿Dónde están mis datos de coordenadas?”.”
Mi consejo: cree una lista de verificación de configuración para cada proyecto. Documente exactamente qué superposiciones están activadas, cuáles están desactivadas y si está utilizando el modo de grabación permanente o de metadatos. Guarde el archivo de configuración. Nuestras cámaras admiten la exportación e importación de configuraciones, por lo que puede clonar configuraciones en cientos de unidades.
Resumen del comportamiento de activación/desactivación
| Acción | Modo de grabación permanente | Modo de superposición de metadatos |
|---|---|---|
| Desactivar en OSD | Deja de grabar solo en fotogramas nuevos | Deja de renderizar en la vista previa de la cámara; los metadatos aún se transmiten |
| Activar en OSD | Reanuda la grabación en fotogramas nuevos | Reanuda la renderización en la vista previa de la cámara |
| Efecto en grabaciones pasadas | Sin cambios — los cuadros son permanentes | Sin cambios — los metadatos siempre se almacenan por separado |
| Control independiente del VMS | No es posible | Completamente posible |
¿Cómo ayuda la superposición de coordenadas a mi equipo a coordinar las respuestas manuales de PTZ?
En grandes proyectos de seguridad perimetral, a menudo veo una desconexión entre el operador que detecta la amenaza y el equipo de campo que responde. El operador dice: “Está en el lado izquierdo de la pantalla”. Eso es inútil cuando la cámara cubre una línea de valla de 2 kilómetros.
La superposición de coordenadas XY da a sus operadores un lenguaje numérico preciso para comunicar las posiciones de los objetivos. En lugar de descripciones vagas, su sala de control puede comunicarse por radio con el equipo de campo con ángulos de paneo e inclinación exactos derivados de los datos XY. Esto reduce significativamente el tiempo de coordinación de respuesta y elimina las conjeturas en el control manual de PTZ.

De coordenadas de píxeles a posiciones del mundo real
Así es como funciona realmente el flujo de trabajo en un sistema bien configurado. La IA de la cámara detecta a una persona en las coordenadas de píxeles (1423, 576) en un fotograma de 1920 × 1080. El firmware conoce el ángulo de paneo actual es de 127.4° y el ángulo de inclinación es de -8.2°. También conoce el campo de visión al nivel de zoom actual es de 6.3° horizontal.
Usando matemáticas simples, el firmware calcula que el objetivo está aproximadamente 1.2° a la derecha del centro del fotograma y 0.5° por encima del centro. Luego, emite el rumbo absoluto: Paneo 128.6°, Inclinación -7.7°. Esto es lo que se muestra en la superposición o se envía a través de metadatos.
Por qué esto importa para la anulación manual
En muchos de nuestros Despliegues PTZ solares 4G1, la cámara funciona en modo de seguimiento automático la mayor parte del tiempo. Pero hay momentos en que el operador necesita tomar el control manual. Quizás la IA perdió el objetivo detrás de un árbol. Quizás hay dos objetivos y el operador quiere centrarse en el segundo.
Sin datos de coordenadas, el operador tiene que escanear visualmente la escena, adivinar a dónde fue el objetivo y mover manualmente el PTZ. Con datos de coordenadas, el operador ve la última posición conocida — digamos, Paneo 214.3°, Inclinación -3.1° — y puede introducir esos números directamente en el controlador PTZ. Algunas plataformas VMS incluso admiten “hacer clic para ir a la coordenada”, lo que lo hace instantáneo.
Coordinación entre múltiples cámaras
Esto se vuelve aún más potente cuando tienes múltiples cámaras PTZ que cubren la misma área desde diferentes ángulos. Si la Cámara A informa de un objetivo en el rumbo geográfico 214°, la Cámara B puede girar automáticamente al mismo rumbo. O el operador puede comandar manualmente a la Cámara B que mire a 214°. La superposición de coordenadas hace posible esta transferencia entre cámaras sin que el operador necesite memorizar qué cámara cubre qué zona.
Escenario del mundo real: Monitoreo de tuberías en West Texas
Uno de nuestros clientes monitorea un corredor de tuberías de 15 millas con seis unidades PTZ solares. Cada cámara cubre aproximadamente 2.5 millas. Cuando la Cámara 3 detecta un vehículo cerca de la tubería en una coordenada específica, el operador ve los valores de paneo/inclinación en la pantalla. Le dice por radio al camión de patrulla: “Objetivo en la Cámara 3, rumbo 187 grados, aproximadamente a 800 metros del cruce de la carretera de acceso”. El equipo de patrulla sabe exactamente a dónde ir. Antes de tener superposiciones de coordenadas, la llamada por radio era: “La Cámara 3 ve algo en el lado derecho”. El equipo de patrulla conduciría durante 20 minutos tratando de encontrarlo.
Esa es la diferencia que marcan los datos de coordenadas. Convierte las alertas vagas en inteligencia procesable.
¿Afecta la superposición a la eficiencia de compresión H.265 de la transmisión de video en vivo?
Esta es la pregunta que separa a los compradores casuales de los ingenieros serios. Cada integrador de sistemas con el que trabajo que gestiona implementaciones 4G con ancho de banda limitado hace esta pregunta. Y deberían. Porque en un sitio con energía solar y una tarjeta SIM 4G, cada kilobit importa.
El impacto depende del método de superposición que utilice. El OSD quemado a fuego añade texto y cuadros de alto contraste a la imagen, lo que reduce ligeramente la eficiencia de la compresión H.265 porque el codificador debe preservar esos bordes nítidos. El aumento es típicamente del 3-8% en la tasa de bits. La superposición de metadatos tiene un impacto nulo en la compresión de video porque los datos de coordenadas viajan en un canal separado y ligero.

Por qué el quemado a fuego perjudica la compresión (un poco)
H.265 (HEVC) es muy bueno comprimiendo escenas naturales. Césped, cielo, árboles, carreteras: estos tienen gradientes suaves y movimiento predecible. El codificador explota esta predictibilidad para lograr altas relaciones de compresión.
Pero cuando se incrustan en la imagen texto nítido de alto contraste y formas geométricas (como cuadros delimitadores), se introducen elementos que el codificador no puede predecir bien. Una etiqueta blanca “X:1423 Y:576” sobre un fondo oscuro crea bordes duros que requieren más bits para codificar con precisión. El codificador tiene que gastar bits adicionales para mantener esos caracteres legibles.
¿De Cuánto Ancho de Banda Adicional Estamos Hablando?
En nuestras pruebas de laboratorio, esto es lo que medimos en una escena típica al aire libre a 1080p, 25fps, Perfil principal de H.2656:
| Configuración de superposición | Bitrate medio | Aumento vs. Limpio |
|---|---|---|
| Sin superposición (video limpio) | 2.8 Mbps | Línea de base |
| Solo marca de tiempo | 2.85 Mbps | +1.8% |
| Marca de tiempo + 1 cuadro delimitador + texto XY | 2.92 Mbps | +4.3% |
| Marca de tiempo + 5 cuadros delimitadores + texto XY | 3.03 Mbps | +8.2% |
| Superposición de metadatos (sin incrustación) | 2.8 Mbps + 3 kbps de metadatos | ~0% en el flujo de video |
Como puede ver, uno o dos cuadros delimitadores apenas importan. Pero si está monitoreando una intersección concurrida con más de 10 detecciones simultáneas, el aumento de la tasa de bits se acumula. En una conexión 4G con un límite de datos mensual, ese aumento de 8% durante 30 días podría costarle dinero real a su cliente.
El problema del presupuesto de ancho de banda 4G
Permítanme poner esto en perspectiva. Un plan típico de SIM 4G para un dispositivo IoT industrial en EE. UU. le ofrece de 50 a 100 GB por mes. A 2.8 Mbps de transmisión continua, consume alrededor de 900 GB por mes. Obviamente, nadie transmite 24/7 a la máxima velocidad de bits en 4G. Utiliza grabación activada por movimiento, tasa de bits adaptativa y ventanas de transmisión programadas.
Pero incluso con esas optimizaciones, un aumento del 8% en la tasa de bits significa un 8% más de consumo de datos. En una implementación de 100 cámaras, eso es significativo.
Nuestro Enfoque: Programación Inteligente de Superposición
Es por eso que creamos una función llamada ‘Programación Inteligente de Superposición’2 en nuestro firmware. Funciona así:
- Durante eventos de alarma, la cámara habilita automáticamente la superposición de coordenadas para que el clip de evidencia tenga datos visuales completos.
- Durante vigilancia normal (sin alarma), la cámara deshabilita la superposición y envía las coordenadas solo a través del canal de metadatos.
- La transición ocurre dentro de un GOP (Grupo de Imágenes)9, que típicamente es de 2 segundos.
Esto le brinda lo mejor de ambos mundos. Sus clips de evidencia tienen coordenadas superpuestas para el tribunal. Sus grabaciones de vigilancia de rutina permanecen limpias y eficientes en cuanto al ancho de banda. Y su factura de datos 4G se mantiene bajo control.
Sincronización PTS sobre redes 4G
Hay un detalle técnico más que es importante para las implementaciones 4G. Cuando la cámara envía la transmisión de video y la transmisión de metadatos a través de una conexión 4G, la fluctuación de la red puede hacer que lleguen al VMS en momentos diferentes. El fotograma de video puede llegar 500 ms tarde, pero el pequeño paquete de metadatos llega a tiempo.
Si su VMS superpone ingenuamente los metadatos a medida que llegan, el cuadro delimitador parecerá “adelantarse” al objetivo. El cuadro se mueve antes que la persona. Esto parece defectuoso.
Nuestro firmware resuelve esto con sincronización PTS (Marca de Tiempo de Presentación)3. Cada paquete de metadatos lleva la misma marca de tiempo que el fotograma de video al que pertenece. El VMS almacena en búfer ambas transmisiones y las alinea por marca de tiempo antes de renderizarlas. El resultado: el cuadro delimitador permanece fijo en el objetivo, incluso en una conexión 4G entrecortada en un campo petrolero remoto de Texas.
Conclusión
La superposición de coordenadas XY en transmisiones RTSP es totalmente factible. Elija la incrustación permanente para pruebas a prueba de manipulaciones. Elija la superposición de metadatos para mayor flexibilidad y ahorro de ancho de banda. Adapte el método a las necesidades reales de su proyecto.
1. Cámaras PTZ alimentadas por energía solar que utilizan redes celulares 4G para la vigilancia remota. ︎↩︎ 2. Función de firmware que permite la incrustación solo durante las alarmas para ahorrar ancho de banda. ︎↩︎ 3. Marca de tiempo utilizada para sincronizar transmisiones de video y metadatos para mantener la alineación. ︎↩︎ 4. Plataforma de software de gestión de video popular que admite la superposición de metadatos. ︎↩︎ 5. Reproductor de medios de código abierto que puede mostrar transmisiones de video con superposiciones. ︎↩︎ 6. Estándar de compresión de video también conocido como HEVC, utilizado para una transmisión de video eficiente. ︎↩︎ 7. Cámara capaz de panorámica, inclinación y zoom, comúnmente utilizada en vigilancia. ︎↩︎ 8. Chip que procesa datos de imagen sin procesar antes de la codificación, donde ocurre la incrustación. ︎↩︎ 9. Secuencia de fotogramas en video comprimido utilizada para la eficiencia de la codificación. ︎↩︎