【
Ciudad inteligenteColumna de marca en línea] si hay alguien nadando en el embalse, alerte a tiempo. en el pasado, se trataba de una instrucción entregada al Administrador de seguridad, mientras que en el Congreso Mundial de inteligencia artificial 2026 (waic 2026), HIKVISION mostró una nueva posibilidad: dirigir esta tarea directamente a una Cámara.

El 17 de julio, el primer día de la apertura de waic 2026, HIKVISION lanzó una cámara inteligente multimodal, logrando que "la cámara funcione en una palabra". Por ejemplo, en los escenarios de gestión de la seguridad de los embalses, las cámaras tradicionales ven "personas" y "aguas", mientras que las cámaras inteligentes multimodal con tareas establecidas no solo pueden monitorear áreas de riesgo en tiempo real, describir con precisión los personajes, Estados y entornos en los escenarios, sino también entender mejor los escenarios, juzgar que "hay riesgo de ahogamiento en la Natación de las personas" y tomar la iniciativa de vincular altavoces para emitir advertencias. Esta capacidad de "entender, entender y ejecutar" marca que las cámaras están evolucionando hacia "asistentes inteligentes" que sirven activamente.

Este avance se ha beneficiado de la profunda integración del gran modelo multimodal y la arquitectura de computación de borde. "Hemos instalado el gran modelo multimodal en este pequeño fuselaje para que no solo pueda percibir con precisión, sino también reconocer, juzgar y responder rápidamente, adaptándose a Escenas similares a los recordatorios de agua cercana que están relacionadas con la seguridad y requieren un mayor tiempo real", dijo el responsable de hikvision. en comparación con las cámaras tradicionales, las cámaras inteligentes multimodal tienen una Mayor capacidad de comprensión de escenas, una configuración de tareas más flexible y una capacidad de procesamiento de bordes más en tiempo real.
Específicamente, las cámaras tradicionales solo pueden ver lo que hay en la imagen, y las cámaras con un gran modelo visual único pueden entender lo que hay en la imagen, pero no pueden responder a las instrucciones lingüísticas humanas. A través de la capacidad multimodal, la Cámara inteligente multimodal ha logrado un triple salto: primero, la actualización interactiva, desde la escritura de reglas complejas hasta la expresión directa de las necesidades; El segundo es entender la actualización, desde identificar "hay un grupo de personas" hasta entender "están nadando, hay riesgos"; El tercero es la actualización de la toma de decisiones, desde la alarma pasiva hasta la vinculación activa de sonido, luz y control de notificación.
En términos de potencia computacional y parámetros, la Cámara inteligente multimodal integra la Potencia computacional 26t, el modelo multimodal de parámetros 2b incorporado, admite la comprensión profunda de la imagen y el análisis semántica, y puede lograr un circuito cerrado de interacción multimodal en el lado final, que se puede utilizar ampliamente en los campos de la seguridad pública, la gobernanza urbana, la fabricación Industrial y la producción segura.
Cabe mencionar que la Cámara inteligente multimodal admite el control del lenguaje natural y puede mejorar efectivamente la eficiencia del negocio. Tomando como ejemplo la aplicación en escenarios de producción de seguridad, el usuario solo necesita introducir un lenguaje natural, como "las personas que entran en la zona de construcción sin ropa reflectante deben llamar a la policía", el sistema lo convierte inmediatamente en una regla de control dinámico, y una vez que el flujo de video en tiempo real en el lado final coincide con el objetivo, inmediatamente activa la alarma y admite dispositivos periféricos como sonido, luz y control de acceso. De la recuperación pasiva a la defensa activa, la verificación posterior a la intervención en el evento para lograr una gestión de circuito cerrado.
En el área de exhibición waic 2026 hikvision, los espectadores también pueden experimentar personalmente esta inteligencia "al alcance de la mano". Al hacer clic en las entradas de la pantalla, como "qué escena es esta, analizar el comportamiento de riesgo en la escena" o "detectar si alguien está nadando en la imagen, si hay, alerta", la Cámara inteligente multimodal puede analizar automáticamente el contenido del video y generar resultados gráficos de preguntas y respuestas, mensajes de alerta temprana en tiempo real en la pantalla, y vincular la alerta de voz "aquí está prohibido nadar, por favor salga lo antes posible".

Esta demostración no solo muestra intuitivamente la fuerza de HIKVISION en la comprensión gráfica y la interacción con el lenguaje natural, sino que también hace que el público sienta personalmente que el gran modelo no solo "puede entender", sino también "puede hablar" y "puede trabajar", sino que es un asistente inteligente que realmente puede arraigarse en escenas de primera línea.
Desde el recordatorio de agua cercana al embalse hasta la producción segura de la fábrica, desde la gobernanza urbana hasta el comercio minorista inteligente...... En el pasado, muchos escenarios de análisis inteligentes estaban limitados por el ancho de banda de la red o el costo de la Potencia de cálculo en la nube, por lo que era difícil lograr una respuesta en tiempo real. Con su profunda acumulación en el campo de la IOT inteligente, HIKVISION continúa promoviendo el aterrizaje de la tecnología de Ia en el extremo marginal. hoy en día, el lanzamiento de cámaras inteligentes multimodal marca que la capacidad de Ia realmente puede hundirse en el último kilómetro de aplicaciones industriales, lo que inyectará un nuevo impulso creciente en la transformación digital de miles de industrias.