Flujo de trabajo visual que muestra imágenes, documentos escaneados y decisiones de revisión apoyadas por visión por computadora
Flujo de trabajo visual que muestra imágenes, documentos escaneados y decisiones de revisión apoyadas por visión por computadora

¿Qué es CV?

Fundamentos, modelos y capacidades de IA

CV significa Computer Vision (visión por computadora). Es el área de la IA dedicada a ayudar a los sistemas a interpretar información visual procedente de imágenes, vídeos, escaneos, documentos y cámaras. Un sistema de visión por computadora puede reconocer objetos, leer texto de un documento, detectar daños, comparar imágenes, verificar la calidad de un producto o señalar un problema de seguridad. CV no es lo mismo que OCR, aunque el OCR es una capacidad relacionada importante. En los negocios, la visión por computadora resulta más útil cuando la información visual ya impulsa un flujo de trabajo y la organización quiere revisiones más rápidas o verificaciones más consistentes.

Revisado por Jackie, Head of Learning & Development, Levellers - Última revisión: 8 de junio de 2026

Qué significa esto

La visión por computadora se entiende mejor como reconocimiento de patrones aplicado al material visual. Las personas miran una imagen y perciben qué está presente, qué falta, qué está dañado, qué resulta inusual o qué es importante. Los sistemas de CV intentan apoyar partes de ese proceso extrayendo información útil de los píxeles. Esa información puede ser una etiqueta, un cuadro delimitador, una puntuación de confianza, un valor de texto, un recuento, una comparación o una indicación para revisión humana.

El término puede evocar robótica o vehículos autónomos, pero las organizaciones pequeñas y medianas pueden encontrar CV en la captura de documentos, verificación de identidad, reclamaciones de seguros, control de inventario, fotografía de productos, inspección de propiedades, gestión de activos o herramientas de IA multimodal que analizan capturas de pantalla e imágenes.

Un proyecto de CV práctico debe comenzar por la decisión de negocio. ¿El sistema ayuda a alguien a leer un documento, inspeccionar un activo, verificar una condición, clasificar un caso visual o detectar excepciones? La respuesta determina los datos, los requisitos de precisión y los controles de revisión.

Por qué es importante

La visión por computadora importa porque muchos procesos de negocio siguen dependiendo de que las personas miren. El personal revisa fotos de mercancías dañadas, albaranes, estantes, formularios, documentos de identidad, imágenes de propiedades, grabaciones de seguridad o materiales de marketing. Este trabajo puede ser lento e inconsistente, especialmente cuando las imágenes llegan en distintos formatos y niveles de calidad.

CV puede ayudar convirtiendo el material visual en señales estructuradas. Puede contar, clasificar, comparar, recortar, marcar y enrutar. Puede hacer que grandes conjuntos de imágenes sean buscables. Puede ayudar a los equipos a encontrar los pocos casos que requieren atención en lugar de revisar manualmente cada elemento. Combinado con OCR, NLP o automatización de flujos de trabajo, puede trasladar información de una fuente visual a un proceso de negocio.

Para las organizaciones más pequeñas, la oportunidad no suele ser construir un modelo de visión a medida, sino utilizar CV dentro de las herramientas existentes: captura de documentos, plataformas de reclamaciones, sistemas de inventario, herramientas de control de calidad, productos de seguridad o asistentes de IA. El valor depende de si la herramienta reduce un cuello de botella real y de si las personas confían suficientemente en los resultados para utilizarlos.

El riesgo es que los resultados visuales parezcan objetivos. Un cuadro alrededor de un objeto o una puntuación de confianza pueden parecer definitivos, pero el sistema puede equivocarse por la iluminación, el ángulo, las obstrucciones, ejemplos de entrenamiento deficientes o un contexto desconocido. CV debe apoyar el juicio operativo en lugar de reemplazarlo silenciosamente donde los errores importan.

Cómo funciona

Un flujo de trabajo de visión por computadora comienza con una entrada visual. Esa entrada puede ser una foto, un fotograma de vídeo, un PDF escaneado, una captura de pantalla, un formulario, una cámara en directo o una imagen integrada en otro sistema. La calidad importa. La baja resolución, el deslumbramiento, las sombras, el desenfoque, la compresión, el ángulo inadecuado, los fondos desordenados y el encuadre inconsistente pueden reducir el rendimiento.

El sistema realiza entonces una o varias tareas. La clasificación de imágenes asigna una etiqueta a toda la imagen, como "embalaje dañado". La detección de objetos localiza elementos dentro de la imagen, como palés, herramientas, defectos o equipos de seguridad. La segmentación separa partes de una imagen. El OCR extrae texto de documentos visuales o imágenes. La comparación visual verifica si un elemento se parece a una imagen de referencia. Los sistemas multimodales combinan la comprensión de imágenes con el lenguaje, de modo que un usuario puede hacer preguntas sobre una captura de pantalla o una fotografía.

El entrenamiento y la evaluación dependen de los ejemplos. Si un sistema se entrena o ajusta con imágenes etiquetadas, las etiquetas deben ser consistentes y pertinentes. Si el sistema se adquiere como herramienta de un proveedor, la organización igualmente necesita probarlo con sus propias condiciones de imagen. Un modelo que funciona bien con imágenes de productos nítidas puede fallar con fotos de almacén con poca luz o imágenes tomadas con el móvil por clientes.

El despliegue es la parte operativa. Los equipos deben decidir qué ocurre en cada nivel de confianza, cuándo interviene una persona, cómo se notifican los errores, cómo se almacenan las imágenes y quién se encarga del seguimiento. El flujo de trabajo debe contemplar los permisos de acceso, la retención y la seguridad, especialmente cuando las imágenes incluyen personas, instalaciones, documentos o datos personales.

Dónde aparece en flujos de trabajo reales

En el procesamiento de documentos, CV y OCR pueden leer formularios escaneados, facturas, albaranes y expedientes de solicitud. El sistema puede identificar el tipo de documento, extraer el texto visible y enrutar el archivo a la cola correcta. La revisión humana sigue siendo necesaria para los campos de baja confianza, la escritura a mano, los formatos inusuales y las decisiones de alto impacto.

En los flujos de trabajo de seguros o propiedades, CV puede ayudar a clasificar fotos de daños. Un equipo de reclamaciones podría utilizarlo para agrupar imágenes de tejados, vehículos o contenidos, y marcar los casos en que la calidad de la foto es demasiado baja para su evaluación. La herramienta no debe tratarse como el evaluador definitivo cuando están en juego la responsabilidad, el fraude, la seguridad o la vulnerabilidad del cliente.

Malentendidos frecuentes

Un malentendido habitual es creer que la visión por computadora y el OCR son lo mismo. El OCR se centra en reconocer texto en imágenes o documentos escaneados. La visión por computadora es más amplia: puede incluir detección de objetos, clasificación de imágenes, comparación visual, segmentación, análisis de movimiento y comprensión multimodal de imágenes.

Otro malentendido es que CV ve el mundo como lo hacen las personas. No es así. Procesa patrones visuales en función de su diseño, sus datos y su evaluación. Puede pasar por alto lo obvio si la imagen difiere de sus ejemplos de entrenamiento. También puede detectar un patrón que no tiene ningún significado práctico.

Los responsables también pueden asumir que más imágenes siempre implican mejor rendimiento. Más datos solo ayudan si son pertinentes, representativos y están correctamente etiquetados. La calidad de los datos, la consistencia del etiquetado y el diseño de las pruebas importan más que el volumen por sí solo.

Por último, CV a veces se trata únicamente como un tema de vigilancia. La vigilancia es un límite importante, pero muchos usos de CV no son vigilancia: la captura de documentos, los controles de calidad, la clasificación de productos y la búsqueda de imágenes son casos de uso distintos. La gobernanza debe ajustarse al uso real, no al acrónimo.

Riesgos y límites

Los mayores riesgos de CV se producen cuando la interpretación visual afecta a personas o desencadena consecuencias operativas. Los falsos positivos pueden generar investigaciones innecesarias, reclamaciones rechazadas, accesos bloqueados o trato injusto. Los falsos negativos pueden pasar por alto problemas de seguridad, defectos, falta de existencias o indicios de fraude. El equilibrio depende del flujo de trabajo y del coste de cada tipo de error.

Las imágenes y los vídeos pueden incluir datos personales. Cuando los sistemas identifican o monitorizan personas, la posición en materia de protección de datos se vuelve más delicada. El reconocimiento biométrico es un ámbito específico y puede implicar datos biométricos de categoría especial cuando se utiliza para identificar de forma unívoca a una persona. No todo flujo de trabajo de procesamiento de imágenes constituye reconocimiento biométrico, pero los responsables deben evitar suposiciones apresuradas. El propósito, el contexto y la capacidad son determinantes.

La monitorización en el lugar de trabajo requiere especial cuidado. Un sistema de cámaras que verifica si se lleva el equipo de protección es diferente de un sistema que rastrea a trabajadores individuales, puntúa el rendimiento o identifica rostros. Cuanto más afecte el flujo de trabajo a las personas, mayor será la necesidad de transparencia, necesidad, proporcionalidad, controles de acceso y revisión.

También existen riesgos de seguridad y confidencialidad. Las imágenes pueden mostrar documentos de clientes, pizarras, almacenes, pantallas, direcciones o activos comercialmente sensibles. Las herramientas de proveedores deben evaluarse en cuanto al tratamiento de datos, la retención, el uso para entrenamiento de modelos, el acceso y la eliminación. CV no debe convertirse en una vía de carga no controlada de material sensible.

Qué deben hacer los responsables a continuación

Comience con un flujo de trabajo de bajo riesgo y visualmente claro. Los buenos candidatos incluyen la clasificación de tipos de documentos, el etiquetado de imágenes, la revisión de activos, la organización de fotografías de inventario o un control de calidad en el que la revisión humana siga siendo central. Evite comenzar con vigilancia, identidad, monitorización de personal o decisiones de elegibilidad de alto impacto, salvo que exista una necesidad de negocio sólida y una gobernanza adecuada.

Describa por escrito la tarea visual. Defina las imágenes de entrada, la calidad aceptable, el resultado esperado, los umbrales de confianza, las reglas de revisión humana y los puntos de escalada. Utilice ejemplos reales, incluidas imágenes deficientes, casos límite y formatos inusuales.

Pruebe la herramienta en las condiciones en que se utilizará realmente. No se base en demostraciones del proveedor con imágenes perfectas. Revise los falsos positivos y los falsos negativos por separado. Pregúntese quién se ve afectado por los errores y si el flujo de trabajo les ofrece una vía de corrección.

Por último, conecte CV al flujo de información más amplio. El texto extraído, las etiquetas de imagen o las marcas necesitan un destino: un sistema de gestión documental, una cola de casos, un CRM, una plataforma de inventario o un registro de calidad. Una herramienta de visión que produce un resultado impresionante pero no modifica el flujo de trabajo aportará poco valor.

¿Tiene alguna pregunta o sugerencia, o desea saber cómo investigamos y revisamos estas guías? Lea sobre nuestros estándares editoriales y cómo contactarnos.

Preguntas frecuentes

¿Es el OCR parte de la visión por computadora?

El OCR está estrechamente relacionado con la visión por computadora porque reconoce texto a partir de material visual como escaneos, fotografías y PDF. Sin embargo, CV es más amplio que el OCR. Un sistema de visión por computadora puede clasificar imágenes, detectar objetos, comparar características visuales, identificar defectos o interpretar vídeo. El OCR es una capacidad importante dentro de muchos flujos de trabajo de documentos e imágenes, pero no abarca todo el campo.

¿Puede la visión por computadora eliminar la inspección manual?

En algunos casos puede reducirla, pero los responsables deben ser prudentes ante una sustitución total. CV suele ser más eficaz como capa de clasificación que identifica posibles problemas, imágenes de baja calidad o casos que requieren revisión. La automatización completa exige una confianza mucho mayor, una tolerancia al error bien definida y un seguimiento riguroso. En muchos flujos de trabajo prácticos, el mejor resultado es reducir las verificaciones rutinarias y mejorar la atención humana en las excepciones.

¿Qué hace que un proyecto de visión por computadora fracase?

Muchos fracasos se deben a la mala calidad de las imágenes, condiciones de captura inconsistentes, etiquetas deficientes, reglas de revisión poco claras o una discrepancia entre la demostración y el flujo de trabajo real. El sistema puede funcionar en una prueba controlada pero fallar con fotos de clientes, la iluminación de un almacén o variantes de producto inusuales. CV también falla cuando los resultados no están conectados a un proceso de negocio.

Fuentes