Qué es. Esto es una demo, no un producto terminado. Argira es un prototipo interno que explora si es posible generar texto alternativo para imágenes de forma automática, sin depender de un modelo de IA entrenado para describir imágenes.
Cómo funciona. Al analizar una imagen, la herramienta la dibuja en un lienzo oculto y mide propiedades estadísticas de sus píxeles — variación de color, densidad de bordes, entropía de tono y saturación. Con esas métricas, un heurístico (un conjunto de reglas ponderadas, no un modelo entrenado) estima si la imagen es probablemente una fotografía, una pintura, una ilustración o una imagen generada por IA. Según ese tipo, se construye una oración de texto alternativo con una plantilla simple. A diferencia de la mayoría de herramientas de este tipo, Argira expone las métricas y la confianza del resultado en lugar de entregar una oración final sin mostrar la incertidumbre detrás.
Qué no hace esta demo. Esta demo concreta no realiza reconocimiento semántico mediante un modelo de visión: no puede identificar objetos, personas o escenas — no puede decir "un perro corriendo en la playa", solo "esto parece una fotografía". El proyecto ARGIRA en su conjunto incluye otras herramientas capaces de trabajar con el contenido real de una imagen (disponibles en argira.eus), pero esta demo concreta utiliza únicamente el heurístico estadístico y las plantillas descritos arriba.
Por qué algunas imágenes no se pueden analizar. Debido a una restricción de seguridad del navegador, solo se puede leer el contenido de los píxeles de imágenes cuyo servidor de origen lo permita explícitamente, o de archivos subidos localmente. Esto no es un fallo de la herramienta, sino una restricción del propio navegador.
Cómo se compara con otras herramientas. Ya existen herramientas comerciales (AltText.ai, Alt Magic, generadores integrados en algunos CMS) que usan modelos de visión entrenados para describir el contenido real de una imagen — "un jersey de lana azul", "un golden retriever jugando en el césped". Esta demo no compite con eso ni intenta reemplazarlo: explora una pregunta distinta, si sin un modelo de visión es posible al menos clasificar el tipo de imagen siendo transparente sobre la incertidumbre de esa estimación.
Un heurístico basado en estadísticas de píxeles nunca reconocerá objetos ni escenas, pero puede complementar a un modelo de visión aportando contexto sobre su propia certeza — por ejemplo, si clasifica una imagen como "posiblemente sintética" o reporta poca confianza, esa información puede acompañar el texto alternativo generado por otro sistema. Para la accesibilidad esto importa: las personas usuarias de lectores de pantalla a menudo no tienen otra forma de juzgar la fiabilidad de una descripción generada automáticamente.