Qué es ARGIRA
ARGIRA es una iniciativa de investigación y accesibilidad que explora nuevas formas de representar información mediante tecnología, incluyendo enfoques de sonificación diseñados para crear experiencias más ricas para personas con discapacidad visual.
Escribe para filtrar publicaciones y secciones de esta página. Los resultados aparecen debajo como una lista de enlaces.
Investigación en curso · 2026
ARGIRA
Sonificación
y Métricas
Perceptuales
Ranero García, Jose
Zenodo · CC BY-NC 4.0
¿Puede la estructura visual de una imagen predecir cómo suena perceptualmente? ARGIRA es un proyecto de investigación que responde esta pregunta a través de resultados negativos sistemáticos — mapeando los límites de lo que las representaciones visuales estándar pueden y no pueden explicar sobre la percepción sonora.
Esta página es el índice y resumen de la serie de estudios ARGIRA (I–XII), publicados en Zenodo con DOI verificable — no un artículo único, sino el mapa de todo el programa de investigación: experimentos, datos, hallazgos y las herramientas interactivas derivadas de ellos.
La pregunta central
¿Cómo influye el diseño del mapping en la información visual que sobrevive en la representación acústica?
Pregunta inicial (ARGIRA I–III): ¿Es Δ predecible a partir de características visuales? — Los experimentos mostraron que no. ARGIRA IV explica por qué.
Un mapa de lo que
no explica Δ
ARGIRA no es un modelo predictivo. Es un marco de eliminación representacional estructurada: una secuencia de experimentos diseñada para determinar qué clases de representación visual son insuficientes para capturar la diferencia perceptual entre mappings de sonificación.
El proyecto evalúa tres niveles jerárquicos de representación —estadísticas de bajo nivel, espacios de características expandidos y embeddings semánticos proxy— usando regresión lineal robusta y Random Forest con validación cruzada de 5 folds. El corpus incluye ~86 imágenes de dos colecciones visuales heterogéneas: pinturas postimpresionistas y fotografías de paisaje de museo.
Los resultados negativos no son un problema del programa — son su mecanismo. Serie completa · zenodo.20534327 ↗ (abre en nueva pestaña)
Antes de la pregunta,
el programa.
Los experimentos 11–15 no surgieron en el vacío. El proyecto acumuló durante meses un corpus de observaciones previas —pipelines, benchmarks, corpus de naturaleza, análisis de clustering— que establecieron los fenómenos a explicar y descartaron hipótesis tempranas. Estos depósitos son el suelo del que crece ARGIRA I–V.
Historial de versiones (v1 – v9)
Corpus adicionales: Dataset unificado 74 imágenes · zenodo.20402536 ↗ · Espacio A=f(H,S,I) · zenodo.20388416 ↗ · Dataset B_v9 (43 obras, umbral v*) · zenodo.20357570 ↗
La correlación que
lo empezó todo
Al analizar 45 obras con la regla de conversión de Argira, emergió una correlación estadísticamente robusta entre la variabilidad cromática de una pintura y la complejidad sonora de su sonificación.
Esta correlación —r = 0.8869, R² = 0.8417, p < 0.001— no estaba diseñada. Surgió de los datos. Es la razón por la que el proyecto existe: el color parece estar relacionado con el sonido.
16 obras mostradas · Correlación calculada sobre N = 45 obras (dataset completo) · Zenodo v10 (abre en nueva pestaña)
Esta correlación es el punto de partida, no la conclusión. La pregunta que abre es: ¿qué características visuales explican ese vínculo? Los experimentos 11–15 intentan responderla — y encuentran que las representaciones visuales estándar no son suficientes.
El museo sonoro argira.eus/argira-sonification/ permite escuchar esta correlación en acción: las 16 obras ordenadas de menor a mayor cromatismo, de Malevich a Kandinsky.
Tres niveles.
El mismo resultado.
Resumen del estudio
De la divergencia perceptual
a la asimetría estructural
ARGIRA IV reexamina los resultados negativos de las fases anteriores desde una perspectiva diferente. En lugar de modelar directamente Δ como variable objetivo, analiza por separado los dos mappings que la componen: OPRS y RTR. Este cambio metodológico revela una asimetría estructural previamente oculta.
Modelado independiente de mappings — ARGIRA IV
Los resultados negativos de ARGIRA I–III no indican ausencia de relaciones imagen-sonido.
La dificultad surge al modelar directamente una variable compuesta (Δ) que combina dos transformaciones con sensibilidades distintas y parcialmente opuestas. Cuando ambos mappings se estudian por separado, emergen estructuras predictivas claramente diferenciadas.
Inversión de predictores
entre dominios
ARGIRA V investiga si las mismas variables visuales predicen la rugosidad en dominios visuales y acústicos. El estudio combina cinco corpus visuales independientes (n=319 imágenes) y un corpus acústico (n=72 sonificaciones), con 391 casos analizados en total.
lum_contrast: secundario (ρ = 0.56–0.74)
edge_density aquí: secundario (ρ = 0.428)
Los resultados apoyan una arquitectura de sonificación multicapa donde la información estructural (edge_density) y la información cromática (hue_entropy) deben representarse de forma independiente, ya que contribuyen información no redundante a dominios de rugosidad distintos.
Convergencia estructural
en el espacio del predictor
ARGIRA VI amplía el corpus canónico de 187 a 227 imágenes (96 pinturas canónicas de 19 artistas identificados, más 131 controles sintéticos), usando el nuevo Pipeline de Sonificación v3.4 con arquitectura de tres canales ortogonales: hue_entropy controla la frecuencia base, edge_density + fractal_D controlan la profundidad de modulación (predictor derivado por OLS, R² = 0.640), y luminance_contrast controla el tiempo de decaimiento.
El hallazgo central es que pinturas visualmente muy distintas pueden converger hacia estados acústicos casi idénticos dentro de la arquitectura de mapeo de ARGIRA: 80 pares de obras canónicas cumplen |Δfractal_D| < 0.005 con |Δedge_density| > 0.15, y aun así producen valores de profundidad de modulación prácticamente iguales. A nivel de artista emergen firmas estructurales reconocibles en el espacio fractal_D × edge_density —Turner ocupa establemente la región de fractal alto/borde bajo, Caravaggio la de fractal bajo/borde medio— sin usar ninguna etiqueta estilística explícita.
DOI: 10.5281/zenodo.20553976 · Pipeline v3.4 (companion): 10.5281/zenodo.20550714
Una matriz para
medir la asociación, no asumirla
ARGIRA VII introduce la Matriz de Asociación Visual-Acústica (VAAM), una representación sistemática de cómo cinco descriptores visuales primarios (hue_std, hue_entropy_bits, edge_density, fractal_D, luminance_contrast) y tres términos de interacción se asocian con siete dimensiones acústicas, sobre un corpus canónico de 117 pinturas procesadas con un único operador de sonificación (M1).
Cuatro hallazgos organizan el estudio. Primero, los predictores visuales se agrupan en dos familias funcionalmente independientes: una familia cromática (hue_std, hue_entropy_bits) que mapea preferentemente a dimensiones relacionadas con frecuencia, y una familia estructural (edge_density, luminance_contrast) que mapea a dimensiones temporales y de textura. Segundo, hue_std y hue_entropy_bits son observables no redundantes —la correlación parcial muestra que predicen de forma independiente distintos objetivos acústicos. Tercero, fractal_D muestra un poder predictivo mínimo en todas las dimensiones acústicas (S máximo ≈ 0.27), lo que contrasta con su relevancia documentada en estética empírica y sugiere que esta arquitectura de sonificación transmite mal la información fractal. Cuarto, la dimensión de rugosidad concentra los mayores índices de no linealidad de la matriz.
Dos asociaciones alcanzan valores casi perfectos (S ≈ 1.000) —hue_std→odd_bias y luminance_contrast→decay_s— pero no se interpretan como descubrimientos empíricos: surgen directamente de ecuaciones deterministas implementadas en el propio operador de sonificación, y se reportan explícitamente como estructura impuesta por el operador, no como propiedades emergentes del corpus. Distinguir relaciones impuestas de asociaciones observadas es la contribución metodológica central de este depósito. La cuestión de si las asociaciones visuales-acústicas sobreviven a través de operadores de sonificación estructuralmente distintos queda abierta y constituye el objetivo de ARGIRA VIII (abre en nueva pestaña) ↗. La respuesta: hue_std→odd_bias no sobrevive — queda falsada bajo reorganización arquitectónica completa (M3b) y reclasificada como artefacto del operador, no como propiedad invariante del corpus.
La pregunta ya no es ¿qué sonido produce una imagen?
Sino: ¿qué aspecto de la imagen quiero que el usuario perciba mediante el sonido?
Un mapping es una
hipótesis perceptual
ARGIRA IV revela que cada algoritmo de sonificación no traduce una imagen: selecciona qué dimensión visual merece sobrevivir en el sonido. Esta selección no es técnica, es epistemológica. El diseñador del mapping decide —implícitamente— qué es la imagen para el oyente.
De este principio se deriva una consecuencia directa: no existe una única sonificación correcta de una imagen. Existen tantas sonificaciones válidas como propiedades visuales se consideren relevantes comunicar.
| Propiedad visual | Mapping posible | Lo que percibe el usuario |
|---|---|---|
| Color (Hue) | hue → frecuencia | Clima cromático |
| Saturación | saturación → amplitud | Intensidad emocional |
| Brillo | luminancia → pitch | Claridad / oscuridad |
| Bordes | edge density → rugosidad | Geometría |
| Textura | roughness → modulación | Relieve |
| Simetría | symmetry → consonancia | Orden |
| Entropía | entropy → ruido espectral | Complejidad |
| Contraste | contrast → rango dinámico | Tensión |
| Profundidad | depth → reverberación | Espacio |
| Movimiento | optical flow → tempo | Dinamismo |
ARGIRA explora actualmente: hue, entropía cromática, rugosidad espacial.
Cuatro tipos de
filtro perceptual
A partir de los resultados de ARGIRA IV, es posible esbozar una primera clasificación de mappings según el tipo de propiedad visual que priorizan y la experiencia perceptual que generan en el oyente.
ARGIRA IV · zenodo.20531660 (abre en nueva pestaña) ↗
Transmiten la geometría de la imagen: bordes, contornos, orientación, composición. El oyente puede «sentir» la estructura visual.
Traducen la paleta de la imagen en dimensiones acústicas. Hue, saturación y brillo como tres canales independientes de información cromática.
Mapean la posición en la imagen al espacio acústico. Posición X al paneo, posición Y a la altura tonal. El oyente navega la imagen como un territorio.
Transmiten el carácter emocional o expresivo de la imagen. No una propiedad medible, sino la sensación que genera.
Δ no puede modelarse de forma robusta mediante las representaciones visuales evaluadas.
Aumentar la complejidad representacional —de estadísticas básicas a espacios expandidos a embeddings semánticos— no mejora de forma consistente la predicción de Δ. ARGIRA IV sugiere que esta limitación surge porque Δ combina dos mappings con sensibilidades visuales distintas, ocultando estructuras predictivas que emergen cuando cada mapping se analiza por separado.
ARGIRA II · zenodo.20526610 (abre en nueva pestaña) ↗
ARGIRA III · zenodo.20530682 (abre en nueva pestaña) ↗
| Nivel | Mejor R² CV | Estado |
|---|---|---|
| Bajo nivel Exp 11–13 |
Sin señal | |
| Medio nivel Exp 14 |
Marginal | |
| Semántico Exp 15 |
Sin señal |
Los algoritmos de sonificación
no son traductores neutros
Cada mapping selecciona, preserva y descarta diferentes propiedades de la imagen. La elección del mapping determina qué aspectos de la obra sobreviven en la representación acústica.
De estudiar una correlación a proponer una teoría del diseño de mappings.
Si este resultado se consolida con más mappings, ARGIRA podría pasar de analizar Δ como variable estadística a proponer un marco teórico para el diseño de mappings en accesibilidad multimodal — una contribución considerablemente más amplia que explicar una diferencia perceptual entre dos algoritmos.
No «el sonido de la imagen».
Una interpretación acústica de una propiedad concreta de la imagen.
RTR → atmósfera · color · distribución cromática
Varias maneras de contar
el mismo proyecto
ARGIRA es un instrumento auditable, no una landing page. Existe material dedicado a explicarlo desde distintos niveles de profundidad — desde una frase para quien no sabe nada del tema, hasta la arquitectura formal para un revisor de ICAD. Todos describen la misma idea central: pasar de una caja negra a un proceso auditable. Esta página (el índice de publicaciones) es solo una de esas maneras.
Esta página (el índice completo de publicaciones y auditorías, con DOIs verificables) es otra manera más: la más exhaustiva, pensada para quien necesita trazabilidad completa dato por dato.
El programa ARGIRA
en una página
Un proyecto de investigación en sonificación que evalúa sistemáticamente qué clases de representación visual pueden — y no pueden — predecir la diferencia perceptual entre mappings acústicos. Cinco estudios, todos con acceso abierto en Zenodo.
¿Cómo influye el diseño del mapping en la información visual que sobrevive en la representación acústica? ¿Qué características visuales predicen la diferencia perceptual Δ = OPRS − RTR?
~86 imágenes (pinturas postimpresionistas + fotografías de museo). Regresión Ridge y Random Forest con CV-5 folds. Tres niveles de representación visual evaluados de forma jerárquica. Todos los materiales reproducibles en Zenodo.
| Estudio | Pregunta | Resultado | DOI |
|---|---|---|---|
| ARGIRA I | Features de bajo nivel (8 variables) — Exp 11 | R² CV < 0 | 20524644 ↗ (abre en nueva pestaña) |
| ARGIRA II | Features expandidas con PCA (209 variables) — Exp 11–15 | R² CV ≈ 0.10 | 20526610 ↗ (abre en nueva pestaña) |
| ARGIRA III | Descriptores semánticos LLM — Claude Haiku, n=72 | R² CV = −0.162 | 20530682 ↗ (abre en nueva pestaña) |
| ARGIRA IV | OPRS y RTR modelados por separado — asimetría estructural | OPRS R²=0.582 RTR R²=0.086 |
20531660 ↗ (abre en nueva pestaña) |
| ARGIRA V | Inversión de predictores cross-corpus — n=391, 5 corpus visuales + 1 acústico | edge_density ≠ hue_entropy ρ≈−0.10 |
20534328 ↗ (abre en nueva pestaña) |
Δ no puede modelarse de forma robusta mediante las representaciones visuales evaluadas. ARGIRA IV revela por qué: OPRS y RTR preservan propiedades visuales estructuralmente distintas. ARGIRA V confirma que la asimetría generaliza entre dominios y corpus.
Ranero García, J. (2026). ARGIRA: Sonificación y Métricas Perceptuales
(Serie completa I–V). Zenodo.
doi.org/10.5281/zenodo.20534327 ↗ (abre en nueva pestaña)
ICAD 2026 · Poster #4302 · Barcelona · Jul 2026
Acceso abierto
a todos los materiales
Serie ARGIRA I–XII
Correlación → asimetría estructural → invariancia → falsaciónFormaliza un marco de "observadores estructurales" mediante una matriz de transición, cerrando la serie con una síntesis metodológica de todo el programa ARGIRA.
Aplica análisis de textura GLCM sobre los residuos no explicados de ARGIRA X (N=227), para comprobar si queda estructura visual sin capturar. Encuentra una mejora de ajuste modesta (ΔR² ≈ 0.064).
Análisis espectral empírico (SVD + Procrustes) de cómo cambia el acoplamiento visual-acústico según el operador de sonificación usado, comparando configuraciones de rango 1 (M1) a rango 3 (M3).
Analiza la covarianza entre canales perceptuales (tempo_color, fractal, espacio) y cómo esa covarianza se reorganiza — "migra" — al cambiar el operador de sonificación empleado.
Responde la pregunta abierta por ARGIRA VII: ¿la asociación hue_std→odd_bias sobrevive a un cambio completo de arquitectura de sonificación (N=117, reorganización M3b)? No sobrevive — se reclasifica como artefacto del operador, no como propiedad invariante del corpus.
Introduce la Matriz de Asociación Visual-Acústica (VAAM), cruzando 5 descriptores visuales con 7 dimensiones acústicas sobre 117 pinturas + 110 controles sintéticos. Las familias cromática y estructural predicen dimensiones acústicas distintas y no redundantes; fractal_D apenas tiene poder predictivo. Distingue explícitamente asociaciones impuestas por el operador de sonificación de propiedades reales del corpus.
Extiende el corpus canónico a 227 obras de 19 artistas. Muestra que pinturas muy distintas visualmente pueden converger en estados acústicos casi idénticos (80 pares con gran diferencia de borde pero profundidad de modulación casi igual), y que emergen firmas estructurales por artista sin usar ninguna etiqueta de estilo.
Sobre 391 casos (5 corpus visuales + 1 acústico), encuentra una inversión de predictores entre dominios: edge_density domina en lo visual (ρ 0.49–0.84), pero en lo acústico domina hue_entropy (ρ = 0.595). Apoya una arquitectura de sonificación con canales cromático y estructural independientes.
Punto de inflexión de la serie: en vez de modelar Δ como variable combinada, separa los dos mappings (OPRS y RTR) y los modela de forma independiente. OPRS conserva estructura predictiva (R² CV ≈ 0.58, ligado a textura y rugosidad); RTR apenas la conserva (R² CV ≈ 0.25, ligado a color global). Explica por qué I–III no encontraban señal: Δ mezclaba dos sensibilidades visuales distintas.
Sustituye las features numéricas por descriptores semánticos generados con un LLM (Claude Haiku) — la representación visual más "alta" evaluada en la serie. La señal predictiva desaparece del todo (R² CV = −0.337 según el experimento 15 asociado), reforzando que el problema no era falta de complejidad representacional.
Repite la prueba de ARGIRA I con un espacio de features mucho más amplio (~209: histogramas HSV, filtros Laws, estadísticas por cuadrante, Sobel) reducido con PCA. La señal mejora pero sigue siendo marginal e inestable (R² CV ≈ 0.10) — no generaliza.
Primer experimento de la serie: prueba si ~8 features visuales de bajo nivel (tono, saturación, densidad de bordes, rugosidad, contraste de luminancia) predicen la divergencia perceptual Δ entre dos mappings de sonificación. Sin señal (R² CV < 0).
Replica en un corpus mayor (N=30, frente a N=9–10 en v1–v3) la correlación hue_std→rugosidad espectral hallada por casualidad al comparar el pipeline mono original con la versión estéreo (Argira v23). La correlación baja de r≈0.85 a r=0.687 al ampliar la muestra, pero sigue siendo significativa (p<0.001); combinada con entropía sube a R²=0.732.
Historial de versiones (v1 – v3)
Nota: al ampliar la muestra de N=9–10 a N=30 en v4, la correlación baja de r≈0.85 a r=0.687 (aunque sigue siendo significativa, p<0.001) — se documenta también un artefacto de digitalización (Black Square) que, excluido, sube r a 0.790.
Comprueba si la relación entre dispersión de tono y rugosidad se generaliza a corpus independientes, comparando tres pipelines (naive, OPRS, RTR). El pipeline naive es el que mejor generaliza (r ≈ 0.54–0.62), por encima de OPRS y RTR.
Prueba la robustez de la correspondencia visual-acústica variando el umbral de rugosidad sobre un corpus de 69 obras. La jerarquía de resultados se mantiene estable en el rango 1000–1750 Hz.
Evalúa si OPRS produce resultados estables al repetir el muestreo aleatorio. Converge de forma práctica en torno a 50–100 repeticiones.
Analiza RTR con 10.000 remuestreos bootstrap; encuentra r = −0.417 y confirma que el orden relativo de los valores, no solo su magnitud, influye en el resultado.
Corpus de 14 obras sonificadas con la regla mínima hue→frecuencia. El clustering no supervisado agrupa correctamente el 92.9% de los casos, mostrando que la dimensión espectral (Ds) actúa como invariante incluso con esta versión simplificada del pipeline.
21 fotografías de paisaje tomadas con móvil. La saturación de color predice el número de armónicos emergentes con una correlación muy alta (r = 0.9644).
Agrupamiento no supervisado (k-means, k=4, con PCA) sobre 74 obras sonificadas. Identifica un cluster dominado por Rembrandt y a Signac como outlier del corpus.
Línea RMA — Auditoría de pérdida estructural
Qué sobrevive a una transformación determinista, dominio por dominioÚltima versión de la línea RMA en el formato de paquete estático (documentos, informes, scripts) — no la versión final de la línea RMA en general, que es el Knowledge Explorer v1.8 y la sustituye. Añade la auditoría Expansion Score, comparando Random Forest contra un modelo de interacción de bajo orden.
Historial de versiones (v1 – v1.4)
Versión actual y más reciente de toda la línea RMA. Sustituye al paquete estático de documentos y scripts por una aplicación interactiva que corre offline en el navegador (motor Python vía Pyodide), organizada en tres capas: Evidence (resultados auditados), Research (hipótesis exploratorias) y Analysis (exploración bajo demanda, cuyos resultados quedan locales a la sesión del navegador y nunca se promueven automáticamente a Evidence). v1.8.0 es una publicación de estabilización centrada en consistencia del release, integridad del artefacto y claridad documental — integra el build HTML standalone confirmado como artefacto canónico, verifica que se preserva la funcionalidad de v1.7 (incluidas las representaciones de conocimiento v3.4 y v3.5.7) y la separación de Research Mode, y actualiza documentación y metadatos de citación; no hay cambios en la metodología computacional de RMA, el cálculo de Bootstrap CI, el análisis de R² residual ni la lógica de clasificación estadística. Documenta como caso límite no confirmado un posible escenario de persistencia de mensaje de la interfaz de Bootstrap, revisado mediante inspección estática de código: solo podría producirse bajo una condición de temporización de interacción muy concreta con controles bloqueados durante la transición entre la finalización de Bootstrap y el desbloqueo de la interfaz; no se ha reproducido en uso normal y no se aplicó ningún cambio de código en v1.8.0.
Historial de versiones (v1.4 – v1.7)
Aplica el auditor RMA a features simbólicas de partituras MIDI. La variable duration_std se confirma en el corpus MAESTRO (R²=0.32) pero no se sostiene en Aria-MIDI (R²=−0.26).
Audita cuánta estructura sobrevive al pasar documentos por reconocimiento óptico de caracteres (Tesseract 5.3.4), sobre el corpus FUNSD, con 20 variables estructurales evaluadas en 4 fases.
Audita la pérdida de estructura al comprimir en JPEG (calidad QF=10) 109 pinturas. El color se conserva casi intacto (r≥0.98) pero la densidad de bordes se degrada más (r=0.77).
Formaliza el framework general de auditoría: test de permutación, análisis de invarianza y validación cruzada leave-one-out/bootstrap, con 169 de 169 tests superados. La v2 corrigió tres bugs de reproducibilidad y lo aplicó tanto a la sonificación de pinturas (ARGIRA, N=227) como a un dataset ajeno de eficiencia energética (UCI, N=768), con resultados cualitativamente distintos entre dominios.
Historial de versiones (v1 – v2)
Documenta la correlación hue_std→rugosidad en un corpus de 74 obras (r=0.923). El índice etiqueta también "filotaxis" y tres hipótesis (H1–H3) sin desarrollarlas más — consultar el DOI para el contenido completo.
Instrumento perceptual · Arquitectura RAF
Campo navegable, acoplamiento continuo y memoria de trayectoriaAccesibilidad · Caracterización visual
Alt-text con incertidumbre comunicada, más reciente que la línea RMALa línea completa de accesibilidad (ARGIRA v1.4.x, validaciones de fractal_D, RMA sintético) está documentada en la sección Accesibilidad ↓.
Material histórico · Pipelines y variantes
Desarrollo previo a la serie numerada, mantenido por trazabilidadMostrar 21 depósitos de desarrollo previo (v14–v21, pipelines de mapping, dataset B_v9) · serie completa hasta v23 destacada arriba
45 archivos de audio generados por el pipeline v3.5, con hue_std mapeado a frecuencia, Dv a textura granular y tempo a distribución espacial.
Compara cuatro funciones de mapeo hue→frecuencia (log, mel, estocástico, cuadrático), con correlaciones entre r=0.878 y r=0.951, frente a un control scanline con r=−0.116.
Compara un pipeline armónico (09, r=+0.951) con uno no armónico (07, r=+0.687).
Compara pipeline naive (07, r=+0.687), sine armónico (09, r=+0.951) y scanline de control (08, r=−0.116), con N=30.
Pipeline de control sin mapeo hue→frecuencia; corrige FREQ_MAX de 2000 a 10000 Hz. N=26, r=−0.116 (p=0.572) frente al pipeline naive r=+0.710 (p<0.001).
Cinco pipelines probando log, mel, estocástico y cuadrático como funciones hue→frecuencia, con correlaciones entre r=+0.878 y r=+0.935, N=30.
10 imágenes sintéticas que aíslan hue, saturación e irregularidad espacial; contrasta dos imágenes con el mismo hue_std pero distinto número de armónicos.
Caracterización acústica de 21 imágenes sintéticas (I00–I20) a lo largo de un gradiente de irregularidad espacial, con métricas por nivel.
Nota técnica sobre una paradoja de amplitud estéreo: Malevich obtiene W=0.196 y Kandinsky W=0.058, resultado invertido respecto a lo esperado por complejidad.
Calibración empírica de una arquitectura de 3 canales ortogonales sobre N=187 obras; edge_density→mod_depth r=+0.900 (OLS), con roughness eliminado por colinealidad.
Análisis espectro-temporal de 72 obras sonificadas, 2.160 observaciones banda-velocidad, con una transición de régimen en 4–8 kHz donde ρ pasa de +0.973 a −0.22.
Dataset de 72 obras cruzando 6 bandas de frecuencia y 5 velocidades, con ρ = −0.9524 entre la banda 4–8 kHz y hue_std.
Prueba de invariantes geométricos sobre 74 obras: la inversión completa del proceso no es posible (error medio 0.709), aunque cx→pan tiene error <0.05 y edge_density→effort r=0.759.
74 obras de dominio público con hue_std→Ds r=0.9233, R²=0.8524, validado con test de permutaciones (N=1000, p<0.001).
Versión extendida sin revisión por pares, N=47: VTI→Ds r=0.9289, validación cruzada con filtro Sobel r=0.9570.
Analizador independiente con 6 métricas validadas: hue_std→Ds r=0.9289, irregularidad→Sobel r=0.9570, N=47.
Integra Claude Vision como canal complementario de descripción de objetos, mediante servidor proxy (Node.js/Render) con fallback si la API no está disponible.
Añade audio espacial (centroid.x→pan, centroid.y→registro) sobre 4 dimensiones perceptivas con Web Audio API; es la versión activa que usa el museo sonoro.
Dataset de N=47 obras con r=0.9289, validado con test de permutaciones (N=1000).
Aplica el umbral v* = 7800 − 12500·hue_std a 43 obras reales (r=0.9370) y activa el módulo háptico client-side en la demo.
v1 (10.5281/zenodo.20354217 ↗) fue la nota técnica que formalizó el modelo del umbral v* = k − m·hue_std sobre las tres capas del ecosistema (Python, JS, extensión háptica Android), sin dataset propio. v2 es la primera versión que aplica el umbral a datos reales (43 obras) y reporta la correlación.
Añade un canal semántico complementario que describe las imágenes en voz alta usando la Claude API y Web Speech API, sin necesidad de servidor.
Página interactiva que reúne los experimentos 1–15 y los hallazgos de la serie ARGIRA I–V, con una taxonomía de mappings, conforme a WCAG AA.
Analizador independiente con 6 métricas validadas: hue_std↔Ds r=0.9289, N=47.
Versión extendida posterior al envío a ICAD (v10), N=47, r=0.9289, Sobel r=0.9570; documenta también un resultado negativo con FFT 2D.
Replicación independiente con corpus extendido a 74 obras, r=0.9233, R²=0.8524.
Pipeline de control con arquitectura espacial sin mapeo hue→frecuencia; documenta un resultado nulo (r=−0.116).
Reescribe el analizador con arquitectura modular y filtro high-shelf, como herramienta de navegador basada en Web Audio API.
Añade control de velocidad (lupa temporal) en rango 0.5×–1.5×, preservando la correlación r>0.92.
Sonificación táctil del color en modo noche: toque de píxel→tono, saturación→timbre, brillo→volumen.
Anuncia primero la posición en una cuadrícula 3×3 y después el color, por ejemplo "arriba izquierda, azul".
De la sonificación
a la incertidumbre comunicada
A partir de agosto de 2026, el programa ARGIRA se extiende a un problema distinto y complementario: cómo comunicar la incertidumbre de una estimación automática de texto alternativo (alt-text) a una persona que no puede verificarla visualmente. A diferencia de los lectores de pantalla comerciales, que presentan sus descripciones como hechos, ARGIRA v1.4.x expone de forma explícita la confianza de cada estimación y las señales que la sustentan — usando estadística de imagen determinista, no redes neuronales.
Esta línea incluye tres estudios de validación independientes sobre la fiabilidad de las señales técnicas empleadas (estabilidad de fractal_D, vulnerabilidad de características de discriminación de origen, y validación empírica de RMA con 1.200 ejecuciones controladas), publicados con el mismo estándar de honestidad metodológica que el resto del programa: se documenta tanto lo que las señales pueden sostener como lo que no.
Tres bloques de cambios: (1) selector de idioma ES/EN con enlace cruzado entre versiones; (2) navegación de resultados por tarjetas individuales con foco explícito — ya no se anuncian automáticamente al insertarse; adaptaciones para JAWS (verificación parcial), TalkBack (heredada de versiones anteriores) y VoiceOver (adaptado en código, sin verificar en entorno real); (3) reordenación de controles, texto de error revisado, eliminación de lenguaje interno del header visible al usuario. No introduce cambios en la heurística de clasificación ni en el cálculo de incertidumbre. Los dos artefactos HTML (ES/EN) son autocontenidos: funcionan localmente sin instalación ni conexión a red. El autor insiste en que ARGIRA sigue siendo un artefacto de investigación experimental, no un producto terminado ni tecnología de accesibilidad validada.
Historial de versiones (v1.0 – v1.4.6)
Estudio complementario a ARGIRA v1.4.4 que investiga si el comportamiento observado del feature fractal_D se mantiene estable ante cambios de escala, método de interpolación, resoluciones intermedias y transformaciones controladas, junto con una auditoría del residuo asociado (RMA-0) — distinta del repositorio independiente de calibración RMA (1.200 ejecuciones, DOI 10.5281/zenodo.21935413). Corpus experimental de 52 imágenes (18 generadas por IA, 14 fotografías, 20 pinturas). Encadena siete fases documentadas: estabilidad de fractal_D sobre el corpus completo, análisis de curvas D individuales y diferencias sucesivas, control de interpolación Lanczos a distintas escalas, comparación bilineal vs. Lanczos, análisis de resoluciones intermedias, análisis de transformación residual, y la auditoría RMA-0 con control de efectos de formato/origen de imagen. La pregunta central es si la señal fractal_D es una propiedad estable de las imágenes analizadas o si su valor medido puede verse sustancialmente afectado por escala, interpolación, resolución o transformaciones controladas — examinando así la propia señal y las condiciones bajo las que cambia, no un valor numérico aislado como evidencia independiente de origen. El estudio no afirma que fractal_D por sí solo determine el origen de una imagen individual, ni constituye un sistema completo de detección de imágenes generadas por IA; los resultados deben interpretarse dentro del corpus, las implementaciones, las transformaciones y las condiciones experimentales documentadas. Paquete de reproducibilidad de 100 archivos (99 cubiertos por un manifiesto de integridad MD5) organizados en scripts, datos numéricos CSV/JSON, figuras, informes, el corpus de 52 imágenes, los materiales de la fase de control de formato/origen, los materiales de la auditoría RMA-0, y la fuente original de box_counting_dimension incluida como referencia metodológica para verificar la fidelidad de la implementación analizada. Los resultados están pensados para informar el desarrollo futuro de ARGIRA, incluyendo la evolución prevista hacia v1.4.5, pero este depósito no constituye por sí mismo la implementación de esa versión — la publicación de la investigación y su eventual incorporación al software son pasos separados. Complementario, no solapado, con el estudio independiente sobre vulnerabilidad y controlabilidad de las señales de discriminación de origen (DOI 10.5281/zenodo.21945633), que se centra en señales de luminancia y saturación en vez de en fractal_D.
Estudio complementario a ARGIRA v1.4.4 que investiga si señales específicas de ARGIRA pueden distinguir de forma fiable entre imágenes generadas por IA, pinturas reales y fotografías reales. Resultado principal: las señales estudiadas no constituyen evidencia fiable de origen bajo las condiciones experimentales analizadas. fractal_D no discrimina significativamente entre imágenes generadas por IA y pinturas al usar la implementación real de producción sobre una muestra equilibrada; luminance_contrast + sat_mean sí muestra separación estadística entre grupos, pero es vulnerable a modificaciones habituales de brillo, contraste y saturación; el score de producción z_combined puede desplazarse mediante ediciones fotográficas controladas sin que las características estructurales de la imagen se desplacen de la misma manera; y las pruebas de estrés muestran variabilidad de score dentro de una misma clase comparable a la separación observada entre clases. Encadena nueve estudios o fases experimentales con artefactos verificables: prueba exploratoria de fractal_D y features candidatas culminando en una Ronda 5 con 20 imágenes generadas por IA frente a 20 pinturas usando un port fiel de la implementación real de producción ARGIRA v3.5; separación con luminance_contrast + sat_mean; validación con particiones de desarrollo y validación; verificación cruzada con imágenes generadas con Gemini; control experimental de iluminación, brillo, contraste y saturación; auditoría de luminance_mean; control de vulnerabilidad con pinturas reales; prueba de estrés sistemática con 13 familias de perturbación sobre tres imágenes base; y prueba de estrés ampliada con nueve imágenes base incluyendo generadas por IA, pinturas y fotografías. Las fases de emparejamiento natural y basado en ediciones (10C/10A) no se incluyen como resultados reproducibles porque no se localizaron artefactos verificables correspondientes. El estudio no establece el origen de ninguna imagen individual con certeza, no constituye un sistema completo de detección de imágenes de IA, no evalúa todos los generadores o pipelines de generación existentes, no evalúa arquitecturas de aprendizaje automático como enfoques alternativos, ni establece que el comportamiento observado generalice necesariamente a todos los conjuntos de datos, generadores o condiciones de imagen posibles — estas limitaciones no invalidan los hallazgos, sino que delimitan su alcance. Es un repositorio científico independiente, no parte de la publicación de ARGIRA v1.4.4 en sí; sus resultados están pensados para informar la evolución hacia v1.4.5, pero la publicación de este estudio y su implementación en el HTML son decisiones separadas — primero se establece y publica la evidencia científica de forma trazable, y después se decide qué conclusiones concretas se incorporan a la interfaz y lógica de esa versión futura, que debería citar este repositorio por su DOI como parte de la trazabilidad científica de los cambios derivados.
Estudio de validación/calibración metodológica realizado como parte del desarrollo de la versión 1.4.5, dando continuidad a los análisis RMA (Residual Mapping Analysis) usados en la v1.4.4 precedente. Documenta una validación empírica de RMA bajo condiciones de control sintéticas con verdad de referencia conocida, evaluando su capacidad de discriminar entre datos correctamente especificados o sin señal y modelos deliberadamente mal especificados. Se probaron cinco condiciones generativas: un control externo de ruido puro, una condición lineal correctamente especificada, y tres condiciones deliberadamente mal especificadas (no lineal, compuesta y jerárquica); cada condición se evaluó en cuatro tamaños de muestra (n = 51, 100, 300 y 800), con 30 semillas aleatorias independientes y dos objetivos, resultando en 1.200 ejecuciones finales. Bajo las condiciones probadas, los casos correctamente especificados y sin señal produjeron valores de R² residual negativos que convergían hacia cero al aumentar el tamaño de muestra, mientras que las condiciones mal especificadas produjeron valores de R² residual positivos con separación creciente al aumentar la muestra; el control de ruido puro produjo 0% de falsos positivos observados en 240 ejecuciones bajo el umbral por defecto del framework (0.05). El estudio aporta respaldo empírico al comportamiento discriminativo de RMA bajo las condiciones sintéticas probadas, pero no constituye una validación general de RMA para todas las configuraciones posibles, ni valida los hallazgos derivados que usan RMA en D o en ARGIRA. El repositorio incluye resultados crudos completos, resultados agregados, el script de calibración, el wrapper de ejecución por bloques, el protocolo experimental congelado, documentación README y la visualización principal; el dataset final contiene 1.200 filas sin claves experimentales duplicadas y un hash de integridad de framework consistente en todos los registros. La versión v1.1.0 (vigente, enlazada aquí) añade rma_framework.py, la implementación de referencia del pipeline de auditoría RMA usada para producir estos resultados, omitida por error en la v1.0.0 anterior — una actualización de completitud de código: los datos, resultados y figuras subyacentes no cambian; MANIFEST.md5 y CITATION.cff se regeneraron para reflejar el nuevo archivo y versión.
Concept DOI de esta línea (resuelve siempre a la versión más reciente): 10.5281/zenodo.21830301 · Anexo completo del ecosistema de herramientas: ver anexo ↗