La plataforma fue creada en AudacIA, el centro de investigación e innovación en inteligencia artificial y robótica de la Universidad Simón Bolívar. Su algoritmo identifica patrones visuales y convierte los valores de color de cada píxel en frecuencias sonoras.
Un sistema de inteligencia artificial traduce imágenes en secuencias musicales al convertir los valores de color de cada píxel en frecuencias sonoras, usando una escala predefinida. La herramienta, llamada Pixsound, analiza patrones visuales y los transforma en notas, lo que permite explorar nuevas formas de representación de datos y experiencias sensoriales.
El punto de partida de la plataforma creada en AudacIA, el centro de investigación e innovación en inteligencia artificial y robótica de la Universidad Simón Bolívar, es que propone una forma de traducción entre dos dominios: el visual y el sonoro. Su algoritmo está entrenado para tomar una imagen digital y analizar cada píxel a partir de sus tres canales de color: rojo, verde y azul. Cada canal contiene un valor numérico y, a partir de esos datos, realiza un mapeo que convierte la información cromática en frecuencias sonoras.
“El código lee los colores dentro de la imagen, extrae sus valores y los convierte en una frecuencia que pueda expresarse como sonido”, explica el ingeniero e investigador Steffen Cantillo Molina.
Una vez obtenidas las frecuencias, Pixsound aplica reglas de organización basadas en teoría musical. En lugar de reproducir los píxeles en secuencia lineal, reorganiza la información para generar coherencia auditiva. “No se trata de tomar el primer píxel y luego el segundo, se analiza el conjunto y se reorganiza de manera que suene armónico”, señala Cantillo.
Para lograrlo, el software incorpora una segunda capa en la que asigna las notas dentro de una escala musical. Cada frecuencia calculada se aproxima a una nota específica y se ubica en una escala previamente seleccionada. El equipo optó por la escala del blues, evocando la estética de la banda alemana Kraftwerk, considerados los padres del pop electrónico en la década de 1970. “Se establecieron condiciones basadas en distintas escalas. Una vez seleccionada, el sistema reorganiza las frecuencias según la nota que mejor se ajusta”, detalla Cantillo.
El resultado es una reinterpretación estructurada de la imagen porque combina reglas computacionales con criterios musicales para evitar una salida arbitraria. “No queríamos solo números. Buscamos coherencia, una forma de transmitir lo que está en la pintura”, añade Reynaldo Villareal González, director de AudacIA.

Su algoritmo está entrenado para tomar una imagen digital y analizar cada píxel a partir de sus tres canales de color: rojo, verde y azul.
El arte y las nuevas posibilidades
Como prueba de concepto, el sistema se aplicó a obras del artista visual Jorge Serrano Sanmiguel. Sus pinturas, construidas a partir de capas materiales y procesos internos, ofrecen un escenario adecuado para explorar esa traducción. “No son creaciones planas, sino que se va construyendo desde adentro”, explica Serrano sobre su proceso creativo.
Las composiciones contienen una estética cercana a la música electrónica. El uso de sintetizadores y la referencia a Kraftwerk responden a una decisión del equipo para evidenciar la innovación tecnológica en la música.
El sistema presenta condiciones específicas. La conversión depende de reglas definidas por los desarrolladores y de la escala elegida. No existe una correspondencia universal entre color y sonido. Tampoco hay, por ahora, validaciones sistemáticas sobre la percepción de distintos usuarios. El modelo no interpreta significados: reorganiza datos bajo condiciones establecidas.
La calidad musical depende de ajustes adicionales. El equipo plantea que una versión más avanzada requerirá trabajo con músicos y procesos de producción sonora más complejos. “Es una base. Se puede extender con más teoría musical, más instrumentos, más capas”, comenta González.
El proyecto se conecta con la sonificación de datos, una técnica utilizada en ciencia y tecnología para representar información mediante sonido. En este caso, el enfoque se traslada al arte y abre nuevas posibilidades.
En accesibilidad, el sistema permite interpretar imágenes a través del sonido para personas con discapacidad visual. En educación, facilita explicar relaciones entre luz, color y frecuencia. En análisis de imágenes, ofrece una vía alternativa para identificar patrones. En el arte, amplía el campo de experimentación y desplaza la obra hacia otros lenguajes.
Para Serrano, la experiencia va más allá de lo técnico. “Cuando me dijeron que mi obra tenía sonido, casi que me brotan lágrimas. Cuando pinto, intento construir una obra sinfónica”, dice. Y lejos de ver la inteligencia artificial como una amenaza, la asume como una extensión. “Va a complementar lo que hago, me puede dar una visión distinta”, afirma.
El artista proyecta su uso hacia el espacio público, ciudades donde las imágenes se escuchen, donde las fachadas proyecten arte acompañado de sonido, donde la experiencia estética se desplace del museo a la calle. “La IA no va a hacer lo que yo hago, pero sí puede complementar, enriquecer, ofrecerme una visión distinta. Yo no le tengo miedo; al contrario, me estimula, me obliga a ir más allá, a no quedarme cómodo repitiendo fórmulas porque el arte no es estancarse. Es evolución”.
PERFIL CIENTÍFICO

Ingeniero de Sistemas. Ph. D. en Gestión de la Innovación y la Tecnología. Director de AudacIA.
Grupo Gestión de la Innovación y el Emprendimiento

Ingeniero Mecatrónico, MSc. en Ingeniería Biomédica, MSc. en Computer Science.
AudacIA, centro de investigación, desarrollo tecnológico e innovación en inteligencia artificial y robótica
