
SEALI: intra-acciones humano-máquina en la improvisación libre
Virtualis. Revista de cultura digital
Tecnológico de Monterrey, Dirección de Investigación de la Escuela de Humanidades y EducaciónEste artículo presenta el desarrollo de SEALI (Sistema de escucha automática para la libre improvisación), un sistema interactivo que utiliza la escucha de máquina para analizar elementos sonoros e incidir en la práctica de la libre improvisación musical. El sistema emplea técnicas algorítmicas aplicadas a la segmentación, el análisis y el entrenamiento de un corpus sonoro a través de redes neuronales, para generar modelos que describen la improvisación libre en términos tímbricos y formales. Para lograrlo, se analiza cómo el aprendizaje supervisado y sin supervisión pueden describir numéricamente esta práctica, así como las redes neuronales recurrentes—particularmente las redes LSTM—, pueden ofrecer una alternativa para la predicción de la forma musical. Estos modelos constituyen la base de este sistema, lo que posibilita la interacción en tiempo real con otros músicos. El artículo detalla las funcionalidades y hallazgos principales en torno a SEALI, aborda los estudios de caso que han contribuido a su evolución continua y retoma algunas discusiones sobre la agencialidad algorítmica en las prácticas artísticas.

			El presente artículo parte de mi investigación doctoral sobre SEALI (Sistema de escucha automática para la libre improvisación) el cual es un sistema sonoro interactivo que parte de la escucha artificial, modelada desde mi propia escucha, para analizar elementos sonoros en un ámbito muy acotado de la libre improvisación y, también, para interactuar a varios niveles temporales con otros improvisadores mediante la clasificación y la predicción sonora en el contexto de dicha práctica. Las funcionalidades de este sistema las pienso desde una perspectiva algorítmica y que, en conjunto, articulan la arquitectura de SEALI. A grandes rasgos, éstas comienzan en la selección de un corpus sonoro, posterior a ello, se aplicaron técnicas de segmentación, estructuración, análisis y entrenamiento de redes neuronales para generar una serie de supuestos abstractos a nivel numérico (modelos) que describan esta práctica musical. Finalmente, se desarrolló un sistema interactivo en tiempo real para establecer una serie de respuestas coherentes en la libre improvisación.

			Cada una de estas funcionalidades, implica varios procesos entrelazados por bucles de retroalimentación donde mi escucha y el aprendizaje de máquina se unen con el objetivo de desarrollar la metodología y las técnicas algorítmicas que posibilitaron la realización de SEALI y su integración en contextos artísticos musicales. En este artículo abordaré a detalle las funcionalidades más generales de ese sistema, así como los estudios de caso que han sido útiles para continuar su evolución, bajo el entendido de que su constante introducción en la práctica artística sigue modificando sus funcionalidades para adecuarse cada vez más a las necesidades contextuales de una práctica en permanente cambio como la libre improvisación.

		La improvisación libre es una forma de música que no sigue reglas ni estructuras preestablecidas, sino que se basa en la creatividad y la interacción de los músicos al momento de hacerla (Matthews, W. (2012). . Turner Publicaciones.Matthews, 2012). Aunque difícil de datar exactamente en su origen debido a sus raíces en diversas corrientes musicales y académicas, se consolidó como práctica en los años sesenta en Europa y Estados Unidos. Galiana Gallach, J. L. (2018). De la naturaleza de la improvisación libre: Elementos esenciales para su identificación y diferencias con la composición escrita. Itamar. , 0.Galiana (2018) define la improvisación libre como 'un proceso creativo y no un producto acabado, manufacturado, listo para ser escuchado y consumido tantas veces como se desee'. Sin embargo, algunos improvisadores han llegado a considerar que la libre improvisación fue la primera forma musical creada por los humanos (Bailey, D. (1980). . Moorland.Bailey, 1980).

			Inspirada por el
Sí bien en la actualidad existen proyectos que comparten algunas características con SEALI (Escobar Castañeda, A. A. (2022). Resistencias maquínicas: Una caracterización a la improvisación libre con aprendizaje y escucha de máquina [Tesis doctoral, Universidad Nacional Autónoma de México]. Facultad de Música.Escobar-Castañeda, 2022), este sistema se distingue por su enfoque en la convergencia entre la escucha artificial y la libre improvisación. En este sistema, la escucha artificial se concibe como un proceso modelado a través de algoritmos de aprendizaje y escucha de máquinas (Collins, N. (2012). Automatic composition of electroacoustic art music utilizing machine listening. , (3), 8-23.Collins, 2012), partiendo de mi propia escucha, generando así un marco de referencia que toma mi bagaje como compositor e improvisador.

			Inicialmente, este enfoque contempla el análisis de elementos sonoros dentro de la libre improvisación y, más adelante, la interacción dinámica entre la escucha artificial y la improvisación. Algunos elementos principales por destacar en este proceso son: la selección de un repertorio sonoro, la aplicación de técnicas algorítmicas para su análisis, la implementación de redes neuronales capaces de capturar numéricamente la esencia de la improvisación libre. Estas técnicas no solo posibilitan el análisis y la respuesta en tiempo real a la improvisación, sino también las interacciones a distintos niveles temporales con otros improvisadores, contribuyendo así a la evolución y expansión de la improvisación libre.

		A continuación, presento una revisión de las funcionalidades que componen a SEALI. Estos aspectos se dividen en dos categorías: las funcionalidades relacionadas con la clasificación tímbrica y las relacionadas con la predicción de la estructura en la improvisación libre.

			La primera tarea de SEALI, es analizar un corpus musical de improvisaciones libres que servirá como fuente de
Una vez consolidado este corpus, el proceso subsecuente implica un análisis en dos fases: primero, la segmentación del corpus, y segundo, la construcción de una base de datos mediante la extracción de características de audio digital presentes en cada segmento. Como exploraremos más adelante, estas características se denominan descripciones o descriptores de audio (Vinet, H., Herrera, P., y Pachet, F. (2002). The CUIDADO project. En 3rd International Society for Music Information Retrieval (ISMIR) Conference (pp. 197-203). Paris, France. Content Based Retrieval.Vinet, 2002). Este proceso garantiza que los segmentos individuales mantengan coherencia entre sí y sean objetos significativos más allá de su contexto. La segmentación se basa en el análisis de gestos sonoros, elementos auditivamente reconocibles y significativos por sí mismos. Estos gestos pueden estar caracterizados por propiedades, como el timbre, la altura, el ritmo, el contenido, la densidad, la energía y la complejidad espectral. El desafío de esta tarea radica en que estos gestos pueden variar en altura, intensidad, duración, contenido espectral e intención al ser ejecutados, lo que crea un fenómeno multidimensional en constante evolución en función del contexto y la interpretación. Por lo tanto, es esencial entrenar al algoritmo de escucha y aprendizaje automático con una base de datos que contenga una amplia variedad de muestras sonoras representativas de la práctica.

				El concepto de objeto sonoro, influenciado por la obra de Schaeffer, P., y De Diego, A. C. (1996). (Serie Alianza música). Alianza.Schaeffer (1996) desempeña un papel esencial en la segmentación del audio en SEALI. Schaeffer introdujo el término 'música concreta' para comprender la música como cualquier fenómeno sonoro perceptible y reproducible, independientemente de su origen o significado. El concepto de objeto sonoro se define como una manifestación sonora percibida como una entidad coherente, independientemente de su origen o significado. Los objetos sonoros se relacionan con el gesto, pensado como unidad sonora, que puede evocar emociones y significados sin depender de un contexto musical previo o futuro. Así, el gesto comunica una idea y contiene atributos comunicativos, su apertura a la reelaboración y recontextualización le otorgan un carácter polisémico y una curva energética.

				Cabe mencionar que, a lo largo de la investigación, se examinaron distintas aproximaciones a la segmentación de audio dentro de la improvisación libre, lo que condujo a realizar ajustes y modificaciones en la metodología. Por limitaciones de espacio, en este artículo solo abordaré una de las aproximaciones más significativas.

			A través de experimentaciones con diferentes descriptores y una validación auditiva, se determinó que los cambios tímbricos eran el criterio más adecuado para la segmentación en el contexto de la improvisación libre. Esta segmentación de audio se basó en el uso del algoritmo
El siguiente paso fue construir una base de datos derivada del corpus de segmentos de audio, donde cada elemento se describe numéricamente. Para llevar a cabo esta tarea, se empleó la librería
Posteriormente, un algoritmo de aprendizaje automático fue empleado para analizar la base de datos generada. Este algoritmo tiene la capacidad de discernir entre las particularidades tímbricas individuales cada segmento de la base de datos a través de la modificación de sesgos y pesos durante el entrenamiento. Para realizar este proceso, la base de datos se divide en dos partes: una se destina al entrenamiento, y la otra a probar el modelo computacional resultante. Durante el aprendizaje, el modelo proporciona un índice de certeza para clasificar o predecir diversos datos en relación con los datos del conjunto de entrenamiento.

				SEALI toma dos enfoques: el aprendizaje supervisado y el aprendizaje sin supervisión (Kotsiantis, S. B., Zaharakis, I. D., y Pintelas, P. E. (2006). Machine learning: A review of classification and combining techniques. , , 159–190.Kotsiantis et al., 2007). La distinción clave entre estos enfoques radica en que el primero requiere una base de datos anotada, mientras que el segundo usa datos no clasificados (Kotsiantis, S. B. (2007). Supervised machine learning: A review of classification techniques. , (3), 249-268.Kotsiantis, 2007). En el campo del aprendizaje automático, la clasificación se considera un caso de aprendizaje supervisado en el que se dispone de un conjunto de datos previamente etiquetados, ya sea por humanos o por un modelo de agrupación de datos (Hastie, T., Tibshirani, R., y Friedman, J. (2009). . Springer.Hastie et al., 2009). El aprendizaje no supervisado, por otro lado, se conoce como
El propósito de la clasificación es asignar subcategorías a un conjunto de categorías previamente definidas. Estas categorías deben estar etiquetadas previamente, ya sea mediante una clasificación binaria—
La principal función del aprendizaje automático y de los modelos es la de procesar y analizar datos sin la necesidad de definir reglas explícitas para cada problema. A diferencia de los sistemas expertos que requieren reglas definidas, los modelos de redes neuronales pueden abstraer y sintetizar información para identificar patrones y predecir nueva información. Esto es útil en una amplia variedad de problemas, incluyendo aquellos relacionados con aspectos sensibles de naturaleza humana, así como la creatividad y el arte. Los modelos se construyen a través del entrenamiento, que implica la actualización de pesos y sesgos, la optimización y la regularización de los datos. Estas funciones permiten a los modelos definir límites en el espacio de datos para categorizar nuevas observaciones.

				
					Fiebrink, R. A. (2011). Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral). Princeton University, USA.Fiebrink (2011), añade que, los algoritmos de aprendizaje supervisado de uso general destinados a tareas de clasificación y regresión tienen la capacidad de aprender la relación entre las entradas y las salidas. A este respecto, un enfoque interesante es donde los usuarios pueden evaluar los modelos entrenados al ejecutarlos en tiempo real, observando cómo se comporta el sistema, por ejemplo, a través de la generación de sonidos sintetizados a medida que se introducen nuevas entradas. Además, los usuarios tienen la opción de ajustar y modificar de manera iterativa los ejemplos de entrenamiento y reentrenar los algoritmos utilizando los datos modificados. A aproximación podría llamarse aprendizaje automático interactivo y brinda a los usuarios la capacidad de corregir fácilmente múltiples errores del sistema mediante modificaciones
En un contexto de trabajo con compositores enfocados en el diseño de instrumentos controlados por gestos mediante el uso del aprendizaje automático interactivo Fiebrink (2010), observa una estrategia útil para explorar nuevos sonidos y relaciones entre gestos y sonidos. En este enfoque, los compositores primero establecen los 'límites sonoros y gestuales del espacio compositivo', definiendo valores para los parámetros de síntesis y las posiciones gestuales del controlador. Luego, crean un conjunto inicial de datos de entrenamiento utilizando gestos y sonidos en estos límites establecidos. Después de entrenar las redes neuronales con estos datos, los modelos resultantes permiten a los compositores navegar por el espacio de gestos, descubriendo nuevos sonidos tanto dentro como fuera de los límites establecidos por los ejemplos iniciales.

				De manera análoga a lo que se describe en Fiebrink, R., Trueman, D., Britt, C., Nagai, M., Kaczmarek, K., Early, M., y Cook, P. (2012, marzo). . ICMC.Fiebrink et al. (2012), en el contexto de SEALI, después de que el algoritmo
Una de las razones que me llevó a elegir el algoritmo de
La idea detrás de esta aproximación es utilizar medidas de similitud o diferencias sonoras para definir grupos basados en características tímbricas. En este sentido, se empleó el algoritmo de
El objetivo de incluir este enfoque es permitir que los algoritmos descubran patrones numéricos en los datos del audio para así evitar el sesgo que un humano podría introducir en este proceso y dejar al algoritmo tomar esa decisión. Si bien, esto refleja una diferencia fundamental entre la percepción humana y de máquinas debido a que en algunos casos la clasificación no se adecuaba a las decisiones que un humano pudiera haber tomado, destaca la necesidad de comprender cómo funcionan los algoritmos de clasificación sin supervisión y cuáles son sus limitaciones en contextos complejos como los presentes en la improvisación libre. A continuación, presento los resultados de clasificación producidos por el algoritmo

					
Clasificación de la base de datos con el algoritmo de MSCS
Mapa de conexiones de SEALI para la predicción tímbrica e interacción en la improvisación libre
Alpaydin, E. (2004). . MIT Press.
Bailey, D. (1980). . Moorland.
Barad, K. M. (2007). . Duke University Press.
Briot, J., Hadjeres, G., y Pachet, F. (2019). . Springer International Publishing.
Brownlee, J. (2017). . Machine Learning Mastery.
Collins, N. (2006). Towards autonomous agents for live computer music: Realtime machine listening and interactive music systems (Tesis doctoral). University of Cambridge.
Collins, N. (2012). Automatic composition of electroacoustic art music utilizing machine listening. , (3), 8-23.
Davis, S., y Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. , (4), 357-366.
Comaniciu, D., y Meer, P. (2002). Mean shift: A robust approach toward feature space analysis. , (5), 603-619.
Dudas, R. (2010). Comprovisation: The various facets of composed improvisation within interactive performance systems. , , 29-31.
Escobar Castañeda, A. A. (2022). Resistencias maquínicas: Una caracterización a la improvisación libre con aprendizaje y escucha de máquina [Tesis doctoral, Universidad Nacional Autónoma de México]. Facultad de Música.
Fiebrink, R. A. (2011). Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral). Princeton University, USA.
Fiebrink, R., Trueman, D., Britt, C., Nagai, M., Kaczmarek, K., Early, M., y Cook, P. (2012, marzo). . ICMC.
Galiana Gallach, J. L. (2018). De la naturaleza de la improvisación libre: Elementos esenciales para su identificación y diferencias con la composición escrita. Itamar. , 0.
Gillespie, T. (2013). The relevance of algorithms. En T. Gillespie, P. J. Boczkowski y K. A. Foot (Eds.), (pp. 167-194). MIT Press.
Hastie, T., Tibshirani, R., y Friedman, J. (2009). . Springer.
Hochreiter, S., y Schmidhuber, J. (1997). Long short-term memory. , (8), 1735–1780.
Johnston, J. D. (1988). Transform coding of audio signals using perceptual noise criteria. , , 314–323.
Kotsiantis, S. B. (2007). Supervised machine learning: A review of classification techniques. , (3), 249-268.
Kotsiantis, S. B., Zaharakis, I. D., y Pintelas, P. E. (2006). Machine learning: A review of classification and combining techniques. , , 159–190.
Lerch, A. (2022). . Wiley.
Matthews, W. (2012). . Turner Publicaciones.
Oliveros, P. (2005). . iUniverse.
Painter, T., y Spanias, A. (1997). A review of algorithms for perceptual audio coding of digital audio signals.
Peeters, G., y Rodet, X. (2004). Automatically selecting signal descriptors for sound classification. En (pp. 464-467).
Peeters, R. (2020). The agency of algorithms: Understanding human-algorithm interaction in administrative decision-making. , , 1-16.
Vinet, H., Herrera, P., y Pachet, F. (2002). The CUIDADO project. En 3rd International Society for Music Information Retrieval (ISMIR) Conference (pp. 197-203). Paris, France. Content Based Retrieval.
Schaeffer, P., y De Diego, A. C. (1996). (Serie Alianza música). Alianza.
Xu, R., Wunsch, D. (2008). . Reino Unido: Wiley.
Zhang, T., y Kuo, C. J. (2013). . Springer US.