Desde el cine a la estética de la síntesis neural. Texto escrito por por Alejandra Pérez[1]

Alejandra Pérez Núñez
30 diciembre 2024
Share Button

Según Alexandre Astruc en su manifiesto vanguardista de 1948, el cine es capaz de representar de forma lógica y racional las ideas de la misma forma que la escritura. A esto lo ha llamado el cine lapicera o film stylo, que se libera de la tiranía de las imágenes y la narración[2]. En su manifiesto también declara que esta propuesta no es nueva. “Feyder ha dicho: yo podría hacer una película del Espíritu de la Ley de Montesquieu. Pero Feyder estaba pensando en ilustrar con imágenes al igual que Eisenstein había pensado en ilustrar El Capital de Marx en forma de libro.”[3]. También señala que el problema fundamental del cine es encontrar las maneras de expresar el pensamiento[4].

Para la artista Ursula Biemann ha pasado mucho desde Sans soleil de Chris Marker, película producida a principios de los años 1980, y que marca para ella el inicio del cine-ensayo que describe como “la emergencia de una práctica post estructuralista”[5]. Para Biemann, el cine- ensayo “es una práctica teórica, artística y política”. En Stuff it Biemann señala la necesidad de mirar las tecnologías y la internet e indagar en cómo nutren al ensayo con su materialidad, mientras que abren nuevas posibilidades de compromiso crítico. Se trata de un desplazamiento fundamental, así como la separación del video-ensayo de la tradición literaria francesa germánica para adquirir una perspectiva postcolonial de estudios culturales[6]. Para Biemann el trabajo del ensayista no tiene tanta relación con documentar la realidad como con “organizar la complejidad [...] El ensayo es bueno para capturar los procesos abstractos e intangibles de las transiciones sociales y culturales”[7].

Según Daniella Dotorinni el video-ensayo sigue la tradición del cine lapicera de Astruc y es en sí mismo una metodología de investigación: “El video-ensayo se configura claramente como una forma de análisis e investigación, como un ejemplo de pensamiento material (material thinking) que tiene lugar a través del contacto, la apropiación y la manipulación del propio objeto de investigación”[8]. Dotorinni asocia al video-ensayo todas las prácticas fílmicas asistidas por software especializado y basadas en la cultura del software y el remix como aquellas que van desde “el ludo essay, el mash-up, el vidding a las más poéticas y experimentales (el lyric essay o el desktop documentary)”[9]. La fotografía como método de investigación ha sido aplicada en el campo de la antropología visual[10] y el cine etnográfico contribuyó al establecimiento de la subdisciplina de la antropología visual y también ha sido reconocido como una influencia fundamental como forma de arte y herramienta política[11]. Jessica Jacobs reflexiona sobre el aumento de interés sobre el cine digital como método de investigación en geografía y lo compara con el desplazamiento al interior de los métodos cualitativos de investigación hacia formas de cuestionamiento basadas en la práctica, experienciales y corporeizadas.

El artículo “El estudio como laboratorio”[12] establece que la investigación en la práctica (practice based research) ha evolucionado en que ambas son actividades interdependientes que tienen beneficios mutuos, así como resultados distintivos. De esta forma, investigación y práctica o investigación y realización, pueden considerarse como un continuo, lo que abre espacio al arte para ser considerado un tipo de pensamiento material y la puesta a prueba de sus diseños como metodologías de investigación. La investigación artística en la práctica puede analizar, cuestionar, proponer y describir representaciones, visibilizando las relaciones de poder que están incorporadas en las representaciones de la otredad.

Un caso relevante de este tipo de operaciones es el trabajo de la cineasta y etnógrafa vietnamita Trinh T. Minh-ha, quien ha señalado las relaciones de poder implícitas en el cine del primer y tercer mundo. En su crítica, alerta el frecuente cuestionamiento a que una cineasta del tercer mundo haga cine sobre el tercer mundo, como un problema de objetividad, de subjetividad versus objetividad, de afuera y adentro. Minh-ha pregunta ¿Dónde está la línea que separa el interior del exterior?[13] a la vez que interroga si es que puede la teoría del cine hablar desde el cine en sí mismo, sin tomar conceptos de otras prácticas. Ante esto enfatiza que la evidencia continúa siendo evidencia, aunque la mirada se califique a sí misma como subjetiva u objetiva. De fondo continúa el poder que tiene el film para capturar la realidad (ahí afuera) para nosotros (aquí dentro)[14]. La crítica de Minh-ha a la racionalidad cartesiana es incorporada a la metodología que será descrita más adelante, en el sentido en que el cine es considerado un ensamblaje social y técnico capaz de producir conocimiento a propósito de su involucramiento, precisamente por la difusa línea entre adentro y afuera, entre lo subjetivo y lo objetivo.

En esta misma dirección, de cuestionamiento de la separación objetividad-subjetividad en el contexto de la metodología de investigación artística se propone la práctica artística como un instrumento de medición y a la vez de intervención. La metodología tiene una capacidad performativa y mientras se ejecuta produce la realidad. La música computacional y el cine como herramientas de medición y ensayo, cuestionan las divisiones de la experiencia de lo subjetivo y objetivo.

El método como instrumento de medición e intervención coincide con las descripciones que realiza la historiadora de la física Karen Barad sobre los experimentos de Niels Bohr que confirman que los diseños experimentales influyen en los resultados de forma material. En este sentido, Karen Barad ofrece conceptos importantes para esta metodología, como la difracción, la “intra materialidad” y la interferencia, los cuales ayudan a comprender el quehacer artístico en la práctica. Barad sugiere el concepto de intra materialidad como una alternativa al de interactividad para detener la dinámica de representaciones donde el sujeto está separado del objeto.

En su artículo[15], Scurto, Caramiaux y Bevilacqua, delinean la práctica difractiva del aprendizaje de máquinas (machine learning) en el marco material del diseño de interacción. Con este objetivo revisan los aportes de trabajos relacionados con el diseño de interacción humano-computador (HCI), nuevas interfaces para la expresión musical y arte computacional. También revisan estudios centrados en la práctica performativa musical y el arte robótico basado en herramientas de aprendizaje de máquinas, en lo que esperan revelar la materialidad computacional y el potencial de  incorporación (embodiment) para desarrollar prototipos de inteligencia artificial que reconfiguran sus propios comportamientos técnicos y conceptuales.

Algunos artistas que involucran en su práctica el uso de tecnologías informáticas han explorado las interfaces y cuestionado el rol del usuario. Han traído desde el mundo de la música computacional el concepto de ejecutante o performista (performer), que representa mejor la relación del músico con su instrumento, pues sugiere una relación que no solamente es de uso, en el sentido de que no implica una relación entre un sujeto y un objeto sino más bien una correspondencia material y estética entre gesto e información.

Memo Akten realizó su tesis doctoral en el departamento de Computación Creativa de Goldsmiths en “instrumentos profundos”. Allí integra redes neuronales para escribir, generar imágenes y distintos acercamientos a la música. Akten, que ha desarrollado instrumentos multimediales haciendo uso de redes de aprendizaje profundas, que aumentan la performance creativa, por ejemplo, el uso de gestos para navegar bancos sonoros. Su trabajo desarrolla formas de “control humano significativo” que está definido por la predictibilidad y la responsividad. El desarrollo se enfoca en el control continuo en tiempo real para incrementar la capacidad de feedback inmediato en la performance interactiva (el live act o acto en vivo). Esta inmediatez favorece la exploración sin objetivos. En su investigación, Akten ha buscado formas para navegar y explorar qué información valiosa ha aprendido una Deep Neural Network (DNN) y cómo se puede usar ese tipo de modelo para la producción de trabajos artísticos y creativos de manera performativa y expresiva[16].

Para Akten, la relación con los instrumentos se extiende más allá del usuario y en su lugar está la ejecutante (performer) del instrumento. El artista utiliza al menos dos tipos de redes neuronales para producir samples. Las redes del tipo Generative Adversarial Networks (GAN) y las Deep Convolutional Generative Adversarial Networks (DCGAN), con las que establece una red de discriminación. Otros artistas, como Dadabots, utilizan redes neuronales como Sample RNN, un modelo neural de generación aural. En su artículo, Carr y Zukowski documentan cómo, desde comienzos del siglo XX, para la generación de música de estilo black metal y rock matemático la manipulación del timbre se volvió relevante para la composición, al mismo tiempo que indican el potencial investigativo de la estética de la síntesis neural y su quimera compuesta de coros de voces fantasmales y la inter-polinización de múltiples registros[17].

Recientes investigaciones artísticas, como la de Rebecca Fiebrink, Gabriel Vigliensoni  y Louis McCallum en Goldsmiths[18], se han enfocado en la investigación de las firmas rítmicas en los espacios latentes de ritmos musicales. En el caso de R-VAE[19] , se habilita un tipo de codificación que considera una tercera grilla métrica lo que deriva en una codificación de la estructura del ritmo en la estructura de los datos. Una grilla métrica se puede explicar como la ratio principal según la cual los comienzos de las notas son localizados en una medida[20]. Según Vigliensoni, McCallum, y Fiebrink, los géneros de música actual (como footwork, trap, 2-step, gqom, drum and bass, y dembow) se basan en ritmos hasta de 32 veces una nota triplet, por lo que la codificación debe hacerse de forma más fina. Para su investigación, la interacción con un espacio latente plantea preguntas excelentes como: ¿Cómo se pueden caracterizar los espacios latentes en términos de suavidad de las interpolaciones? O ¿Cuál es una buena métrica para medir la riqueza del espacio codificado? Al fondo de su investigación resuenan preguntas que se escapan a la literatura técnica, como las que apuntan a las pequeñas diferencias en la percepción de formas rítmicas.

El trabajo liberado por IRCAM, Realtime Audio Variational autoEncoder (RAVE)[21], consiste en una librería basada en un modelo de generación profunda para la codificación automática de audio basada en redes neuronales convolutivas que  permite ejecutar síntesis de forma de onda de audio y trabajar en tiempo real con redes neuronales en el entrenamiento del modelo. Gabriel Vigliensoni, Phoenix Perry y Rebecca Fiebrink apuntan a la utilización de bases de datos pequeñas en el entrenamiento del modelo, lo que resultaría en un aumento de la influencia humana sobre el modelo computacional de GenAI. Menciona por ejemplo, el trabajo de Dadabots, que entrena el modelo sobre un solo álbum de una banda de black metal y el trabajo de Anna Ridler que entrena al modelo pix2pix con todos sus dibujos para continuar generando dibujos[22]. En este sentido el uso de pequeñas bases de datos (small datasets) recuperan la agencia humana sobre el modelo computacional.

Cabe destacar además la literatura que considera la síntesis neural de audio como una metodología de investigación. En el campo de la antropología, Mark Dyer revisa ejemplos de la música computacional y el uso de modelos entrenados con aprendizaje supervisado como métodos para representar las ciudades[23]. Dyer ejemplifica su argumento con la actividad de artistas tales como Sam Salem, cuya obra Midlands (2019) deriva material musical desde la red neuronal profunda WaveNet. Del mismo modo, describe el trabajo de Jennifer Walshe quien usa la red neuronal SampleRNN en la obra A late anthology of early music. Vol. 1: ancient to renaissance (2020) para crear una narrativa simulada del arte musical occidental. También menciona los trabajos The lady 's glove (1991) y Spring spyre (2012) de Laetitia Sonami, quien usa aprendizaje de máquinas para mapear instrumentos digitales[24]. Según Dyer, estos trabajos pueden ser descritos como antropología artístico-algorítmica, y lo que Salem y Walshe realizan es “utilizar aprendizaje de máquinas para explorar, refractar y reimaginar los pasados y presentes de los contextos personales en que cada trabajo reside. Explorar cómo cada compositor debe primero recolectar el cuerpo de datos desde el mundo, para entrenar el algoritmo, un proceso de encontrar, compilar y refinar”[25].

Describe más allá, los extraños glitches y artefactos de audio, que no son para él solo decoraciones estéticas. Más bien en su desplazamiento desde las fuentes originales surge un espacio interpretativo en que la audiencia es invitada a evaluar cómo sienten estos sonidos respecto a cómo deberían sonar. Para Dyer la materialidad de una presencia múltiple aproxima el método de trabajo con redes neuronales al cine de Trinh T. Minh-ha y a su concepto de hablar en las cercanías “speaking nearby”[26]. Para el autor este tipo de metodologías constituyen una antropología en el sentido que Tim Ingold la define, como un “aprendiendo a aprender”.

Metodología

El trabajo que describiré a continuación fue desarrollado con el archivo de sonido de la comunidad colaborativa de arte digital Dada[27] en Mayo de 2023. Para ellos he compuesto What a very good soup, una colección de sonido para cuatro canales que fue desarrollado para ser utilizado en una instalación inmersiva cuadrafónica[28]. El sonido, para cuatro canales fue producido usando herramientas de software libre como SuperCollider y Pure Data. Un total de quinientos archivos, de duración y calidad heterogéneas fueron explorados y estandarizados ejecutando líneas de comando para procesar de forma masiva los audios. En este proceso los distintos archivos, frecuentemente notas de voz  y grabaciones hechas con teléfonos y también composiciones e improvisaciones en vivo, fueron indexados por asociación a las categorías de música, poesía, lenguaje, ambientes naturales, ambientes urbanos, música y spam.

Lo siguiente fue establecer una serie de procesos automatizados para reproducir fragmentos de estos audios en un loop y también registrar aleatoriamente fragmentos de los fragmentos. Estas acciones fueron iteradas.

Los archivos de Dada fueron reproducidos en una lista que cambiaba al azar según un metrónomo cuyo tempo también cambiaba al azar. En estas operaciones elementales comienzan a aparecer artefactos sonoros e inter-polinización de los registros con aquella cualidad descrita como fantasmal o extrañamente extraña, que según Dyer corresponde al espacio interpretativo que surge con el desplazamiento desde la fuente original, entre lo que se escucha y lo que se asocia a lo que es.

Una colección  de quinientos elementos puede ser considerada una base de datos pequeña (small dataset) y sobre ella  teóricamente una aplicación de inteligencia artificial podría explorar, clasificar y refinar, produciendo nuevos sonidos con la cualidad característica del archivo. Para componer What a very good soup he seguido un método artístico algorítmico con la idea de producir desplazamientos desde la fuente original a través de la concatenación de procesos ejecutados con software. ¿A quién corresponde la agencia en esta  red de procedimientos?.

Conclusiones

En esta exploración se ha aplicado una metodología algorítmica para navegar la complejidad de los bancos sonoros y  producir poesía-sonora-ensayo a partir de esta navegación. La exploración junto a procesos algorítmicos abre el dilema de la identidad “el dilema de que el trabajo sea explicado (o clausurado) a través de la propia personalidad y los atributos particulares de cada una”[29]. La identidad está difractada por las operaciones de muestreo y azar.  La composición desde un punto de vista colectivo dispone la atención sobre las pequeñas diferencias y la percepción de inter-polinizaciones, los acercamientos oblicuos al otro, “hablando cerca“ como señala Trinh Thi Minha[30]. La presencia múltiple característica de este acercamiento revela la estructura de la que los archivos son parte. El método de composición opera incorporando la subjetividad en relación con lo otro como multiplicidades de yoes involucrados en el movimiento a aproximarse a otros yoes.

Dada Perspective (2022) - Beatriz Ramos

Óscar Santis

© Óscar Santis

Retrato de Alejandra Pérez (2022)

Referencias bibliográficas

  • Akten, Memo. “Deep visual instruments: realtime continuous, meaningful human control over deep neural networks for creative expresión”. Tesis doctoral, Goldsmiths, University of London, 2021.
  • Caillon, Antoine y Philippe Esling. “RAVE: a variational autoencoder for fast and high-quality neural audio synthesis”. arXiv preprint arXiv:2111.05011 (2021).
  • Carr, C. J., and Zack Zukowski. "Generating albums with samplernn to imitate metal, rock, and punk bands." arXiv preprint arXiv:1811.06633 (2018).
  • Chen, Nancy N., and Trinh T. Minh-Ha. "Speaking nearby." In Visualizing theory, pp. 433-453. Routledge, 2014.
  • Collier, John, and Malcolm Collier. Visual anthropology: Photography as a research method. UNM Press, 1986.
  • Dyer, Mark. “Neural synthesis as a methodology for art-anthropology in contemporary music”. Organised Sound 27, n. 2 (2022), pp. 1-8.
  • Biemann, Ursula (ed.). Stuff it: the video essay in the digital age (vol. 2). Zúrich y Nueva York: Edition Voldemeer y Springer Wien, 2003.
  • Dottorini, Daniele y Malena Di Bastiano. “El video-ensayo: la escritura o el montaje soberano”. Arkadin, n. 10 (agosto de 2021).
  • Edmonds, Ernest A., Alastair Weakley, Linda Candy, Mark Fell, Roger Knott y Sandra Pauletto. “The studio as laboratory: combining creative practice and digital technology research”. International Journal of Human-Computer Studies 63.
  • Jacobs, Jessica. “Filmic geographies: the rise of digital film as a research method and output”. Area 48, n. 4 (2016).
  • MacKenzie, Scott (ed.). Film manifestos and global cinema cultures: a critical anthology. California: University of California Press, 2021.
  • Minh-Ha, Trinh. “Not you/like you: postcolonial women and the interlocking questions of identity and difference”. Cultural Politics, n. 11 (1997), pp. 415-419.
  • Minh-Ha, Trinh T. "Documentary is/not a name." October 52 (1990), pp 77-98.
  • Scurto, Hugo, Baptiste Caramiaux y Fredric Bevilacqua. “Prototyping machine learning through diffractive art practice”. DIS ‘21: Designing Interactive Systems Conference 2021. Nueva York: Association for Computing Machinery, 2021, pp. 2013-2025.
  • Vigliensoni, Gabriel, Louis McCallum y Rebecca Fiebrink. “Creating latent spaces for modern music genre rhythms using minimal training data”. ICCC’20 11th International Conference on Computational Creativity (2020).
  • Vigliensoni, Gabriel, Phoenix Perry, and Rebecca Fiebrink. "A Small-Data Mindset for Generative AI Creative Work." (2022).
  • Vigliensoni, Gabriel, and Marcelo M. Wanderley. "Soundcatcher: explorations in audio-looping and time-freezing using an open-air gestural controller." In ICMC. 2010.
  •  Dada Perspective, (2022)
  •  Beatriz Ramos
  •  Retrato de Alejandra Pérez (2022)
  •  Fotografía de Óscar Santis
  •  What a very good Soup (2023)
  •  Sonido para el Immersive Room de dada.nyc
  •  Alejandra Pérez
  • Alejandra Pérez Núñez

What a very good Soup (2023). Sonido para el Immersive Room de dada.nyc Alejandra Pérez

Alejandra Pérez Núñez

Es una artista chilena. Sus intereses incluyen, el hackeo, el software libre, la performance y la filosofía. Ha sido formada en psicología, estética y medios, en Chile en la P. Universidad Católica y en Holanda en el Instituto Piet Zwart. El año 2020 ha recibido el grado de Doctor en Filosofia por la Universidad de Westminster, Inglaterra. “Mi trabajo se desarrolla en torno al concepto de imperceptibilidad, los fenómenos imperceptibles, la violencia epistémica y el tiempo profundo. En todos estos casos la imperceptibilidad toma distintas formas relacionadas con el acceso al conocimiento”.

+ info: http://elpueblodechina.org

Proyecto Financiado por Fondart Nacional, convocatoria 2022.

Notas

  1. [1] También conocida como elpueblodechina http://elpueblodechina.org
  2. [2] Alexandre Astruc en Scott MacKenzie (ed.), Film manifestos and global cinema cultures: a critical anthology (California: University of California Press, 2021), p. 609. Todas las citas son traducciones del autor.
  3. [3] Ibidem, p. 605.
  4. [4] Ídem.
  5. [5] Ursula Biemann (ed.), Stuff it: the video essay in the digital age (vol. 2) (Zúrich y Nueva York: Edition Voldemeer y Springer Wien, 2003), p. 6.
  6. [6] Ibidem, p. 10.
  7. [7] Ibidem, p. 10.
  8. [8] Daniele Dottorini y Malena Di Bastiano, “El video-ensayo: la escritura o el montaje soberano”, Arkadin, n. 10 (agosto de 2021), p. 7.
  9. [9] Ibidem, p. X.
  10. [10] Collier, John, and Malcolm Collier. Visual anthropology: Photography as a research method. UNM Press, 1986.
  11. [11] Jessica Jacobs, “Filmic geographies: the rise of digital film as a research method and output”, Area 48, n. 4 (2016), p. 452.
  12. [12] Ernest A. Edmonds, Alastair Weakley, Linda Candy, Mark Fell, Roger Knott y Sandra Pauletto, “The studio as laboratory: combining creative practice and digital technology research”. International Journal of Human-Computer Studies 63, pp. 452.
  13. [13] Trinh T. Minh-ha, “Not you/like you: postcolonial women and the interlocking questions of identity and difference”, Cultural Politics, n. 11 (1997), “the question of outsider and insider in ethnographic practices.”p. 3.
  14. [14] Trinh T. Minh-ha “Documentary Is/Not a Name”. October, 52, 76. (1990), p.83.
  15. [15] Hugo Scurto, Baptiste Caramiaux y Fredric Bevilacqua, “Prototyping machine learning through diffractive art practice”, en DIS 21: Designing Interactive Systems Conference 2021 (Nueva York: Association for Computing Machinery, 2021), pp. 2013-2025.
  16. [16] Memo Akten, “Deep visual instruments: realtime continuous, meaningful human control over deep neural networks for creative expression” (tesis doctoral, Goldsmiths, University of London, 2021).
  17. [17] C. J. Carr y Zack Zukowski, “Generating albums with SampleRNN to imitate metal, rock, and punk bands”, arXiv:1811.06633v1 (noviembre de 2018), pp. 1-2.
  18. [18] Gabriel Vigliensoni, Louis McCallum y Rebecca Fiebrink, “Creating latent spaces for modern music genre rhythms using minimal training data”, ICCC’20 11th International Conference on Computational Creativity (2020).
  19. [19] Rhythm generator using Variational Autoencoder(VAE)
  20. [20] Vigliensoni, Gabriel, Phoenix Perry, and Rebecca Fiebrink. "A Small-Data Mindset for Generative AI Creative Work." (2022).
  21. [21] Antoine Caillon y Philippe Esling, “RAVE: A variational autoencoder for fast and high-quality neural audio synthesis”, arXiv preprint arXiv:2111.05011 (2021).
  22. [22] Vigliensoni, Gabriel, Phoenix Perry, and Rebecca Fiebrink. "A Small-Data Mindset for Generative AI Creative Work." (2022).
  23. [23] Mark Dyer, “Neural synthesis as a methodology for art-anthropology in contemporary music”, Organised Sound 27, n. 2.
  24. [24] Para Spring spyre, Sonami colaboró cercanamente con la desarrolladora Rebecca Fiebrink y su herramienta de aprendizaje de máquinas Wekinator.
  25. [25] Ibidem, p. 5.
  26. [26] Ibidem, p. 6.
  27. [27] https://dada.nyc/home
  28. [28] Parte de la sala inmersiva expuesta en la exhibición  “Dada Perspective” en el Meet Center for Digital Culture en la ciudad de Milán en Italia https://www.meetcenter.it/en/event/dada-perspective-opening-2/
  29. [29] Nancy N. Chen, y Trinh T. Minh-Ha. "Speaking nearby." In Visualizing theory, pp. 433-453. (2014).p. 83
  30. [30] “un hablar que no objetiva, que no señala un objeto como si estuviera lejos del sujeto hablante o ausente del lugar hablante. Un hablar que reflexiona sobre sí mismo y puede acercarse mucho a un tema sin apoderarse de él o reivindicarlo. Un hablar en breve, cuyos cierres son sólo momentos de transición que se abren a otros posibles momentos de transición, son formas de indirectas bien comprendidas por cualquiera que esté en sintonía con el lenguaje poético”. Ibídem. p. 87

A excepción del contenido de terceros y de que se indique lo contrario, éste artículo se encuentra bajo una Licencia Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International Licencia.

Share Button