La IA que compone música con modelos de difusión pone en jaque la autoría y la creatividad humana

🕒 Publicado en Zendoric: 2 de septiembre de 2026 · 08:27
✨ Generado con IA · cómo se hace
Un artículo de MIT Technology Review explora cómo los modelos de difusión —el mismo tipo de tecnología que generó el boom de imágenes y vídeo por IA— están llegando ahora a la música, un terreno que el autor considera especialmente vulnerable porque la música está profundamente ligada a las emociones, los recuerdos y…
Un artículo de MIT Technology Review explora cómo los modelos de difusión —el mismo tipo de tecnología que generó el boom de imágenes y vídeo por IA— están llegando ahora a la música, un terreno que el autor considera especialmente vulnerable porque la música está profundamente ligada a las emociones, los recuerdos y la vida social de las personas. El texto arranca con un repaso histórico: en 1956, en la célebre conferencia de Dartmouth donde se acuñó el término «inteligencia artificial», los organizadores ya incluían entre los retos del campo construir máquinas capaces de creatividad y originalidad, y proponían una fórmula llamativa: la diferencia entre el pensamiento creativo y el meramente competente residiría en la inyección de algo de aleatoriedad, guiada por intuición. Casi setenta años después, los modelos de difusión siguen esa receta casi al pie de la letra.
El artículo explica de forma didáctica cómo funcionan estos modelos usando el ejemplo de una imagen de un elefante: se entrenan añadiendo progresivamente ruido aleatorio a fotos reales hasta convertirlas en pura estática, mientras el modelo aprende estadísticamente a revertir ese proceso, es decir, a «desruidar» la imagen paso a paso. Una vez entrenado, generar contenido nuevo consiste en partir de ruido puro y, guiado por un texto de entrada (el prompt), ir retirando ruido hasta que emerge una imagen coherente, sin que el modelo «sepa» realmente qué es lo que está representando. En música, el mecanismo es análogo pero se aplica sobre formas de onda o espectrogramas, es decir, representaciones visuales de las señales sonoras: el modelo aprende a partir de millones de fragmentos de canciones etiquetadas con descripciones, y luego genera nuevas formas de onda —y por tanto nuevas canciones completas, con todos sus instrumentos y voces a la vez, no instrumento por instrumento— a partir de ruido aleatorio moldeado por el prompt del usuario.
El reportaje pone nombre a los actores que lideran esta carrera: Udio, con sede en Nueva York y cofundada por David Ding (antes ingeniero senior en modelos de difusión de imagen y vídeo en Google DeepMind) y Andrew Sanchez como director de operaciones, y Suno, con sede en Cambridge (Massachusetts). Según los datos citados, Suno afirma tener más de 12 millones de usuarios y captó una ronda de financiación de 125 millones de dólares en mayo de 2024, además de haber establecido una colaboración con el productor Timbaland. Udio, por su parte, levantó una ronda semilla de 10 millones de dólares en abril de 2024 con inversores como Andreessen Horowitz y músicos como Will.i.am y Common. Ambas compañías buscan que personas sin formación musical puedan generar canciones completas, y Suno ya cuenta con páginas de «artistas» que son en realidad usuarios expertos en escribir prompts, algunos con seguimiento notable, acompañados incluso de imágenes de «artista» generadas también por IA.
El artículo señala que ambas empresas afrontan demandas de las grandes discográficas —incluidas Universal y Sony— presentadas en junio de 2024, todavía en curso. Las discográficas alegan que los modelos se entrenaron con música protegida por derechos de autor «a una escala casi inimaginable» y que generan canciones que imitan cualidades de grabaciones humanas reales; la demanda contra Suno menciona específicamente una canción de estilo ABBA llamada «Prancing Queen» como ejemplo. Suno no respondió a las preguntas para el reportaje, pero su consejero delegado, Mikey Shulman, declaró en el blog de la empresa en agosto que entrenan con música disponible en internet abierto, que «efectivamente contiene materiales protegidos», defendiendo no obstante que «aprender no es infringir». Udio no quiso comentar el litigio en curso, aunque en su momento afirmó que su modelo incorpora filtros para no reproducir obras protegidas ni voces de artistas concretos. El texto añade que, en enero, la Oficina de Copyright de EE. UU. publicó una guía según la cual las obras generadas con IA pueden registrarse si incluyen una aportación humana considerable, y que un mes después un artista de Nueva York obtuvo lo que podría ser el primer copyright de una obra visual creada con ayuda de IA, con la música señalada como el siguiente terreno probable. También se apunta que YouTube habría negociado con grandes discográficas licencias de música para entrenamiento de IA, y que Meta amplió sus acuerdos con Universal Music Group, lo que sugiere que este tipo de licencias podría generalizarse independientemente de cómo acaben los pleitos.
Más allá del plano legal, el artículo profundiza en qué hace buena —o no— a la música generada por IA, señalando tres factores: los datos de entrenamiento, la arquitectura del propio modelo de difusión y la calidad del prompt. Ninguna de las dos empresas ha revelado qué música compone su conjunto de entrenamiento, aunque previsiblemente ese dato saldrá a la luz en los litigios. Ding explica que el etiquetado de las canciones —desde descripciones básicas de género hasta matices como si una pieza es «melancólica» o detalles técnicos como una progresión de acordes— es un área de investigación activa en Udio, que combina anotadores con formación musical formal y aficionados con vocabulario más informal para poder atender a una base de usuarios amplia. El texto también subraya que estos modelos necesitan alimentarse continuamente de música nueva creada por humanos para no quedar «anclados» en el tiempo, aunque menciona que, siguiendo una tendencia ya explorada en otros ámbitos de la IA, en el futuro podrían llegar a entrenarse con sus propias salidas.
Un aspecto curioso que resalta el artículo es la aleatoriedad deliberada de estos sistemas: dado que parten de una muestra de ruido, dar el mismo prompt al mismo modelo produce una canción distinta cada vez, y compañías como Udio inyectan aleatoriedad adicional distorsionando ligeramente la forma de onda en cada paso para lograr imperfecciones que resulten más «interesantes» o «reales». Sanchez comenta que esa naturaleza no determinista sorprende incluso a los artistas que colaboran con Udio, acostumbrados a que el software dé siempre la misma respuesta ante la misma entrada; según él, cuando preguntan por qué el sistema actúa así, la respuesta honesta de la empresa es que «no lo sabemos realmente», lo que ilustra que la era generativa exige aceptar programas más «desordenados» e inescrutables.
El artículo dedica buena parte del análisis a contrastar estos procesos con lo que la ciencia cognitiva sabe sobre la creatividad humana. Repasa la definición clásica formulada en 1953 por el psicólogo Morris Stein —una obra creativa debe ser novedosa y útil (o «satisfactoria»), y algunos añaden que también debe resultar sorprendente— y cómo, desde los años noventa, técnicas como la resonancia magnética funcional permitieron estudiar los mecanismos neuronales de la creatividad. Cita a Roger Beaty, del Laboratorio de Neurociencia Cognitiva de la Creatividad de Penn State, quien describe la «teoría asociativa» de la creatividad: las personas más creativas conectarían conceptos muy distantes semánticamente, un fenómeno que la investigación ha vinculado a la memoria semántica y a una atención más «permeable» a información en principio irrelevante. Beaty y otros investigadores, entre ellos Dean Keith Simonton, insisten en que la creatividad no reside en una única zona cerebral —«nada en el cerebro produce creatividad como una glándula secreta una hormona»—, sino en redes dispersas de actividad: unas para generar ideas por asociación, otras para identificar las más prometedoras y otras para evaluarlas y modificarlas. El artículo menciona además un estudio de febrero liderado por investigadores de Harvard Medical School que sugiere que la creatividad podría implicar incluso la supresión de ciertas redes cerebrales, como las asociadas a la autocensura.
Frente a esto, el reportaje da voz a defensores de la música generada por IA que sostienen que la creatividad humana también se apoya en una suerte de «estadística» acumulada por la experiencia: el compositor Anthony Brandt, profesor de música en la Universidad Rice, argumenta en un estudio reciente que tanto los humanos como los grandes modelos de lenguaje usan experiencias pasadas para evaluar escenarios futuros y tomar mejores decisiones, y recuerda que buena parte del arte humano, especialmente en música, es en sí mismo «prestado», lo que a menudo termina en litigios por copia o samples no autorizados. Con todo, el propio Brandt marca un límite claro donde, a su juicio, la creatividad humana supera claramente a la artificial: lo que llama «amplificar la anomalía». Según explica, los modelos de IA operan mediante muestreo estadístico, es decir, reduciendo errores y buscando patrones probables, mientras que los humanos se sienten atraídos precisamente por las rarezas, que en la creación humana no quedan como hechos aislados sino que llegan a permear toda la obra. El artículo, en el fragmento disponible, empieza a ilustrar esa idea con un ejemplo de una decisión compositiva de Beethoven, pero el texto se interrumpe ahí, por lo que no es posible reconstruir con precisión en qué consistía ese ejemplo concreto.
En conjunto, el reportaje no zanja si lo que producen estos modelos es creación genuina o simple réplica sofisticada de sus datos de entrenamiento, y deja abierta la pregunta de si esa misma ambigüedad no podría aplicarse también, hasta cierto punto, a la creatividad humana. Lo que sí deja claro es que, con o sin resolución judicial de las demandas contra Suno y Udio, la música generada por IA ya está filtrándose en playlists, bandas sonoras y plataformas de streaming, muchas veces sin que el oyente llegue a saber si detrás hay una persona o una máquina, algo que el propio autor describe como inquietante tras escuchar una canción generada por IA que le pareció genuinamente buena.
🔗 Relacionadas en Zendoric
- Atrapados en el pensamiento único: la startup que intenta que los LLM dejen de repetirse · 2026-07-03
- El Plan de Acción de IA de Trump: una distracción que desmantela las bases del liderazgo estadounidense · 2026-07-04
- Los modelos chinos de IA ganan terreno en EE. UU. mientras se disparan los costes de OpenAI y Anthropic · 2026-07-09


