Suno, que construye música con inteligencia artificial, ha entrado en la generación de voz. Ha publicado una versión beta pública que convierte guiones o descripciones impulsadas por indicaciones en audio hablado, junto con música de fondo generada por IA. La función está disponible en la web y en dispositivos móviles.
Suno toma una indicación o un guion y produce una grabación con narración y una pista debajo. La compañía dice que es el primer modelo de audio que construye voz y música en una sola pista cohesiva a la vez. Este esfuerzo va más allá de su negocio principal, aunque conlleva algunos problemas legales en el proceso.
Anuncio de Jack Brody
Jack Brody, director de producto de Suno, anunció la función, presentándola como una extensión natural de las ambiciones más amplias de la compañía. «La música siempre estará en el corazón de Suno y de lo que construimos», dijo. «Al mismo tiempo, nuestra visión siempre se ha extendido a otras formas de expresión humana».
También agregó: «Hoy, estamos expandiendo lo que es posible en Suno con Speech: el primer modelo de audio que genera voz y música juntos como una sola pista cohesiva».
Brody también abordó directamente el estado beta. «Beta realmente significa beta», dijo. «Ocasionalmente, los acentos británicos pueden desviarse a Australia y viceversa. Las pausas dramáticas pueden ser muy dramáticas. Casi con seguridad descubrirá usos para esto que nunca se nos ocurrieron».
El campo abarrotado
La síntesis de voz de aprendizaje profundo ha existido durante algún tiempo. DeepMind lo está probando desde hace diez años. Adobe tiene su propia herramienta de texto a voz. ElevenLabs se ha convertido en una de las plataformas más conocidas desde su lanzamiento en 2023, y el campo no muestra signos de desaceleración.
Suno simplemente se une a la fiesta. El generador de música de la compañía ha atraído numerosas demandas, y diversificar la plataforma tiene sentido como un movimiento estratégico. Combinar música de IA con voces generadas es la versión de Suno de las herramientas de texto a voz — el tipo de truco que podría ganarse la atención o simplemente confirmar que el mercado está saturado.
La opción de desactivar la música de fondo existe. Un interruptor le permite eliminar la banda sonora por completo, de modo que el discurso se reproduce sin acompañamiento. El propósito detrás de ello es adaptar el contenido hablado generado a usos particulares — una pista relajante para poemas, o un sonido más animado para voces en off dramáticas y discursos inspiradores.
Cómo usarlo
El proceso es sencillo. Elija la pestaña «Crear», luego vaya a la opción de Discurso. Dos modos están disponibles:
- Simple, que le permite describir lo que desea crear a través de la caja de indicaciones proporcionada (como «un capitán pirata arengando a su tripulación»).
- Avanzado, que le permite agregar un guion personalizado si ya sabe exactamente lo que desea que diga.
Los ajustes avanzados le permiten cambiar el género de la voz, su forma de hablar y la cantidad de variación en cada creación de voz. Un solo fragmento de discurso puede durar hasta unos ocho minutos.
Suno reconoce que la función está por debajo de la perfección, pero insiste en que continuará refinando Speech en función de lo que los usuarios le digan.
Lo que significa la versión beta
Lo que importa aquí es la etiqueta beta. Suno no está afirmando un producto terminado; está describiendo un trabajo en progreso. Eso significa que ocasionales acentos británicos que se desvían a Australia y viceversa forman parte de lo que la compañía dice que viene con el paquete, junto con pausas dramáticas que pueden ser muy dramáticas.
«Beta realmente significa beta», dijo Brody. «Ocasionalmente, los acentos británicos pueden desviarse a Australia y viceversa. Las pausas dramáticas pueden ser muy dramáticas. Casi con seguridad descubrirá usos para esto que nunca se nos ocurrieron.»
Es refrescante ser honesto al respecto. También sirve como un recordatorio de que la función sigue en desarrollo. Una duración máxima de ocho minutos proporciona mucho espacio, aunque las peculiaridades mencionadas forman parte de lo que los usuarios obtienen en lugar de una lista de deficiencias.
Si simplemente quiere la voz por sí sola, el interruptor existe para ese propósito. Es un alivio modesto. Más allá de eso, sin embargo, espera todo lo demás que encontrar.
“El creador de música con IA Suno ahora genera palabras habladas,” The Verge.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

