Elecciones 2026Vea quién creemos que merece su voto, según nuestros criteriosLa guía →
ESCRITO EN ESPAÑOL CLARO.
CLAY TRIBUNE.
Publicidad

Gemini 3.8 Text-to-Speech: dos nuevos modelos de texto a voz le permiten crear voces desde cero. )

Gemini 3.8 añade Flash TTS y Flash-Lite TTS para crear nuevas voces desde cero, dirección línea por línea y copia de voz.

Por mitch·6 min de lectura
Digital light beams forming the shape of a human mouth, symbolizing text-to-speech voice generation.

El gigante de la búsqueda ha lanzado dos nuevos modelos de texto a voz Gemini, y los enmarca como herramientas para un estudio creativo en lugar de simples cajas de voz preestablecidas. Según la compañía, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS permiten a los creadores construir voces completamente nuevas desde cero, ofrecer interpretaciones línea por línea y, incluso, copiar la voz de una persona a partir de una muestra de 30 segundos.

Dos Modelos, Un Estudio Creativo

Los dos modelos cumplen diferentes propósitos. Gemini 3.8 Flash TTS está diseñado para una profunda dirección creativa y diseño de personajes. Puede crear voces completamente nuevas utilizando indicaciones de lenguaje natural, dirigir cada interpretación línea por línea e incluso cambiar dialectos a mitad de oración. Está dirigido a juegos, audiolibros inmersivos, podcasts y medios interactivos.

La edición de alto volumen de Gemini Flash-Lite TTS está diseñada para doblaje, creación de contenido de audio y agentes de voz expresivos. Tanto en ambos modelos está disponible un control detallado sobre el tono, el ritmo y el matiz expresivo. 3.8

Publicidad

La familia de audio Gemini se amplía con estas nuevas adiciones, y ahora cuenta con 3.5 Live Translate, 3.5 Transcribe, 3.8 Live y 3.8 Live Extended Thinking entre sus miembros.

Construyendo Voces Desde Cero

Gemini 3.8 Flash TTS ofrece la posibilidad de pasar de nada a una voz funcional al permitirle personalizar el rol, el acento y los rasgos de la voz en más de 100 idiomas y dialectos a través de indicaciones de lenguaje natural. Incluye un ejemplo dramático de un dragón que escupe fuego y un narrador con un claro acento regional.

Una gran selección de voces listas para la producción es parte de lo que la compañía ofrece. Se incluyen más de 2,000 voces, que van del español mexicano al francés de Quebec y al inglés escocés. Un perfil vocal consistente puede reproducirse a partir de un fragmento de audio de solo 30 segundos, completo con verificación de consentimiento integrada, marcas de agua SynthID e credenciales C2PA diseñadas para proteger tanto a los desarrolladores como a los artistas de voz con los que trabajan.

La consistencia en los proyectos en curso se mantiene a través de las funciones de guardar y escalar, las cuales preservan las voces personalizadas. Una herramienta de remixaje de voz que se espera permitirá la selección de una voz de la biblioteca y el ajuste del timbre, la entonación, el ritmo y el acento usando indicaciones como «añadir un sutil acento sureño estadounidense» o «suavizar la entrega».

Dirección línea por línea

Ambos modelos TTS le permiten controlar la entrega después de elegir sus voces. Puede componer sus propias indicaciones escénicas o dejar que Gemini se encargue de todo con indicaciones de guion naturales. Los modelos mantienen una alta calidad de voz, un ritmo natural y un timbre de personaje a lo largo de horas de audio continuo, lo que los hace adecuados para podcasts y audiolibros.

Un solo guion puede utilizarse para escenificar conversaciones entre dos oradores, manteniendo sus voces separadas unas de otras. El texto incluye explosiones de diálogo escritas junto con reacciones de fondo que añaden sonido natural a la conversación, incluyendo risas, suspiros, jadeos y respuestas de escucha como |mhm| o |yeah|.

Pruebas de referencia y pruebas a ciegas

Gemini 3.8 Flash TTS obtuvo el puesto #1 en general en el Voice Design Benchmark de Hume AI, con una puntuación de 71.4. También lideró en el modelado de acentos, con una puntuación de 60.8. El modelo ocupa los puestos #1 y #2 respectivamente en el Índice de Calidad General de Hume AI, con mejoras significativas en contenido de formato largo y control de guiones de dos actores en comparación con Gemini 3.1 Flash TTS.

Gemini 3.8 Flash y Flash-Lite TTS quedaron primeros en las pruebas de preferencia humana en Voice Arena en varios idiomas importantes a nivel mundial. Japonés, portugués brasileño, vietnamita, árabe estándar moderno (MSA), español mexicano e hindi fueron algunos de los idiomas clave en los que ambos modelos superaron a sus competidores. Juntos, los modelos admiten más de 100 idiomas.

Modelo Enfoque Característica clave
Gemini 3.8 Flash TTS Dirección creativa Nuevas voces desde cero, dirección línea por línea (1)
Gemini 3.8 Flash-Lite TTS (2) Escala de alto volumen (3) Doblaje, agentes de voz, control fino (4)

Confianza, Consentimiento y Marca de Agua (5)

Estas herramientas fueron construidas con estrictas salvaguardas por Google. Para producir una voz, un usuario debe primero presentar una grabación verbal de consentimiento del propietario de la voz que corresponde al orador de referencia. Cada clip de audio está marcado con SynthID, una marca de agua imperceptible integrada directamente en la salida de audio para que el discurso generado por IA pueda ser detectado. (6)

Los lectores son dirigidos por la compañía al documento del modelo para obtener más información sobre su enfoque en seguridad y responsabilidad. (7)

Pruébelo en Google AI Studio (8)

En Google AI Studio, los desarrolladores pueden explorar nuevas funciones de generación de voz a través de un espacio de trabajo de diseño de voz. Pueden comenzar con una identidad vocal completamente nueva o reproducir su propia voz, y luego mover esas creaciones a un editor de guiones de doble altavoz donde la entrega línea por línea es dirigida. (9)

Lo Que Hacemos De Esto (10)

El audio generativo ha dado un salto notable. Crear voces completamente nuevas desde la nada, dirigir actuaciones con control fino y copiar la voz de una persona con verificación de consentimiento, todo esto impulsa la síntesis de voz a partir de texto más allá de los ajustes predefinidos hacia una caja de herramientas creativa en cambio. (11)

Las ganancias reales sobre modelos anteriores aparecen en los puntos de referencia y pruebas a ciegas, lo que indica una clara apuesta de la compañía hacia un audio que ofrece una mayor expresividad a escala. (12)

Una salvaguarda práctica contra la copia de una voz sin permiso es el requisito de verificación de consentimiento, y vale la pena destacarlo porque de otra manera podría ser un problema legal serio.

Algunas cosas permanecen poco claras. Se menciona la configuración de doble orador, pero no se ofrecen más detalles. La compañía también ha guardado silencio sobre si estos modelos se unirán a la línea existente de Gemini TTS.

Aún así, esta es una actualización importante para la familia Gemini Audio. Los nuevos modelos brindan a los creadores más libertad para crear experiencias de audio personalizadas, y el compromiso de la compañía con el consentimiento y el agua marca sugiere que está considerando seriamente las implicaciones éticas de esta tecnología.

Ya no es una mera herramienta, el texto a voz se ha convertido en un medio creativo, y el anuncio deja claro que Google se ve a sí mismo liderando ese cambio.

Fuente: “Gemini 3.8 texto a voz,” Google.

El Cuaderno

Recibe El Cuaderno.

Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

Enviamos una nota para confirmar. Cada número trae un enlace para darte de baja con un clic.

Publicidad

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Como Afiliado de Amazon, Clay Tribune obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.