Der Suchriese hat zwei neue Gemini Text-to-Speech Modelle vorgestellt und präsentiert sie als Werkzeuge für ein Kreativstudio anstatt einfache vordefinierte Sprachboxen. Laut dem Unternehmen ermöglichen Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS es Kreativen, völlig neue Stimmen aus dem Nichts zu konstruieren, direkte Zeile-für-Zeile-Aufführungen zu liefern und sogar die Stimme einer Person anhand einer 30-sekündigen Probe zu kopieren.
Zwei Modelle, Ein Kreativstudio
Die beiden Modelle dienen unterschiedlichen Zwecken. Gemini 3.8 Flash TTS ist für tiefgehende kreative Gestaltung und Charakterdesign konzipiert. Man kann komplett neue Stimmen mithilfe von natürlichsprachlichen Prompts erstellen, jede Performance Zeile für Zeile steuern und Dialekte mitten im Satz ändern. Es richtet sich an Gaming, immersive Hörbücher, Podcasts und interaktive Medien.
Die Hochvolumen-Edition von Gemini Flash-Lite TTS ist für Synchronisation, Audioinhalts-Erstellung und ausdrucksstarke Sprachassistenten gedacht. Eine feingranulare Steuerung über Ton, Tempo und ausdrucksvolle Nuancen ist bei beiden Modellen verfügbar. 3.8
Die Gemini Audio Familie wird mit diesen neuen Ergänzungen erweitert und zählt nun 3.5 Live Translate, 3.5 Transcribe, 3.8 Live und 3.8 Live Extended Thinking zu ihren Mitgliedern.
Stimmen Von Grund Auf Neu Erstellen
Gemini 3.8 Flash TTS bietet Ihnen die Möglichkeit, von Null bis zu einer funktionierenden Stimme zu gelangen, indem Sie Rolle, Akzent und Stimmmerkmale über mehr als 100 Sprachen und Dialekte mithilfe von natürlichsprachlichen Prompts anpassen können. Es beinhaltet ein dramatisches Beispiel eines feuerspeienden Drachens und eines Erzählers mit einer deutlichen regionalen Kadenz.
Eine große Auswahl an produktionsreifen Stimmen ist Teil dessen, was das Unternehmen bereitstellt. Mehr als 2.000 Stimmen sind enthalten, von mexikanischem Spanisch über Quebec-Französisch bis hin zu schottischem Englisch. Ein konsistentes Stimmprofil kann anhand eines 30-sekündigen Audio-Clips reproduziert werden, einschließlich integrierter Einwilligungsprüfung, SynthID Wasserzeichen und C2PA-Anmeldeinformationen, die sowohl Entwickler als auch die Voice-Artists schützen sollen, mit denen sie zusammenarbeiten.
Die Konsistenz über laufende Projekte hinweg wird durch Save- und Scale-Funktionen aufrechterhalten, die benutzerdefinierte Stimmen erhalten. Ein kommendes Werkzeug zur Stimmen-Remixierung ermöglicht die Auswahl einer Stimme aus der Bibliothek und die Anpassung von Klangfarbe, Tonhöhe, Tempo und Akzent mithilfe von Anweisungen wie „fügen Sie einen subtilen Südstaaten-Akzent hinzu“ oder „erleichtern Sie die Auslieferung“.
Schrittweise Anweisungen
Beide TTS-Modelle ermöglichen Ihnen die Kontrolle über die Auslieferung, nachdem Sie Ihre Stimmen ausgewählt haben. Sie können Ihre eigenen Regieanweisungen verfassen oder Gemini mit natürlichen Skript-Prompts die Arbeit überlassen. Die Modelle behalten eine hohe Sprachqualität, ein natürliches Tempo und eine charakteristische Klangfarbe über Stunden kontinuierlichen Audios bei, was sie besonders gut für Podcasts und Hörbücher geeignet macht.
Ein einzelnes Skript kann verwendet werden, um Gespräche zwischen zwei Sprechern zu inszenieren, wobei ihre Stimmen getrennt voneinander gehalten werden. Der Text enthält skriptbasierte Gesprächseinwürfe zusammen mit Hintergrundreaktionen, die dem Gespräch eine natürliche Klangfarbe verleihen, darunter Lachen, Seufzer, Keuchen und Antwortreaktionen wie |mhm| oder |yeah|.
Benchmarks Und Blinde Tests
Gemini 3.8 Flash TTS erreichte den #1-Gesamtplatz im Hume AI Voice Design Benchmark mit 71,4 Punkten. Es führte auch in der Akzentmodellierung und erreichte 60,8 Punkte. Das Modell belegt die Plätze #1 und #2 im Hume AI Overall Quality Index und weist im Vergleich zu Gemini 3.1 Flash TTS erhebliche Verbesserungen bei Langform-Inhalten und der Steuerung von Drehbüchern für zwei Sprecher auf.
Gemini 3.8 Flash und Flash-Lite TTS belegten im Human Preference Test auf Voice Arena den ersten Platz in einer Reihe wichtiger Welt-Sprachen. Japanisch, brasilianisches Portugiesisch, Vietnamesisch, Modern Standard Arabic (MSA), mexikanisches Spanisch und Hindi gehörten zu den wichtigsten Sprachen, in denen die beiden Modelle ihre Konkurrenten übertrafen. Zusammen unterstützen die Modelle mehr als 100 Sprachen.
| Modell | Fokus | Hauptmerkmal |
|---|---|---|
| Gemini 3.8 Flash TTS | Kreative Richtung | Neue Stimmen von Grund auf, zeilenweise Regie ( |
| Gemini 3.8 Flash-Lite TTS ( | Hochvolumige Skalierung ( | Synchronisation, Sprachagenten, feingranulare Steuerung ( |
Vertrauen, Zustimmung und Wasserzeichen (
Diese Werkzeuge wurden von Google mit strengen Schutzvorkehrungen entwickelt. Um eine Stimme zu erzeugen, muss ein Nutzer zunächst eine verbale Einwilligungsaufnahme des Inhabers der Stimme vorlegen, die dem Referenzsprecher entspricht. Jeder Audio-Clip ist mit SynthID markiert, einem unmerkbaren Wasserzeichen, das direkt in die Audioausgabe eingearbeitet ist, sodass KI-generierte Sprache erkannt werden kann. (
Leser werden von dem Unternehmen auf die Modellkarte verwiesen, um weitere Informationen über ihren Ansatz in Bezug auf Sicherheit und Verantwortung zu erhalten. (
Ausprobieren in Google AI Studio (
In Google AI Studio können Entwickler frische Sprachgenerierungsfunktionen über einen Stimmdesign-Arbeitsbereich erkunden. Sie können mit einer völlig neuen Stimmidentität beginnen oder ihre eigene Stimme reproduzieren und diese Kreationen dann in einen Editor für Drehbücher mit zwei Sprechern überführen, wo die Lieferung zeilenweise gesteuert wird. (
Was wir daraus machen (
Generatives Audio hat eine bemerkenswerte Verbesserung erfahren. Das Erstellen völlig neuer Stimmen von Grund auf, das Dirigieren von Darbietungen mit feingranularer Steuerung und das Kopieren der Stimme einer Person mit Zustimmungskontrolle bringen Text-to-Speech über vordefinierte Einstellungen hinaus zu einem kreativen Werkzeugkasten. (
Reale Fortschritte gegenüber früheren Modellen zeigen sich in den Benchmarks und blinden Tests, was auf einen klaren Fokus des Unternehmens auf Audio hinweist, das bei großen Stückzahlen eine größere Ausdruckskraft liefert.
Ein praktischer Schutz vor dem Kopieren einer Stimme ohne Erlaubnis ist die Anforderung der Einwilligungserklärung, und es ist erwähnenswert, da dies andernfalls ein ernstes rechtliches Problem darstellen könnte.
Einige Dinge bleiben unklar. Der Dual-Speaker-Aufbau wird erwähnt, aber es folgen keine weiteren Details. Das Unternehmen hat sich auch nicht dazu geäußert, ob diese Modelle dem bestehenden Gemini TTS-Lineup beitreten werden.
Dennoch ist dies ein starkes Update für die Gemini Audio-Familie. Die neuen Modelle geben Kreativen mehr Freiheit, um individuelle Audioerlebnisse zu erstellen, und das Engagement des Unternehmens für Einwilligung und Wasserzeichen deutet darauf hin, dass es die ethischen Implikationen dieser Technologie ernst nimmt.
Nicht mehr nur ein Werkzeug, sondern Text-to-Speech ist zu einem kreativen Medium geworden, und die Ankündigung macht deutlich, dass Google sich selbst als Vorreiter in diesem Wandel sieht.
Quelle: „Gemini 3.8 Text-to-Speech“, Google.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

