Suno, ein Unternehmen, das KI-Musik entwickelt, ist in die Sprachsynthese eingestiegen. Es hat eine öffentliche Beta-Version veröffentlicht, die Skripte oder beschriebene Anweisungen in gesprochene Audio zusammen mit KI-Hintergrundmusik umwandelt. Die Funktion ist über Web und Mobile verfügbar.
Suno nimmt eine Anweisung oder ein Skript entgegen und erzeugt eine Aufnahme mit Sprecherkommentar und einem darunterliegenden Track. Das Unternehmen sagt, es handele sich um das erste Audio-Modell, das Stimme und Musik zu einem einzigen, zusammenhängenden Track zusammenfügt. Dieses Vorhaben geht über das Kerngeschäft hinaus, bringt aber auch rechtliche Probleme mit sich.
Ankündigung von Jack Brody
Jack Brody, Chief Product Officer von Suno, kündigte die Funktion an und stellte sie als natürliche Erweiterung der breiteren Ambitionen des Unternehmens dar. „Musik wird immer das Herz von Suno und dem sein, was wir entwickeln“, sagte er. „Gleichzeitig erstreckt sich unsere Vision immer auf andere Formen menschlichen Ausdrucks.“
Er fügte hinzu: „Heute erweitern wir mit Speech die Möglichkeiten von Suno: das erste Audio-Modell, das Stimme und Musik zusammen als einen einzigen, zusammenhängenden Track erzeugt.“
Brody sprach auch direkt über den Beta-Status. „Beta bedeutet wirklich Beta“, sagte er. „Gelegentlich können britische Akzente nach Australien und zurück wandern. Dramatische Pausen können sehr dramatisch sein. Sie werden mit Sicherheit Anwendungen dafür entdecken, an die wir nie gedacht haben.“
Das wettbewerbsstarke Feld
Deep-Learning-Sprachsynthese gibt es schon eine Weile. DeepMind testet es seit zehn Jahren. Adobe hat sein eigenes Tool zur Sprachausgabe. ElevenLabs hat sich seit seiner Einführung im Jahr 2023 zu einer der bekanntesten Plattformen entwickelt, und das Feld zeigt keine Anzeichen der Verlangsamung.
Suno schließt sich also der Party an. Der Musikgenerator des Unternehmens hat bereits zahlreiche Klagen auf sich gezogen, und die Diversifizierung der Plattform ergibt strategisch Sinn. Die Kombination von KI-Musik mit generierten Stimmen ist Sunos Interpretation von Text-in-Speech-Tools – einer Art von Gimmick, der entweder Aufmerksamkeit gewinnen oder einfach nur bestätigen könnte, dass der Markt gesättigt ist.
Die Option, die Hintergrundmusik auszuschalten, existiert. Ein Schalter ermöglicht es, den Soundtrack vollständig zu entfernen, sodass die Sprache ohne Begleitung abgespielt wird. Der Hintergrund dafür ist, bestimmte Verwendungszwecke für generierte gesprochene Inhalte anzupassen – einen beruhigenden Track für Gedichte oder einen lebhafteren Klang für dramatische Voiceovers und inspirierende Reden.
Wie man es benutzt
Der Prozess ist einfach. Wählen Sie den Reiter „Erstellen“, dann gehen Sie zur Option „Sprache“. Zwei Modi stehen zur Verfügung:
- Einfach, bei dem Sie beschreiben können, was Sie erstellen möchten, über die bereitgestellte Eingabeaufforderung (z. B. „ein Piratenkapitän, der seine Crew aufruft“).
- Erweitert, bei dem Sie ein benutzerdefiniertes Skript hinzufügen können, falls Sie bereits genau wissen, was es sagen soll.
Die erweiterten Einstellungen ermöglichen es Ihnen, das Geschlecht der Stimme, ihre Sprechweise und den Grad der Variation bei jeder Sprachgenerierung zu ändern. Ein einzelnes Stück Sprache kann bis zu etwa acht Minuten dauern.
Suno räumt ein, dass das Feature nicht perfekt ist, besteht jedoch darauf, dass es Speech weiterhin verfeinern wird, basierend auf dem, was Benutzer ihm mitteilen.
Was die Beta bedeutet
Was hier zählt, ist das Beta-Label. Suno erhebt nicht den Anspruch auf ein fertiges Produkt; es beschreibt ein Work-in-Progress. Das bedeutet, dass gelegentliche britische Akzente, die nach Australien und zurück wandern, Teil dessen sind, was das Unternehmen als Teil des Pakets bezeichnet, zusammen mit dramatischen Pausen, die sehr dramatisch sein können.
„Beta bedeutet wirklich Beta“, sagte Brody. „Gelegentlich können britische Akzente nach Australien und zurück wandern. Dramatische Pausen können sehr dramatisch sein. Sie werden mit Sicherheit Verwendungszwecke dafür entdecken, die uns nie eingefallen sind.“
Es ist erfrischend, ehrlich darüber zu sein. Es dient auch als Erinnerung daran, dass das Feature sich noch in der Entwicklung befindet. Eine maximale Dauer von acht Minuten bietet viel Spielraum, obwohl die erwähnten Eigenheiten Teil dessen sind, was Benutzer erhalten, und nicht eine Aufzählung von Mängeln.
Wenn Sie einfach nur die Stimme für sich alleine wollen, existiert der Schalter für diesen Zweck. Es ist eine bescheidene Erleichterung. Jenseits davon wartet jedoch alles andere darauf, entdeckt zu werden.
„KI-Musik-Tool Suno generiert jetzt gesprochene Worte,” The Verge.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

