Kurzantwort
Das Sprach-KI-Unternehmen ElevenLabs hat seine nächste Modellgeneration vorgestellt, die breitere Sprachunterstützung und feinere Ausdruckskontrolle bietet. Die neue Architektur ermöglicht das Klonen einer Stimme aus einer viel kürzeren Audioprobe und hält die Stimmidentität über lange Textpassagen hinweg deutlich konsistenter für Sprachassistenten und Kundenservice.
Das Wichtigste
- Die neuen Modelle decken jetzt deutlich mehr Sprachen ab als die vorherige Version.
- Nutzer können eine Stimme jetzt mit nur 10 Sekunden Audiomaterial klonen.
- Die annualisierte Umsatzrate von ElevenLabs ist seit Jahresbeginn deutlich gestiegen.

2 Min. LesezeitChefredakteur: Uğur Deniz İlhan
ElevenLabs hat zwei neue Sprachmodelle namens ElevenLabs v4 und v4 Turbo vorgestellt, wie TechCrunch berichtet. Die neuen Versionen bringen mehr Ausdruckskontrolle, geringere Latenz für Sprachagenten und Unterstützung für mehr als 90 Sprachen.
Was ist neu?
Das Unternehmen veröffentlichte sein v3-Modell im vergangenen Jahr; für die v4-Generation setzt es auf eine völlig neue Architektur. Dadurch können Nutzer eine Stimme jetzt mit nur 10 Sekunden Audiomaterial klonen. Das Modell hält die Stimmidentität über längere Textabschnitte hinweg konsistenter und passt den Ausdruck an den Kontext des vorgelesenen Textes an. Die mit v3 eingeführten Inline-Ausdrucks-Tags wurden in v4 erweitert; Nutzer können nun mehrere Tags nacheinander kombinieren.
Welche Sprachen wurden verbessert?
Die Vorgängerversion unterstützte 70 Sprachen; ElevenLabs gibt an, diese Zahl nun auf 90 erhöht zu haben. Den größten Qualitätssprung habe man bei Japanisch, brasilianischem Portugiesisch, Mandarin und Kantonesisch beobachtet. Das neue Modell kann zudem mit der Audioerzeugung beginnen, sobald das zugrunde liegende Sprachmodell seine Antwort zu generieren beginnt, was Wartezeiten bei Sprachassistenten verkürzt.
Was sollten Produktteams in der Türkei tun?
Für türkische Teams, die Callcenter-Automatisierung und Sprachassistenten entwickeln, könnten geringere Latenz und das Klonen aus einer kürzeren Probe die Kosten senken, insbesondere bei mehrsprachigen Kundenservice-Szenarien. Das schnelle Wachstum des Unternehmensgeschäfts von ElevenLabs deutet darauf hin, dass konkurrierende Modelle in dieselbe Richtung gehen werden; Teams sollten bei der Wahl eines Sprachanbieters nicht nur auf Sprachabdeckung, sondern auch auf Kriterien wie Latenz und den Umgang mit Gesprächsunterbrechungen achten.
Häufige Fragen
- Wie viel Audiomaterial wird benötigt, um eine Stimme mit v4 zu klonen?
- Laut ElevenLabs ermöglicht die neue Architektur das Klonen einer Stimme mit nur 10 Sekunden Audiomaterial.
Quellen
- TechCrunch ·
Dem UNIT Journal folgen
Das Neueste aus Suche, KI und Technologie – jeden Tag in Ihrem Feed.


