So erstellen Sie mit ElevenLabs eine KI-Stimme, die wie Ihre eigene klingt

Generative KI und Deepfakes wurden tiefgreifend integriert, um fortschrittliche Audio-Tools zu entwickeln. Die Idee ist einfach: Sie nehmen einen Ton und manipulieren ihn so, dass das Modell die Worte spricht, die Sie ihm geben.

Die Sprachherstellungstechnologie gilt als eine der bedeutendsten Entwicklungen in der Welt der modernen Technologie, da es möglich ist, mithilfe von Textansagen eine künstliche Stimme zu erzeugen, die der menschlichen Stimme unglaublich ähnlich ist. Zu den innovativen Tools und Plattformen, die Ihnen diese beeindruckende Leistung ermöglichen, gehört ElevenLabs, das neben einigen großartigen kostenpflichtigen Optionen auch eine kostenlose Nutzungsstufe bietet.

In diesem Artikel gehen wir ausführlich auf die Verwendung der Sprachsynthesetechnologie mit ElevenLabs und die damit verbundenen Vorteile ein. Wir gehen die wichtigsten Schritte zur Erstellung von Audio durch, das in einer Vielzahl von Anwendungen nützlich sein kann, von Audio und Werbung bis hin zu KI- und maschinellen Lernanwendungen. Verifizieren Ist immersive Technologie ein Gewinn oder Verlust für die Cybersicherheit?

Was ist ElevenLabs?

ElevenLabs wurde von einem ehemaligen Ingenieur für maschinelles Lernen bei Google und einem ehemaligen Strategen bei Palantir Technologies, einem Forschungsunternehmen für Sprachtechnologie, gegründet. Ein Sprachmodell ist eine Schlüsselkomponente seiner Strategie, aber das ultimative Ziel besteht darin, ein Tool zu schaffen, das „gesprochene Audiodaten sofort zwischen verschiedenen Sprachen umwandelt“.

ElevenLabs Voice AI ist ein KI-basiertes Text-to-Speech-Modell, das eine realistisch klingende menschliche Stimme erzeugen kann. Auf seiner Website heißt es:

„Unsere Mission ist es, mehrsprachige Sprachunterstützung auf Abruf in den Bereichen Bildung, Streaming, Hörbücher, Spiele, Filme und sogar Echtzeit-Chat Wirklichkeit werden zu lassen.“

Google Translate und seine Alternativen bieten bereits einen Mehrwert, aber können Sie sich ein Tool vorstellen, das das, was Sie hören, sofort in gesprochene Form übersetzen kann? Die Wiedergabe der Stimme des Sprechers, sodass Sie das Gespräch hören können, während er oder sie es sagt, ist ein wichtiger Ausgangspunkt, um dies zu erreichen.

Was ist KI-Tonerzeugung?

Einfach ausgedrückt ermöglicht die KI-Sprachgenerierung Ihnen, eine Stimme zu erfassen und sie sagen zu lassen, was Sie hören möchten. Wählen Sie einfach eine Stimme und stellen Sie den Dialog bereit, und die benutzerdefinierte Vorlage erledigt den Rest.

Sie könnten sagen: „Na ja, Microsoft Sam hat das in den 90ern gemacht“, und Sie hätten völlig Recht. Aber Microsoft Sam und ähnliche Tools sahen aus wie Bots. Mittlerweile kommt das Tool von ElevenLabs dem Menschen viel näher.

ElevenLabs bietet drei Sprach-KI-Optionen: völlig kostenlose „voreingestellte“ Stimmen, einen KI-Stimmengenerator (mit dem Sie Geschlecht, Alter und Akzent auswählen können) und „Klon“-Stimmen, die nur im Abonnement erhältlich sind und heruntergeladen werden können.

Hier ist ein Beispiel:

Notiz: Der Einsatz von KI für kreative Zwecke bringt einige ethische und geistige Eigentumspflichten mit sich, und die Erstellung von Stimmen mit dem KI-Sprachtool von ElevenLabs ist nicht anders. Kurz gesagt: Benutzen Sie niemandes Stimme ohne deren Erlaubnis. Obwohl dies nicht illegal ist, könnten sie dadurch verärgert sein.

Bevor wir fortfahren, denken Sie daran, dass sich das Sprach-KI-Tool von ElevenLabs zum Zeitpunkt des Schreibens in der Betaphase befindet. Dies bedeutet, dass es sich nicht um das Endprodukt handelt. Verifizieren Entdecken Sie spannende KI-Projekte, die mit einem Raspberry Pi durchgeführt werden können.

Erstellen Sie einen grundlegenden KI-Dialog

Der einfachste Einstieg ist die Nutzung des kostenlosen, KI-gesteuerten Sprachtools von ElevenLabs.

Um es zu verwenden, gehen Sie zu beta.elevenlabs.io Und erstellen Sie ein Konto (Sie können Ihre E-Mail-Adresse, Ihr Google-Konto oder Facebook verwenden).

Hier sind die nächsten Schritte:

  • Klicken Sprachsynthese.
  • Wählen Sie eine der voreingestellten Stimmen in den Einstellungen aus (männliche und weibliche Stimmen sind verfügbar).
  • Erweitern Sie die Toneinstellungen, um die Schieberegler „Stabilität“ und „Klarheit + Ähnlichkeit verbessern“ festzulegen (höhere Stabilität ist normalerweise monoton, höhere Klarheit kommt dem beabsichtigten Klang näher).

  • Wählen Elf einsprachig (Standart Englisch).
  • Geben Sie den Text ein, den Sie in Sprache umwandeln möchten.
  • Klicken aufbauen.

  • Sobald der Vorgang abgeschlossen ist, sollte der Ton automatisch abgespielt werden; Wenn nicht, klicken Sie تشغيل.

Sie können das generierte Beispiel auch herunterladen.

So erstellen Sie eine KI-Stimme mit ElevenLabs

Wenn Sie lieber eine neue Stimme erstellen möchten, können Sie über die Schaltfläche „Stimme hinzufügen“ den VoiceLab-Bildschirm aufrufen. So erstellen Sie einen neuen Sound basierend auf ElevenLabs-Presets:

  • Klicken Sound hinzufügen -> Sounddesign.

  • Legen Sie die Felder für Geschlecht, Alter und Dialekt fest.
  • Passen Sie den Fokusstärke-Schieberegler wie gewünscht an.
  • Geben Sie den Text ein, den Sie konvertieren möchten.
  • Klicken aufbauen.

  • Wenn Sie fertig sind, hören Sie zu.

Beim Testen stellte ich fest, dass sowohl der weibliche/junge/australische als auch der männliche/alte/australische Akzent eindeutig „amerikanisch“ war. Dieses Problem wird wahrscheinlich gelöst werden, wenn sich die Technologie verbessert.

Erstellen Sie Ihre eigene KI-Stimme

Während die voreingestellten und konfigurierbaren Optionen interessant sind, ist das wirklich spannende Element der Technologie von ElevenLabs die Option „Instant Voice Reproduktion“.

Im Gegensatz zu anderen Optionen ist für die sofortige Sprachwiedergabe ein Abonnement erforderlich. Es stehen mehrere Optionen zur Verfügung, die günstigste kostet 5 $ pro Monat. Zum Zeitpunkt des Verfassens dieses Artikels gibt es einen Rabatt von 80 % für den ersten Monat, also nur XNUMX $.

Andere Optionen kosten 22, 99 und 330 US-Dollar pro Monat und bieten die Möglichkeit, bis zu 40 Stunden Audio pro Monat zu generieren.

Um die Sprachtranskription von ElevenLabs nutzen zu können, benötigen Sie einen Dialog und eine Probe Ihrer Stimme. Alles ist möglich, solange es klar ist und im MP3-Format vorliegt. Je länger die Probe, desto besser, bis zu 5 Minuten.

Auf dem VoiceLab-Bildschirm:

  • Klicken Audio hinzufügen -> Sofortige Audiotranskription.
  • Vergeben Sie im daraufhin angezeigten Fenster einen Namen.
  • Klicken oder ziehen Sie die entsprechende Datei, um das Audiobeispiel zu laden (bis zu 25 Beispiele können hinzugefügt werden, um die Genauigkeit zu verbessern).
  • Klicken Sie auf Beschriftungen und wählen Sie Schlüssel + Wert (z. B. Akzent/Britisch) – wiederholen Sie dies bis zu fünf Mal.

  • Geben Sie eine kurze Beschreibung des Audios ein.
  • Aktivieren Sie das Kontrollkästchen „Einwilligung bestätigen“ und dann „Ton hinzufügen“.

Wenn Audio hinzugefügt wurde, können Sie es wie oben erwähnt im Sprachsynthesebildschirm anpassen. Verifizieren Bewertung des Einsatzes der Audio-Klon-Technologie bei der Erstellung umfangreicher Inhalte.

Was können Sie mit KI-Stimme machen?

AI Voice verfügt über viele voreingestellte und reproduzierte Stimmen mit vielen Möglichkeiten. Wie bereits erwähnt, ist das ultimative Ziel von ElevenLabs die Live-Übersetzung, es wurden jedoch auch viele andere Einsatzmöglichkeiten festgestellt.

Erwähnt werden Hörbücher (vielleicht von einem längst verstorbenen Filmstar gelesen) sowie Videospiele (die Verwendung einer KI-Stimme würde Geld für Synchronsprecher sparen). Aber es hat darüber hinausgehende Verwendungsmöglichkeiten, von Musik über Satire bis hin zur Selbsthilfe und vielleicht sogar darüber hinaus.

Sie können einen Podcast auch mit KI-Audio erstellen, obwohl die Ergebnisse möglicherweise flach und langweilig klingen.

Das Intro für diese Podcast-Episode „Really Hilfreiche“ wurde mit ElevenLabs produziert:

Auch wenn die Ergebnisse nicht ganz unseren Erwartungen entsprachen, sind sie doch gut genug für den Einsatz und die Technologie kann nur noch besser werden.

Unterdessen plant ElevenLabs, die Funktion „Voice Chat“ zu einem späteren Zeitpunkt einzuführen.

häufige Fragen

F1: Mit welcher Technologie werden Geräusche erzeugt?

Bei der Sprachsynthesetechnologie handelt es sich um eine Technologie, die künstliche Intelligenz und Tonverarbeitungstechniken nutzt, um eine künstliche Stimme zu erzeugen, die der menschlichen Stimme ähnelt. Es kann in einer Vielzahl von Anwendungen wie Audio, Werbung und Anwendungen für künstliche Intelligenz eingesetzt werden.

F2: Was ist ElevenLabs und was bietet es?

ElevenLabs ist eine fortschrittliche Plattform, die auf soliden Fertigungstechnologien basiert. Es bietet Benutzern leistungsstarke Tools zum Erstellen einer synthetischen Stimme, die ihrer persönlichen Stimme ähneln kann. ElevenLabs hilft Ihnen, Sounds anzupassen und sie für vielfältige Zwecke zu verwenden.

F3: Wie kann ich ElevenLabs nutzen?

Sie können ganz einfach loslegen, indem Sie sich auf der ElevenLabs-Plattform registrieren und deren einfache und benutzerfreundliche Oberfläche erkunden. Sie erhalten die Möglichkeit, Ihre eigene synthetische Stimme zu erstellen, anzupassen und in Ihrem Projekt zu verwenden.

F4: Gibt es besondere Anforderungen für den Einsatz solider Fertigungstechnologie?

Für die Verwendung von ElevenLabs sind keine fortgeschrittenen technischen Kenntnisse erforderlich, es ist jedoch hilfreich, grundlegende Konzepte zur Audioverarbeitung zu verstehen und grundlegende Technologien zu verwenden. Die Benutzeroberfläche und die Anweisungen sind einfach zu bedienen und erleichtern Ihnen den Einstieg.

F5: Was sind einige häufige Anwendungen der Tonfertigungstechnologie von ElevenLabs?

Zu den beliebten Anwendungen gehören personalisierte Audioanzeigen, personalisierte Sprachdienste und Anwendungen für künstliche Intelligenz, die synthetische Stimmen manipulieren. Mit ElevenLabs können Sounds genau an Ihr Projekt angepasst werden.

Nutzen Sie Ihre Stimme auf eine neue Art und Weise mit der KI von ElevenLabs

Künstliche Intelligenz hat uns in den letzten Jahren einige erstaunliche neue Werkzeuge beschert. Chat-GPT kann zum Generieren von Text, zum Beantworten von Fragen, zum Planen von Berichten und mehr verwendet werden. Zwischendurch Es ist ein erstaunliches Modell, das Kunst auf der Grundlage von Behauptungen erzeugt.

Jetzt erleichtert das Speech AI-Tool von ElevenLabs die Arbeit mit Sprache. Es ist wie ein Identitätswechsel, aber mit einer Kopie des Originaltons.

Obwohl es ethische Argumente gegen die Verwendung von Stimmen ohne Zustimmung gibt, handelt es sich hierbei um ein leistungsstarkes Tool mit einigen interessanten Einsatzmöglichkeiten. Das Beste daran ist, dass es überraschend einfach zu bedienen ist und erstaunliche Ergebnisse liefert. Sie können es jetzt ansehen Die besten KI-Kunstgeneratoren zum Erstellen kreativer Gemälde aus Fotos.

Nach oben gehen