Whisper von OpenAI ist eine neue KI-gestützte Lösung, die Ihnen dabei helfen kann, Ihre Stimme auf einzigartige Weise in Text umzuwandeln. Das Beste daran ist, dass es kostenlos ist.
Es gibt jedoch ein relativ kleines Problem: Installation und Nutzung sind schwieriger als bei einem normalen Windows-Tool. Vor allem, wenn Sie die Tensor-Kerne Ihrer Nvidia-Grafikkarte nutzen möchten, um ihr einen ordentlichen Boost zu verleihen. Verifizieren Die besten KI-basierten Tools, um aus Ihren Texten kostenlos Kunst zu erstellen.

Sie sollten jedoch nicht verzweifeln. Deshalb sind wir hier! Lesen Sie weiter, um zu erfahren, wie Sie es installieren und verwenden. Wenn Sie jedoch eine Nvidia-Grafikkarte besitzen, zeigen wir Ihnen auch, welche Vorteile Whisper für Sie haben kann.
Schnelle Links
Was ist Whisper von OpenAI?
ChatGPT wird bei den Nutzern schnell beliebt und wir haben bereits gesehen, wie Sie es nutzen können ChatGPT von OpenAI. Es ist jedoch nicht das einzige interessante Projekt von OpenAI.
Whisper basiert auf Deep Learning und neuronalen Netzen und ist ein System zur Verarbeitung natürlicher Sprache, das Sprache „verstehen“ und in Text umwandeln kann. Aber es verfügt auch über viele kundenspezifische Konfigurationen in seinem Bereich und übertrifft alle ähnlichen Lösungen dank:
- Whisper ist eine auf natürliche Sprache „trainierte“ KI-Lösung. Das Verstehen „natürlicher“ menschlicher Sprache ist also besser als alte Lösungen.
- Whisper verfügt nicht über eine Schnittstelle und kann kein Audio aufnehmen. Es können nur vorhandene Audiodateien übernommen und Textdateien ausgegeben werden.
- Da Whisper gut im „Sprachverstehen“ ist, verfügt es auch über die absolute Spitzenleistung bei der automatischen Übersetzung.
- Whisper ist kein Onlinedienst und kann vollständig offline funktionieren.
- Wenn Sie über eine Nvidia-Grafikkarte (GTX970 oder höher) verfügen, kann Whisper im Hardwarebeschleunigungsmodus ausgeführt werden, um die Reaktionsfähigkeit zu erhöhen.
- Es besteht keine Notwendigkeit, sich zu registrieren, eine Lizenz zu erwerben oder ein Abonnement zu erwerben.
Warum wird die AMD-Grafikkarte nicht unterstützt?
Damit GPUs nicht nur für die Grafikausgabe nützlich sind, müssen sie als vollständig programmierbare Prozessoren funktionieren. Aus diesem Grund hat Nvidia die CUDA-Architektur entwickelt, die offiziell als „Parallel-Computing-Plattform und Programmierparadigma“ gilt.
CUDA ist eine proprietäre Nvidia-Technologie, die nur mit Nvidia-GPUs kompatibel ist. Die nächsten Alternativen zu AMD sind OpenCL und Radeon Compute Platform.
Im Vergleich zu Alternativen ist CUDA ausgereifter, leistungsfähiger und benutzerfreundlicher. Daher zielen die meisten Entwickler nur auf CUDA ab, was wiederum bedeutet, dass ihre Anwendungen nur die Hardwarefunktionen der Nvidia-GPUs nutzen. Dazu gehört auch Whisper. Verifizieren Vergleich von AMD- und NVIDIA-Grafikkarten unter Linux: Welche sollten Sie verwenden?
So laden Sie Whisper herunter und installieren es
Leider ist Whisper keine eigenständige App, die Sie herunterladen, installieren und ausführen können. Dies hängt von anderen Abhängigkeiten ab, die ebenfalls installiert werden müssen.
Um diese Anleitung für Windows einfach zu halten, verwenden wir das weit verbreitete Chocolatey, um die meisten erforderlichen Anwendungsteile zu installieren. Schauen Sie sich unseren Leitfaden dazu an Der schnellste Weg, Windows-Anwendungen zu installieren Weitere Informationen zu Chocolatey.
Für Linux und Mac sollte der Installationsprozess (mit Ausnahme der Windows-Pfadvariablen und der praktischen Batchdateien, die wir erstellen werden) ähnlich sein.
- Um Whisper zu installieren und zu verwenden, müssen Sie Python und sein PIP-Tool installieren und diese zur Windows-Variablen „Pfad“ hinzufügen. Informationen dazu finden Sie in unserem Artikel über So installieren Sie Python PIP unter Windows و Mac und Linux.
- Installieren FFMPEG Über Chocolatey mit diesem Befehl:
choco install ffmpeg

- Installieren Sie außerdem die Python-Version mit:
pip3 install python-ffmpeg
- Installieren Sie Whisper abschließend von seiner Github-Seite mit:
pip3 install git+https://github.com/openai/whisper.git
Holen Sie sich die CUDA-fähige Version von Whisper
Obwohl Whisper nativ keine Nvidia-GPUs verwendet, bietet das zugrunde liegende Torch-Paket eine CUDA-beschleunigte Version. Wenn Sie es anstelle der „normalen“ Version von Whisper verwenden, können Sie mithilfe Ihrer Nvidia-Grafikkarte Audiotranskriptionen schneller abschließen.
So erhalten Sie Whisper, das Nvidias CUDA verwendet:
- Wenn Sie bereits die „Vanilla“-Version von Torch installiert haben, deinstallieren Sie sie und entfernen Sie die verbleibenden Dateien mit:
pip3 uninstall torch
- Wenn Sie fertig sind, führen Sie anschließend den folgenden Befehl aus:
Pip-Cache-Bereinigung
- Installieren Sie die CUDA-fähige Version von Torch mit dem folgenden Befehl:
pip3 install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu117

- Um zu überprüfen, ob Whisper mit einer Nvidia-GPU funktionieren kann, verwenden Sie Folgendes:
whisper — help | findstr -i pytorch
Sie sollten (default:cuda) anstelle von (default:cpu) sehen. Verifizieren Erweiterte Gründe, warum ChatGPT Ihren Job als Content-Autor nicht übernehmen sollte.
Was tun, wenn die Torch-Installation fehlschlägt?
Wenn bei der Installation von Torch die Fehlermeldung „Keine Version gefunden“ auftritt, müssen Sie möglicherweise eine ältere Version von Python parallel zu Ihrer aktuellen Version installieren.
Verwenden Sie dazu diesen Befehl:
choco install python --version ÄLTERE_VERSION --side-by-side
Ersetzen Sie „OLDER_VERSION“ durch eine Version wie 3.10.

Als nächstes verwenden Sie den sekundären Versionspfad für alle „generischen“ Whisper-Befehle (z. B. „c:\Python310\Scripts\pip.exe“ statt nur „pip“.
So nehmen Sie Ihre Stimme auf
Sie können jede Audioaufnahme-App verwenden, um Ihre Stimme in eine WAV- oder MP3-Datei zu konvertieren. Windows enthält eine solche Anwendung. Weitere Informationen dazu finden Sie unter Verwendung Audiorecorder-App unter Windows 10.
Probieren Sie Audacity aus, um eine Option mit vollem Funktionsumfang zu erhalten. Erfahren Sie in unserem Leitfaden auf, wie das geht So verwenden Sie Audacity Zum Aufnehmen von Audio unter Windows und Mac.

So beginnen Sie mit Whisper zu schreiben
Obwohl Whisper nicht über eine einfache Benutzeroberfläche verfügt, ist die Verwendung sehr reibungslos.
Nehmen wir an, wir haben eine Datei „LatestNote.mp3“ mit der griechischen Rede im Ordner „c:\MyAudioFiles“ und möchten sie ins Englische übersetzen und in eine Textdatei kopieren.
- Wir fangen an zu laufen Eingabeaufforderung oder PowerShell.
- Mit diesem Befehl „ändern wir das Verzeichnis“, in dem die Audiodatei gespeichert ist:
cd C:\MyAudioFiles
- Wir führen Whisper in der Datei aus mit:
Whisper — Modellbasis — Sprache gr — Aufgabe übersetzen NeuesteNotiz.mp3

Nach der Verarbeitung wird die Textdatei (mit dem Namen „LatestNote.mp3.txt“) im selben Ordner angezeigt. Öffnen Sie es in einem Texteditor wie Notepad, um den übersetzten Text anzuzeigen.
Wir haben eine Beispielübersetzung verwendet, weil die englische Transliteration klarer ist: Verwenden Sie einfach die Tags „lose“, „-Language“ und „-Task“. Für eine einfache phonetische Transkription wäre der obige Befehl also:
Whisper – Modellbasis LatestNote.mp3
Der Tag „model“ ist erforderlich, da Whisper eine der verschiedenen Optionen verwendet. Lassen Sie uns es erweitern, um Ihnen bei der Auswahl der besten Lösung für Ihre Bedürfnisse zu helfen. Verifizieren Welche Funktion hat die Sprachtranskription? Welche Rolle spielt es und wie funktioniert es?
Welches Modell soll ich wählen?
Whisper bietet verschiedene Sprachmodelle. Je größer das Modell, desto höher ist seine Auflösung, aber auch desto höher sind seine Hardwareanforderungen. Welches ist:
- Winzig.
- Basierend.
- Klein
- Mittel.
- Groß.
Tiny- oder Base-Formulare sollten für die meisten Englischsprachigen in Ordnung sein. Nicht-englische Muttersprachler erzielen möglicherweise bessere Ergebnisse mit größeren Modellen wie Medium und Large.
Beachten Sie jedoch, dass die Modelle Medium und Large mehr als 8 GB VRAM benötigen (d. h.Ihr GPU-Speicher").

Um eines davon auszuwählen, geben Sie das Modell nach dem Schlüssel „-model“ im Befehl an:
Whisper – Modell winzig/klein/mittel/groß [Datei]
Beispielsweise:
Flüstern – kleines Modell My_Voice_Note.mp3
So vereinfachen Sie die Audiotranskription
Es kann schnell langweilig werden, jedes Mal den gesamten Whisper-Befehl eingeben zu müssen, wenn Sie etwas Audio transkribieren möchten. Lassen Sie uns eine global zugängliche Batchdatei erstellen, um den Prozess zu vereinfachen.
- Starten Sie den Windows Explorer und besuchen Sie das Laufwerk C:.
- Erstellen Sie einen Ordner für Skripte und kopieren Sie seinen Pfad in die Zwischenablage.
- Suchen Sie im Windows-Startmenü nach „Pfad“ und wählen Sie „Pfad“ aus Ändern von Systemumgebungsvariablen.

- Ich suche nach Pfadvariable Unter Benutzervariablen für IHREN_BENUTZERNAME. Doppelklicken Sie darauf, um es zu bearbeiten. Klicken جديد und fügen Sie den Pfad zu Ihrem Skriptordner ein. Klicken Sie auf OK, um die Änderungen zu übernehmen.

- Kehren Sie im Windows Explorer zum Ordner „Skripte“ zurück. Erstellen Sie dort eine neue Batchdatei mit dem Namen „wht.bat“. Fügen Sie „Inside it“ diesen Befehl hinzu:
Flüstern – winziges Modell – Sprache in %1

- Erstellen Sie zwei Batchdateien, „whs“ und „whm“.
- Fügen Sie diesen Befehl in die erste Datei ein:
Flüstern – kleines Modell – Sprache in %1
- Fügen Sie diesen Befehl in die zweite Datei ein:
Flüstern – Modellmedium – Sprache in %1
Herzlichen Glückwunsch, Sie haben jetzt drei Dateien, mit denen Sie die kleinen, mittleren und einfachen Whisper-Modelle ganz einfach mit Ihren Audiodateien verwenden können! So konvertieren Sie eine beliebige Audiodatei in Text:
- Suchen Sie die Datei mit dem Windows-Datei-Explorer.
- Klicken Sie mit der rechten Maustaste auf eine leere Stelle und wählen Sie „Im Terminal öffnen“.
- Geben Sie diesen Befehl ein und ersetzen Sie „wht“ durch „whs“ oder „whm“, um Kleinbuchstaben oder Mittelsprachenformen zu verwenden:
wht IHRE_AUDIO_DATEI.mp3
Schreiben Sie mit Whisper schnell Audioinhalte
Selbst die schnellsten Schreibkräfte können nicht mit der Geschwindigkeit mithalten, mit der wir sprechen. Allerdings war Sprechen statt Schreiben für die Dokumenterstellung bis vor Kurzem nicht optimal.
Die meisten Audio-zu-Text-Lösungen lieferten mittelmäßige Ergebnisse. Man konnte einige Lösungen finden, die einen Versuch wert waren, aber kompliziert in der Anwendung oder teuer waren. Glücklicherweise hat Whisper das alles geändert.
Nach den oben genannten Schritten sollten Sie bereit sein, Ihre Stimme mit nur einem Befehl mit hoher Genauigkeit zu transkribieren oder zu übersetzen. Sie können es jetzt ansehen Beste Audio-zu-Text-Apps für Notizen, Besprechungen und Vorträge.










