AT AI Tools

Sprache zu Text (Whisper)

Kostenlose, private Spracherkennung im Browser: Transkribiere oder übersetze Audio und Video mit OpenAI Whisper direkt auf deinem Gerät – per Mikrofon aufnehmen und als TXT oder SRT exportieren.

🔒 Läuft vollständig in Ihrem Browser — nichts wird hochgeladen

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Whisper-Spracherkennung, die auf deinem Gerät läuft

Dieses Tool verwandelt gesprochene Worte mit Whisper in Text – dem offenen Spracherkennungsmodell, das OpenAI veröffentlicht hat. Anders als bei den meisten Online-Transkriptionsdiensten wird nichts an einen Server gesendet: Dein Browser dekodiert die Audiodatei, rechnet sie auf 16 kHz Mono um und übergibt sie in einem Web Worker im Hintergrund an das Modell. Die Seite wählt automatisch die schnellste verfügbare Engine – WebGPU auf Grafikkarten und in Browsern, die es unterstützen, sonst überall WebAssembly auf der CPU. Beim ersten Durchlauf werden die Modellgewichte von Hugging Face heruntergeladen; danach bleiben sie im Browser-Cache, sodass spätere Sitzungen deutlich schneller starten.

Du kannst Interviews, Vorlesungen, Podcasts, Sprachnotizen und Besprechungsaufnahmen transkribieren oder die Tonspur einer Videodatei. Kurze Clips lassen sich direkt über dein Mikrofon aufnehmen. Lange Aufnahmen werden in überlappenden 30-Sekunden-Fenstern verarbeitet, und der Fortschrittsbalken zeigt, wie viele Fenster bereits fertig sind. Da die Verarbeitung lokal erfolgt, eignet sich das Tool auch für vertrauliche Aufnahmen, die du keinem Cloud-Dienst anvertrauen möchtest.

Transkripte, Übersetzungen und Untertitel

Wähle Transcribe, um Text in der Originalsprache zu erhalten, oder Translate to English, damit Whisper eine englische Fassung von Sprache in einer anderen Sprache schreibt. „Auto-detect“ hört sich die ersten 30 Sekunden an, um die Sprache zu erkennen; beginnt deine Aufnahme mit Musik oder Stille, erzielst du bessere Ergebnisse, wenn du die Sprache selbst auswählst. Schalte Zeitstempel ein, um zu sehen, wann welcher Satz gesprochen wurde, und lade eine SRT-Untertiteldatei herunter, die du in Videoeditoren, auf YouTube oder in Mediaplayern verwenden kannst.

Tipps für genaue Ergebnisse

Klarer Ton ist wichtiger als alles andere. Nimm nah am Mikrofon auf, vermeide Hintergrundmusik und lass immer nur eine Person gleichzeitig sprechen. Whisper base ist ein kompaktes Modell, daher müssen Namen, Fachbegriffe und starke Akzente eventuell kurz von Hand korrigiert werden – lies den Text vor der Veröffentlichung immer Korrektur. Wenn dein Gerät wenig Arbeitsspeicher hat, schließe andere rechenintensive Tabs, bevor du lange Dateien transkribierst, und lass diesen Tab geöffnet, bis das Transkript vollständig ist. In Räumen mit Hall hilft außerdem ein externes Mikrofon oder ein Headset.

So verwenden Sie

  1. Audio hinzufügenZiehe eine Audio- oder Videodatei in das Feld oder drücke „Record from microphone“ und sprich los.
  2. Sprache und Aufgabe wählenLass die Sprache auf „Auto-detect“ oder wähle sie aus und entscheide dich dann für „Transcribe“ oder „Translate to English“.
  3. Whisper startenDrücke „Transcribe“. Das Modell wird einmalig heruntergeladen und läuft dann auf deinem Gerät, während sich der Fortschrittsbalken füllt.
  4. Text exportierenAktiviere bei Bedarf Zeitstempel und kopiere dann das Transkript oder lade es als .txt-Datei oder als .srt-Untertitel herunter.

Häufig gestellte Fragen

Wird meine Audiodatei auf einen Server hochgeladen?
Nein. Die Audiodaten werden in deinem Browser dekodiert und transkribiert. Heruntergeladen wird nur das Whisper-Modell selbst – beim ersten Mal von Hugging Face, danach liegt es im Cache deines Geräts.
Wie groß ist das Modell und wie lange dauert es?
Whisper base ist auf dem WebAssembly-Pfad (CPU) etwa 77 MB groß und mit WebGPU etwa 200 MB. Nach dem ersten Durchlauf wird es aus dem Browser-Cache geladen. Auf einem modernen Laptop dauert eine Minute Audio mit WebGPU meist nur wenige Sekunden, auf der CPU länger.
Welche Sprachen werden unterstützt?
Whisper erkennt rund 100 Sprachen. Die Liste bietet die gängigsten an, darunter Englisch, Spanisch, Deutsch, Französisch, Italienisch, Portugiesisch, Niederländisch, Schwedisch, Polnisch, Ukrainisch und Russisch. „Auto-detect“ bestimmt die Sprache anhand der ersten 30 Sekunden.
Was macht „Translate to English“?
Whisper hört Sprache in jeder unterstützten Sprache und schreibt direkt die englische Übersetzung – ohne separaten Übersetzungsschritt. Zeitstempel und SRT-Export funktionieren genauso.
Welche Dateiformate funktionieren?
Alles, was dein Browser dekodieren kann: in der Regel MP3, WAV, M4A/AAC, OGG, Opus, FLAC sowie die Tonspur von MP4- oder WebM-Videos. Wenn eine Datei nicht funktioniert, wandle sie in MP3 oder WAV um und versuche es erneut.
Advertisement