AT AI Tools

Spraak naar tekst (Whisper)

Gratis, privé spraak-naar-tekst in je browser. Transcribeer of vertaal audio en video met OpenAI Whisper op je eigen apparaat – neem op met je microfoon en exporteer als TXT of SRT.

🔒 Draait volledig in uw browser — niets wordt geüpload

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Whisper-spraakherkenning die op je eigen apparaat draait

Deze tool zet gesproken woorden om in tekst met Whisper, het open spraakherkenningsmodel dat OpenAI heeft uitgebracht. Anders dan bij de meeste online transcriptiediensten wordt er niets naar een server gestuurd: je browser decodeert de audio, zet die om naar 16 kHz mono en geeft die in een Web Worker op de achtergrond door aan het model. De pagina kiest automatisch de snelste beschikbare engine – WebGPU op grafische kaarten en in browsers die dat ondersteunen, en anders overal WebAssembly op de CPU. Bij de eerste keer worden de modelgewichten van Hugging Face gedownload; daarna blijven ze in je browsercache staan, zodat volgende sessies veel sneller starten.

Je kunt interviews, colleges, podcasts, spraakmemo’s en vergaderopnamen transcriberen, of de audiotrack van een videobestand. Korte fragmenten kun je rechtstreeks met je microfoon opnemen. Lange opnamen worden verwerkt in overlappende vensters van 30 seconden, en de voortgangsbalk laat zien hoeveel vensters al klaar zijn. Omdat alles lokaal gebeurt, is de tool ook geschikt voor vertrouwelijke opnamen die je niet aan een clouddienst wilt toevertrouwen.

Transcripties, vertalingen en ondertitels

Kies Transcribe om tekst in de oorspronkelijke taal te krijgen, of Translate to English om Whisper een Engelse versie te laten schrijven van spraak in een andere taal. “Auto-detect” luistert naar de eerste 30 seconden om de taal te herkennen; begint je opname met muziek of stilte, dan krijg je betere resultaten als je de taal zelf kiest. Zet tijdstempels aan om te zien wanneer elke zin werd uitgesproken, en download een SRT-ondertitelbestand dat je kunt laden in video-editors, op YouTube of in mediaspelers.

Tips voor nauwkeurige resultaten

Heldere audio is belangrijker dan wat dan ook. Neem dicht bij de microfoon op, vermijd achtergrondmuziek en laat steeds één persoon tegelijk praten. Whisper base is een compact model, dus namen, vakjargon en zware accenten moet je soms even handmatig corrigeren – lees de tekst altijd na voordat je hem publiceert. Heeft je apparaat weinig geheugen, sluit dan andere zware tabbladen voordat je lange bestanden transcribeert, en houd dit tabblad open tot de transcriptie klaar is.

Hoe te gebruiken

  1. Audio toevoegenSleep een audio- of videobestand naar het vak, of druk op “Record from microphone” en begin te praten.
  2. Taal en taak kiezenLaat de taal op “Auto-detect” staan of kies er zelf een, en kies daarna “Transcribe” of “Translate to English”.
  3. Whisper uitvoerenDruk op “Transcribe”. Het model wordt één keer gedownload en draait daarna op je apparaat terwijl de voortgangsbalk volloopt.
  4. Tekst exporterenZet tijdstempels aan als je ze nodig hebt en kopieer daarna de transcriptie of download die als .txt-bestand of als .srt-ondertitels.

Veelgestelde vragen

Wordt mijn audio naar een server geüpload?
Nee. De audio wordt in je browser gedecodeerd en getranscribeerd. Het enige dat wordt gedownload is het Whisper-model zelf: de eerste keer van Hugging Face, daarna staat het in de cache op je apparaat.
Hoe groot is het model en hoe lang duurt het?
Whisper base is ongeveer 77 MB via WebAssembly (CPU) en ongeveer 200 MB wanneer WebGPU wordt gebruikt. Na de eerste keer wordt het uit de browsercache geladen. Op een moderne laptop kost een minuut audio met WebGPU meestal maar een paar seconden; op de CPU duurt het langer.
Welke talen worden ondersteund?
Whisper herkent ongeveer 100 talen. De lijst bevat de meest gebruikte, waaronder Engels, Spaans, Duits, Frans, Italiaans, Portugees, Nederlands, Zweeds, Pools, Oekraïens en Russisch. “Auto-detect” bepaalt de taal aan de hand van de eerste 30 seconden.
Wat doet “Translate to English”?
Whisper luistert naar spraak in elke ondersteunde taal en schrijft direct de Engelse vertaling, zonder aparte vertaalstap. Tijdstempels en SRT-export werken op dezelfde manier.
Welke bestandsformaten werken?
Alles wat je browser kan decoderen: meestal MP3, WAV, M4A/AAC, OGG, Opus, FLAC en de audiotrack van MP4- of WebM-video’s. Lukt het niet met een bestand, zet het dan om naar MP3 of WAV en probeer het opnieuw.
Advertisement