AT AI Tools

Mowa na tekst (Whisper)

Darmowa i prywatna zamiana mowy na tekst w przeglądarce. Transkrybuj lub tłumacz audio i wideo z OpenAI Whisper działającym na Twoim urządzeniu — nagraj z mikrofonu i eksportuj TXT lub napisy SRT.

🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłane

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Rozpoznawanie mowy Whisper działające na Twoim urządzeniu

To narzędzie zamienia wypowiadane słowa na tekst za pomocą Whisper — otwartego modelu rozpoznawania mowy udostępnionego przez OpenAI. W przeciwieństwie do większości internetowych usług transkrypcji nic nie jest wysyłane na serwer: dźwięk jest dekodowany przez przeglądarkę, przepróbkowywany do 16 kHz mono i przekazywany do modelu w działającym w tle Web Workerze. Strona wybiera najszybszy dostępny silnik — WebGPU na kartach graficznych i w przeglądarkach, które go obsługują, albo WebAssembly na procesorze we wszystkich pozostałych przypadkach. Przy pierwszym uruchomieniu wagi modelu są pobierane z Hugging Face; potem pozostają w pamięci podręcznej przeglądarki, więc kolejne sesje startują znacznie szybciej.

Możesz transkrybować wywiady, wykłady, podcasty, notatki głosowe i nagrania ze spotkań, a także ścieżkę dźwiękową pliku wideo. Krótkie fragmenty nagrasz bezpośrednio z mikrofonu. Długie nagrania są przetwarzane w nakładających się 30-sekundowych oknach, a pasek postępu pokazuje, ile okien zostało już ukończonych. Dzięki temu nawet godzinny wykład da się spisać bez wysyłania go komukolwiek.

Transkrypcje, tłumaczenia i napisy

Wybierz Transcribe, aby otrzymać tekst w oryginalnym języku, lub Translate to English, aby Whisper napisał angielską wersję wypowiedzi w innym języku. Automatyczne wykrywanie analizuje pierwsze 30 sekund, by rozpoznać język; jeśli nagranie zaczyna się od muzyki lub ciszy, samodzielny wybór języka da lepsze wyniki. Włącz znaczniki czasu, aby zobaczyć, kiedy padło każde zdanie, i pobierz plik napisów SRT, który wczytasz do edytorów wideo, YouTube lub odtwarzaczy multimedialnych.

Wskazówki dla dokładnych wyników

Czysty dźwięk ma większe znaczenie niż cokolwiek innego. Nagrywaj blisko mikrofonu, unikaj muzyki w tle i pozwól mówić jednej osobie naraz. Whisper base to kompaktowy model, więc nazwiska, żargon i silne akcenty mogą wymagać szybkiej ręcznej poprawki — zawsze przeczytaj tekst przed publikacją. Jeśli Twoje urządzenie ma mało pamięci, zamknij inne wymagające karty przed transkrypcją długich plików i nie zamykaj tej karty, dopóki transkrypcja nie zostanie ukończona. Przy bardzo długich nagraniach warto podzielić je na kilka krótszych plików i przetwarzać je po kolei.

Jak używać

  1. Dodaj audioUpuść plik audio lub wideo na pole albo naciśnij „Record from microphone” i zacznij mówić.
  2. Wybierz język i zadaniePozostaw język na „Auto-detect” lub wybierz go ręcznie, a następnie wybierz „Transcribe” albo „Translate to English”.
  3. Uruchom WhisperNaciśnij „Transcribe”. Model pobiera się jednorazowo, a potem działa na Twoim urządzeniu, podczas gdy wypełnia się pasek postępu.
  4. Wyeksportuj tekstW razie potrzeby włącz znaczniki czasu, a następnie skopiuj transkrypcję lub pobierz ją jako plik .txt albo napisy .srt.

Najczęściej zadawane pytania

Czy moje nagranie jest wysyłane na serwer?
Nie. Dźwięk jest dekodowany i transkrybowany w Twojej przeglądarce. Jedynym pobieraniem jest sam model Whisper, który za pierwszym razem pochodzi z Hugging Face, a potem jest przechowywany w pamięci podręcznej Twojego urządzenia.
Jak duży jest model i ile to trwa?
Whisper base zajmuje około 77 MB w trybie WebAssembly (CPU) i około 200 MB przy użyciu WebGPU. Po pierwszym uruchomieniu wczytuje się z pamięci podręcznej przeglądarki. Na nowoczesnym laptopie minuta nagrania zajmuje zwykle kilka sekund z WebGPU i dłużej na procesorze.
Jakie języki są obsługiwane?
Whisper rozpoznaje około 100 języków. Lista zawiera najpopularniejsze z nich, w tym angielski, hiszpański, niemiecki, francuski, włoski, portugalski, niderlandzki, szwedzki, polski, ukraiński i rosyjski. Automatyczne wykrywanie odgaduje język na podstawie pierwszych 30 sekund.
Co robi opcja „Translate to English”?
Whisper słucha mowy w dowolnym obsługiwanym języku i od razu zapisuje jej angielskie tłumaczenie, bez osobnego etapu tłumaczenia. Znaczniki czasu i eksport SRT działają tak samo.
Jakie formaty plików działają?
Wszystko, co potrafi zdekodować Twoja przeglądarka: zwykle MP3, WAV, M4A/AAC, OGG, Opus, FLAC oraz ścieżka dźwiękowa filmów MP4 lub WebM. Jeśli plik nie działa, przekonwertuj go do MP3 lub WAV i spróbuj ponownie.
Advertisement