AT AI Tools

Мовлення в текст (Whisper)

Безкоштовне й приватне перетворення мовлення на текст у браузері. Транскрибуйте або перекладайте аудіо й відео за допомогою OpenAI Whisper на вашому пристрої — записуйте з мікрофона та експортуйте TXT або субтитри SRT.

🔒 Працює повністю у вашому браузері — нічого не завантажується

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Розпізнавання мовлення Whisper, що працює на вашому пристрої

Цей інструмент перетворює усне мовлення на текст за допомогою Whisper — відкритої моделі розпізнавання мовлення, яку випустила OpenAI. На відміну від більшості онлайн-сервісів транскрибування, нічого не надсилається на сервер: браузер декодує аудіо, передискретизує його до 16 кГц моно й передає моделі у фоновому Web Worker. Сторінка обирає найшвидший доступний рушій — WebGPU на відеокартах і в браузерах, що його підтримують, або WebAssembly на процесорі в усіх інших випадках. Під час першого запуску ваги моделі завантажуються з Hugging Face; після цього вони зберігаються в кеші браузера, тож наступні сеанси запускаються значно швидше.

Ви можете транскрибувати інтерв’ю, лекції, подкасти, голосові нотатки й записи нарад, а також звукову доріжку відеофайлу. Короткі фрагменти можна записати просто з мікрофона. Довгі записи обробляються 30-секундними вікнами, що перекриваються, а індикатор прогресу показує, скільки вікон уже готово. Завдяки цьому навіть годинну лекцію можна розшифрувати, нікому її не пересилаючи.

Транскрипції, переклади й субтитри

Оберіть Transcribe, щоб отримати текст мовою оригіналу, або Translate to English, щоб Whisper написав англійську версію мовлення іншою мовою. Автовизначення аналізує перші 30 секунд, щоб розпізнати мову; якщо запис починається з музики чи тиші, краще вибрати мову самостійно — так результат буде точнішим. Увімкніть часові мітки, щоб бачити, коли прозвучало кожне речення, і завантажте файл субтитрів SRT, який можна відкрити у відеоредакторах, на YouTube чи в медіаплеєрах.

Поради для точних результатів

Чистий звук важливіший за все інше. Записуйте близько до мікрофона, уникайте фонової музики й дозволяйте говорити лише одній людині водночас. Whisper base — компактна модель, тож імена, професійний жаргон і сильний акцент можуть потребувати швидкого ручного виправлення; завжди вичитуйте текст перед публікацією. Якщо на вашому пристрої мало пам’яті, закрийте інші важкі вкладки перед транскрибуванням довгих файлів і не закривайте цю вкладку, доки транскрипцію не буде завершено. Дуже довгі записи варто розділити на кілька коротших файлів і обробляти їх по черзі.

Як користуватися

  1. Додайте аудіоПеретягніть аудіо- або відеофайл у поле чи натисніть «Record from microphone» і почніть говорити.
  2. Оберіть мову й завданняЗалиште мову на «Auto-detect» або виберіть її вручну, а потім оберіть «Transcribe» чи «Translate to English».
  3. Запустіть WhisperНатисніть «Transcribe». Модель завантажується один раз, а потім працює на вашому пристрої, поки заповнюється індикатор прогресу.
  4. Експортуйте текстЗа потреби увімкніть часові мітки, а потім скопіюйте транскрипцію або завантажте її як файл .txt чи субтитри .srt.

Часті запитання

Чи завантажується моє аудіо на сервер?
Ні. Аудіо декодується й транскрибується у вашому браузері. Єдине, що завантажується, — сама модель Whisper: уперше вона надходить із Hugging Face, а потім зберігається в кеші вашого пристрою.
Який розмір моделі та скільки часу це займає?
Whisper base займає близько 77 MB у режимі WebAssembly (CPU) і близько 200 MB, коли використовується WebGPU. Після першого запуску модель завантажується з кешу браузера. На сучасному ноутбуці хвилина аудіо зазвичай обробляється за кілька секунд із WebGPU і довше на процесорі.
Які мови підтримуються?
Whisper розпізнає близько 100 мов. У списку є найпоширеніші з них, зокрема англійська, іспанська, німецька, французька, італійська, португальська, нідерландська, шведська, польська, українська й російська. Автовизначення вгадує мову за першими 30 секундами.
Що робить функція «Translate to English»?
Whisper слухає мовлення будь-якою підтримуваною мовою й одразу записує його англійський переклад, без окремого етапу перекладу. Часові мітки й експорт SRT працюють так само.
Які формати файлів підтримуються?
Усе, що може декодувати ваш браузер: зазвичай MP3, WAV, M4A/AAC, OGG, Opus, FLAC і звукова доріжка відео MP4 або WebM. Якщо файл не відкривається, конвертуйте його в MP3 чи WAV і спробуйте ще раз.
Advertisement