AT AI Tools

Речь в текст (Whisper)

Бесплатное и приватное распознавание речи в браузере. Расшифровывайте или переводите аудио и видео с OpenAI Whisper прямо на вашем устройстве — записывайте с микрофона и экспортируйте TXT или субтитры SRT.

🔒 Работает полностью в вашем браузере — ничего не загружается

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Распознавание речи Whisper на вашем устройстве

Этот инструмент превращает устную речь в текст с помощью Whisper — открытой модели распознавания речи, выпущенной OpenAI. В отличие от большинства онлайн-сервисов расшифровки, ничего не отправляется на сервер: браузер декодирует аудио, передискретизирует его до 16 кГц моно и передаёт модели в фоновом Web Worker. Страница выбирает самый быстрый доступный движок — WebGPU на видеокартах и в браузерах, которые его поддерживают, или WebAssembly на процессоре во всех остальных случаях. При первом запуске веса модели загружаются с Hugging Face; затем они остаются в кэше браузера, поэтому последующие сеансы запускаются намного быстрее.

Вы можете расшифровывать интервью, лекции, подкасты, голосовые заметки и записи совещаний, а также звуковую дорожку видеофайла. Короткие фрагменты можно записать прямо с микрофона. Длинные записи обрабатываются перекрывающимися 30-секундными окнами, а индикатор прогресса показывает, сколько окон уже готово. Благодаря этому даже часовую лекцию можно расшифровать, никому её не пересылая.

Расшифровки, переводы и субтитры

Выберите Transcribe, чтобы получить текст на языке оригинала, или Translate to English, чтобы Whisper написал английскую версию речи на другом языке. Автоопределение анализирует первые 30 секунд, чтобы распознать язык; если запись начинается с музыки или тишины, лучше выбрать язык вручную — так результат будет точнее. Включите временные метки, чтобы видеть, когда прозвучало каждое предложение, и скачайте файл субтитров SRT, который можно загрузить в видеоредакторы, на YouTube или в медиаплееры.

Советы для точного результата

Чистый звук важнее всего остального. Записывайте близко к микрофону, избегайте фоновой музыки и давайте говорить одному человеку за раз. Whisper base — компактная модель, поэтому имена, профессиональный жаргон и сильный акцент могут потребовать быстрой ручной правки; всегда вычитывайте текст перед публикацией. Если на устройстве мало памяти, закройте другие тяжёлые вкладки перед расшифровкой длинных файлов и не закрывайте эту вкладку, пока расшифровка не завершится. Очень длинные записи лучше разделить на несколько более коротких файлов и обрабатывать их по очереди.

Как использовать

  1. Добавьте аудиоПеретащите аудио- или видеофайл в поле либо нажмите «Record from microphone» и начните говорить.
  2. Выберите язык и задачуОставьте язык на «Auto-detect» или выберите его вручную, затем выберите «Transcribe» или «Translate to English».
  3. Запустите WhisperНажмите «Transcribe». Модель загружается один раз, а затем работает на вашем устройстве, пока заполняется индикатор прогресса.
  4. Экспортируйте текстПри необходимости включите временные метки, затем скопируйте расшифровку или скачайте её как файл .txt или субтитры .srt.

Часто задаваемые вопросы

Загружается ли моё аудио на сервер?
Нет. Аудио декодируется и расшифровывается в вашем браузере. Скачивается только сама модель Whisper: в первый раз она загружается с Hugging Face, а затем хранится в кэше вашего устройства.
Какой размер у модели и сколько времени это занимает?
Whisper base занимает около 77 MB в режиме WebAssembly (CPU) и около 200 MB при использовании WebGPU. После первого запуска модель загружается из кэша браузера. На современном ноутбуке минута аудио обычно обрабатывается за несколько секунд с WebGPU и дольше на процессоре.
Какие языки поддерживаются?
Whisper распознаёт около 100 языков. В списке есть самые распространённые из них, включая английский, испанский, немецкий, французский, итальянский, португальский, нидерландский, шведский, польский, украинский и русский. Автоопределение угадывает язык по первым 30 секундам.
Что делает функция «Translate to English»?
Whisper слушает речь на любом поддерживаемом языке и сразу записывает её английский перевод, без отдельного этапа перевода. Временные метки и экспорт SRT работают так же.
Какие форматы файлов поддерживаются?
Всё, что может декодировать ваш браузер: обычно MP3, WAV, M4A/AAC, OGG, Opus, FLAC и звуковая дорожка видео MP4 или WebM. Если файл не открывается, конвертируйте его в MP3 или WAV и попробуйте снова.
Advertisement