AT AI Tools

Voz a texto (Whisper)

Transcripción de voz gratuita y privada en tu navegador. Transcribe o traduce audio y vídeo con OpenAI Whisper en tu dispositivo, graba con el micrófono y exporta a TXT o subtítulos SRT.

🔒 Se ejecuta completamente en tu navegador — nada se carga

Drop an audio or video file here or click to browse

No audio selected.

The first run downloads the Whisper base model (about 77 MB, or about 200 MB with WebGPU) from Hugging Face. It is cached for next time, and your audio never leaves this device.

Advertisement

Reconocimiento de voz Whisper que se ejecuta en tu dispositivo

Esta herramienta convierte la voz en texto con Whisper, el modelo abierto de reconocimiento de voz publicado por OpenAI. A diferencia de la mayoría de los servicios de transcripción en línea, no se envía nada a ningún servidor: el navegador decodifica el audio, lo remuestrea a 16 kHz mono y lo pasa al modelo en un Web Worker en segundo plano. La página elige el motor más rápido disponible: WebGPU en las tarjetas gráficas y los navegadores que lo admiten, o WebAssembly en la CPU en todos los demás casos. La primera vez se descargan los pesos del modelo desde Hugging Face; a partir de entonces permanecen en la caché del navegador, por lo que las siguientes sesiones arrancan mucho más rápido.

Puedes transcribir entrevistas, clases, pódcasts, notas de voz y grabaciones de reuniones, o la pista de audio de un archivo de vídeo. Los clips cortos se pueden grabar directamente desde el micrófono. Las grabaciones largas se procesan en ventanas superpuestas de 30 segundos, y la barra de progreso muestra cuántas ventanas se han completado.

Transcripciones, traducciones y subtítulos

Elige Transcribe para obtener el texto en el idioma original o Translate to English para que Whisper escriba una versión en inglés de lo que se dice en otro idioma. La detección automática escucha los primeros 30 segundos para identificar el idioma; si tu grabación empieza con música o silencio, seleccionar tú mismo el idioma da mejores resultados. Activa las marcas de tiempo para ver cuándo se pronunció cada frase y descarga un archivo de subtítulos SRT que puedes cargar en editores de vídeo, YouTube o reproductores multimedia.

Consejos para obtener resultados precisos

Un audio claro importa más que cualquier otra cosa. Graba cerca del micrófono, evita la música de fondo y deja que hable una persona cada vez. Whisper base es un modelo compacto, así que los nombres propios, la jerga y los acentos marcados pueden necesitar una rápida corrección manual: revisa siempre el texto antes de publicarlo. Si tu dispositivo tiene poca memoria, cierra otras pestañas pesadas antes de transcribir archivos largos y mantén esta pestaña abierta hasta que la transcripción esté completa.

Cómo usar

  1. Añade el audioArrastra un archivo de audio o vídeo al recuadro, o pulsa «Record from microphone» y habla.
  2. Elige idioma y tareaDeja el idioma en «Auto-detect» o selecciónalo, y luego elige «Transcribe» o «Translate to English».
  3. Ejecuta WhisperPulsa «Transcribe». El modelo se descarga una sola vez y después se ejecuta en tu dispositivo mientras se llena la barra de progreso.
  4. Exporta el textoActiva las marcas de tiempo si las necesitas y luego copia la transcripción o descárgala como .txt o como subtítulos .srt.

Preguntas frecuentes

¿Se sube mi audio a un servidor?
No. El audio se decodifica y se transcribe dentro de tu navegador. La única descarga es el propio modelo Whisper, que llega desde Hugging Face la primera vez y después queda en la caché de tu dispositivo.
¿Cuánto ocupa el modelo y cuánto tarda?
Whisper base ocupa unos 77 MB con WebAssembly (CPU) y unos 200 MB cuando se usa WebGPU. Tras el primer uso se carga desde la caché del navegador. En un portátil moderno, un minuto de audio suele tardar unos segundos con WebGPU y más con la CPU.
¿Qué idiomas se admiten?
Whisper reconoce unos 100 idiomas. La lista ofrece los más habituales, como inglés, español, alemán, francés, italiano, portugués, neerlandés, sueco, polaco, ucraniano y ruso. «Auto-detect» deduce el idioma a partir de los primeros 30 segundos.
¿Qué hace «Translate to English»?
Whisper escucha la voz en cualquier idioma admitido y escribe directamente la traducción al inglés, sin un paso de traducción aparte. Las marcas de tiempo y la exportación SRT funcionan igual.
¿Qué formatos de archivo funcionan?
Cualquiera que tu navegador pueda decodificar: normalmente MP3, WAV, M4A/AAC, OGG, Opus, FLAC y la pista de audio de vídeos MP4 o WebM. Si un archivo falla, conviértelo a MP3 o WAV e inténtalo de nuevo.
Advertisement