Transcripción ilimitada en tu navegador con Whisper AI
Elige un archivo de audio y el modelo Whisper se ejecuta dentro de tu navegador para transcribirlo. No hace falta preparar Python, ffmpeg ni controladores de GPU. El audio nunca llega a un servidor, y no necesitas cuenta ni pago.
La precisión baja mucho en este idioma con los modelos pequeños. Elige Whisper Small o uno mayor
Normalmente puedes dejarlo en «Auto». Indícalo solo si el resultado muestra un número de hablantes claramente distinto del real
Cómo usarlo
- Elige un modelo. El predeterminado se elige automáticamente según las capacidades de tu dispositivo. En un PC con WebGPU, Large v3 Turbo ofrece un buen equilibrio entre precisión y velocidad.
- Elige el idioma. La detección automática funciona, pero indicar el idioma real reduce los errores de reconocimiento.
- Elige un archivo de audio o de vídeo. La transcripción empieza en cuanto se carga el archivo y, al terminar, puedes exportarla como archivo TXT o SRT.
Sobre Whisper ejecutándose en el navegador
Whisper es un modelo de reconocimiento de voz publicado por OpenAI. Normalmente se usa preparando un entorno de Python e instalando ffmpeg y los controladores de la GPU. Esta herramienta ejecuta los mismos modelos de Whisper convertidos a un formato que funciona en el navegador. El modelo se descarga la primera vez y, a partir de entonces, se usa la copia guardada en el navegador.
Hay seis modelos: Tiny, Base, Small, Medium, Large v3 Turbo y Large v3. En un PC con WebGPU se ejecutan en la GPU; en móviles y en dispositivos sin WebGPU, en la CPU. Cuanto más grande es el modelo, mayor es la precisión, pero también la descarga y el uso de memoria. Large v3 Turbo mantiene el codificador de Large v3 y solo reduce el decodificador, así que funciona rápido con una precisión cercana a la de Large v3.
Whisper a veces escribe frases que nadie ha dicho durante silencios o música. Las frases repetidas se eliminan automáticamente, pero una frase que aparece una sola vez se queda, así que borra esa línea en la pantalla de resultados.
Si algo no funciona
- Si el proceso se detiene a medias, es posible que falte memoria en tu dispositivo. Cambia al modelo inmediatamente más pequeño o divide el audio en partes más cortas.
- Si a menudo se pierden nombres propios o términos técnicos, cambia a Small o a un modelo mayor.
Preguntas frecuentes
¿Necesito Python o una GPU?
No. Basta con un navegador reciente como Chrome o Edge. En un PC con WebGPU funciona rápido en la GPU, y en móviles o dispositivos sin una GPU utilizable funciona en la CPU (tarda más).
¿Qué modelo debo elegir?
El modelo predeterminado se elige automáticamente según las capacidades de tu dispositivo. En un PC con WebGPU, Large v3 Turbo ofrece un buen equilibrio entre precisión y velocidad; en un móvil, elige Tiny o Base.
¿Los resultados son iguales a los de la versión de Whisper para Python?
El modelo es el mismo Whisper, pero está aligerado para ejecutarse en el navegador, así que los detalles del resultado pueden no coincidir con los de la versión para Python.
¿Funciona sin conexión?
Sí. Una vez descargado el modelo, puedes transcribir sin conexión a la red.
Preparar el audio y el vídeo, y después de transcribir
Ayúdanos a mejorar el servicio
Enviarnos las circunstancias de una ejecución —con éxito o fallida— nos ayuda a encontrar los problemas (una tasa de fallos necesita ambas). Saber qué dispositivos y ajustes fallan más nos permite revisar los valores recomendados y corregir los errores. Si no te importa, dejarlo activado nos ayuda mucho.
Qué se envía
Las características del dispositivo (modelo de GPU, memoria, número de núcleos), el navegador y el sistema operativo, el modelo y el idioma elegidos, hasta dónde llegó el proceso, los detalles del error, el formato del archivo con su tamaño y duración aproximados, y cuánto tardó.
Qué no se envía nunca
El audio, las transcripciones, los nombres de archivo y las direcciones IP. Los datos van únicamente al servidor de este sitio, nunca a un servicio de terceros.