Transcriber

Transcripción de audio con IA
dentro de tu navegador

Solo tienes que elegir un archivo de audio y Whisper AI lo transcribe dentro de tu navegador. Tu audio nunca se envía a un servidor. Sin registro, sin límites de tiempo y totalmente gratis.

Totalmente privado
Funciona sin conexión
Inferencia rápida con WebGPU
Comprobando tu entorno…

La precisión baja mucho en este idioma con los modelos pequeños. Elige Whisper Small o uno mayor

ActivadaBeta

Si sabes cuántas personas hablan, indicarlo mejora bastante la precisión

Cómo funciona

  1. 1

    Carga el audio

    Compatible con los formatos habituales como MP3, WAV, M4A y FLAC. También puedes arrastrar y soltar.

  2. 2

    La IA transcribe automáticamente

    Whisper AI ejecuta la inferencia dentro de tu navegador. La primera vez se descarga el modelo (de 40 MB a 1,6 GB según el que elijas).

  3. 3

    Exporta el resultado

    Descárgalo como texto plano o como subtítulos SRT. Incluye diarización de hablantes.

Para qué puedes usarlo

Convierte grabaciones en texto sin salir del navegador. Como no se sube nada, sirve también para grabaciones que no puedes entregar a un servicio de terceros.

Actas de reuniones

La diarización asigna un color a cada participante, así que la transcripción ya se parece a un acta. Las grabaciones internas no pasan por servidores externos.

Transcripción de entrevistas

No hay límite de duración. Indicar cuántas personas hablan mejora la separación entre entrevistador y entrevistado.

Subtítulos para vídeo y YouTube

Carga directamente un archivo MP4 o WebM y exporta subtítulos SRT con códigos de tiempo. No hace falta convertir nada antes.

Apuntes de clases y seminarios

Conserva las clases grabadas como texto que puedes buscar. Los modelos grandes manejan mejor el audio con mucha terminología.

Notas de voz

Las notas M4A grabadas con el móvil se pueden cargar tal cual y convertir en texto.

Transcripción de pódcast y directos

Transcribe episodios ya publicados para reutilizarlos como artículos o como base para ganar visibilidad en buscadores.

Formatos de archivo admitidos

Archivos de audio
MP3, WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA, AMR, WebM
Archivos de vídeo
MP4, MOV, MKV, WebM, AVI, WMV, FLV, MPEG-TS, 3GP (se extrae la pista de audio y se transcribe)
Formatos de exportación
TXT (texto plano) y SRT (subtítulos con códigos de tiempo)
Tamaño máximo de archivo
Hasta 2 GB por archivo (500 MB en móviles)
Idiomas
Japonés, inglés, chino, coreano, español, francés, alemán, portugués, ruso, italiano e indonesio. Con la detección automática también se transcriben idiomas fuera de esta lista

No necesitas convertir el vídeo en audio de antemano: el navegador extrae la pista de audio en cuanto se carga el archivo.

En qué se diferencia de los servicios de transcripción en la nube

La mayoría de los servicios de transcripción envían tu audio a sus servidores. Transcriber ejecuta el modelo dentro de tu navegador, y eso cambia el equilibrio.

AspectoServicio en la nube habitualTranscriber
Adónde va el audioSe sube a los servidores del proveedorNunca se envía: se procesa en tu dispositivo
Cuota gratuitaSuele limitarse a unos minutos al mesSin límites de tiempo ni de uso
Cuenta necesariaNormalmente síNo
Uso sin conexiónNo es posiblePosible una vez descargado el modelo
De qué depende la velocidadDel hardware del proveedorDe la GPU / CPU de tu propio dispositivo

Los servicios en la nube tienen la ventaja de una velocidad constante en equipos poco potentes. El procesamiento en el navegador encaja cuando la grabación no puede salir de tu control o cuando necesitas procesar audio largo sin chocar con una cuota.

Preguntas frecuentes

¿Es realmente gratis? ¿Hay límites de tiempo o de uso?

Es totalmente gratis. No hay límites de duración, de número de usos ni de caracteres, y no se pide tarjeta de crédito. El único tope es de 2 GB por archivo (500 MB en móviles); dentro de eso, puedes usarlo tantas veces como quieras.

¿Se sube mi audio a un servidor?

No. Whisper AI ejecuta la inferencia dentro de tu navegador, así que tu audio nunca sale de tu dispositivo. No se guarda nada en un servidor ni se entrega a terceros.

¿Hace falta crear una cuenta o iniciar sesión?

No. Abre la página, elige un archivo de audio y la transcripción empieza. Nunca se te pide una dirección de correo.

¿Qué formatos de archivo admite?

Audio: MP3, WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA y AMR. Vídeo: MP4, MOV, MKV, WebM, AVI, WMV, FLV, MPEG-TS y 3GP. Puedes arrastrar el archivo o elegirlo desde el selector.

¿Puedo transcribir un archivo de vídeo?

Sí. Carga un archivo MP4, MOV, MKV, WebM o AVI y el navegador extrae su pista de audio para transcribirla. No hace falta convertirlo antes en un archivo de audio. El archivo se lee por partes en lugar de cargarse entero, así que los vídeos de varios gigabytes no son problema.

¿Distingue entre hablantes?

Sí, hay diarización de hablantes (Beta). En grabaciones con varias personas, como reuniones o entrevistas, cada hablante aparece en un color distinto. Si ya sabes cuántas personas hablan, indicarlo mejora bastante la precisión. Las etiquetas de hablante se pueden renombrar en pantalla y los hablantes separados por error se pueden fusionar, y cualquier línea se puede reasignar o dividir.

¿Puedo generar archivos de subtítulos?

Sí: las transcripciones se pueden exportar como subtítulos SRT con códigos de tiempo, listos para cargarlos en un editor de vídeo o en una plataforma. También puedes exportar texto plano (TXT) o copiarlo al portapapeles.

¿Funciona sin conexión?

Sí. Una vez descargado el modelo de IA, la transcripción funciona sin red. Según el modelo elegido, el tamaño va de unos 40 MB a 1,6 GB.

¿Cómo puedo mejorar la precisión?

Elegir un modelo más grande mejora la precisión. En equipos con WebGPU, Whisper Large v3 Turbo ofrece una precisión casi óptima manteniendo la velocidad. Indicar el idioma explícitamente en vez de dejar la detección automática también reduce los errores.

¿Puedo usarlo en el móvil?

Sí, aunque funciona en un modo de memoria reducida (WASM) para proteger el dispositivo y los archivos están limitados a 500 MB. Para grabaciones largas es preferible un ordenador.

¿Recopilan información sobre errores?

Solo las estadísticas necesarias para corregir fallos: las características del dispositivo (GPU, memoria, número de núcleos), el modelo y el idioma elegidos, en qué etapa falló, el tipo y el texto del error, y el formato del archivo con su tamaño y duración aproximados. El audio, las transcripciones, los nombres de archivo y las direcciones IP nunca se envían, y los datos van únicamente al servidor de este sitio, nunca a un servicio de terceros. Puedes desactivarlo cuando quieras con el interruptor de la sección «Ayúdanos a mejorar el servicio», al final de la página.

Ayúdanos a mejorar el servicio

Cuando una transcripción falla, enviarnos las circunstancias nos ayuda a encontrar la causa. Saber qué dispositivos y ajustes fallan más nos permite revisar los valores recomendados y corregir los errores. Si no te importa, dejarlo activado nos ayuda mucho.

Qué se envía

Las características del dispositivo (GPU, memoria, número de núcleos), el modelo y el idioma elegidos, en qué etapa falló, los detalles del error y el formato del archivo con su tamaño y duración aproximados.

Qué no se envía nunca

El audio, las transcripciones, los nombres de archivo y las direcciones IP. Los datos van únicamente al servidor de este sitio, nunca a un servicio de terceros.

Apoya esta herramienta

Esta herramienta la desarrolla y mantiene una sola persona. Tu apoyo permite que el servicio siga funcionando y que pueda mantener y mejorar su calidad. Cualquier aportación se agradece enormemente.

Apoyar con Stripe