Transcriber

MP3 in Text umwandeln

Wählen Sie eine MP3-Datei, und die KI (Whisper oder SenseVoice) transkribiert sie in Ihrem Browser. Das Audio erreicht nie einen Server. Kein Konto, keine Bezahlung, keine Längenbegrenzung.

Umgebung wird geprüft …

Bei kleineren Modellen sinkt die Genauigkeit für diese Sprache stark. Wählen Sie Whisper Small oder größer

AnBeta

Normalerweise können Sie „Auto“ beibehalten. Ändern Sie den Wert nur, wenn das Ergebnis eindeutig die falsche Anzahl an Sprechern hat

So transkribieren Sie eine MP3-Datei

  1. Wählen Sie die Sprache. Die automatische Erkennung funktioniert, aber wenn Sie die tatsächliche Sprache festlegen (etwa Deutsch für eine deutsche Aufnahme), gibt es weniger Erkennungsfehler. Wenn zwei oder mehr Personen sprechen, schalten Sie außerdem die Sprechererkennung ein.
  2. Legen Sie die MP3-Datei hier ab oder klicken Sie, um sie auszuwählen. Die Transkription beginnt, sobald die Datei geladen ist, und die Zeilen erscheinen der Reihe nach, sobald sie feststehen.
  3. Wenn sie fertig ist, klicken Sie auf eine Zeile, um das Audio ab dieser Stelle abzuspielen und Fehler zu korrigieren. Exportieren Sie das Ergebnis dann als TXT- oder SRT-Datei oder kopieren Sie den Text direkt.

Worauf es bei MP3 ankommt

MP3 ist ein komprimiertes Format, daher wirkt sich die Bitrate der ursprünglichen Aufnahme direkt auf die Genauigkeit aus. Ab 128 kbit/s wird normale Sprache zuverlässig erkannt. Unter 64 kbit/s – oder bei Telefonaufnahmen, denen die hohen Frequenzen fehlen – fallen häufiger Wörter weg. Für andere Sprachen als Japanisch, Chinesisch und Koreanisch hilft meist der Wechsel zum Modell Small oder größer.

Alles läuft auf Ihrem eigenen Gerät. Die Datei wird nicht hochgeladen, und auch der fertige Text wird nirgendwohin gesendet. So lassen sich Aufnahmen, die Sie nicht weitergeben dürfen – Besprechungen, Interviews –, direkt verarbeiten.

Stille Abschnitte werden nicht verarbeitet, daher hängt die Dauer davon ab, wie lange tatsächlich gesprochen wird, nicht von der Länge der Datei. Vorlesungen mit langen Pausen oder Aufnahmen, in denen lange niemand spricht, sind schneller fertig, als ihre Länge vermuten lässt.

Wenn etwas nicht klappt

Häufige Fragen

Kann ich auch andere Formate als MP3 transkribieren?

Ja. WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA, AMR und WebM werden alle unterstützt. Wenn Sie eine Videodatei wählen, wird nur die Audiospur extrahiert und verarbeitet.

Gibt es eine Begrenzung der Dateigröße?

Bis zu 2 GB pro Datei, auf Smartphones 500 MB. Die Dauer ist nicht begrenzt, daher lässt sich jede Aufnahme innerhalb der Größengrenze verarbeiten, egal wie lang sie ist.

Wird mein Audio irgendwohin hochgeladen?

Nein. Die Transkription läuft in Ihrem Browser, und weder die Audiodatei noch der fertige Text wird an einen externen Server gesendet. Verarbeitungsstatistiken zur Fehlerbehebung (Gerätedaten, Fehlerart und Ähnliches) werden an den eigenen Server dieser Website gesendet, enthalten aber kein Audio, keinen Transkripttext, keine Dateinamen und keine IP-Adressen. Sie können das mit dem Schalter unter „Helfen Sie uns, den Dienst zu verbessern“ unten auf der Seite abschalten.

Wie lange dauert die Transkription?

Das hängt von Ihrem Gerät und der Modellgröße ab. Mit WebGPU ist sie oft schneller als Echtzeit; ohne WebGPU sollten Sie mit einem Mehrfachen der Audiolänge rechnen.

Audio vorbereiten – und nach dem Transkribieren

Helfen Sie uns, den Dienst zu verbessern

Wenn Sie uns die Umstände eines Durchlaufs senden – ob erfolgreich oder fehlgeschlagen –, hilft uns das, Probleme aufzuspüren (eine Fehlerquote braucht beides). Zu wissen, welche Geräte und Einstellungen am häufigsten scheitern, hilft uns, die empfohlenen Voreinstellungen anzupassen und die Fehler dahinter zu beheben. Wenn es Sie nicht stört, ist es eine echte Hilfe, die Einstellung eingeschaltet zu lassen.

Was gesendet wird

Die Daten Ihres Geräts (GPU-Modell, Arbeitsspeicher, Anzahl der Kerne), Browser und Betriebssystem, das gewählte Modell und die gewählte Sprache, Ihre Einstellung der Sprechererkennung (an oder aus und die eingestellte Sprecheranzahl), die Anzeigesprache der Seite, wie weit der Durchlauf kam, Fehlerart und Details, das Dateiformat mit ungefährer Größe und Länge sowie die Dauer.

Was nie gesendet wird

Audio, Transkripte, Dateinamen und IP-Adressen. Die Daten gehen nur an den eigenen Server dieser Website, nie an einen Drittanbieter.