Transcriber

Audioaufnahme in Text umwandeln

Wählen Sie eine Datei von einem Diktiergerät oder einer Aufnahme-App, und die KI (Whisper oder SenseVoice) transkribiert sie in Ihrem Browser. Eine Formatumwandlung ist nicht nötig, und es gibt kein Zeitlimit, egal wie lang die Aufnahme ist. Das Audio erreicht nie einen Server.

Umgebung wird geprüft …

Bei kleineren Modellen sinkt die Genauigkeit für diese Sprache stark. Wählen Sie Whisper Small oder größer

AnBeta

Normalerweise können Sie „Auto“ beibehalten. Ändern Sie den Wert nur, wenn das Ergebnis eindeutig die falsche Anzahl an Sprechern hat

So transkribieren Sie eine Datei vom Diktiergerät

  1. Verbinden Sie das Diktiergerät per USB mit Ihrem Computer und kopieren Sie die Aufnahme. Aufnahmen aus einer Smartphone-App speichern Sie über das Teilen-Menü in einem Cloud-Speicher. Für iPhone-Sprachmemos siehe die Schritte auf der Seite M4A transkribieren.
  2. Wenn zwei oder mehr Personen sprechen, schalten Sie die Sprechererkennung ein. Wenn Sie die Sprache kennen, wählen Sie sie anstelle der automatischen Erkennung.
  3. Wählen Sie die Aufnahme. Fertige Zeilen erscheinen nach und nach auf dem Bildschirm, und wenn alles fertig ist, können Sie das Ergebnis als TXT- oder SRT-Datei exportieren.

Dateiformate nach Aufnahmegerät

Viele Diktiergeräte speichern MP3 oder WAV, manche WMA. Aufnahme-Apps auf Smartphones speichern M4A, MP3, AMR oder andere Formate. All diese lassen sich direkt laden, eine vorherige Umwandlung in MP3 ist also nicht nötig.

Am stärksten wirkt sich die Art der Aufnahme auf das Ergebnis aus. Drei Dinge zählen: Die sprechende Person ist nah am Mikrofon, es gibt wenig Hintergrundgeräusche wie eine Klimaanlage, und die Stimmen überlagern sich nicht.

Auch bei langen Aufnahmen gibt es kein Zeitlimit. Fertige Zeilen erscheinen schon während der Verarbeitung, sodass Sie den Inhalt prüfen können, bevor alles fertig ist. Wenn Sie die Seite zwischendurch schließen, bleibt der bis dahin fertige Text in Ihrem Verlauf.

Wenn etwas nicht klappt

Häufige Fragen

Welche Aufnahmeformate werden unterstützt?

MP3, WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA, AMR und WebM werden unterstützt. Wenn Sie eine Videodatei wählen, wird nur die Audiospur extrahiert und verarbeitet.

Wie viele Stunden Aufnahme lassen sich transkribieren?

Es gibt kein Zeitlimit. Dateien dürfen bis zu 2 GB groß sein, auf Smartphones 500 MB. Smartphones laufen zum Schutz des Geräts in einem speicherschonenden Modus, daher wird für lange Aufnahmen ein Computer empfohlen.

Kann es mehrere Sprecher in einer Aufnahme trennen?

Ja. Mit eingeschalteter Sprechererkennung werden die Zeilen nach Sprechern aufgeteilt (bis zu acht). Für Meeting-Aufzeichnungen ist die Seite „Meeting transkribieren“, auf der die Sprechererkennung von Anfang an eingeschaltet ist, am einfachsten.

Wird meine Aufnahme irgendwohin gesendet?

Nein. Die Transkription läuft in Ihrem Browser auf Ihrem Gerät, und weder die Aufnahme noch der fertige Text wird an einen externen Server weitergegeben. Verarbeitungsstatistiken zur Fehlerbehebung (Gerätedaten, Fehlerart und Ähnliches) werden an den eigenen Server dieser Website gesendet, enthalten aber kein Audio, keinen Transkripttext, keine Dateinamen und keine IP-Adressen. Sie können das mit dem Schalter unter „Helfen Sie uns, den Dienst zu verbessern“ unten auf der Seite abschalten.

Audio vorbereiten – und nach dem Transkribieren

Helfen Sie uns, den Dienst zu verbessern

Wenn Sie uns die Umstände eines Durchlaufs senden – ob erfolgreich oder fehlgeschlagen –, hilft uns das, Probleme aufzuspüren (eine Fehlerquote braucht beides). Zu wissen, welche Geräte und Einstellungen am häufigsten scheitern, hilft uns, die empfohlenen Voreinstellungen anzupassen und die Fehler dahinter zu beheben. Wenn es Sie nicht stört, ist es eine echte Hilfe, die Einstellung eingeschaltet zu lassen.

Was gesendet wird

Die Daten Ihres Geräts (GPU-Modell, Arbeitsspeicher, Anzahl der Kerne), Browser und Betriebssystem, das gewählte Modell und die gewählte Sprache, Ihre Einstellung der Sprechererkennung (an oder aus und die eingestellte Sprecheranzahl), die Anzeigesprache der Seite, wie weit der Durchlauf kam, Fehlerart und Details, das Dateiformat mit ungefährer Größe und Länge sowie die Dauer.

Was nie gesendet wird

Audio, Transkripte, Dateinamen und IP-Adressen. Die Daten gehen nur an den eigenen Server dieser Website, nie an einen Drittanbieter.