M4A ohne Konvertierung in Text umwandeln
Wählen Sie eine M4A-Datei, und die KI (Whisper oder SenseVoice) transkribiert sie unverändert in Ihrem Browser. Das Audio erreicht nie einen Server, und es gibt weder Konto noch Bezahlung.
Bei kleineren Modellen sinkt die Genauigkeit für diese Sprache stark. Wählen Sie Whisper Small oder größer
Normalerweise können Sie „Auto“ beibehalten. Ändern Sie den Wert nur, wenn das Ergebnis eindeutig die falsche Anzahl an Sprechern hat
iPhone-Sprachmemos am Computer transkribieren
- Tippen Sie in der App „Sprachmemos“ auf die Aufnahme, dann auf die Taste „Mehr“ (…), anschließend auf „Teilen“ und wählen Sie AirDrop oder „In Dateien sichern“. Auf einen Mac gelangt die Datei per AirDrop oder iCloud-Synchronisierung; unter Windows sichern Sie sie in iCloud Drive und öffnen sie mit iCloud für Windows oder auf iCloud.com.
- Öffnen Sie diese Seite in einem Browser auf Ihrem Computer und wählen Sie die M4A-Datei. Die Transkription beginnt, sobald die Datei geladen ist; stellen Sie also vorher Modell, Sprache und Sprechererkennung ein.
- Prüfen Sie das Ergebnis und exportieren Sie es als TXT- oder SRT-Datei.
Über M4A
M4A enthält in der Regel mit AAC komprimiertes Audio und ist das Speicherformat der iPhone-App „Sprachmemos“, mancher Android-Aufnahme-Apps und von Diktiergeräten. Die Komprimierung im Inneren kann je nach Qualitätseinstellung variieren, die Dateiendung ist aber in jedem Fall M4A, und dieses Tool lädt die Datei ohne Konvertierung.
Wenn Sie beim Teilen in „Sprachmemos“ unter „Optionen“ die bearbeitbare Variante wählen, erhalten Sie statt einer M4A- eine QuickTime-Audiodatei. Für die Transkription lassen Sie diese Option ausgeschaltet und exportieren die standardmäßige M4A-Datei.
Auf einem iPhone 12 oder neuer mit iOS 18 oder neuer lassen sich Sprachmemos direkt auf dem iPhone transkribieren, auch auf Deutsch (nicht in allen Ländern oder Regionen verfügbar). Den Text können Sie dort allerdings nur herauskopieren: Es gibt weder eine Aufteilung nach Sprechern noch einen Export als Untertiteldatei (SRT). Für Besprechungen und Interviews ist es einfacher, die Aufnahme auf einen Computer zu übertragen und mit diesem Tool zu verarbeiten.
Wenn etwas nicht klappt
- Die Verarbeitung einer langen Aufnahme direkt auf dem iPhone kann aus Speichermangel abbrechen. Übertragen Sie sie auf einen Computer und verarbeiten Sie sie dort.
- Um Dateien von Android zu übertragen, speichern Sie sie über das Teilen-Menü der Aufnahme-App in Google Drive oder verbinden Sie das Gerät per USB und öffnen Sie den Ordner mit den Aufnahmen.
Häufige Fragen
Muss ich M4A in MP3 umwandeln?
Nein. M4A wird direkt geladen. Eine Umwandlung zwischen komprimierten Formaten kann die Audioqualität verringern, wählen Sie daher die ursprüngliche M4A-Datei.
Kann ich es direkt auf dem iPhone nutzen?
Ja. Sichern Sie das Sprachmemo über das Teilen-Menü in der App „Dateien“ und wählen Sie diese Datei dann auf dieser Seite. Smartphones laufen in einem speicherschonenden Modus und Dateien sind auf 500 MB begrenzt, daher wird für lange Aufnahmen ein Computer empfohlen.
Kann es Sprecher unterscheiden (Sprechererkennung)?
Ja. Mit eingeschalteter Sprechererkennung werden die Zeilen nach Sprechern aufgeteilt (bis zu acht). Sie können Sprecher umbenennen und eine Person, die in zwei aufgeteilt wurde, auf dem Bildschirm zusammenführen.
Gibt es eine Begrenzung der Dateigröße?
Bis zu 2 GB pro Datei, auf Smartphones 500 MB. Ein Zeitlimit gibt es nicht.
Audio vorbereiten – und nach dem Transkribieren
Helfen Sie uns, den Dienst zu verbessern
Wenn Sie uns die Umstände eines Durchlaufs senden – ob erfolgreich oder fehlgeschlagen –, hilft uns das, Probleme aufzuspüren (eine Fehlerquote braucht beides). Zu wissen, welche Geräte und Einstellungen am häufigsten scheitern, hilft uns, die empfohlenen Voreinstellungen anzupassen und die Fehler dahinter zu beheben. Wenn es Sie nicht stört, ist es eine echte Hilfe, die Einstellung eingeschaltet zu lassen.
Was gesendet wird
Die Daten Ihres Geräts (GPU-Modell, Arbeitsspeicher, Anzahl der Kerne), Browser und Betriebssystem, das gewählte Modell und die gewählte Sprache, Ihre Einstellung der Sprechererkennung (an oder aus und die eingestellte Sprecheranzahl), die Anzeigesprache der Seite, wie weit der Durchlauf kam, Fehlerart und Details, das Dateiformat mit ungefährer Größe und Länge sowie die Dauer.
Was nie gesendet wird
Audio, Transkripte, Dateinamen und IP-Adressen. Die Daten gehen nur an den eigenen Server dieser Website, nie an einen Drittanbieter.