Audio kostenlos & unbegrenzt
mit KI transkribieren
Wählen Sie einfach eine Audiodatei – die KI (Whisper oder SenseVoice) transkribiert sie direkt in Ihrem Browser. Ihre Audiodaten werden nie an einen Server gesendet. Ohne Anmeldung, ohne Zeitlimit, völlig kostenlos.
Bei kleineren Modellen sinkt die Genauigkeit für diese Sprache stark. Wählen Sie Whisper Small oder größer
Normalerweise können Sie „Auto“ beibehalten. Ändern Sie den Wert nur, wenn das Ergebnis eindeutig die falsche Anzahl an Sprechern hat
So funktioniert es
- 1
Audiodatei auswählen
Unterstützt gängige Formate wie MP3, WAV, M4A und FLAC. Drag & Drop funktioniert ebenfalls.
- 2
KI transkribiert automatisch
Die KI (Whisper, SenseVoice oder Qwen3-ASR) rechnet direkt in Ihrem Browser. Beim ersten Mal wird das Modell heruntergeladen (je nach Auswahl 40 MB bis 5,2 GB).
- 3
Ergebnis exportieren
Als reinen Text oder als SRT-Untertitel herunterladen. Sprechererkennung wird unterstützt.
Wofür Sie es nutzen können
Machen Sie aus Aufnahmen Text, ohne Ihren Browser zu verlassen. Da nichts hochgeladen wird, eignet es sich auch für Aufnahmen, die Sie keinem externen Dienst überlassen dürfen.
Besprechungsprotokolle
Die Sprechererkennung markiert jede teilnehmende Person farblich, sodass das Transkript schon nah an einem Protokoll ist. Interne Aufnahmen gelangen auf keinen externen Server.
Interviews verschriftlichen
Die Aufnahmedauer ist nicht begrenzt. Interviewende und Befragte werden automatisch unterschieden, und Sie können jeder Person einen Namen geben.
Untertitel für Videos und YouTube
Laden Sie eine MP4- oder WebM-Datei direkt, prüfen und korrigieren Sie die Untertitel während der Wiedergabe und exportieren Sie SRT-Untertitel mit Zeitstempeln. Eine Umwandlung ist nicht nötig.
Mitschriften von Vorlesungen und Seminaren
Bewahren Sie aufgezeichnete Vorlesungen als durchsuchbaren Text auf. Größere Modelle kommen mit vielen Fachbegriffen besser zurecht.
Sprachmemos
Auf dem Smartphone aufgenommene M4A-Memos lassen sich direkt laden und in Text umwandeln.
Transkripte von Podcasts und Streams
Transkribieren Sie archivierte Folgen, um sie als Artikel wiederzuverwenden oder als Grundlage für bessere Auffindbarkeit in Suchmaschinen.
Starten Sie mit dem, was Sie brauchen
Wenn Sie den Dateityp oder das Ziel schon kennen, beginnen Sie hier – die Einstellungen sind auf den jeweiligen Fall abgestimmt.
MP3 transkribieren
Eine MP3-Datei auswählen und in Text umwandeln.
Video (MP4) transkribieren
Das Audio aus MP4 und anderen Videos extrahieren und in Text umwandeln.
M4A transkribieren
M4A-Dateien wie iPhone-Sprachmemos in Text umwandeln.
Untertitel (SRT) erstellen
Untertitel mit Zeitstempeln aus Audio oder Video erstellen.
Transkription mit Whisper KI
Whisper ohne Installation zum Transkribieren nutzen.
Meeting transkribieren
Meeting-Aufzeichnungen nach Sprechern getrennt in Protokolle umwandeln.
Aufnahmen transkribieren
Dateien von Diktiergeräten und lange Aufnahmen in Text umwandeln.
Audio vorbereiten – und nach dem Transkribieren
Weitere Tools desselben Autors. Speichern Sie eine X-Übertragung vor dem Transkribieren, kürzen Sie eine lange Aufnahme vor dem Laden oder brennen Sie die erstellte SRT-Datei ins Video ein – alles in Ihrem Browser.
Aufzeichnung eines X Space speichern
Speichert das Archiv eines beendeten X-(Twitter-)Space als M4A. Die Datei lässt sich direkt in dieses Tool laden.
X Space Downloader →
X-Video speichern
Speichert auf X gepostete Videos und Live-Archive als MP4. Laden Sie das Video direkt und transkribieren Sie es.
X Video Downloader →
Audio aufbereiten, SRT einbrennen
Kürzen Sie eine Aufnahme durch das Entfernen von Stille, extrahieren Sie nur das Audio aus einem Video oder brennen Sie die erstellte SRT-Datei ins Video ein. Alles läuft in Ihrem Browser.
Media Tools →
Unterstützte Dateiformate
- Audiodateien
- MP3, WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA, AMR, WebM
- Videodateien
- MP4, MOV, MKV, WebM, AVI, WMV, FLV, MPG, MPEG-TS, 3GP (die Audiospur wird extrahiert und transkribiert; das Ergebnis läuft bei der Wiedergabe als Untertitel über dem Video)
- Exportformate
- TXT (reiner Text) und SRT (Untertitel mit Zeitstempeln)
- Maximale Dateigröße
- Bis zu 2 GB pro Datei (500 MB auf Smartphones)
- Sprachen
- 100 Sprachen (die 99 von Whisper plus Kantonesisch mit SenseVoice). Neben Japanisch, Englisch, Chinesisch, Koreanisch, Spanisch, Französisch, Deutsch, Portugiesisch, Russisch, Italienisch und Indonesisch sind auch Niederländisch, Türkisch, Polnisch, Thailändisch, Vietnamesisch, Arabisch und viele weitere auswählbar. Sie können nach Sprachname oder Sprachcode suchen oder bei Unsicherheit „Automatisch erkennen“ wählen
Sie müssen Videos nicht vorher in Audio umwandeln – der Browser extrahiert die Audiospur, sobald die Datei geladen ist.
Verfügbare Modelle
Es stehen acht Modelle zur Verfügung. SenseVoice Small ist der Standard für Japanisch, Chinesisch und Koreanisch. Größere Whisper-Modelle transkribieren genauer, aber auch der erste Download und die Anforderungen an die Hardware wachsen. Qwen3-ASR 1.7B ist ein hochgenaues Modell nur für Computer mit WebGPU und lädt beim ersten Mal etwa 5,2 GB herunter.
| Modell | Größe | Hinweise |
|---|---|---|
| SenseVoice Small | 〜240 MB | Japanisch, Chinesisch, Koreanisch, Englisch und Kantonesisch. Leicht und schnell, bei Japanisch und Chinesisch mindestens so genau wie Large v3 Turbo (Standard für Japanisch, Chinesisch, Koreanisch und Kantonesisch) |
| Whisper Tiny | GPU 〜145 MB / CPU 〜40 MB | Schnell und leicht. Am besten für klare Aufnahmen |
| Whisper Base | GPU 〜280 MB / CPU 〜75 MB | Gute Balance aus Geschwindigkeit und Genauigkeit |
| Whisper Small | GPU 〜925 MB / CPU 〜240 MB | Hohe Genauigkeit. Stark bei Fachbegriffen und schwierigen Aufnahmen |
| Whisper Medium | GPU 〜1.0 GB / CPU 〜650 MB | Zwischen Small und Large. Hohe Genauigkeit, großer Download |
| Whisper Large v3 Turbo | GPU 〜1.5 GB / CPU 〜725 MB | Nahezu beste Genauigkeit und schnell. WebGPU empfohlen (empfohlen) |
| Whisper Large v3 | GPU 〜2.0 GB / CPU 〜1.2 GB | Vollständiges Large v3. Das genaueste Whisper-Modell, größter Download, langsam (WebGPU praktisch erforderlich) |
| Qwen3-ASR 1.7B | 〜5.2 GB | Hohe Genauigkeit. Nur auf Computern mit WebGPU; beim ersten Mal werden etwa 5,2 GB heruntergeladen (zwei Modelle: eines für den Text, eines für die Zeitstempel), und es werden etwa 5 GB GPU-Speicher (VRAM) belegt |
Whisper Medium und größer sowie Qwen3-ASR benötigen eine Umgebung mit WebGPU. Ohne WebGPU wählen Sie Small oder kleiner.
Als Anhaltspunkt: Whisper Large v3 und Qwen3-ASR 1.7B liefen unter Windows 11 mit einer GeForce RTX 2060 SUPER (8 GB). Qwen3-ASR belegt etwa 5 GB GPU-Speicher.
Unterschiede zu Cloud-Transkriptionsdiensten
Die meisten Transkriptionsdienste schicken Ihre Audiodaten zur Verarbeitung an ihre Server. Transcriber führt das Modell stattdessen in Ihrem Browser aus – das verändert die Vor- und Nachteile.
| Aspekt | Typischer Cloud-Dienst | Transcriber |
|---|---|---|
| Wohin das Audio geht | Wird auf die Server des Anbieters hochgeladen | Wird nie gesendet – Verarbeitung auf Ihrem Gerät |
| Kostenloses Kontingent | Meist auf eine Anzahl Minuten pro Monat begrenzt | Kein Zeit- oder Nutzungslimit |
| Konto erforderlich | Meist ja | Nein |
| Offline-Nutzung | Nicht möglich | Möglich, sobald das Modell heruntergeladen ist |
| Was die Geschwindigkeit bestimmt | Die Server-Hardware des Anbieters | GPU / CPU Ihres eigenen Geräts |
Cloud-Dienste haben den Vorteil gleichbleibender Geschwindigkeit auch auf leistungsschwachen Geräten. Die Verarbeitung im Browser eignet sich, wenn die Aufnahme Ihre Kontrolle nicht verlassen darf oder wenn Sie lange Aufnahmen ohne Kontingentgrenze verarbeiten müssen.
Häufige Fragen
Ist es wirklich kostenlos? Gibt es Zeit- oder Nutzungslimits?
Es ist völlig kostenlos. Es gibt keine Begrenzung der Dauer, der Anzahl der Durchläufe oder der Zeichenzahl, und es ist keine Kreditkarte nötig. Die einzige Grenze sind 2 GB pro Datei (500 MB auf Smartphones); innerhalb davon können Sie es so oft nutzen, wie Sie möchten.
Werden meine Audiodaten auf einen Server hochgeladen?
Nein. Die KI (Whisper oder SenseVoice) rechnet in Ihrem Browser, daher verlassen Ihre Audiodaten Ihr Gerät nicht. Nichts wird auf einem Server gespeichert und nichts an Dritte weitergegeben.
Muss ich ein Konto erstellen oder mich anmelden?
Nein. Öffnen Sie die Seite, wählen Sie eine Audiodatei, und die Transkription beginnt. Nach einer E-Mail-Adresse wird nie gefragt.
Welche Dateiformate werden unterstützt?
Audio: MP3, WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA und AMR. Video: MP4, MOV, MKV, WebM, AVI, WMV, FLV, MPG, MPEG-TS und 3GP. Sie können eine Datei per Drag & Drop ablegen oder über die Dateiauswahl wählen.
Kann ich eine Videodatei transkribieren?
Ja. Laden Sie eine MP4-, MOV-, MKV-, WebM- oder AVI-Datei, und der Browser extrahiert die Audiospur für die Transkription. Eine vorherige Umwandlung in eine Audiodatei ist nicht nötig. Nach der Transkription können Sie das Video mit dem Ergebnis als Untertitel abspielen, um es zu prüfen und zu korrigieren, oder es mit übersetzten Untertiteln ansehen. Die Grenze liegt bei 2 GB pro Datei (500 MB auf Smartphones). Videos, die Sie mit dem X Video Downloader von X (Twitter) gespeichert haben, lassen sich direkt laden; um vorher nur das Audio zu extrahieren, nutzen Sie Media Tools.
Kann es Sprecher unterscheiden?
Die Sprechererkennung (Diarisierung) wird unterstützt (Beta). Bei Aufnahmen mit mehreren Beteiligten, etwa Besprechungen oder Interviews, wird jeder Sprecher in einer anderen Farbe angezeigt. Die Anzahl der Sprecher wird automatisch geschätzt, daher müssen Sie sie normalerweise nicht einstellen. Sprecherbezeichnungen lassen sich auf dem Bildschirm umbenennen, versehentlich getrennte Sprecher zusammenführen, und jede Zeile kann einem anderen Sprecher zugewiesen oder geteilt werden. Läuft die Transkription mit WebGPU in einem anderen Browser als Firefox und steht die Sprecheranzahl auf „Auto“, nutzt die Erkennung NVIDIA Nemotron 3 Diarization, andernfalls pyannote; in beiden Fällen werden die Stimmmerkmale mit WeSpeaker verglichen.
Kann ich Untertiteldateien erstellen?
Ja – Transkripte lassen sich als SRT-Untertitel mit Zeitstempeln exportieren, bereit für Videoschnittprogramme oder Videoplattformen. Export als reiner Text (TXT) und Kopieren in die Zwischenablage sind ebenfalls möglich. Um die exportierte SRT-Datei direkt ins Video einzubrennen, nutzen Sie Media Tools (Untertitel einbrennen).
Kann ich das Transkript übersetzen?
Ja. Öffnen Sie „Übersetzen“ in der Kopfzeile des Ergebnisses, wählen Sie Ausgangs- und Zielsprache, und unter jeder Zeile erscheint eine Übersetzung. TXT und SRT lassen sich als Original, Übersetzung oder beides exportieren. Wenn Sie ein Video geladen haben, kann die Übersetzung bei der Wiedergabe auch als Untertitel darüber angezeigt werden. Die Übersetzung nutzt den integrierten Übersetzer von Chrome 138+ und Edge 148+ auf dem Desktop und läuft vollständig auf Ihrem Gerät, daher wird das Transkript nirgendwohin gesendet. Auf Smartphones sowie in Firefox und Safari ist sie nicht verfügbar. Bei der ersten Nutzung einer Sprache wird deren Übersetzungsmodell heruntergeladen.
Funktioniert es offline?
Ja. Nachdem das KI-Modell einmal heruntergeladen wurde, funktioniert die Transkription ohne Netzwerkverbindung. Die Modelle sind je nach Auswahl etwa 40 MB bis 5,2 GB groß.
Wie kann ich die Genauigkeit verbessern?
Ein zur Sprache passendes Modell verbessert die Genauigkeit. Für Japanisch, Chinesisch und Koreanisch ist das voreingestellte SenseVoice Small leicht und schnell und bei Japanisch und Chinesisch mindestens so genau wie Whisper Large v3 Turbo. Für andere Sprachen sind größere Modelle genauer; auf Geräten mit WebGPU bietet Whisper Large v3 Turbo nahezu die beste Genauigkeit bei hoher Geschwindigkeit. Auf Computern mit WebGPU können Sie außerdem Qwen3-ASR 1.7B wählen (beim ersten Mal ca. 5,2 GB Download), das bei Japanisch, Englisch und Chinesisch weniger Fehler macht als Whisper Large v3 Turbo. Wenn Sie die Sprache ausdrücklich festlegen, statt sie automatisch erkennen zu lassen, sinken die Fehler ebenfalls.
Kann ich es auf dem Smartphone nutzen?
Ja, allerdings läuft es zum Schutz des Geräts in einem speicherschonenden Modus (WASM), und Dateien sind auf 500 MB begrenzt. Für lange Aufnahmen wird ein Computer empfohlen.
Werden Fehlerinformationen erfasst?
Nur die Statistiken, die zum Beheben von Problemen nötig sind. Das sind die Daten Ihres Geräts (GPU-Modell, Arbeitsspeicher, Anzahl der Kerne), Browser und Betriebssystem, das gewählte Modell und die gewählte Sprache, Ihre Einstellung der Sprechererkennung (an oder aus und die eingestellte Sprecheranzahl), die Anzeigesprache der Seite, wie weit der Durchlauf kam, Fehlerart und Fehlertext, das Dateiformat mit ungefährer Größe und Länge sowie die Dauer. Dieselben Felder werden auch bei Erfolg gesendet, weil sich eine Fehlerquote nur aus beidem ergibt. Audio, Transkripte, Dateinamen und IP-Adressen werden nie gesendet, und die Daten gehen nur an den eigenen Server dieser Website – nie an einen Drittanbieter. Sie können das jederzeit mit dem Schalter im Abschnitt „Helfen Sie uns, den Dienst zu verbessern“ unten auf der Seite abschalten.
Helfen Sie uns, den Dienst zu verbessern
Wenn Sie uns die Umstände eines Durchlaufs senden – ob erfolgreich oder fehlgeschlagen –, hilft uns das, Probleme aufzuspüren (eine Fehlerquote braucht beides). Zu wissen, welche Geräte und Einstellungen am häufigsten scheitern, hilft uns, die empfohlenen Voreinstellungen anzupassen und die Fehler dahinter zu beheben. Wenn es Sie nicht stört, ist es eine echte Hilfe, die Einstellung eingeschaltet zu lassen.
Was gesendet wird
Die Daten Ihres Geräts (GPU-Modell, Arbeitsspeicher, Anzahl der Kerne), Browser und Betriebssystem, das gewählte Modell und die gewählte Sprache, Ihre Einstellung der Sprechererkennung (an oder aus und die eingestellte Sprecheranzahl), die Anzeigesprache der Seite, wie weit der Durchlauf kam, Fehlerart und Details, das Dateiformat mit ungefährer Größe und Länge sowie die Dauer.
Was nie gesendet wird
Audio, Transkripte, Dateinamen und IP-Adressen. Die Daten gehen nur an den eigenen Server dieser Website, nie an einen Drittanbieter.