Transcriber

Audio kostenlos & unbegrenzt
mit KI transkribieren

Wählen Sie einfach eine Audiodatei – die KI (Whisper oder SenseVoice) transkribiert sie direkt in Ihrem Browser. Ihre Audiodaten werden nie an einen Server gesendet. Ohne Anmeldung, ohne Zeitlimit, völlig kostenlos.

Vollständig privat
Funktioniert offline
Schnell dank WebGPU
Umgebung wird geprüft …

Bei kleineren Modellen sinkt die Genauigkeit für diese Sprache stark. Wählen Sie Whisper Small oder größer

AnBeta

Normalerweise können Sie „Auto“ beibehalten. Ändern Sie den Wert nur, wenn das Ergebnis eindeutig die falsche Anzahl an Sprechern hat

So funktioniert es

  1. 1

    Audiodatei auswählen

    Unterstützt gängige Formate wie MP3, WAV, M4A und FLAC. Drag & Drop funktioniert ebenfalls.

  2. 2

    KI transkribiert automatisch

    Die KI (Whisper, SenseVoice oder Qwen3-ASR) rechnet direkt in Ihrem Browser. Beim ersten Mal wird das Modell heruntergeladen (je nach Auswahl 40 MB bis 5,2 GB).

  3. 3

    Ergebnis exportieren

    Als reinen Text oder als SRT-Untertitel herunterladen. Sprechererkennung wird unterstützt.

Wofür Sie es nutzen können

Machen Sie aus Aufnahmen Text, ohne Ihren Browser zu verlassen. Da nichts hochgeladen wird, eignet es sich auch für Aufnahmen, die Sie keinem externen Dienst überlassen dürfen.

Besprechungsprotokolle

Die Sprechererkennung markiert jede teilnehmende Person farblich, sodass das Transkript schon nah an einem Protokoll ist. Interne Aufnahmen gelangen auf keinen externen Server.

Interviews verschriftlichen

Die Aufnahmedauer ist nicht begrenzt. Interviewende und Befragte werden automatisch unterschieden, und Sie können jeder Person einen Namen geben.

Untertitel für Videos und YouTube

Laden Sie eine MP4- oder WebM-Datei direkt, prüfen und korrigieren Sie die Untertitel während der Wiedergabe und exportieren Sie SRT-Untertitel mit Zeitstempeln. Eine Umwandlung ist nicht nötig.

Mitschriften von Vorlesungen und Seminaren

Bewahren Sie aufgezeichnete Vorlesungen als durchsuchbaren Text auf. Größere Modelle kommen mit vielen Fachbegriffen besser zurecht.

Sprachmemos

Auf dem Smartphone aufgenommene M4A-Memos lassen sich direkt laden und in Text umwandeln.

Transkripte von Podcasts und Streams

Transkribieren Sie archivierte Folgen, um sie als Artikel wiederzuverwenden oder als Grundlage für bessere Auffindbarkeit in Suchmaschinen.

Starten Sie mit dem, was Sie brauchen

Wenn Sie den Dateityp oder das Ziel schon kennen, beginnen Sie hier – die Einstellungen sind auf den jeweiligen Fall abgestimmt.

Weitere Tools desselben Autors. Speichern Sie eine X-Übertragung vor dem Transkribieren, kürzen Sie eine lange Aufnahme vor dem Laden oder brennen Sie die erstellte SRT-Datei ins Video ein – alles in Ihrem Browser.

Unterstützte Dateiformate

Audiodateien
MP3, WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA, AMR, WebM
Videodateien
MP4, MOV, MKV, WebM, AVI, WMV, FLV, MPG, MPEG-TS, 3GP (die Audiospur wird extrahiert und transkribiert; das Ergebnis läuft bei der Wiedergabe als Untertitel über dem Video)
Exportformate
TXT (reiner Text) und SRT (Untertitel mit Zeitstempeln)
Maximale Dateigröße
Bis zu 2 GB pro Datei (500 MB auf Smartphones)
Sprachen
100 Sprachen (die 99 von Whisper plus Kantonesisch mit SenseVoice). Neben Japanisch, Englisch, Chinesisch, Koreanisch, Spanisch, Französisch, Deutsch, Portugiesisch, Russisch, Italienisch und Indonesisch sind auch Niederländisch, Türkisch, Polnisch, Thailändisch, Vietnamesisch, Arabisch und viele weitere auswählbar. Sie können nach Sprachname oder Sprachcode suchen oder bei Unsicherheit „Automatisch erkennen“ wählen

Sie müssen Videos nicht vorher in Audio umwandeln – der Browser extrahiert die Audiospur, sobald die Datei geladen ist.

Verfügbare Modelle

Es stehen acht Modelle zur Verfügung. SenseVoice Small ist der Standard für Japanisch, Chinesisch und Koreanisch. Größere Whisper-Modelle transkribieren genauer, aber auch der erste Download und die Anforderungen an die Hardware wachsen. Qwen3-ASR 1.7B ist ein hochgenaues Modell nur für Computer mit WebGPU und lädt beim ersten Mal etwa 5,2 GB herunter.

ModellGrößeHinweise
SenseVoice Small〜240 MBJapanisch, Chinesisch, Koreanisch, Englisch und Kantonesisch. Leicht und schnell, bei Japanisch und Chinesisch mindestens so genau wie Large v3 Turbo (Standard für Japanisch, Chinesisch, Koreanisch und Kantonesisch)
Whisper TinyGPU 〜145 MB / CPU 〜40 MBSchnell und leicht. Am besten für klare Aufnahmen
Whisper BaseGPU 〜280 MB / CPU 〜75 MBGute Balance aus Geschwindigkeit und Genauigkeit
Whisper SmallGPU 〜925 MB / CPU 〜240 MBHohe Genauigkeit. Stark bei Fachbegriffen und schwierigen Aufnahmen
Whisper MediumGPU 〜1.0 GB / CPU 〜650 MBZwischen Small und Large. Hohe Genauigkeit, großer Download
Whisper Large v3 TurboGPU 〜1.5 GB / CPU 〜725 MBNahezu beste Genauigkeit und schnell. WebGPU empfohlen (empfohlen)
Whisper Large v3GPU 〜2.0 GB / CPU 〜1.2 GBVollständiges Large v3. Das genaueste Whisper-Modell, größter Download, langsam (WebGPU praktisch erforderlich)
Qwen3-ASR 1.7B〜5.2 GBHohe Genauigkeit. Nur auf Computern mit WebGPU; beim ersten Mal werden etwa 5,2 GB heruntergeladen (zwei Modelle: eines für den Text, eines für die Zeitstempel), und es werden etwa 5 GB GPU-Speicher (VRAM) belegt

Whisper Medium und größer sowie Qwen3-ASR benötigen eine Umgebung mit WebGPU. Ohne WebGPU wählen Sie Small oder kleiner.
Als Anhaltspunkt: Whisper Large v3 und Qwen3-ASR 1.7B liefen unter Windows 11 mit einer GeForce RTX 2060 SUPER (8 GB). Qwen3-ASR belegt etwa 5 GB GPU-Speicher.

Unterschiede zu Cloud-Transkriptionsdiensten

Die meisten Transkriptionsdienste schicken Ihre Audiodaten zur Verarbeitung an ihre Server. Transcriber führt das Modell stattdessen in Ihrem Browser aus – das verändert die Vor- und Nachteile.

AspektTypischer Cloud-DienstTranscriber
Wohin das Audio gehtWird auf die Server des Anbieters hochgeladenWird nie gesendet – Verarbeitung auf Ihrem Gerät
Kostenloses KontingentMeist auf eine Anzahl Minuten pro Monat begrenztKein Zeit- oder Nutzungslimit
Konto erforderlichMeist jaNein
Offline-NutzungNicht möglichMöglich, sobald das Modell heruntergeladen ist
Was die Geschwindigkeit bestimmtDie Server-Hardware des AnbietersGPU / CPU Ihres eigenen Geräts

Cloud-Dienste haben den Vorteil gleichbleibender Geschwindigkeit auch auf leistungsschwachen Geräten. Die Verarbeitung im Browser eignet sich, wenn die Aufnahme Ihre Kontrolle nicht verlassen darf oder wenn Sie lange Aufnahmen ohne Kontingentgrenze verarbeiten müssen.

Häufige Fragen

Ist es wirklich kostenlos? Gibt es Zeit- oder Nutzungslimits?

Es ist völlig kostenlos. Es gibt keine Begrenzung der Dauer, der Anzahl der Durchläufe oder der Zeichenzahl, und es ist keine Kreditkarte nötig. Die einzige Grenze sind 2 GB pro Datei (500 MB auf Smartphones); innerhalb davon können Sie es so oft nutzen, wie Sie möchten.

Werden meine Audiodaten auf einen Server hochgeladen?

Nein. Die KI (Whisper oder SenseVoice) rechnet in Ihrem Browser, daher verlassen Ihre Audiodaten Ihr Gerät nicht. Nichts wird auf einem Server gespeichert und nichts an Dritte weitergegeben.

Muss ich ein Konto erstellen oder mich anmelden?

Nein. Öffnen Sie die Seite, wählen Sie eine Audiodatei, und die Transkription beginnt. Nach einer E-Mail-Adresse wird nie gefragt.

Welche Dateiformate werden unterstützt?

Audio: MP3, WAV, M4A, AAC, FLAC, OGG, Opus, AIFF, WMA und AMR. Video: MP4, MOV, MKV, WebM, AVI, WMV, FLV, MPG, MPEG-TS und 3GP. Sie können eine Datei per Drag & Drop ablegen oder über die Dateiauswahl wählen.

Kann ich eine Videodatei transkribieren?

Ja. Laden Sie eine MP4-, MOV-, MKV-, WebM- oder AVI-Datei, und der Browser extrahiert die Audiospur für die Transkription. Eine vorherige Umwandlung in eine Audiodatei ist nicht nötig. Nach der Transkription können Sie das Video mit dem Ergebnis als Untertitel abspielen, um es zu prüfen und zu korrigieren, oder es mit übersetzten Untertiteln ansehen. Die Grenze liegt bei 2 GB pro Datei (500 MB auf Smartphones). Videos, die Sie mit dem X Video Downloader von X (Twitter) gespeichert haben, lassen sich direkt laden; um vorher nur das Audio zu extrahieren, nutzen Sie Media Tools.

Kann es Sprecher unterscheiden?

Die Sprechererkennung (Diarisierung) wird unterstützt (Beta). Bei Aufnahmen mit mehreren Beteiligten, etwa Besprechungen oder Interviews, wird jeder Sprecher in einer anderen Farbe angezeigt. Die Anzahl der Sprecher wird automatisch geschätzt, daher müssen Sie sie normalerweise nicht einstellen. Sprecherbezeichnungen lassen sich auf dem Bildschirm umbenennen, versehentlich getrennte Sprecher zusammenführen, und jede Zeile kann einem anderen Sprecher zugewiesen oder geteilt werden. Läuft die Transkription mit WebGPU in einem anderen Browser als Firefox und steht die Sprecheranzahl auf „Auto“, nutzt die Erkennung NVIDIA Nemotron 3 Diarization, andernfalls pyannote; in beiden Fällen werden die Stimmmerkmale mit WeSpeaker verglichen.

Kann ich Untertiteldateien erstellen?

Ja – Transkripte lassen sich als SRT-Untertitel mit Zeitstempeln exportieren, bereit für Videoschnittprogramme oder Videoplattformen. Export als reiner Text (TXT) und Kopieren in die Zwischenablage sind ebenfalls möglich. Um die exportierte SRT-Datei direkt ins Video einzubrennen, nutzen Sie Media Tools (Untertitel einbrennen).

Kann ich das Transkript übersetzen?

Ja. Öffnen Sie „Übersetzen“ in der Kopfzeile des Ergebnisses, wählen Sie Ausgangs- und Zielsprache, und unter jeder Zeile erscheint eine Übersetzung. TXT und SRT lassen sich als Original, Übersetzung oder beides exportieren. Wenn Sie ein Video geladen haben, kann die Übersetzung bei der Wiedergabe auch als Untertitel darüber angezeigt werden. Die Übersetzung nutzt den integrierten Übersetzer von Chrome 138+ und Edge 148+ auf dem Desktop und läuft vollständig auf Ihrem Gerät, daher wird das Transkript nirgendwohin gesendet. Auf Smartphones sowie in Firefox und Safari ist sie nicht verfügbar. Bei der ersten Nutzung einer Sprache wird deren Übersetzungsmodell heruntergeladen.

Funktioniert es offline?

Ja. Nachdem das KI-Modell einmal heruntergeladen wurde, funktioniert die Transkription ohne Netzwerkverbindung. Die Modelle sind je nach Auswahl etwa 40 MB bis 5,2 GB groß.

Wie kann ich die Genauigkeit verbessern?

Ein zur Sprache passendes Modell verbessert die Genauigkeit. Für Japanisch, Chinesisch und Koreanisch ist das voreingestellte SenseVoice Small leicht und schnell und bei Japanisch und Chinesisch mindestens so genau wie Whisper Large v3 Turbo. Für andere Sprachen sind größere Modelle genauer; auf Geräten mit WebGPU bietet Whisper Large v3 Turbo nahezu die beste Genauigkeit bei hoher Geschwindigkeit. Auf Computern mit WebGPU können Sie außerdem Qwen3-ASR 1.7B wählen (beim ersten Mal ca. 5,2 GB Download), das bei Japanisch, Englisch und Chinesisch weniger Fehler macht als Whisper Large v3 Turbo. Wenn Sie die Sprache ausdrücklich festlegen, statt sie automatisch erkennen zu lassen, sinken die Fehler ebenfalls.

Kann ich es auf dem Smartphone nutzen?

Ja, allerdings läuft es zum Schutz des Geräts in einem speicherschonenden Modus (WASM), und Dateien sind auf 500 MB begrenzt. Für lange Aufnahmen wird ein Computer empfohlen.

Werden Fehlerinformationen erfasst?

Nur die Statistiken, die zum Beheben von Problemen nötig sind. Das sind die Daten Ihres Geräts (GPU-Modell, Arbeitsspeicher, Anzahl der Kerne), Browser und Betriebssystem, das gewählte Modell und die gewählte Sprache, Ihre Einstellung der Sprechererkennung (an oder aus und die eingestellte Sprecheranzahl), die Anzeigesprache der Seite, wie weit der Durchlauf kam, Fehlerart und Fehlertext, das Dateiformat mit ungefährer Größe und Länge sowie die Dauer. Dieselben Felder werden auch bei Erfolg gesendet, weil sich eine Fehlerquote nur aus beidem ergibt. Audio, Transkripte, Dateinamen und IP-Adressen werden nie gesendet, und die Daten gehen nur an den eigenen Server dieser Website – nie an einen Drittanbieter. Sie können das jederzeit mit dem Schalter im Abschnitt „Helfen Sie uns, den Dienst zu verbessern“ unten auf der Seite abschalten.

Helfen Sie uns, den Dienst zu verbessern

Wenn Sie uns die Umstände eines Durchlaufs senden – ob erfolgreich oder fehlgeschlagen –, hilft uns das, Probleme aufzuspüren (eine Fehlerquote braucht beides). Zu wissen, welche Geräte und Einstellungen am häufigsten scheitern, hilft uns, die empfohlenen Voreinstellungen anzupassen und die Fehler dahinter zu beheben. Wenn es Sie nicht stört, ist es eine echte Hilfe, die Einstellung eingeschaltet zu lassen.

Was gesendet wird

Die Daten Ihres Geräts (GPU-Modell, Arbeitsspeicher, Anzahl der Kerne), Browser und Betriebssystem, das gewählte Modell und die gewählte Sprache, Ihre Einstellung der Sprechererkennung (an oder aus und die eingestellte Sprecheranzahl), die Anzeigesprache der Seite, wie weit der Durchlauf kam, Fehlerart und Details, das Dateiformat mit ungefährer Größe und Länge sowie die Dauer.

Was nie gesendet wird

Audio, Transkripte, Dateinamen und IP-Adressen. Die Daten gehen nur an den eigenen Server dieser Website, nie an einen Drittanbieter.