Auf Aufnahme drücken — Ihre Worte streamen direkt zu unserer KI. Der Text erscheint Sekunden hinter Ihrer Stimme, und beim Stoppen erhalten Sie ein sauber ausgearbeitetes Transkript.
Keine Anmeldung
Kein Wasserzeichen
Export als TXT · SRT · VTT
Dateien löschen sich automatisch nach 24h
Ziehen Sie Ihre Datei hierher
oder Ihre Dateien durchsuchen
Kostenlos: {0} Dateien pro Tag · bis zu {1} Min. & {2} MB pro Datei
0:00
Live-Entwurf
Worte erscheinen während Sie sprechen, live von unserer eigenen KI transkribiert — drücken Sie Transcribe, wenn Sie für die polierte, editierbare Version fertig sind.
Mikrofon-Zugang wurde blockiert — erlauben Sie es in Ihrem Browser-Site-Einstellungen, oder laden Sie eine Datei statt.
Wirklich live: Ihre Sprache fließt beim Sprechen direkt zu unserer eigenen KI
Während Sie aufnehmen, zerlegt die Seite den Mikrofonstream in kurze Segmente — jeweils wenige Sekunden, adaptiv geschnitten, sodass das nächste in dem Moment losgeschickt wird, in dem das vorige zurückkommt — und leitet jedes direkt an unsere GPU-Server weiter, wo dasselbe Modell der Whisper-Klasse, das die ganze Website antreibt, es sofort transkribiert. Der Text landet Sekunden hinter Ihrer Stimme im Live-Feed und fließt weiter, solange Sie sprechen. Kein Browser-Sprachdienst, keine Diktier-API von Drittanbietern — der Live-Text ist echte Whisper-Ausgabe von unserer eigenen Hardware.
Weil nur eine Mikrofonaufnahme nötig ist, funktioniert der Live-Modus in jedem modernen Browser — Chrome, Edge, Safari und Firefox, am Desktop wie am Handy. Jedes Audiosegment wird von unseren Servern gelöscht, sobald sein Text zurückkommt.
Der Live-Feed und das finale Transkript
Segmentweise Transkription hat eine eingebaute Grenze: Das Modell sieht immer nur wenige Sekunden auf einmal — ein Wort auf der Grenze zwischen zwei Segmenten kann abgeschnitten herauskommen, und Satzzeichen über Segmentgrenzen hinweg sind Rätselraten. Deshalb endet der Ablauf mit einem weiteren Schritt: Die komplette Aufnahme bleibt während des Sprechens in Ihrem Browser, und mit einem Druck auf „Transkribieren“ läuft sie als Ganzes durch das Modell — voller Kontext, korrekte Interpunktion, Zeitstempel, der Editor und TXT-/SRT-/VTT-Exporte.
Nutzen Sie den Live-Feed, um zu prüfen, dass alles mitkommt, und um Text sofort nach dem Aussprechen zu übernehmen (der Feed hat einen Kopieren-Button); nutzen Sie den finalen Durchlauf für alles, was Sie behalten wollen. Für Audio, das bereits als Datei vorliegt, ist der Upload-Modus auf jeder Tool-Seite der kürzere Weg.
Häufig gestellte Fragen
Ist das tatsächlich live oder aufgezeichnet und danach gesendet?
Wirklich live: Aufnahme und Transkription überlappen sich. Die Seite schickt jedes nur wenige Sekunden lange Audiostück an unsere GPUs, während Sie schon das nächste sprechen — der Text sammelt sich also während der Aufnahme an, nicht danach. Rechnen Sie damit, dass der Feed eine Handvoll Sekunden hinter Ihrer Stimme läuft: die Zeit, die ein Stück braucht, um fertig zu werden, hochgeladen und transkribiert zu werden.
Warum ist der Live-Text ein paar Sekunden hinter mir?
Drei kleine Verzögerungen stapeln sich: Ein Schnitt muss aufgezeichnet werden (drei Sekunden oder so), reisen zum Server und passieren das Modell. Das stellt normalerweise den Feed etwa 4-8 Sekunden hinter Ihre Stimme – und wenn unsere GPUs kurz beschäftigt sind, passt sich die Seite an, indem sie etwas längere Scheiben schickt, anstatt zurück zu fallen. Natürliche Sprache mit Pausen fühlt sich glatt an.
In welchen Browsern funktioniert der Live-Modus?
Alle modernen — Chrome, Edge, Safari, und Firefox, auf Desktop und Telefone. Es stützt sich auf Standard-Mikrofonaufnahme anstatt ein Browser-Sprachdienst, so dass es funktioniert in Firefox genauso gut wie in Chrome.
Wohin geht meine Stimme, während die Live-Transkription läuft?
Nur zu unseren Servern, ehrlich beschrieben: Der Live-Modus streamt Ihr Audio beim Sprechen in kurzen Segmenten zu uns — genau das macht ihn live — und jedes Segment wird sofort gelöscht, sobald sein Text zurückkommt. Nichts geht an Google, Apple oder irgendeinen Drittanbieter-Sprachdienst. Die vollständige Aufnahme bleibt in Ihrem Browser, bis Sie auf „Transkribieren“ drücken, und anonyme Transkripte löschen sich innerhalb von 24 Stunden automatisch.
Kann ich es benutzen, um einem Meeting oder einer Vorlesung im Raum zu folgen?
Als persönliche Hilfe ja — stellen Sie das Gerät nah an die sprechende Person, dann folgt der Feed klarer Sprache gut, etwa zehn Sekunden versetzt. Kennen Sie aber die Grenzen: ein einziges Mikrofon, entfernte Stimmen und Durcheinanderreden verschlechtern das Ergebnis, und es ist kein zertifizierter Untertitelungsdienst für Barrierefreiheits-Anforderungen. Drücken Sie am Ende auf „Transkribieren“ — der Durchlauf mit vollem Kontext rettet meist, was der Live-Feed verpatzt hat.
Welche Sprachen funktionieren live und soll ich eine wählen?
Dieselben 90+ Sprachen wie jede Transkription auf dieser Seite — es ist dasselbe Modell. Ein Tipp speziell für den Live-Modus: Wählen Sie Ihre Sprache im Auswahlmenü, statt die automatische Erkennung anzulassen. Die Erkennung läuft pro Segment, und sieben Sekunden sind wenig Anhaltspunkt — mit fest eingestellter Sprache gerät der Feed bei kurzen oder akzentgefärbten Sätzen nicht ins Schwanken.