Audio und Video transkribieren
Englische oder deutsche Sprache lokal erkennen, Zeitmarken prüfen und Text oder Untertitel exportieren.
Dein Tool wird vorbereitet …
So funktioniert’s
- Wähle eine Audio- oder Videodatei bis 50 MiB und 60 Sekunden. Prüfe die erkannten Spuren, wähle eine dekodierbare Tonspur und bestimme Englisch oder Deutsch als gesprochene Sprache.
- Bestätige den Download von 66,2 MB geprüften Engine- und Modelldateien dieser Website und wähle Lokal transkribieren. Verfolge Download und tatsächliche Erkennungsaktivität. Abbrechen beendet den Auftrag; Zurücksetzen und Modell freigeben leert die Arbeitssitzung.
- Höre die Quelle ab den Anfangszeiten der Segmente an. Korrigiere Wörter, Namen, Zahlen und Zeiten und ergänze fehlende Zeiten selbst. Prüfe wiederholte oder angeschnittene Sätze an überlappenden Erkennungsfenstern, bevor du die Kontrolle bestätigst.
- Wähle TXT, SRT oder VTT und anschliessend den gesonderten Download-Link. Untertitelexporte benötigen gültige Zeiten. In Untertitel-Reparatur weiterbearbeiten öffnet die geprüften Segmente auf derselben Seite für Verschiebung, Driftkorrektur und einen weiteren Untertitelexport.
In einem echten deutschen Test wurde gesprochenes «neun Uhr dreissig» als «39 Uhr» erkannt. Eine Korrektur des Segments zu «9:30 Uhr» verändert den bearbeiteten Export. Eine fehlende Endzeit bleibt leer, bis du einen gültigen Wert anhand der Quelle einträgst.
Details & Grenzen
Bis 50 MiB / 60 Sekunden. Mono-/Stereo-Audio, 8–96 kHz; Video bis 1’920 px pro Seite / 2,07 MP. Ausdrücklicher Download von 66,2 MB Engine/Modell. Browser-Dekodierung und Gerätespeicher erforderlich. Namen, Zahlen und fehlende Zeiten prüfen; kein Genauigkeitsversprechen für Schweizerdeutsch und kein Cloud-Fallback.
Welche Dateien funktionieren, und wie verlässlich ist das Ergebnis?
Unterstützte Container sind WAV, MP3, Ogg, ADTS/AAC, MP4/MOV und WebM/Matroska; der Browser muss den tatsächlichen Audio-Codec dekodieren können. Eingaben dürfen höchstens acht Spuren sowie Mono-/Stereo-Audio bei 8–96 kHz enthalten. Video ist auf 1’920 px pro Seite und 2’073’600 Pixel begrenzt. Die Erkennung liefert einen bearbeitbaren englischen oder deutschen Entwurf: Namen, Zahlen, Schweizerdeutsch, Musik und Stille können Fehler oder erfundenen Text verursachen. Zeiten sind Modellschätzungen auf der ursprünglichen Zeitachse, keine zugesicherte Ausrichtung. Überlappende 30-Sekunden-Fenster können doppelte oder angeschnittene Sätze enthalten; Text wird nicht automatisch gelöscht. Grenzen: 200 Segmente, insgesamt 20’000 Zeichen und 2’000 je Segment. Audio-Dekodierung stoppt nach 60 Sekunden Arbeit; Modellstart und Erkennung haben äussere Fünf-Minuten-Grenzen und können früher scheitern. Das Modell kann mehrere hundert MB RAM benötigen; Mobilgeräte können dafür zu eingeschränkt sein. Es wird in der laufenden Worker-Sitzung wiederverwendet und muss nach Zurücksetzen oder Abbrechen erneut laden. TXT verwendet die bearbeiteten Wörter; SRT/VTT werden sicher kodiert und erneut eingelesen. Diese Strukturprüfung bestätigt nicht den gesprochenen Inhalt.