Über 90 Sprachen · Sprecherkennung · SRT / VTT · Ergebnis in ~1 Minute

Verwandle Audio & Video in präzisen Text

Lade einen Podcast, ein Meeting oder eine Vorlesung hoch — Audio oder Video. Wir erkennen die Sprache, markieren, wer was gesagt hat, und liefern durchsuchbaren Text mit Klick-Wiedergabe und Untertitel-Export.

Melde dich an, um deine erste Datei zu transkribieren

Gratis-Konten bekommen 3 Transkriptionen pro Tag. Keine Kreditkarte, kein Testphasen-Countdown.

Gratis: 3 Dateien pro Tag, je bis zu 30 Minuten, Reset um Mitternacht UTC · eine 30-Minuten-Aufnahme dauert etwa eine Minute · keine Kreditkarte

Funktioniert mitMP3WAVM4AAACFLACOGGMP4MOVWEBMMKV

Jeden Tag gratis.

3 Transkriptionen pro Tag aufs Haus — und jede Datei bekommt das volle Werkzeugset, keine abgespeckte Kostprobe.

Sprecherkennung

Ein Häkchen, und jede Zeile kommt nach Stimme markiert und mit Zeitcode zurück.

Editor mit Klick-Wiedergabe

Klicke auf einen Satz, um genau diesen Moment zu hören — ein Zitat zu prüfen dauert Sekunden.

Untertitel mit einem Klick

Exportiere SRT oder VTT und zieh es direkt in YouTube, Premiere oder Final Cut.

Sechs Exportformate

TXT, DOCX, PDF, CSV, SRT, VTT — lade mehrere auf einmal herunter.

Ein durchsuchbares Archiv

Finde die Minute, in der ein Thema aufkam, statt stundenlang Aufnahmen erneut zu hören.

Video direkt rein

Lade MP4, MOV, WEBM oder MKV einfach hoch — ohne vorher die Tonspur zu extrahieren.

Genutzt vonPodcasterJournalistenStudierendeForschendeProduktteamsAnwälteÄrzteVideo-EditorenKursersteller

Angetrieben von Whisper.

OpenAIs Sprachmodell verarbeitet deine Dateien — hier steht, wann es präzise ist und wann nicht.

Zwei Engines, automatisch geroutet

Whisper übernimmt die meisten Dateien; bei langen oder Mehrsprecher-Aufnahmen springt eine Diarisierungs-Engine ein. Die Datei entscheidet — du wählst nie ein Modell.

Ehrliche Genauigkeit

Nahezu perfekt mit einem ordentlichen Mikrofon. Rechne mit Ausrutschern bei Namen, Fachjargon und Durcheinanderreden — keine 100%-Versprechen. Teste dein eigenes Audio gratis.

Zeitstempel zum Nachprüfen

Modell-native Zeiten, meist sekundengenau — klicke auf eine Zeile und prüfe sie gegen das Audio.

Über 90 Sprachen, automatisch erkannt

Englisch, Spanisch, Japanisch, Chinesisch und mehr. Gemischte Aufnahmen laufen auf die dominante Sprache hinaus.

Standardmäßig privat

Verschlüsselt gespeichert, nie für Modelltraining verwendet, kein Mensch hört zu — weg, sobald du löschst.

Festpreis statt Taxameter.

Minutenpreise machen aus einer einzigen Stunde Audio eine Rechnung über 10–15 $. Hier deckt ein Festpreis alles ab, was du im Monat transkribierst — und der Gratis-Plan läuft nie ab.

Gratis

$0/ für immer

Zum Ausprobieren — oder für leichte, alltägliche Nutzung.

  • 3 Transkriptionen pro Tag, jeden Tag
  • Dateien bis 30 Minuten / 50MB
  • Zeitstempel & Sprecherkennung
  • Export als TXT, PDF, DOCX, CSV, SRT, VTT
  • Über 90 Sprachen
  • Standard-Warteschlange
Am beliebtesten

Unlimited

$10/ Monat, jährlich abgerechnet (120 $)

Für alle, die beruflich transkribieren.

  • Unbegrenzte Transkriptionen
  • Sprecherkennung bei jeder Datei
  • Alle KI-Tools — Zusammenfassungen, Bereinigung, Übersetzung
  • Bevorzugte Verarbeitung
  • Kein Längenlimit pro Datei — Dateien bis 100MB

Fragen, die wirklich gestellt werden.

Zu Genauigkeit, Datenschutz, Limits und was „gratis“ wirklich heißt. Die skeptischen inklusive.

Wie genau ist es wirklich?

Bei sauberem Audio — ordentliches Mikrofon, ein bis zwei Sprecher, wenig Hintergrundgeräusche — erwarte nahezu perfekten Text mit gelegentlichen Ausrutschern bei Namen und Fachjargon. Die Genauigkeit sinkt bei starkem Durcheinanderreden, kräftigen Akzenten oder lauten Räumen. Der beste Test ist dein eigenes Audio: Die ersten Transkriptionen sind gratis.

Warum muss ich mich mit Google anmelden?

Die Anmeldung ist der Weg, jeder Person ein echtes tägliches Gratis-Kontingent zu geben statt einer einmaligen Kostprobe. Ein Klick mit Google — kein Passwort ausdenken, kein Hin und Her mit Bestätigungs-Mails, und wir erhalten nur Namen, E-Mail und Avatar.

Was ist im Gratis-Plan wirklich drin?

3 Transkriptionen jeden Tag, für immer — jede bis zu 30 Minuten lang. Kein 7-Tage-Test, kein Einmal-Guthaben. Der Zähler wird um Mitternacht UTC zurückgesetzt. Brauchst du mehr oder längere Dateien, hebt der Unlimited-Plan beide Grenzen auf.

Welche Sprachen werden unterstützt?

Über 90, darunter Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Japanisch, Koreanisch und Chinesisch. Die Sprache wird automatisch erkannt — gemischtsprachige Aufnahmen laufen meist auf die dominante hinaus.

Kommt es mit Videodateien klar?

Ja. Lade MP4, MOV, WEBM oder MKV hoch und wir transkribieren die Tonspur direkt — kein vorheriges Extrahieren nötig.

Wie funktioniert die Sprecherkennung?

Setze vor dem Upload das Häkchen „Sprecher erkennen“. Die KI trennt die Stimmen und beschriftet jeden Abschnitt (Sprecher 1, Sprecher 2, …). Am zuverlässigsten ist es bei klaren Redewechseln — Interviews, Meetings, Podcasts — und weniger, wenn Leute durcheinanderreden.

Kann ich den Zeitstempeln trauen?

Sie kommen direkt aus dem Sprachmodell und liegen meist innerhalb einer Sekunde am Audio. Klicke im Editor auf eine Zeile, um die Originalaufnahme an dieser Stelle zu hören und es selbst zu prüfen. Untertitel-Exporte behalten die rohen Segmentzeiten, damit die Untertitel im Videoschnitt passen.

Ist mein Audio privat?

Deine Dateien sind privat in deinem Konto, verschlüsselt gespeichert, werden nie geteilt und nie zum Training von KI-Modellen verwendet. Die Transkription läuft nur auf automatisierten Systemen — kein Mensch hört dein Audio. Löschst du eine Datei, ist sie aus unserem Speicher verschwunden.

Was kann ich exportieren?

PDF- und DOCX-Dokumente, reinen Text (TXT), Tabellen (CSV) und Untertiteldateien (SRT, VTT) — mit optionalen Abschnitts-Zeitstempeln. Du kannst mehrere Formate auswählen und in einem Rutsch herunterladen.

Welche Dateiformate genau kann ich hochladen?

Audio: MP3, WAV, M4A, AAC, FLAC, OGG, OPUS, WMA, AIFF. Video: MP4, MOV, WEBM, MKV, MPEG, AVI. Wenn dein Rekorder oder Schnittprogramm es erzeugt hat, funktioniert es fast sicher — und wenn ein Format doch scheitert, sag uns Bescheid und wir ergänzen es.

Warum ist das so viel billiger als menschliche Transkription?

Weil kein Mensch die Arbeit macht. Ein professionelles Transkriptionsbüro verlangt 1–2 $ pro Audiominute und braucht Tage; ein Sprachmodell kostet uns Cents pro Stunde und braucht etwa eine Minute. Du tauschst eine kleine Genauigkeitsmarge gegen einen hundertfachen Preisunterschied — und alles, was du veröffentlichen willst, kannst du Zeile für Zeile gegen das Audio prüfen.

Wie viel kann ich tatsächlich transkribieren?

Gratis: 3 Dateien pro Tag, jeden Tag — bis zu 90 Aufnahmen im Monat, ohne einen Cent zu zahlen. Unlimited: keine Obergrenze bei der Anzahl; die einzige Regel ist ein Konto pro Person.

Wer steckt dahinter?

Hi 👋 — Transcript.so wird von einem kleinen unabhängigen Team gebaut, nicht von einem VC-finanzierten Riesen. Wir beantworten unsere Support-Mails selbst, liefern wöchentlich Verbesserungen und halten den Dienst schnell und bezahlbar, weil unsere Kosten bewusst niedrig konstruiert sind.

Die nächste Aufnahme muss kein Abend voller Tipperei werden.

Dein erstes Transkript ist etwa eine Minute entfernt — gratis, ohne Karte.

Datei transkribieren — gratis