Handbuch

Sprachverfolgung

Wie TalkPatch deiner Stimme folgt, welche Modelle es gibt und wie du die Lesemarke abstimmst.

So funktioniert es

TalkPatch hört über das gewählte Mikrofon zu, erkennt die Wörter lokal und vergleicht sie mit dem Lauftext. Groß/Klein und Akzente spielen keine Rolle, zusammengesetzte Wörter werden erkannt. Sobald du weiter bist, rückt die Lesemarke nach. Ausgelassene oder umformulierte Wörter toleriert die Verfolgung in einem Fenster von etwa acht Wörtern zurück und sechzig nach vorn. Ohne passenden Treffer bleibt der Text stehen, du kannst also jederzeit abschweifen und wieder einsteigen.

Kapitelüberschriften und Regiehinweise sind ausgenommen: Ihre Wörter werden weder erwartet noch markiert.

Modelle

Auswahl unter Sprachverfolgung-Chip → Pfeil-Menü → Erkennung (dasselbe Menü führt zu Sprachverfolgung-Optionen …). Alle Modelle laufen auf dem Mac; sie werden beim ersten Aktivieren nach ~/Library/Application Support/FluidAudio/Models/ geladen und bleiben dort.

Modell Sprachen Art Hinweis
Nemotron mehrsprachig 0.6B Deutsch, Englisch Streaming, Stufen 560/1120/2240 ms Standard. 1120 ms ist der Kompromiss aus Tempo und Trefferquote
Nemotron Englisch 0.6B Englisch Streaming
Parakeet TDT v3 (Sliding Window) Deutsch, Englisch + 23 Sliding Window
Parakeet TDT v2 / TDT-CTC 110M Englisch Sliding Window leicht, schnell
Parakeet EOU 120M Englisch Streaming, 160/320/1280 ms sehr geringe Latenz
Parakeet Unified 0.6B Englisch Streaming
Cohere Transcribe (Beta) Deutsch, Englisch + 12 Block 1,8 GB, hohe Qualität, höhere Latenz
Apple SpeechAnalyzer / klassisch Deutsch, Englisch Apple braucht die Spracherkennungs-Berechtigung

Die Stufe eines Streaming-Modells ist die Länge der Audioblöcke: kürzer reagiert schneller, länger erkennt sicherer.

Lesemarke abstimmen

Unter Sprachverfolgung-Chip → Pfeil-Menü → Sprachverfolgung-Optionen …:

  • Markierung: aktuelle Zeile, einzelnes Wort, erreichter Lesefortschritt, Kombination oder aus; Farbe und Deckkraft.
  • Vor-/Nachlauf und Scrollbeginn innerhalb der Zeile: wie weit die Marke vor deiner Stimme liegt.
  • Glättung: wie weich der Text nachzieht.
  • Mikrofon und Pegel (echte dBFS) direkt an der Studio-Leiste; die Sprach-Empfindlichkeit im Zahnrad daneben.
  • Countdown vor dem Start abschaltbar.

Die Lesemarke lässt sich auch am Rand der Bühne direkt ziehen.

Zeilen und Sprünge

↑/↓ gehen eine echte Zeile zurück oder vor, auch während die Sprachverfolgung läuft: TalkPatch springt sofort und richtet die Erkennung an der neuen Stelle aus. Die Restzeit im Chip startet mit 132 Wörtern pro Minute und rechnet nach den ersten Sätzen mit deinem gemessenen Tempo weiter, wie ein Navi. Die geschätzte Gesamtdauer steht auch in der Skriptliste und im Editor.