eine Weiterentwicklung von Dragon als lokaler Front-End-Spracherkennung unter Einbeziehung der Fähigkeiten aktueller LLMs lässt ja auf sich warten. Ich zweifle, ob Microsoft/Nuance das überhaupt noch angehen wird.
Daher die Frage: Hat jemand schon (gute) Erfahrungen mit aktueller LLM-basierter Spracherkennung gemacht?
Die Fa. Open AI (die mit Chat GPT) stellt ja das Modell "Whisper" zur Verfügung und man kann dieses mit einschlägigen Front Ends auch lokal betreiben. Ich habe bislang nur ein wenig in der Apple-Welt experimentiert und auf Windows kurz "Voicy" getestet (verlangt nach dem Test ein monatliches Abo).
Nervig finde ich, dass man explizit ein Stück Text, z.B. einen Satz oder Absatz, zu Ende sprechen muss, bevor man per Mausklick oder Hotkey die Umsetzung startet. Zur Überarbeitung von Texten (Ersatz einzelner Wörter oder Wortgruppen) scheint das also wohl weniger geeignet. Für mich verlangsamt es auch die Arbeit. Auch scheinen die Möglichkeiten zur Vokabularanpassung (Abkürzungen, Fachwörter) recht bescheiden. Die automatische Zeichensetzung ist gewöhnungsbedürftig. Die Erkennungsleistung (natürlich ohne Training) ist toll - sie scheint mir noch besser zu sein als bei Dragon.
Das alles sind nur erste Eindrücke. Noch einmal meine Frage: Nutzt jemand ein Whisper-basiertes System im beruflichen Alltag zur Textproduktion (analog Dragon)?
__________________________________________________ Dragon Legal 16, Win 11 Pro, Microsoft 365 64-bit, SpeechMike Premium Air, Intel Core 7 255H, 32 GB RAM, 1TB SSD; + Dragon Legal 16 auf Windows 11 Pro für ARM unter Parallels Pro auf MacBook Air M2