Zum Inhalt springen
Roland Hecht
Kapitel 9 von 20 — Inhaltsverzeichnis

Lokale KI · Sprache · Kapitel 9 · 4 Min.

Stimmungsbild zum Teil Sprache

Whisper — Sprache wird Text

Das Werkzeug, das man am schnellsten nicht mehr missen will. Wie es funktioniert, welche Größe du brauchst und wo es Sätze erfindet.

Von allem in diesem Kurs ist das hier die Sache, die den Alltag am stärksten verändert. Nicht weil sie beeindruckend wäre — weil sie nach drei Tagen selbstverständlich ist und man danach ungern wieder tippt.

Was Whisper ist

Begriff

Whisper ist ein Modell für Spracherkennung. Es bekommt eine Tonaufnahme und liefert Text. Es versteht rund hundert Sprachen, erkennt sie selbständig und braucht kein Training auf deine Stimme.

Der letzte Punkt ist der, an dem sich Whisper von der Diktiersoftware unterscheidet, die man vor zwanzig Jahren einrichten musste. Kein Vorlesen von Beispieltexten, kein Profil, kein Einsprechen. Man drückt und redet.

Whisper ist nicht gleich Whisper

Es gibt mehrere Umsetzungen desselben Modells. Die, die man auf einem normalen Rechner nimmt, heißt faster-whisper — dieselben Ergebnisse, deutlich sparsamer.

Für dich heißt das nur: Wenn in einer Anleitung steht, Whisper sei zu langsam für den Alltag, wurde vermutlich die ursprüngliche Fassung gemessen. Nimm die sparsame.

Welche Größe

Wie bei den Sprachmodellen gibt es Whisper in Stufen. Größer heißt genauer und langsamer:

StufeEinschätzung
tiny, baseFür Deutsch zu ungenau. Namen und Fachwörter gehen verloren.
smallDer Alltagswert. Gute deutsche Erkennung, erträgliches Tempo. Das benutze ich.
mediumMerklich genauer, spürbar langsamer. Für lange Aufnahmen, nicht fürs Diktat.
large-v3-turboBei mir getestet und verworfen: 25 bis 32 Sekunden für 12 Sekunden Ton.

Das Verwerfen ist hier die eigentliche Information. Die größte Stufe ist nicht die beste Wahl, sie ist die beste Wahl auf passender Hardware. Auf meiner ist sie unbenutzbar, und das merkt man erst beim Messen.

Was es bei mir kostet

Gemessen im laufenden Betrieb, an einem ganz normalen Tag:

VorgangDauer
Modell laden beim Start6 bis 13 Sekunden, einmal
6,2 Sekunden Gesagtes erkennen8,1 Sekunden

Langsamer als Echtzeit. Man spricht einen Satz, lässt die Taste los und wartet noch einmal etwa so lang, wie man geredet hat. Klingt schlimmer, als es ist: In der Zeit legt man das Blatt weg oder greift zur Maus.

Achtung

Die Grafikbeschleunigung aus Kapitel 3 hilft hier nicht. Die schnelle Rechnung läuft bei Whisper ausschließlich über NVIDIA-Bibliotheken. Ohne passende Karte gibt es keinen Ausweg, keine Einstellung, keinen Trick. Das Diktat bleibt auf dem Prozessor.

Die vier Schrauben

EinstellungWas sie tutMein Wert
ModellGröße, siehe obensmall
SpracheFest vorgeben spart Zeit und Fehlerde
beam_sizeWieviele Möglichkeiten geprüft werden. 1 ist am schnellsten, 5 am genauesten.2
StillefilterSchneidet Stille am Anfang und Ende wegan

Die Sprache fest zu setzen lohnt sich. Lässt man Whisper selbst erkennen, kostet das nicht nur Zeit — es geht bei kurzen Aufnahmen auch schief, und dann bekommt man einen deutschen Satz in englischer Schreibweise.

Whisper erfindet Sätze

Das ist die Eigenschaft, die man kennen muss, weil sie so absurd ist. Bekommt Whisper Stille oder Rauschen, liefert es nicht etwa nichts. Es liefert einen Satz. Und zwar immer wieder dieselben:

Der Grund ist die Herkunft der Trainingsdaten: sehr viele Videos mit Untertiteln, an deren Ende genau solche Zeilen stehen. Bei Stille ist das für Whisper das wahrscheinlichste, was kommen könnte — also schreibt es das hin.

Merke

Wenn beim versehentlichen Antippen der Taste plötzlich „Untertitelung des ZDF“ in deiner E-Mail steht, ist nichts kaputt. Das ist der Normalfall, und man fängt ihn mit einer Liste ab — wie, steht in Kapitel 10.

Fachwörter beibringen

Whisper kennt keine Baustellen-Vokabeln und keine Eigennamen. „Axians“ wird zu „Aktions“, „BVG“ zu etwas Absurdem. Dagegen hilft ein Kniff: Man gibt Whisper vor der Erkennung eine Liste eigener Wörter mit. Es weiß dann, womit zu rechnen ist.

Das ist keine Wörterbuchfunktion, sondern eher ein Stichwort vorweg — und genau deshalb funktioniert es unauffällig gut. Wie man diese Liste automatisch wachsen lässt, steht in Kapitel 12.

In einem Satz

Die Grafikbeschleunigung aus Kapitel 3 hilft Whisper nicht — hier zählt der Prozessor. Und bei Stille erfindet es Sätze.

Du tippst die Taste versehentlich an, und plötzlich steht „Untertitelung des ZDF“ in deinem Text. Ist das ein Fehler?

Nein, das ist die Bauart. Whisper wurde auf Videomaterial trainiert und füllt Stille mit dem, was dort typischerweise gesprochen wird. Kurze Aufnahmen ohne Inhalt sind der klassische Auslöser.

Kapitel 9 von 20 · Stand: 13.08.2026