Lokale KI · Sprache · Kapitel 9 · 4 Min.
Whisper — Sprache wird Text
Das Werkzeug, das man am schnellsten nicht mehr missen will. Wie es funktioniert, welche Größe du brauchst und wo es Sätze erfindet.
Von allem in diesem Kurs ist das hier die Sache, die den Alltag am stärksten verändert. Nicht weil sie beeindruckend wäre — weil sie nach drei Tagen selbstverständlich ist und man danach ungern wieder tippt.
Was Whisper ist
Whisper ist ein Modell für Spracherkennung. Es bekommt eine Tonaufnahme und liefert Text. Es versteht rund hundert Sprachen, erkennt sie selbständig und braucht kein Training auf deine Stimme.
Der letzte Punkt ist der, an dem sich Whisper von der Diktiersoftware unterscheidet, die man vor zwanzig Jahren einrichten musste. Kein Vorlesen von Beispieltexten, kein Profil, kein Einsprechen. Man drückt und redet.
Whisper ist nicht gleich Whisper
Es gibt mehrere Umsetzungen desselben Modells. Die, die man auf einem normalen Rechner nimmt, heißt faster-whisper — dieselben Ergebnisse, deutlich sparsamer.
Für dich heißt das nur: Wenn in einer Anleitung steht, Whisper sei zu langsam für den Alltag, wurde vermutlich die ursprüngliche Fassung gemessen. Nimm die sparsame.
Welche Größe
Wie bei den Sprachmodellen gibt es Whisper in Stufen. Größer heißt genauer und langsamer:
| Stufe | Einschätzung |
|---|---|
tiny, base | Für Deutsch zu ungenau. Namen und Fachwörter gehen verloren. |
small | Der Alltagswert. Gute deutsche Erkennung, erträgliches Tempo. Das benutze ich. |
medium | Merklich genauer, spürbar langsamer. Für lange Aufnahmen, nicht fürs Diktat. |
large-v3-turbo | Bei mir getestet und verworfen: 25 bis 32 Sekunden für 12 Sekunden Ton. |
Das Verwerfen ist hier die eigentliche Information. Die größte Stufe ist nicht die beste Wahl, sie ist die beste Wahl auf passender Hardware. Auf meiner ist sie unbenutzbar, und das merkt man erst beim Messen.
Was es bei mir kostet
Gemessen im laufenden Betrieb, an einem ganz normalen Tag:
| Vorgang | Dauer |
|---|---|
| Modell laden beim Start | 6 bis 13 Sekunden, einmal |
| 6,2 Sekunden Gesagtes erkennen | 8,1 Sekunden |
Langsamer als Echtzeit. Man spricht einen Satz, lässt die Taste los und wartet noch einmal etwa so lang, wie man geredet hat. Klingt schlimmer, als es ist: In der Zeit legt man das Blatt weg oder greift zur Maus.
Die Grafikbeschleunigung aus Kapitel 3 hilft hier nicht. Die schnelle Rechnung läuft bei Whisper ausschließlich über NVIDIA-Bibliotheken. Ohne passende Karte gibt es keinen Ausweg, keine Einstellung, keinen Trick. Das Diktat bleibt auf dem Prozessor.
Die vier Schrauben
| Einstellung | Was sie tut | Mein Wert |
|---|---|---|
| Modell | Größe, siehe oben | small |
| Sprache | Fest vorgeben spart Zeit und Fehler | de |
beam_size | Wieviele Möglichkeiten geprüft werden. 1 ist am schnellsten, 5 am genauesten. | 2 |
| Stillefilter | Schneidet Stille am Anfang und Ende weg | an |
Die Sprache fest zu setzen lohnt sich. Lässt man Whisper selbst erkennen, kostet das nicht nur Zeit — es geht bei kurzen Aufnahmen auch schief, und dann bekommt man einen deutschen Satz in englischer Schreibweise.
Whisper erfindet Sätze
Das ist die Eigenschaft, die man kennen muss, weil sie so absurd ist. Bekommt Whisper Stille oder Rauschen, liefert es nicht etwa nichts. Es liefert einen Satz. Und zwar immer wieder dieselben:
- „Untertitelung des ZDF, 2020“
- „Untertitel von Stephanie Geiges“
- „Untertitel der Amara.org-Community“
- „Das war's. Bis zum nächsten Mal.“
Der Grund ist die Herkunft der Trainingsdaten: sehr viele Videos mit Untertiteln, an deren Ende genau solche Zeilen stehen. Bei Stille ist das für Whisper das wahrscheinlichste, was kommen könnte — also schreibt es das hin.
Wenn beim versehentlichen Antippen der Taste plötzlich „Untertitelung des ZDF“ in deiner E-Mail steht, ist nichts kaputt. Das ist der Normalfall, und man fängt ihn mit einer Liste ab — wie, steht in Kapitel 10.
Fachwörter beibringen
Whisper kennt keine Baustellen-Vokabeln und keine Eigennamen. „Axians“ wird zu „Aktions“, „BVG“ zu etwas Absurdem. Dagegen hilft ein Kniff: Man gibt Whisper vor der Erkennung eine Liste eigener Wörter mit. Es weiß dann, womit zu rechnen ist.
Das ist keine Wörterbuchfunktion, sondern eher ein Stichwort vorweg — und genau deshalb funktioniert es unauffällig gut. Wie man diese Liste automatisch wachsen lässt, steht in Kapitel 12.
Die Grafikbeschleunigung aus Kapitel 3 hilft Whisper nicht — hier zählt der Prozessor. Und bei Stille erfindet es Sätze.
Du tippst die Taste versehentlich an, und plötzlich steht „Untertitelung des ZDF“ in deinem Text. Ist das ein Fehler?
Nein, das ist die Bauart. Whisper wurde auf Videomaterial trainiert und füllt Stille mit dem, was dort typischerweise gesprochen wird. Kurze Aufnahmen ohne Inhalt sind der klassische Auslöser.
Kapitel 9 von 20 · Stand: 13.08.2026
Achtung
In einem Satz