Zum Inhalt springen
Roland Hecht
Kapitel 4 von 20 — Inhaltsverzeichnis

Lokale KI · Grundlagen · Kapitel 4 · 7 Min.

Stimmungsbild zum Teil Grundlagen

Welches Modell

Klein, mittel oder groß — und warum das kleinste bei mir im Test still den halben Satz verschluckt hat.

Auf meiner Platte liegen drei Modelle. Ich habe sie nicht nach Gefühl ausgesucht, sondern dieselbe Aufgabe rechnen lassen und verglichen. Dieses Kapitel ist das Ergebnis.

Die drei Kandidaten

ModellGrößeKontextfensterKann außerdem
gemma3:1b815 MB32.000 Tokennur Text
gemma3:4b3,3 GB128.000 TokenText und Bilder
gemma4:e4b9,6 GB128.000 TokenText, Bilder und Ton

Der Test

Die Aufgabe war die, die ich täglich stelle: ein diktierter Rohtext soll aufgeräumt werden. Die Anweisung dazu sagt ausdrücklich „Behalte ALLE Inhaltswörter wörtlich“ und „Erfinde NICHTS“. Hineingegeben habe ich das hier, so wie die Spracherkennung es ausspuckt:

also ich wollte nochmal ähm nachfragen wegen dem termin am donnerstag ob das so passt oder ob wir das ja halt verschieben müssen weil ich da noch einen anderen termin habe also den beim zahnarzt und das wird knapp

Das kleine Modell lieferte:

Also ich wollte noch einmal nachfragen bezüglich des Termins am Donnerstag. Ob das so passt oder ob wir das ja verschieben müssen, weil ich noch einen anderen Termin habe, nämlich beim Zahnarzt.

Liest sich gut. Ist aber falsch. „Und das wird knapp“ fehlt. Der Satz, der die eigentliche Botschaft trägt — es wird eng — ist stillschweigend verschwunden. Und man merkt es nicht, weil das Ergebnis rund klingt.

Das mittlere Modell behielt ihn:

Also, ich wollte nochmal nachfragen wegen dem Termin am Donnerstag, ob das so passt oder ob wir das ja verschieben müssen, weil ich da noch einen anderen Termin habe, beim Zahnarzt und das wird knapp.
Merke

Ein kleines Modell hält sich nicht zuverlässig an eine harte Regel, auch wenn sie in Großbuchstaben dasteht. Nicht aus Trotz — es ist schlicht zu klein dafür. Und die gefährlichste Sorte Fehler ist die, die sich flüssig liest.

Und das größte?

Der Name führt in die Irre. gemma4:e4b ist mit 9,6 Gigabyte fast dreimal so groß wie das 4b-Modell. Das „e“ steht nämlich nicht für vier Milliarden Parameter.

Achtung — nachgemessen am 24.08.2026

Hier stand, dieses Modell sei im warmen Zustand „ungefähr gleich schnell“ wie das mittlere. Das gilt nicht mehr. Seit einer neueren Fassung denkt es vor dem Antworten und braucht für dieselbe Aufgabe 185 statt 10 Sekunden. Schaltet man das Denken ab, sind es 9 bis 16 Sekunden — dann stimmt der alte Satz wieder annähernd. Wie das geht, steht als Handgriff 1 in Kapitel 18; die Messung dazu in Kapitel 3.

Begriff

Das E in e2b und e4b steht für effective — effektive Parameter. Diese Bauart hält immer nur einen Teil des Modells gleichzeitig aktiv. Auf der Platte acht Milliarden Parameter, beim Rechnen wirken rund viereinhalb. Gebaut für Geräte am Rand: Notebooks, Telefone.

Es ist also nicht das „größere“, sondern ein anders gebautes Modell. Es kann als einziges der drei auch Ton verarbeiten. Für den Alltag auf meinem Rechner nehme ich es trotzdem nicht — es belegt 9,6 GB Platte für ein Ergebnis, das dem des dreimal kleineren Modells sehr ähnlich sieht.

Merke — eine Warnung, die sich erledigt hat

Genau dieses Modell war es, das bei mir unter der Grafik-Einstellung aus Kapitel 3 aufhörte, brauchbare Sätze zu liefern — vier Versuche, vier Mal Kauderwelsch. Beim Nachmessen am 24.08.2026 war der Fehler weg: sauberes Deutsch, mit und ohne Schalter. Es lohnt sich also, eine alte Warnung ab und zu selbst nachzuprüfen — sonst meidet man jahrelang etwas, das längst repariert ist.

Zweimal gemessen, dasselbe Ergebnis

Diesen Test habe ich am 24.08.2026 wiederholt — ein Jahr Softwareentwicklung später, mit einer deutlich neueren Ollama-Fassung, viermal: mit und ohne Grafik, kalt und warm. Das kleine Modell verschluckt „und das wird knapp“ in allen vier Läufen.

Es macht sogar mehr: Einmal wurde aus „halt“ ein „wohl“, einmal fiel gleich der ganze Anfang „wegen dem Termin“ weg. Das mittlere Modell und das große behielten den Halbsatz jedes Mal.

Merke

Vieles in diesem Kurs hat sich mit der neuen Fassung geändert — Geschwindigkeiten, Schalternamen, sogar ein Fehler ist verschwunden. Dieser Befund nicht. Und das ist der Unterschied zwischen einer Momentaufnahme und einer Eigenschaft: Tempo ist eine Frage der Programmversion. Dass ein kleines Modell eine harte Regel nicht durchhält, ist eine Frage seiner Größe.

Was ich empfehle

  1. Fang mit dem kleinsten an.
    Nicht weil es das beste ist, sondern weil du in zwei Minuten weißt, ob dein Rechner überhaupt mitspielt. Ein 815-MB-Modell lädt schnell und verzeiht.
  2. Geh auf 4 Milliarden, sobald es ernst wird.
    Sobald es darauf ankommt, dass nichts verloren geht — E-Mails, Notizen, alles mit Zahlen und Terminen — nimm die mittlere Größe. Der Test oben ist der Grund.
  3. Miss selbst, statt zu glauben.
    Stell demselben Modell dieselbe Aufgabe wie ich, mit einem Text, den du kennst. Prüf nicht, ob es schön klingt, sondern ob alles noch drin ist. Das ist die einzige Prüfung, die zählt.

Die Stufe darüber: gpt-oss

Die drei oben sind das, was auf meinem Rechner läuft. Es gibt eine Stufe darüber, und weil danach oft gefragt wird, gehört sie hierher — mit einer klaren Ansage vorweg:

Achtung

Alles in diesem Abschnitt ist nicht von mir gemessen, sondern aus der Modellbeschreibung und aus Tests Dritter. Der Rest des Kapitels ist selbst getestet, dieser Abschnitt nicht. Behandle ihn entsprechend.

gpt-oss ist das Modell, das OpenAI zum Herunterladen freigegeben hat — dieselbe Firma, die ChatGPT betreibt, aber dieses hier läuft auf deinem Rechner. Es gibt es in zwei Größen:

ModellGrößeKontextfensterWas der Rechner braucht
gpt-oss:20b14 GB128.000 Tokenab 16 GB Speicher
gpt-oss:120b65 GB128.000 Tokeneine 80-GB-Grafikkarte, oder der Umweg aus Kapitel 3

Die untere Zeile ist für die meisten von uns Zuschauersport. Die obere ist es nicht: 16 Gigabyte Speicher hat heute ein normales Notebook. Dass ein 14-GB-Modell auf 16 GB überhaupt läuft, liegt an der Quantisierung — die Parameter sind auf gut vier Bit heruntergerundet. Was Quantisierung ist, steht in Kapitel 2.

Warum das interessant ist: Bei den Sachfragen, an denen kleine Modelle scheitern — „Was ist das c’t-Magazin?“ und ähnliche — liefert gpt-oss nach übereinstimmenden Tests brauchbare Antworten, während die kleinen Modelle munter dazuerfinden. Das Kapitel 15 zeigt, wie unangenehm das aussehen kann.

Merke

Für meine Hauptaufgabe — diktierten Text aufräumen — brauche ich es nicht. Ein 4b-Modell schafft das, und zwar schnell. gpt-oss:20b ist die Antwort auf eine andere Frage: „Kann das Ding auch etwas wissen?“ Wer nur aufräumen lässt, gewinnt dadurch nichts außer Wartezeit.

Achtung

Beim Herunterladen aufpassen: Im Verzeichnis stehen neben gpt-oss:20b auch Einträge, die auf -cloud enden. Die sehen aus wie Modelle, laufen aber auf fremden Servern. Mehr dazu im Kniffe-Kapitel 18 — es ist die Falle, die den ganzen Sinn dieses Kurses aushebelt.

Deutsch ist nicht selbstverständlich

Fast alle diese Modelle können vor allem Englisch. Deutsch können sie mit, und je kleiner das Modell, desto mehr merkt man das. Bei mir zeigte sich das so: Das kleine Modell schrieb Hauptwörter klein und formulierte an einer Stelle „wegen des Termin“.

Wenn du also ein Modell testest und der deutsche Text wirkt schief — es liegt selten an deiner Anweisung. Nimm eine Nummer größer, bevor du an deinem Prompt verzweifelst.

Wo die Gigabyte bleiben

Drei Modelle, knapp 13 Gigabyte. Das läppert sich schneller, als man denkt, weil das Ausprobieren nichts kostet und man Modelle gern liegen lässt. Wie du siehst, was da liegt, und wie du wieder loswirst, was du nicht brauchst, steht im nächsten Kapitel.

In einem Satz

Ein kleines Modell hält sich nicht zuverlässig an eine harte Regel, auch wenn sie ausdrücklich im Auftrag steht. Es vergisst sie nicht — es kann sie nicht durchhalten.

Du gibst einem kleinen Modell eine unmissverständliche Regel, und es hält sie trotzdem nicht ein. Ist der Auftrag schuld?

Nicht unbedingt. Bei kleinen Modellen ist das eine Grenze der Größe, nicht der Formulierung. Die Antwort ist dann nicht ein besserer Prompt, sondern ein größeres Modell oder eine Prüfung hinterher.

Kapitel 4 von 20 · Stand: 24.08.2026