Zum Inhalt springen
Roland Hecht
Kapitel 2 von 20 — Inhaltsverzeichnis

Lokale KI · Grundlagen · Kapitel 2 · 4 Min.

Stimmungsbild zum Teil Grundlagen

Die Vokabeln

Modell, Parameter, Quantisierung, Token, Kontextfenster, Inferenz. Sechs Wörter, ohne die der Rest keinen Sinn ergibt.

Auf dem Bau sagt keiner „waagerechter Tragebalken“, man sagt Sturz. Hier ist es genauso. Sechs Wörter reichen für diesen Kurs. Wer sie kennt, versteht auch die Beschreibungen auf den Herstellerseiten.

Modell

Begriff

Ein Modell ist eine Datei auf deiner Festplatte. Ein paar hundert Megabyte bis mehrere Gigabyte. Darin stehen keine Sätze und keine Wikipedia, sondern Zahlen.

Das ist der Punkt, an dem die meisten hängen bleiben, deshalb gleich zu Anfang: In dem Modell steht nichts nach, was man nachschlagen könnte. Es ist keine Datenbank. Es ist eine sehr große Tabelle von Gewichten, mit der sich ausrechnen lässt, welches Wort als nächstes am wahrscheinlichsten kommt. Alles, was es kann, folgt daraus.

Deshalb erfindet ein Modell auch dann etwas, wenn es nichts weiß: Ein wahrscheinliches nächstes Wort gibt es immer. Das ist keine Bosheit und kein Fehler im Programm, das ist die Bauart.

Parameter

Begriff

Parameter sind diese Gewichte. Ihre Anzahl steht im Namen: 1b ist eine Milliarde, 4b sind vier. Mehr Parameter heißt in der Regel: klüger, größer, langsamer.

Das ist die eine Zahl, an der du dich beim Auswählen entlanghangelst. Als grobe Ordnung:

GrößeWofür es reicht
1bUmformulieren, aufräumen, übersetzen. Kurze Sachen.
4bDer brauchbare Alltag. Zusammenfassen, E-Mails, Stichpunkte.
ab 7bMerklich besser — und auf einem Rechner ohne Grafikkarte kaum noch zu ertragen.

Quantisierung

Begriff

Quantisierung heißt: Die Gewichte werden gröber gespeichert. Statt jeder Zahl viel Platz zu geben, bekommt sie wenig. Das Modell wird kleiner und schneller und büßt ein bisschen Genauigkeit ein.

Ohne dieses Verfahren würde nichts davon auf einem normalen Rechner laufen. Vier Milliarden Parameter in voller Auflösung wären rund 16 Gigabyte. Das Modell, das ich täglich benutze, hat vier Milliarden Parameter und belegt 3,3 Gigabyte. Das ist der ganze Unterschied.

Praktisch musst du dich darum nicht kümmern — was du von Ollama bekommst, ist bereits quantisiert. Wissen solltest du es trotzdem, weil es erklärt, warum die Zahl im Namen und die Dateigröße nicht zusammenpassen.

Merke

Die Dateigröße ist der ehrlichere Wert als die Parameterzahl. Sie sagt dir, wieviel Arbeitsspeicher das Ding beim Rechnen belegt — und das ist die Zahl, die über „läuft“ oder „läuft nicht“ entscheidet.

Token

Begriff

Ein Token ist ein Textbaustein, etwa ein dreiviertel Wort. „Bauleitung“ sind zwei bis drei Token, „und“ ist eins.

Gerechnet wird in Token, nicht in Wörtern. Wenn irgendwo steht, ein Modell schaffe „8 Token pro Sekunde“, dann sind das ungefähr sechs Wörter — also etwa Vorlesetempo.

Der Unterschied zu den Diensten im Netz: Hier kostet dich ein Token nichts. Es kostet dich Zeit. Das ist die einzige Währung in diesem Kurs.

Kontextfenster

Begriff

Das Kontextfenster ist, wieviel Text das Modell gleichzeitig vor Augen hat — deine Frage, seine bisherige Antwort, alles zusammen. Ist es voll, fällt vorne etwas heraus.

Auf dem eigenen Rechner hat das eine Folge, die man im Netz nicht kennt: Das Kontextfenster kostet Arbeitsspeicher. Wer es großzügig einstellt, belegt zusätzlich zum Modell noch einmal ordentlich Speicher und wird langsamer — auch wenn er das Fenster gar nicht ausnutzt.

Für Diktat-Aufräumen reichen 2000 Token bequem. Genau das steht auch in der Einstellung meines Diktierwerkzeugs. Man stellt hier klein ein, nicht groß.

Inferenz

Begriff

Inferenz ist das Wort für das, was passiert, wenn das Modell arbeitet. Also das Ausrechnen der Antwort. Nicht das Lernen — das ist längst vorbei, das nennt sich Training und ist nichts, was auf deinem Rechner stattfindet.

Die Trennung ist wichtig, weil sie ein verbreitetes Missverständnis auflöst: Dein lokales Modell lernt nicht dazu. Es merkt sich nichts von gestern, es wird durch Benutzung nicht besser, und es gibt auch nichts an irgendwen weiter. Was du willst, dass es weiß, musst du ihm jedes Mal mitgeben.

Das ist Nachteil und Vorteil in einem. Nachteil, weil du dich nicht auf ein Gedächtnis verlassen kannst. Vorteil, weil nichts hängen bleibt, was nicht hängen bleiben soll.

Und ein Wort, das du nicht brauchst

VRAM steht für den eigenen Speicher einer Grafikkarte. In fast jeder Anleitung im Netz ist davon die Rede, weil dort jeder eine Grafikkarte voraussetzt. Hat dein Rechner keine eigene Karte, gibt es keinen VRAM — es gibt nur Arbeitsspeicher, und den teilen sich alle.

Wenn du also liest „du brauchst mindestens 8 GB VRAM“, heißt das für dich nicht automatisch „geht nicht“. Es heißt: Der Text ist für andere Hardware geschrieben. Was auf deiner geht, steht im nächsten Kapitel.

In einem Satz

Die Dateigröße ist der ehrlichere Wert als die Parameterzahl — sie sagt dir, was tatsächlich in deinen Speicher muss.

Zwei Modelle haben dieselbe Parameterzahl, aber sehr verschiedene Dateigrößen. Woran liegt das?

An der Quantisierung — wie grob die Zahlen im Modell gespeichert sind. Gröber heißt kleiner und schneller, aber irgendwann auch merklich dümmer.

Kapitel 2 von 20 · Stand: 13.08.2026