Lokale KI · Praxis · Kapitel 18 · 9 Min.
Kniffe, die man nicht auf Anhieb findet
Sieben Handgriffe für die lokale KI — einer davon macht das größte Modell zehnmal schneller. Und warum es dieses Kapitel bis vor Kurzem gar nicht geben sollte.
Die anderen Kurse haben dieses Kapitel von Anfang an. Dieser hier bekam bewusst keins, und die Begründung stand fest: An einer Kommandozeile liegt alles offen. Wo keine Oberfläche ist, kann sich nichts verstecken.
Diese Begründung ist überholt — aus zwei Gründen. Der erste ist, dass Ollama inzwischen etwas anderes ist als noch vor einem Jahr. Der zweite ist grundsätzlicher: Nicht das Fehlen eines Knopfes versteckt etwas, sondern die Entfernung. Und Entfernung gibt es hier reichlich — der Handgriff steht in einer Fußnote der Dokumentation, in einem Namenszusatz, oder in einer Voreinstellung, die niemand nennt.
1. Das Denken abschalten, wenn nichts zu denken ist
Das ist der Handgriff mit der größten Wirkung im ganzen Kurs, und man findet ihn nur, wenn
man ollama run --help eintippt. Neuere Modelle denken vor dem Antworten —
sie erzeugen erst eine lange innere Überlegung, die du nie zu sehen bekommst, und antworten
dann. Das ist ab Werk eingeschaltet.
Bei Knobelaufgaben ist das ein Gewinn. Beim Aufräumen von diktiertem Text ist es reine Wartezeit, denn dort gibt es nichts zu überlegen. Auf meinem Gerät gemessen, gleiche Aufgabe, gleiches Modell:
gemma4:e4b | Zeit | Wortteile | Ergebnis |
|---|---|---|---|
| ab Werk | 93,8 s | 671 | richtig |
mit --think=false | 8,9 s | 45 | richtig — dasselbe |
Zehnmal schneller bei gleichem Ergebnis. Die Antwort ist 45 Wortteile lang; die anderen gut 620 waren Nachdenken über einen Satz, der keins brauchte.
ollama run gemma4:e4b --think=false "Räum diesen Text auf: ..."Es gibt den Schalter auch in Stufen — statt false kannst du
low, medium oder high schreiben, sofern das Modell das
kann. Und wenn du das Denken nur nicht sehen, aber behalten willst, gibt es dafür
--hidethinking. Das ist etwas anderes: Es versteckt die Ausgabe, spart aber
keine Sekunde.
Die Faustregel: Denken ausschalten, wo du die Antwort selbst schon kennst und nur eine saubere Form willst — Aufräumen, Umformulieren, Übersetzen, Zusammenfassen. Anlassen, wo wirklich etwas zu entscheiden ist. Wer es überall anlässt, wartet den ganzen Tag auf Überlegungen zu Kommasetzung.
Woran man merkt, dass ein Modell denkt: Es dauert unerklärlich lange, und in
ollama run --verbose steht am Ende eine Zahl erzeugter Wortteile, die viel
größer ist als die sichtbare Antwort. Bei mir 671 gegenüber 45 — das Fünfzehnfache. Wenn
dir eine Antwort zu lange braucht, ist das der erste Verdacht.
2. Der blanke Befehl ist kein Modellstarter mehr
Zwei Jahre lang war ollama ohne Zusatz nur eine Hilfeausgabe. Man tippte
ollama run …, alles andere war Beiwerk. Seit Version 0.32 ist das anders:
ollamaDas startet jetzt einen interaktiven Agenten. Der plaudert nicht nur, sondern kann Code schreiben, Befehle ausführen und im Netz suchen. Aus dem Modellstarter ist eine Arbeitsumgebung geworden — mit demselben Befehl, den du seit zwei Jahren tippst.
Zwei Dinge, die dabei zusammenkommen. Erstens: Im Netz suchen ist nicht lokal. Was der Agent sucht, verlässt deinen Rechner — das ist der Sinn einer Suche. Zweitens: Befehle ausführen heißt, dass ein Modell etwas auf deiner Platte tut. Beides kann man wollen. Man sollte es nur wissen, bevor man es benutzt.
Wenn du bei ollama run gemma3:1b bleibst, wie dieser Kurs es zeigt, ändert
sich für dich nichts. Der Kniff besteht darin, zu wissen, dass hinter dem blanken Befehl
inzwischen etwas anderes wartet.
3. Modelle mit -cloud laufen nicht bei dir
Das ist der wichtigste Handgriff dieses Kapitels, und es ist eigentlich eine Warnung. Im Ollama-Verzeichnis stehen neben den normalen Einträgen auch solche:
gpt-oss:20b # lädt herunter, läuft bei dir
gpt-oss:20b-cloud # läuft auf Ollamas ServernSie stehen im selben Verzeichnis, sehen gleich aus und werden gleich gestartet. Der einzige Unterschied ist die Silbe am Ende. Wer sie überliest, schickt seinen Text an einen fremden Rechner — in einem Kurs, dessen ganzer Zweck es ist, genau das zu vermeiden.
Die Cloud-Modelle sind nicht das Problem. Dass sie im selben Regal stehen, ist es.
Es gibt einen zweiten, verlässlicheren Hinweis: Cloud-Modelle verlangen eine Anmeldung bei ollama.com. Wenn dich ein Modell nach einem Konto fragt, ist es keins, das bei dir läuft. Ein örtliches Modell fragt nie nach einem Konto.
Und der Unterschied ist grundsätzlicher, als eine Datenschutzerklärung es sein kann: Ein Anbieter verspricht, deine Eingaben nicht zu behalten. Das ist ein Versprechen. Ein Modell auf deiner Platte kann nichts weggeben — das ist Bauart. Versprechen lassen sich ändern, Bauart nicht.
4. Ein zu großes Modell läuft trotzdem — nur langsamer
Die verbreitete Annahme lautet: Passt das Modell nicht in den Grafikspeicher, geht es nicht. Das stimmt nicht. Es geht, es wird nur langsamer — und wie viel langsamer, lässt sich steuern.
Der Rechner legt den Teil, der nicht auf die Grafikkarte passt, in den normalen Arbeitsspeicher. Man nennt das Auslagern oder, in den Einstellungen, GPU offload. Und daraus folgt ein Handgriff, der viel Geld spart: Statt einer größeren Grafikkarte kaufst du normalen Arbeitsspeicher dazu. Der kostet einen Bruchteil.
| Aufbau | Was läuft | Tempo |
|---|---|---|
| Grafikkarte mit 24 GB, Modell passt hinein | Modelle bis ~24 GB | flott |
| dieselbe Karte, dazu 128 GB normaler Arbeitsspeicher | auch ein 63-GB-Modell | zäh, aber brauchbar |
Die c’t hat genau das gemessen: ein Modell mit 63 Gigabyte auf einer Grafikkarte mit nur 24 Gigabyte, mit dazugekauftem Arbeitsspeicher für rund 500 Euro — rund 14 Token pro Sekunde. Das reißt keine Bäume aus, aber es läuft, wo vorher gar nichts lief.
Das ist die praktische Seite dessen, was in Kapitel 3 steht: Ohne Grafikkarte ist nicht der Speicher die Grenze, sondern das Tempo. Hier siehst du, dass man zwischen beidem wählen kann — mehr Platz gegen weniger Tempo, und das für wenig Geld.
5. Nicht die Rechenleistung entscheidet, sondern die Datentransferrate
Wenn du wissen willst, ob ein Rechner Sprachmodelle flott abspielt, ist die naheliegende Frage — „wie schnell rechnet er?“ — die falsche. Die richtige lautet: Wie schnell kommt der Speicher hinterher?
Das Modell muss für jedes einzelne Wort einmal komplett durch den Speicher gelesen werden. Der Flaschenhals ist also nicht das Rechnen, sondern das Nachschieben. Die c’t hat dasselbe Modell zweimal laufen lassen:
| Läuft auf | Datentransferrate | Ergebnis |
|---|---|---|
| Grafikkarte (GDDR6X) | rund 1.000 GB/s | über 40 Token/s |
| Hauptprozessor, 16 Kerne (DDR5) | rund 90 GB/s | 3 Token/s |
Elfmal mehr Datentransferrate, dreizehnmal mehr Tempo. Die sechzehn Kerne des Prozessors haben daran fast nichts geändert — sie warten die meiste Zeit.
Ein Nachtrag zur Genauigkeit: Das gilt fürs Ausgeben der Antwort. Beim Einlesen deiner Frage samt Vorgeschichte zählt tatsächlich die Rechenleistung. Wer sehr lange Texte hineingibt, merkt beides — erst eine Denkpause, dann die Ausgabe.
Praktisch heißt das: Eine gebrauchte Grafikkarte mit viel schnellem Speicher schlägt einen neuen Prozessor. Und dass Rechner mit gemeinsamem schnellem Speicher — Apples Bauart und neuerdings auch einige AMD-Geräte — hier gut abschneiden, liegt an derselben Zahl.
6. Dasselbe Modell gibt es in mehreren Stufen
Wenn zwei Modelle 30 und 24 Milliarden Parameter haben, ist das mit 30 dann größer? Nicht unbedingt. Die Dateigröße hängt nicht nur an der Zahl der Parameter, sondern daran, wie genau jeder einzelne gespeichert ist.
Statt jeden Parameter mit voller Genauigkeit abzulegen, wird gerundet — auf acht, vier oder sogar drei Bit. Das spart Platz und bringt Tempo. Rundet man zu grob, wird das Modell schlechter, und zwar auf die unangenehme Art: Es antwortet weiter flüssig, nur falscher.
Die Regel für die Praxis: Nimm die höchste Stufe, die noch in deinen Grafikspeicher passt. Nicht die höchste überhaupt — die läuft dann teilweise im langsamen Speicher und du verlierst mehr Tempo, als du an Güte gewinnst.
Was Quantisierung genau ist, steht in Kapitel 2. Hier zählt nur, dass es sie gibt und dass du eine Wahl hast, wo du vielleicht keine vermutet hättest.
7. Dein Bilderordner, durchsuchbar gemacht
Ein Anwendungsfall, der zeigt, wofür ein örtliches Modell wirklich taugt — und der ohne Bedenken funktioniert, weil kein einziges Bild das Haus verlässt.
Jeder hat einen Ordner voller Bildschirmfotos. Man findet dort nichts wieder, weil die
Dateien Screenshot_2026-03-14_18-22-07.png heißen. Ein Modell, das Bilder
versteht, kann jedes davon beschreiben — und plötzlich ist der Ordner durchsuchbar.
ollama run gemma3:4b "Beschreibe dieses Bild. Nenne
auch den Text, der darauf zu lesen ist." ./Screenshot_2026-03-14.pngFür einen einzelnen Blick genügt das. Der eigentliche Nutzen entsteht, wenn man es über den ganzen Ordner laufen lässt und die Beschreibungen in eine Tabelle schreibt — dann findest du das Bild später über die Suche nach „Rechnung“ oder „Fehlermeldung“.
Zwei Grenzen, die man vorher kennen sollte. Text im Bild lesen ist die Schwäche kleiner Modelle — aus „Gemini“ wird gern „Gemni“. Und je kleiner das Modell, desto mehr Offensichtliches übersieht es. Für Stichwörter reicht es; als Ersatz für eine Texterkennung taugt es nicht.
Wenn du so etwas über viele Dateien laufen lässt: Schreib nach jedem Bild das Ergebnis weg und überspring, was schon in der Tabelle steht. Dann kannst du abbrechen und später weitermachen, ohne von vorn anzufangen. Bei tausend Bildern ist das der Unterschied zwischen brauchbar und ärgerlich.
Warum es hier weniger sind als drüben
Sieben Handgriffe. In den anderen Kursen sind es vierzehn und mehr. Das ist kein Versäumnis, sondern liegt an der Bauart — nur anders, als ich zuerst dachte.
Die ursprüngliche Begründung war: Eine Kommandozeile kann nichts verstecken. Das war zu
schlicht. Richtiger ist: Sie versteckt nichts hinter Knöpfen — aber sie versteckt
sehr wohl durch Entfernung. Die Silbe -cloud steht direkt vor deiner Nase
und ist trotzdem die gefährlichste Falle des ganzen Kurses. Das Auslagern ist nirgends
angeschrieben. Und dass der blanke Befehl seit einem Software-Stand etwas anderes tut, erfährt
man nur, wenn man Änderungsnotizen liest.
Daraus folgt die Gewohnheit für diesen Kurs — und sie ist eine andere als drüben. Dort
heißt sie: einmal im Monat / tippen und die Liste ansehen. Hier gibt es keine
Liste. Hier heißt sie: Vor jedem Aktualisieren einmal nachsehen, was sich geändert
hat. Bei einem Werkzeug, das deine Dateien anfasst und neuerdings ins Netz kann, ist
das keine Neugier, sondern Sorgfalt.
An einer Kommandozeile ist nichts versteckt, hieß es. Das stimmte, solange Ollama nur Modelle startete. Es startet inzwischen mehr.
Du lädst ein Modell aus dem Ollama-Verzeichnis, dessen Name auf <code>-cloud</code> endet. Läuft es auf deinem Rechner?
Nein. Es läuft auf fremden Servern, und dein Text geht dorthin. Der Namenszusatz ist der einzige Hinweis — sonst sieht der Eintrag aus wie jedes andere Modell im selben Verzeichnis.
Kapitel 18 von 20 · Stand: 24.08.2026
Merke
Achtung
In einem Satz