Zum Inhalt springen
Roland Hecht
Kapitel 18 von 20 — Inhaltsverzeichnis

Lokale KI · Praxis · Kapitel 18 · 9 Min.

Stimmungsbild zum Teil Praxis

Kniffe, die man nicht auf Anhieb findet

Sieben Handgriffe für die lokale KI — einer davon macht das größte Modell zehnmal schneller. Und warum es dieses Kapitel bis vor Kurzem gar nicht geben sollte.

Die anderen Kurse haben dieses Kapitel von Anfang an. Dieser hier bekam bewusst keins, und die Begründung stand fest: An einer Kommandozeile liegt alles offen. Wo keine Oberfläche ist, kann sich nichts verstecken.

Diese Begründung ist überholt — aus zwei Gründen. Der erste ist, dass Ollama inzwischen etwas anderes ist als noch vor einem Jahr. Der zweite ist grundsätzlicher: Nicht das Fehlen eines Knopfes versteckt etwas, sondern die Entfernung. Und Entfernung gibt es hier reichlich — der Handgriff steht in einer Fußnote der Dokumentation, in einem Namenszusatz, oder in einer Voreinstellung, die niemand nennt.

1. Das Denken abschalten, wenn nichts zu denken ist

Das ist der Handgriff mit der größten Wirkung im ganzen Kurs, und man findet ihn nur, wenn man ollama run --help eintippt. Neuere Modelle denken vor dem Antworten — sie erzeugen erst eine lange innere Überlegung, die du nie zu sehen bekommst, und antworten dann. Das ist ab Werk eingeschaltet.

Bei Knobelaufgaben ist das ein Gewinn. Beim Aufräumen von diktiertem Text ist es reine Wartezeit, denn dort gibt es nichts zu überlegen. Auf meinem Gerät gemessen, gleiche Aufgabe, gleiches Modell:

gemma4:e4bZeitWortteileErgebnis
ab Werk93,8 s671richtig
mit --think=false8,9 s45richtig — dasselbe

Zehnmal schneller bei gleichem Ergebnis. Die Antwort ist 45 Wortteile lang; die anderen gut 620 waren Nachdenken über einen Satz, der keins brauchte.

ollama run gemma4:e4b --think=false "Räum diesen Text auf: ..."

Es gibt den Schalter auch in Stufen — statt false kannst du low, medium oder high schreiben, sofern das Modell das kann. Und wenn du das Denken nur nicht sehen, aber behalten willst, gibt es dafür --hidethinking. Das ist etwas anderes: Es versteckt die Ausgabe, spart aber keine Sekunde.

Merke

Die Faustregel: Denken ausschalten, wo du die Antwort selbst schon kennst und nur eine saubere Form willst — Aufräumen, Umformulieren, Übersetzen, Zusammenfassen. Anlassen, wo wirklich etwas zu entscheiden ist. Wer es überall anlässt, wartet den ganzen Tag auf Überlegungen zu Kommasetzung.

Achtung

Woran man merkt, dass ein Modell denkt: Es dauert unerklärlich lange, und in ollama run --verbose steht am Ende eine Zahl erzeugter Wortteile, die viel größer ist als die sichtbare Antwort. Bei mir 671 gegenüber 45 — das Fünfzehnfache. Wenn dir eine Antwort zu lange braucht, ist das der erste Verdacht.

2. Der blanke Befehl ist kein Modellstarter mehr

Zwei Jahre lang war ollama ohne Zusatz nur eine Hilfeausgabe. Man tippte ollama run …, alles andere war Beiwerk. Seit Version 0.32 ist das anders:

ollama

Das startet jetzt einen interaktiven Agenten. Der plaudert nicht nur, sondern kann Code schreiben, Befehle ausführen und im Netz suchen. Aus dem Modellstarter ist eine Arbeitsumgebung geworden — mit demselben Befehl, den du seit zwei Jahren tippst.

Achtung

Zwei Dinge, die dabei zusammenkommen. Erstens: Im Netz suchen ist nicht lokal. Was der Agent sucht, verlässt deinen Rechner — das ist der Sinn einer Suche. Zweitens: Befehle ausführen heißt, dass ein Modell etwas auf deiner Platte tut. Beides kann man wollen. Man sollte es nur wissen, bevor man es benutzt.

Wenn du bei ollama run gemma3:1b bleibst, wie dieser Kurs es zeigt, ändert sich für dich nichts. Der Kniff besteht darin, zu wissen, dass hinter dem blanken Befehl inzwischen etwas anderes wartet.

3. Modelle mit -cloud laufen nicht bei dir

Das ist der wichtigste Handgriff dieses Kapitels, und es ist eigentlich eine Warnung. Im Ollama-Verzeichnis stehen neben den normalen Einträgen auch solche:

gpt-oss:20b          # lädt herunter, läuft bei dir
gpt-oss:20b-cloud    # läuft auf Ollamas Servern

Sie stehen im selben Verzeichnis, sehen gleich aus und werden gleich gestartet. Der einzige Unterschied ist die Silbe am Ende. Wer sie überliest, schickt seinen Text an einen fremden Rechner — in einem Kurs, dessen ganzer Zweck es ist, genau das zu vermeiden.

Die Cloud-Modelle sind nicht das Problem. Dass sie im selben Regal stehen, ist es.

Merke

Es gibt einen zweiten, verlässlicheren Hinweis: Cloud-Modelle verlangen eine Anmeldung bei ollama.com. Wenn dich ein Modell nach einem Konto fragt, ist es keins, das bei dir läuft. Ein örtliches Modell fragt nie nach einem Konto.

Und der Unterschied ist grundsätzlicher, als eine Datenschutzerklärung es sein kann: Ein Anbieter verspricht, deine Eingaben nicht zu behalten. Das ist ein Versprechen. Ein Modell auf deiner Platte kann nichts weggeben — das ist Bauart. Versprechen lassen sich ändern, Bauart nicht.

4. Ein zu großes Modell läuft trotzdem — nur langsamer

Die verbreitete Annahme lautet: Passt das Modell nicht in den Grafikspeicher, geht es nicht. Das stimmt nicht. Es geht, es wird nur langsamer — und wie viel langsamer, lässt sich steuern.

Der Rechner legt den Teil, der nicht auf die Grafikkarte passt, in den normalen Arbeitsspeicher. Man nennt das Auslagern oder, in den Einstellungen, GPU offload. Und daraus folgt ein Handgriff, der viel Geld spart: Statt einer größeren Grafikkarte kaufst du normalen Arbeitsspeicher dazu. Der kostet einen Bruchteil.

AufbauWas läuftTempo
Grafikkarte mit 24 GB, Modell passt hinein Modelle bis ~24 GBflott
dieselbe Karte, dazu 128 GB normaler Arbeitsspeicher auch ein 63-GB-Modellzäh, aber brauchbar

Die c’t hat genau das gemessen: ein Modell mit 63 Gigabyte auf einer Grafikkarte mit nur 24 Gigabyte, mit dazugekauftem Arbeitsspeicher für rund 500 Euro — rund 14 Token pro Sekunde. Das reißt keine Bäume aus, aber es läuft, wo vorher gar nichts lief.

Merke

Das ist die praktische Seite dessen, was in Kapitel 3 steht: Ohne Grafikkarte ist nicht der Speicher die Grenze, sondern das Tempo. Hier siehst du, dass man zwischen beidem wählen kann — mehr Platz gegen weniger Tempo, und das für wenig Geld.

5. Nicht die Rechenleistung entscheidet, sondern die Datentransferrate

Wenn du wissen willst, ob ein Rechner Sprachmodelle flott abspielt, ist die naheliegende Frage — „wie schnell rechnet er?“ — die falsche. Die richtige lautet: Wie schnell kommt der Speicher hinterher?

Das Modell muss für jedes einzelne Wort einmal komplett durch den Speicher gelesen werden. Der Flaschenhals ist also nicht das Rechnen, sondern das Nachschieben. Die c’t hat dasselbe Modell zweimal laufen lassen:

Läuft aufDatentransferrateErgebnis
Grafikkarte (GDDR6X)rund 1.000 GB/süber 40 Token/s
Hauptprozessor, 16 Kerne (DDR5)rund 90 GB/s3 Token/s

Elfmal mehr Datentransferrate, dreizehnmal mehr Tempo. Die sechzehn Kerne des Prozessors haben daran fast nichts geändert — sie warten die meiste Zeit.

Begriff

Ein Nachtrag zur Genauigkeit: Das gilt fürs Ausgeben der Antwort. Beim Einlesen deiner Frage samt Vorgeschichte zählt tatsächlich die Rechenleistung. Wer sehr lange Texte hineingibt, merkt beides — erst eine Denkpause, dann die Ausgabe.

Praktisch heißt das: Eine gebrauchte Grafikkarte mit viel schnellem Speicher schlägt einen neuen Prozessor. Und dass Rechner mit gemeinsamem schnellem Speicher — Apples Bauart und neuerdings auch einige AMD-Geräte — hier gut abschneiden, liegt an derselben Zahl.

6. Dasselbe Modell gibt es in mehreren Stufen

Wenn zwei Modelle 30 und 24 Milliarden Parameter haben, ist das mit 30 dann größer? Nicht unbedingt. Die Dateigröße hängt nicht nur an der Zahl der Parameter, sondern daran, wie genau jeder einzelne gespeichert ist.

Statt jeden Parameter mit voller Genauigkeit abzulegen, wird gerundet — auf acht, vier oder sogar drei Bit. Das spart Platz und bringt Tempo. Rundet man zu grob, wird das Modell schlechter, und zwar auf die unangenehme Art: Es antwortet weiter flüssig, nur falscher.

Merke

Die Regel für die Praxis: Nimm die höchste Stufe, die noch in deinen Grafikspeicher passt. Nicht die höchste überhaupt — die läuft dann teilweise im langsamen Speicher und du verlierst mehr Tempo, als du an Güte gewinnst.

Was Quantisierung genau ist, steht in Kapitel 2. Hier zählt nur, dass es sie gibt und dass du eine Wahl hast, wo du vielleicht keine vermutet hättest.

7. Dein Bilderordner, durchsuchbar gemacht

Ein Anwendungsfall, der zeigt, wofür ein örtliches Modell wirklich taugt — und der ohne Bedenken funktioniert, weil kein einziges Bild das Haus verlässt.

Jeder hat einen Ordner voller Bildschirmfotos. Man findet dort nichts wieder, weil die Dateien Screenshot_2026-03-14_18-22-07.png heißen. Ein Modell, das Bilder versteht, kann jedes davon beschreiben — und plötzlich ist der Ordner durchsuchbar.

ollama run gemma3:4b "Beschreibe dieses Bild. Nenne
auch den Text, der darauf zu lesen ist." ./Screenshot_2026-03-14.png

Für einen einzelnen Blick genügt das. Der eigentliche Nutzen entsteht, wenn man es über den ganzen Ordner laufen lässt und die Beschreibungen in eine Tabelle schreibt — dann findest du das Bild später über die Suche nach „Rechnung“ oder „Fehlermeldung“.

Achtung

Zwei Grenzen, die man vorher kennen sollte. Text im Bild lesen ist die Schwäche kleiner Modelle — aus „Gemini“ wird gern „Gemni“. Und je kleiner das Modell, desto mehr Offensichtliches übersieht es. Für Stichwörter reicht es; als Ersatz für eine Texterkennung taugt es nicht.

Merke

Wenn du so etwas über viele Dateien laufen lässt: Schreib nach jedem Bild das Ergebnis weg und überspring, was schon in der Tabelle steht. Dann kannst du abbrechen und später weitermachen, ohne von vorn anzufangen. Bei tausend Bildern ist das der Unterschied zwischen brauchbar und ärgerlich.

Warum es hier weniger sind als drüben

Sieben Handgriffe. In den anderen Kursen sind es vierzehn und mehr. Das ist kein Versäumnis, sondern liegt an der Bauart — nur anders, als ich zuerst dachte.

Die ursprüngliche Begründung war: Eine Kommandozeile kann nichts verstecken. Das war zu schlicht. Richtiger ist: Sie versteckt nichts hinter Knöpfen — aber sie versteckt sehr wohl durch Entfernung. Die Silbe -cloud steht direkt vor deiner Nase und ist trotzdem die gefährlichste Falle des ganzen Kurses. Das Auslagern ist nirgends angeschrieben. Und dass der blanke Befehl seit einem Software-Stand etwas anderes tut, erfährt man nur, wenn man Änderungsnotizen liest.

Merke

Daraus folgt die Gewohnheit für diesen Kurs — und sie ist eine andere als drüben. Dort heißt sie: einmal im Monat / tippen und die Liste ansehen. Hier gibt es keine Liste. Hier heißt sie: Vor jedem Aktualisieren einmal nachsehen, was sich geändert hat. Bei einem Werkzeug, das deine Dateien anfasst und neuerdings ins Netz kann, ist das keine Neugier, sondern Sorgfalt.

In einem Satz

An einer Kommandozeile ist nichts versteckt, hieß es. Das stimmte, solange Ollama nur Modelle startete. Es startet inzwischen mehr.

Du lädst ein Modell aus dem Ollama-Verzeichnis, dessen Name auf <code>-cloud</code> endet. Läuft es auf deinem Rechner?

Nein. Es läuft auf fremden Servern, und dein Text geht dorthin. Der Namenszusatz ist der einzige Hinweis — sonst sieht der Eintrag aus wie jedes andere Modell im selben Verzeichnis.

Kapitel 18 von 20 · Stand: 24.08.2026