Zum Inhalt springen
Roland Hecht
Kapitel 3 von 20 — Inhaltsverzeichnis

Lokale KI · Grundlagen · Kapitel 3 · 7 Min.

Stimmungsbild zum Teil Grundlagen

Was dein Rechner hergibt

Der ehrliche Rahmen: warum es ohne Grafikkarte zäh wird, was ein Versionssprung daran geändert hat — und warum das größte Modell plötzlich Minuten braucht. Zweimal gemessen, ein Jahr Software dazwischen.

Dieses Kapitel steht mit Absicht vor der Installation. Wer erst einrichtet und dann merkt, dass es zäh läuft, hört nach zwei Tagen wieder auf. Wer es vorher weiß, hat die richtige Erwartung und bleibt dabei.

Der eine Satz

Ein Sprachmodell rechnet auf einer Grafikkarte schnell und auf dem Hauptprozessor langsam. Das ist keine Einstellungssache, das ist Bauart: Eine Grafikkarte macht tausende kleine Rechnungen gleichzeitig, ein Prozessor ein paar wenige nacheinander.

Mein Rechner als Maßstab

Damit die Zahlen weiter unten etwas bedeuten, hier das Gerät, auf dem ich sie gemessen habe. Kein Sonderfall, ein normaler Bürorechner:

TeilWas drin ist
Prozessor4 Kerne, 8 Threads
Arbeitsspeicher30 GB
GrafikAMD Radeon RX Vega 11 — integriert, keine eigene Karte

„Integriert“ heißt: Die Grafikeinheit sitzt im Prozessor mit drin und hat keinen eigenen Speicher. Sie borgt sich Arbeitsspeicher vom Rest des Rechners. Das ist der Normalfall in Bürogeräten und Notebooks ohne Zusatzkarte.

So sieht es ab Werk aus

Ich habe drei Modelle dieselbe Aufgabe rechnen lassen, die ich täglich stelle: einen diktierten Rohtext aufräumen. Kalt heißt, das Modell muss erst von der Platte in den Speicher. Warm heißt, es liegt schon dort.

Gemessen am 24.08.2026 mit Ollama 0.32.15. Die Zahlen in Klammern sind die vom 15.08.2026 mit Version 0.24.0 — warum die danebenstehen, steht gleich darunter.

ModellAuf der PlatteKaltWarmWörter je Sekunde
gemma3:1b815 MB8,6 s (12,1)2,5 s (5,1)rund 14 (12)
gemma3:4b3,3 GB23,4 s (30,8)6,4 s (10,5)rund 6 (5)
gemma4:e4b9,6 GB173,2 s (56,8)185,5 s (9,8)siehe unten

Die ersten beiden Zeilen sind die gute Nachricht: Dieselbe Hardware, dasselbe Modell, dieselbe Aufgabe — und alles ist gut doppelt so schnell geworden. Ich habe dafür nichts getan außer zu aktualisieren. Die dritte Zeile sieht dagegen aus wie ein Unfall. Sie ist keiner, und was dahintersteckt, ist der nützlichste Fund dieses Kapitels.

Warum das größte Modell plötzlich Minuten braucht

gemma4:e4b hat aufgehört, einfach zu antworten. Es denkt jetzt erst nach — und zwar ab Werk, ohne dass man es einschaltet. Für unsere Aufgabe sieht das so aus:

gemma4:e4bZeitErzeugte WortteileAntwort brauchbar?
ab Werk (denkt)93,8 s671ja
mit --think=false8,9 s45ja — dieselbe

Die Antwort ist am Ende 45 Wortteile lang. Die anderen rund 620 sind Nachdenken, das du nie zu sehen bekommst. Zehnmal so lange warten für ein Ergebnis, das sich nicht unterscheidet.

Merke

Denken hilft beim Knobeln — bei Rechenaufgaben, beim Programmieren, bei Fragen mit Haken. Beim Aufräumen von Text hilft es nichts, denn dort ist nichts zu überlegen. Für die tägliche Arbeit dieses Kurses schaltest du es also ab. Wie, steht als Handgriff 1 in Kapitel 18.

Und damit rückt die Tabelle oben gerade: Mit abgeschaltetem Denken liegt das größte Modell bei 8,9 Sekunden — nicht bei 185. Es ist damit wieder ein normales Mitglied der Reihe, nur eben das langsamste.

Zum Vergleich: Ein Mensch liest etwa drei Wörter pro Sekunde laut vor. Das mittlere Modell schreibt also gut doppelt so schnell, wie du lesen kannst. Zum Zuschauen reicht das bequem. Zum Verarbeiten von zwanzig Seiten immer noch nicht.

Der Schalter, den kaum jemand kennt

Ollama kann auch integrierte AMD-Grafik zum Rechnen heranziehen — über eine Schnittstelle namens Vulkan. Sie ist ab Werk ausgeschaltet.

Begriff

Vulkan ist eine herstellerübergreifende Schnittstelle für Grafikkarten. Für uns ist nur eins wichtig: Sie ist der einzige Weg, auf dem eine AMD-Grafikeinheit unter Windows beim Rechnen mithilft. Der übliche Weg heißt CUDA und funktioniert ausschließlich mit NVIDIA-Karten.

Achtung — der Schalter heißt inzwischen anders

Hier stand bis zum 24.08.2026 OLLAMA_VULKAN. Diesen Namen führt Ollama nicht mehr in seiner Liste. Der Schalter, der heute wirkt, heißt OLLAMA_IGPU_ENABLE — sinngemäß „integrierte Grafik zulassen“. Vulkan selbst ist kein Sonderfall mehr; ausgeschlossen wird jetzt die integrierte Grafik, und genau die haben wir hier.

Solange der Schalter aus ist, meldet ollama ps in der Spalte PROCESSOR nüchtern 100% CPU — nichts liegt auf der Grafik. Legst du ihn um, steht dort 100% GPU, und im Protokoll erscheint offloaded 27/27 layers to GPU.

Dieselbe Messung, gleiche Aufgabe, nur der Schalter umgelegt:

ModellWarm ohneWarm mitWortteile je Sekunde
gemma3:1b2,5 s2,5 s18 → 22
gemma3:4b6,4 s5,8 s7,5 → 9,1
gemma4:e4b ohne Denken16,4 s8,9 s—

Und jetzt das Kleingedruckte

Hier stand einmal eine Warnung, und sie ist überholt. Beim Nachmessen gehören beide Hälften erzählt — die alte Beobachtung und was aus ihr geworden ist.

Damals (0.24.0)Heute (0.32.15)
Der Schalter machte das kleine Modell doppelt so schnell (5,1 → 2,4 s) Er bringt beim kleinen Modell gar nichts mehr (2,5 → 2,5 s)
gemma4:e4b lieferte unter Vulkan vier von vier unbrauchbar — englische Endlosschleifen, Kauderwelsch, das ins Vietnamesische kippte Der Fehler ist weg. Sauberes, vollständiges Deutsch — mit und ohne Schalter

Beides hat dieselbe Ursache: Das Programm ist besser geworden. Der Prozessorweg hat so viel aufgeholt, dass er den Vorsprung der Grafik eingeholt hat — was der Schalter früher brachte, bekommst du heute geschenkt. Und der Fehler, vor dem ich gewarnt habe, ist behoben worden.

Merke

Die Warnung von damals war richtig, und ihre Begründung ist es immer noch: Einen solchen Schalter prüft man nach dem Umlegen nach, statt der Geschwindigkeitsanzeige zu glauben. Schneller falsch ist nicht besser. Nur das Beispiel dazu ist abgelaufen — und genau deshalb steht unter jeder Tabelle hier ein Datum und eine Versionsnummer.

Was bleibt für dich? Lohnt sich der Schalter noch? Auf meinem Gerät: für das mittlere Modell knapp (rund 10 % schneller), für das kleine gar nicht, für das große deutlich — aber nur, wenn du ohnehin das Denken abschaltest. Probier ihn aus, miss nach, und wenn er nichts bringt, lass ihn aus. Er ist kein Muss mehr, sondern eine Option.

Fürs Diktat hilft der Schalter gar nicht

Eine Sache, die man leicht durcheinanderbringt: Der Schalter wirkt nur auf Ollama, also auf den Textteil. Die Spracherkennung ist ein anderes Programm und hält sich nicht daran.

Whisper läuft in der Fassung, die alle benutzen, für die schnelle Rechnung ausschließlich über NVIDIA-Bibliotheken. Ohne NVIDIA-Karte gibt es dort keinen Ausweg — kein Vulkan, keine Einstellung, nichts. Das Diktat bleibt auf dem Prozessor.

Bei mir heißt das konkret: 8,1 Sekunden Rechnen für 6,2 Sekunden Gesagtes. Langsamer als Echtzeit. Man spricht einen Satz und wartet dann kurz. Im Alltag stört das weniger, als es sich liest — aber es ist die Wahrheit über das Verfahren.

Die Faustregel

Was auf der Platte liegt, muss beim Rechnen in den Arbeitsspeicher. Ein Modell von 3,3 GB belegt also gut 3,3 GB, dazu etwas Verwaltung. Mit 8 GB Arbeitsspeicher sind kleine und mittlere Modelle machbar, mit 16 GB hast du Luft.

Merke

Nicht der Speicher ist auf einem Rechner ohne Grafikkarte die Grenze, sondern das Tempo. Ein 10-GB-Modell passt bei mir bequem — es ist nur so langsam, dass ich es nicht benutze. Groß genug ist leicht. Schnell genug ist die Kunst.

Was damit geht

Was diese Aufgaben gemeinsam haben: Du wartest ohnehin gerade. Du hast eben zu Ende gesprochen, du legst das Blatt weg, du greifst zur Tasse. Fünf Sekunden fallen da nicht auf.

Was nicht geht

Lokale KI ist nicht die kleine Ausgabe der Cloud. Es ist ein anderes Werkzeug mit einer anderen Stärke: Sie fragt nichts, sie schickt nichts, sie kostet nichts — und sie läuft auch dann, wenn das Netz weg ist.

In einem Satz

Ohne Grafikkarte ist nicht der Speicher die Grenze, sondern das Tempo. Das Modell läuft — es läuft nur langsam.

Warum steht in diesem Kapitel bei jeder Messung dazu, auf welchem Gerät sie entstanden ist?

Weil eine Messung auf einem Rechner keine allgemeine Aussage ist. Dieselbe Einstellung kann auf anderer Hardware das Gegenteil bewirken — deshalb gilt hier eigene Messung mehr als jede Empfehlung.

Kapitel 3 von 20 · Stand: 24.08.2026