Lokale KI · Am Ball bleiben · Kapitel 20 · 6 Min.
Quellen und Weiterlesen
Woher das Wissen stammt, was ich selbst gemessen habe — und warum eigene Messung hier über der Dokumentation steht.
Was hier steht, ist nicht ausgedacht. Es kommt aus drei Töpfen, und die haben in diesem Kurs eine andere Rangfolge als in den anderen.
Die Rangfolge
- Die eigene Messung. Jede Zeit- und Größenangabe in diesem Kurs stammt von meinem Rechner, mit Datum. Bei lokaler KI hängt alles an der Hardware — eine fremde Zahl sagt über dein Gerät nichts.
- Die offizielle Dokumentation. Für alles, was keine Frage der Hardware ist: Befehle, Einstellungen, Modellangaben.
- Videos und Blogs. Nützlich, um zu sehen, wie andere arbeiten. Als Faktenquelle zu langsam und bei Hardwarefragen fast immer irreführend.
In den anderen Kursen dieser Lernwerkstatt gilt: Bei Widerspruch gewinnt die Dokumentation. Hier gewinnt die Messung. Die Dokumentation sagt dir, was ein Programm kann. Ob es auf deinem Rechner brauchbar ist, sagt dir nur die Stoppuhr.
Und eine vierte Quelle, der ich nicht mehr traue
Beim Schreiben dieses Kurses ist mir etwas Unangenehmes aufgefallen. Meine eigenen Notizen neben dem eigenen Code waren an drei Stellen falsch:
| In meinen Notizen stand | Im Code stand |
|---|---|
| Halluzinations-Filter fehlt noch | war längst eingebaut |
| Zwischenablage wird überschrieben | wurde längst zurückgeschrieben |
| Sprachmodell-Schicht noch nicht aktiviert | war gebaut und lief |
Alle drei Notizen waren zum Zeitpunkt des Schreibens richtig. Der Code ist danach weitergegangen, die Notiz nicht. Für diesen Kurs habe ich deshalb im Quelltext nachgesehen, nicht in der Beschreibung daneben.
Das gilt auch für alles, was du im Netz zu diesen Werkzeugen liest — einschließlich dieser Seite. Eine Anleitung ist eine Momentaufnahme. Unten auf jeder Kapitelseite steht ein Datum. Ist es älter als das, was dein Bildschirm sagt, glaub deinem Bildschirm.
Die offiziellen Seiten
| Wofür | Wo |
|---|---|
| Ollama — Herunterladen, Befehle, Einstellungen | docs.ollama.com |
| Ollama — welche Grafikkarten unterstützt werden | docs.ollama.com/gpu |
| Modelle mit Größen und Kontextfenster | ollama.com/library |
| faster-whisper — Modellstufen und Einstellungen | github.com/SYSTRAN/faster-whisper |
| Whisper — die Modelltabelle im Original | github.com/openai/whisper |
Was ich wo gemessen habe
Alle Zahlen dieses Kurses stammen von einem Gerät mit vier Kernen, 30 GB Arbeitsspeicher und integrierter AMD-Grafik (Ryzen 5 3400G, Radeon Vega 11).
Zwei Messreihen: die erste am 15.08.2026 mit Ollama 0.24.0, die zweite am 24.08.2026 mit Ollama 0.32.15. Wo beide vorliegen, stehen sie nebeneinander — die alte in Klammern. Das ist Absicht: Der Vergleich sagt mehr als jede Einzelmessung.
| Angabe | Steht in |
|---|---|
| Modelle mit und ohne Grafikbeschleunigung | Kapitel 3 — neu gemessen |
Denken an und aus bei gemma4:e4b | Kapitel 3 und 18 — neu |
| Der verschluckte Halbsatz beim kleinen Modell | Kapitel 4 — bestätigt |
| Erkennungsdauer beim Diktat | Kapitel 9 |
| Dauer der vier Umschreib-Modi | Kapitel 11 |
| Schwärzung: 11 von 11 gegen 0 von 11 | Kapitel 13 |
| Wer welchen Treffer gefunden hat | Kapitel 14 |
Wenn du dieselben Messungen auf deinem Rechner machst, werden andere Zahlen herauskommen. Das ist kein Widerspruch — das ist der Punkt.
Fremde Messungen, die ich übernommen habe
Kapitel 18 enthält Zahlen, die nicht von meinem Gerät stammen — mein Rechner kann sie gar nicht erzeugen, weil ihm die Grafikkarte dafür fehlt. Sie stammen aus einem Test der c’t und stehen hier, weil sie einen Zusammenhang zeigen, den ich sonst nur behaupten könnte:
| Übernommene Angabe | Steht in |
|---|---|
| 40 gegen 3 Token/s — Grafikkarte gegen Prozessor | Kapitel 18, Handgriff 5 |
| 63-GB-Modell auf einer 24-GB-Karte, rund 14 Token/s | Kapitel 18, Handgriff 4 |
Nach der Rangfolge oben ist das eine Stufe schlechter als eigene Messung. Sie stehen trotzdem drin, weil sie eine Größenordnung zeigen und nicht eine Empfehlung geben — und weil klar dabeisteht, woher sie kommen. Wenn du eine Grafikkarte hast: Miss nach und glaub mir nicht.
Die Videos, aus denen Kapitel 18 entstanden ist
- Ein deutschsprachiges Video über 22 Minuten zu lokaler KI und Hardware. Die beste der drei Quellen — daher die beiden Messungen oben und der Zusammenhang mit der Datentransferrate.
- Ein englischsprachiges Video über 8 Minuten zu einer Ollama-Neuerung. Sprecher ist eine KI-Figur, die Versionsnummern durcheinanderbringt — die Sache dahinter stimmte aber, nachgeprüft an den Änderungsnotizen von Ollama. Daraus stammt der Hinweis auf den interaktiven Agenten.
- Ein englischsprachiges Video über 15 Minuten zum Beschriften von Bildern mit einem örtlichen Modell. Der Gedanke ist übernommen, das gezeigte Modell nicht — es ist inzwischen zwei Generationen alt.
Bei allen dreien war dasselbe nötig: nachsehen, was heute gilt. Ein Video ist ein Zeitpunkt, kein Zustand. Das mittlere zeigt es am deutlichsten — die Neuerung war echt, die genannte Versionsnummer gab es nie.
Zwischen den beiden Messreihen liegen acht Ollama-Versionen. Was sich dabei geändert hat, ist lehrreicher als jede einzelne Zahl:
- Doppelt so schnell, ohne Zutun. Dieselbe Hardware, dieselben Modelle — der Prozessorweg hat massiv aufgeholt.
- Ein Schalter hat den Namen gewechselt. Aus
OLLAMA_VULKANwurdeOLLAMA_IGPU_ENABLE. Wer die alte Anleitung befolgt, wundert sich, dass nichts passiert. - Ein Fehler ist verschwunden. Die Warnung vor dem größten Modell unter Vulkan hat sich erledigt.
- Ein neues Verhalten ist dazugekommen. Das größte Modell denkt jetzt ab Werk und wurde dadurch zwanzigmal langsamer.
- Ein Befund hat gehalten. Das kleine Modell verschluckt den Halbsatz weiterhin — in allen vier Läufen.
Vier von fünf Punkten waren nach einem Jahr überholt. Der eine, der blieb, ist der, der von der Größe des Modells handelt und nicht von der Software. Das ist die Faustregel für die Haltbarkeit: Zahlen altern, Bauart nicht.
Wenn du selber messen willst
- Nimm eine Aufgabe, die du wirklich hast.
Nicht „schreib ein Gedicht“. Nimm einen Text, den du kennst, und eine Anweisung, die du auch sonst geben würdest. - Miss kalt und warm getrennt.
Der erste Aufruf nach dem Start ist nicht vergleichbar mit dem zweiten. Beides ist interessant, aber nicht dasselbe. - Prüfe das Ergebnis, nicht die Stoppuhr.
Schneller falsch ist nicht besser. Die Frage ist immer: Steht noch alles drin? - Schreib das Datum dazu.
Sonst weißt du in einem halben Jahr nicht mehr, welche Programmversion das war.
Die anderen Kurse hier
Für die großen Dienste im Netz gibt es in dieser Lernwerkstatt eigene Kurse — einen zu Claude, einen zu ChatGPT. Beide gehen deutlich tiefer, weil dort mehr zu erklären ist.
Wer beides gelesen hat, merkt den Unterschied im Ton. Dort geht es darum, ein mächtiges Werkzeug zu bändigen. Hier darum, aus einem schwachen etwas Nützliches zu bauen. Das ist eine andere Sorte Handwerk, und mir macht sie mehr Spaß.
In den anderen Kursen gewinnt bei Widerspruch die Dokumentation. Hier gewinnt die eigene Messung — weil Tempo von deinem Gerät abhängt, nicht vom Hersteller.
Warum steht in diesem Kurs die eigene Messung über der Dokumentation?
Weil es um Tempo und Speicher auf deinem konkreten Rechner geht. Was der Hersteller angibt, gilt für seine Testbedingungen — was bei dir herauskommt, weiß nur dein Gerät.
Kapitel 20 von 20 · Stand: 24.08.2026
Achtung
Was das Nachmessen ergeben hat
In einem Satz