Lokale KI · Am Ball bleiben · Kapitel 19 · 4 Min.
Glossar A–Z
Jedes Wort aus diesem Kurs in einem Satz. Zum Nachschlagen, wenn es mitten im Tun fehlt.
Alphabetisch. Wenn dir beim Einrichten ein Wort fehlt, ist das die Seite, die du aufmachst.
Anonymisieren — Namen und Nummern aus einem Dokument entfernen und durch Platzhalter ersetzen, damit es weitergegeben werden kann. Nicht dasselbe wie ein schwarzer Balken. → Kapitel 13
beam_size — Bei Whisper: wieviele Deutungsmöglichkeiten geprüft werden, bevor entschieden wird. 1 ist am schnellsten, 5 am genauesten. → Kapitel 9
CUDA — Die Technik, mit der NVIDIA-Grafikkarten rechnen. Whisper nutzt für die schnelle Erkennung ausschließlich diesen Weg — ohne NVIDIA-Karte bleibt es beim Prozessor. → Kapitel 3
Effektive Parameter — Bei Modellen mit „e“ im Namen: Nicht das ganze Modell ist gleichzeitig aktiv. Auf der Platte acht Milliarden, beim Rechnen wirken viereinhalb. → Kapitel 4
Halluzination — Wenn ein Modell etwas erfindet, das plausibel klingt. Bei Whisper besonders auffällig: Stille wird zu „Untertitelung des ZDF, 2020“. → Kapitel 9
Inferenz — Das Ausrechnen einer Antwort. Nicht zu verwechseln mit Training — dein lokales Modell lernt nichts dazu. → Kapitel 2
Integrierte Grafik — Eine Grafikeinheit, die im Prozessor mitsitzt und keinen eigenen Speicher hat. Der Normalfall in Bürogeräten. → Kapitel 3
keep_alive — Wie lange ein Modell nach dem letzten Aufruf im Arbeitsspeicher bleibt. Voreingestellt fünf Minuten; wer das erhöht, spart sich den Kaltstart. → Kapitel 7
Kaltstart — Der erste Aufruf, bei dem das Modell erst von der Festplatte geladen werden muss. Bei mir 12 bis 57 Sekunden je nach Größe. → Kapitel 3
Kontextfenster — Wieviel Text das Modell gleichzeitig vor Augen hat. Kostet lokal Arbeitsspeicher, deshalb klein einstellen statt großzügig. → Kapitel 2
localhost — „Dieser Rechner hier“. Die Adresse localhost:11434 ist
Ollamas Tür und von außen nicht erreichbar. → Kapitel 7
Modell — Eine Datei mit Gewichten. Keine Datenbank, kein Nachschlagewerk — eine Rechenvorschrift für das nächste wahrscheinliche Wort. → Kapitel 2
Modelfile — Eine kleine Textdatei, mit der man einem Modell feste Grundanweisungen und Einstellungen mitgibt und es unter eigenem Namen ablegt. → Kapitel 8
NER — Namenserkennung. Ein spezialisiertes Verfahren, das Personen, Orte und Organisationen im Fließtext findet, wo Suchmuster versagen. → Kapitel 14
num_ctx — Die eingestellte Größe des Kontextfensters. Bei mir 2048, weil mehr nur Speicher kostet. → Kapitel 7
num_predict — Obergrenze für die Antwortlänge. Die Bremse gegen Endlosschleifen. → Kapitel 8
Ollama — Das Programm, das Sprachmodelle auf dem eigenen Rechner laufen lässt und sie anderen Programmen zur Verfügung stellt. → Kapitel 5
OLLAMA_MODELS — Die Einstellung, mit der man den Modellordner auf ein anderes Laufwerk legt. Sollte man setzen, bevor das erste Modell da ist. → Kapitel 5
Parameter — Die Gewichte im Modell. Ihre Anzahl steht im Namen: 4b sind
vier Milliarden. Mehr heißt klüger und langsamer. → Kapitel 2
Prompt — Der Auftrag, den du dem Modell gibst. Bei kleinen Modellen gilt: kurz, hart, eindeutig — und sag, wer spricht. → Kapitel 8
Quantisierung — Die Gewichte werden gröber gespeichert. Deshalb belegt ein Modell mit vier Milliarden Parametern 3,3 statt 16 Gigabyte. → Kapitel 2
Schwärzen — Text aus einer Datei entfernen und ein Rechteck an seine Stelle setzen. Ein bloßes Rechteck darüber ist keine Schwärzung. → Kapitel 13
Stopp-Sequenz — Zeichenfolgen, bei denen das Modell die Antwort sofort beendet. Nützlich, wenn es anfängt, den eigenen Auftrag nachzuplappern. → Kapitel 8
temperature — Wie frei das Modell formuliert. Beim Aufräumen niedrig halten (0,2): Es soll gehorchen, nicht kreativ sein. → Kapitel 7
Token — Ein Textbaustein, etwa ein dreiviertel Wort. Lokal kostet ein Token kein Geld, sondern Zeit. → Kapitel 2
Vorwärmen — Beim Programmstart eine winzige Anfrage schicken, damit das Modell schon im Speicher liegt, wenn der Benutzer zuschlägt. → Kapitel 7
VRAM — Der eigene Speicher einer Grafikkarte. Hat dein Rechner keine eigene Karte, gibt es keinen — Anleitungen mit VRAM-Angaben sind für andere Hardware geschrieben. → Kapitel 2
Vulkan — Eine herstellerübergreifende Schnittstelle für Grafikkarten. Der einzige Weg, auf dem AMD-Grafik unter Windows bei Ollama mitrechnet. Ab Werk aus, und nicht ohne Nebenwirkung. → Kapitel 3
Whisper — Das Modell, das aus gesprochener Sprache Text macht. Braucht kein Training auf deine Stimme. → Kapitel 9
Kapitel 19 von 20 · Stand: 15.08.2026