Lokale KI · Ollama Schritt für Schritt · Kapitel 7 · 4 Min.
Die Schnittstelle
Der Punkt, an dem Ollama vom Spielzeug zum Bauteil wird — und an dem alles andere in diesem Kurs andockt.
Bis hierher hast du in ein schwarzes Fenster getippt. Das ist nett zum Ausprobieren, aber es ist nicht der Grund, warum sich lokale KI lohnt.
Der Grund ist dieser: Während Ollama läuft, macht es im Hintergrund eine Tür auf. Jedes Programm auf deinem Rechner kann anklopfen und um eine Antwort bitten. Genau daran hängen die beiden Werkzeuge, die in den nächsten Teilen kommen.
Die Adresse
http://localhost:11434localhost heißt „dieser Rechner hier“. Die Zahl dahinter ist die Türnummer. Diese Adresse ist von außen nicht erreichbar — sie existiert nur innerhalb deines Geräts. Was durch diese Tür geht, geht nicht ins Netz.
Ob die Tür offen ist, prüfst du im Browser: Tipp die Adresse ein. Steht dort Ollama is running, läuft alles. Kommt eine Fehlerseite, läuft der Dienst nicht — und dann funktioniert auch kein Werkzeug, das daran hängt.
Merk dir diese Adresse. Wenn irgendwann ein Werkzeug „geht nicht mehr“ sagt, ohne zu sagen warum, ist das der erste Ort zum Nachsehen. Bei mir stand monatelang im Protokoll meines Diktierwerkzeugs die Zeile „Ollama-Prewarm fehlgeschlagen“ — vier von sechs Modi fielen still aus, und ich habe es nicht gemerkt.
Einmal selbst anklopfen
Das geht ohne jedes Programm, direkt aus der PowerShell:
$anfrage = @{
model = "gemma3:4b"
prompt = "Nenne drei Werkzeuge, die auf jede Baustelle gehoeren."
stream = $false
} | ConvertTo-Json
(Invoke-RestMethod -Uri "http://localhost:11434/api/generate" `
-Method Post -Body $anfrage -ContentType "application/json").responseWas zurückkommt, ist die Antwort als Text. Mehr passiert hier nicht — und mehr braucht es auch nicht, um ein eigenes Werkzeug zu bauen. Alles Weitere sind Feinheiten.
Zwei Türen, nicht eine
| Weg | Wofür |
|---|---|
/api/generate | Ein Auftrag, eine Antwort. Kein Gesprächsverlauf. Das Richtige für „räum diesen Text auf“. |
/api/chat | Ein Gespräch mit Rollen und Verlauf. Das Richtige, wenn Vorgeschichte zählt. |
Mein Diktierwerkzeug nimmt den ersten Weg — jedes Diktat steht für sich, eine Vorgeschichte wäre nur Ballast. Mein PDF-Schwärzer nimmt den zweiten und verlangt dabei die Antwort ausdrücklich als strukturierte Daten statt als Fließtext.
Die Stellschrauben
Zusammen mit dem Auftrag kannst du Einstellungen mitschicken. Die fünf, die wirklich etwas ändern:
| Schraube | Was sie tut | Mein Wert |
|---|---|---|
temperature | Wie frei das Modell formuliert. Niedrig = brav und vorhersagbar. | 0.2 |
num_ctx | Größe des Kontextfensters. Größer kostet Speicher. | 2048 |
num_thread | Wieviele Prozessorkerne mitrechnen. | 4 |
num_predict | Obergrenze für die Antwortlänge. Bremse gegen Endlosschleifen. | 800 |
keep_alive | Wie lange das Modell im Speicher bleibt. | 30m |
Bei Aufräumarbeiten willst du temperature niedrig. Das Modell soll nicht
kreativ sein, es soll gehorchen. Bei 0,2 bleibt es dicht am Text; bei 0,8 fängt es an,
Formulierungen zu „verbessern“, die du gar nicht verbessert haben wolltest.
Die wichtigste Schraube heißt keep_alive
Voreingestellt fliegt ein Modell nach fünf Minuten aus dem Speicher. Für ein Werkzeug, das über den Tag verteilt immer wieder kurz gebraucht wird, ist das die schlechteste aller Einstellungen: Du zahlst ständig den Kaltstart.
Bei mir sind das gemessen 30,8 Sekunden kalt gegen 10,5 Sekunden warm. Dreimal so lang, nur weil das Modell zwischendurch entladen wurde.
keep_alive = "30m"Genau das steht in der Einstellung meines Diktierwerkzeugs. Der Preis: Das Modell belegt eine halbe Stunde lang seinen Speicher. Bei 3,3 GB und 30 GB im Rechner ist das ein guter Tausch, bei 8 GB Arbeitsspeicher überlegt man es sich.
Vorwärmen heißt: gleich beim Programmstart eine winzige Anfrage schicken, damit das Modell im Speicher liegt, bevor der Benutzer das erste Mal zuschlägt. Kostet einmal Wartezeit im Hintergrund und spart sie danach jedes Mal.
Warum dieses Kapitel das Scharnier ist
Alles, was jetzt noch kommt, hängt an dem, was hier steht. Das Diktat schickt Whisper-Text durch diese Tür und bekommt einen aufgeräumten zurück. Der PDF-Schwärzer schickt den Text einer Seite hindurch und bekommt eine Liste von Namen zurück.
Beides sind ein paar Dutzend Zeilen. Der schwierige Teil war nie das Programmieren — er war zu verstehen, dass diese Tür existiert.
Merk dir die Adresse der Schnittstelle. Wenn ein Werkzeug später „geht nicht mehr“ sagt, ohne zu sagen warum, ist sie der erste Ort zum Nachsehen.
Was macht die Schnittstelle aus Ollama mehr als ein Spielzeug?
Dass andere Programme andocken können. Ab da ist das Modell ein Bauteil, das in eigene Abläufe eingebaut werden kann — der Diktierknopf und der Anonymisierer aus diesem Kurs hängen beide daran.
Kapitel 7 von 20 · Stand: 13.08.2026
Merke
In einem Satz