Ollama CLI Cheat Sheet: ls, serve, run, ps + Befehle (2026-Aktualisierung)
Aktualisierte Ollama-Befehlsliste - ls, ps, run, serve usw.
Dieses Ollama-CLI-Cheatsheet konzentriert sich auf die Befehle, die Sie täglich verwenden (ollama ls, ollama serve, ollama run, ollama ps, Modellverwaltung und gängige Workflows), mit Beispielen, die Sie kopieren und einfügen können.
Es enthält auch einen kurzen Abschnitt zu „Performance-Parametern“, um Ihnen zu helfen, OLLAMA_NUM_PARALLEL und verwandte Einstellungen zu entdecken (und anschließend vertieft zu untersuchen).

Dieses Ollama-Cheatsheet konzentriert sich auf CLI-Befehle, Modellverwaltung und Anpassungen. Wir haben hier jedoch auch einige curl-Aufrufe.
Für einen vollständigen Überblick darüber, wo sich Ollama im Vergleich zu lokalen, selbst gehosteten und Cloud-Optionen einordnet – einschließlich vLLM, Docker Model Runner, LocalAI und Cloud-Anbietern – siehe LLM-Hosting: Lokale, selbst gehostete & Cloud-Infrastruktur im Vergleich. Wenn Sie verschiedene lokale LLM-Hosting-Lösungen vergleichen, werfen Sie einen Blick auf unsere umfassende Vergleichsübersicht von Ollama, vLLM, LocalAI, Jan, LM Studio und mehr. Für diejenigen, die Alternativen zu Kommandozeilen-Oberflächen suchen, bietet Docker Model Runner einen anderen Ansatz zur LLM-Bereitstellung. Wenn gleichzeitiger Traffic oder Warteschlangen eine einzelne Ollama-Instanz belasten, erläutert Ollama zu vLLM: Wann Sie Ihren lokalen LLM-Server migrieren sollten die Migrations-Signale und einen gestaffelten Rollout-Plan.
Ollama-Installation (Download und CLI-Installation)
- Option 1: Download von der Website
- Besuchen Sie ollama.com und laden Sie das Installationsprogramm für Ihr Betriebssystem (Mac, Linux oder Windows) herunter.
- Option 2: Installation über die Kommandozeile
- Für Mac- und Linux-Nutzer verwenden Sie den Befehl:
curl -fsSL https://ollama.com/install.sh | sh
- Folgen Sie den Anweisungen auf dem Bildschirm und geben Sie bei Bedarf Ihr Passwort ein.
Ollama-Systemanforderungen (RAM, Speicher, CPU)
- Betriebssystem: Mac, Linux oder Windows
- Arbeitsspeicher (RAM): Mindestens 8 GB, 16 GB oder mehr empfohlen
- Speicher: Mindestens ~10 GB freier Speicherplatz (Modelldateien können sehr groß sein, siehe hier mehr Ollama-Modelle auf anderes Laufwerk verschieben )
- Prozessor: Ein relativ moderner CPU (aus den letzten 5 Jahren). Wenn Sie neugierig darauf sind, wie Ollama verschiedene CPU-Architekturen nutzt, sehen Sie sich unsere Analyse an, wie Ollama Intel-CPU-Leistungs- und Effizienzkerns nutzt.
Für ernsthafte KI-Workloads möchten Sie vielleicht Hardwareoptionen vergleichen. Wir haben NVIDIA DGX Spark vs. Mac Studio vs. RTX-4080-Leistung mit Ollama benchmarkt, und wenn Sie in High-End-Hardware investieren möchten, bietet unsere DGX Spark Preis- und Funktionsvergleich eine detaillierte Kostenanalyse.
Grundlegende Ollama-CLI-Befehle
| Befehl | Beschreibung |
|---|---|
ollama serve |
Startet den Ollama-Server (Standardport 11434). |
ollama run <model> |
Führt das angegebene Modell in einer interaktiven REPL aus. |
ollama pull <model> |
Lädt das angegebene Modell auf Ihr System herunter. |
ollama push <model> |
Lädt ein Modell in das Ollama-Register hoch. |
ollama list |
Listet alle heruntergeladenen Modelle auf. Gleich wie ollama ls. |
ollama ps |
Zeigt aktuell laufende (geladene) Modelle an. |
ollama stop <model> |
Stoppt (entlädt) ein laufendes Modell. |
ollama rm <model> |
Entfernt ein Modell von Ihrem System. |
ollama cp <source> <dest> |
Erstellt lokal eine Kopie eines Modells unter einem neuen Namen. |
ollama show <model> |
Zeigt Details über ein Modell an (Architektur, Parameter, Vorlage usw.). |
ollama create <model> |
Erstellt ein neues Modell aus einer Modelfile. |
ollama launch [integration] |
Zero-Config-Start von KI-Coding-Assistenten (Claude Code, Codex, Droid, OpenCode). |
ollama signin |
Authentifiziert sich beim Ollama-Register (ermöglicht private Modelle und Cloud-Modelle). |
ollama signout |
Meldet sich vom Ollama-Register ab. |
ollama help |
Bietet Hilfe zu jedem Befehl. |
Sprunglinks: Ollama serve-Befehl · Ollama launch-Befehl · Ollama run-Befehl · Ollama run-Flags · Ollama ps-Befehl · Ollama show-Befehl · Ollama signin · Ollama CLI-Grundlagen · Performance-Parameter (OLLAMA_NUM_PARALLEL) · Tiefenblick parallele Anfragen
Ollama CLI (was es ist)
Ollama CLI ist die Kommandozeilenschnittstelle zur Verwaltung von Modellen und zum lokalen Ausführen/Bereitstellen derselben. Die meisten Workflows reduzieren sich auf:
- Server starten:
ollama serve - Modell ausführen:
ollama run <model> - Sehen, was geladen/läuft:
ollama ps - Modelle verwalten:
ollama pull,ollama list,ollama rm
Ollama-Modellverwaltung: pull- und list-Modelle-Befehle
Modelle auflisten:
ollama list
das Gleiche wie:
ollama ls
Dieser Befehl listet alle Modelle auf, die auf Ihr System heruntergeladen wurden, zusammen mit ihren Dateigrößen auf Ihrer HDD/SSD, wie zum Beispiel:
$ ollama ls
NAME ID SIZE MODIFIED
deepseek-r1:8b 6995872bfe4c 5.2 GB 2 weeks ago
gemma3:12b-it-qat 5d4fa005e7bb 8.9 GB 2 weeks ago
LoTUs5494/mistral-small-3.1:24b-instruct-2503-iq4_NL 4e994e0f85a0 13 GB 3 weeks ago
dengcao/Qwen3-Embedding-8B:Q4_K_M d3ca2355027f 4.7 GB 4 weeks ago
dengcao/Qwen3-Embedding-4B:Q5_K_M 7e8c9ad6885b 2.9 GB 4 weeks ago
qwen3:8b 500a1f067a9f 5.2 GB 5 weeks ago
qwen3:14b bdbd181c33f2 9.3 GB 5 weeks ago
qwen3:30b-a3b 0b28110b7a33 18 GB 5 weeks ago
devstral:24b c4b2fa0c33d7 14 GB 5 weeks ago
Ein Modell herunterladen: ollama pull
ollama pull mistral-nemo:12b-instruct-2407-q6_K
Dieser Befehl lädt das angegebene Modell (z. B. Gemma 2B oder mistral-nemo:12b-instruct-2407-q6_K) auf Ihr System herunter. Die Modelldateien können sehr groß sein, daher sollten Sie den von den Modellen auf der Festplatte oder SSD belegten Speicher im Auge behalten. Sie möchten vielleicht sogar alle Ollama-Modelle von Ihrem Home-Verzeichnis auf ein größeres und besseres Laufwerk verschieben
Ein Modell hochladen: ollama push
ollama push my-custom-model
Lädt ein lokales Modell in das Ollama-Register hoch, damit andere es herunterladen können.
Sie müssen sich zuerst anmelden (ollama signin) und der Modellname muss mit Ihrem Ollama-Benutzernamen beginnen, z. B. myuser/my-model.
Verwenden Sie --insecure, wenn Sie an ein privates Register über HTTP hochladen:
ollama push myuser/my-model --insecure
Ein Modell kopieren: ollama cp
ollama cp llama3.2 my-llama3-variant
Erstellt eine lokale Kopie eines Modells unter einem neuen Namen, ohne etwas erneut herunterzuladen. Dies ist nützlich, bevor Sie eine Modelfile bearbeiten — kopieren Sie zuerst, passen Sie die Kopie an und behalten Sie das Original intakt:
ollama cp qwen3:14b qwen3-14b-custom
ollama create qwen3-14b-custom -f ./Modelfile
Ollama show-Befehl
ollama show gibt Informationen über ein heruntergeladenes Modell aus.
ollama show qwen3:14b
Standardmäßig gibt es die Modellkarte aus (Architektur, Kontextlänge, Einbettungslänge, Quantisierung usw.). Es gibt drei nützliche Flags:
| Flag | Was es anzeigt |
|---|---|
--modelfile |
Die vollständige Modelfile, die zum Erstellen des Modells verwendet wurde (FROM, SYSTEM, TEMPLATE, PARAMETER-Zeilen) |
--parameters |
Nur den Parameterblock (z. B. num_ctx, temperature, stop-Tokens) |
--verbose |
Erweiterte Metadaten einschließlich Tensorformen und Layer-Anzahl |
# Sehen Sie genau, mit welchem System-Prompt und Template ein Modell erstellt wurde
ollama show deepseek-r1:8b --modelfile
# Überprüfen Sie die Größe des Kontextfensters und andere Inferenzparameter
ollama show qwen3:14b --parameters
# Vollständige Tensor-Ebene-Details (nützlich beim Debuggen der Quantisierung)
ollama show llama3.2 --verbose
Die --modelfile-Ausgabe ist besonders nützlich, bevor Sie ein Modell anpassen: Sie können die Basis-Modelfile kopieren und von dort aus bearbeiten, anstatt eine von Grund auf neu zu schreiben.
Ollama serve-Befehl
ollama serve startet den lokalen Ollama-Server (Standard-HTTP-Port 11434).
ollama serve
“ollama serve”-Befehl (systemd-freundliches Beispiel):
# setze Umgebungsvariablen, dann starte den Server
# mache ollama auf der IP-Adresse des Hosts verfügbar
export OLLAMA_HOST=0.0.0.0:11434
export OLLAMA_NUM_PARALLEL=2
ollama serve
Ollama run-Befehl
Ein Modell ausführen:
ollama run gpt-oss:20b
Dieser Befehl startet das angegebene Modell und öffnet eine interaktive REPL zur Interaktion. Möchten Sie verstehen, wie Ollama mehrere gleichzeitige Anfragen verwaltet? Erfahren Sie mehr darüber in unserer detaillierten Analyse wie Ollama parallele Anfragen handhabt.
ollama run führt ein Modell in einer interaktiven Sitzung aus,
daher würden Sie im Fall von gpt-oss:120b etwas wie Folgendes sehen:
$ ollama run gpt-oss:120b
>>> Senden Sie eine Nachricht (/? für Hilfe)
Sie können Ihre Fragen oder Befehle eingeben und das Modell wird antworten.
>>> wer sind Sie?
Denken...
Der Benutzer fragt "wer sind Sie?" Einfache Frage. Sollte als ChatGPT, ein KI-Sprachmodell, trainiert von OpenAI, antworten,
usw. Bieten Sie eine kurze Einführung an. Fragen Sie wahrscheinlich, ob sie Hilfe benötigen.
...fertig mit dem Denken.
Ich bin ChatGPT, ein KI-Sprachmodell, erstellt von OpenAI. Ich wurde auf einer breiten Palette von Texten trainiert, damit ich helfen kann,
Fragen zu beantworten, Ideen zu brainstormen, Konzepte zu erklären, Texte zu entwerfen, Probleme zu beheben und vieles mehr. Denken
Sie an mich als einen vielseitigen virtuellen Assistenten – hier, um Informationen, Unterstützung und Gespräche zu bieten, wann immer Sie sie brauchen.
Wie kann ich Ihnen heute helfen?
>>> Senden Sie eine Nachricht (/? für Hilfe)
Um die interaktive Ollama-Sitzung zu beenden, drücken Sie Strg+D, oder Sie können /bye eingeben, das gleiche Ergebnis:
>>> /bye
$
Ollama run-Befehlsbeispiele
Um ein Modell auszuführen und eine einzelne Frage im nicht-interaktiven Modus zu stellen:
printf "Gib mir 10 Bash-One-Liner für die Log-Analyse.\n" | ollama run llama3.2
Wenn Sie detaillierte verbose LLM-Antworten in der Ollama-Sitzung sehen möchten – führen Sie das Modell mit --verbose oder -v Parameter aus:
$ ollama run gpt-oss:20b --verbose
>>> wer sind Sie?
Denken...
Wir müssen auf eine einfache Frage antworten: "wer sind Sie?" Der Benutzer fragt "wer sind Sie?" Wir können antworten, dass wir
ChatGPT, ein großes Sprachmodell, trainiert von OpenAI, sind. Wir können auch Fähigkeiten erwähnen. Der Benutzer erwartet wahrscheinlich
eine kurze Einführung. Wir halten es freundlich.
...fertig mit dem Denken.
Ich bin ChatGPT, ein großes Sprachmodell, erstellt von OpenAI. Ich bin hier, um Fragen zu beantworten, Erklärungen anzubieten,
Ideen zu brainstormen und über eine breite Palette von Themen zu chatten – von Wissenschaft und Geschichte bis hin zu kreativem Schreiben
und alltäglichen Ratschlägen. Sagen Sie mir einfach, worüber Sie sprechen möchten!
Gesamtlaufzeit: 1.118585707s
Ladezeit: 106.690543ms
Prompt-Auswertungsanzahl: 71 Token(s)
Prompt-Auswertungsdauer: 30.507392ms
Prompt-Auswertungsrate: 2327.30 Token/s
Auswertungsanzahl: 132 Token(s)
Auswertungsdauer: 945.801569ms
Auswertungsrate: 139.56 Token/s
>>> /bye
$
Ja, das stimmt, es sind 139 Token pro Sekunde. Das gpt-oss:20b ist sehr schnell. Wenn Sie, wie ich, eine GPU mit 16GB VRAM haben – sehen Sie sich die Details der LLM-Geschwindigkeitsvergleichs in Beste LLMs für Ollama auf 16GB VRAM GPU an.
Tipp: Wenn Sie das Modell über HTTP für mehrere Apps verfügbar machen möchten, starten Sie den Server mit ollama serve und verwenden Sie den API-Client anstelle langer interaktiver Sitzungen.
Ollama run-Flags (vollständige Referenz)
| Flag | Beschreibung |
|---|---|
--verbose / -v |
Drucke Timing-Statistiken (Token/s, Ladezeit usw.) nach jeder Antwort |
-p, --parameters |
Übergabe von Modellparametern inline ohne eine Modelfile (siehe unten) |
--format string |
Erzwingen eines bestimmten Ausgabeformats, z. B. json |
--nowordwrap |
Deaktivieren Sie das automatische Umbruch von Wörtern – nützlich beim Pipe von Ausgaben zu Skripten |
--insecure |
Erlaube die Verbindung zu einem Register über HTTP (für private/selbst gehostete Register) |
Modellparameter überschreiben ohne eine Modelfile (-p / –parameters)
Das -p-Flag ermöglicht es Ihnen, Inferenzparameter zur Laufzeit zu ändern, ohne eine Modelfile zu erstellen.
Sie können mehrere -p-Flags stapeln:
# Erhöhen Sie das Kontextfenster und senken Sie die Temperatur
ollama run qwen3:14b -p num_ctx=32768 -p temperature=0.5
# Führen Sie eine Coding-Aufgabe mit deterministischer Ausgabe aus
ollama run devstral:24b -p temperature=0 -p num_ctx=65536
Gängige Parameter, die Sie auf diese Weise festlegen können:
| Parameter | Effekt |
|---|---|
num_ctx |
Kontextfenstergröße in Tokens (Standard ist modellabhängig, oft 2048–4096) |
temperature |
Zufälligkeit: 0 = deterministisch, 1 = kreativ |
top_p |
Nukleus-Sampling-Schwelle |
top_k |
Beschränkt den Wortschatz auf die Top-K Tokens |
num_predict |
Maximale zu generierende Tokens (-1 = unbegrenzt) |
repeat_penalty |
Strafe für wiederholte Tokens |
Mehrzeilige Eingabe in der REPL
Umgeben Sie Text mit doppelten Anführungszeichen ("""), um einen mehrzeiligen Prompt einzugeben, ohne ihn vorzeitig zu übermitteln:
>>> """Fasse dies in einem Satz zusammen:
... Der schnelle braune Fuchs springt über den faulen Hund.
... Es geschah an einem Dienstag.
... """
Multimodale Modelle (Bilder)
Für visionsfähige Modelle (z. B. gemma3, llava) übergeben Sie einen Bildpfad direkt im Prompt:
ollama run gemma3 "Was ist in diesem Bild? /home/user/screenshot.png"
Generieren von Einbettungen über die CLI
Einbettungsmodelle geben ein JSON-Array statt Text aus. Pipe-Text direkt für schnelle einmalige Einbettungen:
echo "Hallo Welt" | ollama run nomic-embed-text
Für Produktions-Einbettungs-Workloads verwenden Sie den /api/embeddings REST-Endpunkt oder den Python-Client.
Erzwingen von JSON-Ausgabe (–format)
ollama run llama3.2 --format json "Liste 5 Hauptstädte als JSON auf"
Das Modell wird angewiesen, gültiges JSON zurückzugeben. Nützlich beim Pipe von Ausgaben zu jq oder einem Skript, das strukturierte Daten erwartet.
Ollama stop-Befehl
Dieser Befehl stoppt das angegebene laufende Modell.
ollama stop llama3.1:8b-instruct-q8_0
Ollama entlädt Modelle automatisch nach einiger Zeit.
Sie können diese Zeit angeben, standardmäßig sind es 4 Minuten.
Wenn Sie nicht die restliche Zeit warten möchten, möchten Sie vielleicht diesen ollama stop-Befehl verwenden.
Sie können das Modell auch aus dem VRAM werfen, indem Sie den /generate API-Endpunkt mit dem Parameter keep_alive=0 aufrufen, siehe unten für die Beschreibung und ein Beispiel.
Ollama ps-Befehl
ollama ps zeigt aktuell laufende Modelle und Sitzungen an (nützlich, um zu debuggen, „warum ist mein VRAM voll?“).
ollama ps
Das Beispiel der ollama ps-Ausgabe ist unten:
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b 17052f91a42e 14 GB 100% GPU 4096 4 minutes from now
Sie sehen hier auf meinem PC, dass gpt-oss:20b sehr gut in die 16GB VRAM meiner GPU passt und nur 14GB belegt.
Wenn ich ollama run gpt-oss:120b ausführe und dann ollama ps aufrufe, wird das Ergebnis nicht so positiv sein:
78% der Layer sind auf der CPU, und das nur mit dem Kontextfenster von 4096 Tokens. Es wird mehr sein, wenn ich den Kontext erhöhen muss.
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b a951a23b46a1 66 GB 78%/22% CPU/GPU 4096 4 minutes from now
Ollama launch-Befehl (KI-Coding-Integrationen)
ollama launch ist ein Befehl, der in Ollama v0.15 (Januar 2026) eingeführt wurde und Ihnen Zero-Config, One-Line-Setup für beliebte KI-Coding-Assistenten bietet, die gegen Ihren lokalen Ollama-Server laufen.
Warum ollama launch verwenden?
Bevor ollama launch existierte, bedeutete das Anbinden eines Coding-Agenten wie Claude Code oder Codex an ein lokales Ollama-Backend, manuell Umgebungsvariablen zu setzen, das Tool auf den richtigen API-Endpunkt zu zeigen und ein kompatibles Modell auszuwählen. ollama launch erledigt all das für Sie interaktiv.
Wenn Sie Ollama bereits lokal ausführen und einen agentic Coding-Assistenten möchten, ohne für API-Aufrufe zu zahlen oder Code in die Cloud zu senden, ist ollama launch der schnellste Weg dorthin.
Unterstützte Integrationen
| Integration | Was es ist |
|---|---|
claude |
Anthropics Claude Code — agentic Coding-Assistent |
codex |
OpenAIs Codex CLI Coding-Assistent |
droid |
Factorys AI Coding-Agent |
opencode |
Open-Source Coding-Assistent |
Grundlegende Verwendung
# Interaktiver Picker — Wählen Sie eine Integration aus einem Menü
ollama launch
# Starten Sie eine bestimmte Integration direkt
ollama launch claude
# Starten mit einem bestimmten Modell
ollama launch claude --model qwen3-coder
# Konfigurieren Sie die Integration, ohne sie zu starten (nützlich, um Einstellungen zu inspizieren)
ollama launch droid --config
Empfohlene Modelle
Coding-Agenten benötigen ein langes Kontextfenster, um den Kontext ganzer Dateien und den Verlauf mehrerer Gesprächsrunden zu halten. Ollama empfiehlt Modelle mit mindestens 64.000 Tokens Kontext:
| Modell | Hinweise |
|---|---|
qwen3-coder |
Starke Coding-Leistung, langer Kontext, läuft lokal |
glm-4.7-flash |
Schnelle lokale Option |
devstral:24b |
Mistrals coding-fokussiertes Modell |
Wenn Ihre GPU das Modell nicht fassen kann, bietet Ollama auch cloud-gehostete Varianten (z. B. qwen3-coder:480b-cloud), die auf die gleiche Weise integriert werden, aber die Inferenz an Ollamas Cloud-Tier weiterleiten — erfordert ollama signin.
Beispiel: Lokales Ausführen von Claude Code mit Ollama
# 1. Stellen Sie sicher, dass das Modell verfügbar ist
ollama pull qwen3-coder
# 2. Starten Sie Claude Code dagegen
ollama launch claude --model qwen3-coder
Ollama setzt die notwendigen Umgebungsvariablen und startet Claude Code, das automatisch auf http://localhost:11434 zeigt.
Sie können dann Claude Code genau so verwenden, wie Sie es normalerweise würden – der einzige Unterschied ist, dass die Inferenz auf Ihrer eigenen Hardware stattfindet.
Performance-Parameter (OLLAMA_NUM_PARALLEL)
Wenn Sie Warteschlangen oder Timeouts unter Last sehen, ist der erste Parameter, den Sie lernen sollten, OLLAMA_NUM_PARALLEL.
OLLAMA_NUM_PARALLEL= wie viele Anfragen Ollama parallel ausführt.- Ein höherer Wert kann den Durchsatz erhöhen, kann jedoch den VRAM-Druck und Latenzspitzen erhöhen.
Schnelles Beispiel:
OLLAMA_NUM_PARALLEL=2 ollama serve
Für eine vollständige Erklärung (einschließlich Tuning-Strategien und Fehlermodi) siehe:
Freigeben des Ollama-Modells aus dem VRAM (keep_alive)
Wenn ein Modell in den VRAM (GPU-Speicher) geladen wird, bleibt es dort, auch nachdem Sie damit fertig sind. Um ein Modell explizit aus dem VRAM freizugeben und GPU-Speicher zu befreien, können Sie eine Anfrage an die Ollama-API mit keep_alive: 0 senden.
- Modell aus VRAM freigeben mit curl:
curl http://localhost:11434/api/generate -d '{"model": "MODELNAME", "keep_alive": 0}'
Ersetzen Sie MODELNAME durch Ihren tatsächlichen Modellnamen, zum Beispiel:
curl http://localhost:11434/api/generate -d '{"model": "qwen3:14b", "keep_alive": 0}'
- Modell aus VRAM freigeben mit Python:
import requests
response = requests.post(
'http://localhost:11434/api/generate',
json={'model': 'qwen3:14b', 'keep_alive': 0}
)
Dies ist besonders nützlich, wenn:
- Sie GPU-Speicher für andere Anwendungen freigeben müssen
- Sie mehrere Modelle ausführen und die VRAM-Nutzung verwalten möchten
- Sie mit der Verwendung eines großen Modells fertig sind und Ressourcen sofort freigeben möchten
Hinweis: Der keep_alive-Parameter steuert, wie lange (in Sekunden) ein Modell nach der letzten Anfrage im Speicher geladen bleibt. Das Setzen auf 0 entlädt das Modell sofort aus dem VRAM.
Wenn Sie Ollamas Abstraktionsschicht vollständig vermeiden und direkte Kontrolle darüber haben möchten, welches GGUF-Modell zu jedem Zeitpunkt resident ist, deckt llama-server Router-Modus den nativen llama.cpp-Ansatz zur dynamischen Modellumschaltung ab.
Anpassen von Ollama-Modellen (System-Prompt, Modelfile)
-
System-Prompt festlegen: Innerhalb der Ollama-REPL können Sie einen System-Prompt festlegen, um das Verhalten des Modells anzupassen:
>>> /set system Beantworten Sie alle gestellten Fragen in plain English und vermeiden Sie technischen Jargon so weit wie möglich >>> /save ipe >>> /byeDann führen Sie das angepasste Modell aus:
ollama run ipeDies setzt einen System-Prompt und speichert das Modell für die zukünftige Verwendung.
-
Benutzerdefinierte Modelldatei erstellen: Erstellen Sie eine Textdatei (z. B.
custom_model.txt) mit der folgenden Struktur:FROM llama3.1 SYSTEM [Ihre benutzerdefinierten Anweisungen hier]Dann führen Sie aus:
ollama create mymodel -f custom_model.txt ollama run mymodelDies erstellt ein benutzerdefiniertes Modell basierend auf den Anweisungen in der Datei.
Ollama signin und signout (Register-Authentifizierung)
ollama signin
ollama signout
ollama signin authentifiziert Ihre lokale Ollama-Installation mit dem Ollama-Register bei ollama.com. Sobald Sie angemeldet sind, speichert der Client die Anmeldeinformationen lokal und verwendet sie automatisch für nachfolgende Befehle.
Was signin freischaltet:
- Herunterladen und Hochladen privater Modelle von Ihrem Konto oder Ihrer Organisation.
- Verwendung cloud-gehosteter Modelle (z. B.
qwen3-coder:480b-cloud), die zu groß sind, um lokal ausgeführt zu werden. - Veröffentlichen von Modellen im Register mit
ollama push.
Alternative: API-Schlüssel-Authentifizierung
Wenn Sie Ollama in einer CI-Pipeline oder auf einem headless Server ausführen, wo interaktives ollama signin nicht praktikabel ist, erstellen Sie einen API-Schlüssel in Ihren Ollama-Kontoeinstellungen und stellen Sie ihn als Umgebungsvariable bereit:
export OLLAMA_API_KEY=ollama_...
ollama pull myorg/private-model
Die OLLAMA_API_KEY-Variable wird automatisch von jedem Ollama-Befehl und API-Anforderung aufgenommen – kein Bedarf, ollama signin auf jeder Maschine auszuführen.
Verwendung des Ollama run-Befehls mit Dateien (Zusammenfassung, Umleitung)
-
Text aus einer Datei zusammenfassen:
ollama run llama3.2 "Fassen Sie den Inhalt dieser Datei in 50 Wörtern zusammen." < input.txtDieser Befehl fasst den Inhalt von
input.txtmit dem angegebenen Modell zusammen. -
Modell-Antworten in eine Datei protokollieren:
ollama run llama3.2 "Erzählen Sie mir von erneuerbaren Energien." > output.txtDieser Befehl speichert die Antwort des Modells in
output.txt.
Ollama CLI-Anwendungsfälle (Textgenerierung, Analyse)
-
Textgenerierung:
- Zusammenfassen einer großen Textdatei:
ollama run llama3.2 "Fassen Sie den folgenden Text zusammen:" < long-document.txt - Generieren von Inhalten:
ollama run llama3.2 "Schreiben Sie einen kurzen Artikel über die Vorteile der Nutzung von KI im Gesundheitswesen." > article.txt - Beantworten spezifischer Fragen:
ollama run llama3.2 "Was sind die neuesten Trends in der KI und wie werden sie das Gesundheitswesen beeinflussen?"
.
- Zusammenfassen einer großen Textdatei:
-
Datenverarbeitung und -analyse:
- Klassifizieren von Text in positive, negative oder neutrale Sentiments:
ollama run llama3.2 "Analysieren Sie das Sentiment dieser Kundenbewertung: 'Das Produkt ist fantastisch, aber die Lieferung war langsam.'" - Kategorisieren von Text in vordefinierte Kategorien: Verwenden Sie ähnliche Befehle, um Text basierend auf vordefinierten Kriterien zu klassifizieren oder zu kategorisieren.
- Klassifizieren von Text in positive, negative oder neutrale Sentiments:
Verwendung von Ollama mit Python (Client und API)
- Ollama Python-Bibliothek installieren:
pip install ollama - Text mit Python generieren:
Dieses Code-Snippet generiert Text mit dem angegebenen Modell und Prompt.
import ollama response = ollama.generate(model='gemma:2b', prompt='was ist ein Qubit?') print(response['response'])
Für erweiterte Python-Integration erkunden Sie Verwendung von Ollamas Web Search API in Python, die Web-Suchfunktionen, Tool-Calling und MCP-Server-Integration abdeckt. Wenn Sie KI-gestützte Anwendungen entwickeln, kann unser AI Coding Assistants Vergleich Ihnen helfen, die richtigen Tools für die Entwicklung auszuwählen.
Suchen Sie nach einer webbasierten Benutzeroberfläche? Open WebUI bietet eine selbst gehostete Oberfläche mit RAG-Fähigkeiten und Multi-User-Unterstützung. Für hochperformante Produktionsbereitstellungen erwägen Sie vLLM als Alternative. Um Ollama mit anderen lokalen und Cloud-LLM-Infrastruktur-Optionen zu vergleichen, siehe LLM-Hosting: Lokale, selbst gehostete & Cloud-Infrastruktur im Vergleich.
Nützliche Links
Konfiguration und Verwaltung
Alternativen und Vergleiche
- Lokales LLM-Hosting: Umfassender 2026-Leitfaden - Ollama, vLLM, LocalAI, Jan, LM Studio & Mehr
- vLLM Quickstart: Hochperformantes LLM-Serving
- Docker Model Runner vs Ollama: Welches sollten Sie wählen?
- Erste Anzeichen der Ollama-Enshittification
- Ollama zu vLLM: Wann Sie Ihren lokalen LLM-Server migrieren sollten
Leistung und Hardware
- Wie Ollama parallele Anfragen handhabt
- Wie Ollama Intel-CPU-Leistungs- und Effizienzkerns nutzt
- NVIDIA DGX Spark vs Mac Studio vs RTX-4080: Ollama-Leistungsvergleich
- DGX Spark vs. Mac Studio: Ein praktischer, preisgeprüfter Blick auf NVIDIAs persönliche KI-Supercomputer
Integration und Entwicklung
- Verwendung der Ollama Web Search API in Python
- AI Coding Assistants Vergleich
- Open WebUI: Selbst gehostete LLM-Oberfläche
- Open-Source-Chat-UIs für LLMs auf lokalen Ollama-Instanzen
- Einschränken von LLMs mit strukturierter Ausgabe: Ollama, Qwen3 & Python oder Go
- Integration von Ollama mit Python: REST API und Python-Client-Beispiele
- Go SDKs für Ollama - Vergleich mit Beispielen