Ollama CLI Cheat Sheet: ls, serve, run, ps + Befehle (2026-Aktualisierung)

Aktualisierte Ollama-Befehlsliste - ls, ps, run, serve usw.

Inhaltsverzeichnis

Dieses Ollama-CLI-Cheatsheet konzentriert sich auf die Befehle, die Sie täglich verwenden (ollama ls, ollama serve, ollama run, ollama ps, Modellverwaltung und gängige Workflows), mit Beispielen, die Sie kopieren und einfügen können.

Es enthält auch einen kurzen Abschnitt zu „Performance-Parametern“, um Ihnen zu helfen, OLLAMA_NUM_PARALLEL und verwandte Einstellungen zu entdecken (und anschließend vertieft zu untersuchen).

Ollama Cheatsheet

Dieses Ollama-Cheatsheet konzentriert sich auf CLI-Befehle, Modellverwaltung und Anpassungen. Wir haben hier jedoch auch einige curl-Aufrufe.

Für einen vollständigen Überblick darüber, wo sich Ollama im Vergleich zu lokalen, selbst gehosteten und Cloud-Optionen einordnet – einschließlich vLLM, Docker Model Runner, LocalAI und Cloud-Anbietern – siehe LLM-Hosting: Lokale, selbst gehostete & Cloud-Infrastruktur im Vergleich. Wenn Sie verschiedene lokale LLM-Hosting-Lösungen vergleichen, werfen Sie einen Blick auf unsere umfassende Vergleichsübersicht von Ollama, vLLM, LocalAI, Jan, LM Studio und mehr. Für diejenigen, die Alternativen zu Kommandozeilen-Oberflächen suchen, bietet Docker Model Runner einen anderen Ansatz zur LLM-Bereitstellung. Wenn gleichzeitiger Traffic oder Warteschlangen eine einzelne Ollama-Instanz belasten, erläutert Ollama zu vLLM: Wann Sie Ihren lokalen LLM-Server migrieren sollten die Migrations-Signale und einen gestaffelten Rollout-Plan.

Ollama-Installation (Download und CLI-Installation)

  • Option 1: Download von der Website
    • Besuchen Sie ollama.com und laden Sie das Installationsprogramm für Ihr Betriebssystem (Mac, Linux oder Windows) herunter.
  • Option 2: Installation über die Kommandozeile
    • Für Mac- und Linux-Nutzer verwenden Sie den Befehl:
curl -fsSL https://ollama.com/install.sh | sh
  • Folgen Sie den Anweisungen auf dem Bildschirm und geben Sie bei Bedarf Ihr Passwort ein.

Ollama-Systemanforderungen (RAM, Speicher, CPU)

  • Betriebssystem: Mac, Linux oder Windows
  • Arbeitsspeicher (RAM): Mindestens 8 GB, 16 GB oder mehr empfohlen
  • Speicher: Mindestens ~10 GB freier Speicherplatz (Modelldateien können sehr groß sein, siehe hier mehr Ollama-Modelle auf anderes Laufwerk verschieben )
  • Prozessor: Ein relativ moderner CPU (aus den letzten 5 Jahren). Wenn Sie neugierig darauf sind, wie Ollama verschiedene CPU-Architekturen nutzt, sehen Sie sich unsere Analyse an, wie Ollama Intel-CPU-Leistungs- und Effizienzkerns nutzt.

Für ernsthafte KI-Workloads möchten Sie vielleicht Hardwareoptionen vergleichen. Wir haben NVIDIA DGX Spark vs. Mac Studio vs. RTX-4080-Leistung mit Ollama benchmarkt, und wenn Sie in High-End-Hardware investieren möchten, bietet unsere DGX Spark Preis- und Funktionsvergleich eine detaillierte Kostenanalyse.

Grundlegende Ollama-CLI-Befehle

Befehl Beschreibung
ollama serve Startet den Ollama-Server (Standardport 11434).
ollama run <model> Führt das angegebene Modell in einer interaktiven REPL aus.
ollama pull <model> Lädt das angegebene Modell auf Ihr System herunter.
ollama push <model> Lädt ein Modell in das Ollama-Register hoch.
ollama list Listet alle heruntergeladenen Modelle auf. Gleich wie ollama ls.
ollama ps Zeigt aktuell laufende (geladene) Modelle an.
ollama stop <model> Stoppt (entlädt) ein laufendes Modell.
ollama rm <model> Entfernt ein Modell von Ihrem System.
ollama cp <source> <dest> Erstellt lokal eine Kopie eines Modells unter einem neuen Namen.
ollama show <model> Zeigt Details über ein Modell an (Architektur, Parameter, Vorlage usw.).
ollama create <model> Erstellt ein neues Modell aus einer Modelfile.
ollama launch [integration] Zero-Config-Start von KI-Coding-Assistenten (Claude Code, Codex, Droid, OpenCode).
ollama signin Authentifiziert sich beim Ollama-Register (ermöglicht private Modelle und Cloud-Modelle).
ollama signout Meldet sich vom Ollama-Register ab.
ollama help Bietet Hilfe zu jedem Befehl.

Sprunglinks: Ollama serve-Befehl · Ollama launch-Befehl · Ollama run-Befehl · Ollama run-Flags · Ollama ps-Befehl · Ollama show-Befehl · Ollama signin · Ollama CLI-Grundlagen · Performance-Parameter (OLLAMA_NUM_PARALLEL) · Tiefenblick parallele Anfragen

Ollama CLI (was es ist)

Ollama CLI ist die Kommandozeilenschnittstelle zur Verwaltung von Modellen und zum lokalen Ausführen/Bereitstellen derselben. Die meisten Workflows reduzieren sich auf:

  • Server starten: ollama serve
  • Modell ausführen: ollama run <model>
  • Sehen, was geladen/läuft: ollama ps
  • Modelle verwalten: ollama pull, ollama list, ollama rm

Ollama-Modellverwaltung: pull- und list-Modelle-Befehle

Modelle auflisten:

ollama list

das Gleiche wie:

ollama ls

Dieser Befehl listet alle Modelle auf, die auf Ihr System heruntergeladen wurden, zusammen mit ihren Dateigrößen auf Ihrer HDD/SSD, wie zum Beispiel:

$ ollama ls
NAME                                                    ID              SIZE      MODIFIED     
deepseek-r1:8b                                          6995872bfe4c    5.2 GB    2 weeks ago     
gemma3:12b-it-qat                                       5d4fa005e7bb    8.9 GB    2 weeks ago     
LoTUs5494/mistral-small-3.1:24b-instruct-2503-iq4_NL    4e994e0f85a0    13 GB     3 weeks ago     
dengcao/Qwen3-Embedding-8B:Q4_K_M                       d3ca2355027f    4.7 GB    4 weeks ago     
dengcao/Qwen3-Embedding-4B:Q5_K_M                       7e8c9ad6885b    2.9 GB    4 weeks ago     
qwen3:8b                                                500a1f067a9f    5.2 GB    5 weeks ago     
qwen3:14b                                               bdbd181c33f2    9.3 GB    5 weeks ago     
qwen3:30b-a3b                                           0b28110b7a33    18 GB     5 weeks ago     
devstral:24b                                            c4b2fa0c33d7    14 GB     5 weeks ago  

Ein Modell herunterladen: ollama pull

ollama pull mistral-nemo:12b-instruct-2407-q6_K

Dieser Befehl lädt das angegebene Modell (z. B. Gemma 2B oder mistral-nemo:12b-instruct-2407-q6_K) auf Ihr System herunter. Die Modelldateien können sehr groß sein, daher sollten Sie den von den Modellen auf der Festplatte oder SSD belegten Speicher im Auge behalten. Sie möchten vielleicht sogar alle Ollama-Modelle von Ihrem Home-Verzeichnis auf ein größeres und besseres Laufwerk verschieben

Ein Modell hochladen: ollama push

ollama push my-custom-model

Lädt ein lokales Modell in das Ollama-Register hoch, damit andere es herunterladen können. Sie müssen sich zuerst anmelden (ollama signin) und der Modellname muss mit Ihrem Ollama-Benutzernamen beginnen, z. B. myuser/my-model. Verwenden Sie --insecure, wenn Sie an ein privates Register über HTTP hochladen:

ollama push myuser/my-model --insecure

Ein Modell kopieren: ollama cp

ollama cp llama3.2 my-llama3-variant

Erstellt eine lokale Kopie eines Modells unter einem neuen Namen, ohne etwas erneut herunterzuladen. Dies ist nützlich, bevor Sie eine Modelfile bearbeiten — kopieren Sie zuerst, passen Sie die Kopie an und behalten Sie das Original intakt:

ollama cp qwen3:14b qwen3-14b-custom
ollama create qwen3-14b-custom -f ./Modelfile

Ollama show-Befehl

ollama show gibt Informationen über ein heruntergeladenes Modell aus.

ollama show qwen3:14b

Standardmäßig gibt es die Modellkarte aus (Architektur, Kontextlänge, Einbettungslänge, Quantisierung usw.). Es gibt drei nützliche Flags:

Flag Was es anzeigt
--modelfile Die vollständige Modelfile, die zum Erstellen des Modells verwendet wurde (FROM, SYSTEM, TEMPLATE, PARAMETER-Zeilen)
--parameters Nur den Parameterblock (z. B. num_ctx, temperature, stop-Tokens)
--verbose Erweiterte Metadaten einschließlich Tensorformen und Layer-Anzahl
# Sehen Sie genau, mit welchem System-Prompt und Template ein Modell erstellt wurde
ollama show deepseek-r1:8b --modelfile

# Überprüfen Sie die Größe des Kontextfensters und andere Inferenzparameter
ollama show qwen3:14b --parameters

# Vollständige Tensor-Ebene-Details (nützlich beim Debuggen der Quantisierung)
ollama show llama3.2 --verbose

Die --modelfile-Ausgabe ist besonders nützlich, bevor Sie ein Modell anpassen: Sie können die Basis-Modelfile kopieren und von dort aus bearbeiten, anstatt eine von Grund auf neu zu schreiben.

Ollama serve-Befehl

ollama serve startet den lokalen Ollama-Server (Standard-HTTP-Port 11434).

ollama serve

“ollama serve”-Befehl (systemd-freundliches Beispiel):

# setze Umgebungsvariablen, dann starte den Server
# mache ollama auf der IP-Adresse des Hosts verfügbar
export OLLAMA_HOST=0.0.0.0:11434
export OLLAMA_NUM_PARALLEL=2
ollama serve

Ollama run-Befehl

Ein Modell ausführen:

ollama run gpt-oss:20b

Dieser Befehl startet das angegebene Modell und öffnet eine interaktive REPL zur Interaktion. Möchten Sie verstehen, wie Ollama mehrere gleichzeitige Anfragen verwaltet? Erfahren Sie mehr darüber in unserer detaillierten Analyse wie Ollama parallele Anfragen handhabt.

ollama run führt ein Modell in einer interaktiven Sitzung aus, daher würden Sie im Fall von gpt-oss:120b etwas wie Folgendes sehen:

$ ollama run gpt-oss:120b
>>> Senden Sie eine Nachricht (/? für Hilfe)

Sie können Ihre Fragen oder Befehle eingeben und das Modell wird antworten.

>>> wer sind Sie?
Denken...
Der Benutzer fragt "wer sind Sie?" Einfache Frage. Sollte als ChatGPT, ein KI-Sprachmodell, trainiert von OpenAI, antworten,
usw. Bieten Sie eine kurze Einführung an. Fragen Sie wahrscheinlich, ob sie Hilfe benötigen.
...fertig mit dem Denken.

Ich bin ChatGPT, ein KI-Sprachmodell, erstellt von OpenAI. Ich wurde auf einer breiten Palette von Texten trainiert, damit ich helfen kann,
Fragen zu beantworten, Ideen zu brainstormen, Konzepte zu erklären, Texte zu entwerfen, Probleme zu beheben und vieles mehr. Denken
Sie an mich als einen vielseitigen virtuellen Assistenten – hier, um Informationen, Unterstützung und Gespräche zu bieten, wann immer Sie sie brauchen.
Wie kann ich Ihnen heute helfen?

>>> Senden Sie eine Nachricht (/? für Hilfe)

Um die interaktive Ollama-Sitzung zu beenden, drücken Sie Strg+D, oder Sie können /bye eingeben, das gleiche Ergebnis:

>>> /bye
$ 

Ollama run-Befehlsbeispiele

Um ein Modell auszuführen und eine einzelne Frage im nicht-interaktiven Modus zu stellen:

printf "Gib mir 10 Bash-One-Liner für die Log-Analyse.\n" | ollama run llama3.2

Wenn Sie detaillierte verbose LLM-Antworten in der Ollama-Sitzung sehen möchten – führen Sie das Modell mit --verbose oder -v Parameter aus:

$ ollama run gpt-oss:20b --verbose
>>> wer sind Sie?
Denken...
Wir müssen auf eine einfache Frage antworten: "wer sind Sie?" Der Benutzer fragt "wer sind Sie?" Wir können antworten, dass wir
ChatGPT, ein großes Sprachmodell, trainiert von OpenAI, sind. Wir können auch Fähigkeiten erwähnen. Der Benutzer erwartet wahrscheinlich
eine kurze Einführung. Wir halten es freundlich.
...fertig mit dem Denken.

Ich bin ChatGPT, ein großes Sprachmodell, erstellt von OpenAI. Ich bin hier, um Fragen zu beantworten, Erklärungen anzubieten,
Ideen zu brainstormen und über eine breite Palette von Themen zu chatten – von Wissenschaft und Geschichte bis hin zu kreativem Schreiben
und alltäglichen Ratschlägen. Sagen Sie mir einfach, worüber Sie sprechen möchten!

Gesamtlaufzeit:       1.118585707s
Ladezeit:             106.690543ms
Prompt-Auswertungsanzahl:    71 Token(s)
Prompt-Auswertungsdauer: 30.507392ms
Prompt-Auswertungsrate:     2327.30 Token/s
Auswertungsanzahl:           132 Token(s)
Auswertungsdauer:        945.801569ms
Auswertungsrate:            139.56 Token/s
>>> /bye
$ 

Ja, das stimmt, es sind 139 Token pro Sekunde. Das gpt-oss:20b ist sehr schnell. Wenn Sie, wie ich, eine GPU mit 16GB VRAM haben – sehen Sie sich die Details der LLM-Geschwindigkeitsvergleichs in Beste LLMs für Ollama auf 16GB VRAM GPU an.

Tipp: Wenn Sie das Modell über HTTP für mehrere Apps verfügbar machen möchten, starten Sie den Server mit ollama serve und verwenden Sie den API-Client anstelle langer interaktiver Sitzungen.

Ollama run-Flags (vollständige Referenz)

Flag Beschreibung
--verbose / -v Drucke Timing-Statistiken (Token/s, Ladezeit usw.) nach jeder Antwort
-p, --parameters Übergabe von Modellparametern inline ohne eine Modelfile (siehe unten)
--format string Erzwingen eines bestimmten Ausgabeformats, z. B. json
--nowordwrap Deaktivieren Sie das automatische Umbruch von Wörtern – nützlich beim Pipe von Ausgaben zu Skripten
--insecure Erlaube die Verbindung zu einem Register über HTTP (für private/selbst gehostete Register)

Modellparameter überschreiben ohne eine Modelfile (-p / –parameters)

Das -p-Flag ermöglicht es Ihnen, Inferenzparameter zur Laufzeit zu ändern, ohne eine Modelfile zu erstellen. Sie können mehrere -p-Flags stapeln:

# Erhöhen Sie das Kontextfenster und senken Sie die Temperatur
ollama run qwen3:14b -p num_ctx=32768 -p temperature=0.5

# Führen Sie eine Coding-Aufgabe mit deterministischer Ausgabe aus
ollama run devstral:24b -p temperature=0 -p num_ctx=65536

Gängige Parameter, die Sie auf diese Weise festlegen können:

Parameter Effekt
num_ctx Kontextfenstergröße in Tokens (Standard ist modellabhängig, oft 2048–4096)
temperature Zufälligkeit: 0 = deterministisch, 1 = kreativ
top_p Nukleus-Sampling-Schwelle
top_k Beschränkt den Wortschatz auf die Top-K Tokens
num_predict Maximale zu generierende Tokens (-1 = unbegrenzt)
repeat_penalty Strafe für wiederholte Tokens

Mehrzeilige Eingabe in der REPL

Umgeben Sie Text mit doppelten Anführungszeichen ("""), um einen mehrzeiligen Prompt einzugeben, ohne ihn vorzeitig zu übermitteln:

>>> """Fasse dies in einem Satz zusammen:
... Der schnelle braune Fuchs springt über den faulen Hund.
... Es geschah an einem Dienstag.
... """

Multimodale Modelle (Bilder)

Für visionsfähige Modelle (z. B. gemma3, llava) übergeben Sie einen Bildpfad direkt im Prompt:

ollama run gemma3 "Was ist in diesem Bild? /home/user/screenshot.png"

Generieren von Einbettungen über die CLI

Einbettungsmodelle geben ein JSON-Array statt Text aus. Pipe-Text direkt für schnelle einmalige Einbettungen:

echo "Hallo Welt" | ollama run nomic-embed-text

Für Produktions-Einbettungs-Workloads verwenden Sie den /api/embeddings REST-Endpunkt oder den Python-Client.

Erzwingen von JSON-Ausgabe (–format)

ollama run llama3.2 --format json "Liste 5 Hauptstädte als JSON auf"

Das Modell wird angewiesen, gültiges JSON zurückzugeben. Nützlich beim Pipe von Ausgaben zu jq oder einem Skript, das strukturierte Daten erwartet.

Ollama stop-Befehl

Dieser Befehl stoppt das angegebene laufende Modell.

ollama stop llama3.1:8b-instruct-q8_0

Ollama entlädt Modelle automatisch nach einiger Zeit. Sie können diese Zeit angeben, standardmäßig sind es 4 Minuten. Wenn Sie nicht die restliche Zeit warten möchten, möchten Sie vielleicht diesen ollama stop-Befehl verwenden. Sie können das Modell auch aus dem VRAM werfen, indem Sie den /generate API-Endpunkt mit dem Parameter keep_alive=0 aufrufen, siehe unten für die Beschreibung und ein Beispiel.

Ollama ps-Befehl

ollama ps zeigt aktuell laufende Modelle und Sitzungen an (nützlich, um zu debuggen, „warum ist mein VRAM voll?“).

ollama ps

Das Beispiel der ollama ps-Ausgabe ist unten:

NAME           ID              SIZE     PROCESSOR    CONTEXT    UNTIL
gpt-oss:20b    17052f91a42e    14 GB    100% GPU     4096       4 minutes from now

Sie sehen hier auf meinem PC, dass gpt-oss:20b sehr gut in die 16GB VRAM meiner GPU passt und nur 14GB belegt.

Wenn ich ollama run gpt-oss:120b ausführe und dann ollama ps aufrufe, wird das Ergebnis nicht so positiv sein: 78% der Layer sind auf der CPU, und das nur mit dem Kontextfenster von 4096 Tokens. Es wird mehr sein, wenn ich den Kontext erhöhen muss.

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    a951a23b46a1    66 GB    78%/22% CPU/GPU    4096       4 minutes from now

Ollama launch-Befehl (KI-Coding-Integrationen)

ollama launch ist ein Befehl, der in Ollama v0.15 (Januar 2026) eingeführt wurde und Ihnen Zero-Config, One-Line-Setup für beliebte KI-Coding-Assistenten bietet, die gegen Ihren lokalen Ollama-Server laufen.

Warum ollama launch verwenden?

Bevor ollama launch existierte, bedeutete das Anbinden eines Coding-Agenten wie Claude Code oder Codex an ein lokales Ollama-Backend, manuell Umgebungsvariablen zu setzen, das Tool auf den richtigen API-Endpunkt zu zeigen und ein kompatibles Modell auszuwählen. ollama launch erledigt all das für Sie interaktiv.

Wenn Sie Ollama bereits lokal ausführen und einen agentic Coding-Assistenten möchten, ohne für API-Aufrufe zu zahlen oder Code in die Cloud zu senden, ist ollama launch der schnellste Weg dorthin.

Unterstützte Integrationen

Integration Was es ist
claude Anthropics Claude Code — agentic Coding-Assistent
codex OpenAIs Codex CLI Coding-Assistent
droid Factorys AI Coding-Agent
opencode Open-Source Coding-Assistent

Grundlegende Verwendung

# Interaktiver Picker — Wählen Sie eine Integration aus einem Menü
ollama launch

# Starten Sie eine bestimmte Integration direkt
ollama launch claude

# Starten mit einem bestimmten Modell
ollama launch claude --model qwen3-coder

# Konfigurieren Sie die Integration, ohne sie zu starten (nützlich, um Einstellungen zu inspizieren)
ollama launch droid --config

Empfohlene Modelle

Coding-Agenten benötigen ein langes Kontextfenster, um den Kontext ganzer Dateien und den Verlauf mehrerer Gesprächsrunden zu halten. Ollama empfiehlt Modelle mit mindestens 64.000 Tokens Kontext:

Modell Hinweise
qwen3-coder Starke Coding-Leistung, langer Kontext, läuft lokal
glm-4.7-flash Schnelle lokale Option
devstral:24b Mistrals coding-fokussiertes Modell

Wenn Ihre GPU das Modell nicht fassen kann, bietet Ollama auch cloud-gehostete Varianten (z. B. qwen3-coder:480b-cloud), die auf die gleiche Weise integriert werden, aber die Inferenz an Ollamas Cloud-Tier weiterleiten — erfordert ollama signin.

Beispiel: Lokales Ausführen von Claude Code mit Ollama

# 1. Stellen Sie sicher, dass das Modell verfügbar ist
ollama pull qwen3-coder

# 2. Starten Sie Claude Code dagegen
ollama launch claude --model qwen3-coder

Ollama setzt die notwendigen Umgebungsvariablen und startet Claude Code, das automatisch auf http://localhost:11434 zeigt. Sie können dann Claude Code genau so verwenden, wie Sie es normalerweise würden – der einzige Unterschied ist, dass die Inferenz auf Ihrer eigenen Hardware stattfindet.

Performance-Parameter (OLLAMA_NUM_PARALLEL)

Wenn Sie Warteschlangen oder Timeouts unter Last sehen, ist der erste Parameter, den Sie lernen sollten, OLLAMA_NUM_PARALLEL.

  • OLLAMA_NUM_PARALLEL = wie viele Anfragen Ollama parallel ausführt.
  • Ein höherer Wert kann den Durchsatz erhöhen, kann jedoch den VRAM-Druck und Latenzspitzen erhöhen.

Schnelles Beispiel:

OLLAMA_NUM_PARALLEL=2 ollama serve

Für eine vollständige Erklärung (einschließlich Tuning-Strategien und Fehlermodi) siehe:

Freigeben des Ollama-Modells aus dem VRAM (keep_alive)

Wenn ein Modell in den VRAM (GPU-Speicher) geladen wird, bleibt es dort, auch nachdem Sie damit fertig sind. Um ein Modell explizit aus dem VRAM freizugeben und GPU-Speicher zu befreien, können Sie eine Anfrage an die Ollama-API mit keep_alive: 0 senden.

  • Modell aus VRAM freigeben mit curl:
curl http://localhost:11434/api/generate -d '{"model": "MODELNAME", "keep_alive": 0}'

Ersetzen Sie MODELNAME durch Ihren tatsächlichen Modellnamen, zum Beispiel:

curl http://localhost:11434/api/generate -d '{"model": "qwen3:14b", "keep_alive": 0}'
  • Modell aus VRAM freigeben mit Python:
import requests

response = requests.post(
    'http://localhost:11434/api/generate',
    json={'model': 'qwen3:14b', 'keep_alive': 0}
)

Dies ist besonders nützlich, wenn:

  • Sie GPU-Speicher für andere Anwendungen freigeben müssen
  • Sie mehrere Modelle ausführen und die VRAM-Nutzung verwalten möchten
  • Sie mit der Verwendung eines großen Modells fertig sind und Ressourcen sofort freigeben möchten

Hinweis: Der keep_alive-Parameter steuert, wie lange (in Sekunden) ein Modell nach der letzten Anfrage im Speicher geladen bleibt. Das Setzen auf 0 entlädt das Modell sofort aus dem VRAM.

Wenn Sie Ollamas Abstraktionsschicht vollständig vermeiden und direkte Kontrolle darüber haben möchten, welches GGUF-Modell zu jedem Zeitpunkt resident ist, deckt llama-server Router-Modus den nativen llama.cpp-Ansatz zur dynamischen Modellumschaltung ab.

Anpassen von Ollama-Modellen (System-Prompt, Modelfile)

  • System-Prompt festlegen: Innerhalb der Ollama-REPL können Sie einen System-Prompt festlegen, um das Verhalten des Modells anzupassen:

    >>> /set system Beantworten Sie alle gestellten Fragen in plain English und vermeiden Sie technischen Jargon so weit wie möglich
    >>> /save ipe
    >>> /bye
    

    Dann führen Sie das angepasste Modell aus:

    ollama run ipe
    

    Dies setzt einen System-Prompt und speichert das Modell für die zukünftige Verwendung.

  • Benutzerdefinierte Modelldatei erstellen: Erstellen Sie eine Textdatei (z. B. custom_model.txt) mit der folgenden Struktur:

    FROM llama3.1
    SYSTEM [Ihre benutzerdefinierten Anweisungen hier]
    

    Dann führen Sie aus:

    ollama create mymodel -f custom_model.txt
    ollama run mymodel
    

    Dies erstellt ein benutzerdefiniertes Modell basierend auf den Anweisungen in der Datei.

Ollama signin und signout (Register-Authentifizierung)

ollama signin
ollama signout

ollama signin authentifiziert Ihre lokale Ollama-Installation mit dem Ollama-Register bei ollama.com. Sobald Sie angemeldet sind, speichert der Client die Anmeldeinformationen lokal und verwendet sie automatisch für nachfolgende Befehle.

Was signin freischaltet:

  • Herunterladen und Hochladen privater Modelle von Ihrem Konto oder Ihrer Organisation.
  • Verwendung cloud-gehosteter Modelle (z. B. qwen3-coder:480b-cloud), die zu groß sind, um lokal ausgeführt zu werden.
  • Veröffentlichen von Modellen im Register mit ollama push.

Alternative: API-Schlüssel-Authentifizierung

Wenn Sie Ollama in einer CI-Pipeline oder auf einem headless Server ausführen, wo interaktives ollama signin nicht praktikabel ist, erstellen Sie einen API-Schlüssel in Ihren Ollama-Kontoeinstellungen und stellen Sie ihn als Umgebungsvariable bereit:

export OLLAMA_API_KEY=ollama_...
ollama pull myorg/private-model

Die OLLAMA_API_KEY-Variable wird automatisch von jedem Ollama-Befehl und API-Anforderung aufgenommen – kein Bedarf, ollama signin auf jeder Maschine auszuführen.

Verwendung des Ollama run-Befehls mit Dateien (Zusammenfassung, Umleitung)

  • Text aus einer Datei zusammenfassen:

    ollama run llama3.2 "Fassen Sie den Inhalt dieser Datei in 50 Wörtern zusammen." < input.txt
    

    Dieser Befehl fasst den Inhalt von input.txt mit dem angegebenen Modell zusammen.

  • Modell-Antworten in eine Datei protokollieren:

    ollama run llama3.2 "Erzählen Sie mir von erneuerbaren Energien." > output.txt
    

    Dieser Befehl speichert die Antwort des Modells in output.txt.

Ollama CLI-Anwendungsfälle (Textgenerierung, Analyse)

  • Textgenerierung:

    • Zusammenfassen einer großen Textdatei:
      ollama run llama3.2 "Fassen Sie den folgenden Text zusammen:" < long-document.txt
      
    • Generieren von Inhalten:
      ollama run llama3.2 "Schreiben Sie einen kurzen Artikel über die Vorteile der Nutzung von KI im Gesundheitswesen." > article.txt
      
    • Beantworten spezifischer Fragen:
      ollama run llama3.2 "Was sind die neuesten Trends in der KI und wie werden sie das Gesundheitswesen beeinflussen?"
      

    .

  • Datenverarbeitung und -analyse:

    • Klassifizieren von Text in positive, negative oder neutrale Sentiments:
      ollama run llama3.2 "Analysieren Sie das Sentiment dieser Kundenbewertung: 'Das Produkt ist fantastisch, aber die Lieferung war langsam.'"
      
    • Kategorisieren von Text in vordefinierte Kategorien: Verwenden Sie ähnliche Befehle, um Text basierend auf vordefinierten Kriterien zu klassifizieren oder zu kategorisieren.

Verwendung von Ollama mit Python (Client und API)

  • Ollama Python-Bibliothek installieren:
    pip install ollama
    
  • Text mit Python generieren:
    import ollama
    
    response = ollama.generate(model='gemma:2b', prompt='was ist ein Qubit?')
    print(response['response'])
    
    Dieses Code-Snippet generiert Text mit dem angegebenen Modell und Prompt.

Für erweiterte Python-Integration erkunden Sie Verwendung von Ollamas Web Search API in Python, die Web-Suchfunktionen, Tool-Calling und MCP-Server-Integration abdeckt. Wenn Sie KI-gestützte Anwendungen entwickeln, kann unser AI Coding Assistants Vergleich Ihnen helfen, die richtigen Tools für die Entwicklung auszuwählen.

Suchen Sie nach einer webbasierten Benutzeroberfläche? Open WebUI bietet eine selbst gehostete Oberfläche mit RAG-Fähigkeiten und Multi-User-Unterstützung. Für hochperformante Produktionsbereitstellungen erwägen Sie vLLM als Alternative. Um Ollama mit anderen lokalen und Cloud-LLM-Infrastruktur-Optionen zu vergleichen, siehe LLM-Hosting: Lokale, selbst gehostete & Cloud-Infrastruktur im Vergleich.

Konfiguration und Verwaltung

Alternativen und Vergleiche

Leistung und Hardware

Integration und Entwicklung

Abonnieren

Neue Beiträge zu Systemen, Infrastruktur und KI-Engineering.