Ściąga do interfejsu wiersza poleceń Ollama: ls, serve, run, ps + polecenia (aktualizacja 2026)

Zaktualizowana lista poleceń Ollama – ls, ps, run, serve itp.

Page content

Ten skrót klawiszowy do CLI Ollama ({Ollama CLI cheatsheet}) skupia się na komendach, których używasz codziennie (ollama ls, ollama serve, ollama run, ollama ps, zarządzanie modelami oraz typowe przepływy pracy), z przykładami, które możesz skopiować i wkleić.

Zawiera również krótką sekcję „parametry wydajności”, która pomoże Ci odkryć (a następnie dogłębnie przeanalizować) OLLAMA_NUM_PARALLEL oraz powiązane ustawienia.

ollama cheatsheet

Ten skrót klawiszowy do Ollama koncentruje się na komendach CLI, zarządzaniu modelami i dostosowywaniu, ale mamy tu również kilka wywołań curl.

Aby uzyskać pełny obraz tego, gdzie Ollama plasuje się wśród opcji lokalnych, self-hosted i chmurowych – w tym vLLM, Docker Model Runner, LocalAI i dostawców chmurowych – zobacz LLM Hosting: Local, Self-Hosted & Cloud Infrastructure Compared. Porównując różne rozwiązania hostingowe lokalnych LLM, sprawdź naszą kompleksową porównawczą analizę Ollama, vLLM, LocalAI, Jan, LM Studio i innych. Dla tych, którzy szukają alternatyw dla interfejsów wiersza poleceń, Docker Model Runner oferuje inne podejście do wdrażania LLM. Jeśli jednoczesny ruch lub kolejki zaczynają przeciążać pojedynczą instancję Ollama, artykuł Ollama to vLLM: When to Migrate Your Local LLM Server omawia sygnały migracji oraz plan stopniowego wprowadzania zmian.

Instalacja Ollama (pobieranie i instalacja CLI)

  • Opcja 1: Pobranie ze strony internetowej
    • Odwiedź stronę ollama.com i pobierz instalator dla swojego systemu operacyjnego (Mac, Linux lub Windows).
  • Opcja 2: Instalacja przez wiersz poleceń
    • Dla użytkowników Mac i Linux użyj komendy:
curl -fsSL https://ollama.com/install.sh | sh
  • Postępuj zgodnie z instrukcjami wyświetlanymi na ekranie i wprowadź hasło, jeśli zostaniesz o to poproszony.

Wymagania systemowe Ollama (RAM, przestrzeń dyskowa, CPU)

W przypadku poważnych obciążeń AI możesz chcieć porównać opcje sprzętowe. Przeprowadziliśmy benchmark wydajności NVIDIA DGX Spark vs Mac Studio vs RTX-4080 z Ollama, a jeśli rozważasz inwestycję w sprzęt najwyższej klasy, nasz porównawczy artykuł o cenach i możliwościach DGX Spark dostarcza szczegółowej analizy kosztów.

Podstawowe komendy CLI Ollama

Komenda Opis
ollama serve Uruchamia serwer Ollama (domyślny port 11434).
ollama run <model> Uruchamia określony model w interaktywnym REPL.
ollama pull <model> Pobiera określony model na Twój system.
ollama push <model> Przesyła model do rejestru Ollama.
ollama list Wyświetla listę wszystkich pobranych modeli. To samo co ollama ls.
ollama ps Pokazuje aktualnie uruchomione (załadowane) modele.
ollama stop <model> Zatrzymuje (odładowuje) uruchomiony model.
ollama rm <model> Usuwa model z Twojego systemu.
ollama cp <source> <dest> Kopiuje model lokalnie pod nową nazwą.
ollama show <model> Wyświetla szczegóły modelu (architekturę, parametry, szablon itp.).
ollama create <model> Tworzy nowy model z pliku Modelfile.
ollama launch [integration] Uruchomienie asystentów kodowania AI bez konfiguracji (Claude Code, Codex, Droid, OpenCode).
ollama signin Autoryzuje się w rejestrze Ollama (umożliwia używanie prywatnych i chmurowych modeli).
ollama signout Wylogowuje z rejestru Ollama.
ollama help Dostarcza pomoc dotyczącą dowolnej komendy.

Szybkie linki: Komenda Ollama serve · Komenda Ollama launch · Komenda Ollama run · Opcje komendy Ollama run · Komenda Ollama ps · Komenda Ollama show · Ollama signin · Podstawy CLI Ollama · Parametry wydajności (OLLAMA_NUM_PARALLEL) · Dogłębna analiza żądań równoległych

Ollama CLI (co to jest)

Ollama CLI to interfejs wiersza poleceń służący do zarządzania modelami i ich uruchamiania/serwisowania lokalnie. Większość przepływów pracy sprowadza się do:

  • Uruchomienie serwera: ollama serve
  • Uruchomienie modelu: ollama run <model>
  • Sprawdzenie, co jest załadowane/uruchomione: ollama ps
  • Zarządzanie modelami: ollama pull, ollama list, ollama rm

Zarządzanie modelami Ollama: komendy pull i list

Lista modeli:

ollama list

to samo co:

ollama ls

Ta komenda wyświetla wszystkie modele pobrane na Twój system wraz z ich rozmiarami plików na dysku HDD/SSD, np.

$ ollama ls
NAME                                                    ID              SIZE      MODIFIED     
deepseek-r1:8b                                          6995872bfe4c    5.2 GB    2 weeks ago     
gemma3:12b-it-qat                                       5d4fa005e7bb    8.9 GB    2 weeks ago     
LoTUs5494/mistral-small-3.1:24b-instruct-2503-iq4_NL    4e994e0f85a0    13 GB     3 weeks ago     
dengcao/Qwen3-Embedding-8B:Q4_K_M                       d3ca2355027f    4.7 GB    4 weeks ago     
dengcao/Qwen3-Embedding-4B:Q5_K_M                       7e8c9ad6885b    2.9 GB    4 weeks ago     
qwen3:8b                                                500a1f067a9f    5.2 GB    5 weeks ago     
qwen3:14b                                               bdbd181c33f2    9.3 GB    5 weeks ago     
qwen3:30b-a3b                                           0b28110b7a33    18 GB     5 weeks ago     
devstral:24b                                            c4b2fa0c33d7    14 GB     5 weeks ago  

Pobranie modelu: ollama pull

ollama pull mistral-nemo:12b-instruct-2407-q6_K

Ta komenda pobiera określony model (np. Gemma 2B lub mistral-nemo:12b-instruct-2407-q6_K) na Twój system. Pliki modeli mogą być dość duże, więc warto śledzić przestrzeń dyskową zajmowaną przez modele na dysku twardym lub SSD. Możesz nawet chcieć przenieść wszystkie modele Ollama z katalogu domowego na większy i lepszy dysk

Przesłanie modelu: ollama push

ollama push my-custom-model

Przesyła lokalny model do rejestru Ollama, aby inni mogli go pobrać. Najpierw musisz się zalogować (ollama signin), a nazwa modelu musi być poprzedzona Twoją nazwą użytkownika Ollama, np. myuser/my-model. Użyj opcji --insecure, jeśli przesyłasz do prywatnego rejestru przez HTTP:

ollama push myuser/my-model --insecure

Kopiowanie modelu: ollama cp

ollama cp llama3.2 my-llama3-variant

Tworzy lokalną kopię modelu pod nową nazwą bez konieczności ponownego pobierania. Przydatne przed edycją pliku Modelfile – najpierw skopiuj, dostosuj kopię i zachowaj oryginał:

ollama cp qwen3:14b qwen3-14b-custom
ollama create qwen3-14b-custom -f ./Modelfile

Komenda Ollama show

ollama show drukuje informacje o pobranym modelu.

ollama show qwen3:14b

Domyślnie drukuje kartę modelu (architekturę, długość kontekstu, długość embeddingu, kwantyzację itp.). Istnieje trzy przydatne flagi:

Flag Co pokazuje
--modelfile Pełny plik Modelfile użyty do utworzenia modelu (linijki FROM, SYSTEM, TEMPLATE, PARAMETER)
--parameters Tylko blok parametrów (np. num_ctx, temperature, tokeny stop)
--verbose Rozszerzone metadane, w tym kształty tensorów i liczba warstw
# Sprawdź dokładnie, z jakim systemem promptem i szablonem został zbudowany model
ollama show deepseek-r1:8b --modelfile

# Sprawdź rozmiar okna kontekstu i inne parametry wnioskowania
ollama show qwen3:14b --parameters

# Szczegóły na poziomie tensorów (przydatne przy debugowaniu kwantyzacji)
ollama show llama3.2 --verbose

Wyjście --modelfile jest szczególnie przydatne przed dostosowywaniem modelu: możesz skopiować podstawowy plik Modelfile i edytować go, zamiast pisać od zera.

Komenda Ollama serve

ollama serve uruchamia lokalny serwer Ollama (domyślny port HTTP 11434).

ollama serve

Komenda “ollama serve” (przyjazna dla systemd):

# ustaw zmienne środowiskowe, a następnie uruchom serwer
# udostępnij ollama na adresie IP hosta
export OLLAMA_HOST=0.0.0.0:11434
export OLLAMA_NUM_PARALLEL=2
ollama serve

Komenda Ollama run

Uruchomienie modelu:

ollama run gpt-oss:20b

Ta komenda uruchamia określony model i otwiera interaktywny REPL do interakcji. Chcesz zrozumieć, jak Ollama zarządza wieloma równoległymi żądaniami? Dowiedz się więcej o tym, jak Ollama obsługuje żądania równoległe w naszej szczegółowej analizie.

ollama run uruchamia model w sesji interaktywnej, więc w przypadku gpt-oss:120b zobaczysz coś w stylu:

$ ollama run gpt-oss:120b
>>> Wyślij wiadomość (/? dla pomocy)

możesz wpisywać pytania lub komendy, a model odpowie.

>>> kim jesteś?
Myślenie...
Użytkownik pyta "kim jesteś?" Proste pytanie. Należy odpowiedzieć jako ChatGPT, model językowy AI, wytrenowany przez OpenAI,
itd. Przedstawić krótkie wprowadzenie. Prawdopodobnie zapytać, czy potrzebują pomocy.
...koniec myślenia.

Jestem ChatGPT, modelem językowym AI stworzonym przez OpenAI. Byłem trenowany na szerokim zakresie tekstów, więc mogę pomóc
odpowiadać na pytania, generować pomysły, wyjaśniać koncepcje, pisać teksty, rozwiązywać problemy i wiele więcej. Traktuj
mnie jako wszechstronnego wirtualnego asystenta – jestem tutaj, aby dostarczać informacje, wsparcie i rozmowę, kiedykolwiek tego potrzebujesz.
W czym mogę Ci dzisiaj pomóc?

>>> Wyślij wiadomość (/? dla pomocy)

Aby wyjść z interaktywnej sesji ollama, naciśnij Ctrl+D, lub możesz wpisać /bye, co da ten sam efekt:

>>> /bye
$ 

Przykłady komendy Ollama run

Aby uruchomić model i zadać jedno pytanie w trybie nieinteraktywnym:

printf "Podaj 10 jedno-liniowych komend bash do analizy logów.\n" | ollama run llama3.2

Jeśli chcesz zobaczyć szczegółowe, werbalne odpowiedzi LLM w sesji ollama – uruchom model z parametrem --verbose lub -v:

$ ollama run gpt-oss:20b --verbose
>>> kim jesteś?
Myślenie...
Musimy odpowiedzieć na proste pytanie: "kim jesteś?" Użytkownik pyta "kim jesteś?" Możemy odpowiedzieć, że
jesteśmy ChatGPT, dużym modelem językowym wytrenowanym przez OpenAI. Możemy też wspomnieć o możliwościach. Użytkownik prawdopodobnie oczekuje
krótkiego wprowadzenia. Utrzymamy przyjazny ton.
...koniec myślenia.

Jestem ChatGPT, dużym modelem językowym stworzonym przez OpenAI. Jestem tutaj, aby pomóc odpowiadać na pytania, oferować wyjaśnienia,
generować pomysły i rozmawiać o szerokiej gamie tematów – od nauki i historii po twórcze pisanie
i codzienną poradę. Daj mi tylko znać, o czym chciałbyś porozmawiać!

total duration:       1.118585707s
load duration:        106.690543ms
prompt eval count:    71 token(s)
prompt eval duration: 30.507392ms
prompt eval rate:     2327.30 tokens/s
eval count:           132 token(s)
eval duration:        945.801569ms
eval rate:            139.56 tokens/s
>>> /bye
$ 

Tak, to prawda, to 139 tokenów na sekundę. gpt-oss:20b jest bardzo szybki. Jeśli, jak ja, masz GPU z 16 GB VRAM – zobacz szczegóły porównania szybkości LLM w Najlepsze LLM dla Ollama na GPU z 16 GB VRAM.

Porada: Jeśli chcesz, aby model był dostępny przez HTTP dla wielu aplikacji, uruchom serwer poleceniem ollama serve i użyj klienta API zamiast długich sesji interaktywnych.

Opcje komendy Ollama run (pełny spis)

Flag Opis
--verbose / -v Wyświetl statystyki czasowe (tokeny/s, czas ładowania itp.) po każdej odpowiedzi
-p, --parameters Przekazuj parametry modelu inline bez pliku Modelfile (zobacz poniżej)
--format string Wymuś określony format wyjścia, np. json
--nowordwrap Wyłącz automatyczne zawijanie słów – przydatne przy przekazywaniu wyjścia do skryptów
--insecure Pozwól na połączenie z rejestrze przez HTTP (dla prywatnych/self-hosted rejestrów)

Nadpisywanie parametrów modelu bez pliku Modelfile (-p / –parameters)

Flaga -p pozwala zmienić parametry wnioskowania w czasie wykonania bez tworzenia pliku Modelfile. Możesz stosować wiele flag -p:

# Zwiększ okno kontekstu i obniż temperaturę
ollama run qwen3:14b -p num_ctx=32768 -p temperature=0.5

# Uruchom zadanie kodowania z deterministycznym wyjściem
ollama run devstral:24b -p temperature=0 -p num_ctx=65536

Częste parametry, które można ustawić w ten sposób:

Parametr Efekt
num_ctx Rozmiar okna kontekstu w tokenach (domyślnie zależny od modelu, często 2048–4096)
temperature Losowość: 0 = deterministyczne, 1 = twórcze
top_p Próg próbkowania jądra (nucleus sampling)
top_k Ogranicza słownictwo do top-K tokenów
num_predict Maksymalna liczba generowanych tokenów (-1 = nieograniczone)
repeat_penalty Kara za powtarzanie tokenów

Wprowadzanie wieloliniowe w REPL

Oto otocz tekst potrójnymi cudzysłowami ("""), aby wprowadzić wieloliniowy prompt bez wczesnego zgłoszenia:

>>> """Streszcz to w jednym zdaniu:
... Szybki brązowy lis skacze przez leniwego psa.
... Stało się to we wtorek.
... """

Modele multimodalne (obrazy)

Dla modeli zdolnych do widzenia (np. gemma3, llava), podaj ścieżkę do obrazu bezpośrednio w prompcie:

ollama run gemma3 "Co jest na tym obrazie? /home/user/screenshot.png"

Generowanie embeddingów przez CLI

Modele embeddingowe zwracają tablicę JSON zamiast tekstu. Przekieruj tekst bezpośrednio dla szybkich, jednorazowych embeddingów:

echo "Hello world" | ollama run nomic-embed-text

W przypadku produkcyjnych obciążeń embeddingowych użyj endpointu REST /api/embeddings lub klienta Python.

Wymuszenie wyjścia JSON (–format)

ollama run llama3.2 --format json "Wypisz 5 stolic jako JSON"

Model jest instruowany do zwrócenia ważnego JSON. Przydatne przy przekazywaniu wyjścia do jq lub skryptu oczekującego sformatowanych danych.

Komenda Ollama stop

Ta komenda zatrzymuje określony uruchomiony model.

ollama stop llama3.1:8b-instruct-q8_0

Ollama usuwa modele automagicznie po jakimś czasie. Możesz określić ten czas, domyślnie jest to 4 minuty. Jeśli nie chcesz czekać pozostałego czasu, możesz użyć tej komendy ollama stop. Możesz również usunąć model z VRAM, wywołując endpoint API /generate z parametrem keep_alive=0, patrz opis i przykład poniżej.

Komenda Ollama ps

ollama ps pokazuje aktualnie uruchomione modele i sesje (przydatne do debugowania „dlaczego moje VRAM jest pełne?”).

ollama ps

Przykład wyjścia ollama ps znajduje się poniżej:

NAME           ID              SIZE     PROCESSOR    CONTEXT    UNTIL
gpt-oss:20b    17052f91a42e    14 GB    100% GPU     4096       4 minutes from now

Widzisz tutaj, że na moim PC gpt-oss:20b bardzo dobrze mieści się w 16 GB VRAM mojego GPU, zajmując tylko 14 GB.

Jeśli wykonam ollama run gpt-oss:120b, a następnie wywołam ollama ps, wynik nie będzie tak optymistyczny: 78% warstw jest na CPU, a to tylko przy oknie kontekstu 4096 tokenów. Będzie gorzej, jeśli będę musiał zwiększyć kontekst.

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    a951a23b46a1    66 GB    78%/22% CPU/GPU    4096       4 minutes from now

Komenda Ollama launch (integracje z kodowaniem AI)

ollama launch to komenda wprowadzona w Ollama v0.15 (styczeń 2026), która daje Ci zero-konfiguracji, jednowierszowe setupy dla popularnych asystentów kodowania AI uruchamianych przeciwko Twojemu lokalnemu serwerowi Ollama.

Dlaczego używać ollama launch?

Przed ollama launch, podłączenie agenta kodującego, takiego jak Claude Code lub Codex, do lokalnego backendu Ollama wymagało ręcznego ustawiania zmiennych środowiskowych, wskazywania narzędzia na odpowiedni endpoint API i wyboru kompatybilnego modelu. ollama launch obsługuje to wszystko interaktywnie.

Jeśli już uruchamiasz Ollama lokalnie i chcesz asystenta kodującego agentowego bez płacenia za wywołania API lub wysyłania kodu do chmury, ollama launch to najszybsza droga do celu.

Wspierane integracje

Integracja Co to jest
claude Claude Code od Anthropic – agentowy asystent kodowania
codex Codex CLI od OpenAI – asystent kodowania
droid AI agent kodowania od Factory
opencode Asystent kodowania open-source

Podstawowe użycie

# Interaktywny wybór – wybierz integrację z menu
ollama launch

# Uruchom konkretną integrację bezpośrednio
ollama launch claude

# Uruchom z określonym modelem
ollama launch claude --model qwen3-coder

# Skonfiguruj integrację bez jej uruchamiania (przydatne do sprawdzenia ustawień)
ollama launch droid --config

Polecane modele

Agenci kodowania potrzebują długiego okna kontekstu, aby utrzymać kontekst całego pliku i historię rozmów wieloturnowych. Ollama zaleca modele z co najmniej 64 000 tokenami kontekstu:

Model Uwagi
qwen3-coder Silna wydajność kodowania, długi kontekst, uruchamia się lokalnie
glm-4.7-flash Szybka opcja lokalna
devstral:24b Model skupiony na kodowaniu od Mistral

Jeśli Twoje GPU nie może zmieścić modelu, Ollama oferuje również warianty hostowane w chmurze (np. qwen3-coder:480b-cloud), które integrują się w ten sam sposób, ale kierują wnioskowanie do warstwy chmurowej Ollama – wymagając ollama signin.

Przykład: uruchamianie Claude Code lokalnie z Ollama

# 1. Upewnij się, że model jest dostępny
ollama pull qwen3-coder

# 2. Uruchom Claude Code przeciwko niemu
ollama launch claude --model qwen3-coder

Ollama ustawia niezbędne zmienne środowiskowe i uruchamia Claude Code, kierując je automatycznie na http://localhost:11434. Możesz następnie używać Claude Code dokładnie tak, jak normalnie – jedyną różnicą jest to, że wnioskowanie odbywa się na Twoim własnym sprzęcie.

Parametry wydajności (OLLAMA_NUM_PARALLEL)

Jeśli widzisz kolejkowanie lub przekroczenie limitu czasu pod obciążeniem, pierwszym parametrem do poznania jest OLLAMA_NUM_PARALLEL.

  • OLLAMA_NUM_PARALLEL = ile żądań Ollama wykonuje równolegle.
  • Wyższa wartość może zwiększyć przepustowość, ale może zwiększyć presję na VRAM i szczyty opóźnień.

Szybki przykład:

OLLAMA_NUM_PARALLEL=2 ollama serve

Aby uzyskać pełne wyjaśnienie (w tym strategie strojenia i tryby awaryjne), zobacz:

Zwalnianie modelu Ollama z VRAM (keep_alive)

Gdy model jest załadowany do VRAM (pamięci GPU), pozostaje tam nawet po zakończeniu jego użytkowania. Aby jawnie zwolnić model z VRAM i uwolnić pamięć GPU, możesz wysłać żądanie do API Ollama z parametrem keep_alive: 0.

  • Zwolnij model z VRAM za pomocą curl:
curl http://localhost:11434/api/generate -d '{"model": "MODELNAME", "keep_alive": 0}'

Podmień MODELNAME na swoją rzeczywistą nazwę modelu, np.:

curl http://localhost:11434/api/generate -d '{"model": "qwen3:14b", "keep_alive": 0}'
  • Zwolnij model z VRAM za pomocą Pythona:
import requests

response = requests.post(
    'http://localhost:11434/api/generate',
    json={'model': 'qwen3:14b', 'keep_alive': 0}
)

Jest to szczególnie przydatne, gdy:

  • Musisz zwolnić pamięć GPU dla innych aplikacji
  • Uruchamiasz wiele modeli i chcesz zarządzać użyciem VRAM
  • Zakończyłeś używanie dużego modelu i chcesz natychmiast zwolnić zasoby

Uwaga: Parametr keep_alive kontroluje, jak długo (w sekundach) model pozostaje załadowany w pamięci po ostatnim żądaniu. Ustawienie go na 0 natychmiast odładowuje model z VRAM.

Jeśli wolisz całkowicie unikać warstwy abstrakcyjnej Ollama i chcesz mieć bezpośrednią kontrolę nad tym, który model GGUF jest aktywny w danym momencie, tryb routera llama-server omawia podejście natywne dla llama.cpp do dynamicznego przełączania modeli.

Dostosowywanie modeli Ollama (system prompt, Modelfile)

  • Ustaw System Prompt: W REPL Ollama możesz ustawić system prompt, aby dostosować zachowanie modelu:

    >>> /set system For all questions asked answer in plain English avoiding technical jargon as much as possible
    >>> /save ipe
    >>> /bye
    

    Następnie uruchom dostosowany model:

    ollama run ipe
    

    Ustawia to system prompt i zapisuje model do przyszłego użycia.

  • Tworzenie niestandardowego pliku modelu: Stwórz plik tekstowy (np. custom_model.txt) z następującą strukturą:

    FROM llama3.1
    SYSTEM [Twoje niestandardowe instrukcje tutaj]
    

    Następnie uruchom:

    ollama create mymodel -f custom_model.txt
    ollama run mymodel
    

    Tworzy to dostosowany model na podstawie instrukcji w pliku".

Ollama signin i signout (autoryzacja w rejestrze)

ollama signin
ollama signout

ollama signin autoryzuje Twoją lokalną instalację Ollama z rejestrze Ollama na ollama.com. Po zalogowaniu się klient przechowuje dane uwierzytelniające lokalnie i automatycznie je ponownie używa dla kolejnych komend.

Co odblokowuje signin:

  • Pobieranie i przesyłanie prywatnych modeli z Twojego konta lub organizacji.
  • Używanie modeli hostowanych w chmurze (np. qwen3-coder:480b-cloud), które są zbyt duże, aby uruchomić je lokalnie.
  • Publikowanie modeli w rejestrze za pomocą ollama push.

Alternatywa: uwierzytelnianie kluczem API

Jeśli uruchamiasz Ollama w pipeline CI lub na serwerze headless, gdzie interaktywne ollama signin nie jest praktyczne, utwórz klucz API w ustawieniach konta Ollama i ujawnij go jako zmienną środowiskową:

export OLLAMA_API_KEY=ollama_...
ollama pull myorg/private-model

Zmienna OLLAMA_API_KEY jest automatycznie przechwytywana przez każdą komendę Ollama i żądanie API – nie ma potrzeby uruchamiania ollama signin na każdej maszynie.

Używanie komendy Ollama run z plikami (podsumowanie, przekierowanie)

  • Podsumowanie tekstu z pliku:

    ollama run llama3.2 "Podsumuj zawartość tego pliku w 50 słowach." < input.txt
    

    Ta komenda podsumowuje zawartość input.txt przy użyciu określonego modelu.

  • Logowanie odpowiedzi modelu do pliku:

    ollama run llama3.2 "Opowiedz mi o energii odnawialnej." > output.txt
    

    Ta komenda zapisuje odpowiedź modelu do output.txt.

Przypadki użycia CLI Ollama (generowanie tekstu, analiza)

  • Generowanie tekstu:

    • Podsumowanie dużego pliku tekstowego:
      ollama run llama3.2 "Podsumuj poniższy tekst:" < long-document.txt
      
    • Generowanie treści:
      ollama run llama3.2 "Napisz krótki artykuł o korzyściach z używania AI w opiece zdrowotnej." > article.txt
      
    • Odpowiadanie na konkretne pytania:
      ollama run llama3.2 "Jakie są najnowsze trendy w AI i jak wpłyną one na opiekę zdrowotną?"
      

    .

  • Przetwarzanie i analiza danych:

    • Klasyfikacja tekstu jako pozytywna, negatywna lub neutralna:
      ollama run llama3.2 "Przeanalizuj sentyment tej recenzji klienta: 'Produkt jest fantastyczny, ale dostawa była wolna.'"
      
    • Kategoryzacja tekstu do zdefiniowanych kategorii: Użyj podobnych komend do klasyfikacji lub kategoryzacji tekstu na podstawie zdefiniowanych kryteriów.

Używanie Ollama z Pythonem (klient i API)

  • Instalacja biblioteki Python Ollama:
    pip install ollama
    
  • Generowanie tekstu za pomocą Pythona:
    import ollama
    
    response = ollama.generate(model='gemma:2b', prompt='what is a qubit?')
    print(response['response'])
    
    Ten fragment kodu generuje tekst przy użyciu określonego modelu i promptu.

Aby uzyskać zaawansowaną integrację z Pythonem, zapoznaj się z używaniem API Wyszukiwania Webowego Ollama w Pythonie, które omawia funkcje wyszukiwania internetowego, wywołanie narzędzi i integrację z serwerami MCP. Jeśli budujesz aplikacje zasilane AI, nasza porównawcza analiza Asystentów Kodowania AI może pomóc Ci wybrać odpowiednie narzędzia do rozwoju.

Szukasz interfejsu webowego? Open WebUI dostarcza interfejs self-hosted z możliwościami RAG i wsparciem dla wielu użytkowników. W przypadku wdrożeń produkcyjnych wysokiej wydajności rozważ vLLM jako alternatywę. Aby porównać Ollama z innymi lokalnymi i chmurowymi opcjami infrastruktury LLM, zobacz LLM Hosting: Local, Self-Hosted & Cloud Infrastructure Compared.

Przydatne linki

Konfiguracja i Zarządzanie

Alternatywy i Porównania

Wydajność i Sprzęt

Integracja i Rozwój

Subskrybuj

Otrzymuj nowe wpisy o systemach, infrastrukturze i inżynierii AI.