Ściąga do interfejsu wiersza poleceń Ollama: ls, serve, run, ps + polecenia (aktualizacja 2026)
Zaktualizowana lista poleceń Ollama – ls, ps, run, serve itp.
Ten skrót klawiszowy do CLI Ollama ({Ollama CLI cheatsheet}) skupia się na komendach, których używasz codziennie (ollama ls, ollama serve, ollama run, ollama ps, zarządzanie modelami oraz typowe przepływy pracy), z przykładami, które możesz skopiować i wkleić.
Zawiera również krótką sekcję „parametry wydajności”, która pomoże Ci odkryć (a następnie dogłębnie przeanalizować) OLLAMA_NUM_PARALLEL oraz powiązane ustawienia.

Ten skrót klawiszowy do Ollama koncentruje się na komendach CLI, zarządzaniu modelami i dostosowywaniu, ale mamy tu również kilka wywołań curl.
Aby uzyskać pełny obraz tego, gdzie Ollama plasuje się wśród opcji lokalnych, self-hosted i chmurowych – w tym vLLM, Docker Model Runner, LocalAI i dostawców chmurowych – zobacz LLM Hosting: Local, Self-Hosted & Cloud Infrastructure Compared. Porównując różne rozwiązania hostingowe lokalnych LLM, sprawdź naszą kompleksową porównawczą analizę Ollama, vLLM, LocalAI, Jan, LM Studio i innych. Dla tych, którzy szukają alternatyw dla interfejsów wiersza poleceń, Docker Model Runner oferuje inne podejście do wdrażania LLM. Jeśli jednoczesny ruch lub kolejki zaczynają przeciążać pojedynczą instancję Ollama, artykuł Ollama to vLLM: When to Migrate Your Local LLM Server omawia sygnały migracji oraz plan stopniowego wprowadzania zmian.
Instalacja Ollama (pobieranie i instalacja CLI)
- Opcja 1: Pobranie ze strony internetowej
- Odwiedź stronę ollama.com i pobierz instalator dla swojego systemu operacyjnego (Mac, Linux lub Windows).
- Opcja 2: Instalacja przez wiersz poleceń
- Dla użytkowników Mac i Linux użyj komendy:
curl -fsSL https://ollama.com/install.sh | sh
- Postępuj zgodnie z instrukcjami wyświetlanymi na ekranie i wprowadź hasło, jeśli zostaniesz o to poproszony.
Wymagania systemowe Ollama (RAM, przestrzeń dyskowa, CPU)
- System operacyjny: Mac, Linux lub Windows
- Pamięć (RAM): Minimum 8 GB, zalecane 16 GB lub więcej
- Przestrzeń dyskowa: Co najmniej ~10 GB wolnego miejsca (pliki modeli mogą być naprawdę duże, zobacz więcej tutaj Przeniesienie modeli Ollama na inny dysk )
- Procesor: Relatywnie nowoczesny procesor (z ostatnich 5 lat). Jeśli interesuje Cię, jak Ollama wykorzystuje różne architektry CPU, zobacz naszą analizę jak Ollama wykorzystuje rdzenie wydajnościowe i efektywne Intel CPU.
W przypadku poważnych obciążeń AI możesz chcieć porównać opcje sprzętowe. Przeprowadziliśmy benchmark wydajności NVIDIA DGX Spark vs Mac Studio vs RTX-4080 z Ollama, a jeśli rozważasz inwestycję w sprzęt najwyższej klasy, nasz porównawczy artykuł o cenach i możliwościach DGX Spark dostarcza szczegółowej analizy kosztów.
Podstawowe komendy CLI Ollama
| Komenda | Opis |
|---|---|
ollama serve |
Uruchamia serwer Ollama (domyślny port 11434). |
ollama run <model> |
Uruchamia określony model w interaktywnym REPL. |
ollama pull <model> |
Pobiera określony model na Twój system. |
ollama push <model> |
Przesyła model do rejestru Ollama. |
ollama list |
Wyświetla listę wszystkich pobranych modeli. To samo co ollama ls. |
ollama ps |
Pokazuje aktualnie uruchomione (załadowane) modele. |
ollama stop <model> |
Zatrzymuje (odładowuje) uruchomiony model. |
ollama rm <model> |
Usuwa model z Twojego systemu. |
ollama cp <source> <dest> |
Kopiuje model lokalnie pod nową nazwą. |
ollama show <model> |
Wyświetla szczegóły modelu (architekturę, parametry, szablon itp.). |
ollama create <model> |
Tworzy nowy model z pliku Modelfile. |
ollama launch [integration] |
Uruchomienie asystentów kodowania AI bez konfiguracji (Claude Code, Codex, Droid, OpenCode). |
ollama signin |
Autoryzuje się w rejestrze Ollama (umożliwia używanie prywatnych i chmurowych modeli). |
ollama signout |
Wylogowuje z rejestru Ollama. |
ollama help |
Dostarcza pomoc dotyczącą dowolnej komendy. |
Szybkie linki: Komenda Ollama serve · Komenda Ollama launch · Komenda Ollama run · Opcje komendy Ollama run · Komenda Ollama ps · Komenda Ollama show · Ollama signin · Podstawy CLI Ollama · Parametry wydajności (OLLAMA_NUM_PARALLEL) · Dogłębna analiza żądań równoległych
Ollama CLI (co to jest)
Ollama CLI to interfejs wiersza poleceń służący do zarządzania modelami i ich uruchamiania/serwisowania lokalnie. Większość przepływów pracy sprowadza się do:
- Uruchomienie serwera:
ollama serve - Uruchomienie modelu:
ollama run <model> - Sprawdzenie, co jest załadowane/uruchomione:
ollama ps - Zarządzanie modelami:
ollama pull,ollama list,ollama rm
Zarządzanie modelami Ollama: komendy pull i list
Lista modeli:
ollama list
to samo co:
ollama ls
Ta komenda wyświetla wszystkie modele pobrane na Twój system wraz z ich rozmiarami plików na dysku HDD/SSD, np.
$ ollama ls
NAME ID SIZE MODIFIED
deepseek-r1:8b 6995872bfe4c 5.2 GB 2 weeks ago
gemma3:12b-it-qat 5d4fa005e7bb 8.9 GB 2 weeks ago
LoTUs5494/mistral-small-3.1:24b-instruct-2503-iq4_NL 4e994e0f85a0 13 GB 3 weeks ago
dengcao/Qwen3-Embedding-8B:Q4_K_M d3ca2355027f 4.7 GB 4 weeks ago
dengcao/Qwen3-Embedding-4B:Q5_K_M 7e8c9ad6885b 2.9 GB 4 weeks ago
qwen3:8b 500a1f067a9f 5.2 GB 5 weeks ago
qwen3:14b bdbd181c33f2 9.3 GB 5 weeks ago
qwen3:30b-a3b 0b28110b7a33 18 GB 5 weeks ago
devstral:24b c4b2fa0c33d7 14 GB 5 weeks ago
Pobranie modelu: ollama pull
ollama pull mistral-nemo:12b-instruct-2407-q6_K
Ta komenda pobiera określony model (np. Gemma 2B lub mistral-nemo:12b-instruct-2407-q6_K) na Twój system. Pliki modeli mogą być dość duże, więc warto śledzić przestrzeń dyskową zajmowaną przez modele na dysku twardym lub SSD. Możesz nawet chcieć przenieść wszystkie modele Ollama z katalogu domowego na większy i lepszy dysk
Przesłanie modelu: ollama push
ollama push my-custom-model
Przesyła lokalny model do rejestru Ollama, aby inni mogli go pobrać.
Najpierw musisz się zalogować (ollama signin), a nazwa modelu musi być poprzedzona Twoją nazwą użytkownika Ollama, np. myuser/my-model.
Użyj opcji --insecure, jeśli przesyłasz do prywatnego rejestru przez HTTP:
ollama push myuser/my-model --insecure
Kopiowanie modelu: ollama cp
ollama cp llama3.2 my-llama3-variant
Tworzy lokalną kopię modelu pod nową nazwą bez konieczności ponownego pobierania. Przydatne przed edycją pliku Modelfile – najpierw skopiuj, dostosuj kopię i zachowaj oryginał:
ollama cp qwen3:14b qwen3-14b-custom
ollama create qwen3-14b-custom -f ./Modelfile
Komenda Ollama show
ollama show drukuje informacje o pobranym modelu.
ollama show qwen3:14b
Domyślnie drukuje kartę modelu (architekturę, długość kontekstu, długość embeddingu, kwantyzację itp.). Istnieje trzy przydatne flagi:
| Flag | Co pokazuje |
|---|---|
--modelfile |
Pełny plik Modelfile użyty do utworzenia modelu (linijki FROM, SYSTEM, TEMPLATE, PARAMETER) |
--parameters |
Tylko blok parametrów (np. num_ctx, temperature, tokeny stop) |
--verbose |
Rozszerzone metadane, w tym kształty tensorów i liczba warstw |
# Sprawdź dokładnie, z jakim systemem promptem i szablonem został zbudowany model
ollama show deepseek-r1:8b --modelfile
# Sprawdź rozmiar okna kontekstu i inne parametry wnioskowania
ollama show qwen3:14b --parameters
# Szczegóły na poziomie tensorów (przydatne przy debugowaniu kwantyzacji)
ollama show llama3.2 --verbose
Wyjście --modelfile jest szczególnie przydatne przed dostosowywaniem modelu: możesz skopiować podstawowy plik Modelfile i edytować go, zamiast pisać od zera.
Komenda Ollama serve
ollama serve uruchamia lokalny serwer Ollama (domyślny port HTTP 11434).
ollama serve
Komenda “ollama serve” (przyjazna dla systemd):
# ustaw zmienne środowiskowe, a następnie uruchom serwer
# udostępnij ollama na adresie IP hosta
export OLLAMA_HOST=0.0.0.0:11434
export OLLAMA_NUM_PARALLEL=2
ollama serve
Komenda Ollama run
Uruchomienie modelu:
ollama run gpt-oss:20b
Ta komenda uruchamia określony model i otwiera interaktywny REPL do interakcji. Chcesz zrozumieć, jak Ollama zarządza wieloma równoległymi żądaniami? Dowiedz się więcej o tym, jak Ollama obsługuje żądania równoległe w naszej szczegółowej analizie.
ollama run uruchamia model w sesji interaktywnej,
więc w przypadku gpt-oss:120b zobaczysz coś w stylu:
$ ollama run gpt-oss:120b
>>> Wyślij wiadomość (/? dla pomocy)
możesz wpisywać pytania lub komendy, a model odpowie.
>>> kim jesteś?
Myślenie...
Użytkownik pyta "kim jesteś?" Proste pytanie. Należy odpowiedzieć jako ChatGPT, model językowy AI, wytrenowany przez OpenAI,
itd. Przedstawić krótkie wprowadzenie. Prawdopodobnie zapytać, czy potrzebują pomocy.
...koniec myślenia.
Jestem ChatGPT, modelem językowym AI stworzonym przez OpenAI. Byłem trenowany na szerokim zakresie tekstów, więc mogę pomóc
odpowiadać na pytania, generować pomysły, wyjaśniać koncepcje, pisać teksty, rozwiązywać problemy i wiele więcej. Traktuj
mnie jako wszechstronnego wirtualnego asystenta – jestem tutaj, aby dostarczać informacje, wsparcie i rozmowę, kiedykolwiek tego potrzebujesz.
W czym mogę Ci dzisiaj pomóc?
>>> Wyślij wiadomość (/? dla pomocy)
Aby wyjść z interaktywnej sesji ollama, naciśnij Ctrl+D, lub możesz wpisać /bye, co da ten sam efekt:
>>> /bye
$
Przykłady komendy Ollama run
Aby uruchomić model i zadać jedno pytanie w trybie nieinteraktywnym:
printf "Podaj 10 jedno-liniowych komend bash do analizy logów.\n" | ollama run llama3.2
Jeśli chcesz zobaczyć szczegółowe, werbalne odpowiedzi LLM w sesji ollama – uruchom model z parametrem --verbose lub -v:
$ ollama run gpt-oss:20b --verbose
>>> kim jesteś?
Myślenie...
Musimy odpowiedzieć na proste pytanie: "kim jesteś?" Użytkownik pyta "kim jesteś?" Możemy odpowiedzieć, że
jesteśmy ChatGPT, dużym modelem językowym wytrenowanym przez OpenAI. Możemy też wspomnieć o możliwościach. Użytkownik prawdopodobnie oczekuje
krótkiego wprowadzenia. Utrzymamy przyjazny ton.
...koniec myślenia.
Jestem ChatGPT, dużym modelem językowym stworzonym przez OpenAI. Jestem tutaj, aby pomóc odpowiadać na pytania, oferować wyjaśnienia,
generować pomysły i rozmawiać o szerokiej gamie tematów – od nauki i historii po twórcze pisanie
i codzienną poradę. Daj mi tylko znać, o czym chciałbyś porozmawiać!
total duration: 1.118585707s
load duration: 106.690543ms
prompt eval count: 71 token(s)
prompt eval duration: 30.507392ms
prompt eval rate: 2327.30 tokens/s
eval count: 132 token(s)
eval duration: 945.801569ms
eval rate: 139.56 tokens/s
>>> /bye
$
Tak, to prawda, to 139 tokenów na sekundę. gpt-oss:20b jest bardzo szybki. Jeśli, jak ja, masz GPU z 16 GB VRAM – zobacz szczegóły porównania szybkości LLM w Najlepsze LLM dla Ollama na GPU z 16 GB VRAM.
Porada: Jeśli chcesz, aby model był dostępny przez HTTP dla wielu aplikacji, uruchom serwer poleceniem ollama serve i użyj klienta API zamiast długich sesji interaktywnych.
Opcje komendy Ollama run (pełny spis)
| Flag | Opis |
|---|---|
--verbose / -v |
Wyświetl statystyki czasowe (tokeny/s, czas ładowania itp.) po każdej odpowiedzi |
-p, --parameters |
Przekazuj parametry modelu inline bez pliku Modelfile (zobacz poniżej) |
--format string |
Wymuś określony format wyjścia, np. json |
--nowordwrap |
Wyłącz automatyczne zawijanie słów – przydatne przy przekazywaniu wyjścia do skryptów |
--insecure |
Pozwól na połączenie z rejestrze przez HTTP (dla prywatnych/self-hosted rejestrów) |
Nadpisywanie parametrów modelu bez pliku Modelfile (-p / –parameters)
Flaga -p pozwala zmienić parametry wnioskowania w czasie wykonania bez tworzenia pliku Modelfile.
Możesz stosować wiele flag -p:
# Zwiększ okno kontekstu i obniż temperaturę
ollama run qwen3:14b -p num_ctx=32768 -p temperature=0.5
# Uruchom zadanie kodowania z deterministycznym wyjściem
ollama run devstral:24b -p temperature=0 -p num_ctx=65536
Częste parametry, które można ustawić w ten sposób:
| Parametr | Efekt |
|---|---|
num_ctx |
Rozmiar okna kontekstu w tokenach (domyślnie zależny od modelu, często 2048–4096) |
temperature |
Losowość: 0 = deterministyczne, 1 = twórcze |
top_p |
Próg próbkowania jądra (nucleus sampling) |
top_k |
Ogranicza słownictwo do top-K tokenów |
num_predict |
Maksymalna liczba generowanych tokenów (-1 = nieograniczone) |
repeat_penalty |
Kara za powtarzanie tokenów |
Wprowadzanie wieloliniowe w REPL
Oto otocz tekst potrójnymi cudzysłowami ("""), aby wprowadzić wieloliniowy prompt bez wczesnego zgłoszenia:
>>> """Streszcz to w jednym zdaniu:
... Szybki brązowy lis skacze przez leniwego psa.
... Stało się to we wtorek.
... """
Modele multimodalne (obrazy)
Dla modeli zdolnych do widzenia (np. gemma3, llava), podaj ścieżkę do obrazu bezpośrednio w prompcie:
ollama run gemma3 "Co jest na tym obrazie? /home/user/screenshot.png"
Generowanie embeddingów przez CLI
Modele embeddingowe zwracają tablicę JSON zamiast tekstu. Przekieruj tekst bezpośrednio dla szybkich, jednorazowych embeddingów:
echo "Hello world" | ollama run nomic-embed-text
W przypadku produkcyjnych obciążeń embeddingowych użyj endpointu REST /api/embeddings lub klienta Python.
Wymuszenie wyjścia JSON (–format)
ollama run llama3.2 --format json "Wypisz 5 stolic jako JSON"
Model jest instruowany do zwrócenia ważnego JSON. Przydatne przy przekazywaniu wyjścia do jq lub skryptu oczekującego sformatowanych danych.
Komenda Ollama stop
Ta komenda zatrzymuje określony uruchomiony model.
ollama stop llama3.1:8b-instruct-q8_0
Ollama usuwa modele automagicznie po jakimś czasie.
Możesz określić ten czas, domyślnie jest to 4 minuty.
Jeśli nie chcesz czekać pozostałego czasu, możesz użyć tej komendy ollama stop.
Możesz również usunąć model z VRAM, wywołując endpoint API /generate z parametrem keep_alive=0, patrz opis i przykład poniżej.
Komenda Ollama ps
ollama ps pokazuje aktualnie uruchomione modele i sesje (przydatne do debugowania „dlaczego moje VRAM jest pełne?”).
ollama ps
Przykład wyjścia ollama ps znajduje się poniżej:
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b 17052f91a42e 14 GB 100% GPU 4096 4 minutes from now
Widzisz tutaj, że na moim PC gpt-oss:20b bardzo dobrze mieści się w 16 GB VRAM mojego GPU, zajmując tylko 14 GB.
Jeśli wykonam ollama run gpt-oss:120b, a następnie wywołam ollama ps, wynik nie będzie tak optymistyczny:
78% warstw jest na CPU, a to tylko przy oknie kontekstu 4096 tokenów. Będzie gorzej, jeśli będę musiał zwiększyć kontekst.
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b a951a23b46a1 66 GB 78%/22% CPU/GPU 4096 4 minutes from now
Komenda Ollama launch (integracje z kodowaniem AI)
ollama launch to komenda wprowadzona w Ollama v0.15 (styczeń 2026), która daje Ci zero-konfiguracji, jednowierszowe setupy dla popularnych asystentów kodowania AI uruchamianych przeciwko Twojemu lokalnemu serwerowi Ollama.
Dlaczego używać ollama launch?
Przed ollama launch, podłączenie agenta kodującego, takiego jak Claude Code lub Codex, do lokalnego backendu Ollama wymagało ręcznego ustawiania zmiennych środowiskowych, wskazywania narzędzia na odpowiedni endpoint API i wyboru kompatybilnego modelu. ollama launch obsługuje to wszystko interaktywnie.
Jeśli już uruchamiasz Ollama lokalnie i chcesz asystenta kodującego agentowego bez płacenia za wywołania API lub wysyłania kodu do chmury, ollama launch to najszybsza droga do celu.
Wspierane integracje
| Integracja | Co to jest |
|---|---|
claude |
Claude Code od Anthropic – agentowy asystent kodowania |
codex |
Codex CLI od OpenAI – asystent kodowania |
droid |
AI agent kodowania od Factory |
opencode |
Asystent kodowania open-source |
Podstawowe użycie
# Interaktywny wybór – wybierz integrację z menu
ollama launch
# Uruchom konkretną integrację bezpośrednio
ollama launch claude
# Uruchom z określonym modelem
ollama launch claude --model qwen3-coder
# Skonfiguruj integrację bez jej uruchamiania (przydatne do sprawdzenia ustawień)
ollama launch droid --config
Polecane modele
Agenci kodowania potrzebują długiego okna kontekstu, aby utrzymać kontekst całego pliku i historię rozmów wieloturnowych. Ollama zaleca modele z co najmniej 64 000 tokenami kontekstu:
| Model | Uwagi |
|---|---|
qwen3-coder |
Silna wydajność kodowania, długi kontekst, uruchamia się lokalnie |
glm-4.7-flash |
Szybka opcja lokalna |
devstral:24b |
Model skupiony na kodowaniu od Mistral |
Jeśli Twoje GPU nie może zmieścić modelu, Ollama oferuje również warianty hostowane w chmurze (np. qwen3-coder:480b-cloud), które integrują się w ten sam sposób, ale kierują wnioskowanie do warstwy chmurowej Ollama – wymagając ollama signin.
Przykład: uruchamianie Claude Code lokalnie z Ollama
# 1. Upewnij się, że model jest dostępny
ollama pull qwen3-coder
# 2. Uruchom Claude Code przeciwko niemu
ollama launch claude --model qwen3-coder
Ollama ustawia niezbędne zmienne środowiskowe i uruchamia Claude Code, kierując je automatycznie na http://localhost:11434.
Możesz następnie używać Claude Code dokładnie tak, jak normalnie – jedyną różnicą jest to, że wnioskowanie odbywa się na Twoim własnym sprzęcie.
Parametry wydajności (OLLAMA_NUM_PARALLEL)
Jeśli widzisz kolejkowanie lub przekroczenie limitu czasu pod obciążeniem, pierwszym parametrem do poznania jest OLLAMA_NUM_PARALLEL.
OLLAMA_NUM_PARALLEL= ile żądań Ollama wykonuje równolegle.- Wyższa wartość może zwiększyć przepustowość, ale może zwiększyć presję na VRAM i szczyty opóźnień.
Szybki przykład:
OLLAMA_NUM_PARALLEL=2 ollama serve
Aby uzyskać pełne wyjaśnienie (w tym strategie strojenia i tryby awaryjne), zobacz:
Zwalnianie modelu Ollama z VRAM (keep_alive)
Gdy model jest załadowany do VRAM (pamięci GPU), pozostaje tam nawet po zakończeniu jego użytkowania. Aby jawnie zwolnić model z VRAM i uwolnić pamięć GPU, możesz wysłać żądanie do API Ollama z parametrem keep_alive: 0.
- Zwolnij model z VRAM za pomocą curl:
curl http://localhost:11434/api/generate -d '{"model": "MODELNAME", "keep_alive": 0}'
Podmień MODELNAME na swoją rzeczywistą nazwę modelu, np.:
curl http://localhost:11434/api/generate -d '{"model": "qwen3:14b", "keep_alive": 0}'
- Zwolnij model z VRAM za pomocą Pythona:
import requests
response = requests.post(
'http://localhost:11434/api/generate',
json={'model': 'qwen3:14b', 'keep_alive': 0}
)
Jest to szczególnie przydatne, gdy:
- Musisz zwolnić pamięć GPU dla innych aplikacji
- Uruchamiasz wiele modeli i chcesz zarządzać użyciem VRAM
- Zakończyłeś używanie dużego modelu i chcesz natychmiast zwolnić zasoby
Uwaga: Parametr keep_alive kontroluje, jak długo (w sekundach) model pozostaje załadowany w pamięci po ostatnim żądaniu. Ustawienie go na 0 natychmiast odładowuje model z VRAM.
Jeśli wolisz całkowicie unikać warstwy abstrakcyjnej Ollama i chcesz mieć bezpośrednią kontrolę nad tym, który model GGUF jest aktywny w danym momencie, tryb routera llama-server omawia podejście natywne dla llama.cpp do dynamicznego przełączania modeli.
Dostosowywanie modeli Ollama (system prompt, Modelfile)
-
Ustaw System Prompt: W REPL Ollama możesz ustawić system prompt, aby dostosować zachowanie modelu:
>>> /set system For all questions asked answer in plain English avoiding technical jargon as much as possible >>> /save ipe >>> /byeNastępnie uruchom dostosowany model:
ollama run ipeUstawia to system prompt i zapisuje model do przyszłego użycia.
-
Tworzenie niestandardowego pliku modelu: Stwórz plik tekstowy (np.
custom_model.txt) z następującą strukturą:FROM llama3.1 SYSTEM [Twoje niestandardowe instrukcje tutaj]Następnie uruchom:
ollama create mymodel -f custom_model.txt ollama run mymodelTworzy to dostosowany model na podstawie instrukcji w pliku".
Ollama signin i signout (autoryzacja w rejestrze)
ollama signin
ollama signout
ollama signin autoryzuje Twoją lokalną instalację Ollama z rejestrze Ollama na ollama.com. Po zalogowaniu się klient przechowuje dane uwierzytelniające lokalnie i automatycznie je ponownie używa dla kolejnych komend.
Co odblokowuje signin:
- Pobieranie i przesyłanie prywatnych modeli z Twojego konta lub organizacji.
- Używanie modeli hostowanych w chmurze (np.
qwen3-coder:480b-cloud), które są zbyt duże, aby uruchomić je lokalnie. - Publikowanie modeli w rejestrze za pomocą
ollama push.
Alternatywa: uwierzytelnianie kluczem API
Jeśli uruchamiasz Ollama w pipeline CI lub na serwerze headless, gdzie interaktywne ollama signin nie jest praktyczne, utwórz klucz API w ustawieniach konta Ollama i ujawnij go jako zmienną środowiskową:
export OLLAMA_API_KEY=ollama_...
ollama pull myorg/private-model
Zmienna OLLAMA_API_KEY jest automatycznie przechwytywana przez każdą komendę Ollama i żądanie API – nie ma potrzeby uruchamiania ollama signin na każdej maszynie.
Używanie komendy Ollama run z plikami (podsumowanie, przekierowanie)
-
Podsumowanie tekstu z pliku:
ollama run llama3.2 "Podsumuj zawartość tego pliku w 50 słowach." < input.txtTa komenda podsumowuje zawartość
input.txtprzy użyciu określonego modelu. -
Logowanie odpowiedzi modelu do pliku:
ollama run llama3.2 "Opowiedz mi o energii odnawialnej." > output.txtTa komenda zapisuje odpowiedź modelu do
output.txt.
Przypadki użycia CLI Ollama (generowanie tekstu, analiza)
-
Generowanie tekstu:
- Podsumowanie dużego pliku tekstowego:
ollama run llama3.2 "Podsumuj poniższy tekst:" < long-document.txt - Generowanie treści:
ollama run llama3.2 "Napisz krótki artykuł o korzyściach z używania AI w opiece zdrowotnej." > article.txt - Odpowiadanie na konkretne pytania:
ollama run llama3.2 "Jakie są najnowsze trendy w AI i jak wpłyną one na opiekę zdrowotną?"
.
- Podsumowanie dużego pliku tekstowego:
-
Przetwarzanie i analiza danych:
- Klasyfikacja tekstu jako pozytywna, negatywna lub neutralna:
ollama run llama3.2 "Przeanalizuj sentyment tej recenzji klienta: 'Produkt jest fantastyczny, ale dostawa była wolna.'" - Kategoryzacja tekstu do zdefiniowanych kategorii: Użyj podobnych komend do klasyfikacji lub kategoryzacji tekstu na podstawie zdefiniowanych kryteriów.
- Klasyfikacja tekstu jako pozytywna, negatywna lub neutralna:
Używanie Ollama z Pythonem (klient i API)
- Instalacja biblioteki Python Ollama:
pip install ollama - Generowanie tekstu za pomocą Pythona:
Ten fragment kodu generuje tekst przy użyciu określonego modelu i promptu.
import ollama response = ollama.generate(model='gemma:2b', prompt='what is a qubit?') print(response['response'])
Aby uzyskać zaawansowaną integrację z Pythonem, zapoznaj się z używaniem API Wyszukiwania Webowego Ollama w Pythonie, które omawia funkcje wyszukiwania internetowego, wywołanie narzędzi i integrację z serwerami MCP. Jeśli budujesz aplikacje zasilane AI, nasza porównawcza analiza Asystentów Kodowania AI może pomóc Ci wybrać odpowiednie narzędzia do rozwoju.
Szukasz interfejsu webowego? Open WebUI dostarcza interfejs self-hosted z możliwościami RAG i wsparciem dla wielu użytkowników. W przypadku wdrożeń produkcyjnych wysokiej wydajności rozważ vLLM jako alternatywę. Aby porównać Ollama z innymi lokalnymi i chmurowymi opcjami infrastruktury LLM, zobacz LLM Hosting: Local, Self-Hosted & Cloud Infrastructure Compared.
Przydatne linki
Konfiguracja i Zarządzanie
Alternatywy i Porównania
- Lokalny Hosting LLM: Kompletny Przewodnik 2026 - Ollama, vLLM, LocalAI, Jan, LM Studio & Więcej
- Szybki start vLLM: Wysoka wydajność serwowania LLM
- Docker Model Runner vs Ollama: Które wybrać?
- Pierwsze oznaki „Enshittification” Ollama
- Ollama do vLLM: Kiedy migracja serwera lokalnego LLM
Wydajność i Sprzęt
- Jak Ollama obsługuje żądania równoległe
- Jak Ollama wykorzystuje rdzenie wydajnościowe i efektywne Intel CPU
- NVIDIA DGX Spark vs Mac Studio vs RTX-4080: Porównanie wydajności Ollama
- DGX Spark vs Mac Studio: Praktyczne, sprawdzone cenowo spojrzenie na osobisty superkomputer AI Nvidii
Integracja i Rozwój
- Używanie API Wyszukiwania Webowego Ollama w Pythonie
- Porównanie Asystentów Kodowania AI
- Open WebUI: Self-Hosted Interfejs LLM
- Interfejsy Chat UI Open Source dla LLM na lokalnych instancjach Ollama
- Ograniczanie LLM strukturalnym wyjściem: Ollama, Qwen3 & Python lub Go
- Integracja Ollama z Pythonem: Przykłady REST API i Klienta Python
- SDK Go dla Ollama - porównanie z przykładami