Ollama CLI 치트시트: ls, serve, run, ps 및 기타 명령어 (2026년 업데이트)
업데이트된 Ollama 명령어 목록 - ls, ps, run, serve 등
이 Ollama CLI 치트시트는 매일 사용하는 명령어(ollama ls, ollama serve, ollama run, ollama ps, 모델 관리, 일반적인 워크플로우)에 초점을 맞추고 있으며, 복사/붙여넣기가 가능한 예제를 제공합니다.
또한 OLLAMA_NUM_PARALLEL 및 관련 설정을 발견하고(그리고 심층적으로 분석) 도움이 되는 짧은 ‘성능 조절 knob(설정)’ 섹션도 포함하고 있습니다.

이 Ollama 치트시트는 CLI 명령어, 모델 관리, 커스터마이징에 중점을 두고 있습니다. 하지만 여기에는 curl 호출 예제도 일부 포함되어 있습니다.
Ollama가 로컬, 자체 호스팅, 클라우드 옵션(vLLM, Docker Model Runner, LocalAI 및 클라우드 제공업체 포함) 중에서 어디에 위치하는지에 대한 전체적인 그림을 보려면 LLM 호스팅: 로컬, 자체 호스팅 및 클라우드 인프라 비교를 참조하세요. 다양한 로컬 LLM 호스팅 솔루션을 비교하고 있다면, Ollama, vLLM, LocalAI, Jan, LM Studio 등 종합 비교를 확인해 보세요. 명령줄 인터페이스 대안을 찾고 있다면, Docker Model Runner는 LLM 배포에 대한 다른 접근 방식을 제공합니다. 동시 트래픽이나 큐잉이 단일 Ollama 인스턴스에 부담을 줄 경우, Ollama에서 vLLM으로: 로컬 LLM 서버 마이그레이션 시기에서는 마이그레이션 신호와 단계별 롤아웃 계획을 안내합니다.
Ollama 설치 (다운로드 및 CLI 설치)
- 옵션 1: 웹사이트에서 다운로드
- ollama.com에 방문하여 운영 체제(Mac, Linux 또는 Windows)에 맞는 설치 프로그램을 다운로드하세요.
- 옵션 2: 명령줄을 통한 설치
- Mac 및 Linux 사용자는 다음 명령어를 사용하세요:
curl -fsSL https://ollama.com/install.sh | sh
- 화면 지시를 따르고 요청 시 비밀번호를 입력하세요.
Ollama 시스템 요구 사항 (RAM, 저장소, CPU)
- 운영 체제: Mac, Linux 또는 Windows
- 메모리 (RAM): 최소 8GB, 16GB 이상 권장
- 저장소: 최소 약 10GB의 여유 공간 필요 (모델 파일은 매우 커질 수 있으므로, Ollama 모델을 다른 드라이브로 이동 가이드를 참고하세요)
- 프로세서: 비교적 최신 CPU (지난 5년 내 제품). Ollama가 다양한 CPU 아키텍처를如何利用하는지 궁금하다면, Ollama가 Intel CPU 성능 및 효율 코어를如何利用하는지 분석을 참조하세요.
심각한 AI 워크로드의 경우 하드웨어 옵션을 비교해 볼 수 있습니다. 우리는 NVIDIA DGX Spark vs Mac Studio vs RTX-4080의 Ollama 성능을 벤치매했으며, 고급 하드웨어 투자를 고려한다면 DGX Spark 가격 및 기능 비교에서 상세한 비용 분석을 제공합니다.
기본 Ollama CLI 명령어
| 명령어 | 설명 |
|---|---|
ollama serve |
Ollama 서버 시작 (기본 포트 11434). |
ollama run <model> |
지정된 모델을 상호작용형 REPL에서 실행합니다. |
ollama pull <model> |
지정된 모델을 시스템으로 다운로드합니다. |
ollama push <model> |
모델을 Ollama 레지스트리에 업로드합니다. |
ollama list |
다운로드된 모든 모델을 나열합니다. ollama ls와 동일합니다. |
ollama ps |
현재 실행 중(로딩됨)인 모델을 표시합니다. |
ollama stop <model> |
실행 중인 모델을 중지(언로드)합니다. |
ollama rm <model> |
시스템에서 모델을 제거합니다. |
ollama cp <source> <dest> |
로컬에서 새 이름으로 모델을 복사합니다. |
ollama show <model> |
모델에 대한 세부 정보(아키텍처, 매개변수, 템플릿 등)를 표시합니다. |
ollama create <model> |
Modelfile에서 새 모델을 생성합니다. |
ollama launch [integration] |
AI 코딩 어시스턴트(Claude Code, Codex, Droid, OpenCode)의 제로 구성 시작. |
ollama signin |
Ollama 레지스트리 인증 (프라이빗 모델 및 클라우드 모델 사용 가능). |
ollama signout |
Ollama 레지스트리 로그아웃. |
ollama help |
모든 명령어에 대한 도움말을 제공합니다. |
바로 가기 링크: Ollama serve 명령어 · Ollama launch 명령어 · Ollama run 명령어 · Ollama run 플래그 · Ollama ps 명령어 · Ollama show 명령어 · Ollama signin · Ollama CLI 기본 · 성능 조절 knob (OLLAMA_NUM_PARALLEL) · 병렬 요청 심층 분석
Ollama CLI (개요)
Ollama CLI는 모델을 관리하고 로컬에서 실행/제공하기 위한 명령줄 인터페이스입니다. 대부분의 워크플로우는 다음으로 요약됩니다:
- 서버 시작:
ollama serve - 모델 실행:
ollama run <model> - 로딩/실행 상태 확인:
ollama ps - 모델 관리:
ollama pull,ollama list,ollama rm
Ollama 모델 관리: pull 및 list 모델 명령어
모델 목록 보기:
ollama list
다음과 동일합니다:
ollama ls
이 명령어는 시스템에 다운로드된 모든 모델과 HDD/SSD상의 파일 크기를 나열합니다.
$ ollama ls
NAME ID SIZE MODIFIED
deepseek-r1:8b 6995872bfe4c 5.2 GB 2 weeks ago
gemma3:12b-it-qat 5d4fa005e7bb 8.9 GB 2 weeks ago
LoTUs5494/mistral-small-3.1:24b-instruct-2503-iq4_NL 4e994e0f85a0 13 GB 3 weeks ago
dengcao/Qwen3-Embedding-8B:Q4_K_M d3ca2355027f 4.7 GB 4 weeks ago
dengcao/Qwen3-Embedding-4B:Q5_K_M 7e8c9ad6885b 2.9 GB 4 weeks ago
qwen3:8b 500a1f067a9f 5.2 GB 5 weeks ago
qwen3:14b bdbd181c33f2 9.3 GB 5 weeks ago
qwen3:30b-a3b 0b28110b7a33 18 GB 5 weeks ago
devstral:24b c4b2fa0c33d7 14 GB 5 weeks ago
모델 다운로드: ollama pull
ollama pull mistral-nemo:12b-instruct-2407-q6_K
이 명령어는 지정된 모델(예: Gemma 2B 또는 mistral-nemo:12b-instruct-2407-q6_K)을 시스템으로 다운로드합니다. 모델 파일은 매우 클 수 있으므로 하드 드라이브 또는 SSD에서 모델이 사용하는 공간을 주의 깊게 확인하세요. 모든 Ollama 모델을 홈 디렉토리에서 더 크고 좋은 다른 드라이브로 이동하는 것도 고려해 볼 만합니다.
모델 업로드: ollama push
ollama push my-custom-model
로컬 모델을 Ollama 레지스트리에 업로드하여 다른 사용자가 pull할 수 있게 합니다.
먼저 로그인(ollama signin)해야 하며, 모델 이름에는 Ollama 사용자 이름이 접두사로 붙어야 합니다(예: myuser/my-model).
HTTP를 통해 프라이빗 레지스트리에 푸시하는 경우 --insecure를 사용하세요:
ollama push myuser/my-model --insecure
모델 복사: ollama cp
ollama cp llama3.2 my-llama3-variant
아무것도 다시 다운로드하지 않고 새 이름으로 모델의 로컬 복사본을 생성합니다. Modelfile을 편집하기 전에 유용합니다 — 먼저 복사하고, 복사본을 커스터마이저하고, 원본을 그대로 유지하세요:
ollama cp qwen3:14b qwen3-14b-custom
ollama create qwen3-14b-custom -f ./Modelfile
Ollama show 명령어
ollama show는 다운로드된 모델에 대한 정보를 출력합니다.
ollama show qwen3:14b
기본적으로 모델 카드(아키텍처, 컨텍스트 길이, 임베딩 길이, 양자화 등)를 출력합니다. 다음 세 가지 유용한 플래그가 있습니다:
| 플래그 | 표시되는 내용 |
|---|---|
--modelfile |
모델을 생성하는 데 사용된 전체 Modelfile (FROM, SYSTEM, TEMPLATE, PARAMETER 행) |
--parameters |
매개변수 블록만 (예: num_ctx, temperature, stop 토큰) |
--verbose |
텐서 모양 및 레이어 수를 포함한 확장된 메타데이터 |
# 모델이 구축된 시스템 프롬프트 및 템플릿을 정확히 확인
ollama show deepseek-r1:8b --modelfile
# 컨텍스트 윈도우 크기 및 기타 추론 매개변수 확인
ollama show qwen3:14b --parameters
# 전체 텐서 수준 세부 정보 (양자화 디버깅 시 유용)
ollama show llama3.2 --verbose
--modelfile 출력은 모델을 커스터마이징하기 전에 특히 유용합니다: 처음부터 작성하는 대신 기본 Modelfile을 복사하고 거기서 수정할 수 있습니다.
Ollama serve 명령어
ollama serve는 로컬 Ollama 서버를 시작합니다 (기본 HTTP 포트 11434).
ollama serve
“ollama serve” 명령어 (systemd 친화적 예제):
# 환경 변수 설정 후 서버 시작
# 호스트의 IP 주소에서 ollama 사용 가능하게 설정
export OLLAMA_HOST=0.0.0.0:11434
export OLLAMA_NUM_PARALLEL=2
ollama serve
Ollama run 명령어
모델 실행:
ollama run gpt-oss:20b
이 명령어는 지정된 모델을 시작하고 상호작용을 위한 인터랙티브 REPL을 엽니다. Ollama가 여러 동시 요청을 어떻게 관리하는지 이해하고 싶으신가요? Ollama가 병렬 요청을 처리하는 방법에 대한 심층 분석에서 더 알아보세요.
ollama run은 모델을 인터랙티브 세션에서 실행하므로,
gpt-oss:120b의 경우 다음과 같은 것을 보게 될 것입니다:
$ ollama run gpt-oss:120b
>>> Send a message (/? for help)
질문이나 명령어를 입력하면 모델이 응답합니다.
>>> who are you?
Thinking...
The user asks "who are you?" Simple question. Should respond as ChatGPT, an AI language model, trained by OpenAI,
etc. Provide brief intro. Probably ask if they need help.
...done thinking.
I’m ChatGPT, an AI language model created by OpenAI. I’ve been trained on a wide range of text so I can help
answer questions, brainstorm ideas, explain concepts, draft writing, troubleshoot problems, and much more. Think
of me as a versatile virtual assistant—here to provide information, support, and conversation whenever you need
it. How can I help you today?
>>> Send a message (/? for help)
인터랙티브 ollama 세션을 종료하려면 Ctrl+D를 누르거나 /bye를 입력하면 됩니다. 결과는 동일합니다:
>>> /bye
$
Ollama run 명령어 예제
비인터랙티브 모드에서 모델을 실행하고 단일 질문을 하려면:
printf "Give me 10 bash one-liners for log analysis.\n" | ollama run llama3.2
ollama 세션에서 자세한 verbose LLM 응답을 보고 싶다면 --verbose 또는 -v 파라미터로 모델을 실행하세요:
$ ollama run gpt-oss:20b --verbose
>>> who are you?
Thinking...
We need to respond to a simple question: "who are you?" The user is asking "who are you?" We can answer that we
are ChatGPT, a large language model trained by OpenAI. We can also mention capabilities. The user likely expects
a brief introduction. We'll keep it friendly.
...done thinking.
I’m ChatGPT, a large language model created by OpenAI. I’m here to help answer questions, offer explanations,
brainstorm ideas, and chat about a wide range of topics—everything from science and history to creative writing
and everyday advice. Just let me know what you’d like to talk about!
total duration: 1.118585707s
load duration: 106.690543ms
prompt eval count: 71 token(s)
prompt eval duration: 30.507392ms
prompt eval rate: 2327.30 tokens/s
eval count: 132 token(s)
eval duration: 945.801569ms
eval rate: 139.56 tokens/s
>>> /bye
$
네, 맞습니다. 초당 139 토큰입니다. gpt-oss:20b는 매우 빠릅니다. 저처럼 16GB VRAM을 갖춘 GPU를 가지고 계신다면, 16GB VRAM GPU용 최고의 Ollama LLM에서 LLM 속도 비교 세부 정보를 확인하세요.
팁: 여러 애플리케이션에서 HTTP를 통해 모델을 사용하려면 ollama serve로 서버를 시작하고 긴 인터랙티브 세션 대신 API 클라이언트를 사용하세요.
Ollama run 플래그 (전체 참조)
| 플래그 | 설명 |
|---|---|
--verbose / -v |
각 응답 후 타이밍 통계(토큰/초, 로딩 시간 등) 출력 |
-p, --parameters |
Modelfile 없이 인라인으로 모델 매개변수 전달 (아래 참조) |
--format string |
특정 출력 형식 강제, 예: json |
--nowordwrap |
자동 단어 줄 바꿈 비활성화 — 스크립트로 출력을 파이프할 때 유용 |
--insecure |
HTTP를 통해 레지스트리에 연결 허용 (프라이빗/자체 호스팅 레지스트리용) |
Modelfile 없이 모델 매개변수 오버라이드 (-p / –parameters)
-p 플래그를 사용하면 Modelfile을 생성하지 않고 런타임에 추론 매개변수를 변경할 수 있습니다.
여러 -p 플래그를 쌓을 수 있습니다:
# 컨텍스트 윈도우 증가 및 temperature 낮추기
ollama run qwen3:14b -p num_ctx=32768 -p temperature=0.5
# 결정론적 출력으로 코딩 작업 실행
ollama run devstral:24b -p temperature=0 -p num_ctx=65536
이렇게 설정할 수 있는 일반적인 매개변수:
| 매개변수 | 효과 |
|---|---|
num_ctx |
토큰 단위의 컨텍스트 윈도우 크기 (기본값은 모델에 따라 다름, 보통 2048–4096) |
temperature |
무작위성: 0 = 결정론적, 1 = 창의적 |
top_p |
핵 샘플링(Nucleus sampling) 임계값 |
top_k |
어휘를 상위-K 토큰으로 제한 |
num_predict |
생성할 최대 토큰 수 (-1 = 무제한) |
repeat_penalty |
토큰 반복에 대한 페널티 |
REPL에서의 멀티라인 입력
텍스트를 세 개의 따옴표(""")로 감싸서 조기 제출 없이 멀티라인 프롬프트를 입력하세요:
>>> """Summarise this in one sentence:
... The quick brown fox jumps over the lazy dog.
... It happened on a Tuesday.
... """
멀티모달 모델 (이미지)
비전 기능이 있는 모델(예: gemma3, llava)의 경우 이미지 경로를 프롬프트에 직접 전달하세요:
ollama run gemma3 "What's in this image? /home/user/screenshot.png"
CLI를 통한 임베딩 생성
임베딩 모델은 텍스트 대신 JSON 배열을 출력합니다. 빠른 일회성 임베딩을 위해 텍스트를 직접 파이프하세요:
echo "Hello world" | ollama run nomic-embed-text
프로덕션 임베딩 워크로드에는 대신 /api/embeddings REST 엔드포인트 또는 Python 클라이언트를 사용하세요.
JSON 출력 강제 (–format)
ollama run llama3.2 --format json "List 5 capital cities as JSON"
모델은 유효한 JSON을 반환하도록 지시됩니다. 출력을 jq나 구조화된 데이터를 기대하는 스크립트에 파이프할 때 유용합니다.
Ollama stop 명령어
이 명령어는 지정된 실행 중인 모델을 중지합니다.
ollama stop llama3.1:8b-instruct-q8_0
Ollama는 일정 시간이 지나면 모델을 자동으로 제거합니다.
이 시간을 지정할 수 있으며 기본값은 4분입니다.
남은 시간을 기다리지 않으려면 이 ollama stop 명령어를 사용할 수 있습니다.
또한 /generate API 엔드포인트에 매개변수 keep_alive=0을 호출하여 모델을 VRAM에서 강제로 제거할 수 있으며, 설명 및 예제는 아래를 참조하세요.
Ollama ps 명령어
ollama ps는 현재 실행 중인 모델 및 세션을 표시합니다 (“왜 내 VRAM이 가득 차 있죠?” 디버깅에 유용).
ollama ps
ollama ps 출력 예제는 다음과 같습니다:
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b 17052f91a42e 14 GB 100% GPU 4096 4 minutes from now
내 PC에서 gpt-oss:20b가 GPU의 16GB VRAM에 잘 맞으며, 단 14GB만 차지하고 있음을 볼 수 있습니다.
ollama run gpt-oss:120b를 실행한 후 ollama ps를 호출하면 결과는 그리 밝지 않습니다:
레이어의 78%가 CPU에 있으며, 이는 컨텍스트 윈도우가 4096 토큰일 뿐입니다. 컨텍스트를 늘리면 더 늘어날 것입니다.
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b a951a23b46a1 66 GB 78%/22% CPU/GPU 4096 4 minutes from now
Ollama launch 명령어 (AI 코딩 통합)
ollama launch는 **Ollama v0.15 (2026년 1월)**에서 도입된 명령어로, 로컬 Ollama 서버에 대해 인기 있는 AI 코딩 어시스턴트의 제로 구성, 한 줄 설정을 제공합니다.
왜 ollama launch를 사용해야 할까요?
ollama launch 이전에는 Claude Code 또는 Codex와 같은 코딩 에이전트를 로컬 Ollama 백엔드에 연결하려면 환경 변수를 수동으로 설정하고, 도구를 올바른 API 엔드포인트로 가리키며, 호환 가능한 모델을 선택해야 했습니다. ollama launch는 이를 모두 대화식으로 처리해 줍니다.
이미 로컬에서 Ollama를 실행 중이고 API 호출 비용을 지불하거나 코드를 클라우드에 보내지 않고 에이전틱 코딩 어시스턴트를 원한다면, ollama launch가 가장 빠른 경로입니다.
지원되는 통합
| 통합 | 설명 |
|---|---|
claude |
Anthropic의 Claude Code — 에이전틱 코딩 어시스턴트 |
codex |
OpenAI의 Codex CLI 코딩 어시스턴트 |
droid |
Factory의 AI 코딩 에이전트 |
opencode |
오픈소스 코딩 어시스턴트 |
기본 사용법
# 인터랙티브 선택기 — 메뉴에서 통합 선택
ollama launch
# 특정 통합 직접 시작
ollama launch claude
# 특정 모델로 시작
ollama launch claude --model qwen3-coder
# 통합을 시작하지 않고 구성 (설정 검사에 유용)
ollama launch droid --config
권장 모델
코딩 에이전트는 전체 파일 컨텍스트와 다중 턴 대화 기록을 보유하려면 긴 컨텍스트 윈도우가 필요합니다. Ollama는 최소 64,000 토큰의 컨텍스트가 있는 모델을 권장합니다:
| 모델 | 참고 사항 |
|---|---|
qwen3-coder |
강력한 코딩 성능, 긴 컨텍스트, 로컬 실행 |
glm-4.7-flash |
빠른 로컬 옵션 |
devstral:24b |
Mistral의 코딩 중심 모델 |
GPU가 모델을 수용할 수 없는 경우, Ollama는 클라우드 호스팅 변형(예: qwen3-coder:480b-cloud)도 제공합니다. 이는 동일한 방식으로 통합되지만 추론을 Ollama의 클라우드 계층으로 라우팅하므로 ollama signin이 필요합니다.
예제: Ollama로 로컬에서 Claude Code 실행
# 1. 모델이 사용 가능한지 확인
ollama pull qwen3-coder
# 2. 이를 대상으로 Claude Code 시작
ollama launch claude --model qwen3-coder
Ollama는 필요한 환경 변수를 설정하고 자동으로 http://localhost:11434를 가리키며 Claude Code를 시작합니다.
그러면 평소처럼 Claude Code를 사용할 수 있으며 — 유일한 차이점은 추론이 자체 하드웨어에서 발생한다는 것입니다.
성능 조절 knob (OLLAMA_NUM_PARALLEL)
부하 시 큐잉 또는 타임아웃이 발생한다면, 먼저 배워야 할 knob은 **OLLAMA_NUM_PARALLEL**입니다.
OLLAMA_NUM_PARALLEL= Ollama가 병렬로 실행하는 요청 수.- 값이 높으면 처리량이 증가할 수 있지만, VRAM 압력과 지연 시간 급증이 발생할 수 있습니다.
빠른 예제:
OLLAMA_NUM_PARALLEL=2 ollama serve
전체 설명(튜닝 전략 및 실패 모드 포함)은 다음을 참조하세요:
VRAM에서 Ollama 모델 방출 (keep_alive)
모델이 VRAM(GPU 메모리)에 로드되면 사용이 끝나도 그대로 유지됩니다. 모델을 VRAM에서 명시적으로 방출하고 GPU 메모리를 해제하려면 keep_alive: 0과 함께 Ollama API에 요청을 보낼 수 있습니다.
- curl을 사용하여 VRAM에서 모델 방출:
curl http://localhost:11434/api/generate -d '{"model": "MODELNAME", "keep_alive": 0}'
MODELNAME을 실제 모델 이름으로 교체하세요, 예:
curl http://localhost:11434/api/generate -d '{"model": "qwen3:14b", "keep_alive": 0}'
- Python을 사용하여 VRAM에서 모델 방출:
import requests
response = requests.post(
'http://localhost:11434/api/generate',
json={'model': 'qwen3:14b', 'keep_alive': 0}
)
이는 다음 경우에 특히 유용합니다:
- GPU 메모리를 다른 애플리케이션을 위해 해제해야 할 때
- 여러 모델을 실행 중이며 VRAM 사용량을 관리하고 싶을 때
- 대형 모델을 사용했고 자원을 즉시 해제하고 싶을 때
참고: keep_alive 매개변수는 마지막 요청 후 모델이 메모리에 로드된 상태를 유지하는 시간(초)을 제어합니다. 0으로 설정하면 모델이 VRAM에서 즉시 언로드됩니다.
Ollama의 추상화 레이어를 완전히 피하고 언제든지 어떤 GGUF 모델이驻留하는지 직접 제어하고 싶다면, llama-server 라우터 모드에서는 llama.cpp 네이티브 방식의 동적 모델 전환을 다룹니다.
Ollama 모델 커스터마이징 (시스템 프롬프트, Modelfile)
-
시스템 프롬프트 설정: Ollama REPL 내부에서 모델의 동작을 커스터마이징하기 위해 시스템 프롬프트를 설정할 수 있습니다:
>>> /set system For all questions asked answer in plain English avoiding technical jargon as much as possible >>> /save ipe >>> /bye그런 다음 커스터마이징된 모델을 실행하세요:
ollama run ipe이는 시스템 프롬프트를 설정하고 향후 사용을 위해 모델을 저장합니다.
-
커스텀 모델 파일 생성: 다음 구조로 텍스트 파일(예:
custom_model.txt)을 생성하세요:FROM llama3.1 SYSTEM [Your custom instructions here]그런 다음 실행하세요:
ollama create mymodel -f custom_model.txt ollama run mymodel이는 파일의 지침을 기반으로 커스터마이징된 모델을 생성합니다".
Ollama signin 및 signout (레지스트리 인증)
ollama signin
ollama signout
ollama signin은 로컬 Ollama 설치를 ollama.com의 Ollama 레지스트리와 인증합니다. 로그인하면 클라이언트는 자격 증명을 로컬에 저장하고 subsequent 명령어에 자동으로 재사용합니다.
signin이 잠금을 해제하는 것:
- 계정 또는 조직에서 프라이빗 모델 pull 및 push.
- 로컬에서 실행하기에 너무 큰 클라우드 호스팅 모델(예:
qwen3-coder:480b-cloud) 사용. ollama push로 레지스트리에 모델 게시.
대안: API 키 인증
CI 파이프라인이나 인터랙티브 ollama signin이 실용적이지 않은 헤드리스 서버에서 Ollama를 실행 중인 경우, Ollama 계정 설정에서 API 키를 생성하고 환경 변수로 노출하세요:
export OLLAMA_API_KEY=ollama_...
ollama pull myorg/private-model
OLLAMA_API_KEY 변수는 모든 Ollama 명령어 및 API 요청에서 자동으로 인식되므로 각 머신에서 ollama signin을 실행할 필요가 없습니다.
파일과 함께 Ollama run 명령어 사용 (요약, 리디렉션)
-
파일에서 텍스트 요약:
ollama run llama3.2 "Summarize the content of this file in 50 words." < input.txt이 명령어는 지정된 모델을 사용하여
input.txt의 내용을 요약합니다. -
모델 응답을 파일로 로깅:
ollama run llama3.2 "Tell me about renewable energy." > output.txt이 명령어는 모델의 응답을
output.txt에 저장합니다.
Ollama CLI 사용 사례 (텍스트 생성, 분석)
-
텍스트 생성:
- 대형 텍스트 파일 요약:
ollama run llama3.2 "Summarize the following text:" < long-document.txt - 콘텐츠 생성:
ollama run llama3.2 "Write a short article on the benefits of using AI in healthcare." > article.txt - 특정 질문에 답변:
ollama run llama3.2 "What are the latest trends in AI, and how will they affect healthcare?"
.
- 대형 텍스트 파일 요약:
-
데이터 처리 및 분석:
- 텍스트를 긍정, 부정 또는 중립 감정 분류:
ollama run llama3.2 "Analyze the sentiment of this customer review: 'The product is fantastic, but delivery was slow.'" - 텍스트를 사전 정의된 카테고리로 분류: 사전 정의된 기준에 따라 텍스트를 분류하거나 카테고리화하려면 유사한 명령어를 사용하세요.
- 텍스트를 긍정, 부정 또는 중립 감정 분류:
Python과 함께 Ollama 사용 (클라이언트 및 API)
- Ollama Python 라이브러리 설치:
pip install ollama - Python을 사용하여 텍스트 생성:
이 코드 스니펫은 지정된 모델 및 프롬프트를 사용하여 텍스트를 생성합니다.
import ollama response = ollama.generate(model='gemma:2b', prompt='what is a qubit?') print(response['response'])
고급 Python 통합을 위해 Python에서 Ollama의 웹 검색 API 사용하기를 탐색해 보세요. 여기에는 웹 검색 기능, 도구 호출 및 MCP 서버 통합이 포함됩니다. AI 기반 애플리케이션을 구축 중이라면, AI 코딩 어시스턴트 비교가 개발에 적합한 도구를 선택하는 데 도움이 될 수 있습니다.
웹 기반 인터페이스를 찾고 계신가요? Open WebUI는 RAG 기능과 다중 사용자 지원을 갖춘 자체 호스팅 인터페이스를 제공합니다. 고성능 프로덕션 배포를 고려한다면 vLLM을 대안으로 검토해 보세요. Ollama를 다른 로컬 및 클라우드 LLM 인프라 선택지와 비교하려면 LLM 호스팅: 로컬, 자체 호스팅 및 클라우드 인프라 비교를 참조하세요.
유용한 링크
구성 및 관리
대안 및 비교
- 로컬 LLM 호스팅: 2026 완전 가이드 - Ollama, vLLM, LocalAI, Jan, LM Studio 등
- vLLM 퀵스타트: 고성능 LLM 서빙
- Docker Model Runner vs Ollama: 무엇을 선택해야 할까요?
- Ollama Enshittification의 첫 징후
- Ollama에서 vLLM으로: 로컬 LLM 서버 마이그레이션 시기
성능 및 하드웨어
- Ollama가 병렬 요청을 처리하는 방법
- Ollama가 Intel CPU 성능 및 효율 코어를如何利用하는지
- NVIDIA DGX Spark vs Mac Studio vs RTX-4080: Ollama 성능 비교
- DGX Spark vs. Mac Studio: NVIDIA의 개인 AI 슈퍼컴퓨터에 대한 실용적, 가격 확인된 전망