Шпаргалка по CLI Ollama: команды ls, serve, run, ps и другие (обновление 2026)

Обновлённый список команд Ollama — ls, ps, run, serve и др.

Содержимое страницы

Этот шпаргалка по Ollama CLI фокусируется на командах, которые вы используете каждый день (ollama ls, ollama serve, ollama run, ollama ps, управление моделями и типовые рабочие процессы), с примерами, которые можно скопировать и вставить.

Она также включает короткий раздел «Настройки производительности», чтобы помочь вам изучить (а затем глубоко разобраться) в OLLAMA_NUM_PARALLEL и связанных настройках.

ollama cheatsheet

Эта шпаргалка по Ollama фокусируется на командах CLI, управлении моделями и настройке, но здесь также есть несколько вызовов curl.

Для полного понимания того, где Ollama находится среди локальных, self-hosted и облачных опций — включая vLLM, Docker Model Runner, LocalAI и облачных провайдеров — см. Хостинг LLM: Сравнение локальной, self-hosted и облачной инфраструктуры. Если вы сравниваете различные решения для локального хостинга LLM, ознакомьтесь с нашей комплексным сравнением Ollama, vLLM, LocalAI, Jan, LM Studio и других. Для тех, кто ищет альтернативы интерфейсам командной строки, Docker Model Runner предлагает другой подход к развертыванию LLM. Если параллельный трафик или очереди начинают перегружать один экземпляр Ollama, Ollama to vLLM: Когда мигрировать ваш локальный сервер LLM описывает сигналы миграции и поэтапный план развертывания.

Установка Ollama (скачивание и установка через CLI)

  • Вариант 1: Скачивание с сайта
    • Перейдите на ollama.com и скачайте установщик для вашей операционной системы (Mac, Linux или Windows).
  • Вариант 2: Установка через командную строку
    • Для пользователей Mac и Linux используйте команду:
curl -fsSL https://ollama.com/install.sh | sh
  • Следуйте инструкциям на экране и введите пароль, если потребуется.

Системные требования Ollama (ОЗУ, хранилище, ЦП)

Для серьезных AI-нагрузок вы можете захотеть сравнить аппаратные варианты. Мы провели бенчмарки NVIDIA DGX Spark vs Mac Studio vs RTX-4080 производительность с Ollama, и если вы рассматриваете инвестиции в высококлассное оборудование, наш сравнение цен и возможностей DGX Spark предоставляет детальный анализ стоимости.

Базовые команды Ollama CLI

Команда Описание
ollama serve Запускает сервер Ollama (порт по умолчанию 11434).
ollama run <model> Запускает указанную модель в интерактивном режиме REPL.
ollama pull <model> Скачивает указанную модель на вашу систему.
ollama push <model> Загружает модель в реестр Ollama.
ollama list Список всех загруженных моделей. То же самое, что ollama ls.
ollama ps Показывает запущенные (загруженные) модели.
ollama stop <model> Останавливает (выгружает) запущенную модель.
ollama rm <model> Удаляет модель из вашей системы.
ollama cp <source> <dest> Копирует модель под новым именем локально.
ollama show <model> Отображает детали о модели (архитектура, параметры, шаблон и т.д.).
ollama create <model> Создает новую модель из Modelfile.
ollama launch [integration] Запуск без настроек AI-ассистентов для кодирования (Claude Code, Codex, Droid, OpenCode).
ollama signin Аутентификация в реестре Ollama (включает частные модели и облачные модели).
ollama signout Выход из реестра Ollama.
ollama help Предоставляет справку по любой команде.

Ссылки для быстрого перехода: Команда Ollama serve · Команда Ollama launch · Команда Ollama run · Флаги Ollama run · Команда Ollama ps · Команда Ollama show · Ollama signin · Основы Ollama CLI · Настройки производительности (OLLAMA_NUM_PARALLEL) · Глубокое погружение в параллельные запросы

Ollama CLI (что это такое)

Ollama CLI — это интерфейс командной строки для управления моделями и их запуска/обслуживания локально. Большинство рабочих процессов сводятся к:

  • Запуск сервера: ollama serve
  • Запуск модели: ollama run <model>
  • Просмотр загруженных/запущенных: ollama ps
  • Управление моделями: ollama pull, ollama list, ollama rm

Управление моделями Ollama: команды pull и list

Список моделей:

ollama list

то же самое, что:

ollama ls

Эта команда выводит список всех моделей, загруженных в вашу систему, с указанием их размеров на жестком диске/SSD, например:

$ ollama ls
NAME                                                    ID              SIZE      MODIFIED     
deepseek-r1:8b                                          6995872bfe4c    5.2 GB    2 недели назад     
gemma3:12b-it-qat                                       5d4fa005e7bb    8.9 GB    2 недели назад     
LoTUs5494/mistral-small-3.1:24b-instruct-2503-iq4_NL    4e994e0f85a0    13 GB     3 недели назад     
dengcao/Qwen3-Embedding-8B:Q4_K_M                       d3ca2355027f    4.7 GB    4 недели назад     
dengcao/Qwen3-Embedding-4B:Q5_K_M                       7e8c9ad6885b    2.9 GB    4 недели назад     
qwen3:8b                                                500a1f067a9f    5.2 GB    5 недель назад     
qwen3:14b                                               bdbd181c33f2    9.3 GB    5 недель назад     
qwen3:30b-a3b                                           0b28110b7a33    18 GB     5 недель назад     
devstral:24b                                            c4b2fa0c33d7    14 GB     5 недель назад  

Загрузка модели: ollama pull

ollama pull mistral-nemo:12b-instruct-2407-q6_K

Эта команда загружает указанную модель (например, Gemma 2B или mistral-nemo:12b-instruct-2407-q6_K) в вашу систему. Файлы моделей могут быть довольно большими, поэтому следите за местом, занимаемым моделями на жестком диске или SSD. Вы даже можете захотеть переместить все модели Ollama из домашней папки на другой, более крупный и лучший диск

Загрузка модели: ollama push

ollama push my-custom-model

Загружает локальную модель в реестр Ollama, чтобы другие могли ее скачать. Сначала необходимо войти в систему (ollama signin), и имя модели должно иметь префикс с вашим именем пользователя Ollama, например, myuser/my-model. Используйте --insecure, если вы загружаете в частный реестр по HTTP:

ollama push myuser/my-model --insecure

Копирование модели: ollama cp

ollama cp llama3.2 my-llama3-variant

Создает локальную копию модели под новым именем без повторной загрузки. Это удобно перед редактированием Modelfile — сначала скопируйте, настройте копию и сохраните оригинал:

ollama cp qwen3:14b qwen3-14b-custom
ollama create qwen3-14b-custom -f ./Modelfile

Команда Ollama show

ollama show выводит информацию о загруженной модели.

ollama show qwen3:14b

По умолчанию она выводит карточку модели (архитектура, длина контекста, длина эмбеддинга, квантование и т.д.). Есть три полезных флага:

Флаг Что показывает
--modelfile Полный Modelfile, использованный для создания модели (строки FROM, SYSTEM, TEMPLATE, PARAMETER)
--parameters Только блок параметров (например, num_ctx, temperature, токены stop)
--verbose Расширенные метаданные, включая формы тензоров и количество слоев
# Посмотрите, с каким системным промптом и шаблоном была создана модель
ollama show deepseek-r1:8b --modelfile

# Проверьте размер контекстного окна и другие параметры вывода
ollama show qwen3:14b --parameters

# Полная детальность на уровне тензоров (полезно при отладке квантования)
ollama show llama3.2 --verbose

Вывод --modelfile особенно полезен перед настройкой модели: вы можете скопировать базовый Modelfile и редактировать его, вместо того чтобы писать с нуля.

Команда Ollama serve

ollama serve запускает локальный сервер Ollama (HTTP-порт по умолчанию 11434).

ollama serve

Команда “ollama serve” (пример, совместимый с systemd):

# установите переменные окружения, затем запустите сервер
# сделайте ollama доступным по IP-адресу хоста
export OLLAMA_HOST=0.0.0.0:11434
export OLLAMA_NUM_PARALLEL=2
ollama serve

Команда Ollama run

Запуск модели:

ollama run gpt-oss:20b

Эта команда запускает указанную модель и открывает интерактивный REPL для взаимодействия. Хотите понять, как Ollama управляет несколькими параллельными запросами? Узнайте больше о том, как Ollama обрабатывает параллельные запросы в нашем детальном анализе.

ollama run запускает модель в интерактивной сессии, так что в случае с gpt-oss:120b вы увидите что-то вроде:

$ ollama run gpt-oss:120b
>>> Отправьте сообщение (/? для справки)

вы можете вводить свои вопросы или команды, и модель ответит.

>>> кто вы?
Думаю...
Пользователь спрашивает "кто вы?" Простой вопрос. Нужно ответить как ChatGPT, языковая модель AI, обученная OpenAI, 
и т.д. Дать краткое введение. Вероятно, спросить, нужна ли помощь.
...закончил думать.

Я ChatGPT, языковая модель AI, созданная OpenAI. Я обучен на широком спектре текстов, чтобы помочь 
отвечать на вопросы, генерировать идеи, объяснять концепции, писать черновики, устранять неполадки и многое другое. Считайте 
меня универсальным виртуальным помощником — здесь, чтобы предоставлять информацию, поддержку и вести беседу, когда вам это нужно. Чем я могу помочь вам сегодня?

>>> Отправьте сообщение (/? для справки)

Чтобы выйти из интерактивной сессии ollama, нажмите Ctrl+D, или вы можете ввести /bye, результат будет тот же:

>>> /bye
$ 

Примеры команды Ollama run

Чтобы запустить модель и задать один вопрос в неинтерактивном режиме:

printf "Дайте мне 10 однострочных bash-команд для анализа логов.\n" | ollama run llama3.2

Если вы хотите видеть подробный развернутый ответ LLM в сессии ollama — запустите модель с параметром --verbose или -v:

$ ollama run gpt-oss:20b --verbose
>>> кто вы?
Думаю...
Нам нужно ответить на простой вопрос: "кто вы?" Пользователь спрашивает "кто вы?" Мы можем ответить, что 
мы ChatGPT, большая языковая модель, обученная OpenAI. Мы также можем упомянуть возможности. Пользователь, вероятно, ожидает 
краткого введения. Мы сделаем его дружелюбным.
...закончил думать.

Я ChatGPT, большая языковая модель, созданная OpenAI. Я здесь, чтобы помогать отвечать на вопросы, предлагать объяснения, 
генерировать идеи и общаться на самые разные темы — от науки и истории до креативного письма 
и повседневных советов. Просто дайте мне знать, о чем вы хотите поговорить!

общее время:       1.118585707s
время загрузки:        106.690543ms
кол-во токенов промпта:    71 токен(ы)
время оценки промпта: 30.507392ms
скорость оценки промпта:     2327.30 токенов/с
кол-во токенов генерации:           132 токен(ы)
время генерации:        945.801569ms
скорость генерации:            139.56 токенов/с
>>> /bye
$ 

Да, это правильно, это 139 токенов в секунду. Модель gpt-oss:20b очень быстрая. Если у вас, как и у меня, есть GPU с 16 ГБ VRAM — смотрите детали сравнения скорости LLM в Лучшие LLM для Ollama на GPU с 16 ГБ VRAM.

Совет: Если вы хотите, чтобы модель была доступна по HTTP для нескольких приложений, запустите сервер с помощью ollama serve и используйте API-клиент вместо длинных интерактивных сессий.

Флаги команды Ollama run (полная справка)

Флаг Описание
--verbose / -v Выводить статистику времени (токены/с, время загрузки и т.д.) после каждого ответа
-p, --parameters Передавать параметры модели встроенно без Modelfile (см. ниже)
--format string Принудительно задать формат вывода, например, json
--nowordwrap Отключить автоматический перенос слов — полезно при передаче вывода в скрипты
--insecure Разрешить подключение к реестру по HTTP (для частных/self-hosted реестров)

Переопределение параметров модели без Modelfile (-p / –parameters)

Флаг -p позволяет изменять параметры вывода во время выполнения без создания Modelfile. Вы можете использовать несколько флагов -p:

# Увеличьте контекстное окно и снизьте температуру
ollama run qwen3:14b -p num_ctx=32768 -p temperature=0.5

# Выполните задачу по кодированию с детерминированным выводом
ollama run devstral:24b -p temperature=0 -p num_ctx=65536

Общие параметры, которые можно установить таким образом:

Параметр Эффект
num_ctx Размер контекстного окна в токенах (по умолчанию зависит от модели, часто 2048–4096)
temperature Случайность: 0 = детерминированный, 1 = творческий
top_p Порог ядерной выборки
top_k Ограничивает словарь до топ-K токенов
num_predict Максимальное количество генерируемых токенов (-1 = без ограничений)
repeat_penalty Штраф за повторение токенов

Многострочный ввод в REPL

Оберните текст в тройные кавычки ("""), чтобы ввести многострочный промпт без преждевременной отправки:

>>> """Суммируйте это в одном предложении:
... Быстрая коричневая лиса прыгает через ленивую собаку.
... Это произошло во вторник.
... """

Мультимодальные модели (изображения)

Для моделей с поддержкой зрения (например, gemma3, llava), передайте путь к изображению прямо в промпте:

ollama run gemma3 "Что на этом изображении? /home/user/screenshot.png"

Генерация эмбеддингов через CLI

Модели эмбеддингов выводят JSON-массив вместо текста. Передавайте текст напрямую для быстрых одноразовых эмбеддингов:

echo "Hello world" | ollama run nomic-embed-text

Для производственных нагрузок эмбеддингов используйте REST-эндпоинт /api/embeddings или Python-клиент.

Принудительный вывод JSON (–format)

ollama run llama3.2 --format json "Перечислите 5 столиц в формате JSON"

Моделя инструктируется возвращать валидный JSON. Полезно при передаче вывода в jq или скрипт, ожидающий структурированные данные.

Команда Ollama stop

Эта команда останавливает указанную запущенную модель.

ollama stop llama3.1:8b-instruct-q8_0

Ollama выгружает модели автоматически через некоторое время. Вы можете указать это время, по умолчанию оно составляет 4 минуты. Если вы не хотите ждать оставшееся время, вам может пригодиться эта команда ollama stop. Вы также можете выгрузить модель из VRAM, вызвав эндпоинт API /generate с параметром keep_alive=0, см. описание и пример ниже.

Команда Ollama ps

ollama ps показывает запущенные модели и сессии (полезно для отладки вопроса «почему моя VRAM заполнена?»).

ollama ps

Пример вывода ollama ps приведен ниже:

NAME           ID              SIZE     PROCESSOR    CONTEXT    UNTIL
gpt-oss:20b    17052f91a42e    14 GB    100% GPU     4096       4 минуты отныне

Вы видите, что на моем ПК gpt-oss:20b хорошо помещается в 16 ГБ VRAM моего GPU, и занял только 14 ГБ.

Если я выполню ollama run gpt-oss:120b, а затем вызову ollama ps, результат будет не таким радужным: 78% слоев на CPU, и это только при контекстном окне 4096 токенов. Будет больше, если мне нужно будет увеличить контекст.

NAME            ID              SIZE     PROCESSOR          CONTEXT    UNTIL
gpt-oss:120b    a951a23b46a1    66 GB    78%/22% CPU/GPU    4096       4 минуты отныне

Команда Ollama launch (интеграции с AI-кодированием)

ollama launch — это команда, представленная в Ollama v0.15 (январь 2026 года), которая позволяет вам настроить без настроек, одной строкой, популярные AI-ассистенты для кодирования, работающие против вашего локального сервера Ollama.

Зачем использовать ollama launch?

До ollama launch настройка агентного кодера, такого как Claude Code или Codex, для локального бэкенда Ollama означала ручную установку переменных окружения, указание инструмента на правильный эндпоинт API и выбор совместимой модели. ollama launch делает все это для вас интерактивно.

Если вы уже запускаете Ollama локально и хотите агентного кодингового ассистента, не платя за вызовы API или не отправляя код в облако, ollama launch — самый быстрый путь.

Поддерживаемые интеграции

Интеграция Что это
claude Claude Code от Anthropic — агентный ассистент для кодирования
codex Codex CLI от OpenAI — ассистент для кодирования
droid AI-агент для кодирования от Factory
opencode Ассистент для кодирования с открытым исходным кодом

Базовое использование

# Интерактивный выборщик — выберите интеграцию из меню
ollama launch

# Запустить конкретную интеграцию напрямую
ollama launch claude

# Запустить с конкретной моделью
ollama launch claude --model qwen3-coder

# Настроить интеграцию без запуска (полезно для проверки настроек)
ollama launch droid --config

Рекомендуемые модели

Агентам для кодирования нужно длинное контекстное окно для удержания контекста целого файла и истории многооборотного разговора. Ollama рекомендует модели с контекстом как минимум 64 000 токенов:

Модель Примечания
qwen3-coder Сильная производительность в кодировании, длинный контекст, работает локально
glm-4.7-flash Быстрая локальная опция
devstral:24b Модель от Mistral, ориентированная на кодирование

Если ваша GPU не может вместить модель, Ollama также предлагает облачные варианты (например, qwen3-coder:480b-cloud), которые интегрируются таким же образом, но маршрутизируют вывод в облачный уровень Ollama — требуется ollama signin.

Пример: запуск Claude Code локально с Ollama

# 1. Убедитесь, что модель доступна
ollama pull qwen3-coder

# 2. Запустить Claude Code против нее
ollama launch claude --model qwen3-coder

Ollama устанавливает необходимые переменные окружения и запускает Claude Code, указывая на http://localhost:11434 автоматически. Затем вы можете использовать Claude Code точно так же, как обычно — единственная разница в том, что вывод происходит на вашем собственном оборудовании.

Настройки производительности (OLLAMA_NUM_PARALLEL)

Если вы видите очереди или тайм-ауты под нагрузкой, первым рычагом, который нужно изучить, является OLLAMA_NUM_PARALLEL.

  • OLLAMA_NUM_PARALLEL = сколько запросов Ollama выполняет параллельно.
  • Более высокое значение может увеличить пропускную способность, но может увеличить давление на VRAM и скачки задержки.

Быстрый пример:

OLLAMA_NUM_PARALLEL=2 ollama serve

Для полного объяснения (включая стратегии настройки и режимы отказа) см.:

Освобождение модели Ollama из VRAM (keep_alive)

Когда модель загружена в VRAM (память GPU), она остается там даже после того, как вы закончили с ней работу. Чтобы явно освободить модель из VRAM и высвободить память GPU, вы можете отправить запрос в API Ollama с keep_alive: 0.

  • Освободить модель из VRAM с помощью curl:
curl http://localhost:11434/api/generate -d '{"model": "MODELNAME", "keep_alive": 0}'

Замените MODELNAME на фактическое имя вашей модели, например:

curl http://localhost:11434/api/generate -d '{"model": "qwen3:14b", "keep_alive": 0}'
  • Освободить модель из VRAM с помощью Python:
import requests

response = requests.post(
    'http://localhost:11434/api/generate',
    json={'model': 'qwen3:14b', 'keep_alive': 0}
)

Это особенно полезно, когда:

  • Вам нужно освободить память GPU для других приложений
  • Вы запускаете несколько моделей и хотите управлять использованием VRAM
  • Вы закончили работу с большой моделью и хотите немедленно освободить ресурсы

Примечание: Параметр keep_alive контролирует, сколько времени (в секундах) модель остается загруженной в памяти после последнего запроса. Установка его в 0 немедленно выгружает модель из VRAM.

Если вы предпочитаете полностью избежать абстракционного слоя Ollama и хотите прямой контроль над тем, какая модель GGUF резидентна в любой момент, режим маршрутизации llama-server охватывает нативный для llama.cpp подход к динамическому переключению моделей.

Настройка моделей Ollama (системный промпт, Modelfile)

  • Установка системного промпта: Внутри REPL Ollama вы можете установить системный промпт, чтобы настроить поведение модели:

    >>> /set system На все заданные вопросы отвечайте на простом английском, избегая технического жаргона по возможности
    >>> /save ipe
    >>> /bye
    

    Затем запустите настроенную модель:

    ollama run ipe
    

    Это устанавливает системный промпт и сохраняет модель для будущего использования.

  • Создание пользовательского файла модели: Создайте текстовый файл (например, custom_model.txt) со следующей структурой:

    FROM llama3.1
    SYSTEM [Ваши пользовательские инструкции здесь]
    

    Затем выполните:

    ollama create mymodel -f custom_model.txt
    ollama run mymodel
    

    Это создает настроенную модель на основе инструкций в файле".

Ollama signin и signout (аутентификация в реестре)

ollama signin
ollama signout

ollama signin аутентифицирует вашу локальную установку Ollama в реестре Ollama на ollama.com. После входа клиент хранит учетные данные локально и автоматически использует их для последующих команд.

Что открывает signin:

  • Загрузка и выгрузка частных моделей из вашего аккаунта или организации.
  • Использование облачных моделей (например, qwen3-coder:480b-cloud), которые слишком велики для локального запуска.
  • Публикация моделей в реестр с помощью ollama push.

Альтернатива: аутентификация по API-ключу

Если вы запускаете Ollama в CI-пайплайне или на безголовом сервере, где интерактивный ollama signin непрактичен, создайте API-ключ в настройках вашего аккаунта Ollama и экспортируйте его как переменную окружения:

export OLLAMA_API_KEY=ollama_...
ollama pull myorg/private-model

Переменная OLLAMA_API_KEY автоматически подхватывается каждой командой Ollama и запросом API — нет необходимости запускать ollama signin на каждой машине.

Использование команды Ollama run с файлами (суммаризация, редирект)

  • Суммаризация текста из файла:

    ollama run llama3.2 "Суммируйте содержимое этого файла в 50 словах." < input.txt
    

    Эта команда суммирует содержимое input.txt с использованием указанной модели.

  • Логирование ответов модели в файл:

    ollama run llama3.2 "Расскажите мне о возобновляемой энергии." > output.txt
    

    Эта команда сохраняет ответ модели в output.txt.

Случаи использования Ollama CLI (генерация текста, анализ)

  • Генерация текста:

    • Суммаризация большого текстового файла:
      ollama run llama3.2 "Суммируйте следующий текст:" < long-document.txt
      
    • Генерация контента:
      ollama run llama3.2 "Напишите короткую статью о преимуществах использования AI в здравоохранении." > article.txt
      
    • Ответы на конкретные вопросы:
      ollama run llama3.2 "Каковы последние тренды в AI и как они повлияют на здравоохранение?"
      

    .

  • Обработка и анализ данных:

    • Классификация текста на позитивный, негативный или нейтральный сентимент:
      ollama run llama3.2 "Проанализируйте сентимент этого отзыва клиента: 'Продукт фантастический, но доставка была медленной.'"
      
    • Категоризация текста по предопределенным категориям: Используйте аналогичные команды для классификации или категоризации текста на основе предопределенных критериев.

Использование Ollama с Python (клиент и API)

  • Установка библиотеки Ollama для Python:
    pip install ollama
    
  • Генерация текста с использованием Python:
    import ollama
    
    response = ollama.generate(model='gemma:2b', prompt='что такое кубит?')
    print(response['response'])
    
    Этот фрагмент кода генерирует текст с использованием указанной модели и промпта.

Для продвинутой интеграции с Python изучите использование API веб-поиска Ollama в Python, который охватывает возможности веб-поиска, вызов инструментов и интеграцию с MCP-серверами. Если вы создаете AI-приложения, наше сравнение AI-ассистентов для кодирования поможет вам выбрать правильные инструменты для разработки.

Ищете веб-интерфейс? Open WebUI предоставляет self-hosted интерфейс с возможностями RAG и поддержкой нескольких пользователей. Для высокопроизводительных производственных развертываний рассмотрите vLLM как альтернативу. Чтобы сравнить Ollama с другими локальными и облачными вариантами инфраструктуры LLM, см. Хостинг LLM: Сравнение локальной, self-hosted и облачной инфраструктуры.

Полезные ссылки

Конфигурация и управление

Альтернативы и сравнения

Производительность и оборудование

Интеграция и разработка

Подписаться

Получайте новые материалы про системы, инфраструктуру и AI engineering.