Шпаргалка по CLI Ollama: команды ls, serve, run, ps и другие (обновление 2026)
Обновлённый список команд Ollama — ls, ps, run, serve и др.
Этот шпаргалка по Ollama CLI фокусируется на командах, которые вы используете каждый день (ollama ls, ollama serve, ollama run, ollama ps, управление моделями и типовые рабочие процессы), с примерами, которые можно скопировать и вставить.
Она также включает короткий раздел «Настройки производительности», чтобы помочь вам изучить (а затем глубоко разобраться) в OLLAMA_NUM_PARALLEL и связанных настройках.

Эта шпаргалка по Ollama фокусируется на командах CLI, управлении моделями и настройке, но здесь также есть несколько вызовов curl.
Для полного понимания того, где Ollama находится среди локальных, self-hosted и облачных опций — включая vLLM, Docker Model Runner, LocalAI и облачных провайдеров — см. Хостинг LLM: Сравнение локальной, self-hosted и облачной инфраструктуры. Если вы сравниваете различные решения для локального хостинга LLM, ознакомьтесь с нашей комплексным сравнением Ollama, vLLM, LocalAI, Jan, LM Studio и других. Для тех, кто ищет альтернативы интерфейсам командной строки, Docker Model Runner предлагает другой подход к развертыванию LLM. Если параллельный трафик или очереди начинают перегружать один экземпляр Ollama, Ollama to vLLM: Когда мигрировать ваш локальный сервер LLM описывает сигналы миграции и поэтапный план развертывания.
Установка Ollama (скачивание и установка через CLI)
- Вариант 1: Скачивание с сайта
- Перейдите на ollama.com и скачайте установщик для вашей операционной системы (Mac, Linux или Windows).
- Вариант 2: Установка через командную строку
- Для пользователей Mac и Linux используйте команду:
curl -fsSL https://ollama.com/install.sh | sh
- Следуйте инструкциям на экране и введите пароль, если потребуется.
Системные требования Ollama (ОЗУ, хранилище, ЦП)
- Операционная система: Mac, Linux или Windows
- Память (RAM): Минимум 8 ГБ, рекомендуется 16 ГБ и более
- Хранилище: Как минимум ~10 ГБ свободного места (файлы моделей могут быть очень большими, подробнее см. здесь Перемещение моделей Ollama на другой диск )
- Процессор: Относительно современный процессор (последних 5 лет). Если вам интересно, как Ollama использует различные архитектуры CPU, см. наш анализ того, как Ollama использует производительные и энергоэффективные ядра Intel CPU.
Для серьезных AI-нагрузок вы можете захотеть сравнить аппаратные варианты. Мы провели бенчмарки NVIDIA DGX Spark vs Mac Studio vs RTX-4080 производительность с Ollama, и если вы рассматриваете инвестиции в высококлассное оборудование, наш сравнение цен и возможностей DGX Spark предоставляет детальный анализ стоимости.
Базовые команды Ollama CLI
| Команда | Описание |
|---|---|
ollama serve |
Запускает сервер Ollama (порт по умолчанию 11434). |
ollama run <model> |
Запускает указанную модель в интерактивном режиме REPL. |
ollama pull <model> |
Скачивает указанную модель на вашу систему. |
ollama push <model> |
Загружает модель в реестр Ollama. |
ollama list |
Список всех загруженных моделей. То же самое, что ollama ls. |
ollama ps |
Показывает запущенные (загруженные) модели. |
ollama stop <model> |
Останавливает (выгружает) запущенную модель. |
ollama rm <model> |
Удаляет модель из вашей системы. |
ollama cp <source> <dest> |
Копирует модель под новым именем локально. |
ollama show <model> |
Отображает детали о модели (архитектура, параметры, шаблон и т.д.). |
ollama create <model> |
Создает новую модель из Modelfile. |
ollama launch [integration] |
Запуск без настроек AI-ассистентов для кодирования (Claude Code, Codex, Droid, OpenCode). |
ollama signin |
Аутентификация в реестре Ollama (включает частные модели и облачные модели). |
ollama signout |
Выход из реестра Ollama. |
ollama help |
Предоставляет справку по любой команде. |
Ссылки для быстрого перехода: Команда Ollama serve · Команда Ollama launch · Команда Ollama run · Флаги Ollama run · Команда Ollama ps · Команда Ollama show · Ollama signin · Основы Ollama CLI · Настройки производительности (OLLAMA_NUM_PARALLEL) · Глубокое погружение в параллельные запросы
Ollama CLI (что это такое)
Ollama CLI — это интерфейс командной строки для управления моделями и их запуска/обслуживания локально. Большинство рабочих процессов сводятся к:
- Запуск сервера:
ollama serve - Запуск модели:
ollama run <model> - Просмотр загруженных/запущенных:
ollama ps - Управление моделями:
ollama pull,ollama list,ollama rm
Управление моделями Ollama: команды pull и list
Список моделей:
ollama list
то же самое, что:
ollama ls
Эта команда выводит список всех моделей, загруженных в вашу систему, с указанием их размеров на жестком диске/SSD, например:
$ ollama ls
NAME ID SIZE MODIFIED
deepseek-r1:8b 6995872bfe4c 5.2 GB 2 недели назад
gemma3:12b-it-qat 5d4fa005e7bb 8.9 GB 2 недели назад
LoTUs5494/mistral-small-3.1:24b-instruct-2503-iq4_NL 4e994e0f85a0 13 GB 3 недели назад
dengcao/Qwen3-Embedding-8B:Q4_K_M d3ca2355027f 4.7 GB 4 недели назад
dengcao/Qwen3-Embedding-4B:Q5_K_M 7e8c9ad6885b 2.9 GB 4 недели назад
qwen3:8b 500a1f067a9f 5.2 GB 5 недель назад
qwen3:14b bdbd181c33f2 9.3 GB 5 недель назад
qwen3:30b-a3b 0b28110b7a33 18 GB 5 недель назад
devstral:24b c4b2fa0c33d7 14 GB 5 недель назад
Загрузка модели: ollama pull
ollama pull mistral-nemo:12b-instruct-2407-q6_K
Эта команда загружает указанную модель (например, Gemma 2B или mistral-nemo:12b-instruct-2407-q6_K) в вашу систему. Файлы моделей могут быть довольно большими, поэтому следите за местом, занимаемым моделями на жестком диске или SSD. Вы даже можете захотеть переместить все модели Ollama из домашней папки на другой, более крупный и лучший диск
Загрузка модели: ollama push
ollama push my-custom-model
Загружает локальную модель в реестр Ollama, чтобы другие могли ее скачать.
Сначала необходимо войти в систему (ollama signin), и имя модели должно иметь префикс с вашим именем пользователя Ollama, например, myuser/my-model.
Используйте --insecure, если вы загружаете в частный реестр по HTTP:
ollama push myuser/my-model --insecure
Копирование модели: ollama cp
ollama cp llama3.2 my-llama3-variant
Создает локальную копию модели под новым именем без повторной загрузки. Это удобно перед редактированием Modelfile — сначала скопируйте, настройте копию и сохраните оригинал:
ollama cp qwen3:14b qwen3-14b-custom
ollama create qwen3-14b-custom -f ./Modelfile
Команда Ollama show
ollama show выводит информацию о загруженной модели.
ollama show qwen3:14b
По умолчанию она выводит карточку модели (архитектура, длина контекста, длина эмбеддинга, квантование и т.д.). Есть три полезных флага:
| Флаг | Что показывает |
|---|---|
--modelfile |
Полный Modelfile, использованный для создания модели (строки FROM, SYSTEM, TEMPLATE, PARAMETER) |
--parameters |
Только блок параметров (например, num_ctx, temperature, токены stop) |
--verbose |
Расширенные метаданные, включая формы тензоров и количество слоев |
# Посмотрите, с каким системным промптом и шаблоном была создана модель
ollama show deepseek-r1:8b --modelfile
# Проверьте размер контекстного окна и другие параметры вывода
ollama show qwen3:14b --parameters
# Полная детальность на уровне тензоров (полезно при отладке квантования)
ollama show llama3.2 --verbose
Вывод --modelfile особенно полезен перед настройкой модели: вы можете скопировать базовый Modelfile и редактировать его, вместо того чтобы писать с нуля.
Команда Ollama serve
ollama serve запускает локальный сервер Ollama (HTTP-порт по умолчанию 11434).
ollama serve
Команда “ollama serve” (пример, совместимый с systemd):
# установите переменные окружения, затем запустите сервер
# сделайте ollama доступным по IP-адресу хоста
export OLLAMA_HOST=0.0.0.0:11434
export OLLAMA_NUM_PARALLEL=2
ollama serve
Команда Ollama run
Запуск модели:
ollama run gpt-oss:20b
Эта команда запускает указанную модель и открывает интерактивный REPL для взаимодействия. Хотите понять, как Ollama управляет несколькими параллельными запросами? Узнайте больше о том, как Ollama обрабатывает параллельные запросы в нашем детальном анализе.
ollama run запускает модель в интерактивной сессии,
так что в случае с gpt-oss:120b вы увидите что-то вроде:
$ ollama run gpt-oss:120b
>>> Отправьте сообщение (/? для справки)
вы можете вводить свои вопросы или команды, и модель ответит.
>>> кто вы?
Думаю...
Пользователь спрашивает "кто вы?" Простой вопрос. Нужно ответить как ChatGPT, языковая модель AI, обученная OpenAI,
и т.д. Дать краткое введение. Вероятно, спросить, нужна ли помощь.
...закончил думать.
Я ChatGPT, языковая модель AI, созданная OpenAI. Я обучен на широком спектре текстов, чтобы помочь
отвечать на вопросы, генерировать идеи, объяснять концепции, писать черновики, устранять неполадки и многое другое. Считайте
меня универсальным виртуальным помощником — здесь, чтобы предоставлять информацию, поддержку и вести беседу, когда вам это нужно. Чем я могу помочь вам сегодня?
>>> Отправьте сообщение (/? для справки)
Чтобы выйти из интерактивной сессии ollama, нажмите Ctrl+D, или вы можете ввести /bye, результат будет тот же:
>>> /bye
$
Примеры команды Ollama run
Чтобы запустить модель и задать один вопрос в неинтерактивном режиме:
printf "Дайте мне 10 однострочных bash-команд для анализа логов.\n" | ollama run llama3.2
Если вы хотите видеть подробный развернутый ответ LLM в сессии ollama — запустите модель с параметром --verbose или -v:
$ ollama run gpt-oss:20b --verbose
>>> кто вы?
Думаю...
Нам нужно ответить на простой вопрос: "кто вы?" Пользователь спрашивает "кто вы?" Мы можем ответить, что
мы ChatGPT, большая языковая модель, обученная OpenAI. Мы также можем упомянуть возможности. Пользователь, вероятно, ожидает
краткого введения. Мы сделаем его дружелюбным.
...закончил думать.
Я ChatGPT, большая языковая модель, созданная OpenAI. Я здесь, чтобы помогать отвечать на вопросы, предлагать объяснения,
генерировать идеи и общаться на самые разные темы — от науки и истории до креативного письма
и повседневных советов. Просто дайте мне знать, о чем вы хотите поговорить!
общее время: 1.118585707s
время загрузки: 106.690543ms
кол-во токенов промпта: 71 токен(ы)
время оценки промпта: 30.507392ms
скорость оценки промпта: 2327.30 токенов/с
кол-во токенов генерации: 132 токен(ы)
время генерации: 945.801569ms
скорость генерации: 139.56 токенов/с
>>> /bye
$
Да, это правильно, это 139 токенов в секунду. Модель gpt-oss:20b очень быстрая. Если у вас, как и у меня, есть GPU с 16 ГБ VRAM — смотрите детали сравнения скорости LLM в Лучшие LLM для Ollama на GPU с 16 ГБ VRAM.
Совет: Если вы хотите, чтобы модель была доступна по HTTP для нескольких приложений, запустите сервер с помощью ollama serve и используйте API-клиент вместо длинных интерактивных сессий.
Флаги команды Ollama run (полная справка)
| Флаг | Описание |
|---|---|
--verbose / -v |
Выводить статистику времени (токены/с, время загрузки и т.д.) после каждого ответа |
-p, --parameters |
Передавать параметры модели встроенно без Modelfile (см. ниже) |
--format string |
Принудительно задать формат вывода, например, json |
--nowordwrap |
Отключить автоматический перенос слов — полезно при передаче вывода в скрипты |
--insecure |
Разрешить подключение к реестру по HTTP (для частных/self-hosted реестров) |
Переопределение параметров модели без Modelfile (-p / –parameters)
Флаг -p позволяет изменять параметры вывода во время выполнения без создания Modelfile.
Вы можете использовать несколько флагов -p:
# Увеличьте контекстное окно и снизьте температуру
ollama run qwen3:14b -p num_ctx=32768 -p temperature=0.5
# Выполните задачу по кодированию с детерминированным выводом
ollama run devstral:24b -p temperature=0 -p num_ctx=65536
Общие параметры, которые можно установить таким образом:
| Параметр | Эффект |
|---|---|
num_ctx |
Размер контекстного окна в токенах (по умолчанию зависит от модели, часто 2048–4096) |
temperature |
Случайность: 0 = детерминированный, 1 = творческий |
top_p |
Порог ядерной выборки |
top_k |
Ограничивает словарь до топ-K токенов |
num_predict |
Максимальное количество генерируемых токенов (-1 = без ограничений) |
repeat_penalty |
Штраф за повторение токенов |
Многострочный ввод в REPL
Оберните текст в тройные кавычки ("""), чтобы ввести многострочный промпт без преждевременной отправки:
>>> """Суммируйте это в одном предложении:
... Быстрая коричневая лиса прыгает через ленивую собаку.
... Это произошло во вторник.
... """
Мультимодальные модели (изображения)
Для моделей с поддержкой зрения (например, gemma3, llava), передайте путь к изображению прямо в промпте:
ollama run gemma3 "Что на этом изображении? /home/user/screenshot.png"
Генерация эмбеддингов через CLI
Модели эмбеддингов выводят JSON-массив вместо текста. Передавайте текст напрямую для быстрых одноразовых эмбеддингов:
echo "Hello world" | ollama run nomic-embed-text
Для производственных нагрузок эмбеддингов используйте REST-эндпоинт /api/embeddings или Python-клиент.
Принудительный вывод JSON (–format)
ollama run llama3.2 --format json "Перечислите 5 столиц в формате JSON"
Моделя инструктируется возвращать валидный JSON. Полезно при передаче вывода в jq или скрипт, ожидающий структурированные данные.
Команда Ollama stop
Эта команда останавливает указанную запущенную модель.
ollama stop llama3.1:8b-instruct-q8_0
Ollama выгружает модели автоматически через некоторое время.
Вы можете указать это время, по умолчанию оно составляет 4 минуты.
Если вы не хотите ждать оставшееся время, вам может пригодиться эта команда ollama stop.
Вы также можете выгрузить модель из VRAM, вызвав эндпоинт API /generate с параметром keep_alive=0, см. описание и пример ниже.
Команда Ollama ps
ollama ps показывает запущенные модели и сессии (полезно для отладки вопроса «почему моя VRAM заполнена?»).
ollama ps
Пример вывода ollama ps приведен ниже:
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b 17052f91a42e 14 GB 100% GPU 4096 4 минуты отныне
Вы видите, что на моем ПК gpt-oss:20b хорошо помещается в 16 ГБ VRAM моего GPU, и занял только 14 ГБ.
Если я выполню ollama run gpt-oss:120b, а затем вызову ollama ps, результат будет не таким радужным:
78% слоев на CPU, и это только при контекстном окне 4096 токенов. Будет больше, если мне нужно будет увеличить контекст.
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b a951a23b46a1 66 GB 78%/22% CPU/GPU 4096 4 минуты отныне
Команда Ollama launch (интеграции с AI-кодированием)
ollama launch — это команда, представленная в Ollama v0.15 (январь 2026 года), которая позволяет вам настроить без настроек, одной строкой, популярные AI-ассистенты для кодирования, работающие против вашего локального сервера Ollama.
Зачем использовать ollama launch?
До ollama launch настройка агентного кодера, такого как Claude Code или Codex, для локального бэкенда Ollama означала ручную установку переменных окружения, указание инструмента на правильный эндпоинт API и выбор совместимой модели. ollama launch делает все это для вас интерактивно.
Если вы уже запускаете Ollama локально и хотите агентного кодингового ассистента, не платя за вызовы API или не отправляя код в облако, ollama launch — самый быстрый путь.
Поддерживаемые интеграции
| Интеграция | Что это |
|---|---|
claude |
Claude Code от Anthropic — агентный ассистент для кодирования |
codex |
Codex CLI от OpenAI — ассистент для кодирования |
droid |
AI-агент для кодирования от Factory |
opencode |
Ассистент для кодирования с открытым исходным кодом |
Базовое использование
# Интерактивный выборщик — выберите интеграцию из меню
ollama launch
# Запустить конкретную интеграцию напрямую
ollama launch claude
# Запустить с конкретной моделью
ollama launch claude --model qwen3-coder
# Настроить интеграцию без запуска (полезно для проверки настроек)
ollama launch droid --config
Рекомендуемые модели
Агентам для кодирования нужно длинное контекстное окно для удержания контекста целого файла и истории многооборотного разговора. Ollama рекомендует модели с контекстом как минимум 64 000 токенов:
| Модель | Примечания |
|---|---|
qwen3-coder |
Сильная производительность в кодировании, длинный контекст, работает локально |
glm-4.7-flash |
Быстрая локальная опция |
devstral:24b |
Модель от Mistral, ориентированная на кодирование |
Если ваша GPU не может вместить модель, Ollama также предлагает облачные варианты (например, qwen3-coder:480b-cloud), которые интегрируются таким же образом, но маршрутизируют вывод в облачный уровень Ollama — требуется ollama signin.
Пример: запуск Claude Code локально с Ollama
# 1. Убедитесь, что модель доступна
ollama pull qwen3-coder
# 2. Запустить Claude Code против нее
ollama launch claude --model qwen3-coder
Ollama устанавливает необходимые переменные окружения и запускает Claude Code, указывая на http://localhost:11434 автоматически.
Затем вы можете использовать Claude Code точно так же, как обычно — единственная разница в том, что вывод происходит на вашем собственном оборудовании.
Настройки производительности (OLLAMA_NUM_PARALLEL)
Если вы видите очереди или тайм-ауты под нагрузкой, первым рычагом, который нужно изучить, является OLLAMA_NUM_PARALLEL.
OLLAMA_NUM_PARALLEL= сколько запросов Ollama выполняет параллельно.- Более высокое значение может увеличить пропускную способность, но может увеличить давление на VRAM и скачки задержки.
Быстрый пример:
OLLAMA_NUM_PARALLEL=2 ollama serve
Для полного объяснения (включая стратегии настройки и режимы отказа) см.:
Освобождение модели Ollama из VRAM (keep_alive)
Когда модель загружена в VRAM (память GPU), она остается там даже после того, как вы закончили с ней работу. Чтобы явно освободить модель из VRAM и высвободить память GPU, вы можете отправить запрос в API Ollama с keep_alive: 0.
- Освободить модель из VRAM с помощью curl:
curl http://localhost:11434/api/generate -d '{"model": "MODELNAME", "keep_alive": 0}'
Замените MODELNAME на фактическое имя вашей модели, например:
curl http://localhost:11434/api/generate -d '{"model": "qwen3:14b", "keep_alive": 0}'
- Освободить модель из VRAM с помощью Python:
import requests
response = requests.post(
'http://localhost:11434/api/generate',
json={'model': 'qwen3:14b', 'keep_alive': 0}
)
Это особенно полезно, когда:
- Вам нужно освободить память GPU для других приложений
- Вы запускаете несколько моделей и хотите управлять использованием VRAM
- Вы закончили работу с большой моделью и хотите немедленно освободить ресурсы
Примечание: Параметр keep_alive контролирует, сколько времени (в секундах) модель остается загруженной в памяти после последнего запроса. Установка его в 0 немедленно выгружает модель из VRAM.
Если вы предпочитаете полностью избежать абстракционного слоя Ollama и хотите прямой контроль над тем, какая модель GGUF резидентна в любой момент, режим маршрутизации llama-server охватывает нативный для llama.cpp подход к динамическому переключению моделей.
Настройка моделей Ollama (системный промпт, Modelfile)
-
Установка системного промпта: Внутри REPL Ollama вы можете установить системный промпт, чтобы настроить поведение модели:
>>> /set system На все заданные вопросы отвечайте на простом английском, избегая технического жаргона по возможности >>> /save ipe >>> /byeЗатем запустите настроенную модель:
ollama run ipeЭто устанавливает системный промпт и сохраняет модель для будущего использования.
-
Создание пользовательского файла модели: Создайте текстовый файл (например,
custom_model.txt) со следующей структурой:FROM llama3.1 SYSTEM [Ваши пользовательские инструкции здесь]Затем выполните:
ollama create mymodel -f custom_model.txt ollama run mymodelЭто создает настроенную модель на основе инструкций в файле".
Ollama signin и signout (аутентификация в реестре)
ollama signin
ollama signout
ollama signin аутентифицирует вашу локальную установку Ollama в реестре Ollama на ollama.com. После входа клиент хранит учетные данные локально и автоматически использует их для последующих команд.
Что открывает signin:
- Загрузка и выгрузка частных моделей из вашего аккаунта или организации.
- Использование облачных моделей (например,
qwen3-coder:480b-cloud), которые слишком велики для локального запуска. - Публикация моделей в реестр с помощью
ollama push.
Альтернатива: аутентификация по API-ключу
Если вы запускаете Ollama в CI-пайплайне или на безголовом сервере, где интерактивный ollama signin непрактичен, создайте API-ключ в настройках вашего аккаунта Ollama и экспортируйте его как переменную окружения:
export OLLAMA_API_KEY=ollama_...
ollama pull myorg/private-model
Переменная OLLAMA_API_KEY автоматически подхватывается каждой командой Ollama и запросом API — нет необходимости запускать ollama signin на каждой машине.
Использование команды Ollama run с файлами (суммаризация, редирект)
-
Суммаризация текста из файла:
ollama run llama3.2 "Суммируйте содержимое этого файла в 50 словах." < input.txtЭта команда суммирует содержимое
input.txtс использованием указанной модели. -
Логирование ответов модели в файл:
ollama run llama3.2 "Расскажите мне о возобновляемой энергии." > output.txtЭта команда сохраняет ответ модели в
output.txt.
Случаи использования Ollama CLI (генерация текста, анализ)
-
Генерация текста:
- Суммаризация большого текстового файла:
ollama run llama3.2 "Суммируйте следующий текст:" < long-document.txt - Генерация контента:
ollama run llama3.2 "Напишите короткую статью о преимуществах использования AI в здравоохранении." > article.txt - Ответы на конкретные вопросы:
ollama run llama3.2 "Каковы последние тренды в AI и как они повлияют на здравоохранение?"
.
- Суммаризация большого текстового файла:
-
Обработка и анализ данных:
- Классификация текста на позитивный, негативный или нейтральный сентимент:
ollama run llama3.2 "Проанализируйте сентимент этого отзыва клиента: 'Продукт фантастический, но доставка была медленной.'" - Категоризация текста по предопределенным категориям: Используйте аналогичные команды для классификации или категоризации текста на основе предопределенных критериев.
- Классификация текста на позитивный, негативный или нейтральный сентимент:
Использование Ollama с Python (клиент и API)
- Установка библиотеки Ollama для Python:
pip install ollama - Генерация текста с использованием Python:
Этот фрагмент кода генерирует текст с использованием указанной модели и промпта.
import ollama response = ollama.generate(model='gemma:2b', prompt='что такое кубит?') print(response['response'])
Для продвинутой интеграции с Python изучите использование API веб-поиска Ollama в Python, который охватывает возможности веб-поиска, вызов инструментов и интеграцию с MCP-серверами. Если вы создаете AI-приложения, наше сравнение AI-ассистентов для кодирования поможет вам выбрать правильные инструменты для разработки.
Ищете веб-интерфейс? Open WebUI предоставляет self-hosted интерфейс с возможностями RAG и поддержкой нескольких пользователей. Для высокопроизводительных производственных развертываний рассмотрите vLLM как альтернативу. Чтобы сравнить Ollama с другими локальными и облачными вариантами инфраструктуры LLM, см. Хостинг LLM: Сравнение локальной, self-hosted и облачной инфраструктуры.
Полезные ссылки
Конфигурация и управление
Альтернативы и сравнения
- Локальный хостинг LLM: Полное руководство 2026 - Ollama, vLLM, LocalAI, Jan, LM Studio и другие
- vLLM Quickstart: Высокопроизводительное обслуживание LLM
- Docker Model Runner vs Ollama: Что выбрать?
- Первые признаки эншиттификации Ollama
- Ollama to vLLM: Когда мигрировать ваш локальный сервер LLM
Производительность и оборудование
- Как Ollama обрабатывает параллельные запросы
- Как Ollama использует производительные и энергоэффективные ядра Intel CPU
- NVIDIA DGX Spark vs Mac Studio vs RTX-4080: Сравнение производительности Ollama
- DGX Spark vs. Mac Studio: Практический взгляд на цены NVIDIA DGX Spark
Интеграция и разработка
- Использование API веб-поиска Ollama в Python
- Сравнение AI-ассистентов для кодирования
- Open WebUI: Self-hosted интерфейс для LLM
- Open-Source Chat UIs для LLM на локальных инстансах Ollama
- Ограничение LLM структурированным выводом: Ollama, Qwen3 & Python или Go
- Интеграция Ollama с Python: примеры REST API и Python-клиента
- Go SDK для Ollama - сравнение с примерами