Сравнение производительности LLM в Ollama на GPU с 16 ГБ VRAM
Тест скорости LLM на RTX 4080 с 16 ГБ видеопамяти
Запуск больших языковых моделей локально обеспечивает конфиденциальность, возможность работы в автономном режиме и нулевые расходы на API. Этот бенчмарк показывает, чего можно ожидать от 14 популярных LLM на Ollama на видеокарте RTX 4080.
Работая с GPU на 16 ГБ видеопамяти (VRAM), я постоянно сталкивался с выбором: большие модели с потенциально более высоким качеством или меньшие модели с более высокой скоростью инференса. Подробнее о производительности LLM — пропускной способности, латентности, лимитах VRAM, параллельных запросах и бенчмарках на разных рантаймах — см. статью Производительность LLM: бенчмарки, узкие места и оптимизация.
В этой статье фокус на Ollama. Для того же класса GPU с 16 ГБ VRAM, измеренных с помощью llama.cpp при контексте 19K, 32K и 64K (VRAM, загрузка GPU, токены в секунду для плотных и MoE-чекпоинтов), см. статью Бенчмарки LLM с 16 ГБ VRAM на llama.cpp (скорость и контекст).
Когда пропускная способность и распределение VRAM выглядят приемлемо, для агентных нагрузок все еще нужны разумные предустановки температуры и штрафов для стеков на базе Qwen и Gemma; см. Параметры агентного инференса для Qwen и Gemma.

Краткие выводы
Вот обновленная таблица сравнения производительности LLM на RTX 4080 16GB с Ollama 0.17.7, (2026-03-09) добавлены модели Qwen 3.5: 9b, 9bq8, 27b и 35b:
| Модель | Использовано RAM+VRAM | Распределение CPU/GPU | Токенов/сек |
|---|---|---|---|
| gpt-oss:20b | 14 ГБ | 100% GPU | 139.93 |
| qwen3.5:9b | 9.3 ГБ | 100% GPU | 90.89 |
| ministral-3:14b | 13 ГБ | 100% GPU | 70.13 |
| qwen3:14b | 12 ГБ | 100% GPU | 61.85 |
| qwen3.5:9b-q8_0 | 13 ГБ | 100% GPU | 61.22 |
| qwen3-coder:30b | 20 ГБ | 25%/75% CPU/GPU | 57.17 |
| qwen3-vl:30b-a3b | 22 ГБ | 30%/70% CPU/GPU | 50.99 |
| glm-4.7-flash | 21 ГБ | 27%/73% CPU/GPU | 33.86 |
| nemotron-3-nano:30b | 25 ГБ | 38%/62% CPU/GPU | 32.77 |
| qwen3.5:35b | 27 ГБ | 43%/57% CPU/GPU | 20.66 |
| devstral-small-2:24b | 19 ГБ | 18%/82% CPU/GPU | 18.67 |
| mistral-small3.2:24b | 19 ГБ | 18%/82% CPU/GPU | 18.51 |
| gpt-oss:120b | 66 ГБ | 78%/22% CPU/GPU | 12.64 |
| qwen3.5:27b | 24 ГБ | 43%/57% CPU/GPU | 6.48 |
Ключевой вывод: Модели, которые полностью помещаются в VRAM, значительно быстрее. GPT-OSS 20B достигает 139.93 токенов/сек, тогда как GPT-OSS 120B с интенсивной выгрузкой на CPU ползет со скоростью 12.64 токена/сек — разница в 11 раз.
Тестовое оборудование
Бенчмарк проводился на следующей системе:
- GPU: NVIDIA RTX 4080 с 16 ГБ VRAM
- CPU: Intel Core i7-14700 (8 производительных ядер + 12 эффективных ядер)
- RAM: 64 ГБ DDR5-6000
Это типичная конфигурация потребительского оборудования высокого класса для локального инференса LLM. 16 ГБ VRAM являются критическим ограничением — именно они определяют, какие модели работают полностью на GPU, а какие требуют выгрузки части данных на CPU.
Понимание того, как Ollama использует ядра Intel CPU становится важным, когда модели превышают объем VRAM, так как производительность CPU напрямую влияет на скорость инференса выгруженных слоев.
Цель бенчмарка
Основной целью было измерение скорости инференса в реалистичных условиях. Я уже знал по опыту, что Mistral Small 3.2 24B превосходен по качеству языка, тогда как Qwen3 14B предлагает лучшее следование инструкциям для моих конкретных задач.
Этот бенчмарк отвечает на практический вопрос: Насколько быстро каждая модель может генерировать текст и какова цена в скорости за превышение лимитов VRAM?
Параметры тестирования были следующими:
- Размер контекста: 19 000 токенов. Это среднее значение в моих запросах на генерацию.
- Промпт: “compare weather and climate between capital cities of australia” (сравнить погоду и климат между столицами Австралии)
- Метрика: eval rate (токенов в секунду во время генерации)
Установка и версия Ollama
Все тесты использовали Ollama версии 0.15.2, которая была последней на момент тестирования. Позже я повторил прогон на Ollama v 0.17.7 - чтобы добавить модели Qwen3.5. Полный справочник команд Ollama, использованных в этом бенчмарке, см. в Шпаргалке по Ollama.
Для быстрой установки - установка Ollama на Linux:
curl -fsSL https://ollama.com/install.sh | sh
Проверка установки:
ollama --version
Если вам нужно хранить модели на другом диске из-за нехватки места, посмотрите, как переместить модели Ollama на другой диск.
Тестированные модели
Следующие модели были протестированы, в алфавитном порядке:
| Модель | Параметры | Квантование | Примечания |
|---|---|---|---|
| devstral-small-2:24b | 24B | Q4_K_M | Ориентированная на код |
| glm-4.7-flash | 30B | Q4_K_M | Мыслительная модель |
| gpt-oss:20b | 20B | Q4_K_M | Самая быстрая в целом |
| gpt-oss:120b | 120B | Q4_K_M | Самая большая из тестированных |
| ministral-3:14b | 14B | Q4_K_M | Эффективная модель от Mistral |
| mistral-small3.2:24b | 24B | Q4_K_M | Высокое качество языка |
| nemotron-3-nano:30b | 30B | Q4_K_M | Предложение от NVIDIA |
| qwen3:14b | 14B | Q4_K_M | Лучшее следование инструкциям |
| qwen3.5:9b | 9B | Q4_K_M | Быстрая, полностью на GPU |
| qwen3.5:9b-q8_0 | 9B | Q8_0 | Более высокое качество, полностью на GPU |
| qwen3.5:27b | 27B | Q4_K_M | Отличное качество, медленная на Ollama |
| qwen3-vl:30b-a3b | 30B | Q4_K_M | Поддержка зрения |
| qwen3-coder:30b | 30B | Q4_K_M | Ориентированная на код |
| qwen3.5:35b | 35B | Q4_K_M | Хорошие возможности для написания кода |
Для загрузки любой модели:
ollama pull gpt-oss:20b
ollama pull qwen3:14b
Понимание выгрузки на CPU
Когда требования к памяти модели превышают доступный VRAM, Ollama автоматически распределяет слои модели между GPU и системной RAM. В выводе это отображается как процентное распределение, например, “18%/82% CPU/GPU”.
Это имеет огромные последствия для производительности. Каждая генерация токена требует передачи данных между памятью CPU и GPU — это узкое место, которое усугубляется с каждым слоем, выгруженным на CPU.
Выводы из наших результатов очевидны:
- Модели 100% на GPU: 61-140 токенов/сек
- Модели 70-82% на GPU: 19-51 токен/сек
- 22% на GPU (в основном CPU): 12.6 токенов/сек
Это объясняет, почему модель с 20B параметров может превосходить модель с 120B параметров в 11 раз на практике. Если вы планируете обслуживать несколько одновременных запросов, понимание того, как Ollama обрабатывает параллельные запросы становится необходимым для планирования емкости. Распределение при выгрузке на CPU выше на самом деле является проблемой бюджета KV-кэша и весов в замаскированном виде — статья KV Cache на GPU с 16 ГБ разбирает точные вычисления и настройки OLLAMA_KV_CACHE_TYPE, позволяющие вернуть запасы памяти, не переходя на меньшую модель.
Подробные результаты бенчмарка
Модели, работающие 100% на GPU
GPT-OSS 20B — Чемпион по скорости
ollama run gpt-oss:20b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:20b 14 GB 100% GPU 19000
eval count: 2856 token(s)
eval duration: 20.410517947s
eval rate: 139.93 tokens/s
С скоростью 139.93 токенов/сек GPT-OSS 20B является явным победителем для приложений, чувствительных к скорости. Он использует только 14 ГБ VRAM, оставляя запас для более больших окон контекста или других GPU-нагрузок.
Qwen3 14B — Отличный баланс
ollama run qwen3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3:14b 12 GB 100% GPU 19000
eval count: 3094 token(s)
eval duration: 50.020594575s
eval rate: 61.85 tokens/s
Qwen3 14B предлагает лучшее следование инструкциям на мой взгляд, с комфортным потреблением памяти в 12 ГБ. С скоростью 61.85 токенов/сек он достаточно отзывчив для интерактивного использования.
Для разработчиков, интегрирующих Qwen3 в приложения, см. Структурированный вывод LLM с Ollama и Qwen3 для извлечения структурированных JSON-ответов.
Ministral 3 14B — Быстрый и компактный
ollama run ministral-3:14b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
ministral-3:14b 13 GB 100% GPU 19000
eval count: 1481 token(s)
eval duration: 21.11734277s
eval rate: 70.13 tokens/s
Более маленькая модель от Mistral достигает 70.13 токенов/сек, полностью помещаясь в VRAM. Это надежный выбор, когда вам нужно качество семейства Mistral на максимальной скорости.
qwen3.5:9b - быстрый и новый
ollama run qwen3.5:9b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b 6488c96fa5fa 9.3 GB 100% GPU 19000
eval count: 3802 token(s)
eval duration: 41.830174597s
eval rate: 90.89 tokens/s
qwen3.5:9b-q8_0 - квантование q8
Это квантование снижает производительность qwen3.5:9b на 30% по сравнению с q4.
ollama run qwen3.5:9b-q8_0 --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:9b-q8_0 441ec31e4d2a 13 GB 100% GPU 19000
eval count: 3526 token(s)
eval duration: 57.595540159s
eval rate: 61.22 tokens/s
Модели, требующие выгрузки на CPU
qwen3-coder:30b - самая быстрая из набора LLM 30b благодаря текстовому формату
ollama run qwen3-coder:30b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3-coder:30b 06c1097efce0 20 GB 25%/75% CPU/GPU 19000
22%/605%
eval count: 559 token(s)
eval duration: 9.77768875s
eval rate: 57.17 tokens/s
Qwen3-VL 30B — Лучшая производительность с частичной выгрузкой
ollama run qwen3-vl:30b-a3b-instruct --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
qwen3-vl:30b-a3b-instruct 22 GB 30%/70% CPU/GPU 19000
eval count: 1450 token(s)
eval duration: 28.439319709s
eval rate: 50.99 tokens/s
Несмотря на то, что 30% слоев находятся на CPU, Qwen3-VL поддерживает скорость 50.99 токенов/сек — быстрее, чем некоторые модели, работающие 100% на GPU. Возможность работы с изображениями добавляет универсальности для мультимодальных задач.
Mistral Small 3.2 24B — Компромисс между качеством и скоростью
ollama run mistral-small3.2:24b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
mistral-small3.2:24b 19 GB 18%/82% CPU/GPU 19000
eval count: 831 token(s)
eval duration: 44.899859038s
eval rate: 18.51 tokens/s
Mistral Small 3.2 предлагает превосходное качество языка, но платит за это высокой ценой в скорости. С 18.51 токеном/сек он ощущается заметно более медленным для интерактивного чата. Стоит того для задач, где качество важнее латентности.
GLM 4.7 Flash — Моющая модель “мыслителя” (MoE)
ollama run glm-4.7-flash --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
glm-4.7-flash 21 GB 27%/73% CPU/GPU 19000
eval count: 2446 token(s)
eval duration: 1m12.239164004s
eval rate: 33.86 tokens/s
GLM 4.7 Flash — это модель Mixture of Experts (MoE) с 30B-A3B параметрами — всего 30B параметров, но только 3B активны на токен. Как “мыслительная” модель, она генерирует внутреннюю логическую цепочку перед ответом. Скорость 33.86 токенов/сек включает как токены размышления, так и токены вывода. Несмотря на выгрузку на CPU, архитектура MoE сохраняет его достаточно быстрым.
qwen3.5:35b - Новая модель с приличной производительностью при самосторожении
ollama run qwen3.5:35b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:35b 4af949f8bdf0 27 GB 43%/57% CPU/GPU 19000
eval count: 3418 token(s)
eval duration: 2m45.458926548s
eval rate: 20.66 tokens/s
GPT-OSS 120B — Тяжеловес
ollama run gpt-oss:120b --verbose
/set parameter num_ctx 19000
NAME SIZE PROCESSOR CONTEXT
gpt-oss:120b 66 GB 78%/22% CPU/GPU 19000
eval count: 5008 token(s)
eval duration: 6m36.168233066s
eval rate: 12.64 tokens/s
Запуск модели 120B на VRAM в 16 ГБ технически возможен, но мучителен. С 78% нагрузки на CPU скорость в 12.64 токенов/сек делает интерактивное использование раздражающим. Лучше подходит для пакетной обработки, где латентность не важна.
qwen3.5:27b - Умная, но медленная на Ollama
ollama run qwen3.5:27b --verbose
/set parameter num_ctx 19000
compare weather and climate between capital cities of australia
NAME ID SIZE PROCESSOR CONTEXT
qwen3.5:27b 193ec05b1e80 24 GB 43%/57% CPU/GPU 19000
eval count: 3370 token(s)
eval duration: 8m40.087510281s
eval rate: 6.48 tokens/s
Я протестировал qwen3.5:27b и получил отличное впечатление от производительности этой модели с OpenCode. Она очень capable, знающая, с действительно хорошим вызовом инструментов, хотя и медленная на моей машине на Ollama. Я пробовал другие платформы самохостинга LLM и получал значительно более высокие скорости. Думаю, пришло время расстаться с Ollama. Напишу об этом немного позже.
Практические рекомендации
Для интерактивного чата
Используйте модели, которые помещаются 100% в VRAM:
- GPT-OSS 20B — Максимальная скорость (139.93 т/с)
- Ministral 3 14B — Хорошая скорость с качеством Mistral (70.13 т/с)
- Qwen3 14B — Лучшее следование инструкциям (61.85 т/с)
Для лучшего опыта чата рассмотрите Open-Source чат-интерфейсы для локального Ollama.
Для пакетной обработки
Это, опять же, на моем оборудовании - 14GB VRAM (прим. перев: в исходнике написано 14GB, но выше было 16GB, оставлено как есть).
Когда скорость менее критична:
- Mistral Small 3.2 24B — Превосходное качество языка
- Qwen3-VL 30B — Возможность работы с зрением и текстом
Когда скорость совсем не критична:
- Qwen3.5:35b - Хорошие возможности для написания кода
- Qwen3.5:27b - Чрезвычайно хороша, но медленная на Ollama. У меня был большой успех в хостинге этой модели на llama.cpp.
Для разработки и написания кода
Если вы создаете приложения с Ollama:
Альтернативные варианты хостинга
Если ограничения Ollama вас беспокоят (см. Беспокойства по поводу деградации Ollama), изучите другие варианты в Гид по локальному хостингу LLM или сравните Docker Model Runner против Ollama.
Заключение
С 16 ГБ VRAM вы можете запускать capable LLM с впечатляющей скоростью — если выберете мудрено. Ключевые выводы:
-
Оставайтесь в пределах лимитов VRAM для интерактивного использования. Модель 20B со скоростью 140 токенов/сек превосходит модель 120B со скоростью 12 токенов/сек для большинства практических задач.
-
GPT-OSS 20B побеждает по чистой скорости, но Qwen3 14B предлагает лучший баланс скорости и возможностей для задач следования инструкциям.
-
Выгрузка на CPU работает, но ожидайте замедления в 3-10 раз. Приемлемо для пакетной обработки, раздражающе для чата.
-
Размер контекста важен. Контекст 19K, использованный здесь, значительно увеличивает использование VRAM. Уменьшите контекст для лучшего использования GPU.
Для ИИ-поиска, объединяющего локальные LLM с результатами из веба, см. Самосторожение Perplexica с Ollama.
Чтобы исследовать больше бенчмарков, компромиссы между VRAM и пропускной способностью, и настройку производительности на Ollama и других рантаймах, загляните в наш хаб Производительность LLM: бенчмарки, узкие места и оптимизация.
Полезные ссылки
Внутренние ресурсы
- Шпаргалка по Ollama: самые полезные команды Ollama
- Как Ollama обрабатывает параллельные запросы
- Как Ollama использует производительные и эффективные ядра CPU Intel
- Локальный хостинг LLM: Полное руководство 2026 года - Ollama, vLLM, LocalAI, Jan, LM Studio & более