Self-Hosting

llama.cpp против Ollama в 2026 году: какой рантайм выбрать?

llama.cpp против Ollama в 2026 году: какой рантайм выбрать?

«Когда llama-server превосходит Ollama»

Ollama и llama.cpp часто сравнивают, будто бы это конкурирующие движки вывода. Настоящий выбор — между управляемым сервисом моделей и набором инструментов, которым вы управляете напрямую.

KV Cache на GPU с 16 ГБ: Как действительно уместить длинный контекст

KV Cache на GPU с 16 ГБ: Как действительно уместить длинный контекст

Почему контекст 128K не работает на 16 ГБ

Модель может заявлять о поддержке контекстного окна в 128K, но проваливаться уже на 40K токенах на видеокарте с 16 ГБ. Архитектурный потолок никогда не обещал, что веса, KV-кэш, вычислительные буферы и системный композитор смогут одновременно уместиться на вашем устройстве.

Гравитация данных: реальная цена API-first подходов в ИИ

Гравитация данных: реальная цена API-first подходов в ИИ

Почему ваш стек ИИ становится всё более «липким» каждый месяц.

Каждый вызов API кажется простой транзакцией — пока их количество не накопится настолько, что ваши данные для тонкой настройки, системы оценки и схемы инструментов не окажутся привязаны к одному вендору, и переключение перестанет быть просто изменением маршрутизации.

Ollama и vLLM: когда стоит мигрировать локальный LLM-сервер

Ollama и vLLM: когда стоит мигрировать локальный LLM-сервер

Когда переходить с Ollama на vLLM

Ollama — один из самых простых способов запуска локальной языковой модели, но удобство может скрывать момент, когда локальный эксперимент превращается в общий сервис инференса, требующий лучшего планирования и наблюдаемости.

Podman Quadlet и Docker Compose для Linux-сервисов

Podman Quadlet и Docker Compose для Linux-сервисов

Выберите правильный контейнерный рабочий процесс.

Docker Compose и Podman Quadlet решают пересекающиеся задачи, но исходят из разных принципов проектирования, и выбор между ними зависит от того, думаете ли вы в терминах стеков приложений или системных сервисов Linux.

Запуск Docker Compose как службы Linux с помощью systemd

Запуск Docker Compose как службы Linux с помощью systemd

Запуск Docker Compose при загрузке, управляемый через systemd.

Docker Compose на Linux-сервере должен запускаться при загрузке, корректно останавливаться при выключении и переживать перезагрузки без ручного вмешательства.

Установка Docker на Ubuntu: APT, Snap, Rootless — полное руководство 2026

Установка Docker на Ubuntu: APT, Snap, Rootless — полное руководство 2026

Выберите правильный путь установки Docker в Ubuntu.

Установка Docker на Ubuntu должна быть простой, но на практике несколько вариантов установки Docker конкурируют за одно и то же имя команды, каждый из которых имеет различную упаковку, поведение при обновлении и последствия для безопасности.

Устранение неполадок APT в Ubuntu: исправление сломанных пакетов, блокировок и ошибок GPG

Устранение неполадок APT в Ubuntu: исправление сломанных пакетов, блокировок и ошибок GPG

Исправьте APT в Ubuntu без гаданий.

Неудачи с APT — обычное явление на машинах с Ubuntu, которые используются длительное время. Они обычно возникают после обновления версии, изменения стороннего репозитория, удаления PPA, ручной установки пакета .deb или прерванного процесса установки пакетов.

Выгрузка всех моделей маршрутизатора llama.cpp без перезапуска

Выгрузка всех моделей маршрутизатора llama.cpp без перезапуска

Свободная VRAM без остановки llama-server

Режим маршрутизации llama.cpp — одно из самых полезных изменений в llama-server за последние годы. Наконец-то локальным операторам LLM предоставляется опыт управления моделями, близкий к тому, к которому пользователи привыкли в Ollama, при этом сохраняются высокая производительность и низкоуровневый контроль, которые делают llama.cpp стоящими того, чтобы использовать их в первую очередь.

Справочник по параметрам агентного вывода LLM для Qwen и Gemma

Справочник по параметрам агентного вывода LLM для Qwen и Gemma

Справочное руководство по настройке агентов LLM

Эта страница представляет собой практическое руководство по настройке агентов на базе LLM (температура, top_p, top_k, штрафы и их взаимодействие в многоступенчатых рабочих процессах с интенсивным использованием инструментов).

Голосовое управление Hermes с вашего телефона

Голосовое управление Hermes с вашего телефона

Общайтесь с Hermes со своего телефона

Вы уже общаетесь с агентом Hermes через телефон, используя текстовые сообщения. Теперь вы хотите говорить с ним напрямую и получать ответы голосом. Как правило, это правильное решение, особенно если вы уже используете Hermes как постоянно работающего автономного ассистента. Ввод длинных подсказок на маленьком экране медленный и подвержен ошибкам.

Практическое руководство NemoClaw по безопасным операциям с OpenClaw в 2026 году

Практическое руководство NemoClaw по безопасным операциям с OpenClaw в 2026 году

Запускайте OpenClaw безопасно с помощью NemoClaw

Большинство стеков ИИ-агентов по-прежнему рассматривают безопасность как проблему, которую нужно решать после демонстрации. NemoClaw исходит из противоположного предположения и делает изоляцию, политики и маршрутизацию настройками по умолчанию с первого дня.

Управление знаниями в 2026 году: инструменты PKM, самохостинговые вики и цифровые системы

Управление знаниями в 2026 году: инструменты PKM, самохостинговые вики и цифровые системы

Сравнение инструментов, методов и самохостинговых вики для персонального управления знаниями

Управление персональными знаниями охватывает Obsidian, Logseq, DokuWiki, Zettelkasten и PARA — правильный выбор зависит от того, хотите ли вы локальный граф заметок, собственный вики-движок или рабочий процесс, основанный на аутлайнерах.

Быстрый старт с Vane (Perplexica 2.0), Ollama и llama.cpp

Быстрый старт с Vane (Perplexica 2.0), Ollama и llama.cpp

Самохостинг AI-поиска с локальными LLM

Vane — это один из наиболее прагматичных проектов в пространстве «поиска с использованием ИИ и цитированием»: самохостинговое средство ответов, которое сочетает в себе живой поиск в вебе с локальными или облачными LLM, сохраняя при этом полный контроль над всем стеком технологий.

TGI — Text Generation Inference: установка, настройка и устранение неполадок

TGI — Text Generation Inference: установка, настройка и устранение неполадок

Установите TGI, развертывайте быстро, отлаживайте ещё быстрее.

Text Generation Inference (TGI) обладает очень специфической энергетикой. Это не самый новый проект на улице инференса, но это тот, который уже научился, как происходит работа в продакшене, —