Спекулятивное декодирование: ускорение инференса LLM на 20–50%

Спекулятивное декодирование: ускорение инференса LLM на 20–50%

Более быстрый инференс LLM без потери качества — практическое руководство

Модель 70B генерирует один токен за один прямой проход (forward pass), и каждый проход перезагружает веса из видеопамяти (VRAM), вычисляет внимание (attention) для всего контекста и синхронизирует память. Между токенами GPU простаивает, ожидая разрешения последовательных зависимостей.

Шаблоны оркестрации мультиагентных систем: практическое руководство

Шаблоны оркестрации мультиагентных систем: практическое руководство

40% пилотных проектов с многими агентами терпят неудачу. Вот как выбрать правильный паттерн оркестрации и избежать тех, которые приводят к сбоям.

Системы на основе одного агента достигли своего пика в 2025 году — вы предоставляли одной модели языка (LLM) промпт, набор инструментов и цель, и она достаточно хорошо справлялась с ограниченными задачами.

Паттерн транзакционного почтового ящика в Go с PostgreSQL

Паттерн транзакционного почтового ящика в Go с PostgreSQL

Записывайте событие вместе с данными. Никогда не разделяйте их.

Два обновления, которые должны выполниться вместе, в итоге могут завершиться ошибкой по отдельности.

Ваш сервис заказов сохраняет заказ в базе данных, а затем публикует событие order.created в брокере сообщений.

Что такое спецификация-ориентированная разработка? Спецификация как источник истины

Что такое спецификация-ориентированная разработка? Спецификация как источник истины

«Спецификация как источник истины, а не вспомогательный документ».

Разработка на основе спецификаций (Spec-Driven Development) — это одна из тех идей, к которым инженеры по софту обращались ранее, а затем откладывали, когда усилия переставали приносить отдачу.

Решения при разработке программного обеспечения с использованием ИИ

Решения при разработке программного обеспечения с использованием ИИ

Держите намерение близко к коду.

Записи о принятых решениях — это недостающий слой памяти в разработке программного обеспечения с помощью ИИ. Они фиксируют не только то, что было построено, но и почему — и это различие становится критически важным, когда ваш код пишут инструменты на базе искусственного интеллекта.

Тестирование конкурентного кода на Go с помощью synctest

Тестирование конкурентного кода на Go с помощью synctest

Прекратите использовать сон в конкурентных тестах на Go.

Тестирование конкурентного кода на Go всегда требовало определенной дисциплины. Горутины дешевы, каналы просты, а отмена контекста является идиоматичной — фоновые рабочие процессы и таймеры повсюду в реальных сервисах на Go.

Что такое протокол A2A? Разбираем Agent Cards и Tasks

Что такое протокол A2A? Разбираем Agent Cards и Tasks

A2A превращает агентов в равноправных участников сети.

Протокол A2A (Agent-to-Agent Protocol), аббревиатура от Agent2Agent Protocol, представляет собой открытый стандарт для взаимодействия между независимыми системами ИИ-агентов.

Быстрый старт и шпаргалка по диаграммам Mermaid для разработчиков

Быстрый старт и шпаргалка по диаграммам Mermaid для разработчиков

Диаграммы как код, без лишних сложностей.

Mermaid — это текстовый инструмент для создания диаграмм, предназначенный для тех, кто предпочитает описывать диаграммы текстом, а не перетаскивать блоки на холсте. Он использует синтаксис, похожий на Markdown, для описания блок-схем, диаграмм последовательностей, диаграмм классов, автоматов состояний, временных шкал, диаграмм Ганта, диаграмм сущностей и связей и многого другого.

Цифровые сады: выращивайте знания, а не просто публикуйте их

Цифровые сады: выращивайте знания, а не просто публикуйте их

Публикуйте знания, которые развиваются, а не просто посты.

Доминирующая модель публикации знаний в Интернете практически не изменилась с начала 2000-х годов: написать что-то, отредактировать, опубликовать и двигаться дальше.

Подписаться

Получайте новые материалы про системы, инфраструктуру и AI engineering.