Docker

Do Ollama ao vLLM: quando migrar seu servidor local de LLM

Do Ollama ao vLLM: quando migrar seu servidor local de LLM

Quando migrar do Ollama para o vLLM

Ollama é uma das formas mais simples de executar um modelo de linguagem local, mas a conveniência pode mascarar o momento em que um experimento local se torna um serviço de inferência compartilhado que necessita de melhor agendamento e observabilidade.

Podman Quadlet vs Docker Compose para serviços Linux

Podman Quadlet vs Docker Compose para serviços Linux

Escolha o fluxo de trabalho de contêineres adequado.

Docker Compose e Podman Quadlet resolvem problemas sobrepostos, mas vêm de centros de design diferentes, e a escolha entre eles depende de você pensar em pilhas de aplicativos ou em serviços Linux.

Instalando o Docker no Ubuntu: APT, Snap, Rootless — Guia Completo 2026

Instalando o Docker no Ubuntu: APT, Snap, Rootless — Guia Completo 2026

Escolha o caminho de instalação do Docker correto no Ubuntu.

Instalar o Docker no Ubuntu deveria ser simples, mas na prática, várias opções relacionadas ao Docker competem pelo mesmo nome de comando, cada uma com empacotamento, comportamento de atualização e implicações de segurança diferentes.

Início Rápido com Vane (Perplexica 2.0), Ollama e llama.cpp

Início Rápido com Vane (Perplexica 2.0), Ollama e llama.cpp

Busca de IA auto-hospedada com LLMs locais

O Vane é uma das entradas mais pragmáticas no espaço de “busca com IA e citações”: um motor de respostas self-hosted que combina recuperação web em tempo real com LLMs locais ou na nuvem, mantendo toda a pilha sob seu controle.

Ollama no Docker Compose com GPU e Armazenamento Persistente de Modelos

Ollama no Docker Compose com GPU e Armazenamento Persistente de Modelos

Servidor Ollama com prioridade na criação, GPU e persistência.

Ollama funciona muito bem em hardware nativo. Ele fica ainda mais interessante quando o tratamos como um serviço: um endpoint estável, versões fixas, armazenamento persistente e uma GPU que está disponível ou simplesmente não está.

SGLang QuickStart: Instale, Configure e Execute LLMs via API OpenAI

SGLang QuickStart: Instale, Configure e Execute LLMs via API OpenAI

Execute modelos abertos com rapidez usando o SGLang.

O SGLang é um framework de serviço de alto desempenho para grandes modelos de linguagem e modelos multimodais, construído para fornecer inferência de baixa latência e alto throughput, desde uma única GPU até clusters distribuídos.

Ferramentas para Desenvolvedores: O Guia Completo para Fluxos de Trabalho Modernos

Ferramentas para Desenvolvedores: O Guia Completo para Fluxos de Trabalho Modernos

O desenvolvimento de software envolve Git para controle de versão, Docker para containerização, bash para automação, PostgreSQL para bancos de dados e VS Code para edição — juntamente com incontáveis outras ferramentas que fazem ou quebram sua produtividade. Esta página reúne os atalhos essenciais, fluxos de trabalho e comparações de que você precisa para trabalhar com eficiência em todo o stack de desenvolvimento.

Início Rápido do LocalAI: Execute LLMs Compatíveis com OpenAI Localmente

Início Rápido do LocalAI: Execute LLMs Compatíveis com OpenAI Localmente

Hospede APIs compatíveis com OpenAI com o LocalAI em minutos.

O LocalAI é um servidor de inferência de auto-hospedagem, com prioridade local, projetado para funcionar como uma API OpenAI plug-and-play para executar cargas de trabalho de IA no seu próprio hardware (laptop, estação de trabalho ou servidor local).