Ollama

KV Cache em GPUs de 16 GB: Tornando o Contexto Longo Realmente Viável

KV Cache em GPUs de 16 GB: Tornando o Contexto Longo Realmente Viável

Por que a contextualização de 128K falha em 16 GB

Um modelo pode anunciar uma janela de contexto de 128K e ainda assim falhar com 40K tokens em uma GPU de 16 GB. O limite arquitetural nunca prometeu que pesos, cache de KV, buffers de computação e o compositor do ambiente gráfico caberiam no seu cartão ao mesmo tempo.

Gravidade de Dados: O Custo Real da IA Prioritária em APIs

Gravidade de Dados: O Custo Real da IA Prioritária em APIs

Por que seu stack de IA fica mais grudento a cada mês.

Cada chamada de API parece uma transação simples — até que uma quantidade suficiente delas se acumule, de modo que seus dados de ajuste fino, seus conjuntos de avaliação e seus esquemas de ferramentas fiquem moldados em torno de um único fornecedor, e a troca deixe de ser apenas uma mudança de roteamento.

Do Ollama ao vLLM: quando migrar seu servidor local de LLM

Do Ollama ao vLLM: quando migrar seu servidor local de LLM

Quando migrar do Ollama para o vLLM

Ollama é uma das formas mais simples de executar um modelo de linguagem local, mas a conveniência pode mascarar o momento em que um experimento local se torna um serviço de inferência compartilhado que necessita de melhor agendamento e observabilidade.

Início Rápido com Vane (Perplexica 2.0), Ollama e llama.cpp

Início Rápido com Vane (Perplexica 2.0), Ollama e llama.cpp

Busca de IA auto-hospedada com LLMs locais

O Vane é uma das entradas mais pragmáticas no espaço de “busca com IA e citações”: um motor de respostas self-hosted que combina recuperação web em tempo real com LLMs locais ou na nuvem, mantendo toda a pilha sob seu controle.

Ollama no Docker Compose com GPU e Armazenamento Persistente de Modelos

Ollama no Docker Compose com GPU e Armazenamento Persistente de Modelos

Servidor Ollama com prioridade na criação, GPU e persistência.

Ollama funciona muito bem em hardware nativo. Ele fica ainda mais interessante quando o tratamos como um serviço: um endpoint estável, versões fixas, armazenamento persistente e uma GPU que está disponível ou simplesmente não está.