Memória de Sistemas de IA — Conhecimento Persistente e Memória de Agentes
Conhecimento persistente além de uma única thread de chat.
Esta seção reúne guias sobre conhecimento persistente e memória para sistemas de IA — como assistentes mantêm fatos, preferências e contexto destilado entre sessões sem encaixar cada token em um único prompt. Aqui, memória significa retenção intencional (fatos do usuário, resumos, armazenamento suportado por plugins), e não RAM de GPU ou pesos de modelos.
Ela complementa o conjunto mais amplo de Sistemas de IA — OpenClaw, Hermes, orquestração — e está ao lado de RAG para mecânicas de recuperação e Hospedagem de LLMs para executar modelos.
A memória está dentro do stack mais amplo de assistentes descrito em Arquitetura de Assistente de IA junto com roteamento, ferramentas e observabilidade.
Design de memória para assistentes
Guia transversal entre frameworks para memória de curto prazo, estruturada e de recuperação — política de consolidação, compensações de vetores e padrões de OpenAI, LangGraph, Hermes e OpenClaw.
- Sistemas de Memória em Assistentes de IA que Realmente Ajudam — memória de trabalho, estado estruturado, camadas de recuperação e quando a memória ajuda ou prejudica
Fornecedores de memória para agentes
Backends de fácil integração expostos por frameworks como Hermes Agent e OpenClaw — Honcho, OpenViking, Mem0, Hindsight, Mnemosyne e outros — com diferentes compensações de LLM, embeddings e banco de dados.
- Comparação de fornecedores de memória para agentes — tabela completa, comparação de política de captura, notas sobre dependências e fluxos de
memory setupdo Hermes
Para memória de núcleo limitada apenas do Hermes (MEMORY.md / USER.md), veja Sistema de Memória do Hermes Agent. Para uma instalação do Mnemosyne e um roteiro de política de escrita conservadora, veja Mnemosyne para Hermes Agent: Início Rápido de Memória Local.
Governança de memória e modos de falha
Captura automática, reflexão e consolidação podem transformar a própria inferência de um modelo em um “fato” duradouro que é tratado como evidência em sessões futuras.
- Loops de Memória Auto-Reforçados em Agentes de IA — as sete formas que esse feedback assume, por que a proveniência importa mais do que embeddings e como testar se um fornecedor se recusa a memorizar
Grafos de conhecimento e Cognee
Conhecimento institucional e de projeto extraído para grafos destinados a assistentes conscientes da recuperação.
- Auto-Hospedagem de Cognee — Escolhendo LLM no Ollama — início rápido prático de Cognee com modelos locais
- Escolhendo o LLM Certo para Cognee — Configuração Local no Ollama — comparação de modelos para qualidade do gráfico versus hardware
Construtores de grafos, como o Cognee, normalmente ingerem cofres em Markdown, wikis ou exportações que as pessoas já editaram — relevância, nomenclatura e “por que isso importava” são amplamente resolvidos antes que os fragmentos alcancem os embeddings. Um corpus upstream descuidado treina ambiguidade de volta no assistente; fluxos de trabalho disciplinados de captura através da expressão limitam esse dano. Para essa perspectiva centrada no ser humano — incluindo como difere do RAG focado em recuperação — veja Segundo cérebro explicado para engenheiros.