Memória de Sistemas de IA — Conhecimento Persistente e Memória de Agentes

Conhecimento persistente além de uma única thread de chat.

Conteúdo da página

Esta seção reúne guias sobre conhecimento persistente e memória para sistemas de IA — como assistentes mantêm fatos, preferências e contexto destilado entre sessões sem encaixar cada token em um único prompt. Aqui, memória significa retenção intencional (fatos do usuário, resumos, armazenamento suportado por plugins), e não RAM de GPU ou pesos de modelos.

Ela complementa o conjunto mais amplo de Sistemas de IA — OpenClaw, Hermes, orquestração — e está ao lado de RAG para mecânicas de recuperação e Hospedagem de LLMs para executar modelos.

A memória está dentro do stack mais amplo de assistentes descrito em Arquitetura de Assistente de IA junto com roteamento, ferramentas e observabilidade.


Design de memória para assistentes

Guia transversal entre frameworks para memória de curto prazo, estruturada e de recuperação — política de consolidação, compensações de vetores e padrões de OpenAI, LangGraph, Hermes e OpenClaw.


Fornecedores de memória para agentes

Backends de fácil integração expostos por frameworks como Hermes Agent e OpenClaw — Honcho, OpenViking, Mem0, Hindsight, Mnemosyne e outros — com diferentes compensações de LLM, embeddings e banco de dados.

Para memória de núcleo limitada apenas do Hermes (MEMORY.md / USER.md), veja Sistema de Memória do Hermes Agent. Para uma instalação do Mnemosyne e um roteiro de política de escrita conservadora, veja Mnemosyne para Hermes Agent: Início Rápido de Memória Local.


Governança de memória e modos de falha

Captura automática, reflexão e consolidação podem transformar a própria inferência de um modelo em um “fato” duradouro que é tratado como evidência em sessões futuras.


Grafos de conhecimento e Cognee

Conhecimento institucional e de projeto extraído para grafos destinados a assistentes conscientes da recuperação.

Construtores de grafos, como o Cognee, normalmente ingerem cofres em Markdown, wikis ou exportações que as pessoas já editaram — relevância, nomenclatura e “por que isso importava” são amplamente resolvidos antes que os fragmentos alcancem os embeddings. Um corpus upstream descuidado treina ambiguidade de volta no assistente; fluxos de trabalho disciplinados de captura através da expressão limitam esse dano. Para essa perspectiva centrada no ser humano — incluindo como difere do RAG focado em recuperação — veja Segundo cérebro explicado para engenheiros.


Contexto do stack

Subscrever

Receba novos artigos sobre sistemas, infraestrutura e engenharia de IA.