KI-System-Speicher – Persistente Kenntnisse und Agent-Speicher

Persistente Kenntnisse über einzelne Chat-Threads hinweg.

Inhaltsverzeichnis

Dieser Abschnitt bündelt Anleitungen zu permanenter Wissens- und Gedächtnisverwaltung für KI-Systeme — wie Assistenten Fakten, Präferenzen und verdichteten Kontext über Sitzungen hinweg beibehalten, ohne jeden Token in einen einzelnen Prompt zu pressen. Hier bedeutet Gedächtnis bewusste Speicherung (Nutzerfakten, Zusammenfassungen, von Plugins unterstützte Speichersysteme), nicht GPU-Speicher oder Modellgewichte.

Es ergänzt den umfassenderen KI-Systeme-Cluster — OpenClaw, Hermes, Orchestrierung — und steht neben RAG für Abrufmechaniken und LLM-Hosting für den Betrieb von Modellen.

Das Gedächtnis befindet sich innerhalb des umfassenderen Assistenten-Stacks, wie er in Architektur KI-Assistenten beschrieben wird, zusammen mit Routing, Werkzeugen und Observability.


Speicherdesign für Assistenten

Framework-unabhängige Anleitung zu kurzfristigen, strukturierten und Abruf-Speichern — Konsolidierungsrichtlinien, Vektor-Trade-offs und Muster von OpenAI, LangGraph, Hermes und OpenClaw.


Agenten-Speicheranbieter

Plug-and-Play-Backends, die von Frameworks wie Hermes Agent und OpenClaw bereitgestellt werden — Honcho, OpenViking, Mem0, Hindsight, Mnemosyne und andere — mit unterschiedlichen Trade-offs bei LLMs, Embeddings und Datenbanken.

Für den auf Hermes beschränkten Kernspeicher (MEMORY.md / USER.md) siehe Hermes Agent Speicher-System. Für eine Installation von Mnemosyne und eine Anleitung zur konservativen Schreibrichtlinie siehe Mnemosyne für Hermes Agent: Lokaler Speicher Quickstart.


Speicher-Governance und Fehlermodi

Automatische Erfassung, Reflexion und Konsolidierung können die eigene Inferenz eines Modells in eine dauerhafte „Tatsache“ verwandeln, die in späteren Sitzungen als Beweis behandelt wird.


Wissensgraphen und Cognee

Institutionelles und Projektwissen, das in Graphen extrahiert wird, für abfragefähige Assistenten.

Graph-Bau-Tools wie Cognee verarbeiten in der Regel Markdown-Vaults, Wikis oder Exporte, die Menschen bereits bearbeitet haben — Bedeutung, Benennung und „warum das wichtig war“ sind weitgehend geklärt, bevor die Chunks die Embeddings erreichen. Ein schlampiger Oberstream-Korpus trainiert die Assistenten in Mehrdeutigkeit; disziplinierte Erfassungs-über-Ausdrucks-Workflows begrenzen diesen Schaden. Für diesen menschenzentrierten Rahmen — einschließlich wie er sich von RAG mit Abrufpriorität unterscheidet — siehe Zweites Gehirn für Ingenieure erklärt.


Stack-Kontext

Abonnieren

Neue Beiträge zu Systemen, Infrastruktur und KI-Engineering.