KI-System-Speicher – Persistente Kenntnisse und Agent-Speicher
Persistente Kenntnisse über einzelne Chat-Threads hinweg.
Dieser Abschnitt bündelt Anleitungen zu permanenter Wissens- und Gedächtnisverwaltung für KI-Systeme — wie Assistenten Fakten, Präferenzen und verdichteten Kontext über Sitzungen hinweg beibehalten, ohne jeden Token in einen einzelnen Prompt zu pressen. Hier bedeutet Gedächtnis bewusste Speicherung (Nutzerfakten, Zusammenfassungen, von Plugins unterstützte Speichersysteme), nicht GPU-Speicher oder Modellgewichte.
Es ergänzt den umfassenderen KI-Systeme-Cluster — OpenClaw, Hermes, Orchestrierung — und steht neben RAG für Abrufmechaniken und LLM-Hosting für den Betrieb von Modellen.
Das Gedächtnis befindet sich innerhalb des umfassenderen Assistenten-Stacks, wie er in Architektur KI-Assistenten beschrieben wird, zusammen mit Routing, Werkzeugen und Observability.
Speicherdesign für Assistenten
Framework-unabhängige Anleitung zu kurzfristigen, strukturierten und Abruf-Speichern — Konsolidierungsrichtlinien, Vektor-Trade-offs und Muster von OpenAI, LangGraph, Hermes und OpenClaw.
- Speichersysteme in KI-Assistenten, die tatsächlich helfen — Arbeitspeicher, strukturierter Zustand, Abfrageschichten und wann Speicher hilfreich ist und wann er schadet
Agenten-Speicheranbieter
Plug-and-Play-Backends, die von Frameworks wie Hermes Agent und OpenClaw bereitgestellt werden — Honcho, OpenViking, Mem0, Hindsight, Mnemosyne und andere — mit unterschiedlichen Trade-offs bei LLMs, Embeddings und Datenbanken.
- Vergleich der Agenten-Speicheranbieter — vollständige Tabelle, Vergleich der Erfassungsrichtlinien, Hinweise zu Abhängigkeiten und Hermes
memory setup-Abläufe
Für den auf Hermes beschränkten Kernspeicher (MEMORY.md / USER.md) siehe Hermes Agent Speicher-System. Für eine Installation von Mnemosyne und eine Anleitung zur konservativen Schreibrichtlinie siehe Mnemosyne für Hermes Agent: Lokaler Speicher Quickstart.
Speicher-Governance und Fehlermodi
Automatische Erfassung, Reflexion und Konsolidierung können die eigene Inferenz eines Modells in eine dauerhafte „Tatsache“ verwandeln, die in späteren Sitzungen als Beweis behandelt wird.
- Selbstverstärkende Speicher-Loops in KI-Agenten — die sieben Formen dieses Feedbacks, warum Herkunftsangaben wichtiger sind als Embeddings und wie man testet, ob ein Anbieter sich weigert, Dinge zu erinnern
Wissensgraphen und Cognee
Institutionelles und Projektwissen, das in Graphen extrahiert wird, für abfragefähige Assistenten.
- Selbst-Hosting von Cognee — LLM-Wahl auf Ollama — praktische Cognee-Einführung mit lokalen Modellen
- Das richtige LLM für Cognee wählen — Lokale Ollama-Einrichtung — Modellvergleich für Graphqualität im Verhältnis zur Hardware
Graph-Bau-Tools wie Cognee verarbeiten in der Regel Markdown-Vaults, Wikis oder Exporte, die Menschen bereits bearbeitet haben — Bedeutung, Benennung und „warum das wichtig war“ sind weitgehend geklärt, bevor die Chunks die Embeddings erreichen. Ein schlampiger Oberstream-Korpus trainiert die Assistenten in Mehrdeutigkeit; disziplinierte Erfassungs-über-Ausdrucks-Workflows begrenzen diesen Schaden. Für diesen menschenzentrierten Rahmen — einschließlich wie er sich von RAG mit Abrufpriorität unterscheidet — siehe Zweites Gehirn für Ingenieure erklärt.