Porównanie dostawców pamięci dla agentów: polityka przechwytywania i samohostowanie

Polityka przechwytywania jest dziś tak ważna, jak dokładność odzyskiwania.

Page content

Zaktualizowano we wrześniu 2026: dodano Mnemosyne i Memori, rozszerzono konfigurację Honcho i Hindsight oraz dodano porównanie polityk przechwytywania (capture policy) obok oryginalnej tabeli infrastruktury.

Współczesni asystenci nadal zapominają wszystko po zamknięciu karty, chyba że coś zostanie utrwalone poza oknem kontekstu. Dostawcy pamięci agentów to usługi lub biblioteki, które przechowują fakty i podsumowania między sesjami — często wdrażane jako wtyczki, dzięki czemu framework pozostaje lekki, a pamięć się skaluje.

Ten przewodnik porównuje backendy pamięci dostarczane jako zewnętrzne wtyczki pamięci dla Hermes Agent — Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover, Supermemory, Mnemosyne i Memori — oraz wyjaśnia, jak wkomponowują się one w szersze stosy systemów AI. Te same dostawcy pojawiają się w OpenClaw i innych narzędziach agentowych poprzez integracje społecznościowe lub oficjalne. Hub Pamięci Systemów AI wymienia ten artykuł obok Cognee i powiązanych przewodników.

W przypadku ograniczonej pamięci rdzeniowej specyficznej dla Hermes (MEMORY.md i USER.md), zachowań zamrażania i wyzwalaczy, zobacz System Pamięci Hermes Agent. Aby uzyskać kontekst na temat tego, jak natywne dostawcy pamięci Hermes przyczyniają się do rosnącej przewagi adopcji nad OpenClaw — w tym liczby gwiazdek na GitHubie, rankingi tokenów OpenRouter i porównania rozmiaru ekosystemu — zobacz OpenClaw vs Hermes Agent: Gwiazdki, Pobrania i Użycie 2026.

Istnieje inny wymiar, który ma tak samo duże znaczenie, jak jakość odzyskiwania danych: zarządzanie pamięcią. Dostawcy drastycznie różnią się tym, co automatycznie przechwytują, czy wyniki generowane przez asystenta mogą stać się trwałą pamięcią, czy refleksje są przechowywane jako fakty, jak rozwiązywane są sprzeczności oraz czy człowiek może przejrzeć zapis przed tym, zanim stanie się przyszłym kontekstem. Długoterminowi agenci mogą cenić te różnice bardziej niż kolejne punkty na benchmarku recallu — zobacz Samonapędzające się pętle pamięci w agentach AI aby zrozumieć, dlaczego automatyczne przechwytywanie może zamienić wygenerowany wniosek na przyszłe założenie, oraz Mnemosyne dla Hermes Agent: Szybki start pamięci lokalnej dla przećwiczonej konserwatywnej konfiguracji.


Hermes Agent wymienia dziesięć zewnętrznych wtyczek dostawców pamięci dla trwałej, między-sesyjnej wiedzy — oryginalnych osiem plus Mnemosyne i Memori. Jednocześnie może być aktywny tylko jeden zewnętrzny dostawca. Wbudowane MEMORY.md i USER.md pozostają załadowane obok niego — jako dodatek, a nie zastępstwo.

Zależności zewnętrzne. Każdy zewnętrzny dostawca z wyjątkiem Holographic wymaga co najmniej jednego wywołania usługi zewnętrznej — LLM do ekstrakcji pamięci, modelu embedding do wyszukiwania semantycznego lub bazy danych, takiej jak PostgreSQL, do przechowywania. Te zależności mają bezpośrednie konsekwencje dla prywatności, kosztów i tego, czy Twój stos pamięci może działać w pełni samohostowany. Hindsight, ByteRover i Mnemosyne wiążą lub eliminują najwięcej zależności; Honcho, Mem0 i Supermemory wymagają najwięcej ruchomych części. Tam, gdzie dostawca obsługuje Ollama lub dowolny endpoint zgodny z OpenAI, możesz kierować wywołania LLM i embedding do modelu lokalnego i całkowicie trzymać dane z dala od serwerów stron trzecich.

dostawcy systemów pamięci agentów AI

Aktywacja z Hermes Agent

Poniższe kroki wiersza polecenia odzwierciedlają tabele ze ściągi CLI Hermes Agent.

hermes memory setup   # Interaktywny selektor + konfiguracja
hermes memory status  # Sprawdź, co jest aktywne
hermes memory off     # Wyłącz zewnętrznego dostawcę

Lub ręcznie w ~/.hermes/config.yaml:

memory:
  provider: openviking  # lub honcho, mem0, hindsight, holographic, retaindb, byterover, supermemory, mnemosyne, memori

Porównanie dostawców

Dostawca Przechowywanie Koszt Zależności zewnętrzne Możliwość samohostingu Unikalna funkcja
Honcho Chmura/Samohost Płatny/Darmowy LLM + model embedding + PostgreSQL/pgvector + Redis Tak — Docker / K3s / Fly.io Modelowanie dialektyczne użytkownika + kontekst zakresu sesji
OpenViking Samohost Darmowy LLM (VLM) + model embedding Tak — serwer lokalny; kreator init natywny dla Ollama Hierarchia systemu plików + hierarchiczne ładowanie
Mem0 Chmura/Samohost Płatny/Darmowy OSS LLM + model embedding + magazyn wektorowy (Qdrant lub pgvector) Tak — Docker Compose OSS; w pełni lokalnie możliwe Serwerowa ekstrakcja LLM
Hindsight Chmura/Lokalnie Darmowy/Płatny LLM + wbudowany PostgreSQL + wbudowany embedder + wbudowany reranker Tak — Docker lub wbudowany Python; w pełni lokalnie z Ollama Graf wiedzy + synteza reflect
Holographic Lokalnie Darmowy Brak Natywny — brak infrastruktury wymaganej Algebra HRR + scoring zaufania
RetainDB Chmura 20 USD/mies. Zarządzana chmura (LLM + odzyskiwanie na serwerach RetainDB) Nie Kompresja delta + dialektyczny model własny
ByteRover Lokalnie/Chmura Darmowy/Płatny Tylko LLM — brak modelu embedding, brak DB Tak — domyślnie local-first; wspierane Ollama Drzewo kontekstu oparte na plikach; brak linii embedding
Supermemory Chmura Płatny LLM + PostgreSQL/pgvector (deploy korporacyjny Cloudflare) Tylko plan korporacyjny Fencing kontekstu + ingest grafu sesji
Mnemosyne Lokalnie (SQLite) Darmowy Tylko LLM dla dodatkowych embedding; brak dla core Tak — domyślnie w pełni lokalnie Granularne kontrole retencji + lokalny magazyn FTS5/wektorowy
Memori Chmura/Samohost Płatny/Darmowy LLM dla ekstrakcji; przechwytywanie śladów wykonania Częściowo Przechwytywanie tur + śladów narzędzi/pracy

Polityka przechwytywania i zarządzanie

Przechowywanie i zależności odpowiadają na pytanie “czy mogę to uruchomić?”. Poniższa tabela odpowiada na inne pytanie, które ma tak samo duże znaczenie dla długoterminowych agentów: co zostaje zapisane bez pytania i czy człowiek lub polityka może ingerować, zanim stanie się trwałe? Zobacz Samonapędzające się pętle pamięci w agentach AI aby zrozumieć, dlaczego ten wymiar jest ważny.

Dostawca Automatyczne przechwytywanie Wyprowadzone rozumowanie Tylko tryb jawny Wsparcie akceptacji
Holographic Wyłączone domyślnie Niskie Tak Brak kolejki dostawcy
Mnemosyne Konfigurowalne (sync_roles) Fakty + konsolidacja Tak Specyficzne dla dostawcy stadowanie
ByteRover Konfigurowalne (auto_extract) Kurytacja Tak Nie
Hindsight Włączone domyślnie (autoRetain) Synteza reflect Tak (auto_retain: false) Nie
Mem0 Automatyczna ekstrakcja Ekstrakcja faktów Ograniczone Nie
OpenViking Automatyczna ekstrakcja Hierarchiczne podsumowania Częściowo Nie
Supermemory Pełny ingest sesji Profil/graf Częściowo Nie
Memori Przechwytywanie tur + śladów Strukturalne odzyskiwanie Ograniczone Nie
Honcho Obserwacja wiadomości/rówieśników (directional) Modelowanie dialektyczne Konfigurowalne (tryb unified) Nie
RetainDB Bogaty ingest Dialektyka + model własny Ograniczone Nie

Są to kategorie ryzyka architektonicznego, a nie oceny jakości — starannie skonfigurowany zaawansowany dostawca może być w praktyce bezpieczniejszy niż źle skonfigurowany prosty.

Szczegółowy podział

Honcho

Najlepsze do: systemów wieloagentowych, kontekstu między-sesyjnego, dopasowania użytkownik-agent.

Honcho działa obok istniejącej pamięci — USER.md pozostaje bez zmian, a Honcho dodaje dodatkową warstwę kontekstu. Modeluje rozmowy jako rówieśników wymieniających wiadomości — jeden rówieśnik użytkownika plus jeden rówieśnik AI na profil Hermes, wszyscy dzieląc przestrzeń roboczą.

Zależności zewnętrzne: Honcho wymaga LLM do podsumowania sesji, wyznaczania reprezentacji użytkownika i rozumowania dialektycznego; modelu embedding do wyszukiwania semantycznego między obserwacjami; PostgreSQL z rozszerzeniem pgvector do przechowywania wektorów; oraz Redis do cache. Zarządzana chmura na api.honcho.dev obsługuje to wszystko za Ciebie. W przypadku wdrożeń samohostowanych (Docker, K3s lub Fly.io) dostarczasz własne poświadczenia. Slot LLM akceptuje dowolny endpoint zgodny z OpenAI, w tym Ollama i vLLM, dzięki czemu inferencja może pozostać w infrastrukturze on-premises. Slot embedding domyślnie ustawia openai/text-embedding-3-small, ale obsługuje konfigurowalne dostawców przez LLM_EMBEDDING_API_KEY i LLM_EMBEDDING_BASE_URL — działa dowolny serwer embedding zgodny z OpenAI, w tym opcje lokalne, takie jak vLLM z modelem BGE.

Narzędzia: honcho_profile (odczyt/aktualizacja karty rówieśnika), honcho_search (wyszukiwanie semantyczne), honcho_context (kontekst sesji — podsumowanie, reprezentacja, karta, wiadomości), honcho_reasoning (syntezowane przez LLM), honcho_conclude (tworzenie/usuwanie wniosków).

Kluczowe parametry konfiguracji:

  • contextCadence (domyślnie 1): Minimalna liczba tur między odświeżeniami warstwy bazowej
  • dialecticCadence (domyślnie 2): Minimalna liczba tur między wywołaniami LLM peer.chat() (zalecane 1-5)
  • dialecticDepth (domyślnie 1): Przepustki .chat() na wywołanie (ograniczone do 1-3)
  • recallMode (domyślnie ‘hybrid’): hybrid (auto+narzędzia), context (tylko wstrzykiwanie), tools (tylko narzędzia)
  • writeFrequency (domyślnie ‘async’): Czas płukania: async, turn, session lub liczba całkowita N
  • observationMode (domyślnie ‘directional’): directional (wszystko włączone) lub unified (pula wspólna)

Tryby obserwacji i modelowanie własne. directional, domyślny dla nowych konfiguracji, pozwala zarówno użytkownikowi, jak i rówieśnikom AI obserwować siebie nawzajem — bogatsze rozumowanie dialektyczne, ale oznacza to też, że wiadomości autorskie AI przyczyniają się do modelu Honcho samego AI. unified jest opcją bardziej konserwatywną: AI modeluje użytkownika z wiadomości użytkownika, nie budując dopasowanej pętli obserwacji własnej z własnego wyjścia. Ktokolwiek konkretnie zaniepokojony tym, że wygenerowane wnioski zasilają przyszłe rozumowanie — zobacz Samonapędzające się pętle pamięci w agentach AI — powinien traktować unified jako bezpieczniejszy domyślny tryb.

Architektura: Dwuwarstwowe wstrzykiwanie kontekstu — warstwa bazowa (podsumowanie sesji + reprezentacja + karta rówieśnika) + suplement dialektyczny (rozumowanie LLM). Automatycznie wybiera prompty zimnego startu vs ciepłe.

Mapowanie wielu rówieśników: Przestrzeń robocza to środowisko współdzielone między profilami. Rówieśnik użytkownika (peerName) to globalna tożsamość ludzka. Rówieśnik AI (aiPeer) to jeden na profil Hermes (hermes domyślnie, hermes.<profile> dla innych).

Ustawienie:

hermes memory setup  # wybierz "honcho"
# lub legacy: hermes honcho setup

Konfiguracja: $HERMES_HOME/honcho.json (lokalnie dla profilu) lub ~/.honcho/config.json (globalnie).

Zarządzanie profilami:

hermes profile create coder --clone  # Tworzy hermes.coder z wspólną przestrzenią roboczą
hermes honcho sync                   # Wstecznie wypełnia rówieśników AI dla istniejących profili

OpenViking

Najlepsze do: samohostowanego zarządzania wiedzą z przeglądaniem strukturalnym.

OpenViking zapewnia hierarchię systemu plików z hierarchicznym ładowaniem. Jest darmowy, samohostowany i daje Ci pełną kontrolę nad przechowywaniem pamięci.

Zależności zewnętrzne: OpenViking wymaga VLM (model wizyjno-językowy) do przetwarzania semantycznego i ekstrakcji pamięci oraz modelu embedding do wyszukiwania wektorowego — oba są obowiązkowe. Wspierani dostawcy VLM obejmują OpenAI, Anthropic, DeepSeek, Gemini, Moonshot i vLLM (do lokalnego wdrożenia). Dla embedding wspierani dostawcy obejmują OpenAI, Volcengine (Doubao), Jina, Voyage i — przez Ollama — dowolnie lokalnie obsługiwany model embedding. Interaktywny kreator openviking-server init może wykryć dostępną pamięć RAM i zalecić odpowiednie modele Ollama (np. Qwen3-Embedding 8B dla embedding, Gemma 4 27B dla VLM) i skonfigurować wszystko automatycznie dla w pełni lokalnej konfiguracji bez klucza API. Nie jest wymagana zewnętrzna baza danych; OpenViking przechowuje pamięć w systemie plików.

Narzędzia: viking_search, viking_read (hierarchiczne), viking_browse, viking_remember, viking_add_resource.

Pamięć użytkownika vs pamięć agenta. Model tożsamości OpenViking może oddzielić przestrzeń nazw pamięci użytkownika od opcjonalnego rówieśnika asystenta. To oddzielenie ma znaczenie dla higieny pamięci: fakty o użytkowniku i doświadczenia generowane przez agenta nie muszą dzielić tej samej polityki retencji, co jest użyteczną własnością, jeśli chcesz odizolować stan autorski asystenta od stanu autorskiego użytkownika.

Ustawienie:

pip install openviking
openviking-server init   # interaktywny kreator (zaleca modele Ollama dla lokalnego ustawienia)
openviking-server
hermes memory setup  # wybierz "openviking"
echo "OPENVIKING_ENDPOINT=http://localhost:1933" >> ~/.hermes/.env

Mem0

Najlepsze do: bezobsługowego zarządzania pamięcią z automatyczną ekstrakcją.

Mem0 obsługuje ekstrakcję pamięci po stronie serwera przez wywołanie LLM przy każdej operacji add — czyta rozmowę, ekstrahuje dyskretne fakty, usuwa duplikaty i je przechowuje. Zarządzane API chmurowe obsługuje całą infrastrukturę. Biblioteka open-source i serwer samohostowany dają Ci pełną kontrolę.

Zależności zewnętrzne: Mem0 wymaga LLM do ekstrakcji pamięci (domyślnie: OpenAI gpt-4.1-nano; wspierane 20 dostawców, w tym Ollama, vLLM i LM Studio dla modeli lokalnych) i modelu embedding do odzyskiwania (domyślnie: OpenAI text-embedding-3-small; wspierane 10 dostawców, w tym Ollama i HuggingFace dla modeli lokalnych). Przechowywanie używa Qdrant na /tmp/qdrant w trybie biblioteki, lub PostgreSQL z pgvector w trybie samohostowanego serwera — oba mogą działać lokalnie. W pełni lokalny, zero-chmurowy stos Mem0 jest osiągalny: Ollama dla LLM, Ollama dla embedding i lokalna instancja Qdrant, wszystko skonfigurowane przez Memory.from_config.

Mem0 jest fundamentalnie systemem ekstrakcji: LLM przekształca materiał konwersacyjny w dyskretne pamięci i wykonuje logikę deduplikacji i aktualizacji. Jest to wygodne, ale oznacza, że pochodzenie ekstrakcji ma znaczenie — wygenerowany wniosek asystenta może stać się strukturalnie nierozróżnialny od faktu wypowiedzianego przez użytkownika, chyba że ścieżka przechwytywania go odfiltruje przed uruchomieniem ekstrakcji.

Narzędzia: mem0_profile, mem0_search, mem0_conclude.

Ustawienie:

pip install mem0ai
hermes memory setup  # wybierz "mem0"
echo "MEM0_API_KEY=your-key" >> ~/.hermes/.env

Konfiguracja: $HERMES_HOME/mem0.json (user_id: hermes-user, agent_id: hermes).

Hindsight

Najlepsze do: odzyskiwania opartego na grafie wiedzy z relacjami encji.

Hindsight buduje graf wiedzy z Twojej pamięci, ekstrahując encje i relacje. Jego unikalne narzędzie reflect wykonuje syntezę między-pamięci — łącząc wiele pamięci w nowe wnioski. Odzyskiwanie uruchamia cztery strategie odzyskiwania równolegle (semantyczne, słowne/BM25, przebieg grafu, temporalne), a następnie łączy i ponownie排序uje wyniki, używając wzajemnej fuzji rang (reciprocal rank fusion).

Zależności zewnętrzne: Hindsight wymaga LLM do ekstrakcji faktów i encji przy wywołaniach retain i do syntezy przy wywołaniach reflect (domyślnie: OpenAI; wspierani dostawcy obejmują Anthropic, Gemini, Groq, Ollama, LM Studio i dowolny endpoint zgodny z OpenAI). Model embedding i model cross-encoder reranking są wbudowane wewnątrz samego Hindsight — działają lokalnie wewnątrz pakietu hindsight-all i nie wymagają zewnętrznego API. PostgreSQL jest również wbudowany z zainstalowanym Pythonem wbudowanym przez zarządzany katalog danych pg0; możesz alternatywnie wskazać Hindsight na zewnętrzną instancję PostgreSQL. Dla w pełni lokalnego, zero-chmurowego ustawienia, ustaw HINDSIGHT_API_LLM_PROVIDER=ollama i wskaż na lokalny model Ollama — retain i recall działają w pełni; reflect wymaga modelu z zdolnością do wywołań narzędzi (np. qwen3:8b).

Narzędzia: hindsight_retain, hindsight_recall, hindsight_reflect (unikalna synteza między-pamięci).

Ustawienie:

hermes memory setup  # wybierz "hindsight"
echo "HINDSIGHT_API_KEY=your-key" >> ~/.hermes/.env

Automatycznie instaluje hindsight-client (chmura) lub hindsight-all (lokalnie). Wymaga >= 0.4.22.

Konfiguracja: $HERMES_HOME/hindsight/config.json

  • mode: cloud lub local
  • recall_budget: low / mid / high
  • memory_mode: hybrid / context / tools
  • auto_retain / auto_recall: true (domyślnie)

Lokalny UI: hindsight-embed -p hermes ui start

Dla konserwatywnej higieny pamięci, ustawienie auto_retain=false przy pozostawieniu auto_recall=true jest warte rozważenia — semantyczne odzyskiwanie pozostaje dostępne, ale ukończone tury nie wchodzą już automatycznie do pamięci długoterminowej. Traktuj wyjście reflect jako wiedzę wyprowadzoną zsyntezowaną między pamięciami, a nie jako niezależną obserwację o tej samej wadze dowodowej co pamięci, z których była zbudowana.

Holographic

Najlepsze do: ustawień skoncentrowanych na prywatności z wyłącznie lokalnym przechowywaniem.

Holographic używa algebry HRR (Holographic Reduced Representation) do kodowania pamięci, z scoringiem zaufania dla niezawodności pamięci. Brak zależności od chmury — wszystko działa lokalnie na Twoim własnym sprzęcie.

Zależności zewnętrzne: Brak. Holographic nie wymaga LLM, modelu embedding, bazy danych ani połączenia sieciowego. Kodowanie pamięci jest wykonywane całkowicie przez algebrę HRR działającą w procesie. Sprawia to, że jest unikalny wśród wszystkich dostawców w tym porównaniu — jest jedynym, który działa z zerowymi zewnętrznymi wywołaniami. Ceną za to jest niższa jakość odzyskiwania niż przy wyszukiwaniu semantycznym opartym na embedding i brak syntezy między-pamięci, takiej jak reflect w Hindsight. Dla użytkowników, dla których prywatność i działanie zero-zależności są niepodważalne, Holographic jest jedyną opcją, która to gwarantuje bezwarunkowo.

auto_extract domyślnie ustawia się na false, więc Holographic może działać głównie jako mała jawna baza faktów z punktami zaufania, a nie jako autonomiczna linia transkrypt-do-pamięci. Połączone z jego zerowymi zależnościami, sprawia to, że jest jedną z dwóch najprostszych opcji — obok Mnemosyne — dla czytelników, którzy świadomie nie chcą automatycznego przechwytywania.

Narzędzia: 2 narzędzia do operacji pamięci przez algebrę HRR.

Ustawienie:

hermes memory setup  # wybierz "holographic"

RetainDB

Najlepsze do: częstych aktualizacji z kompresją delta.

RetainDB używa kompresji delta do efektywnego przechowywania aktualizacji pamięci i hybrydowego odzyskiwania (wektor + BM25 + reranking), aby uwypuklić powiązany kontekst. Jest oparty na chmurze z kosztem 20 USD/miesiąc, a całe przetwarzanie pamięci jest obsługiwane po stronie serwera.

Zależności zewnętrzne: Wywołania LLM RetainDB, linia embedding i reranking działają wszystkie na własnej infrastrukturze chmurowej RetainDB — dostarczasz tylko RETAINDB_KEY. Ekstrakcja pamięci używa Claude Sonnet po stronie serwera. Nie ma opcji samohostingu ani trybu lokalnego. Całe dane konwersacji są wysyłane na serwery RetainDB do przetwarzania i przechowywania. Jeśli suwerenność danych lub działanie offline ma znaczenie dla Twojego przypadku użycia, ten dostawca nie jest odpowiedni.

Narzędzia: retaindb_profile (profil użytkownika), retaindb_search (wyszukiwanie semantyczne), retaindb_context (kontekst powiązany z zadaniem), retaindb_remember (przechowanie z typem + ważnością), retaindb_forget (usunięcie pamięci).

Integracja Hermes z RetainDB rozrosła się poza zdalną bazę pamięci — teraz obejmuje syntezę dialektyczną i model własny agenta, co architektonicznie przesuwa go bliżej Honcho niż do prostego magazynu wektorowego. Jest to użyteczne dla ciągłości, ale również podnosi istotność oddzielania faktów źródłowych od wygenerowanej interpretacji, to samo zmartwienie, co dotyczy trybu directional w Honcho.

Ustawienie:

hermes memory setup  # wybierz "retaindb"

Mnemosyne

Najlepsze do: lokalnej-first pamięci z granularnymi kontrolami retencji, inspekcjonalnym przechowywaniem SQLite, strukturalnych faktów, pamięci temporalnej i konfigurowalnej konsolidacji.

Mnemosyne nie jest jednym z oryginalnych zintegrowanych dostawców pamięci Hermes — jest dostarczany jako osobna wtyczka dostawcy Hermes, ale integruje się przez ten sam interfejs MemoryProvider. Jego główną zaletą jest kontrola: autozapis rozmowy może być ograniczony rolą lub całkowicie wyłączony z sync_roles: [], logowanie wyników narzędzi jest domyślnie wyłączone, jawne operacje remember/recall/forget pozostają dostępne niezależnie, a nowsze wersje obejmują opcjonalne tłumienie samowielu (self-echo) wokół granic kompresji kontekstu.

Zależności zewnętrzne: Brak dla instalacji core; dodatek embeddings dodaje lokalne wyszukiwanie wektorowe. Przechowywanie to lokalny SQLite z FTS5 i opcjonalnym odzyskiwaniem wektorowym. System utrzymuje również pamięć roboczą, pamięć epizodyczną, strukturalne fakty, trójki temporalne, kanoniczne fakty i konsolidację.

Mnemosyne implementuje również specyficzne dla dostawcy stopniowe zapisy dla Hermes memory.write_approval, choć akceptacja zewnętrznego dostawcy nie jest jeszcze ustandaryzowana między Hermes, więc ta ścieżka powinna być przetestowana przeciwko dokładnym wersjom wdrożonym. Dodatkowa zaawansowanie ma swoją cenę: wyprowadzona pamięć tworzy więcej stanów cyklu życia do inspekcji i sprzątania. Ostatnie wydania Mnemosyne specyficznie zaostrzyły walidację konfliktów, zachowanie usuwania i obsługę samowielu — zobacz Samonapędzające się pętle pamięci w agentach AI dla audytu produkcyjnego, który zainspirował zmianę walidacji konfliktów.

Ustawienie:

python -m pip install "mnemosyne-memory[embeddings]" mnemosyne-hermes
mnemosyne-hermes install
hermes config set memory.provider mnemosyne

Dla pełnej instalacji i spaceru po konserwatywnej konfiguracji, zobacz Mnemosyne dla Hermes Agent: Szybki start pamięci lokalnej.

Memori

Najlepsze do: agentów, dla których historia wykonania ma tak samo duże znaczenie jak historia konwersacji.

Memori to nowsza integracja Hermes skupiona na strukturalnej pamięci świadomej narzędzi. Przechwytuje ukończone tury razem z dostępnym kontekstem wykonania — użycie narzędzi, kroki pracy, decyzje, wyniki i ograniczenia — co jest doskonałe do zapamiętywania pracy operacyjnej, ale też tworzy większą powierzchnię sprzężenia zwrotnego, ponieważ działania, decyzje modelu i wyniki narzędzi mogą wszystkie stać się trwałą strukturalną pamięcią.

W przeciwieństwie do dostawców, którzy głównie wstrzykują duży blok pamięci przed każdą turą, Memori udostępnia jawne narzędzia odzyskiwania i podsumowania odzyskiwania, pozwalając agentowi odzyskiwać kontekst operacyjny, gdy faktycznie go potrzebuje, a nie przy każdym prompcie. To zmniejsza zanieczyszczenie prompcie, ale nie usuwa samego ryzyka sprzężenia zwrotnego po stronie zapisu — ukończone tury i ślady wykonania mogą nadal być automatycznie przechwytywane w tle, więc Memori nadaje się dla użytkowników, którzy chcą, aby agent uczył się z poprzedniej pracy, bardziej niż dla instalacji wymagających surowej tylko jawnej retencji.

Ustawienie:

pip install hermes-memori
hermes memory setup  # wybierz "memori"

ByteRover

Najlepsze do: lokalnej-first pamięci z czytelnym dla człowieka, audytowalnym przechowywaniem.

ByteRover przechowuje pamięć jako strukturalne drzewo kontekstu markdown — hierarchię plików dziedziny, tematu i podtematu — zamiast wektorów embedding lub bazy danych. LLM czyta treść źródłową, rozmyśla o niej i umieszcza wyekstrahowaną wiedzę we właściwym miejscu w hierarchii. Odzyskiwanie to pełnotekstowe wyszukiwanie MiniSearch z hierarchicznym awaryjnym przełącznikiem na wyszukiwanie zasilane LLM, bez konieczności bazy wektorowej.

Zależności zewnętrzne: ByteRover wymaga LLM do kurytacji pamięci i wyszukiwania (wspierane 18 dostawców, w tym Anthropic, OpenAI, Google, Ollama i dowolny endpoint zgodny z OpenAI przez slot dostawcy openai-compatible). Nie wymaga modelu embedding ani bazy danych — drzewo kontekstu to lokalny katalog zwykłych plików markdown. Synchronizacja chmury jest opcjonalna i używana tylko do współpracy zespołowej; wszystko domyślnie działa w pełni offline. Dla w pełni samowystarczalnego lokalnego ustawienia, połącz Ollama jako dostawcę (brv providers connect openai-compatible --base-url http://localhost:11434/v1) i żadne dane nie opuszczają Twojego komputera.

Hermes udostępnia auto_extract: false do wyłączania automatycznych hooków kurytacji, co stawia ByteRovera blisko Holographic i Mnemosyne w grupie dostawców, gdzie automatyczne przechwytywanie jest opcjonalne (opt-in) zamiast domyślne.

Narzędzia: 3 narzędzia do operacji pamięci.

Ustawienie:

hermes memory setup  # wybierz "byterover"

Supermemory

Najlepsze do: prac korporacyjnych z fencingiem kontekstu i ingestem grafu sesji.

Supermemory zapewnia fencing kontekstu (izolowanie pamięci według kontekstu) i ingest grafu sesji (importowanie całych historii konwersacji). Automatycznie ekstrahuje pamięci, buduje profile użytkowników i uruchamia hybrydowe odzyskiwanie łączące wyszukiwanie semantyczne i słowne. Zarządzane API chmurowe jest głównym celem wdrożenia.

Zależności zewnętrzne: Usługa chmurowa Supermemory obsługuje całą inferencję LLM i embedding po stronie serwera — dostarczasz tylko klucz API Supermemory. Samohosting jest dostępny wyłącznie jako dodatek planu korporacyjnego i wdrażany do Cloudflare Workers; wymaga, abyś dostarczył PostgreSQL z rozszerzeniem pgvector (do przechowywania wektorów) i klucz API OpenAI (obowiązkowy, z Anthropic i Gemini jako opcjonalnymi dodatkami). Nie ma ścieżki samohostingu opartej na Dockerze ani lokalnej — architektura jest ściśle sprzężona z obliczeniowym brzegiem Cloudflare Workers. Dla użytkowników, którzy potrzebują pełnej suwerenności danych bez umowy korporacyjnej, ten dostawca nie jest właściwym wyborem.

Bieżąca integracja Hermes z Supermemory zapisuje pełną sesję przez endpoint konwersacji Supermemory jako całość, buforując konwersację i wchłaniając ją pod koniec sesji, resetu lub kompresji. Daje to bogatszy kontekst encji i profilu niż izolowane zapisy faktów, ale oznacza też, że wygenerowany tekst asystenta jest częścią materiału przedstawionego linii ekstrakcji pamięci, a nie tylko stwierdzeń użytkownika.

Narzędzia: 4 narzędzia do operacji pamięci.

Ustawienie:

hermes memory setup  # wybierz "supermemory"

Jak wybrać

Zamiast wybierać jednego globalnego zwycięzcę, dopasuj dostawcę do zadania:

  • Najprostsza jawna lokalna pamięć: Holographic — zero zależności, auto_extract domyślnie wyłączone
  • Lokalna pamięć z bogatszymi kontrolami cyklu życia: Mnemosyne — SQLite, granularna retencja, tłumienie samowielu
  • Synteza obciążona grafem: Hindsight — graf wiedzy plus reflect
  • Modelowanie rówieśnika lub użytkownika: Honcho — rozumowanie dialektyczne, tryb unified dla konserwatywnego modelowania własnego
  • Wiedza w stylu systemu plików: OpenViking — hierarchiczne viking://
  • Bezpilotowa automatyczna ekstrakcja: Mem0 — bezkonfiguracyjna ekstrakcja faktów oparta o LLM
  • Pamięć operacyjna/narzędziowo-świadoma: Memori — przechwytywanie tur i śladów wykonania
  • Czytelna dla człowieka, audytowalna, bez linii embedding: ByteRover — zwykłe drzewo kontekstu markdown
  • Korporacyjny fencing kontekstu: Supermemory — ingest grafu sesji, hostowany w Cloudflare
  • Częste aktualizacje, brak potrzeby samohostingu: RetainDB — kompresja delta, dialektyczny model własny

Dla pełnych konfiguracji dostawców profil-po-profilu i rzeczywistych wzorców pracy, zobacz Hermes Agent production setup.

Szerszy ekosystem pamięci Hermes od stron trzecich

Hermes dokumentuje interfejs pakietu/wtyczki dla zewnętrznych dostawców pamięci, w tym katalogi zainstalowane przez użytkownika i punkty wejścia Pythona, więc ekosystem teraz rozszerza się poza dostawców z pełnymi sekcjami powyżej. Kilka jest warte uwagi, bez dodawania pełnej sekcji dla każdego:

  • Scope Recall traktuje SQLite jako trwałe prawdy, jednocześnie utrzymując surowe przechwytywanie konwersacji osobno w ograniczonym zakresie, z opcjonalnym towarzyszem turn-closure-audit do konserwatywnej przeglądu po-turach — oddziela surowe dowody dziennika od trwałej pamięci semantycznej, zamiast traktować każdą przechwyconą turę jako natychmiast równoważną wiedzę długoterminową.
  • Cognee jest linią wchłaniania grafu wiedzy / ECL, a nie wtyczką pamięci konwersacyjnej Hermes. Doskonale sprawdza się w strukturalnej pamięci projektowej lub instytucjonalnej, ale jest bardziej automatyczny niż jawna baza faktów; zobacz Szybki start Self-Hosting Cognee i Wybór odpowiedniego LLM dla Cognee zamiast traktować go jako wbudowywalnego dostawcę Hermes.
  • AgentMemory podkreśla zdarzenia źródłowe, audytowalność i semantykę usuwania — istotne po problemach osieroconych rekordów wyprowadzonych omówionych dla Mnemosyne powyżej.
  • XMemo dostarcza konserwatywne domyślne wartości: automatyczne przechwytywanie osi czasu może pozostać wyłączone, a usuwanie może być ograniczone. Adopcja jest wciąż na tyle wczesna, że nie wymaga jeszcze pełnej sekcji.

Powiązane przewodniki

Subskrybuj

Otrzymuj nowe wpisy o systemach, infrastrukturze i inżynierii AI.