Sistemi AI: assistenti self-hosted, RAG e infrastruttura locale
La maggior parte delle configurazioni locali di AI inizia con un modello e un runtime.
Scarichi un modello quantizzato, lo avvii tramite Ollama o un altro runtime e inizi a inviare prompt. Per fare esperimenti, questo è più che sufficiente. Ma non appena vai oltre la semplice curiosità — quando ti preoccupied della memoria, della qualità del recupero (retrieval), delle decisioni di routing o della consapevolezza dei costi — la semplicità inizia a mostrare i suoi limiti.
Questo cluster esplora un approccio diverso: trattare l’assistente AI non come una singola chiamata a un modello, ma come un sistema coordinato.
Questa distinzione potrebbe sembrare sottile all’inizio, ma cambia completamente il modo in cui pensi all’AI locale.

Cos’è un Sistema AI?
Un sistema AI è più di un semplice modello. È un livello di orchestrazione che connette inferenza, recupero, memoria ed esecuzione in qualcosa che si comporta come un assistente coerente.
Eseguire un modello in locale è lavoro di infrastruttura. Progettare un assistente attorno a quel modello è lavoro di sistema.
Se hai esplorato le nostre guide più ampie su:
- Hosting di LLM nel 2026: Infrastruttura Locale, Self-Hosted e Cloud Confrontata
- Architettura LLM: Progettazione di Sistemi per l’AI in Produzione — routing, ottimizzazione dei costi, guardrail e orchestrazione multi-modello
- Tutorial su Retrieval-Augmented Generation (RAG): Architettura, Implementazione e Guida alla Produzione
- Secondo cervello spiegato per ingegneri e lavoratori della conoscenza
- Prestazioni dei LLM nel 2026: Benchmark, Colli di Bottiglia e Ottimizzazione
- Osservabilità per Sistemi AI
sai già che l’inferenza è solo un livello dello stack.
Il cluster dei Sistemi AI si posiziona sopra questi livelli. Non li sostituisce — li combina.
Per una mappa trasversale di come questi livelli si integrino negli assistenti in produzione — LLM, memoria, strumenti, routing e osservabilità, con OpenClaw e Hermes come sistemi di riferimento — consulta Architettura degli Assistenti AI: LLM, Memoria, Strumenti, Routing, Osservabilità.
Una volta che l’architettura dell’assistente è solida, il passo successivo è renderlo proattivo. Agenti di Polling negli Assistenti AI: 11 Pattern di Implementazione copre come i worker di polling in background, l’esecuzione basata su code, i flussi di lavoro duraturi e gli valutatori LLM semantici trasformino un assistente reattivo in uno che osserva, decide e agisce in autonomia.
Quando un singolo assistente non è sufficiente e più agenti devono coordinarsi, la scelta del pattern di coordinamento determina tutto: latenza, tolleranza ai guasti, costi e possibilità di debug. Pattern di Orchestrazione Multi-Agente: Una Guida Pratica copre i sei pattern canonici — orchestrator-worker, pipeline sequenziale, fan-out, gerarchico, swarm e mesh — con specifiche modalità di fallimento e un framework decisionale per scegliere l’architettura giusta.
OpenClaw: Un Sistema di Assistente AI Self-Hosted
OpenClaw è un assistente AI open-source e self-hosted progettato per operare su piattaforme di messaggistica, funzionando su infrastruttura locale.
A livello pratico:
- Utilizza runtime LLM locali come Ollama o vLLM
- Integra il recupero su documenti indicizzati
- Mantiene la memoria oltre una singola sessione
- Esegue strumenti e compiti di automazione
- Può essere strumentato e osservato
- Opera entro vincoli hardware
Non è solo un wrapper attorno a un modello. È un livello di orchestrazione che connette inferenza, recupero, memoria ed esecuzione in qualcosa che si comporta come un assistente coerente.
Guida introduttiva e architettura:
- Guida rapida di OpenClaw — installazione basata su Docker utilizzando un modello Ollama locale o una configurazione cloud di Claude
- Panoramica del sistema OpenClaw — esplorazione architettonica di come OpenClaw differisca dalle configurazioni locali più semplici
- Guida a NemoClaw per operazioni sicure di OpenClaw — percorso di OpenClaw incentrato sulla sicurezza con sandboxing di OpenShell, livelli di policy, inferenza instradata e operazioni di seconda giornata
Contesto e analisi:
- Timeline di ascesa e caduta di OpenClaw — l’economia dietro il picco virale, l’interruzione dell’abbonamento di aprile 2026 e cosa rivela il collasso sui cicli di hype nell’AI
- OpenClaw vs Hermes Agent — stelle, download e dati di utilizzo — classifica live di 20 framework con classifiche dei token OpenRouter, conteggi dei download dei pacchetti, metriche di salute della comunità e analisi delle tendenze di ricerca
Estensione e configurazione di OpenClaw:
I plugin estendono il runtime di OpenClaw — aggiungendo backend di memoria, provider di modelli, canali di comunicazione, strumenti web e osservabilità. Le skill estendono il comportamento dell’agente — definendo come e quando l’agente usa quelle capacità. La configurazione di produzione significa combinare entrambi, modellata attorno a chi sta effettivamente usando il sistema.
- Plugin OpenClaw — Guida all’Ecosistema e Scelte Pratiche — tipi di plugin nativi, ciclo di vita CLI, rail di sicurezza e scelte concrete per memoria, canali, strumenti e osservabilità
- Ecosistema di Skill OpenClaw e Scelte Pratiche di Produzione — scoperta tramite ClawHub, flussi di installazione e rimozione, stack per ruolo e le skill da mantenere nel 2026
- Pattern di Setup di Produzione di OpenClaw con Plugin e Skill — configurazioni complete di plugin e skill per tipo di utente: sviluppatore, automazione, ricerca, supporto e crescita — ciascuna con script di installazione combinati
Hermes: Un Agente Persistente con Skill e Sandboxing degli Strumenti
Hermes Agent è un assistente self-hosted, agnostico rispetto al modello, focalizzato sull’operazione persistente: può funzionare come processo a lunga durata, eseguire strumenti tramite backend configurabili e migliorare i flussi di lavoro nel tempo tramite memoria e skill riutilizzabili.
A livello pratico, Hermes è utile quando si desidera:
- Un assistente basato su terminale che può anche collegarsi ad app di messaggistica
- Flessibilità del provider tramite endpoint compatibili con OpenAI e cambio di modello
- Confini di esecuzione degli strumenti tramite backend locali e sandboxed
- Operazioni di seconda giornata con diagnostica, log e igiene delle configurazioni
I profili Hermes sono ambienti completamente isolati — ciascuno con la propria configurazione, segreti, memorie, sessioni, skill e stato — rendendo i profili l’unità reale di proprietà in produzione, non la singola skill.
- Assistente AI Hermes - Installazione, Setup, Flusso di Lavoro e Risoluzione dei Problemi — installazione, setup del provider, pattern di flusso di lavoro e risoluzione dei problemi
- Scheda rapida CLI di Hermes Agent — comandi, flag e scorciatoie slash — indice tabellare dei sotto-comandi di
hermes, flag globali, strumenti per gateway e profilo e comuni scorciatoie slash - Server Headless e Setup Desktop Remoto di Hermes Agent — topologia di deployment headless per l’accesso desktop remoto via LAN e VPN
- Controllo Vocale di Hermes dal Tuo Telefono — flusso di lavoro vocale mobile-first per Telegram e Discord, con regolazione dei provider STT e TTS oltre alla risoluzione dei problemi
- Sistema di Memoria di Hermes Agent: Come Funziona Realmente la Memoria AI Persistente — guida tecnica approfondita sulla memoria centrale a due file, il pattern di snapshot congelato, tutti gli 8 provider esterni e la filosofia della memoria limitata
- Skill per Assistenti AI Hermes per Setup di Produzione Reali — architettura delle skill basata sui profili per ingegneri, ricercatori, operatori e flussi di lavoro esecutivi
- Creazione di Skill Hermes Agent — Struttura SKILL.md e Best Practices — layout pratico di
SKILL.md, metadati, attivazione condizionale e risoluzione dei problemi quando le skill scompaiono dall’indice - Kanban in Hermes Agent per Flussi di Lavoro LLM Self-Hosted — pattern di controllo pratici per la concorrenza del dispatcher, le catene di dipendenza e il batch basato su cron sui gateway self-hosted
- Come Migrare da OpenClaw a Hermes Agent in Sicurezza — runbook di cambio graduale che copre i dry-run di
hermes claw migrate, la policy dei conflitti, la gestione dei segreti, il passaggio della messaggistica e il rollback
Conoscenza e memoria persistenti
Alcuni problemi non sono risolti da una finestra di contesto più grande da sola — hanno bisogno di conoscenza persistente (giri, pipeline di ingestione) e plugin di memoria per agenti (Honcho, Mem0, Hindsight e backend simili) collegati ad assistenti come Hermes o OpenClaw.
- Hub della Memoria dei Sistemi AI — ambito del sottocluster di memoria oltre ai link alle guide di Cognee e al contesto dello stack
- Sistemi di Memoria negli Assistenti AI che Aiutano Realmente — progettazione della memoria cross-framework per stato di lavoro, fatti strutturati e livelli di recupero
- Confronto tra provider di memoria per agenti — confronto completo di Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover, Supermemory, Mnemosyne e Memori per integrazioni di tipo Hermes
- Loop di Memoria Auto-Rinforzanti negli Agenti AI — come le inferenze del modello memorizzate vengono recuperate come prove e amplificate, e i controlli sulla via di scrittura che limitano questo fenomeno
- Mnemosyne per Hermes Agent: Avvio Rapido della Memoria Locale — provider di memoria locale SQLite con ritenzione granulare e controlli di auto-eco
MCP: Model Context Protocol Servers
Il Model Context Protocol (MCP) è uno standard aperto introdotto da Anthropic per collegare i modelli linguistici AI a fonti di dati esterne, strumenti e sistemi. Risolve il problema di integrazione N×M fornendo un’interfaccia universale — pensalo come una porta USB-C per le applicazioni AI. La costruzione di server MCP ti consente di estendere gli assistenti AI con integrazioni personalizzate per file, database, API e strumenti richiamabili, utilizzando un semplice protocollo basato su JSON-RPC su stdio o HTTP.
- Agent Skills vs Server MCP: Framework Decisionale — framework decisionale pratico su quando usare le skill, quando costruire server MCP e come il pattern thin-server combina entrambi
- Server MCP in Go — architettura del protocollo, struttura dei messaggi JSON-RPC, negoziazione delle capacità, SDK ufficiale Go e un tutorial passo-passo per la costruzione di server MCP in Go
- Costruzione di Server MCP in Python — guida pratica all’implementazione in Python che copre i server MCP per ricerca web e scraping, trasportatore stdio e SSE e integrazione con Claude Desktop
A2A: Agent-to-Agent Protocol
Il Protocollo Agent2Agent (A2A) è uno standard aperto per la comunicazione tra sistemi di agenti AI indipendentemente deployati. Dove MCP connette un agente agli strumenti, A2A connette gli agenti ad altri agenti — consentendo loro di scoprire l’uno l’altro tramite Agent Card, scambiare compiti e messaggi, trasmettere progressi in streaming e restituire artefatti tipizzati. A2A è progettato per sistemi in cui gli agenti sono posseduti da team diversi, costruiti con framework diversi o deployati come servizi separati che devono interoperare.
- Cos’è il Protocollo A2A? Agent Card e Compiti Spiegati — analisi approfondita dei concetti di A2A: Agent Card, ciclo di vita del compito, messaggi, parti, artefatti, streaming, sicurezza e il pattern orchestrator-plus-specialisti
- Streaming e Compiti Asincroni A2A per Flussi di Lavoro di Agenti a Lunga Durata — guida operativa allo streaming SSE, webhook push, flussi human-in-the-loop input_required, gestione dei fallimenti e osservabilità per compiti che superano una singola richiesta HTTP
- A2A vs MCP: Gli Agenti AI Hanno Veramente Bisogno di Entrambi i Protocolli? — confronto pratico tra i due protocolli: quando MCP da solo è sufficiente, quando A2A aggiunge valore reale e come il pattern “A2A fuori, MCP dentro” funziona su larga scala
- Protocollo A2A di Google nel 2026: Adozione, Hype e Realtà — uno sguardo misurato su dove A2A ha effettivamente trazione di produzione nel 2026, cosa sbaglia l’hype e un framework decisionale pratico su quando usarlo
Cosa Rende Diversi i Sistemi AI
Diverse caratteristiche rendono i sistemi AI degni di un’esame più approfondito.
Il Routing dei Modelli come Scelta di Progettazione
La maggior parte delle configurazioni locali si basa su un solo modello. I sistemi AI supportano la selezione intenzionale dei modelli.
Questo introduce domande:
- I piccoli richiami dovrebbero usare modelli più piccoli?
- Quando il ragionamento giustifica una finestra di contesto più grande?
- Qual è la differenza di costo per 1.000 token?
Queste domande si collegano direttamente ai compromessi prestazionali discussi nella guida sulle prestazioni dei LLM e alle decisioni infrastrutturali delineate nella guida sull’hosting dei LLM.
I sistemi AI rendono visibili queste decisioni invece di nasconderle.
Il Recupero è Trattato come un Componente Evolutivo
I sistemi AI integrano il recupero dei documenti, ma non come un passo semplicistico di “embedding e ricerca”.
Riconoscono:
- La dimensione del chunk influisce sul recall e sul costo
- La ricerca ibrida (BM25 + vettoriale) può superare il recupero denso puro
- Il reranking migliora la rilevanza a costo della latenza
- La strategia di indicizzazione impatta il consumo di memoria
Questi temi si allineano con le considerazioni architetturali più profonde discusse nel tutorial RAG.
La differenza è che i sistemi AI incorporano il recupero in un assistente vivente invece di presentarlo come una demo isolata.
La Memoria come Infrastruttura
I LLM stateless dimenticano tutto tra le sessioni.
I sistemi AI introducono livelli di memoria persistente. Questo pone immediatamente domande di progettazione:
- Cosa dovrebbe essere memorizzato a lungo termine?
- Quando il contesto dovrebbe essere riassunto?
- Come si previene l’esplosione dei token?
- Come si indicizza la memoria in modo efficiente?
Queste domande si intersecano direttamente con le considerazioni del livello dati dalla guida sull’infrastruttura dei dati. Specificamente per Hermes Agent — memoria a due file limitata, cache dei prefissi, plugin esterni — inizia con Sistema di Memoria di Hermes Agent e il confronto cross-framework Confronto tra provider di memoria per agenti. La cattura automatica e la riflessione possono anche trasformare l’inferenza stessa del modello in “prove” future — vedi Loop di Memoria Auto-Rinforzanti negli Agenti AI per la modalità di fallimento e Mnemosyne per Hermes Agent per un’implementazione locale e conservativa. L’Hub della Memoria dei Sistemi AI elenca le guide correlate di Cognee e dei livelli di conoscenza.
La memoria smette di essere una funzione e diventa un problema di archiviazione.
L’Osservabilità Non è Opzionale
La maggior parte degli esperimenti di AI locali si ferma a “risponde”.
I sistemi AI rendono possibile osservare:
- Utilizzo dei token
- Latenza
- Utilizzo dell’hardware
- Pattern di throughput
Questo si collega naturalmente ai principi di monitoraggio descritti nella guida sull’osservabilità.
Se l’AI gira su hardware, dovrebbe essere misurabile come qualsiasi altro workload.
Com’è l’Esperienza d’Uso
Dall’esterno, un sistema AI può ancora sembrare un’interfaccia di chat.
Sotto la superficie, succedono molte cose.
Se gli chiedi di riassumere un rapporto tecnico memorizzato localmente:
- Recupera i segmenti del documento rilevanti.
- Seleziona un modello appropriato.
- Genera una risposta.
- Registra l’utilizzo dei token e la latenza.
- Aggiorna la memoria persistente se necessario.
L’interazione visibile rimane semplice. Il comportamento del sistema è stratificato.
Questo comportamento stratificato è ciò che distingue un sistema da una demo.
Dove i Sistemi AI si Posizionano nello Stack
Il cluster dei Sistemi AI si trova all’incrocio di diversi livelli di infrastruttura:
- Hosting LLM: Il livello runtime dove i modelli vengono eseguiti (Ollama, vLLM, llama.cpp)
- RAG: Il livello di recupero che fornisce contesto e ancoraggio
- Prestazioni: Il livello di misurazione che traccia latenza e throughput
- Osservabilità: Il livello di monitoraggio che fornisce metriche e tracciamento dei costi
- Infrastruttura Dati: Il livello di archiviazione che gestisce memoria e indicizzazione
Comprendere questa distinzione è utile. Eseguirla da soli rende la differenza più chiara.
Per un’installazione locale minima con OpenClaw, consulta la guida rapida di OpenClaw, che illustra un setup basato su Docker utilizzando un modello Ollama locale o una configurazione cloud di Claude.
Se la tua configurazione dipende da Claude, questo cambio di policy per gli strumenti agentici chiarisce perché la fatturazione tramite API è ora richiesta per i flussi di lavoro di terze parti di OpenClaw.
Risorse Correlate
A2A: Agent-to-Agent Protocol:
- Cos’è il Protocollo A2A? Agent Card e Compiti Spiegati
- A2A vs MCP: Gli Agenti AI Hanno Veramente Bisogno di Entrambi i Protocolli?
- Protocollo A2A di Google nel 2026: Adozione, Hype e Realtà
Server MCP:
Guide sugli assistenti AI:
- Architettura degli Assistenti AI: LLM, Memoria, Strumenti, Routing, Osservabilità
- Pattern di Orchestrazione Multi-Agente: Una Guida Pratica
- Agenti di Polling negli Assistenti AI: 11 Pattern di Implementazione
- Panoramica del sistema OpenClaw
- Timeline di ascesa e caduta di OpenClaw
- Guida rapida di OpenClaw
- Plugin OpenClaw — Guida all’Ecosistema e Scelte Pratiche
- Ecosistema di Skill OpenClaw e Scelte Pratiche di Produzione
- Pattern di Setup di Produzione di OpenClaw con Plugin e Skill
- Assistente AI Hermes - Installazione, Setup, Flusso di Lavoro e Risoluzione dei Problemi
- Sistema di Memoria di Hermes Agent: Come Funziona Realmente la Memoria AI Persistente
- Hub della Memoria dei Sistemi AI
- Confronto tra provider di memoria per agenti
- Skill per Assistenti AI Hermes per Setup di Produzione Reali
- Creazione di Skill Hermes Agent — Struttura SKILL.md e Best Practices
Livelli di infrastruttura:
- Hosting di LLM nel 2026: Infrastruttura Locale, Self-Hosted e Cloud Confrontata
- Tutorial su Retrieval-Augmented Generation (RAG): Architettura, Implementazione e Guida alla Produzione
- Prestazioni dei LLM nel 2026: Benchmark, Colli di Bottiglia e Ottimizzazione
- Parametri di inferenza LLM agentici per Qwen e Gemma
- Osservabilità per Sistemi AI
- Infrastruttura Dati per Sistemi AI