Ai

Sicurezza degli agenti A2A e MCP: identità, delega e audit trail

Sicurezza degli agenti A2A e MCP: identità, delega e audit trail

La sicurezza del protocollo riguarda chi può agire, non il modello.

L’iniezione di prompt riceve la maggior parte dell’attenzione in termini di sicurezza nei sistemi LLM e merita attenzione, ma non è l’unico problema una volta che gli agenti iniziano a chiamare strumenti e a delegare il lavoro ad altri agenti.

Speculative Decoding: inferenza degli LLM dal 20% al 50% più veloce

Speculative Decoding: inferenza degli LLM dal 20% al 50% più veloce

Inferenza LLM più veloce senza perdita di qualità: una guida pratica

Un modello da 70B genera un token per passaggio avanti e ogni passaggio ricarica i pesi dalla VRAM, calcola l’attenzione su tutto il contesto e sincronizza la memoria. Tra un token e l’altro, la GPU resta inattiva in attesa che si risolvano le dipendenze sequenziali.

Guard-rails per LLM nella Pratica: Cosa Funziona Davvero

Guard-rails per LLM nella Pratica: Cosa Funziona Davvero

Controlla il rischio, non solo il modello.

I LLM sono imprevedibili. Hallucinate, perdono dati, generano contenuti dannosi o rifiutano richieste legittime. I guardrails (meccanismi di sicurezza) vincolano il comportamento del modello senza sacrificare le sue capacità.

Instradamento del modello: smetti di usare un unico modello per tutto

Instradamento del modello: smetti di usare un unico modello per tutto

Il modello giusto per il compito giusto.

Eseguire un modello con 70 miliardi di parametri per riassumere un’email di 200 parole è uno spreco. Eseguire un modello da 3 miliardi di parametri per revisionare il codice in produzione è imprudente. La maggior parte dei sistemi si colloca da qualche punto intermedio: ed è qui che entra in gioco il routing dei modelli.

Sistemi di memoria negli assistenti AI

Sistemi di memoria negli assistenti AI

Memoria operativa, strutturata e di recupero per gli assistenti.

La memoria trasforma gli assistenti da sistemi reattivi a sistemi persistenti, ma è anche il luogo in cui molti sistemi degradano silenziosamente. I sondaggi sostengono che la distinzione tra memoria a breve e lungo termine non sia più sufficiente per la memoria dei moderni agenti; OpenAI e gli SDK di LangGraph indicano uno stack più semplice: memoria di lavoro, stato durevole e recupero (retrieval).