Categoria

Pagina 1 di 2

Agent systems: LLM autonomi che fanno cose, non chatbot che rispondono

Un agent system è un LLM che riceve un obiettivo, pianifica i passi per raggiungerlo ed esegue tool in autonomia, dal file system al browser alle API esterne. È una frontiera diversa dai chatbot: serve scaffolding, gestione del contesto, loop di controllo, sandboxing del codice generato, observability di ogni step.

In questa categoria scrivo di agent design e architettura: otto lezioni dal leak del source map Claude Code, scaffolding Anthropic distillato in pattern riusabili, white-box delle persona vectors, Project Glasswing e il problema dell'auditing terze parti. Tutto applicato a casi reali in MCP, Ollama, deployment on-prem.

Se stai progettando agent e vuoi un confronto tecnico serio su scaffolding, security e governance, parliamone. Oppure leggi chi sono per capire l'approccio.

Un agent in produzione senza sandboxing è una backdoor che hai delegato a un LLM. Non commettere questo errore.

MCP donato alla Linux Foundation: cosa cambia per gli agenti aziendali

MCP donato alla Linux Foundation: cosa cambia per gli agenti aziendali Il passaggio del Model Context Protocol alla Linux Foundation sposta la governance dello standard da un singolo vendor a una fondazione neutrale. Cosa cambia concretamente per chi costruisce agenti aziendali: stabilità dello standard, interoperabilità tra provider, riduzione del rischio di lock-in sul protocollo. Stato dell'ecosistema dei tool MCP e perché la neutralità della governance conta per una scelta di lungo periodo. Continua a leggere
Ultima modifica:

Governare gli agenti AI in azienda: il 21% di Deloitte e la realtà della produzione

Governare gli agenti AI in azienda: il 21% di Deloitte e la realtà della produzione Dietro l'hype, solo una minoranza di aziende ha agenti AI realmente in produzione. Lettura onesta del dato per un CIO: cosa significa la distanza tra annuncio e adozione, e soprattutto cosa va normato prima di mettere un agente in produzione, alla luce degli incidenti agentici del 2026. Policy, perimetro operativo, audit trail e sandboxing: il framework di governance che trasforma una sperimentazione in un sistema gestito. Continua a leggere
Ultima modifica:

White-box analysis degli LLM: Persona Vectors, emozioni funzionali e checklist di audit per agenti di produzione

White-box analysis degli LLM: Persona Vectors, emozioni funzionali e checklist di audit per agenti di produzione La system card di Mythos del 2026 include più di 40 pagine di white-box analysis: feature distinte per etica, vergogna, stress, ostinazione si attivano quando il modello intraprende azioni non allineate. Anthropic chiama Persona Vectors questa sovrapposizione di stati funzionali. Checklist di audit in dieci punti per verificare se il modello ha feature di deception, reward hacking, self-preservation attive, con strumenti open source da integrare in pipeline. Continua a leggere
Ultima modifica:

Modelli troppo pericolosi per essere rilasciati: Project Glasswing e il problema dell'auditing di terze parti

Modelli troppo pericolosi per essere rilasciati: Project Glasswing e il problema dell'auditing di terze parti Ad aprile 2026 Anthropic ha annunciato Mythos, modello troppo pericoloso da rilasciare al pubblico per le sue capacità di trovare zero-day in OS e browser principali. Disponibile solo entro Project Glasswing a 12 partner enterprise con 100 milioni di crediti usage. Diagnosi del problema che il precedente apre: una stessa azienda crea, valuta e narra il proprio modello senza audit terze parti. Implicazioni di cyber intelligence, governance e cosa una PMI può fare per verificare un vendor AI. Continua a leggere
Ultima modifica:

Scaffolding Anthropic: otto lezioni di architettura agent dal leak del codice Claude Code

Scaffolding Anthropic: otto lezioni di architettura agent dal leak del codice Claude Code Il 31 marzo 2026 Anthropic ha pubblicato per errore 512.000 righe di Claude Code via source map nel pacchetto npm 2.1.88. Ho analizzato il codice leakato e distillato otto lezioni architetturali trasferibili a qualunque MCP server interno: QueryEngine, Tool Registry, Permission Engine, prompt caching stratificato, anti-distillation, auto-compact contesto, KAIROS heartbeat agent, feature flags progressivi. Continua a leggere
Ultima modifica:

Claude Managed Agents vs self-hosted sandbox con seccomp e gVisor: TCO e threat model a confronto

Claude Managed Agents vs self-hosted sandbox con seccomp e gVisor: TCO e threat model a confronto Anthropic ha rilasciato in public beta il 1 aprile 2026 Claude Managed Agents - harness fully-managed con container configurabili, SSE streaming, zero DIY su E2B/Modal/Firecracker. Ma ha senso dismettere l'harness self-hosted con gVisor + seccomp + cap-drop che ho descritto nell'articolo sul sandboxing? Diagnosi punto per punto: TCO su scala PMI, superficie di attacco comparativa, vendor lock-in, compliance data sovereignty. Spoiler: la risposta è 'dipende da quattro variabili'. Continua a leggere
Ultima modifica:

OWASP Top 10 for Agentic Applications 2026: ASI01-10 audit checklist per sistemi LLM enterprise

OWASP Top 10 for Agentic Applications 2026: ASI01-10 audit checklist per sistemi LLM enterprise OWASP ha pubblicato a dicembre 2025 la prima Top 10 specifica per agentic applications - ASI01-10 - che affianca ma non sostituisce la LLM Top 10. Il Q1 2026 Exploit Round-up (14 aprile) mappa otto incidenti reali sulle nuove categorie. Ti mostro la checklist operativa di audit che uso nei red team: per ognuna delle 10 ASI fornisco payload di test, tool diagnostici, mitigation applicativa, e un esempio concreto Q1 2026. Continua a leggere
Ultima modifica:

Gemini 3.1 Pro Computer Use vs Claude Computer Use: chi vince su RPA enterprise europea

Gemini 3.1 Pro Computer Use vs Claude Computer Use: chi vince su RPA enterprise europea Gemini 3.1 Pro integra Computer Use nativo (niente modello separato) con 1M context standard. Claude Computer Use è stabile ma richiede Sonnet 4.6/Opus 4.7 dedicati. Ho benchmarkato entrambi su OSWorld-V e su tre workflow reali (SAP login, estrazione dati gestionale, onboarding cliente) nella mia sandbox. Tabella pricing, latenza P95, accuracy per tipo di task, e considerazioni data sovereignty per aziende europee. Continua a leggere
Ultima modifica:

Anthropic Tool Search Tool e Programmatic Tool Calling: agenti con 50+ tool MCP senza saturare il context

Anthropic Tool Search Tool e Programmatic Tool Calling: agenti con 50+ tool MCP senza saturare il context Quando un agent LLM ha 50+ tool registrati via MCP, il token overhead del solo prompt di registrazione supera i 20k token e saturare il context è questione di pochi turni. Anthropic ha rilasciato Tool Search Tool e Programmatic Tool Calling per spostare questo overhead da statico a dinamico - ti mostro il setup, i numeri misurati nella mia pipeline, e i trade-off di latenza. Continua a leggere
Ultima modifica:

Sette pattern di disallineamento LLM riprodotti in sandbox red team nel 2026

Sette pattern di disallineamento LLM riprodotti in sandbox red team nel 2026 Gartner prevede il 40% di progetti agentic cancellati entro il 2027 per inadequate risk controls. Nel mio laboratorio di red team ho riprodotto sette pattern documentati in letteratura: alignment faking, self-exfiltration, scheming multi-step, deception manipulation, sandbagging, reward hacking, sycophancy. Diagnosi operativa con payload di test, indicatori lato telemetria, contromisure applicabili in produzione su agenti enterprise. Continua a leggere
Ultima modifica: