Categoria

Pagina 1 di 6

LLM Automation: dall'esperimento all'infrastruttura produttiva

Usare un modello linguistico per una demo è facile. Metterlo in una pipeline aziendale che gira ogni giorno, con costi controllati, output verificabile e governance chiara, è un lavoro di ingegneria. È la differenza fra il giocattolo e lo strumento, ed è la distinzione attorno a cui ruota tutta questa categoria.

Il primo tema è il salto dalla demo alla produzione. Un LLM in produzione ha bisogno delle stesse cure di qualsiasi altro componente critico: monitoring di qualità, costi e anomalie, gestione degli errori transitori, budgeting dei token, difesa dagli abusi. Scrivo di come si costruisce una pipeline che regge il carico reale senza far esplodere la bolletta e senza produrre output di cui nessuno si fida.

Il secondo tema è l'automazione applicata al lavoro vero: orchestrazione multi-step, agenti che pianificano ed eseguono, LLM messi in pipeline CI/CD per code review, generazione di test e documentazione, migrazioni assistite. Non prompt isolati, ma architetture di automazione che si integrano nel processo esistente invece di crearne uno parallelo e incontrollabile.

Il terzo tema è il lato scomodo, che raccontano in pochi: il debito di comprensione che l'AI accumula in una codebase mentre sembra accelerare, la sycophancy dei modelli nelle decisioni aziendali, il riposizionamento dell'ingegnere senior, e le decisioni che restano tue e non vanno delegate a un modello. L'onestà su cosa funziona e cosa no vale più di qualsiasi entusiasmo.

Se vuoi portare l'automazione LLM in produzione sul serio, vedi l'automazione con l'AI o scrivimi.

L'AI non sostituisce l'ingegnere. Sposta il lavoro dal digitare codice al decidere cosa è giusto, che è sempre stato il lavoro vero.

Ornith vs Qwable: Benchmarking Two 9B Coding Agents on a 16GB GPU

Ornith vs Qwable: Benchmarking Two 9B Coding Agents on a 16GB GPU The third part of the local-inference series drops from the 35B MoE to the models most people want on a coding workstation: small, dense, 9-billion-parameter agents. I ran two of them, same base and opposite training recipes, through a full agent loop on a real buggy project plus a Copilot-style autocomplete bench. Neither speed nor correctness separates them: the discriminator is agentic path economy, training- and task-shaped. And local can stand in for Copilot warm, with one 16GB asterisk. Continua a leggere
Ultima modifica:

Vale la pena spostare la mia pipeline su un modello di frontiera? Bilancio di prima mano

Vale la pena spostare la mia pipeline su un modello di frontiera? Bilancio di prima mano Bilancio esperienziale dopo settimane di pipeline editoriale e di sviluppo su un modello di frontiera: dove il tier superiore ha fatto davvero la differenza (task lunghi, refactoring estesi) e dove il modello standard bastava a metà del costo. Con il caveat onesto reso evidente dall'affaire Fable 5: un modello di frontiera può essere sospeso dall'alto, il che rafforza il punto sulla sostituibilità. Information gain massimo, niente recensione da rumor. Continua a leggere
Ultima modifica:

L'AI scrive gran parte del codice di chi la produce: cosa significa per chi assume sviluppatori

L'AI scrive gran parte del codice di chi la produce: cosa significa per chi assume sviluppatori Le aziende di frontiera dichiarano che una quota crescente del loro codice è ormai scritta dall'AI, con il task-horizon che si allunga di mese in mese. Lettura ingegneristica e non allarmistica per un decisore: cosa cambia davvero per chi assume sviluppatori junior, dove resta il valore del senior che fa review e architettura, e il rischio della cascata sistemica quando l'AI genera codice che nessuno comprende a fondo. Niente profezie, solo implicazioni concrete sull'organizzazione di un team. Continua a leggere
Ultima modifica:

Sycophancy degli LLM: rischio nascosto nelle decisioni aziendali e framework Ask-Don't-Tell a confronto

Sycophancy degli LLM: rischio nascosto nelle decisioni aziendali e framework Ask-Don't-Tell a confronto Quando chiedi a Claude o GPT di analizzare una strategia, una proposta di pricing o un audit interno, il modello tende sistematicamente a darti ragione. Il fenomeno si chiama sycophancy: deriva strutturalmente da RLHF e reward model umano. Il Bullshit Bench 2026 misura che in dominio medico i modelli fanno pushback su premesse errate solo nel 36% dei casi. Confronto fra principali modelli 2026 e mitigation Ask-Don't-Tell che riduce la sycophancy del 40-60% senza fine-tuning. Continua a leggere
Ultima modifica:

Prompt caching workspace-level di Anthropic: perché i tuoi agenti costano troppo e come diagnosticare le cache mancate

Prompt caching workspace-level di Anthropic: perché i tuoi agenti costano troppo e come diagnosticare le cache mancate Dal febbraio 2026 Anthropic offre prompt caching workspace-level con cache hit al 10% del prezzo input. Eppure nella maggioranza delle integrazioni che vedo in consulenza le cache sono mancate nel 60-80% delle chiamate per errori di design banali. Diagnosi sistematica: cache prefix vs suffix, invalidazione accidentale del system prompt, bloccaggio con tool list dinamica, e pattern che ho misurato portare fino a 90% di risparmio sulla bolletta API. Continua a leggere
Ultima modifica:

Claude Managed Agents vs self-hosted sandbox con seccomp e gVisor: TCO e threat model a confronto

Claude Managed Agents vs self-hosted sandbox con seccomp e gVisor: TCO e threat model a confronto Anthropic ha rilasciato in public beta il 1 aprile 2026 Claude Managed Agents - harness fully-managed con container configurabili, SSE streaming, zero DIY su E2B/Modal/Firecracker. Ma ha senso dismettere l'harness self-hosted con gVisor + seccomp + cap-drop che ho descritto nell'articolo sul sandboxing? Diagnosi punto per punto: TCO su scala PMI, superficie di attacco comparativa, vendor lock-in, compliance data sovereignty. Spoiler: la risposta è 'dipende da quattro variabili'. Continua a leggere
Ultima modifica:

LazyGraphRAG di Microsoft: 700 volte meno costi per query globale su corpus aziendale

LazyGraphRAG di Microsoft: 700 volte meno costi per query globale su corpus aziendale GraphRAG classico ha un problema: il costo di indicizzazione è proibitivo (centinaia di dollari per corpus medio). LazyGraphRAG Microsoft rimanda l'estrazione relazionale al query time, riduce 700x il costo per query globale e tiene 0,1% del costo indexing del full GraphRAG, vincendo 96/96 comparazioni a parità di GPT-4o. Tutorial: setup su corpus policy aziendale da 340 documenti, configurazione, benchmark sul mio laboratorio. Continua a leggere
Ultima modifica:

Anthropic Economic Index: i dati di uso reale di Claude nei mestieri e cosa dicono alle aziende italiane

Anthropic Economic Index: i dati di uso reale di Claude nei mestieri e cosa dicono alle aziende italiane Anthropic Economic Index 2026: analisi su 900+ mestieri O*NET incrociata con dati reali Claude. Per ogni lavoro due cerchi: limite teorico e uso reale. Il 49% dei mestieri ha già almeno un quarto dei task svolti con Claude, ma il gap fra teorico e reale non si chiude per affidabilità, barriere legali, trust. Analizzo i dati di marzo 2026 per sette categorie di mestiere presenti nelle PMI italiane (sviluppatori, contabili, legali, HR, commerciali, project manager, tecnici). Continua a leggere
Ultima modifica:

Continual learning e World Models: la roadmap AGI di Amodei e Hassabis a confronto

Continual learning e World Models: la roadmap AGI di Amodei e Hassabis a confronto Dario Amodei e Demis Hassabis, i due CEO più autorevoli del settore AI, disegnano due roadmap diverse verso l'AGI. Amodei scommette su RLVR cross-domain come futuro scatto di generalizzazione. Hassabis sostiene che serva altro: continual learning, World Models, esperienza fisica simulata. Dietro il disaccordo una scelta di investimento che impatta le roadmap aziendali dei prossimi due anni. Confronto delle due strategie con dati 2025-2026 e implicazioni sul tipo di pipeline da costruire oggi. Continua a leggere
Ultima modifica:

METR Time Horizon e benchmark maxing: come leggere i grafici di progresso degli LLM senza farsi ingannare

METR Time Horizon e benchmark maxing: come leggere i grafici di progresso degli LLM senza farsi ingannare Il grafico METR che mostra Opus 4.6 capace di risolvere compiti di 12 ore di lavoro umano nel 50% dei casi è virale come prova di AGI imminente. Letto per intero, il paper limita il test a software, ML e cybersec, con CI da 5 a 65 ore. Il fenomeno si chiama benchmark maxing: i benchmark misurabili sono tutti su task verificabili, mentre legali, commerciali e medici restano fermi. Analizzo METR, RLVR e AA Omniscience per distinguere progresso da hype. Continua a leggere
Ultima modifica:

Strumenti utili

Tool gratuiti che possono servirti:

JSON formatter, Convertitore Markdown/HTML.