Categoria

Pagina 4 di 6

LLM Automation: dall'esperimento all'infrastruttura produttiva

Usare un modello linguistico per una demo è facile. Metterlo in una pipeline aziendale che gira ogni giorno, con costi controllati, output verificabile e governance chiara, è un lavoro di ingegneria. È la differenza fra il giocattolo e lo strumento, ed è la distinzione attorno a cui ruota tutta questa categoria.

Il primo tema è il salto dalla demo alla produzione. Un LLM in produzione ha bisogno delle stesse cure di qualsiasi altro componente critico: monitoring di qualità, costi e anomalie, gestione degli errori transitori, budgeting dei token, difesa dagli abusi. Scrivo di come si costruisce una pipeline che regge il carico reale senza far esplodere la bolletta e senza produrre output di cui nessuno si fida.

Il secondo tema è l'automazione applicata al lavoro vero: orchestrazione multi-step, agenti che pianificano ed eseguono, LLM messi in pipeline CI/CD per code review, generazione di test e documentazione, migrazioni assistite. Non prompt isolati, ma architetture di automazione che si integrano nel processo esistente invece di crearne uno parallelo e incontrollabile.

Il terzo tema è il lato scomodo, che raccontano in pochi: il debito di comprensione che l'AI accumula in una codebase mentre sembra accelerare, la sycophancy dei modelli nelle decisioni aziendali, il riposizionamento dell'ingegnere senior, e le decisioni che restano tue e non vanno delegate a un modello. L'onestà su cosa funziona e cosa no vale più di qualsiasi entusiasmo.

Se vuoi portare l'automazione LLM in produzione sul serio, vedi l'automazione con l'AI o scrivimi.

L'AI non sostituisce l'ingegnere. Sposta il lavoro dal digitare codice al decidere cosa è giusto, che è sempre stato il lavoro vero.

Vocabolario AI 2026: i concetti tecnici che un decisore IT deve distinguere davvero

Vocabolario AI 2026: i concetti tecnici che un decisore IT deve distinguere davvero Quando un vendor ti propone un progetto AI per la tua azienda, sa distinguere pretraining da fine-tuning? Sa perché Mixture of Experts cambia i costi di inferenza di un ordine di grandezza? Sa che un benchmark MMLU 5-shot non è comparabile con un 25-shot? Ho passato in rassegna i 28 concetti tecnici che nei contratti enterprise del 2026 vedono più confusione, con distinzioni rigorose per non farsi vendere fumo e per costruire domande operative ai fornitori. Continua a leggere
Ultima modifica:

Agente AI per analisi tecnica di codebase PHP legacy: architettura con Claude API e tool use

Agente AI per analisi tecnica di codebase PHP legacy: architettura con Claude API e tool use Il primo giorno su un progetto legacy è sempre disorientante: migliaia di file, zero documentazione, tempo limitato. Ho costruito un agente AI con Claude API e tool use per automatizzare l'assessment iniziale: chunking intelligente, navigazione filesystem, generazione di report strutturato con priorità. Ti mostro l'architettura, i prompt che uso, la gestione del contesto lungo e il controllo dei costi. Continua a leggere
Ultima modifica:

SDK TypeScript per consumer di API AI: streaming SSE, error recovery, cost tracking lato client

SDK TypeScript per consumer di API AI: streaming SSE, error recovery, cost tracking lato client Un'applicazione AI consumer-facing richiede un SDK TypeScript robusto lato client: streaming SSE che gestisce reconnect su disconnessione rete, error recovery discriminando errori transitori da permanenti, cost tracking per mostrare il consumo utente, tipizzazione forte sugli output strutturati del backend. Ti mostro l'architettura dell'SDK che ho costruito come libreria interna: API pulita, zero dipendenze browser, supporto React/Vue/vanilla, pattern di ripresa sessione dopo navigazione. Continua a leggere
Ultima modifica:

Go come inference gateway per LLM: perché Golang vince su PHP e Node quando la latenza conta davvero

Go come inference gateway per LLM: perché Golang vince su PHP e Node quando la latenza conta davvero PHP e Node sono ottimi per la logica di dominio, ma come inference gateway per LLM sotto carico soffrono: event loop Node saturabile con chiamate lente, PHP-FPM worker-bound con decine di secondi di attesa per token streaming. Go risolve entrambi: concorrenza nativa con goroutine, latenza sub-10ms sui routing decision, gestione elegante di streaming SSE verso migliaia di client paralleli. Ti mostro l'architettura gateway Go che ho costruito come front-end unificato per modelli LLM eterogenei. Continua a leggere
Ultima modifica:

LLM per generazione test automatici: da 5% a 70% di copertura su codebase PHP legacy

LLM per generazione test automatici: da 5% a 70% di copertura su codebase PHP legacy Partire da 5% di copertura test su un codebase legacy è demoralizzante. Portarla al 70% in 3 mesi è realistico con LLM nell'anello di supporto - ma solo se il processo è strutturato. Ti mostro il workflow che ho testato: LLM genera characterization test sul comportamento esistente, sviluppatore verifica, itera. Con catalogo degli anti-pattern LLM tipici (test che passano sempre, assertion inutili) e come rilevarli. Continua a leggere
Ultima modifica:

pgvector in produzione: indici HNSW, IVFFlat e tuning per applicazioni AI con dataset medi

pgvector in produzione: indici HNSW, IVFFlat e tuning per applicazioni AI con dataset medi pgvector trasforma PostgreSQL in un vector database capace. Ma la scelta dell'indice e il tuning dei parametri fanno la differenza tra latenza di 50ms e 5 secondi. Ti mostro il confronto pratico sul dataset di benchmark che uso nel mio laboratorio: quando usare HNSW, quando IVFFlat, come dimensionare m/ef_construction, trade-off memoria vs speed, integrazione con Laravel per pipeline di embedding e ricerca semantica. Continua a leggere
Ultima modifica:

LLM per code review automatica in pipeline GitHub e GitLab: qualità senza rallentamenti

LLM per code review automatica in pipeline GitHub e GitLab: qualità senza rallentamenti La code review umana è collo di bottiglia in molti team piccoli. Gli LLM possono affiancare i reviewer senior, non sostituirli, a condizione che la pipeline sia ben progettata. Ti mostro l'integrazione GitHub Actions + Claude API che ho implementato: prompt strategy per ridurre falsi positivi, esclusione di file sensibili, combinazione con PHPStan per ridurre rumore, controllo dei costi per PR. Continua a leggere
Ultima modifica:

Laravel Horizon per chiamate LLM asincrone: retry strategy, cost tracking, timeout management in produzione

Laravel Horizon per chiamate LLM asincrone: retry strategy, cost tracking, timeout management in produzione Le chiamate LLM sono lente (5-30 secondi), costose (€ per token), soggette a errori transitori (rate limit, 529 overloaded). Farle sincrone nel ciclo HTTP è un anti-pattern garantito. La pipeline giusta passa da Horizon con job dedicati: retry con backoff esponenziale per errori transitori, cost tracking per job con alerting anomalie, timeout management che distingue tra retry-safe e fatal. Ti mostro l'architettura completa con codice reale che uso nella mia pipeline personale su Claude API. Continua a leggere
Ultima modifica:

Containerizzare LLM self-hosted su VPS con GPU: nvidia-container-toolkit, orchestrazione di modelli multipli

Containerizzare LLM self-hosted su VPS con GPU: nvidia-container-toolkit, orchestrazione di modelli multipli Containerizzare un LLM self-hosted non è come containerizzare PHP-FPM. Serve nvidia-container-toolkit per passthrough GPU, gestione dei modelli come persistent volume, orchestrazione di modelli multipli (uno generalista, uno specializzato, un embedding model) con routing intelligente per caso d'uso. Ti mostro l'architettura Docker Compose che uso su VPS GPU: configurazione GPU passthrough, persistent cache, health check, monitoring dei VRAM consumption e risposta alle OOM. Continua a leggere
Ultima modifica:

Strumenti utili

Tool gratuiti che possono servirti:

JSON formatter, Convertitore Markdown/HTML.