Categoria

Pagina 1 di 3

LLM: i modelli linguistici, in produzione e a costo controllato

Un LLM non è magia, è un componente di sistema con costi, latenza, limiti e comportamenti da capire. Sceglierlo, farlo girare e integrarlo bene richiede le stesse competenze ingegneristiche di qualsiasi altra infrastruttura, più un po' di sano scetticismo verso i claim e i benchmark. Questa categoria guarda ai modelli con l'occhio di chi li mette in produzione, non di chi li celebra.

Il primo tema è il modello come componente ingegneristico. Come si valuta davvero un LLM prima di adottarlo, come si leggono benchmark e paper senza farsi ingannare dai grafici, quando un modello linguistico è lo strumento giusto e quando invece non lo è affatto. Capire i limiti architetturali, dalle allucinazioni che il prompting non risolve al ragionamento che resta euristico, è ciò che separa un'integrazione solida da una scommessa.

Il secondo tema è il self-hosting e la sovranità del dato: quando conviene un modello open-weight on-premise rispetto a un'API cloud, la scelta del runtime (vLLM contro Ollama), il deployment su GPU, la quantization per far stare un modello nella VRAM che hai, e i temi che diventano decisivi per una PMI europea, dalla retention imposta al kill-switch, dai costi di energia al ROI reale.

Il terzo tema è l'italiano e i costi che nessuno ti dice: la tassa nascosta della tokenizzazione, che fa consumare a un prompt italiano molti più token del suo equivalente inglese, e come la si riduce. Perché il costo di un LLM non è il prezzo di listino, è quello che paghi davvero sul tuo carico.

Se stai valutando come integrare un LLM in azienda, vedi l'AI per le aziende o scrivimi.

La domanda non è "quale modello è il migliore". È "quale modello risolve il mio problema al costo e al rischio che posso permettermi".

vLLM batte Ollama quando: guida alla scelta del runtime di inference self-hosted

vLLM batte Ollama quando: guida alla scelta del runtime di inference self-hosted Ollama è il default per iniziare, ma non regge ogni carico. Confronto tecnico dei runtime di inference self-hosted: vLLM per throughput e batching su GPU, TGI e sglang per scenari specifici, llama.cpp server per hardware modesto. Quando ciascuno è la scelta giusta, in base a hardware disponibile, concorrenza richiesta e vincoli di latenza. Per chi porta l'inference on-prem dopo aver deciso di non dipendere da un'API di frontiera. Continua a leggere
Ultima modifica:

Retention imposta e kill-switch: il doppio argomento per il self-hosting di un LLM

Retention imposta e kill-switch: il doppio argomento per il self-hosting di un LLM La retention obbligatoria a 30 giorni imposta sui modelli Mythos-class, anche per chi aveva zero-data-retention, era già un argomento per l'inference on-prem. La sospensione di Fable 5 del 12 giugno 2026 ne aggiunge un secondo, più forte: la disponibilità. Per una PMI con vincoli GDPR, NIS2 o sovranità del dato, il self-hosting con Ollama o vLLM è l'unica architettura immune sia alla retention imposta sia al kill-switch sovrano. Quando conviene davvero e cosa costa. Continua a leggere
Ultima modifica:

Integrare un LLM nella pipeline CI/CD: automazione sicura e riduzione del debito tecnico

Integrare un LLM nella pipeline CI/CD: automazione sicura e riduzione del debito tecnico Un LLM in pipeline CI/CD può fare code review automatica, rilevare regressioni di sicurezza e proporre remediation del debito tecnico prima del merge. Ma collegare un modello alla pipeline introduce vettori nuovi: prompt injection da contenuto del repo, esfiltrazione di segreti, falsi positivi che rallentano il deploy. Come integrarlo in modo sicuro, con least-privilege e human-in-the-loop nei punti giusti. Continua a leggere
Ultima modifica:

The Real Cost of a Self-Hosted Coding LLM: Energy, ROI and Concurrency on a 16GB GPU

The Real Cost of a Self-Hosted Coding LLM: Energy, ROI and Concurrency on a 16GB GPU The companion to the Ornith-vs-Qwable benchmark turns from which model to what it costs. I measured the power a 9B coding model draws on a 16GB GPU, then set the energy bill against Claude's and Copilot's 2026 list prices: the marginal cost per million tokens is one to two orders of magnitude below any API tier. But the card only pays off on real token volume, autocomplete alone loses to Copilot's flat plan, and 16GB is a single-stream device: you scale by adding cards, not developers. Continua a leggere
Ultima modifica:

Ornith vs Qwable: Benchmarking Two 9B Coding Agents on a 16GB GPU

Ornith vs Qwable: Benchmarking Two 9B Coding Agents on a 16GB GPU The third part of the local-inference series drops from the 35B MoE to the models most people want on a coding workstation: small, dense, 9-billion-parameter agents. I ran two of them, same base and opposite training recipes, through a full agent loop on a real buggy project plus a Copilot-style autocomplete bench. Neither speed nor correctness separates them: the discriminator is agentic path economy, training- and task-shaped. And local can stand in for Copilot warm, with one 16GB asterisk. Continua a leggere
Ultima modifica:

Laravel AI SDK: feature AI provider-agnostic, e perché ora è risk-mitigation non comodità

Laravel AI SDK: feature AI provider-agnostic, e perché ora è risk-mitigation non comodità Il AI SDK first-party di Laravel porta text generation, tool-calling ed embeddings con uno switch di provider gestito da config. Fino a ieri lo si vendeva come comodità; dopo la sospensione di Fable 5 del 12 giugno 2026 è risk-mitigation: chi ha l'abstraction layer agnostico fa fallback in una riga quando un modello viene spento dall'alto, chi è cablato si ferma. Esempio concreto con un provider primario e un fallback, e cosa serve perché lo switch sia davvero indolore. Continua a leggere
Ultima modifica:

Vale la pena spostare la mia pipeline su un modello di frontiera? Bilancio di prima mano

Vale la pena spostare la mia pipeline su un modello di frontiera? Bilancio di prima mano Bilancio esperienziale dopo settimane di pipeline editoriale e di sviluppo su un modello di frontiera: dove il tier superiore ha fatto davvero la differenza (task lunghi, refactoring estesi) e dove il modello standard bastava a metà del costo. Con il caveat onesto reso evidente dall'affaire Fable 5: un modello di frontiera può essere sospeso dall'alto, il che rafforza il punto sulla sostituibilità. Information gain massimo, niente recensione da rumor. Continua a leggere
Ultima modifica:

Progettare la sostituibilità del modello AI: abstraction layer, eval di portabilità, fallback self-hosted

Progettare la sostituibilità del modello AI: abstraction layer, eval di portabilità, fallback self-hosted Dopo la sospensione di Fable 5 del 12 giugno 2026, la domanda per chi sviluppa con l'AI non è più solo "quale modello" ma "cosa succede quando il modello sparisce". La risposta è architetturale: un abstraction layer provider-agnostic (Laravel AI SDK, LiteLLM), eval di portabilità che misurano la regressione cambiando modello, un fallback multi-provider o self-hosted, e un exit plan documentato. Non significa non usare i frontier model: significa progettarne la sostituibilità prima che serva. Continua a leggere
Ultima modifica:

L'AI scrive gran parte del codice di chi la produce: cosa significa per chi assume sviluppatori

L'AI scrive gran parte del codice di chi la produce: cosa significa per chi assume sviluppatori Le aziende di frontiera dichiarano che una quota crescente del loro codice è ormai scritta dall'AI, con il task-horizon che si allunga di mese in mese. Lettura ingegneristica e non allarmistica per un decisore: cosa cambia davvero per chi assume sviluppatori junior, dove resta il valore del senior che fa review e architettura, e il rischio della cascata sistemica quando l'AI genera codice che nessuno comprende a fondo. Niente profezie, solo implicazioni concrete sull'organizzazione di un team. Continua a leggere
Ultima modifica:

Benchmarking Qwen3.6-35B-A3B on a 16GB RTX 5060 Ti: A Full Engineering Teardown

Benchmarking Qwen3.6-35B-A3B on a 16GB RTX 5060 Ti: A Full Engineering Teardown The engineering companion to the strategic piece on local inference, deliberately exhaustive. llama.cpp build flags for Blackwell, VRAM accounting to the MiB, context ceilings per quantization, prefill and decode throughput with and without MTP, a roofline analysis of why speculative decoding helps this MoE, a 200-call agentic tool-calling harness, and an autopsy of a KV-cache compression technique that crashed with its CUDA stack trace. Every figure measured on one fixed rig. Continua a leggere
Ultima modifica:

Strumenti utili

Tool gratuiti a supporto:

Convertitore Markdown/HTML, JSON formatter.