Categoria

Pagina 2 di 3

LLM: i modelli linguistici, in produzione e a costo controllato

Un LLM non è magia, è un componente di sistema con costi, latenza, limiti e comportamenti da capire. Sceglierlo, farlo girare e integrarlo bene richiede le stesse competenze ingegneristiche di qualsiasi altra infrastruttura, più un po' di sano scetticismo verso i claim e i benchmark. Questa categoria guarda ai modelli con l'occhio di chi li mette in produzione, non di chi li celebra.

Il primo tema è il modello come componente ingegneristico. Come si valuta davvero un LLM prima di adottarlo, come si leggono benchmark e paper senza farsi ingannare dai grafici, quando un modello linguistico è lo strumento giusto e quando invece non lo è affatto. Capire i limiti architetturali, dalle allucinazioni che il prompting non risolve al ragionamento che resta euristico, è ciò che separa un'integrazione solida da una scommessa.

Il secondo tema è il self-hosting e la sovranità del dato: quando conviene un modello open-weight on-premise rispetto a un'API cloud, la scelta del runtime (vLLM contro Ollama), il deployment su GPU, la quantization per far stare un modello nella VRAM che hai, e i temi che diventano decisivi per una PMI europea, dalla retention imposta al kill-switch, dai costi di energia al ROI reale.

Il terzo tema è l'italiano e i costi che nessuno ti dice: la tassa nascosta della tokenizzazione, che fa consumare a un prompt italiano molti più token del suo equivalente inglese, e come la si riduce. Perché il costo di un LLM non è il prezzo di listino, è quello che paghi davvero sul tuo carico.

Se stai valutando come integrare un LLM in azienda, vedi l'AI per le aziende o scrivimi.

La domanda non è "quale modello è il migliore". È "quale modello risolve il mio problema al costo e al rischio che posso permettermi".

Benchmarking Qwen3.6-35B-A3B on a 16GB RTX 5060 Ti: A Full Engineering Teardown

Benchmarking Qwen3.6-35B-A3B on a 16GB RTX 5060 Ti: A Full Engineering Teardown The engineering companion to the strategic piece on local inference, deliberately exhaustive. llama.cpp build flags for Blackwell, VRAM accounting to the MiB, context ceilings per quantization, prefill and decode throughput with and without MTP, a roofline analysis of why speculative decoding helps this MoE, a 200-call agentic tool-calling harness, and an autopsy of a KV-cache compression technique that crashed with its CUDA stack trace. Every figure measured on one fixed rig. Continua a leggere
Ultima modifica:

Running an LLM Locally on a 16GB Consumer GPU: Why It Suddenly Matters in 2026

Running an LLM Locally on a 16GB Consumer GPU: Why It Suddenly Matters in 2026 Running a serious LLM on your own hardware is no longer a lab exercise. I put a 16GB consumer GPU through a 35-billion-parameter Mixture-of-Experts model with 262,000 tokens of context, and the agentic tool-calling came out 100% reliable. This is the strategic half of the story: why local inference turned from a hobby into architectural insurance in 2026, after a frontier model was suspended worldwide by government order. The hard numbers live in the companion deep-dive. Continua a leggere
Ultima modifica:

Mistral 3 MoE on-prem EU vs Claude API: quando preferire open-weight europeo per data sovereignty

Mistral 3 MoE on-prem EU vs Claude API: quando preferire open-weight europeo per data sovereignty Mistral Large 3 MoE (2 dicembre 2025) è il primo open-weight frontier-class deployabile on-prem in Europa - 41B attivi / 675B totali, Apache 2.0, addestrato su 3000 H200 francesi. Confronto con Claude Sonnet 4.6 via API: accuracy, latenza P95, costi totali per 1M chiamate, compliance GDPR. Include configurazione Scaleway H100 SXM ($2,73/hr) vs managed Bedrock. Continua a leggere
Ultima modifica:

Continual learning e World Models: la roadmap AGI di Amodei e Hassabis a confronto

Continual learning e World Models: la roadmap AGI di Amodei e Hassabis a confronto Dario Amodei e Demis Hassabis, i due CEO più autorevoli del settore AI, disegnano due roadmap diverse verso l'AGI. Amodei scommette su RLVR cross-domain come futuro scatto di generalizzazione. Hassabis sostiene che serva altro: continual learning, World Models, esperienza fisica simulata. Dietro il disaccordo una scelta di investimento che impatta le roadmap aziendali dei prossimi due anni. Confronto delle due strategie con dati 2025-2026 e implicazioni sul tipo di pipeline da costruire oggi. Continua a leggere
Ultima modifica:

Leggere un paper AI nel 2026: guida critica a benchmark, metodologia e claim esagerati

Leggere un paper AI nel 2026: guida critica a benchmark, metodologia e claim esagerati Su arXiv ogni giorno escono centinaia di paper AI e pochi thread Twitter li traducono in claim virali. The Illusion of Thinking di Apple è stato risposto con The Illusion of the Illusion of Thinking, paper semi-scherzoso scritto in larga parte da Claude Opus, e intere community scientifiche lo hanno citato senza leggerlo. Saper leggere un paper AI con occhio critico nel 2026 è competenza di business: la mia checklist in otto passaggi per capire se un lavoro porta evidenze o hype. Continua a leggere
Ultima modifica:

Qdrant 1.15 asymmetric quantization e binary storage: 10x meno VRAM per stesso recall

Qdrant 1.15 asymmetric quantization e binary storage: 10x meno VRAM per stesso recall Qdrant 1.15 porta asymmetric quantization in produzione: puoi comprimere i vettori a 1,5 bit (24x compressione) mantenendo scalar query alla risoluzione piena. Sul dataset da 180k embedding della mia sandbox, la RAM residente del vector DB è passata da 1,6 GB a 170 MB con recall@10 in calo di soli 0,8 punti. Tutorial completo: setup, configurazione Compose con binding, migrazione da uncompressed, benchmark. Continua a leggere
Ultima modifica:

Vocabolario AI 2026: i concetti tecnici che un decisore IT deve distinguere davvero

Vocabolario AI 2026: i concetti tecnici che un decisore IT deve distinguere davvero Quando un vendor ti propone un progetto AI per la tua azienda, sa distinguere pretraining da fine-tuning? Sa perché Mixture of Experts cambia i costi di inferenza di un ordine di grandezza? Sa che un benchmark MMLU 5-shot non è comparabile con un 25-shot? Ho passato in rassegna i 28 concetti tecnici che nei contratti enterprise del 2026 vedono più confusione, con distinzioni rigorose per non farsi vendere fumo e per costruire domande operative ai fornitori. Continua a leggere
Ultima modifica:

Prompt engineering avanzato per sviluppatori: pattern concreti per task tecnici ricorrenti

Prompt engineering avanzato per sviluppatori: pattern concreti per task tecnici ricorrenti Il prompt engineering non è magia, è struttura. Ti mostro i 6 pattern che uso quotidianamente per task tecnici: chain of thought per debugging complessi, few-shot con esempi verificati per generazione codice coerente, structured output per pipeline automatiche, system prompt con boundaries espliciti. Ogni pattern con template riutilizzabile e anti-pattern da evitare. Continua a leggere
Ultima modifica:

Strumenti utili

Tool gratuiti a supporto:

Convertitore Markdown/HTML, JSON formatter.