loading experience
Progettazione · Il futuro dell'IA

S1·S2 — L'evoluzione dei modelli IA decisionali: l'integrazione tra giudizio rapido (System One) e ragionamento lento (System Two)

Veloce quando basta, profondo quando serve.

Ispirandoci ai due sistemi cognitivi di Kahneman, separiamo il giudizio rapido e calibrato dal ragionamento lento e deliberativo: il primo risolve quasi tutto in millisecondi, il secondo interviene solo sui casi complessi.

Scorri per esplorare
Il principio

Un equivoco architetturale: un LLM per ogni compito.

Per anni l'ingegneria del software enterprise ha usato i grandi modelli linguistici generici per qualsiasi compito, compresi classificazione, triage e decisioni binarie.

Chiedere a un modello da 70 o 400 miliardi di parametri di generare testo libero per valutare se una transazione è fraudolenta o se un ticket va all'amministrazione è l'equivalente ingegneristico di usare un aereo a reazione per spostarsi di 100 metri.

Separare e coordinare il giudizio rapido e il ragionamento lento.

01 · Architettura cognitiva

Dalla mente umana all'ingegneria del software

La mente non affronta ogni stimolo con la massima concentrazione. Su una strada familiare o davanti a un volto riconosciuto attiviamo il Sistema 1: immediato, a bassissimo consumo, basato su pattern. Per un'equazione o una mossa a scacchi attiviamo il Sistema 2: lento, sequenziale, faticoso.

System One · Fast Judgment

Giudizio rapido, intuitivo e calibrato

  • ObiettivoValutazione e classificazione istantanea
  • OutputVincolato e tipizzato: booleani, enum, punteggi
  • Latenza10 – 50 ms
  • NaturaDeterministica, probabilità calibrate
  • CalcoloMinimo: SLM piccoli e classificatori
System Two · Slow Reasoning

Ragionamento lento, analitico e deliberativo

  • ObiettivoProblemi complessi e pianificazione multi-step
  • OutputGenerativo: Chain-of-Thought, grafi di ragionamento
  • Latenza2 – 60 s
  • NaturaAutoregressiva, calcolo durante l'inferenza
  • CalcoloElevato: LLM di frontiera e modelli di ragionamento

p La matematica della calibrazione delle probabilità

Il problema dei LLM generativi tradizionali è l'iper-confidenza: possono produrre un'affermazione completamente errata (allucinazione) con un'apparente certezza assoluta. I modelli System One sono addestrati o post-calibrati con tecniche dedicate (per esempio apprendimento per rinforzo con premi di calibrazione, o temperature scaling) per allineare la confidenza dichiarata all'accuratezza reale:

ℙ( Ŷ = Y | P̂ = p ) = p

Se il modello dichiara p = 0,92, su un campione ampio di casi con quel punteggio circa 92 su 100 sono corretti. Per questo la confidenza diventa una soglia affidabile con cui il software decide.

02 · Orchestrazione

Il flusso di routing decisionale

In produzione il System One agisce da gateway decisionale e router di sicurezza: filtra, classifica e risolve la stragrande maggioranza del carico, scalando al System Two solo i casi realmente complessi o ambigui.

Richiesta in ingressopayload · transazione · prompt AI Firewall / Proxysanificazione e PII masking System Oneclassificazione + confidenza
Confidenza alta score ≥ soglia

Fast path

  • Form dinamici generati
  • Chiamata API backend
  • Decisione automatica
< 50 ms
Confidenza bassa score < soglia

System Two

  • Chain-of-Thought (CoT)
  • Ricerca su grafo / albero
  • Audit e analisi profonda
Human-in-the-Loop

risposta o azione

La soglia

Una regola di decisione, non un'opinione

azione = { esegui se p ≥ τ ; escala se p < τ }

Con probabilità calibrate, la soglia τ è una leva di business misurabile: più è alta, meno errori automatici e più casi passano all'analisi lenta.

Le fasi

Ciclo di esecuzione

  1. Ingresso e sanificazione l'AI Firewall elimina i dati sensibili (PII) e previene la Prompt Injection.
  2. Valutazione System One un singolo pass vettoriale restituisce intento, azione e confidenza.
  3. Fast path sopra soglia (es. ≥ 85%) l'azione è eseguita direttamente in meno di 50 ms.
  4. Slow path sotto soglia o per le eccezioni complesse: ragionamento multi-step del System Two o operatore umano.
03 · Matrice comparativa

Tre famiglie di modelli a confronto

Latenza tipica (scala logaritmica)

System One
10-50 ms
LLM generativo
1-3 s
System Two
5-60 s
5 ms50 ms0,5 s5 s50 s

Costo per richiesta (scala logaritmica)

System One
$0,0001
LLM generativo
$0,005
System Two
$0,03-0,15
$0,0001$0,001$0,01$0,1
System OneLLM generativi generici (GPT-4o, Llama 3)System Two (o1, o3, Reasoning)
Scopo primarioDecisione, classificazione, triage, routingGenerazione di testo libero e sintesiProblemi complessi e logica
Tipo di outputTipi rigidi (Enum, Bool, Float, JSON)Testo non strutturato, MarkdownChain-of-Thought + risposta
Latenza tipica10 – 50 ms1,0 – 3,0 s5,0 – 60,0 s
Calibrazione della confidenzaAlta, da verificare su dati reali (ECE)Assente o incoerenteInterna al processo di ricerca
Rischio di allucinazioneBasso (spazio di output vincolato, ma non nullo)Medio-altoBasso sulla logica, medio sui dati
Costo computazionaleBassissimo (~$0,0001 / richiesta)Medio (~$0,005 / richiesta)Alto ($0,03 – $0,15 / richiesta)
Hardware ottimaleEdge, CPU o SLM su GPU leggeraGPU cloud o server dedicatiCluster GPU ad altissima memoria

Ordini di grandezza a pieno carico. Nel caso studio sotto, un'istanza locale da €350/mese su 900.000 richieste costa €0,00039 a richiesta: il costo reale dipende dal volume.

04 · Casi d'uso enterprise

Dove il giudizio rapido fa la differenza

Rilevamento frodi in tempo reale

Con volumi elevati di transazioni al secondo servono risposte sub-secondarie: un LLM generativo è inutilizzabile per latenza e costo. Il System One analizza le caratteristiche della transazione, confronta il grafo dei comportamenti e restituisce APPROVE / FLAG_FOR_REVIEW in decine di millisecondi con confidenza calibrata.

AI guardrail e firewall di processo

Prima di inviare la richiesta all'infrastruttura RAG o ai database, un System One classifica l'intento: tentativi di bypass, violazioni di conformità, richieste fuori dominio. Le minacce sono bloccate alla radice.

Triage e routing del servizio clienti

Invece di una conversazione dispersiva, il System One identifica la categoria del problema e genera un form dinamico per i dati mancanti, instradando la pratica al reparto giusto senza sprecare token.

05 · Dimensionamento economico

Costi e sostenibilità finanziaria

Un'azienda gestisce 1.000.000 di interazioni operative al mese per classificare e lavorare pratiche aziendali.

Costi tecnologici mensili a confronto (€/mese)

Monolite LLM generativo (tutto su cloud)
€13.800
Ibrido System 1 + System 2
€902

Riduzione dei costi infrastrutturali: −93,5%

Scenario A · Monolite generativo

Tutto su un LLM cloud

cmono = 4.000 × $2,50 / 1M + 500 × $10,00 / 1M = $0,015
1.000.000 × $0,015 = $15.000 / mese (≈ €13.800)

Latenza media percepita: 2,5 s

Scenario B · DigitalSolutions

System One + escalation

90% (900.000) → System One locale: €350 / mese
c2 = 1.000 × $2,50 / 1M + 350 × $10,00 / 1M = $0,006
10% (100.000) × $0,006 = $600 ≈ €552
Cibrido = €350 + €552 = €902 (≈ $980)

Latenza media: 0,9 × 30 ms + 0,1 × 2,5 s = 277 ms · per il 90% degli utenti: 30 ms

Costo al variare della quota risolta dal System One
Cibrido = F + N × (1 − a) × c2
a = 70%
$2.180
a = 80%
$1.580
a = 90%
$980
a = 95%
$680

F = istanza locale (€350 ≈ $380). Ogni punto percentuale in più risolto dal System One toglie $60 al mese di escalation: la qualità del router vale denaro.

−93,5%sui costi infrastrutturali
€12.898risparmio al mese
€154.776risparmio all'anno
~277 mslatenza media, da 2,5 s

Ipotesi: cambio $1 = €0,92; listino GPT-4o ($2,50 / $10 per 1M token); monolite con 4.000 token in e 500 out per richiesta, escalation con 1.000 in e 350 out grazie al contesto ridotto dal System One; costo istanza locale stimato. Da sostituire con i dati reali del cliente.

DigitalSolutions

Il futuro è l'orchestrazione dei due sistemi.

Un giudizio rapido e calibrato per quasi tutto, un ragionamento profondo solo dove serve: più veloce, più economico, più affidabile.