Giudizio rapido, intuitivo e calibrato
- ObiettivoValutazione e classificazione istantanea
- OutputVincolato e tipizzato: booleani, enum, punteggi
- Latenza10 – 50 ms
- NaturaDeterministica, probabilità calibrate
- CalcoloMinimo: SLM piccoli e classificatori
Veloce quando basta, profondo quando serve.
Ispirandoci ai due sistemi cognitivi di Kahneman, separiamo il giudizio rapido e calibrato dal ragionamento lento e deliberativo: il primo risolve quasi tutto in millisecondi, il secondo interviene solo sui casi complessi.
Per anni l'ingegneria del software enterprise ha usato i grandi modelli linguistici generici per qualsiasi compito, compresi classificazione, triage e decisioni binarie.
Chiedere a un modello da 70 o 400 miliardi di parametri di generare testo libero per valutare se una transazione è fraudolenta o se un ticket va all'amministrazione è l'equivalente ingegneristico di usare un aereo a reazione per spostarsi di 100 metri.
Separare e coordinare il giudizio rapido e il ragionamento lento.
La mente non affronta ogni stimolo con la massima concentrazione. Su una strada familiare o davanti a un volto riconosciuto attiviamo il Sistema 1: immediato, a bassissimo consumo, basato su pattern. Per un'equazione o una mossa a scacchi attiviamo il Sistema 2: lento, sequenziale, faticoso.
Il problema dei LLM generativi tradizionali è l'iper-confidenza: possono produrre un'affermazione completamente errata (allucinazione) con un'apparente certezza assoluta. I modelli System One sono addestrati o post-calibrati con tecniche dedicate (per esempio apprendimento per rinforzo con premi di calibrazione, o temperature scaling) per allineare la confidenza dichiarata all'accuratezza reale:
Se il modello dichiara p = 0,92, su un campione ampio di casi con quel punteggio circa 92 su 100 sono corretti. Per questo la confidenza diventa una soglia affidabile con cui il software decide.
In produzione il System One agisce da gateway decisionale e router di sicurezza: filtra, classifica e risolve la stragrande maggioranza del carico, scalando al System Two solo i casi realmente complessi o ambigui.
risposta o azione
Con probabilità calibrate, la soglia τ è una leva di business misurabile: più è alta, meno errori automatici e più casi passano all'analisi lenta.
| System One | LLM generativi generici (GPT-4o, Llama 3) | System Two (o1, o3, Reasoning) | |
|---|---|---|---|
| Scopo primario | Decisione, classificazione, triage, routing | Generazione di testo libero e sintesi | Problemi complessi e logica |
| Tipo di output | Tipi rigidi (Enum, Bool, Float, JSON) | Testo non strutturato, Markdown | Chain-of-Thought + risposta |
| Latenza tipica | 10 – 50 ms | 1,0 – 3,0 s | 5,0 – 60,0 s |
| Calibrazione della confidenza | Alta, da verificare su dati reali (ECE) | Assente o incoerente | Interna al processo di ricerca |
| Rischio di allucinazione | Basso (spazio di output vincolato, ma non nullo) | Medio-alto | Basso sulla logica, medio sui dati |
| Costo computazionale | Bassissimo (~$0,0001 / richiesta) | Medio (~$0,005 / richiesta) | Alto ($0,03 – $0,15 / richiesta) |
| Hardware ottimale | Edge, CPU o SLM su GPU leggera | GPU cloud o server dedicati | Cluster GPU ad altissima memoria |
Ordini di grandezza a pieno carico. Nel caso studio sotto, un'istanza locale da €350/mese su 900.000 richieste costa €0,00039 a richiesta: il costo reale dipende dal volume.
Con volumi elevati di transazioni al secondo servono risposte sub-secondarie: un LLM generativo è inutilizzabile per latenza e costo. Il System One analizza le caratteristiche della transazione, confronta il grafo dei comportamenti e restituisce APPROVE / FLAG_FOR_REVIEW in decine di millisecondi con confidenza calibrata.
Prima di inviare la richiesta all'infrastruttura RAG o ai database, un System One classifica l'intento: tentativi di bypass, violazioni di conformità, richieste fuori dominio. Le minacce sono bloccate alla radice.
Invece di una conversazione dispersiva, il System One identifica la categoria del problema e genera un form dinamico per i dati mancanti, instradando la pratica al reparto giusto senza sprecare token.
Un'azienda gestisce 1.000.000 di interazioni operative al mese per classificare e lavorare pratiche aziendali.
Riduzione dei costi infrastrutturali: −93,5%
Latenza media percepita: 2,5 s
Latenza media: 0,9 × 30 ms + 0,1 × 2,5 s = 277 ms · per il 90% degli utenti: 30 ms
F = istanza locale (€350 ≈ $380). Ogni punto percentuale in più risolto dal System One toglie $60 al mese di escalation: la qualità del router vale denaro.
Ipotesi: cambio $1 = €0,92; listino GPT-4o ($2,50 / $10 per 1M token); monolite con 4.000 token in e 500 out per richiesta, escalation con 1.000 in e 350 out grazie al contesto ridotto dal System One; costo istanza locale stimato. Da sostituire con i dati reali del cliente.
Un giudizio rapido e calibrato per quasi tutto, un ragionamento profondo solo dove serve: più veloce, più economico, più affidabile.
Parla con la community
Vedi chi è online, scrivi messaggi privati e scambia immagini e file (max 6 MB). Serve un account gratuito.
Accedi Crea un account