100% locale e privato
Nessuna chiamata di rete, nessun servizio esterno: prompt e risposte restano sulla tua macchina.
Il motore di inferenza AI locale per .NET e Python.
Carica modelli quantizzati e li esegue interamente sul tuo hardware: CPU o GPU NVIDIA scelte in automatico, GGUF e safetensors, server compatibile OpenAI con interfaccia web.
Una sessione reale con il modello Spark, eseguita in locale.
Nato nel 2023 dall'esigenza di avere un motore di inferenza locale davvero posseduto, pensato per l'ecosistema .NET e utilizzabile anche da altre tecnologie. Il core è in C++ per il controllo della memoria e le migliori prestazioni su hardware comune.
Nessuna chiamata di rete, nessun servizio esterno: prompt e risposte restano sulla tua macchina.
Sonda la macchina e costruisce un piano di esecuzione: thread, memoria, quantizzazione e backend, CPU o GPU NVIDIA.
Pacchetto NuGet con API C# asincrona, pacchetto PyPI e un core C++ con ABI C stabile.
Carica direttamente i checkpoint safetensors, anche con Mixture-of-Experts, senza conversioni preliminari.
I pesi degli esperti passano da un archivio a livelli, con previsione del routing, invece di restare tutti in RAM.
Se il modello include un encoder visivo viene caricato in automatico: puoi fare domande su un'immagine.
Chiamata di strumenti, output strutturato, sequenze di stop e streaming asincrono con annullamento.
Il prompt di sistema di un agente viene ripristinato da una sessione salvata in meno di un secondo.
Intel Core Ultra 7 155H, GPU NVIDIA RTX 1000 Ada da 6 GB, 32 GB di RAM, Windows 11. Hardware aziendale, non da workstation: le GPU con più SM scalano di conseguenza.
| Modello | Pesi | Prefill 512 | Prefill 2048 | Prefill 8192 | Generazione | Prompt agente, prima volta | Da sessione salvata |
|---|---|---|---|---|---|---|---|
| Spark-X2.5 4B | Q4_K_M | 1.918 | 2.073 | 1.943 | 46,5 | 4,3 s | 1,0 s |
| Gemma 3 4B | Q4_K_M | 2.637 | 2.624 | 2.747 | 59,5 | 3,4 s | 0,9 s |
| Qwen2.5-Coder 3B | Q8_0 | 3.035 | 3.133 | 3.024 | 49,7 | 3,0 s | 0,3 s |
| MiniCPM5 2B | Q8_0 | 4.092 | 4.007 | 3.670 | 65,6 | 2,7 s | 0,3 s |
| Modello | Prefill 512 (tok/s) | Generazione (tok/s) |
|---|---|---|
| Spark-X2.5 4B Q4_K_M | 89 | 17 |
| Gemma 3 4B Q4_K_M | 106 | 18 |
| Qwen2.5-Coder 3B Q8_0 | 134 | 13 |
| MiniCPM5 2B Q8_0 | 184 | 16 |
A parità di modello, file GGUF e GPU, DesireeIA è alla pari o più veloce di un motore open source di riferimento: da +0,1% a +13,3% in prefill e da +3,3% a +5,4% in generazione, con più lavoro per joule sulla GPU. Le prestazioni del portatile variano di circa ±10% tra una misura e l'altra.
Le differenze tra famiglie sono gestite da un sistema di comportamenti per modello, non da un'implementazione diversa per ognuna.
Scegli la strada che ti serve: server con interfaccia web, libreria Python o libreria C#.
pip install desireeia-server
desireeia-server --model modello.gguf --port 8080
# apri http://127.0.0.1:8080
API /v1/chat/completions, modalità router per più modelli, chiamata di strumenti, voce, metriche Prometheus.
dotnet add package DesireeIA
await foreach (var piece in model.ChatStreamAsync(messages))
Console.Write(piece);
API asincrona con annullamento, sequenze di stop e output strutturato.
pip install desireeia
Lo stesso motore nativo, incluso nel pacchetto per le piattaforme supportate.
desireeia-cli chat modello.gguf
Pacchetti autonomi per Windows x64 e Linux x64, senza installare .NET né CUDA. Su macOS si compila dai sorgenti.
DesireeIA si può scaricare, installare ed eseguire gratuitamente, per uso personale e commerciale, e si può condividere nella forma originale e non modificata. Modifiche, derivati e riuso di parti del codice richiedono l'autorizzazione scritta dell'autore. Il codice non può essere usato per addestrare o replicare sistemi di intelligenza artificiale senza consenso.
Idee, collaborazioni e integrazioni in nuove architetture sono benvenute: scrivici.
ContattaciScarica DesireeIA, provala con i tuoi modelli e raccontaci cosa ci costruisci.
Parla con la community
Vedi chi è online, scrivi messaggi privati e scambia immagini e file (max 6 MB). Serve un account gratuito.
Accedi Crea un account