loading experience
C++ NVIDIA CUDA Python .NET Disponibile ora v0.1.4

DesireeIA

Il motore di inferenza AI locale per .NET e Python.

Carica modelli quantizzati e li esegue interamente sul tuo hardware: CPU o GPU NVIDIA scelte in automatico, GGUF e safetensors, server compatibile OpenAI con interfaccia web.

0chiamate di rete
65,6token/s in generazione su un portatile aziendale
4.092token/s in prefill sulla stessa GPU da 6 GB
20+famiglie di architetture supportate
Demo

Guardala lavorare.

Una sessione reale con il modello Spark, eseguita in locale.

Cosa fa

Un motore tuo, sulla tua macchina.

Nato nel 2023 dall'esigenza di avere un motore di inferenza locale davvero posseduto, pensato per l'ecosistema .NET e utilizzabile anche da altre tecnologie. Il core è in C++ per il controllo della memoria e le migliori prestazioni su hardware comune.

100% locale e privato

Nessuna chiamata di rete, nessun servizio esterno: prompt e risposte restano sulla tua macchina.

Si adatta all'hardware

Sonda la macchina e costruisce un piano di esecuzione: thread, memoria, quantizzazione e backend, CPU o GPU NVIDIA.

Nativo per .NET e Python

Pacchetto NuGet con API C# asincrona, pacchetto PyPI e un core C++ con ABI C stabile.

GGUF e safetensors

Carica direttamente i checkpoint safetensors, anche con Mixture-of-Experts, senza conversioni preliminari.

MoE in streaming da SSD

I pesi degli esperti passano da un archivio a livelli, con previsione del routing, invece di restare tutti in RAM.

Visione

Se il modello include un encoder visivo viene caricato in automatico: puoi fare domande su un'immagine.

Strumenti e JSON

Chiamata di strumenti, output strutturato, sequenze di stop e streaming asincrono con annullamento.

Sessioni salvate

Il prompt di sistema di un agente viene ripristinato da una sessione salvata in meno di un secondo.

Prestazioni

Misurato su un portatile qualunque.

Intel Core Ultra 7 155H, GPU NVIDIA RTX 1000 Ada da 6 GB, 32 GB di RAM, Windows 11. Hardware aziendale, non da workstation: le GPU con più SM scalano di conseguenza.

GPU (CUDA), token al secondo

ModelloPesiPrefill 512Prefill 2048Prefill 8192 GenerazionePrompt agente, prima voltaDa sessione salvata
Spark-X2.5 4BQ4_K_M1.9182.0731.94346,54,3 s1,0 s
Gemma 3 4BQ4_K_M2.6372.6242.74759,53,4 s0,9 s
Qwen2.5-Coder 3BQ8_03.0353.1333.02449,73,0 s0,3 s
MiniCPM5 2BQ8_04.0924.0073.67065,62,7 s0,3 s

Solo CPU, senza GPU (la strada di ogni Mac e di ogni PC non NVIDIA)

ModelloPrefill 512 (tok/s)Generazione (tok/s)
Spark-X2.5 4B Q4_K_M8917
Gemma 3 4B Q4_K_M10618
Qwen2.5-Coder 3B Q8_013413
MiniCPM5 2B Q8_018416

A parità di modello, file GGUF e GPU, DesireeIA è alla pari o più veloce di un motore open source di riferimento: da +0,1% a +13,3% in prefill e da +3,3% a +5,4% in generazione, con più lavoro per joule sulla GPU. Le prestazioni del portatile variano di circa ±10% tra una misura e l'altra.

Modelli

Tante famiglie, un solo motore.

Le differenze tra famiglie sono gestite da un sistema di comportamenti per modello, non da un'implementazione diversa per ognuna.

  • Gemma 1-3
  • Qwen 2 · 3 · MoE
  • Mistral
  • MiniCPM
  • InternLM2
  • Exaone
  • SmolLM3
  • Spark 2.5
  • DeepSeek2 (MLA + MoE)
  • Mamba2
  • BERT
  • Starcoder2
  • Nemotron
  • Olmo2
  • Cohere2
  • Falcon
  • GPT-2
  • BLOOM
  • MPT
  • StableLM
  • Orion
  • Arcee
Per iniziare

Dal terminale al tuo codice.

Scegli la strada che ti serve: server con interfaccia web, libreria Python o libreria C#.

Server compatibile OpenAI

pip install desireeia-server
desireeia-server --model modello.gguf --port 8080
# apri http://127.0.0.1:8080

API /v1/chat/completions, modalità router per più modelli, chiamata di strumenti, voce, metriche Prometheus.

C# / .NET

dotnet add package DesireeIA

await foreach (var piece in model.ChatStreamAsync(messages))
    Console.Write(piece);

API asincrona con annullamento, sequenze di stop e output strutturato.

Python

pip install desireeia

Lo stesso motore nativo, incluso nel pacchetto per le piattaforme supportate.

CLI pronta all'uso

desireeia-cli chat modello.gguf

Pacchetti autonomi per Windows x64 e Linux x64, senza installare .NET né CUDA. Su macOS si compila dai sorgenti.

Licenza

Gratuito da usare, aperto al dialogo.

DesireeIA si può scaricare, installare ed eseguire gratuitamente, per uso personale e commerciale, e si può condividere nella forma originale e non modificata. Modifiche, derivati e riuso di parti del codice richiedono l'autorizzazione scritta dell'autore. Il codice non può essere usato per addestrare o replicare sistemi di intelligenza artificiale senza consenso.

Idee, collaborazioni e integrazioni in nuove architetture sono benvenute: scrivici.

Contattaci
DesireeIA

L'intelligenza che resta a casa tua.

Scarica DesireeIA, provala con i tuoi modelli e raccontaci cosa ci costruisci.