← Blog

Un modello, nove prezzi

Chiedi a una qualsiasi API di inferenza quale versione del modello ti ha appena risposto. Quasi nessuna te lo dirà. Lo stesso nome copre pesi che variano di un fattore tre in dimensione e molto in qualità — e paghi lo stesso prezzo in entrambi i casi.

Pubblichiamo nove prezzi per Qwen3.8 27B, da 0,75 € a 0,28 € per milione di token in uscita, e il conto segue i pesi che hanno davvero girato.

Mai sopra il prezzo esposto

Il prezzo dichiarato è quello del build migliore. Tutto il resto è uno sconto: la cifra sulla pagina è un tetto, non una media che potresti superare.

Un header fissa il minimo

-H "X-ElephantPool-Require: quality:reference"

Le tue richieste raggiungono allora solo macchine con i pesi di riferimento. È un minimo, non un'uguaglianza — una qualità migliore è sempre accettata — quindi fissarlo rende il costo prevedibile senza mai costarti un host disponibile.

Perché la fascia bassa è davvero bassa

Pesi più piccoli si decodificano più in fretta, quindi la macchina produce più token all'ora. Prezzare per build ti gira quel vantaggio invece di tenerlo. Un modello da 27 miliardi di parametri a 0,28 € costa meno di quanto buona parte del mercato chieda per uno tre volte più piccolo.

E perché puoi verificarlo

Ogni richiesta completata produce una ricevuta firmata sulla macchina che l'ha servita, con l'impronta del file di pesi caricato. Lo sconto si calcola da quella firma. Un host non può servire il build economico e farsi pagare quello costoso, e noi non possiamo fatturarti una qualità che nessuno ha consegnato.

Il riferimento completo sui prezzi è nella knowledge base.

Reference

Read next

one model, every card: how a 27b runs on 8 gb

Qwen3.8 27B ships in five builds, from Q5_K_M on a 24 GB card down to IQ2_XXS on 8 GB. Why we split models from builds, what quantization actually costs, and how a quantized KV cache doubled our context overnight.

we stopped projecting your earnings and started measuring them

Most GPU marketplaces advertise what a card could earn. Our dashboard shows what yours measured, and refuses to show a number until it has one. Here is why that choice cost us a nicer-looking page and was still right.

Model catalogue · Knowledge base · Run a GPU