← Knowledge base

Pagare la qualità che ricevi

Un modello, nove qualità, nove prezzi — e un header che garantisce il minimo. Più economico del mercato in basso, migliore in alto.

La maggior parte delle API dichiara un prezzo per modello e non dice mai quale versione ha risposto. Noi dichiariamo un prezzo per build, e il conto segue i pesi che hanno davvero girato.

Un modello, una scala di prezzi

Qwen3.8 27B, per milione di token in uscita:

BuildQualitàPrezzo
UD-Q5_K_Mriferimento0,75 €
UD-Q4_K_Mriferimento0,62 €
UD-IQ4_XSbilanciato0,54 €
UD-Q3_K_XLbilanciato0,50 €
UD-IQ2_XXScompatto0,28 €

Il prezzo esposto è quello della migliore qualità: non ti viene mai addebitato di più. Tutto il resto è uno sconto.

Fissa un minimo e non pensarci più

curl … -H "X-ElephantPool-Require: quality:reference"

Un header e le tue richieste raggiungono solo macchine che servono i pesi di riferimento. È un minimo, non un'uguaglianza: una qualità migliore è sempre accettata. Così il prezzo torna prevedibile.

Senza, ottieni il miglior build libero in quel momento, al suo prezzo — spesso più economico, a volte il migliore per meno di quanto un concorrente chieda per il suo peggiore.

Perché la fascia bassa è davvero economica

Pesi più piccoli si decodificano più in fretta, quindi un host produce più token all'ora. Il prezzo per build ti gira quel vantaggio invece di trattenerlo. A 0,28 € per milione di token, un modello da 27 miliardi di parametri costa meno di quanto il mercato chieda di solito per uno tre volte più piccolo.

E perché possiamo dimostrarlo

Ogni richiesta completata torna con una ricevuta firmata sulla macchina che l'ha servita, con lo sha256 del file di pesi caricato. Lo sconto si applica da quella firma, non da ciò che dice l'host. Servire il build economico e farsi pagare quello costoso non è possibile.

Vedi cosa prova una ricevuta e cosa paghi e perché cambia.

Related

Model catalogue · Download mahout · How the whole system works · Blog