Zahlen für die Qualität, die Sie bekommen
Ein Modell, neun Qualitäten, neun Preise — und ein Header, der die Untergrenze garantiert. Unten günstiger als der Markt, oben besser.
Die meisten APIs nennen einen Preis pro Modell und sagen nie, welche Version geantwortet hat. Wir nennen einen Preis pro Build, und die Rechnung folgt den Gewichten, die tatsächlich liefen.
Ein Modell, eine Preisleiter
Qwen3.8 27B, je Million Ausgabe-Token:
| Build | Qualität | Preis |
|---|---|---|
| UD-Q5_K_M | Referenz | 0,75 € |
| UD-Q4_K_M | Referenz | 0,62 € |
| UD-IQ4_XS | ausgewogen | 0,54 € |
| UD-Q3_K_XL | ausgewogen | 0,50 € |
| UD-IQ2_XXS | kompakt | 0,28 € |
Der ausgewiesene Preis ist der der besten Qualität — mehr wird Ihnen nie berechnet. Alles andere ist ein Nachlass.
Eine Untergrenze setzen und vergessen
curl … -H "X-ElephantPool-Require: quality:reference"
Ein Header, und Ihre Anfragen erreichen nur Maschinen mit Referenzgewichten. Es ist eine Untergrenze, keine Gleichheit: bessere Qualität wird immer akzeptiert. Damit ist Ihr Preis wieder vorhersehbar.
Ohne den Header bekommen Sie den besten Build, der gerade frei ist, zu dessen Preis — meist günstiger, gelegentlich der beste für weniger, als ein Wettbewerber für seinen schlechtesten verlangt.
Warum das untere Ende wirklich günstig ist
Kleinere Gewichte dekodieren schneller, also produziert ein Host mehr Token pro Stunde. Preise je Build geben Ihnen diesen Vorteil weiter, statt ihn einzubehalten. Für 0,28 € je Million Token kostet ein Modell mit 27 Milliarden Parametern weniger, als der Markt meist für ein Drittel dieser Größe verlangt.
Und warum wir es beweisen können
Jede abgeschlossene Anfrage kommt mit einer auf der bedienenden Maschine signierten Quittung zurück, die den sha256 der geladenen Gewichtsdatei nennt. Der Nachlass folgt dieser Signatur — nicht dem, was ein Host behauptet. Den günstigen Build bedienen und den teuren abrechnen geht nicht.
Siehe was eine Quittung beweist und was Sie zahlen und warum es sich ändert.
Related
Model catalogue · Download mahout · How the whole system works · Blog