Pagar por la calidad que recibes
Un modelo, nueve calidades, nueve precios — y una cabecera que garantiza el mínimo. Más barato que el mercado abajo, mejor que él arriba.
La mayoría de las API anuncian un precio por modelo y nunca te dicen qué versión respondió. Nosotros anunciamos un precio por build, y la factura sigue a los pesos que realmente se ejecutaron.
Un modelo, una escalera de precios
Qwen3.8 27B, por millón de tokens de salida:
| Build | Calidad | Precio |
|---|---|---|
| UD-Q5_K_M | referencia | 0,75 € |
| UD-Q4_K_M | referencia | 0,62 € |
| UD-IQ4_XS | equilibrado | 0,54 € |
| UD-Q3_K_XL | equilibrado | 0,50 € |
| UD-IQ2_XXS | compacto | 0,28 € |
El precio anunciado es el de la mejor calidad, así que nunca se te cobra por encima. Todo lo demás es un descuento.
Pon un mínimo y olvídate
curl … -H "X-ElephantPool-Require: quality:reference"
Una cabecera y tus peticiones solo llegan a máquinas que sirven pesos de referencia. Es un mínimo, no una igualdad: mejor calidad siempre se acepta. Con eso tu precio vuelve a ser predecible.
Sin ella obtienes el mejor build libre en ese momento, a su precio — casi siempre más barato, y a veces el mejor por menos de lo que un competidor cobra por el suyo peor.
Por qué el extremo barato lo es de verdad
Los pesos más pequeños decodifican más rápido, así que un host produce más tokens por hora. Cobrar por build te traslada esa ganancia en lugar de quedárnosla. A 0,28 € el millón de tokens, un modelo de 27 000 millones de parámetros cuesta menos de lo que el mercado suele pedir por uno tres veces más pequeño.
Y por qué podemos demostrarlo
Cada petición completada vuelve con un recibo firmado en la máquina que la sirvió, con el sha256 del archivo de pesos cargado. El descuento se aplica a partir de esa firma, no de lo que diga el host. Servir el build barato y cobrar el caro no es posible.
Related
Model catalogue · Download mahout · How the whole system works · Blog