← Blog

Un modelo, nueve precios

Pregunta a cualquier API de inferencia qué versión del modelo acaba de responderte. Casi ninguna te lo dirá. El mismo nombre cubre pesos que varían en un factor de tres en tamaño y mucho en calidad — y pagas lo mismo en ambos casos.

Publicamos nueve precios para Qwen3.8 27B, de 0,75 € a 0,28 € el millón de tokens de salida, y la factura sigue a los pesos que realmente se ejecutaron.

Nunca por encima del precio anunciado

El precio de portada es el del mejor build. Todo lo demás es un descuento: la cifra de la página es un techo, no una media que puedas superar.

Una cabecera fija el mínimo

-H "X-ElephantPool-Require: quality:reference"

Tus peticiones solo llegan entonces a máquinas con pesos de referencia. Es un mínimo, no una igualdad — mejor calidad siempre se acepta — así que ponerlo hace tu coste predecible sin costarte nunca un host disponible.

Por qué el extremo barato lo es

Los pesos más pequeños decodifican más rápido, así que la máquina produce más tokens por hora. Tarificar por build te traslada esa ganancia en vez de quedárnosla. Un modelo de 27 000 millones de parámetros a 0,28 € cuesta menos que lo que buena parte del mercado pide por uno tres veces menor.

Y por qué puedes comprobarlo

Cada petición completada produce un recibo firmado en la máquina que la sirvió, con la huella del archivo de pesos cargado. El descuento se calcula a partir de esa firma. Un host no puede servir el build barato y cobrar el caro, y nosotros no podemos facturarte una calidad que nadie entregó.

La referencia completa de precios está en la base de conocimiento.

Reference

Read next

one model, every card: how a 27b runs on 8 gb

Qwen3.8 27B ships in five builds, from Q5_K_M on a 24 GB card down to IQ2_XXS on 8 GB. Why we split models from builds, what quantization actually costs, and how a quantized KV cache doubled our context overnight.

we stopped projecting your earnings and started measuring them

Most GPU marketplaces advertise what a card could earn. Our dashboard shows what yours measured, and refuses to show a number until it has one. Here is why that choice cost us a nicer-looking page and was still right.

Model catalogue · Knowledge base · Run a GPU