← Knowledge base

Elegir exactamente lo que sirve tu GPU

Elige el modelo y la cuantización precisa que ejecuta tu tarjeta — desde la terminal o el móvil, modificable en marcha y recordado.

Tu tarjeta, tu decisión. Tú eliges qué modelos sirve esta máquina y con qué cuantización, y la red te sigue — sin ticket y sin esperarnos.

Dos decisiones, mantenidas aparte

Qué modelos sirves y con qué calidad. Son preguntas distintas, así que son ajustes distintos: puedes fijar una calidad sin estrechar tu catálogo, o al revés.

$ mahout config set models_allowed=qwen3.8-27b
$ mahout config set preferred_builds=qwen3.8-27b@ud_iq4_xs

O las mismas dos decisiones en tu panel, en la fila de la máquina: una casilla por modelo, un desplegable por cuantización. Solo se ofrecen builds que tu tarjeta puede contener de verdad.

Nueve formas de ejecutar un mismo modelo

Qwen3.8 27B viene en nueve builds, de 18,4 GiB a 6,8 GiB. Uno más grande responde mejor; uno más pequeño responde más rápido. En una tarjeta de 24 GB puedes ejecutar los pesos de referencia, o elegir IQ4_XS a propósito y servir más peticiones por hora. Ambos son negocios legítimos.

Modificable en marcha

El agente relee tus ajustes cada minuto. Cambia la cuantización desde el móvil y la máquina descarga los pesos antiguos y carga los nuevos sola — sin reinicio, sin SSH. Lo que fijaste es a lo que vuelve tras un reinicio.

Una fijación se respeta

Si fijas un build que tu tarjeta no puede contener, no servimos otro más pequeño a escondidas. El modelo se retira y el agente dice por qué. Pediste una calidad; una rebaja silenciosa aparecería semanas después como un benchmark inexplicable.

Lo que sirves es también aquello por lo que te pagan — ver qué pagas y qué gana un host.

Related

Model catalogue · Download mahout · How the whole system works · Blog