← Knowledge base

Scegliere esattamente cosa serve la tua GPU

Scegli il modello e la quantizzazione precisa che la tua scheda esegue — da terminale o dal telefono, modificabile a caldo e ricordata.

La tua scheda, la tua decisione. Scegli quali modelli questa macchina serve e con quale quantizzazione, e la rete ti segue — senza ticket e senza aspettarci.

Due decisioni, tenute separate

Quali modelli servi e con quale qualità. Sono domande diverse, quindi impostazioni diverse: puoi fissare una qualità senza restringere il catalogo, o il contrario.

$ mahout config set models_allowed=qwen3.8-27b
$ mahout config set preferred_builds=qwen3.8-27b@ud_iq4_xs

Oppure le stesse due scelte nella dashboard, sulla riga della macchina: una casella per modello, un menu per la quantizzazione. Sono offerti solo i build che la tua scheda può davvero contenere.

Nove modi di eseguire lo stesso modello

Qwen3.8 27B esiste in nove build, da 18,4 GiB a 6,8 GiB. Uno più grande risponde meglio, uno più piccolo risponde più in fretta. Su una scheda da 24 GB puoi eseguire i pesi di riferimento, o scegliere deliberatamente IQ4_XS e servire più richieste all'ora. Entrambi sono affari legittimi.

Modificabile a caldo

L'agente rilegge le impostazioni ogni minuto. Cambia quantizzazione dal telefono e la macchina scarica i pesi vecchi e carica i nuovi da sola — nessun riavvio, nessun SSH. Ciò che hai impostato è ciò a cui torna dopo un riavvio.

Un vincolo viene rispettato

Se fissi un build che la tua scheda non può contenere, non ne serviamo uno più piccolo di nascosto. Il modello viene tolto e l'agente dice perché. Hai chiesto una qualità; un declassamento silenzioso riemergerebbe settimane dopo come un benchmark inspiegabile.

Ciò che servi è anche ciò per cui vieni pagato — vedi cosa paghi e cosa guadagna un host.

Related

Model catalogue · Download mahout · How the whole system works · Blog