Scegliere esattamente cosa serve la tua GPU
Scegli il modello e la quantizzazione precisa che la tua scheda esegue — da terminale o dal telefono, modificabile a caldo e ricordata.
La tua scheda, la tua decisione. Scegli quali modelli questa macchina serve e con quale quantizzazione, e la rete ti segue — senza ticket e senza aspettarci.
Due decisioni, tenute separate
Quali modelli servi e con quale qualità. Sono domande diverse, quindi impostazioni diverse: puoi fissare una qualità senza restringere il catalogo, o il contrario.
$ mahout config set models_allowed=qwen3.8-27b
$ mahout config set preferred_builds=qwen3.8-27b@ud_iq4_xs
Oppure le stesse due scelte nella dashboard, sulla riga della macchina: una casella per modello, un menu per la quantizzazione. Sono offerti solo i build che la tua scheda può davvero contenere.
Nove modi di eseguire lo stesso modello
Qwen3.8 27B esiste in nove build, da 18,4 GiB a 6,8 GiB. Uno più grande risponde meglio, uno più piccolo risponde più in fretta. Su una scheda da 24 GB puoi eseguire i pesi di riferimento, o scegliere deliberatamente IQ4_XS e servire più richieste all'ora. Entrambi sono affari legittimi.
Modificabile a caldo
L'agente rilegge le impostazioni ogni minuto. Cambia quantizzazione dal telefono e la macchina scarica i pesi vecchi e carica i nuovi da sola — nessun riavvio, nessun SSH. Ciò che hai impostato è ciò a cui torna dopo un riavvio.
Un vincolo viene rispettato
Se fissi un build che la tua scheda non può contenere, non ne serviamo uno più piccolo di nascosto. Il modello viene tolto e l'agente dice perché. Hai chiesto una qualità; un declassamento silenzioso riemergerebbe settimane dopo come un benchmark inspiegabile.
Ciò che servi è anche ciò per cui vieni pagato — vedi cosa paghi e cosa guadagna un host.
Related
Model catalogue · Download mahout · How the whole system works · Blog