← Knowledge base

Genau bestimmen, was Ihre GPU bedient

Wählen Sie das Modell und die exakte Quantisierung, die Ihre Karte fährt — vom Terminal oder vom Telefon, im Betrieb änderbar und gespeichert.

Ihre Karte, Ihre Entscheidung. Sie bestimmen, welche Modelle diese Maschine bedient und in welcher Quantisierung, und das Netz folgt — ohne Ticket, ohne auf uns zu warten.

Zwei Entscheidungen, getrennt gehalten

Welche Modelle Sie bedienen, und wie gut. Das sind zwei verschiedene Fragen, also zwei verschiedene Einstellungen: Sie können eine Qualität festlegen, ohne Ihren Katalog einzuschränken, oder umgekehrt.

$ mahout config set models_allowed=qwen3.8-27b
$ mahout config set preferred_builds=qwen3.8-27b@ud_iq4_xs

Oder dieselben zwei Entscheidungen im Dashboard, in der Zeile der Maschine: ein Häkchen je Modell, eine Auswahlliste je Quantisierung. Angeboten wird nur, was Ihre Karte tatsächlich halten kann.

Neun Wege, ein Modell zu fahren

Qwen3.8 27B gibt es in neun Builds, von 18,4 GiB bis 6,8 GiB. Ein größerer Build antwortet besser, ein kleinerer schneller. Auf einer 24-GB-Karte können Sie die Referenzgewichte fahren oder bewusst IQ4_XS und mehr Anfragen pro Stunde bedienen. Beides ist ein legitimes Geschäft.

Im Betrieb änderbar

Der Agent liest Ihre Einstellungen jede Minute neu. Ändern Sie die Quantisierung vom Telefon aus, und die Maschine entlädt die alten Gewichte und lädt die neuen von selbst — kein Neustart, kein SSH. Was Sie eingestellt haben, gilt auch nach einem Reboot wieder.

Eine Festlegung halten wir ein

Legen Sie einen Build fest, den Ihre Karte nicht halten kann, bedienen wir nicht stillschweigend einen kleineren. Das Modell entfällt, und der Agent sagt warum. Sie haben eine Qualität verlangt; eine stille Herabstufung tauchte Wochen später als unerklärlicher Benchmark auf.

Was Sie bedienen, ist auch das, wofür Sie bezahlt werden — siehe was Sie zahlen und was ein Host verdient.

Related

Model catalogue · Download mahout · How the whole system works · Blog