Schlagwort: SGLang

  • Wie Qwen3.8-27B auf der RTX Pro 6000 zum lokalen KI-Monster wird

    Wie Qwen3.8-27B auf der RTX Pro 6000 zum lokalen KI-Monster wird

    KI lokal mit über 200 Tokens pro Sekunde In unserem letzten Artikel haben wir bewiesen, dass man das sagenumwobene 27-Milliarden-Parameter-Modell Qwen3.8-27B mit Müh und Not auf eine billige 8-GB-Grafikkarte quetschen kann. Das Ergebnis? Phänomenaler Code, aber eine Schneckengeschwindigkeit von 4 Tokens pro Sekunde, ideal für Tee-Liebhaber, die nach jedem Prompt eine halbe Stunde Däumchen drehen…