Schlagwort: Multi-Token Prediction

  • Qwen3.8-27B auf der RTX 5060 Ti

    Qwen3.8-27B auf der RTX 5060 Ti

    Brauchen lokale KI-Modelle wirklich 24 GB VRAM? Ein 27-Milliarden-Parameter-Modell auf einer Mittelklasse-Grafikkarte mit nur 16 GB VRAM? Was zunächst nach einer technischen Grenze klingt, ist offenbar möglich. Ein Community-Test zeigt, dass Qwen3.8-27B auf einer einzelnen GeForce RTX 5060 Ti* mit bis zu 47,6 Tokens pro Sekunde laufen kann. Dafür sind allerdings eine besonders speichersparende Quantisierung…