TNG Technology Consulting GmbH

TNG veröffentlicht Qwen3.6-27B-NVFP4-GGUF

28. Juli 2026

Wir haben NVIDIAs Qwen3.6-27B-NVFP4 im GGUF-Format neu gepackt. Der Hauptvorteil liegt in der Inferenzgeschwindigkeit auf lokalen Systemen.

Es erreicht eine um bis zu 50 % schnellere Decodierung mit 46,5 Tokens pro Sekunde auf einem Laptop mit integrierter RTX 5090 und bleibt dabei nahe an der ursprünglichen Präzision. Durch die native Ausführung mit 4-Bit-Quantisierung auf NVIDIA Blackwell passt es problemlos in 24 GB Arbeitsspeicher. Damit bleiben ein großer Kontext von 160k Tokens und Multi-Token-Prediction erhalten.

Die Modellgewichte und weitere Informationen sind auf Hugging Face verfügbar.