TNG verpackt Nemotron 3.5 Lightning als GGUF
11. September 2026
Im Anschluss an die Veröffentlichung von Qwen3.6-27B haben wir auch NVIDIAs Nemotron 3.5 Lightning 30B-A3B für die lokale Nutzung in GGUF (GPT-generated unified format) umgewandelt. Über llama.cpp läuft es nativ auf Blackwell-Hardware. Damit steht der volle 1M-Token-Kontext auf einer einzelnen 24 GB GPU zur Verfügung. Die optionale Multi-Token-Prediction erhöht den Durchsatz, ohne die Qualität des Outputs zu verändern.
Dabei bleibt NVIDIAs 4-Bit-Quantisierung bit-exakt erhalten, der Rest wird verlustarm übernommen. So scheint das Ergebnis sehr nah am NVIDIA-Original zu liegen.
Die Modellgewichte und weitere Informationen sind auf Hugging Face verfügbar.