1.5.0
Fix NemotronHForCausalLM (support Nemotron-3-Super) Faster quantization Experimental zero-copy pinned arena mode for CPU offload (Linux only for now) Faster MoE prefill and decode (see below) Improved speculative decoding for MoE models Faster dense model prefill on some architectures Remove some sources of nondeterminism Bugfixes and cleanup Test case 4k prefill, t/s decode, t/s, S=1 Qwen3.8-Flas…