ONNX Runtime WebGPU Plugin EP v0.2.1
Highlights Major performance work for attention-heavy LLMs. FlashAttention decode kernels were fused and extended for any sequence length (#28389). FlashAttention prefill shared-memory path was generalized (#28520). Dynamic max_k_step was enabled for NVIDIA (#28511). QKV bias support was added for FlashAttention in MultiHeadAttention (#28380). M4 Max-specific FlashAttention optimization landed (#2…