S

SGLang

S
SGLang AI v0.5.16

v0.5.16

169人の参加者からの 574 PR を強調しますDSpark:信頼に基づく推測解読 新しい推測アルゴリズム半自動回帰的にブロックに分けられ、 固定された長さではなく、 設計の自信から各窓を検証します。DeepSeek-V4-Proで353.7 tok/s,B300でTP8 (bs=1) で5~5の長さで受け入れられる。DSPARKとSGLANG_RAGGED_VEの。..

S
SGLang AI v0.5.15.post1

v0.5.15.ポスト1

v0.5.15.post1には、主にGLM 5.2 #30454 #30627 のためのいくつかのパッチが含まれています:非 Cuda / HIP デバイスで DSA モデルの起動を修正します。 #30858: Cuda 12 画像に対するフラッシュインファーの依存性を修正します。 #31001:長入力上の flashinfer trtllm FP4 MoE カーネルによって引き起こされる NaN 出力を修正します。 #30839: GLM 5.2 IndexShare を修正します。 PD 分解設定を修正します。 #30992: GLM 5.2 IndexShare を修正します。

S
SGLang AI v0.5.15

v0.5.15

GLM-5.2 NVFP4を生産のために調整しました このサイクルで GLM-5.2 NVFP4をブラックウェルに調整して生産を最適化しました現在8xB300で500+tok/s/ユーザーで動作し、4xGB300で450 (bs=1)GLM-5.2を 料理本で動かしてデフォルトでスペックV2:CUDAグラフィー可能なDSAドラフト拡張経由でゼロオーバーヘッドスケジューリング、D2H/H2D同期が停止、メタデータ操作が融合。+11% 端から端まで TPS (#29413, #29343,...

S
SGLang AI v0.5.14

v0.5.14

ハイライト 新しいモデルサポート: GLM-5.2, LiquidAI LFM2.5, Kimi-K2.7-Code, Poolside Laguna-M.1, DiffusionGemma, Zyphra ZAYA1, MiMo-V2-ASR GB300 での DeepSeek-V4 は0日以降:同じインタラクティビティで5倍高いスループット、SGLang (ブログ) で NVIDIA GB300 での DeepSeek-V4 を提供。ディープEPの専門家の並列化のための2つの派遣時の負荷バランス方法: シャールのためのウォーターフィール。..

S
SGLang AI v0.5.13

v0.5.13

ハイライト 新しいモデルサポート: オートレグレシブ: ネモトロン3 ウルトラ (Day-0,ブログ), Step-3.7-Flash, コマンドA+ ディフュージョン: Cosmos3, LingBot-World, SANA-WM, Ernie-Image, FLUX.2-Klein 4B/9B, Ideogram 4 Spec V2 は、現在デフォルトの憶測解読経路です: トップk > 1 のツリードラフトは、ページ_イターサイズ > 1 および Mamba / ハイブリッド線形モデル (#...

S
SGLang AI v0.5.12.post1

v0.5.12.ポスト1

v0.5.12.post1は、v0.5.12の上に安定性パッチを付けています。リリースブランチに12の修正を選択します。バグ修正 DeepSeek V4 DSV4-Proは、B200/B300のシングルトークン解読中に歪んだテキストを発信します (解読前に天井アクティベーションスケールによる deep_gemm UE8M0スケールパッキング経路を修正): #25733 DSV4 + EAGLE/MTPの解読クラッシュは、SWA a...

S
SGLang AI v0.5.12

v0.5.12

ハイライト DeepSeek V4 サポート: DeepSeek-V4 (#23882) の完全な推論経路:Day-0を含む 機能: #23882 パラレリズム:テンソールパラレリズム/エキスパートパラレリズム/コンテキストパラレリズム/データパラレルの注意 ハードウェア:Nvidia B300/B200/H200/H100/GB200/GB300,AMD MI35X プリフイル・デコード 解散 HiSparse 非アクティブのKVキャッシュをCPUメモリにオフロードする 理由分析ツールと Deep ParserGemm を呼び出す。..

S
SGLang AI v0.5.11

v0.5.11

ハイライト CUDA 13 + トーチ 2.11: SGLang,sgl-kernel,Docker イメージでデフォルト CUDA バージョンは 13.0 に移動し、PyTorch は 2.9 から 2.11 にアップグレードされます。ビルドマトリックスを近代化し、新しいカーネルをロック解除します: #21247, #24162, #24183, #23593 (トラッキング問題 #21498) デフォルトで憶測的な解読 V2:スペック V2 (CPUオーバーヘッドを隠すために重複スケジューリング) は、現在デフォルトで、実質的に削減されています。..

S
SGLang AI v0.5.10.post1

v0.5.10.ポスト1

全変更日記: v0.5.10...v0.5.10.post1 jit cubin ダウンロード器の問題を解決するために v0.6.7.post2 から v0.6.7.post3 にフラッシュインファーがバムされます。

S
SGLang AI v0.5.10

v0.5.10

ハイライト Piecewise CUDAグラフ デフォルトで有効: Piecewise CUDAグラフキャプチャは、メモリオーバーヘッドを削減し、複雑な制御フローパターンを持つモデルのスループットを改善するデフォルト実行モードです: #16331 Elastic EP for Partial Failure Tolerance: Elastic NIXL-EPをSGLangに統合し、DeepSeek MoEデプロイメントの部分的な障害耐性を可能にします。 GPUが故障すると、システムはリ。..

S
SGLang AI v0.5.10rc0

v0.5.10rc0

ハイライト Piecewise CUDAグラフ デフォルトで有効: Piecewise CUDAグラフキャプチャは、メモリオーバーヘッドを削減し、複雑な制御フローパターンを持つモデルのスループットを改善するデフォルト実行モードです: #16331 Elastic EP for Partial Failure Tolerance: Elastic NIXL-EPをSGLangに統合し、DeepSeek MoEデプロイメントの部分的な障害耐性を可能にします。 GPUが故障すると、システムはリ。..

S
SGLang AI v0.5.9

v0.5.9

ハイライト LoRA 重量負荷の計算の重複: 推論中に計算の重荷の重複 LoRA,大型のアダプターでTTFTを~78%とTPOTを~34.88%削減: #15512 TRT-LLM NSAカーネル統合 DeepSeek V3.2: Native Sparse AttentionのためにTRT-LLM DSAカーネルを統合、両者のためのtrtllmを持つブラックウェルプラットフォームでDeepSeek V3.2のパフォーマンスを3x-5x向上させる --nsa-prefill-b...