vllm-proto 0.2.0 試聴する
PR #56538 CI で fa2a26f で検証されました。
PR #56538 CI で fa2a26f で検証されました。
[ウォーターマーク] 二重鍵のガムベル・マックスウォーターマーク 憶測的な解読。..
vllm-proto 0.1.0
このリリースには、277人の貢献者 (91人の新規) から594件のコミットメントがあります!Model Runner V2は、すべてのモデル (#53183) のデフォルトで、モデル (#48290) のプールで始まった展開を完了しました。MRV2はまた、KVキャッシュの自動サイズ化 (#53306),ステップごとにログットのメモリを1/TP (#50465),プロンプト埋め込み (#42963),extract_hidde...でカットするバッチ分割サンプリングのためのCUDAグラフメモリプロファイリングも獲得した。
[Bugfix][Core] ハイブリッドモデル (#55...
[Core] Mamba + E のデフォルトプレフィックス_キャッシュ_レテンション_インターバル
作成者: コデックス codex@openai.com 署名: コデックス codex@openai.com
[CI] 削除されたnvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF1...
[Bugfix][Multimodal] SHMワーカーキャッシュで前項でカバーされた項目を扱う。..
署名: ケヴィン・ルー 51931015+khluu@users.noreply.github.com 署名: ヨーグエ・ジュ・zyy1102000@gmail.com 共同執筆: コデックス・コデックス@openai.com 共同執筆: ヨーグエ・ジュ・zyy1102000@gmail.com
[ツール] [レシピ] スイープの推奨や 短偽の解析を向上させる。..
このリリースには、 270人の貢献者 (76人の新規) から 584 のコミットメントがあります!Kimi-K3のパフォーマンス推進:キミ-K3のスタック全体での主要な最適化努力 ディコードコンテキストパラレル (DCP) サポート (#50484),融合FlashKDAデコードとプリフィールカーネル (#50654, #51311, #52458), MegaMoE (#50510) のSiTUアクティベーションサポート、シーケンスパラレリズム (#52079) のGEMM-RS,すべての収集者を組み合わせた。..
(Cherry picked from commit b389ac2) 署名は: khluu khluu000@gmail.com
[バグ修正][セキュリティ] _load_ov2_プロセッサを _resolve_trust_remotで保護する。..
署名: Lucas Wilkinson lwilkins@redhat.com 署名: Lucas Wilkinson LucasWilkinson@users.noreply.github.com 署名: Benjamin Chislett chislett.ben@gmail.com 署名: Lucas Wilkinson wilkinson.lucas@gmail.com 署名: Nick Hill nickhill123@gmail.com 共著者: OpenAI コデックス codex@openai.com 共著者: Claude Opus 5 (1M文脈) noreply@anthropic.com 共著者。..
これはv0.27.0の上のパッチリリースですサポート量子化DSpark マルコフヘッド (#50424)
vLLM v0.27.0 リリースノート ハイライト このリリースには、242人の貢献者から561件のコミットメント (64件の新規) が含まれています!Kimi K3 サポートは1つのリリースで完全なスタック着陸:コアモデルファイルとカーネル (#50089, #50000),Python (#50093) とRust (#50104) フロントエンド、AttnResカーネル (#50090),DeepGEMMサポート (#50458),圧縮テンサー量子化チェックポイント (#50500),DSpark AR 融合 (#50242),およびオプションt ...
v0.27.0rc2
v0.27.0rc1
[CI][ROCm] test_ocp_mx_wikitext_correctness参照値を修正する (#4...
vLLM v0.26.0 リリースノート ハイライト このリリースには 212人の貢献者 (61人) から411件のコミットメントがあります!新しいインクリングモデルファミリー、完全なサポートスタック:ベースモデリング (#48799),ピースワイドCUDAグラフサポート (#48822),ホッパーFA4相対注意 (#48858),MTP=1憶測解読 (#48869),LoRA (#48884),標準モデルオプトNVFP4量子化 (#48990).ディープサーチV4の性能は。..
v0.26.0rc1
vLLM v0.25.1 ハイライト このリリースには2人の貢献者からの2つのコミットメント (1個新しい) が含まれています!v0.25.1は、v0.25.0の上に2つの標的バグ修正が含まれているパッチリリースです。バグ修正 TorchCodec (#47888) のためにシステムFFmpegが利用できない場合にモデル起動をブロックすることを避ける。以前は import torchcodec で、システムFFmpegが欠落したときに、ランタイムエラーが発生し、起動がブロックされました (例えば、待って。..
vLLM v0.25.0 リリースノート ハイライト このリリースには、232人の貢献者 (64人の新規) から558件のコミットが含まれています!モデルランナー V2 は、すべてのデントモデル (#44443) のデフォルトになっています。前回のリリースからの量子モデルサポートを基に、MRv2は、EVS (#46535),リアルタイムエンベッディング (#46762),Mambaハイブリッドモデル (#42406),マルチモダル-p...
[P/D][Bugfix] MTPスペックでPDアシンクロ KV負荷の見出しヘッド処理を修正する。..
トランスフォーマーモデリングバックエンド (#4...
[CPU][バグ修正] ARMで短コンブプレフィールテストを修正 (初期化されていない。..
vLLM v0.24.0 リリースノート ハイライト このリリースには、 256人の貢献者 (77人の新規) から 571件のコミットメントがあります!MiniMax-M3:新しいMiniMax-M3モデル (#45381) のサポートを追加し、MSA (#45892),MXFP4サポート (#45896),FP8稀有GQA (#45744) によるBF16/FP8インデクサーの迅速なフォローアップ、MI300X45 (#854) のbf16重量のためのfp8_per_channel,および広範なAMD/ROCmチューニング
ロバート・ショウ 114415538+ロバート・ショウ2-redhat@users.noreply.github.com
Mohammad Miadh Angkad 176301910+mmangkad@users.noreply.github.com (commit 191826eからピックアップされたチェリー)