T

TensorRT-LLM

T
TensorRT-LLM AI v1.3.0rc23

v1.3.0rc23

既知の問題 Deepseek-V4-Proは GB300 ディサグセットで接続できますDeepSeek-R1 NVFP4マルチGPU (PP4 + MTP) は実行中にMPIワーカー出口でクラッシュする (GB300で見られる).DeepSeek-V3-Lite BF16 + Chunked Prefill (Pythonスケジューラー) は、停止/完了に失敗する可能性があります。Qwen MoEのマルチ-LoRA (ルーティングされた専門家、異なったランク、熱心な) は、サンプリング中に失敗する可能性があります。Gemma3-1B FP8は、火花でプリクォンティ化されています。 コンパイルは失敗します。..

T
TensorRT-LLM AI v1.3.0rc22

v1.3.0rc22

知られている問題 pyTorch コンパイルバックエンドで torch.compile がクラッシュする 数々のマルチ-GPU 正確性経路は、torch_compile=True (例えばDeepSeek-V3-Lite bf16/FP8/NVFP4; Llama-3.1-8B-Instruct FP8 with FlashInfer) について説明している。解決法:影響を受ける設定のtorch.compileを無効にする DeepSeek-V3.2 FP8 H200 のブロックスケール OOM.test_fp8_blockscaleの設定は DGX H200 u で OOM することができます。..

T
TensorRT-LLM AI v1.3.0rc21

v1.3.0rc21

Deprecation Notices AutoDeploy バックエンドは廃止されています。早期モデルサポートは TensorRT LLM の多くのユーザーにとって重要な優先事項であり、PyTorch バックエンドにおける機能モデルサポートへの時間を改善するための代理方法に取り組んでいます。初期の指標として、これはモデルリリースの最初の週内に Minimax M3 機能サポートをリリースするために使用されました。既知の問題 深く探す。..

T
TensorRT-LLM AI v1.3.0rc20

v1.3.0rc20

このRCバージョンは TensorRT バックエンドをサポートする最後のバージョンになります 次のバージョンでは TensorRT バックエンドは削除されます!既知の問題 DeepSeek V3/V3.2 は、違法なメモリアクセスでクラッシュしたり、ウォームアップ中にストップしたりします。Qwen3ファミリーモデルの自動調節は"断言失敗: cutlass TMA WS グループ化 gemm を初期化できなかった"とクラッシュする可能性があります。 API TeaCache係数 (#13170) BR を設定する API を追加します。..

T
TensorRT-LLM AI v1.3.0rc19

v1.3.0rc19

既知の問題 Llama 3.1 8B FP8は、GB200のオートチューナーウォームアップ中にぶら下がります。モデルサポート サポート NVIDIA Wan2.2-T2V量子化チェックポイント (#15093) ステップ-3.7 NVFP4とポートステップ-3.7VLのビジョンタワーをTRT-LLMモジュール (#14926) に MTPを有効にする PyTorch バックエンド (#13919) の T5 と BART をサポートする PyTorch バックエンド (#15292) の MiniMax-M3 をサポートする API VisualGen をアライナイン VisualGen を用いてスキーマの要求を。..

T
TensorRT-LLM AI v1.3.0rc18

v1.3.0rc18

既知の問題 DSV3.2 は、CuteDSL MoE バックエンドを使用すると、GB200/GB300 の様々な長時間パーフテストで IMA とクラッシュします。この問題を回避するために 別の MoE バックエンドを使用しますモデルサポート ホッパー (#14775) のネモトロン-H NVFP4チェックポイントをサポート Qwen画像サポート (#13449) サポートステップ-3.7-フラッシュモデル (#14711) コスモス3-ナノとコスモス3-スーパーサポート (#14824) を追加 AFMoE トリニティサポート。..

T
TensorRT-LLM AI v1.3.0rc17

v1.3.0rc17

認識された問題点 ディープ検索 V3.2 は、様々なagg/disagg コンフィギュレーションで長時間実行されたパフォーマンステスト中に違法なメモリアクセスでクラッシュします。モデルサポート モットワールドモデルサポートを追加 (#14012) MiniMax-M2 (#14314) のマルチノードテンソール並行性を有効にする Mistral Large 3 テキスト専用プロセッサ (#14248) の復元 Gemma4 マルチヘッド_ディムプールとSWA トリトンカーンのホストサイドスライス。..

T
TensorRT-LLM AI v1.3.0rc16

v1.3.0rc16

ハイライト モデルサポート ネイティブビジョンとオーディオタワー (#14300) を備えたGemma4マルチモダルのサポートを追加 Qwen3.5 MTPとQwen3.6-27B-FP8モデルサポート (#12646, #14359) EXAONE-4.5とLagunaモデルサポート (#12873, #13559) DeepSeek,NemotronH, Qwen3, Qwen3.5-MoEをシャードリングIRカノンモデル (#13478) に切り替える API リファクタ VisualGenArgs APIとレジストリ (#14175) sink_token_length を。..

T
TensorRT-LLM AI v1.3.0rc15

v1.3.0rc15

ハイライト モデルサポート テキスト、ビジュアル、オーディオ、チャンクドプレフィール機能 (#12932, #14134) を備えた Gemma4 マルチモダルモデルサポートを追加 キミ K2.5 マルチモダルビジョンサポートと推理解析器統合 (#12788, #13801) GPT-OSS, Ministral3, Nemotron-H, Nemotron Nano,および DeepSeek モデル有効化および互換性更新 (#12743, #12884, #13844, #13977) を追加 DeepSeek V4と DeepSeek...

T
TensorRT-LLM AI v1.3.0rc14

v1.3.0rc14

ハイライト モデルサポート Qwen3.5 と Nemotron Super V3 (#12185) を含むMambaハイブリッドモデルのためのプレフィックスキャッシングを追加する カスタムMOEルーティングと密度とNVFP4重量ロード修正 (#13433, #13090, #13716) と Qwen3.5サポートを改善する GEMMチューニングとマルチモダルプレイスホルダー拡張 (#13160, #13069) と Nemotron Nanoサポートを改善する 2.2 Wan 5B TI2Vサポートを追加し、LTX-2 FP4ステージを精製する。..

T
TensorRT-LLM AI v1.3.0rc13

v1.3.0rc13

ハイライト モデルサポート ネモトロン3 ナノオムニのサポートと初期最適化; ビデオからオーディオとビデオのためのチャンクドプレフィールに関する既知の問題 ビデオからオーディオ抽出を追加し、ViT注意を最適化し、ネモトロンとネモトロンナノVLモデル (#12921, #12911, #13283) の初期化メモリを削減する モデルごとに VisualGen 例スクリプトを追加し、共有コンフィギュレーション、モデルごとに def ...

T
TensorRT-LLM AI v1.3.0rc12

v1.3.0rc12.post1

[None][feat] 会話ルーター統合テストを追加し、フィンを改善。..