トランク/85728e11a5a98c344c4596880855e35046db81b0
[DTensor] 底辺の変数であるときに as_strided を答えます。..
[DTensor] 底辺の変数であるときに as_strided を答えます。..
テストのタイムアウトが表示される時 CI ログには タイムアウトが表示される線に タイムアウトが表示されるものを 特定する方法がありませんretry_shell prints コマンドは30分以上かかり 124を返します リストは何も表示しませんので ログクラシファーは1行だけ選び HUDのグループキーとしてそのキャプチャを使用します試行錯誤したファイルは 見えません
トーチコンのバグを修正して 1つのサブグループを破壊し すべてのグループを消す
このPRは毎晩自動的に生成されます固定されたタッチ通信のハッシュを更新します。#191421 削除要求が解決しました https://github.com/pytorchbot
このPRは毎晩自動的に生成されます固定されたビジョンハッシュを更新します。#191422 削除要求が解決しました https://github.com/pytorchbot
test_reductions_large_half_tensorsは、trunk macos-py3-arm64デフォルトシャードで、commit-induced (隣接する2つのSHAが赤、緑) のように見えていましたが、実際にはスキップゲートです。ルーツ原因:テストは largeTensorTest (("8GB") によってゲートされています。 MPSでは psutil.virtual_memory (().可用 >= 8GiB に縮小されます。16GBの m1 安定ランナーで 門戸のすぐ近くで スキップが発射されるか。..
isFwGradDefinedはtorch/csrc/autograd/generated/VariableType*で多くのことを呼びます。これらの呼び出しの多くは、関数にテンソーを渡します。この機能の初期実装では 選択的な機能のみが認められましたこれは、その関数が呼び出されるたびにオプションコンストラクタへの呼び出しを強制し、後でオプション::has_value (は) に不要な呼び出しを強制した。このコンミットにより、テンソールを受け入れるオーバーロードが追加されます。わかった。..
[xpu][修正]XPUのnative_group_normの fp16 グラッド・トレランスを緩和する (#19...
[xpu][修正]XPUのnative_group_normの fp16 グラッド・トレランスを緩和する (#19...
[xpu] XPUCachingAllocator (#... に IPCメモリハンドル共有サポートを追加する
module.compile() はtorch.compile ((self._call_impl) をインストールします。Conv2d などの組み込みリーフモジュールでは、Module._call_impl とモジュールフォワードの両方がスキップルールのファイルに表示されます。torch.compile ((module) パスは既に、wrap_inline でスキップルルがある先のモジュールをラッピングすることでこれを処理していますが、 module.compile (()) は _call_impl をトップレベルのラッピングから除外しました。撮影できるフレームが なかったので カスタム。..
dtensor_dispatch_custom_handler pr_timeベースラインを 38000 に復元する (#1...
dtensor_dispatch_custom_handler pr_timeベースラインを 38000 に復元する (#1...
nccl2 オール・トゥ・オール パスは、分割サイズを直接サインされていない値に投影し、両方の分割リストが空だった場合にのみ正規化しました。ネガティブな値が NCCLに届きましたGlooとstock NCCLは、両方のリストが空であるときにリード次元検証を回避し、テンソールを次元ゼロに沿って分割しない等分を許可した。C10Dの分割チェックを Eveに適用する。..
Python の関数 (#191661) で文字列の不一致を修正しました (#191661...
[ドキュメント] ページをデブログにリンクし プロファイラーベースの追加 ...
TVM対応画像 (pytorch-linux-jammy-py3.{11,12,13}-clang21) のDockerビルドをブロックする #190927 を解凍するには、OSエラー: .../tvm/lib/libtvm_runtime.so: undefined シンボル: _ZN3tvm3ffi4json9StringifyERKNS0_3AnyENS0_8OptionalIivEE ルーツ原因は浮き放たれる自由に残された移行依存関係です。#190799 アパッチ-tvm==0.25.0.post1を固定した しかし、そのパッケージはアパッチを宣言。..
[gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒]
[gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒] [gstack-毒]
アップデート torchcomms コンミットハッシュ
更新ビジョンコミットハッシュ
アップデート vllm コンミットハッシュ
更新 torchtitan コミットハッシュ
更新 torchtitan コミットハッシュ
triton commit ハッシュを更新する
戻る 戻る GILを無効にする
戻る 戻る GILを無効にする
このテストは純粋なCPUベクトリ化コードゲンで、2x9CPUテンソール上で比較操作をコンパイルし、生成された_cpp_vec_kernel_countを主張します。CUDA カーネルが起動することはありませんCUDA sm86のスローシャードで動作し、 a10g GPUがイドリング状態で ~57分 (測定 3429s と 3489s) かかります。 CI のテスト選択は、デバイスごとにではなくビルドコンフィギュレーションごとに行われます。
概要: _torchcomms_handles_backend() を追加し、TorchComms パスをゲート (init_process_group バックエンドの自動資格と _new_process_group_helper) に追加する。独自のc10dプラグインは持っていないので、 new_comm を強制する代わりに、ネイティブのc10d作成経路を維持します。is_backend_built を使ってバックエンドを報告する。動的に登録されたアダプター r...
[cuDNN][varlen] パージ KV キャッシュ (block_table) と seqused_k をサポートする。..