持続可能/厳格/1789594034
[インダクター] [CPU] 証明できないバッチディムに オプトインBMM分解。..
[インダクター] [CPU] 証明できないバッチディムに オプトインBMM分解。..
DTensorのシャードングプロパゲーターには aten.miopen_batch_norm の戦略がないため、シャードされた 4D 入力上の F.batch_norm は ROCm で失敗し",オペレータ aten.miopen_batch_norm.default にはシャードング戦略が登録されていません".CUDAは、 aten.cudnn_batch_norm がtorch/_decomp で分解しているため、DTensor の DecompSharding Strategy に戻ってくるので、同値に決して到達しません。ROCmの分解は。..
[ROCm][インダクタ] gfx1250 TDM 汎用記述子コードゲンのサポート (...
#188136を担当するすべての Linux XPU manywheel バリアントを1つの作業で構築し、 Python バージョン全体で ABI 独立 C++/SYCL アーテファクトを再利用し、インタープリターごとに Python 結合アーテファクトを再構築する。前と後の 8 つの XPU マトリックスビルドを、この PR の統一ビルドと比較する。 34123506914 を実行する。 Linux XPUビルドのランナー分前 (Python マトリックス、 8 つの仕事) 後。..
要約 TestFlopCounter から新しい TestFlopCounter CUDA ((TestCase) クラスに 9 つの CUDA 特定テストを抽出 hw_classification = HardwareClassification とすべての 3 つのクラスにタグ付けしました。 * 引き出す要求は解決しました: #192478 承認: https://github.com/can-gaa-hou, https://github.com/fffrog
[テストケースリファクタリング] test_fake_backeのハードウェア分類を追加。..
[テストケースリファクタリング] test_hf_models に適切な hw_classification を追加する。..
[テストケースリファクタリング] test_capture_s に適切な hw_classification を追加する。..
[テスト] テスト/functorch/test_compile_to_python.py テストデバイス-g...
モチベーション 私たちは#196950でBMGで pyzesテストを有効化すると、zesDeviceEnumEngineGroupsが pyzes.ZE_RESULT_ERROR_INSUFFICIENT_PERMISSIONSで失敗すると発見しました。これはXeアーチとは異なる論理ですレベル0のシスマンは 次のバージョンで修正するこの論理をPyTorch側で一時的に処理します。この修正により:テストはスキップされます。そうでなければ、ランタイムエラーで失敗します。
[テストケースリファクタリング] test/fx/test_matcher_ に hw_classification を追加する。..
[テストケースリファクタリング] テストのためのデバイスアグノスティックテストクラスを分類。..
== に値を加えることで?から: 値 ternary の終わりに static_cast<bfloat> の誤った排除を防ぐために、変形性を使用してください。 下の再生器を参照してください。 import torch lib = torch.mps.compile_shader (("""#include <metal_stdlib> using namespace metal; bfloat volcast(volatile float x) { return static_cast<bfloat>(x); } kernel void repro_bug ((デバイス bfloat* out, constant float2& 境界、 constant float* サンプル、...
== に値を加えることで?から: 値 ternary の終わりに static_cast<bfloat> の誤った排除を防ぐために、変形性を使用してください。 下の再生器を参照してください。 import torch lib = torch.mps.compile_shader (("""#include <metal_stdlib> using namespace metal; bfloat volcast(volatile float x) { return static_cast<bfloat>(x); } kernel void repro_bug ((デバイス bfloat* out, constant float2& 境界、 constant float* サンプル、...
[テストケースリファクタリング] ハードウェア分類を distributed_test に追加。..
このPRは毎晩自動的に生成されますメタマテスのメジャールールをアクティブチームメンバーと更新します。#197041 削除要求が解決しました https://github.com/pytorchbot
[テストケースリファクタリング] 稀有性パラメータ化テストを。..
[テストケースリファクタリング][量子化][熱心] GENERIC hw_classificaを追加。..
[テストケースリファクタリング] api_test.py に HardwareClassification を追加する (#19...
#195487を修正するtorch._dynamo.test_case.TestCase.setUp/tearDownは、torch.is_grad_enabledを既にスナップショットし、テストが変更された場合、 (警告付き) tearDownで復元しますが、自動キャストに相当するものはありません。オートキャスト状態の4つの部分 - - 有効、dtype,cache_enabled,そしてネスティングカウンタ - - はテストの終了後、次に実行されるテストに存続しますこの状態を漏らすテスト (...
人文注釈 私はこれを繰り返しブラックウェルCIエージェントの注目に失敗していることに気付いた。 DeepSeek Tritonメインループは、128x128スケールを拡張するときに、GEMMブロックよりも小さいタイルのために、長階スケールインデックスが間違って、および外側/K寸法が交わされていることを仮定した。実際の歩みと論理軸を尊重し、 要素の偏移からスケール座標を計算し、
概要: NCCL_ALLTOALL_SUPORTED はレポのどこにも定義されていません。D115674668 ("[ncclx][fix-build] Remove NCCL_ALLTOALL_SUPPORTED macro") は、nccl.h.in の v2_29 と v2_30 の両方で、特に新しい NCCLX に基づいて構築された古い PyTorch が、大文字T ncclAllToAll API を選択するのを停止するように、nccl.h.in から # define を削除しました。定義された項目 (NCCL_ALLTOALL_SUPORTED) は、現在 al...
[ダイナモ] 警備のスナップショットと サブグラフの再利用を比較する
[ダイナモ] 警備のスナップショットと サブグラフの再利用を比較する
[テストケースリファクタリング] hw_classification=GENERIC を TestComplemen に追加する。..
[ATen] ROCm 7.0.0-7.1.0 (hipMemset) で fill_カーネルをゼロに保持する
パイテストを使いますpython test_logging.pyの代わりに pytest test_logging.pyを使用しています初期コードは:log_qname in log_internal.log_registry.get_log_qnames (():logger = logging.getLogger ((log_qname) created_handlers.update ((logger.handlers) self.assertEqual (((lenlogger.handlers), 2,f"{log_qname}にはストリームとファイルハンドラーのみがあるべきです")) すべてのアクティ。..
パイテストを使いますpython test_logging.pyの代わりに pytest test_logging.pyを使用しています初期コードは:log_qname in log_internal.log_registry.get_log_qnames (():logger = logging.getLogger ((log_qname) created_handlers.update ((logger.handlers) self.assertEqual (((lenlogger.handlers), 2,f"{log_qname}にはストリームとファイルハンドラーのみがあるべきです")) すべてのアクティ。..
mm の結果より広い入力を拒絶します。
#153327 の修正 Eager は native_functions の非正因子を拒絶する: RuntimeError: pixel_shuffle は正のアップスケール_ファクタを期待しているが、0 を得ている。 メタ登録と _refs の分解は決して同じチェックを得ていないので、代わりに因子で割る: パスファクター = 0 因子 = -2 eager RuntimeError: ...正のアップスケール_ファクタ、しかし 0 を得ている RuntimeError: ...しかし -2 メタ_ピクセル_シャッフル ZeroDivi を得ている。..