intel / intel/torch-xpu-ops

[upstream_ut] RuntimeError: FlashAttentionForwardXPU does not only support dropout > 0.0 yet

Open
#3,140 2 comments 0 reactions 1 assignee Claimed by @LuFinch View on GitHub
skipped test: ut ut_upstream
Dominant language
Python
Stars
113
Forks
128
Avg merge
5d 9h
Merged PRs (30d)
112

Description

Cases:
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
op_ut,third_party.torch-xpu-ops.test.xpu.test_transformers_xpu.TestSDPACudaOnlyXPU,test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16

pytest_command:
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_256_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_256_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_256_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_1024_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_1_seq_len_q_1024_seq_len_k_1024_head_dim_64_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16
cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_1024_head_dim_32_is_causal_False_dropout_p_0_22_float16_scale0_fused_kernel0_xpu_float16

Error Message:
RuntimeError: FlashAttentionForwardXPU does not only support dropout > 0.0 yet

Trace Example:

```
Command: cd /third_party/torch-xpu-ops/test/xpu && PYTORCH_TEST_WITH_SLOW=1 pytest -v third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py -k test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16
Traceback (most recent call last):
File "/home/daisyden/upstream/test_transformers/third_party/torch-xpu-ops/test/xpu/test_transformers_xpu.py", line 4182, in test_fused_attention_vs_math_ref_grads_cudagraph
output_tuple = fused_op(query, key, value, **kwargs)
File "/home/daisyden/miniforge3/envs/test_transformers/lib/python3.10/site-packages/torch/_ops.py", line 1275, in __call__
return self._op(*args, **kwargs)
RuntimeError: FlashAttentionForwardXPU does not only support dropout > 0.0 yet

To execute this test, run the following from the base repo dir:
python test/xpu/test_transformers_xpu.py TestSDPACudaOnlyXPU.test_fused_attention_vs_math_ref_grads_cudagraph_batch_size_8_seq_len_q_256_seq_len_k_256_head_dim_64_is_causal_True_dropout_p_0_22_float16_scale_l1_fused_kernel0_xpu_float16

This message can be suppressed by setting PYTORCH_PRINT_REPRO_ON_FAILURE=0
```

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.