modelscope / modelscope/ms-swift

GKD cuda访问越界

Open
#9,609 5 comments 0 reactions 0 assignees View on GitHub

Nobody has claimed this yet.

bug
Dominant language
Python
Stars
15.7k
Forks
1.7k
Avg merge
1d 16h
Merged PRs (30d)
136

Description

Checklist / 检查清单
  • I have searched existing issues, and this is a new bug report. / 我已经搜索过现有的 issues,确认这是一个新的 bug report。
Bug Description / Bug 描述

进行GKD(on-policy distillation)训练(student rollout+student training+teacher vllm server)时,发现偶尔会报错cuda illegal(无法稳定复现),想请问这个可能是什么原因?
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: Traceback (most recent call last):
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/cli/rlhf.py", line 7, in
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: rlhf_main()
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/pipelines/train/rlhf.py", line 246, in rlhf_main
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return SwiftRLHF(args).main()
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/pipelines/base.py", line 52, in main
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: result = self.run()
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/ray/base.py", line 168, in wrapper
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return func(self, *args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/pipelines/train/sft.py", line 197, in run
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return self.train(trainer)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/pipelines/train/sft.py", line 271, in train
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: trainer.train(resume_checkpoint)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/trainers/mixin.py", line 903, in train
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: res = super().train(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/transformers/trainer.py", line 1424, in train
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return inner_training_loop(
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/transformers/trainer.py", line 1506, in _inner_training_loop
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: self._run_epoch(
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/transformers/trainer.py", line 1734, in _run_epoch
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: tr_loss_step = self.training_step(model, inputs, num_items_in_batch)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/rlhf_trainers/utils.py", line 613, in wrapper
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return func(self, *args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/yangpenghui1/ms-swift/swift/rlhf_trainers/gkd_trainer.py", line 1092, in training_step
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return HFSFTTrainer.training_step(self, model, inputs, num_items_in_batch)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/trl/trainer/sft_trainer.py", line 1338, in training_step
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return super().training_step(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/transformers/trainer.py", line 1934, in training_step
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: self.accelerator.backward(loss, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/accelerate/accelerator.py", line 2830, in backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: self.deepspeed_engine_wrapped.backward(loss, sync_gradients=self.sync_gradients, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/accelerate/utils/deepspeed.py", line 270, in backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: self.engine.backward(loss, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/utils/nvtx.py", line 33, in wrapped_fn
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ret_val = func(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/engine.py", line 2633, in backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: loss.backward(**backward_kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/_tensor.py", line 630, in backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: torch.autograd.backward(
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/autograd/init.py", line 364, in backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: _engine_run_backward(
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/autograd/graph.py", line 865, in _engine_run_backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return Variable._execution_engine.run_backward( # Calls into the C++ engine to run the backward pass
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/autograd/function.py", line 317, in apply
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return user_fn(self, *args)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/utils/checkpoint.py", line 325, in backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: torch.autograd.backward(outputs_with_grad, args_with_grad)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/autograd/init.py", line 364, in backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: _engine_run_backward(
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/autograd/graph.py", line 865, in _engine_run_backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return Variable._execution_engine.run_backward( # Calls into the C++ engine to run the backward pass
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/autograd/function.py", line 317, in apply
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return user_fn(self, *args)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/parameter_offload.py", line 419, in backward
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ctx.pre_backward_function(ctx.module)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/utils/nvtx.py", line 33, in wrapped_fn
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ret_val = func(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/parameter_offload.py", line 400, in _run_before_backward_function
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: self.pre_sub_module_backward_function(sub_module)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/utils/_contextlib.py", line 124, in decorate_context
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return func(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/parameter_offload.py", line 509, in pre_sub_module_backward_function
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: param_coordinator.fetch_sub_module(sub_module, forward=False)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/_dynamo/eval_frame.py", line 1181, in _fn
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return fn(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/utils/nvtx.py", line 33, in wrapped_fn
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ret_val = func(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/torch/utils/_contextlib.py", line 124, in decorate_context
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return func(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/partitioned_param_coordinator.py", line 325, in fetch_sub_module
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: self._fetch_sub_module_impl(current_submodule, forward, is_leaf)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/partitioned_param_coordinator.py", line 460, in _fetch_sub_module_impl
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: self.__all_gather_params(params_to_prefetch, forward)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/utils/nvtx.py", line 33, in wrapped_fn
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ret_val = func(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/partitioned_param_coordinator.py", line 520, in __all_gather_params
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: self._all_gather_params(nonquantized_params, forward, quantize=self.zero_quantized_weights)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/partitioned_param_coordinator.py", line 549, in _all_gather_params
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: handle = param_group[0].all_gather_coalesced(param_group, quantize=quantize)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/utils/nvtx.py", line 33, in wrapped_fn
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ret_val = func(*args, **kwargs)
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/partition_parameters.py", line 1491, in all_gather_coalesced
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: return _all_gather_coalesced(params, world_size, rank_in_group, use_secondary_tensor, ds_process_group,
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/partition_parameters.py", line 1377, in _all_gather_coalesced
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: _all_gather_dtype(dtype_params[dtype], world_size, rank_in_group, ds_process_group, dtype))
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: File "/mnt/shared-storage-user/mllm/yangpenghui/miniconda3/envs/clawrl_swift/lib/python3.12/site-packages/deepspeed/runtime/zero/partition_parameters.py", line 1262, in _all_gather_dtype
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: [p.ds_tensor.to(get_accelerator().current_device_name()).to(allgather_dtype) for p in params],
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: torch.AcceleratorError: CUDA error: an illegal memory access was encountered
[2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: Search for cudaErrorIllegalAddress' in https://docs.nvidia.com/cuda/cuda-runtime-api/group__CUDART__TYPES.html for more information. [2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: CUDA kernel errors might be asynchronously reported at some other API call, so the stacktrace below might be incorrect. [2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: For debugging consider passing CUDA_LAUNCH_BLOCKING=1 [2026-06-21T01:26:03+08:00] simulate-qwen36-gpt-train-22558506-8beb9-cfcd2 >> [rank3]: Compile with TORCH_USE_CUDA_DSA` to enable device-side assertions.

How to Reproduce / 如何复现

ms-swift: 4.3.0
cuda: 12.8
GPU: H200

Additional Information / 补充信息

codex分析可能问题出在teacher侧,例如返回的top-K的index越界之类的

Contributor guide

Open the contributing guide

First steps

  1. Read the whole issue, then the project's contributing guide.
  2. Comment on the issue to say you are picking it up — it saves two people doing the same work.
  3. Fork the repository and make your change on a branch.
  4. Open a pull request that references the issue number.

Research direction

Start with swift/rlhf_trainers/gkd_trainer.py at training_step and swift/rlhf_trainers/utils.py at the wrapper, then trace the reported backward path through swift/pipelines/train/rlhf.py. Reproduce the intermittent GKD CUDA illegal-access failure and verify that the cause and a stable fix are covered by a repeatable test or run.

Written by the indexing model from the issue text.

Assessment

Tech stack
python, pytorch
Domain
distributed-systems, machine-learning
Issue type
Bug
Difficulty
5/5
Estimated time
Over a week
Activity status
Quiet
Clarity
Needs clarification
Newbie friendliness
28/100

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.