modelscope / modelscope/ms-swift

Qwen3-Next-80b-a3b-instruct-fp8不支持GRPO训练

Open
#7,313 1 comment 0 reactions 0 assignees View on GitHub

Nobody has claimed this yet.

enhancement stale
Dominant language
Python
Stars
15.7k
Forks
1.7k
Avg merge
1d 16h
Merged PRs (30d)
136

Description

Traceback (most recent call last):
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/cli/_megatron/rlhf.py", line 7, in
[rank3]: megatron_rlhf_main()
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/train/rlhf.py", line 71, in megatron_rlhf_main
[rank3]: return MegatronRLHF(args).main()
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/llm/base.py", line 49, in main
[rank3]: result = self.run()
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/train/sft.py", line 77, in run
[rank3]: self.trainer.train(train_dataset, val_dataset, data_collator)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/grpo_trainer.py", line 70, in train
[rank3]: super().train(train_dataset, val_dataset, data_collator)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/base.py", line 1016, in train
[rank3]: pretrain(
[rank3]: File "/root/.cache/modelscope/hub/_github/Megatron-LM/megatron/training/training.py", line 737, in pretrain
[rank3]: iteration, num_floating_point_operations_so_far = train(
[rank3]: File "/root/.cache/modelscope/hub/_github/Megatron-LM/megatron/training/training.py", line 2298, in train
[rank3]: ) = train_step(
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/base.py", line 516, in train_step
[rank3]: new_data_iterator = self._replace_data_iterator(data_iterator, model)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/grpo_trainer.py", line 503, in _replace_data_iterator
[rank3]: micro_batch_data = self._generate_and_score_completions(rollout_batch)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/grpo_trainer.py", line 528, in _generate_and_score_completions
[rank3]: rollout_batch = self._generate_completions(rollout_batch)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/utils.py", line 154, in wrapper
[rank3]: return func(self, *args, **kwargs)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/grpo_trainer.py", line 691, in _generate_completions
[rank3]: self._move_model_to_vllm()
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/utils.py", line 154, in wrapper
[rank3]: return func(self, *args, **kwargs)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/grpo_trainer.py", line 230, in _move_model_to_vllm
[rank3]: self._export_and_load_weights()
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/swift/megatron/trainers/grpo_trainer.py", line 266, in _export_and_load_weights
[rank3]: llm_model.load_weights(weight_iterator)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/vllm/model_executor/models/qwen3_next.py", line 1279, in load_weights
[rank3]: return loader.load_weights(weights)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/vllm/model_executor/model_loader/online_quantization.py", line 173, in patched_model_load_weights
[rank3]: return original_load_weights(auto_weight_loader, weights, mapper=mapper)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/vllm/model_executor/models/utils.py", line 335, in load_weights
[rank3]: autoloaded_weights = set(self._load_module("", self.module, weights))
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/vllm/model_executor/models/utils.py", line 288, in _load_module
[rank3]: yield from self._load_module(
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/vllm/model_executor/models/utils.py", line 261, in _load_module
[rank3]: loaded_params = module_load_weights(weights)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/vllm/model_executor/models/qwen3_next.py", line 1122, in load_weights
[rank3]: weight_loader(param, loaded_weight)
[rank3]: File "/opt/conda/envs/zzb_megatron/lib/python3.10/site-packages/vllm/model_executor/layers/linear.py", line 555, in weight_loader_v2
[rank3]: param.load_column_parallel_weight(loaded_weight=loaded_weight)
[rank3]: AttributeError: 'Parameter' object has no attribute 'load_column_parallel_weight'

Contributor guide

Open the contributing guide

First steps

  1. Read the whole issue, then the project's contributing guide.
  2. Comment on the issue to say you are picking it up — it saves two people doing the same work.
  3. Fork the repository and make your change on a branch.
  4. Open a pull request that references the issue number.

Research direction

Reproduce the GRPO run for Qwen3-Next-80b-a3b-instruct-fp8 and start by reading swift/megatron/trainers/grpo_trainer.py around _export_and_load_weights and vllm/model_executor/models/qwen3_next.py around load_weights. Trace the weight loader in vllm/model_executor/layers/linear.py; done means the model can proceed through GRPO weight loading without the reported AttributeError.

Written by the indexing model from the issue text.

Assessment

Tech stack
python
Domain
machine-learning
Issue type
Bug
Difficulty
4/5
Estimated time
3-5 days
Activity status
Quiet
Clarity
Needs clarification
Newbie friendliness
38/100

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.