deepspeedai / deepspeedai/DeepSpeedExamples

RuntimeError: The size of tensor a (768) must match the size of tensor b (3072) at non-singleton dimension 0

Open
#643 1 comment 0 reactions 0 assignees View on GitHub

Nobody has claimed this yet.

Dominant language
Python
Stars
6.8k
Forks
1.1k
Avg merge
2d 16h
Merged PRs (30d)
1

Description

root@mz32-01:/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat#
root@mz32-01:/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat# python3 train.py --step 3 --deployment-type multi_node
---=== Running Step 3 ===---
Running:
bash /home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/training/step3_rlhf_finetuning/training_scripts/multi_node/run_125m.sh /home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/output/actor-models/125m /home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/output/reward-models/125m '' '' /home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/output/step3-models/125m
[2023-07-16 15:08:13,237] [INFO] [real_accelerator.py:110:get_accelerator] Setting ds_accelerator to cuda (auto detect)
........
[2023-07-16 15:08:33,417] [INFO] [config.py:960:print] DeepSpeedEngine configuration:
[2023-07-16 15:08:33,417] [INFO] [config.py:964:print] activation_checkpointing_config {
"partition_activations": false,
"contiguous_memory_optimization": false,
"cpu_checkpointing": false,
"number_checkpoints": null,
"synchronize_checkpoint_boundary": false,
"profile": false
}
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] aio_config ................... {'block_size': 1048576, 'queue_depth': 8, 'thread_count': 1, 'single_submit': False, 'overlap_events': True}
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] amp_enabled .................. False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] amp_params ................... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] autotuning_config ............ {
"enabled": false,
"start_step": null,
"end_step": null,
"metric_path": null,
"arg_mappings": null,
"metric": "throughput",
"model_info": null,
"results_dir": "autotuning_results",
"exps_dir": "autotuning_exps",
"overwrite": true,
"fast": true,
"start_profile_step": 3,
"end_profile_step": 5,
"tuner_type": "gridsearch",
"tuner_early_stopping": 5,
"tuner_num_trials": 50,
"model_info_path": null,
"mp_size": 1,
"max_train_batch_size": null,
"min_train_batch_size": 1,
"max_train_micro_batch_size_per_gpu": 1.024000e+03,
"min_train_micro_batch_size_per_gpu": 1,
"num_tuning_micro_batch_sizes": 3
}
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] bfloat16_enabled ............. False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] checkpoint_parallel_write_pipeline False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] checkpoint_tag_validation_enabled True
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] checkpoint_tag_validation_fail False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] comms_config ................. <deepspeed.comm.config.DeepSpeedCommsConfig object at 0x7f676c057070>
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] communication_data_type ...... None
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] compression_config ........... {'weight_quantization': {'shared_parameters': {'enabled': False, 'quantizer_kernel': False, 'schedule_offset': 0, 'quantize_groups': 1, 'quantize_verbose': False, 'quantization_type': 'symmetric', 'quantize_weight_in_forward': False, 'rounding': 'nearest', 'fp16_mixed_quantize': False, 'quantize_change_ratio': 0.001}, 'different_groups': {}}, 'activation_quantization': {'shared_parameters': {'enabled': False, 'quantization_type': 'symmetric', 'range_calibration': 'dynamic', 'schedule_offset': 1000}, 'different_groups': {}}, 'sparse_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'row_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'head_pruning': {'shared_parameters': {'enabled': False, 'method': 'topk', 'schedule_offset': 1000}, 'different_groups': {}}, 'channel_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'layer_reduction': {'enabled': False}}
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] curriculum_enabled_legacy .... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] curriculum_params_legacy ..... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] data_efficiency_config ....... {'enabled': False, 'seed': 1234, 'data_sampling': {'enabled': False, 'num_epochs': 1000, 'num_workers': 0, 'curriculum_learning': {'enabled': False}}, 'data_routing': {'enabled': False, 'random_ltd': {'enabled': False, 'layer_token_lr_schedule': {'enabled': False}}}}
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] data_efficiency_enabled ...... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] dataloader_drop_last ......... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] disable_allgather ............ False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] dump_state ................... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] dynamic_loss_scale_args ...... {'init_scale': 65536, 'scale_window': 100, 'delayed_shift': 2, 'consecutive_hysteresis': False, 'min_scale': 1}
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] eigenvalue_enabled ........... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] eigenvalue_gas_boundary_resolution 1
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] eigenvalue_layer_name ........ bert.encoder.layer
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] eigenvalue_layer_num ......... 0
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] eigenvalue_max_iter .......... 100
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] eigenvalue_stability ......... 1e-06
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] eigenvalue_tol ............... 0.01
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] eigenvalue_verbose ........... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] elasticity_enabled ........... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] flops_profiler_config ........ {
"enabled": false,
"recompute_fwd_factor": 0.0,
"profile_step": 1,
"module_depth": -1,
"top_modules": 1,
"detailed": true,
"output_file": null
}
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] fp16_auto_cast ............... False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] fp16_enabled ................. True
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] fp16_master_weights_and_gradients False
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] global_rank .................. 0
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] grad_accum_dtype ............. None
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] gradient_accumulation_steps .. 1
[2023-07-16 15:08:33,418] [INFO] [config.py:964:print] gradient_clipping ............ 1.0
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] gradient_predivide_factor .... 1.0
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] hybrid_engine ................ enabled=True max_out_tokens=512 inference_tp_size=2 release_inference_cache=False pin_parameters=True tp_gather_partition_size=128
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] initial_dynamic_scale ........ 65536
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] load_universal_checkpoint .... False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] loss_scale ................... 0
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] memory_breakdown ............. False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] mics_hierarchial_params_gather False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] mics_shard_size .............. -1
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] monitor_config ............... tensorboard=TensorBoardConfig(enabled=False, output_path='', job_name='DeepSpeedJobName') wandb=WandbConfig(enabled=False, group=None, team=None, project='deepspeed') csv_monitor=CSVConfig(enabled=False, output_path='', job_name='DeepSpeedJobName') enabled=False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] nebula_config ................ {
"enabled": false,
"persistent_storage_path": null,
"persistent_time_interval": 100,
"num_of_version_in_retention": 2,
"enable_nebula_load": true,
"load_path": null
}
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] optimizer_legacy_fusion ...... False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] optimizer_name ............... None
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] optimizer_params ............. None
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] pipeline ..................... {'stages': 'auto', 'partition': 'best', 'seed_layers': False, 'activation_checkpoint_interval': 0}
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] pld_enabled .................. False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] pld_params ................... False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] prescale_gradients ........... False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] scheduler_name ............... None
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] scheduler_params ............. None
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] sparse_attention ............. None
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] sparse_gradients_enabled ..... False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] steps_per_print .............. 10
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] train_batch_size ............. 256
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] train_micro_batch_size_per_gpu 128
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] use_node_local_storage ....... False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] wall_clock_breakdown ......... False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] world_size ................... 2
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] zero_allow_untested_optimizer False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] zero_config .................. stage=3 contiguous_gradients=True reduce_scatter=True reduce_bucket_size=500,000,000 allgather_partitions=True allgather_bucket_size=500,000,000 overlap_comm=True load_from_fp32_weights=True elastic_checkpoint=False offload_param=DeepSpeedZeroOffloadParamConfig(device='none', nvme_path=None, buffer_count=5, buffer_size=100,000,000, max_in_cpu=1,000,000,000, pin_memory=False) offload_optimizer=DeepSpeedZeroOffloadOptimizerConfig(device='none', nvme_path=None, buffer_count=4, pin_memory=False, pipeline=False, pipeline_read=False, pipeline_write=False, fast_init=False) sub_group_size=1,000,000,000 cpu_offload_param=None cpu_offload_use_pin_memory=None cpu_offload=None prefetch_bucket_size=30000000 param_persistence_threshold=10000 model_persistence_threshold=sys.maxsize max_live_parameters=30000000 max_reuse_distance=1,000,000,000 gather_16bit_weights_on_model_save=False stage3_gather_fp16_weights_on_model_save=False ignore_unused_parameters=True legacy_stage1=False round_robin_gradients=False mics_shard_size=-1 mics_hierarchical_params_gather=False memory_efficient_linear=False
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] zero_enabled ................. True
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] zero_force_ds_cpu_optimizer .. True
[2023-07-16 15:08:33,419] [INFO] [config.py:964:print] zero_optimization_stage ...... 3
[2023-07-16 15:08:33,419] [INFO] [config.py:950:print_user_config] json = {
"train_batch_size": 256,
"train_micro_batch_size_per_gpu": 128,
"steps_per_print": 10,
"zero_optimization": {
"stage": 3,
"offload_param": {
"device": "none"
},
"offload_optimizer": {
"device": "none"
},
"stage3_param_persistence_threshold": 1.000000e+04,
"stage3_max_live_parameters": 3.000000e+07,
"stage3_prefetch_bucket_size": 3.000000e+07,
"memory_efficient_linear": false
},
"fp16": {
"enabled": true,
"loss_scale_window": 100
},
"gradient_clipping": 1.0,
"prescale_gradients": false,
"wall_clock_breakdown": false,
"hybrid_engine": {
"enabled": true,
"max_out_tokens": 512,
"inference_tp_size": 2,
"release_inference_cache": false,
"pin_parameters": true,
"tp_gather_partition_size": 128
}
}
Using /root/.cache/torch_extensions/py38_cu117 as PyTorch extensions root...
Using /root/.cache/torch_extensions/py38_cu117 as PyTorch extensions root...
Detected CUDA files, patching ldflags
Emitting ninja build file /root/.cache/torch_extensions/py38_cu117/transformer_inference/build.ninja...
Building extension module transformer_inference...
Allowing ninja to set a default number of workers... (overridable by setting the environment variable MAX_JOBS=N)
ninja: no work to do.
Loading extension module transformer_inference...
Time to load transformer_inference op: 0.4970717430114746 seconds
Loading extension module transformer_inference...
Time to load transformer_inference op: 0.5848901271820068 seconds
[2023-07-16 15:08:34,199] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed-Inference config: {'layer_id': 0, 'hidden_size': 768, 'intermediate_size': 3072, 'heads': 12, 'num_hidden_layers': -1, 'dtype': torch.float16, 'pre_layer_norm': True, 'norm_type': <NormType.LayerNorm: 1>, 'local_rank': -1, 'stochastic_mode': False, 'epsilon': 1e-05, 'mp_size': 2, 'scale_attention': True, 'triangular_masking': True, 'local_attention': False, 'window_size': 1, 'rotary_dim': -1, 'rotate_half': False, 'rotate_every_two': True, 'return_tuple': True, 'mlp_after_attn': True, 'mlp_act_func_type': <ActivationFuncType.ReLU: 2>, 'specialized_mode': False, 'training_mp_size': 1, 'bigscience_bloom': False, 'max_out_tokens': 512, 'min_out_tokens': 512, 'scale_attn_by_inverse_layer_idx': False, 'enable_qkv_quantization': False, 'use_mup': False, 'return_single_tuple': False, 'set_empty_params': True, 'transposed_mode': True}
Using /root/.cache/torch_extensions/py38_cu117 as PyTorch extensions root...
No modifications detected for re-loaded extension module transformer_inference, skipping build step...
Loading extension module transformer_inference...
Time to load transformer_inference op: 0.08850884437561035 seconds
Using /root/.cache/torch_extensions/py38_cu117 as PyTorch extensions root...
No modifications detected for re-loaded extension module transformer_inference, skipping build step...
Loading extension module transformer_inference...
Time to load transformer_inference op: 0.09563326835632324 seconds
Using /root/.cache/torch_extensions/py38_cu117 as PyTorch extensions root...
No modifications detected for re-loaded extension module transformer_inference, skipping build step...
Loading extension module transformer_inference...
Time to load transformer_inference op: 0.08705496788024902 seconds
Using /root/.cache/torch_extensions/py38_cu117 as PyTorch extensions root...
No modifications detected for re-loaded extension module transformer_inference, skipping build step...
Loading extension module transformer_inference...
Time to load transformer_inference op: 0.08372807502746582 seconds
[end] Initialized Actor Model [end] (duration: 7.58s)*
************************[start] Initializing Ref Model [start] **************************
[2023-07-16 15:08:34,910] [INFO] [partition_parameters.py:453:exit] finished initializing model with 0.33B parameters
[2023-07-16 15:08:35,158] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed info: version=0.9.5, git-hash=unknown, git-branch=unknown
[2023-07-16 15:08:35,164] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed Flops Profiler Enabled: False
[2023-07-16 15:08:35,164] [INFO] [logging.py:96:log_dist] [Rank 0] Creating ZeRO Offload
[2023-07-16 15:08:35,478] [INFO] [utils.py:785:see_memory_usage] DeepSpeedZeRoOffload initialize [begin]
[2023-07-16 15:08:35,479] [INFO] [utils.py:786:see_memory_usage] MA 1.67 GB Max_MA 1.85 GB CA 2.14 GB Max_CA 2 GB
[2023-07-16 15:08:35,479] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.52 GB, percent = 3.4%
Parameter Offload: Total persistent parameters: 121344 in 122 params
[2023-07-16 15:08:35,790] [INFO] [utils.py:785:see_memory_usage] DeepSpeedZeRoOffload initialize [end]
[2023-07-16 15:08:35,790] [INFO] [utils.py:786:see_memory_usage] MA 1.67 GB Max_MA 1.67 GB CA 2.14 GB Max_CA 2 GB
[2023-07-16 15:08:35,791] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.7 GB, percent = 3.5%
[2023-07-16 15:08:35,791] [INFO] [config.py:960:print] DeepSpeedEngine configuration:
[2023-07-16 15:08:35,791] [INFO] [config.py:964:print] activation_checkpointing_config {
"partition_activations": false,
"contiguous_memory_optimization": false,
"cpu_checkpointing": false,
"number_checkpoints": null,
"synchronize_checkpoint_boundary": false,
"profile": false
}
[2023-07-16 15:08:35,791] [INFO] [config.py:964:print] aio_config ................... {'block_size': 1048576, 'queue_depth': 8, 'thread_count': 1, 'single_submit': False, 'overlap_events': True}
[2023-07-16 15:08:35,791] [INFO] [config.py:964:print] amp_enabled .................. False
[2023-07-16 15:08:35,791] [INFO] [config.py:964:print] amp_params ................... False
[2023-07-16 15:08:35,791] [INFO] [config.py:964:print] autotuning_config ............ {
"enabled": false,
"start_step": null,
"end_step": null,
"metric_path": null,
"arg_mappings": null,
"metric": "throughput",
"model_info": null,
"results_dir": "autotuning_results",
"exps_dir": "autotuning_exps",
"overwrite": true,
"fast": true,
"start_profile_step": 3,
"end_profile_step": 5,
"tuner_type": "gridsearch",
"tuner_early_stopping": 5,
"tuner_num_trials": 50,
"model_info_path": null,
"mp_size": 1,
"max_train_batch_size": null,
"min_train_batch_size": 1,
"max_train_micro_batch_size_per_gpu": 1.024000e+03,
"min_train_micro_batch_size_per_gpu": 1,
"num_tuning_micro_batch_sizes": 3
}
[2023-07-16 15:08:35,791] [INFO] [config.py:964:print] bfloat16_enabled ............. False
[2023-07-16 15:08:35,791] [INFO] [config.py:964:print] checkpoint_parallel_write_pipeline False
[2023-07-16 15:08:35,791] [INFO] [config.py:964:print] checkpoint_tag_validation_enabled True
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] checkpoint_tag_validation_fail False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] comms_config ................. <deepspeed.comm.config.DeepSpeedCommsConfig object at 0x7f6742b42190>
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] communication_data_type ...... None
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] compression_config ........... {'weight_quantization': {'shared_parameters': {'enabled': False, 'quantizer_kernel': False, 'schedule_offset': 0, 'quantize_groups': 1, 'quantize_verbose': False, 'quantization_type': 'symmetric', 'quantize_weight_in_forward': False, 'rounding': 'nearest', 'fp16_mixed_quantize': False, 'quantize_change_ratio': 0.001}, 'different_groups': {}}, 'activation_quantization': {'shared_parameters': {'enabled': False, 'quantization_type': 'symmetric', 'range_calibration': 'dynamic', 'schedule_offset': 1000}, 'different_groups': {}}, 'sparse_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'row_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'head_pruning': {'shared_parameters': {'enabled': False, 'method': 'topk', 'schedule_offset': 1000}, 'different_groups': {}}, 'channel_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'layer_reduction': {'enabled': False}}
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] curriculum_enabled_legacy .... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] curriculum_params_legacy ..... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] data_efficiency_config ....... {'enabled': False, 'seed': 1234, 'data_sampling': {'enabled': False, 'num_epochs': 1000, 'num_workers': 0, 'curriculum_learning': {'enabled': False}}, 'data_routing': {'enabled': False, 'random_ltd': {'enabled': False, 'layer_token_lr_schedule': {'enabled': False}}}}
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] data_efficiency_enabled ...... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] dataloader_drop_last ......... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] disable_allgather ............ False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] dump_state ................... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] dynamic_loss_scale_args ...... None
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] eigenvalue_enabled ........... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] eigenvalue_gas_boundary_resolution 1
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] eigenvalue_layer_name ........ bert.encoder.layer
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] eigenvalue_layer_num ......... 0
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] eigenvalue_max_iter .......... 100
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] eigenvalue_stability ......... 1e-06
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] eigenvalue_tol ............... 0.01
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] eigenvalue_verbose ........... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] elasticity_enabled ........... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] flops_profiler_config ........ {
"enabled": false,
"recompute_fwd_factor": 0.0,
"profile_step": 1,
"module_depth": -1,
"top_modules": 1,
"detailed": true,
"output_file": null
}
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] fp16_auto_cast ............... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] fp16_enabled ................. True
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] fp16_master_weights_and_gradients False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] global_rank .................. 0
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] grad_accum_dtype ............. None
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] gradient_accumulation_steps .. 1
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] gradient_clipping ............ 1.0
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] gradient_predivide_factor .... 1.0
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] hybrid_engine ................ enabled=False max_out_tokens=512 inference_tp_size=1 release_inference_cache=False pin_parameters=True tp_gather_partition_size=8
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] initial_dynamic_scale ........ 65536
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] load_universal_checkpoint .... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] loss_scale ................... 0
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] memory_breakdown ............. False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] mics_hierarchial_params_gather False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] mics_shard_size .............. -1
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] monitor_config ............... tensorboard=TensorBoardConfig(enabled=False, output_path='', job_name='DeepSpeedJobName') wandb=WandbConfig(enabled=False, group=None, team=None, project='deepspeed') csv_monitor=CSVConfig(enabled=False, output_path='', job_name='DeepSpeedJobName') enabled=False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] nebula_config ................ {
"enabled": false,
"persistent_storage_path": null,
"persistent_time_interval": 100,
"num_of_version_in_retention": 2,
"enable_nebula_load": true,
"load_path": null
}
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] optimizer_legacy_fusion ...... False
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] optimizer_name ............... None
[2023-07-16 15:08:35,792] [INFO] [config.py:964:print] optimizer_params ............. None
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] pipeline ..................... {'stages': 'auto', 'partition': 'best', 'seed_layers': False, 'activation_checkpoint_interval': 0}
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] pld_enabled .................. False
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] pld_params ................... False
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] prescale_gradients ........... False
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] scheduler_name ............... None
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] scheduler_params ............. None
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] sparse_attention ............. None
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] sparse_gradients_enabled ..... False
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] steps_per_print .............. 10
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] train_batch_size ............. 256
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] train_micro_batch_size_per_gpu 128
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] use_node_local_storage ....... False
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] wall_clock_breakdown ......... False
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] world_size ................... 2
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] zero_allow_untested_optimizer False
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] zero_config .................. stage=3 contiguous_gradients=True reduce_scatter=True reduce_bucket_size=500,000,000 allgather_partitions=True allgather_bucket_size=500,000,000 overlap_comm=True load_from_fp32_weights=True elastic_checkpoint=False offload_param=DeepSpeedZeroOffloadParamConfig(device='none', nvme_path=None, buffer_count=5, buffer_size=100,000,000, max_in_cpu=1,000,000,000, pin_memory=False) offload_optimizer=None sub_group_size=1,000,000,000 cpu_offload_param=None cpu_offload_use_pin_memory=None cpu_offload=None prefetch_bucket_size=50,000,000 param_persistence_threshold=10000 model_persistence_threshold=sys.maxsize max_live_parameters=1,000,000,000 max_reuse_distance=1,000,000,000 gather_16bit_weights_on_model_save=False stage3_gather_fp16_weights_on_model_save=False ignore_unused_parameters=True legacy_stage1=False round_robin_gradients=False mics_shard_size=-1 mics_hierarchical_params_gather=False memory_efficient_linear=False
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] zero_enabled ................. True
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] zero_force_ds_cpu_optimizer .. True
[2023-07-16 15:08:35,793] [INFO] [config.py:964:print] zero_optimization_stage ...... 3
[2023-07-16 15:08:35,793] [INFO] [config.py:950:print_user_config] json = {
"train_batch_size": 256,
"train_micro_batch_size_per_gpu": 128,
"steps_per_print": 10,
"zero_optimization": {
"stage": 3,
"stage3_param_persistence_threshold": 1.000000e+04,
"offload_param": {
"device": "none"
},
"memory_efficient_linear": false
},
"fp16": {
"enabled": true
},
"gradient_clipping": 1.0,
"prescale_gradients": false,
"wall_clock_breakdown": false
}
[end] Initialized Ref Model [end] (duration: 1.05s)

************************[start] Initializing Critic Model [start] ************************
Using /root/.cache/torch_extensions/py38_cu117 as PyTorch extensions root...
No modifications detected for re-loaded extension module fused_adam, skipping build step...
Loading extension module fused_adam...
Time to load fused_adam op: 0.0006570816040039062 seconds
Using /root/.cache/torch_extensions/py38_cu117 as PyTorch extensions root...
No modifications detected for re-loaded extension module fused_adam, skipping build step...
Loading extension module fused_adam...
Time to load fused_adam op: 0.0010995864868164062 seconds
[2023-07-16 15:08:37,364] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed info: version=0.9.5, git-hash=unknown, git-branch=unknown
[2023-07-16 15:08:37,438] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed Flops Profiler Enabled: False
[2023-07-16 15:08:37,439] [INFO] [logging.py:96:log_dist] [Rank 0] Removing param_group that has no 'params' in the client Optimizer
[2023-07-16 15:08:37,439] [INFO] [logging.py:96:log_dist] [Rank 0] Using client Optimizer as basic optimizer
[2023-07-16 15:08:37,443] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed Basic Optimizer = FusedAdam
[2023-07-16 15:08:37,443] [INFO] [utils.py:54:is_zero_supported_optimizer] Checking ZeRO support for optimizer=FusedAdam type=<class 'deepspeed.ops.adam.fused_adam.FusedAdam'>
[2023-07-16 15:08:37,443] [INFO] [logging.py:96:log_dist] [Rank 0] Creating fp16 ZeRO stage 3 optimizer, MiCS is enabled False, Hierarchical params gather False
[2023-07-16 15:08:37,443] [INFO] [logging.py:96:log_dist] [Rank 0] Creating torch.float16 ZeRO stage 3 optimizer
[2023-07-16 15:08:37,776] [INFO] [utils.py:785:see_memory_usage] Stage 3 initialize beginning
[2023-07-16 15:08:37,777] [INFO] [utils.py:786:see_memory_usage] MA 1.9 GB Max_MA 1.9 GB CA 2.14 GB Max_CA 2 GB
[2023-07-16 15:08:37,777] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
[2023-07-16 15:08:37,779] [INFO] [stage3.py:113:init] Reduce bucket size 500,000,000
[2023-07-16 15:08:37,779] [INFO] [stage3.py:114:init] Prefetch bucket size 30000000
[2023-07-16 15:08:38,115] [INFO] [utils.py:785:see_memory_usage] DeepSpeedZeRoOffload initialize [begin]
[2023-07-16 15:08:38,116] [INFO] [utils.py:786:see_memory_usage] MA 1.9 GB Max_MA 1.9 GB CA 2.14 GB Max_CA 2 GB
[2023-07-16 15:08:38,116] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
Parameter Offload: Total persistent parameters: 122112 in 123 params
[2023-07-16 15:08:38,491] [INFO] [utils.py:785:see_memory_usage] DeepSpeedZeRoOffload initialize [end]
[2023-07-16 15:08:38,491] [INFO] [utils.py:786:see_memory_usage] MA 1.78 GB Max_MA 1.94 GB CA 2.17 GB Max_CA 2 GB
[2023-07-16 15:08:38,492] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
[2023-07-16 15:08:38,834] [INFO] [utils.py:785:see_memory_usage] Before creating fp16 partitions
[2023-07-16 15:08:38,834] [INFO] [utils.py:786:see_memory_usage] MA 1.78 GB Max_MA 1.78 GB CA 2.17 GB Max_CA 2 GB
[2023-07-16 15:08:38,835] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
[2023-07-16 15:08:39,554] [INFO] [utils.py:785:see_memory_usage] After creating fp16 partitions: 2
[2023-07-16 15:08:39,555] [INFO] [utils.py:786:see_memory_usage] MA 1.78 GB Max_MA 1.78 GB CA 1.92 GB Max_CA 2 GB
[2023-07-16 15:08:39,556] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
[2023-07-16 15:08:39,896] [INFO] [utils.py:785:see_memory_usage] Before creating fp32 partitions
[2023-07-16 15:08:39,897] [INFO] [utils.py:786:see_memory_usage] MA 1.78 GB Max_MA 1.78 GB CA 1.92 GB Max_CA 2 GB
[2023-07-16 15:08:39,897] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
[2023-07-16 15:08:40,240] [INFO] [utils.py:785:see_memory_usage] After creating fp32 partitions
[2023-07-16 15:08:40,241] [INFO] [utils.py:786:see_memory_usage] MA 2.02 GB Max_MA 2.13 GB CA 2.27 GB Max_CA 2 GB
[2023-07-16 15:08:40,241] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
[2023-07-16 15:08:40,582] [INFO] [utils.py:785:see_memory_usage] Before initializing optimizer states
[2023-07-16 15:08:40,583] [INFO] [utils.py:786:see_memory_usage] MA 2.02 GB Max_MA 2.02 GB CA 2.27 GB Max_CA 2 GB
[2023-07-16 15:08:40,583] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
[2023-07-16 15:08:40,927] [INFO] [utils.py:785:see_memory_usage] After initializing optimizer states
[2023-07-16 15:08:40,928] [INFO] [utils.py:786:see_memory_usage] MA 2.48 GB Max_MA 2.72 GB CA 2.98 GB Max_CA 3 GB
[2023-07-16 15:08:40,928] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 8.89 GB, percent = 3.5%
[2023-07-16 15:08:40,928] [INFO] [stage3.py:387:_setup_for_real_optimizer] optimizer state initialized
[2023-07-16 15:08:41,277] [INFO] [utils.py:785:see_memory_usage] After initializing ZeRO optimizer
[2023-07-16 15:08:41,277] [INFO] [utils.py:786:see_memory_usage] MA 3.53 GB Max_MA 3.68 GB CA 3.95 GB Max_CA 4 GB
[2023-07-16 15:08:41,277] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 9.05 GB, percent = 3.6%
[2023-07-16 15:08:41,278] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed Final Optimizer = FusedAdam
[2023-07-16 15:08:41,278] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed using client LR scheduler
[2023-07-16 15:08:41,278] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed LR Scheduler = <torch.optim.lr_scheduler.LambdaLR object at 0x7f6742500880>
[2023-07-16 15:08:41,278] [INFO] [logging.py:96:log_dist] [Rank 0] step=0, skipped=0, lr=[0.0, 0.0], mom=[(0.9, 0.95), (0.9, 0.95)]
[2023-07-16 15:08:41,278] [INFO] [config.py:960:print] DeepSpeedEngine configuration:
[2023-07-16 15:08:41,278] [INFO] [config.py:964:print] activation_checkpointing_config {
"partition_activations": false,
"contiguous_memory_optimization": false,
"cpu_checkpointing": false,
"number_checkpoints": null,
"synchronize_checkpoint_boundary": false,
"profile": false
}
[2023-07-16 15:08:41,278] [INFO] [config.py:964:print] aio_config ................... {'block_size': 1048576, 'queue_depth': 8, 'thread_count': 1, 'single_submit': False, 'overlap_events': True}
[2023-07-16 15:08:41,278] [INFO] [config.py:964:print] amp_enabled .................. False
[2023-07-16 15:08:41,278] [INFO] [config.py:964:print] amp_params ................... False
[2023-07-16 15:08:41,278] [INFO] [config.py:964:print] autotuning_config ............ {
"enabled": false,
"start_step": null,
"end_step": null,
"metric_path": null,
"arg_mappings": null,
"metric": "throughput",
"model_info": null,
"results_dir": "autotuning_results",
"exps_dir": "autotuning_exps",
"overwrite": true,
"fast": true,
"start_profile_step": 3,
"end_profile_step": 5,
"tuner_type": "gridsearch",
"tuner_early_stopping": 5,
"tuner_num_trials": 50,
"model_info_path": null,
"mp_size": 1,
"max_train_batch_size": null,
"min_train_batch_size": 1,
"max_train_micro_batch_size_per_gpu": 1.024000e+03,
"min_train_micro_batch_size_per_gpu": 1,
"num_tuning_micro_batch_sizes": 3
}
[2023-07-16 15:08:41,278] [INFO] [config.py:964:print] bfloat16_enabled ............. False
[2023-07-16 15:08:41,278] [INFO] [config.py:964:print] checkpoint_parallel_write_pipeline False
[2023-07-16 15:08:41,278] [INFO] [config.py:964:print] checkpoint_tag_validation_enabled True
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] checkpoint_tag_validation_fail False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] comms_config ................. <deepspeed.comm.config.DeepSpeedCommsConfig object at 0x7f67427aa430>
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] communication_data_type ...... None
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] compression_config ........... {'weight_quantization': {'shared_parameters': {'enabled': False, 'quantizer_kernel': False, 'schedule_offset': 0, 'quantize_groups': 1, 'quantize_verbose': False, 'quantization_type': 'symmetric', 'quantize_weight_in_forward': False, 'rounding': 'nearest', 'fp16_mixed_quantize': False, 'quantize_change_ratio': 0.001}, 'different_groups': {}}, 'activation_quantization': {'shared_parameters': {'enabled': False, 'quantization_type': 'symmetric', 'range_calibration': 'dynamic', 'schedule_offset': 1000}, 'different_groups': {}}, 'sparse_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'row_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'head_pruning': {'shared_parameters': {'enabled': False, 'method': 'topk', 'schedule_offset': 1000}, 'different_groups': {}}, 'channel_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'layer_reduction': {'enabled': False}}
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] curriculum_enabled_legacy .... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] curriculum_params_legacy ..... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] data_efficiency_config ....... {'enabled': False, 'seed': 1234, 'data_sampling': {'enabled': False, 'num_epochs': 1000, 'num_workers': 0, 'curriculum_learning': {'enabled': False}}, 'data_routing': {'enabled': False, 'random_ltd': {'enabled': False, 'layer_token_lr_schedule': {'enabled': False}}}}
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] data_efficiency_enabled ...... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] dataloader_drop_last ......... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] disable_allgather ............ False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] dump_state ................... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] dynamic_loss_scale_args ...... {'init_scale': 65536, 'scale_window': 100, 'delayed_shift': 2, 'consecutive_hysteresis': False, 'min_scale': 1}
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] eigenvalue_enabled ........... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] eigenvalue_gas_boundary_resolution 1
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] eigenvalue_layer_name ........ bert.encoder.layer
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] eigenvalue_layer_num ......... 0
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] eigenvalue_max_iter .......... 100
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] eigenvalue_stability ......... 1e-06
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] eigenvalue_tol ............... 0.01
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] eigenvalue_verbose ........... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] elasticity_enabled ........... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] flops_profiler_config ........ {
"enabled": false,
"recompute_fwd_factor": 0.0,
"profile_step": 1,
"module_depth": -1,
"top_modules": 1,
"detailed": true,
"output_file": null
}
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] fp16_auto_cast ............... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] fp16_enabled ................. True
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] fp16_master_weights_and_gradients False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] global_rank .................. 0
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] grad_accum_dtype ............. None
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] gradient_accumulation_steps .. 1
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] gradient_clipping ............ 1.0
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] gradient_predivide_factor .... 1.0
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] hybrid_engine ................ enabled=False max_out_tokens=512 inference_tp_size=1 release_inference_cache=False pin_parameters=True tp_gather_partition_size=8
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] initial_dynamic_scale ........ 65536
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] load_universal_checkpoint .... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] loss_scale ................... 0
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] memory_breakdown ............. False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] mics_hierarchial_params_gather False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] mics_shard_size .............. -1
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] monitor_config ............... tensorboard=TensorBoardConfig(enabled=False, output_path='', job_name='DeepSpeedJobName') wandb=WandbConfig(enabled=False, group=None, team=None, project='deepspeed') csv_monitor=CSVConfig(enabled=False, output_path='', job_name='DeepSpeedJobName') enabled=False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] nebula_config ................ {
"enabled": false,
"persistent_storage_path": null,
"persistent_time_interval": 100,
"num_of_version_in_retention": 2,
"enable_nebula_load": true,
"load_path": null
}
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] optimizer_legacy_fusion ...... False
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] optimizer_name ............... None
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] optimizer_params ............. None
[2023-07-16 15:08:41,279] [INFO] [config.py:964:print] pipeline ..................... {'stages': 'auto', 'partition': 'best', 'seed_layers': False, 'activation_checkpoint_interval': 0}
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] pld_enabled .................. False
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] pld_params ................... False
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] prescale_gradients ........... False
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] scheduler_name ............... None
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] scheduler_params ............. None
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] sparse_attention ............. None
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] sparse_gradients_enabled ..... False
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] steps_per_print .............. 10
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] train_batch_size ............. 256
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] train_micro_batch_size_per_gpu 128
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] use_node_local_storage ....... False
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] wall_clock_breakdown ......... False
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] world_size ................... 2
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] zero_allow_untested_optimizer False
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] zero_config .................. stage=3 contiguous_gradients=True reduce_scatter=True reduce_bucket_size=500,000,000 allgather_partitions=True allgather_bucket_size=500,000,000 overlap_comm=True load_from_fp32_weights=True elastic_checkpoint=False offload_param=DeepSpeedZeroOffloadParamConfig(device='none', nvme_path=None, buffer_count=5, buffer_size=100,000,000, max_in_cpu=1,000,000,000, pin_memory=False) offload_optimizer=DeepSpeedZeroOffloadOptimizerConfig(device='none', nvme_path=None, buffer_count=4, pin_memory=False, pipeline=False, pipeline_read=False, pipeline_write=False, fast_init=False) sub_group_size=1,000,000,000 cpu_offload_param=None cpu_offload_use_pin_memory=None cpu_offload=None prefetch_bucket_size=30000000 param_persistence_threshold=10000 model_persistence_threshold=sys.maxsize max_live_parameters=30000000 max_reuse_distance=1,000,000,000 gather_16bit_weights_on_model_save=False stage3_gather_fp16_weights_on_model_save=False ignore_unused_parameters=True legacy_stage1=False round_robin_gradients=False mics_shard_size=-1 mics_hierarchical_params_gather=False memory_efficient_linear=False
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] zero_enabled ................. True
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] zero_force_ds_cpu_optimizer .. True
[2023-07-16 15:08:41,280] [INFO] [config.py:964:print] zero_optimization_stage ...... 3
[2023-07-16 15:08:41,280] [INFO] [config.py:950:print_user_config] json = {
"train_batch_size": 256,
"train_micro_batch_size_per_gpu": 128,
"steps_per_print": 10,
"zero_optimization": {
"stage": 3,
"offload_param": {
"device": "none"
},
"offload_optimizer": {
"device": "none"
},
"stage3_param_persistence_threshold": 1.000000e+04,
"stage3_max_live_parameters": 3.000000e+07,
"stage3_prefetch_bucket_size": 3.000000e+07,
"memory_efficient_linear": false
},
"fp16": {
"enabled": true,
"loss_scale_window": 100
},
"gradient_clipping": 1.0,
"prescale_gradients": false,
"wall_clock_breakdown": false,
"hybrid_engine": {
"enabled": false,
"max_out_tokens": 512,
"inference_tp_size": 1,
"release_inference_cache": false,
"pin_parameters": true,
"tp_gather_partition_size": 8
}
}
[end] Initialized Critic Model [end] (duration: 5.49s)
************************[start] Initializing Reward Model [start] ************************
[2023-07-16 15:08:42,782] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed info: version=0.9.5, git-hash=unknown, git-branch=unknown
[2023-07-16 15:08:42,847] [INFO] [logging.py:96:log_dist] [Rank 0] DeepSpeed Flops Profiler Enabled: False
[2023-07-16 15:08:42,848] [INFO] [logging.py:96:log_dist] [Rank 0] Creating ZeRO Offload
[2023-07-16 15:08:43,181] [INFO] [utils.py:785:see_memory_usage] DeepSpeedZeRoOffload initialize [begin]
[2023-07-16 15:08:43,181] [INFO] [utils.py:786:see_memory_usage] MA 3.77 GB Max_MA 3.77 GB CA 3.95 GB Max_CA 4 GB
[2023-07-16 15:08:43,182] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 9.3 GB, percent = 3.7%
Parameter Offload: Total persistent parameters: 122112 in 123 params
[2023-07-16 15:08:43,563] [INFO] [utils.py:785:see_memory_usage] DeepSpeedZeRoOffload initialize [end]
[2023-07-16 15:08:43,563] [INFO] [utils.py:786:see_memory_usage] MA 3.65 GB Max_MA 3.81 GB CA 3.98 GB Max_CA 4 GB
[2023-07-16 15:08:43,564] [INFO] [utils.py:793:see_memory_usage] CPU Virtual Memory: used = 9.3 GB, percent = 3.7%
[2023-07-16 15:08:43,564] [INFO] [config.py:960:print] DeepSpeedEngine configuration:
[2023-07-16 15:08:43,564] [INFO] [config.py:964:print] activation_checkpointing_config {
"partition_activations": false,
"contiguous_memory_optimization": false,
"cpu_checkpointing": false,
"number_checkpoints": null,
"synchronize_checkpoint_boundary": false,
"profile": false
}
[2023-07-16 15:08:43,564] [INFO] [config.py:964:print] aio_config ................... {'block_size': 1048576, 'queue_depth': 8, 'thread_count': 1, 'single_submit': False, 'overlap_events': True}
[2023-07-16 15:08:43,564] [INFO] [config.py:964:print] amp_enabled .................. False
[2023-07-16 15:08:43,564] [INFO] [config.py:964:print] amp_params ................... False
[2023-07-16 15:08:43,564] [INFO] [config.py:964:print] autotuning_config ............ {
"enabled": false,
"start_step": null,
"end_step": null,
"metric_path": null,
"arg_mappings": null,
"metric": "throughput",
"model_info": null,
"results_dir": "autotuning_results",
"exps_dir": "autotuning_exps",
"overwrite": true,
"fast": true,
"start_profile_step": 3,
"end_profile_step": 5,
"tuner_type": "gridsearch",
"tuner_early_stopping": 5,
"tuner_num_trials": 50,
"model_info_path": null,
"mp_size": 1,
"max_train_batch_size": null,
"min_train_batch_size": 1,
"max_train_micro_batch_size_per_gpu": 1.024000e+03,
"min_train_micro_batch_size_per_gpu": 1,
"num_tuning_micro_batch_sizes": 3
}
[2023-07-16 15:08:43,564] [INFO] [config.py:964:print] bfloat16_enabled ............. False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] checkpoint_parallel_write_pipeline False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] checkpoint_tag_validation_enabled True
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] checkpoint_tag_validation_fail False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] comms_config ................. <deepspeed.comm.config.DeepSpeedCommsConfig object at 0x7f67424502b0>
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] communication_data_type ...... None
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] compression_config ........... {'weight_quantization': {'shared_parameters': {'enabled': False, 'quantizer_kernel': False, 'schedule_offset': 0, 'quantize_groups': 1, 'quantize_verbose': False, 'quantization_type': 'symmetric', 'quantize_weight_in_forward': False, 'rounding': 'nearest', 'fp16_mixed_quantize': False, 'quantize_change_ratio': 0.001}, 'different_groups': {}}, 'activation_quantization': {'shared_parameters': {'enabled': False, 'quantization_type': 'symmetric', 'range_calibration': 'dynamic', 'schedule_offset': 1000}, 'different_groups': {}}, 'sparse_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'row_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'head_pruning': {'shared_parameters': {'enabled': False, 'method': 'topk', 'schedule_offset': 1000}, 'different_groups': {}}, 'channel_pruning': {'shared_parameters': {'enabled': False, 'method': 'l1', 'schedule_offset': 1000}, 'different_groups': {}}, 'layer_reduction': {'enabled': False}}
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] curriculum_enabled_legacy .... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] curriculum_params_legacy ..... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] data_efficiency_config ....... {'enabled': False, 'seed': 1234, 'data_sampling': {'enabled': False, 'num_epochs': 1000, 'num_workers': 0, 'curriculum_learning': {'enabled': False}}, 'data_routing': {'enabled': False, 'random_ltd': {'enabled': False, 'layer_token_lr_schedule': {'enabled': False}}}}
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] data_efficiency_enabled ...... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] dataloader_drop_last ......... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] disable_allgather ............ False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] dump_state ................... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] dynamic_loss_scale_args ...... None
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] eigenvalue_enabled ........... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] eigenvalue_gas_boundary_resolution 1
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] eigenvalue_layer_name ........ bert.encoder.layer
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] eigenvalue_layer_num ......... 0
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] eigenvalue_max_iter .......... 100
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] eigenvalue_stability ......... 1e-06
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] eigenvalue_tol ............... 0.01
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] eigenvalue_verbose ........... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] elasticity_enabled ........... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] flops_profiler_config ........ {
"enabled": false,
"recompute_fwd_factor": 0.0,
"profile_step": 1,
"module_depth": -1,
"top_modules": 1,
"detailed": true,
"output_file": null
}
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] fp16_auto_cast ............... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] fp16_enabled ................. True
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] fp16_master_weights_and_gradients False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] global_rank .................. 0
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] grad_accum_dtype ............. None
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] gradient_accumulation_steps .. 1
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] gradient_clipping ............ 1.0
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] gradient_predivide_factor .... 1.0
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] hybrid_engine ................ enabled=False max_out_tokens=512 inference_tp_size=1 release_inference_cache=False pin_parameters=True tp_gather_partition_size=8
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] initial_dynamic_scale ........ 65536
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] load_universal_checkpoint .... False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] loss_scale ................... 0
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] memory_breakdown ............. False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] mics_hierarchial_params_gather False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] mics_shard_size .............. -1
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] monitor_config ............... tensorboard=TensorBoardConfig(enabled=False, output_path='', job_name='DeepSpeedJobName') wandb=WandbConfig(enabled=False, group=None, team=None, project='deepspeed') csv_monitor=CSVConfig(enabled=False, output_path='', job_name='DeepSpeedJobName') enabled=False
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] nebula_config ................ {
"enabled": false,
"persistent_storage_path": null,
"persistent_time_interval": 100,
"num_of_version_in_retention": 2,
"enable_nebula_load": true,
"load_path": null
}
[2023-07-16 15:08:43,565] [INFO] [config.py:964:print] optimizer_legacy_fusion ...... False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] optimizer_name ............... None
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] optimizer_params ............. None
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] pipeline ..................... {'stages': 'auto', 'partition': 'best', 'seed_layers': False, 'activation_checkpoint_interval': 0}
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] pld_enabled .................. False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] pld_params ................... False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] prescale_gradients ........... False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] scheduler_name ............... None
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] scheduler_params ............. None
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] sparse_attention ............. None
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] sparse_gradients_enabled ..... False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] steps_per_print .............. 10
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] train_batch_size ............. 256
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] train_micro_batch_size_per_gpu 128
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] use_node_local_storage ....... False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] wall_clock_breakdown ......... False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] world_size ................... 2
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] zero_allow_untested_optimizer False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] zero_config .................. stage=3 contiguous_gradients=True reduce_scatter=True reduce_bucket_size=500,000,000 allgather_partitions=True allgather_bucket_size=500,000,000 overlap_comm=True load_from_fp32_weights=True elastic_checkpoint=False offload_param=DeepSpeedZeroOffloadParamConfig(device='none', nvme_path=None, buffer_count=5, buffer_size=100,000,000, max_in_cpu=1,000,000,000, pin_memory=False) offload_optimizer=None sub_group_size=1,000,000,000 cpu_offload_param=None cpu_offload_use_pin_memory=None cpu_offload=None prefetch_bucket_size=50,000,000 param_persistence_threshold=10000 model_persistence_threshold=sys.maxsize max_live_parameters=1,000,000,000 max_reuse_distance=1,000,000,000 gather_16bit_weights_on_model_save=False stage3_gather_fp16_weights_on_model_save=False ignore_unused_parameters=True legacy_stage1=False round_robin_gradients=False mics_shard_size=-1 mics_hierarchical_params_gather=False memory_efficient_linear=False
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] zero_enabled ................. True
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] zero_force_ds_cpu_optimizer .. True
[2023-07-16 15:08:43,566] [INFO] [config.py:964:print] zero_optimization_stage ...... 3
[2023-07-16 15:08:43,566] [INFO] [config.py:950:print_user_config] json = {
"train_batch_size": 256,
"train_micro_batch_size_per_gpu": 128,
"steps_per_print": 10,
"zero_optimization": {
"stage": 3,
"stage3_param_persistence_threshold": 1.000000e+04,
"offload_param": {
"device": "none"
},
"memory_efficient_linear": false
},
"fp16": {
"enabled": true
},
"gradient_clipping": 1.0,
"prescale_gradients": false,
"wall_clock_breakdown": false
}
[end] Initialized Reward Model [end] (duration: 2.29s)
***** Running training *****
Beginning of Epoch 1/1, Total Generation Batches 120
Traceback (most recent call last):
File "main.py", line 520, in
main()
File "main.py", line 428, in main
out = trainer.generate_experience(batch_prompt['prompt'],
File "/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/training/step3_rlhf_finetuning/ppo_trainer.py", line 98, in generate_experience
seq = self._generate_sequence(prompts, mask)
File "/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/training/step3_rlhf_finetuning/ppo_trainer.py", line 73, in _generate_sequence
seq = self.actor_model.module.generate(prompts,
File "/usr/local/lib/python3.8/dist-packages/deepspeed/runtime/hybrid_engine.py", line 207, in generate
self._fuse_lora(self.layer_params[layer_id], self.lora_params[layer_id])
File "/usr/local/lib/python3.8/dist-packages/deepspeed/runtime/hybrid_engine.py", line 137, in _fuse_lora
weight.data += lora_scaling * torch.matmul(lora_left_weight.t(), lora_right_weight.t())
RuntimeError: The size of tensor a (768) must match the size of tensor b (3072) at non-singleton dimension 0
Traceback (most recent call last):
File "main.py", line 520, in
main()
File "main.py", line 428, in main
out = trainer.generate_experience(batch_prompt['prompt'],
File "/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/training/step3_rlhf_finetuning/ppo_trainer.py", line 98, in generate_experience
seq = self._generate_sequence(prompts, mask)
File "/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/training/step3_rlhf_finetuning/ppo_trainer.py", line 73, in _generate_sequence
seq = self.actor_model.module.generate(prompts,
File "/usr/local/lib/python3.8/dist-packages/deepspeed/runtime/hybrid_engine.py", line 207, in generate
self._fuse_lora(self.layer_params[layer_id], self.lora_params[layer_id])
File "/usr/local/lib/python3.8/dist-packages/deepspeed/runtime/hybrid_engine.py", line 137, in _fuse_lora
weight.data += lora_scaling * torch.matmul(lora_left_weight.t(), lora_right_weight.t())
RuntimeError: The size of tensor a (768) must match the size of tensor b (3072) at non-singleton dimension 0

[2023-07-16 15:08:46,492] [INFO] [launch.py:315:sigkill_handler] Killing subprocess 7239
[2023-07-16 15:08:46,502] [INFO] [launch.py:315:sigkill_handler] Killing subprocess 7240
[2023-07-16 15:08:46,502] [ERROR] [launch.py:321:sigkill_handler] ['/usr/bin/python3', '-u', 'main.py', '--local_rank=1', '--data_path', 'Dahoas/rm-static', '--data_split', '2,4,4', '--actor_model_name_or_path', '/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/output/actor-models/125m', '--critic_model_name_or_path', '/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/output/reward-models/125m', '--num_padding_at_beginning', '1', '--per_device_train_batch_size', '128', '--per_device_mini_train_batch_size', '128', '--generation_batch_numbers', '1', '--ppo_epochs', '1', '--max_answer_seq_len', '256', '--max_prompt_seq_len', '256', '--actor_learning_rate', '5e-4', '--critic_learning_rate', '5e-6', '--actor_weight_decay', '0.1', '--critic_weight_decay', '0.1', '--num_train_epochs', '1', '--lr_scheduler_type', 'cosine', '--gradient_accumulation_steps', '1', '--num_warmup_steps', '100', '--deepspeed', '--seed', '1234', '--enable_hybrid_engine', '--inference_tp_size', '2', '--tp_gather_partition_size', '128', '--actor_zero_stage', '3', '--critic_zero_stage', '3', '--actor_gradient_checkpointing', '--disable_actor_dropout', '--actor_lora_dim', '128', '--actor_lora_module_name', 'decoder.layers.', '--output_dir', '/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat/output/step3-models/125m'] exits with return code = 1
---=== Finished Step 3 in 0:00:34 ===---
root@mz32-01:/home/amd01/llm_dev/DeepSpeedExamples/applications/DeepSpeed-Chat#

Contributor guide

No contributing guide indexed for this repository

First steps

  1. Read the whole issue, then the project's contributing guide.
  2. Comment on the issue to say you are picking it up — it saves two people doing the same work.
  3. Fork the repository and make your change on a branch.
  4. Open a pull request that references the issue number.

Research direction

Start with train.py --step 3 --deployment-type multi_node and the referenced training/step3_rlhf_finetuning/training_scripts/multi_node/run_125m.sh entry point. Reproduce the Step 3 run and trace the reported 768/3072 tensor-shape mismatch. Done means identifying the failing configuration or input and making the multi-node command complete successfully.

Written by the indexing model from the issue text.

Assessment

Tech stack
python
Domain
machine-learning
Issue type
Bug
Difficulty
4/5
Estimated time
3-5 days
Activity status
Stale
Clarity
Needs clarification
Newbie friendliness
25/100

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.