DAMO-NLP-SG / DAMO-NLP-SG/VideoLLaMA2

why does transformer version matter so much ?

Open
#157 0 comments 0 reactions 0 assignees View on GitHub
Dominant language
Python
Stars
1.3k
Forks
90
PR merge metrics
No merged PRs in 30d

Description

I finetune the model on my custom video QA data with official instruactions but with different transformer version.

for transformer 4.40.0, I got following log:
```
{'loss': 1.5214, 'grad_norm': 82.93941089686794, 'learning_rate': 1.4285714285714286e-06, 'epoch': 0.01}
{'loss': 1.5197, 'grad_norm': 91.43226300518772, 'learning_rate': 2.8571428571428573e-06, 'epoch': 0.01}
{'loss': 1.3843, 'grad_norm': 117.94924912080238, 'learning_rate': 4.2857142857142855e-06, 'epoch': 0.02}
{'loss': 0.5067, 'grad_norm': 31.150019053226128, 'learning_rate': 5.7142857142857145e-06, 'epoch': 0.03}
{'loss': 0.4281, 'grad_norm': 38.64170903808288, 'learning_rate': 7.1428571428571436e-06, 'epoch': 0.03}
{'loss': 0.3751, 'grad_norm': 19.90264880071217, 'learning_rate': 8.571428571428571e-06, 'epoch': 0.04}
{'loss': 0.6321, 'grad_norm': 37.228204250367746, 'learning_rate': 1e-05, 'epoch': 0.05}
{'loss': 0.3688, 'grad_norm': 20.387932031811747, 'learning_rate': 1.1428571428571429e-05, 'epoch': 0.05}
{'loss': 0.3486, 'grad_norm': 14.012076077393262, 'learning_rate': 1.2857142857142859e-05, 'epoch': 0.06}
{'loss': 0.3496, 'grad_norm': 22.349105568435977, 'learning_rate': 1.4285714285714287e-05, 'epoch': 0.07}
{'loss': 0.291, 'grad_norm': 9.85790174114647, 'learning_rate': 1.5714285714285715e-05, 'epoch': 0.08}
{'loss': 0.3098, 'grad_norm': 13.538180247193864, 'learning_rate': 1.7142857142857142e-05, 'epoch': 0.08}
{'loss': 0.271, 'grad_norm': 6.623439021748574, 'learning_rate': 1.8571428571428575e-05, 'epoch': 0.09}
{'loss': 0.3104, 'grad_norm': 9.930709963160833, 'learning_rate': 2e-05, 'epoch': 0.1}
{'loss': 0.2846, 'grad_norm': 9.21824734784664, 'learning_rate': 1.9999721578003894e-05, 'epoch': 0.1}
{'loss': 0.2579, 'grad_norm': 3.8729149583560787, 'learning_rate': 1.9998886327519337e-05, 'epoch': 0.11}
{'loss': 0.2576, 'grad_norm': 11.994079935491763, 'learning_rate': 1.999749429505675e-05, 'epoch': 0.12}
{'loss': 0.2626, 'grad_norm': 7.663359078941963, 'learning_rate': 1.9995545558130624e-05, 'epoch': 0.12}
{'loss': 0.2695, 'grad_norm': 8.298424248135397, 'learning_rate': 1.9993040225255205e-05, 'epoch': 0.13}
{'loss': 0.2609, 'grad_norm': 8.433909957307737, 'learning_rate': 1.998997843593845e-05, 'epoch': 0.14}
{'loss': 0.2538, 'grad_norm': 4.970478349847721, 'learning_rate': 1.9986360360674252e-05, 'epoch': 0.14}
{'loss': 0.2475, 'grad_norm': 7.694188984657519, 'learning_rate': 1.9982186200932964e-05, 'epoch': 0.15}
{'loss': 0.2111, 'grad_norm': 7.587000402350441, 'learning_rate': 1.9977456189150164e-05, 'epoch': 0.16}
{'loss': 0.2173, 'grad_norm': 2.562863972939241, 'learning_rate': 1.9972170588713715e-05, 'epoch': 0.16}
{'loss': 0.2248, 'grad_norm': 7.412999978717785, 'learning_rate': 1.9966329693949098e-05, 'epoch': 0.17}
{'loss': 0.2359, 'grad_norm': 6.294411739373039, 'learning_rate': 1.9959933830103034e-05, 'epoch': 0.18}
{'loss': 0.2016, 'grad_norm': 2.986197414014209, 'learning_rate': 1.9952983353325358e-05, 'epoch': 0.19}
{'loss': 0.2366, 'grad_norm': 10.212039448740871, 'learning_rate': 1.9945478650649192e-05, 'epoch': 0.19}
{'loss': 0.2391, 'grad_norm': 6.63284240611023, 'learning_rate': 1.9937420139969397e-05, 'epoch': 0.2}
{'loss': 0.2205, 'grad_norm': 3.342664603311147, 'learning_rate': 1.9928808270019297e-05, 'epoch': 0.21}
{'loss': 0.2059, 'grad_norm': 3.491255143882172, 'learning_rate': 1.9919643520345698e-05, 'epoch': 0.21}
{'loss': 0.2227, 'grad_norm': 5.060304447440421, 'learning_rate': 1.990992640128218e-05, 'epoch': 0.22}
{'loss': 0.2072, 'grad_norm': 5.249886429144937, 'learning_rate': 1.989965745392068e-05, 'epoch': 0.23}
{'loss': 0.2249, 'grad_norm': 5.0116139824547, 'learning_rate': 1.988883725008136e-05, 'epoch': 0.23}
{'loss': 0.2402, 'grad_norm': 7.49526130721432, 'learning_rate': 1.9877466392280773e-05, 'epoch': 0.24}
{'loss': 0.2139, 'grad_norm': 5.121455710993479, 'learning_rate': 1.9865545513698304e-05, 'epoch': 0.25}
{'loss': 0.2285, 'grad_norm': 7.0491027554118215, 'learning_rate': 1.9853075278140913e-05, 'epoch': 0.25}
{'loss': 0.2308, 'grad_norm': 8.745161385585831, 'learning_rate': 1.984005638000618e-05, 'epoch': 0.26}
{'loss': 0.2207, 'grad_norm': 5.79068353129325, 'learning_rate': 1.9826489544243623e-05, 'epoch': 0.27}
{'loss': 0.232, 'grad_norm': 4.0660758101351515, 'learning_rate': 1.981237552631434e-05, 'epoch': 0.27}
{'loss': 0.2103, 'grad_norm': 4.886926156622297, 'learning_rate': 1.9797715112148937e-05, 'epoch': 0.28}
{'loss': 0.2069, 'grad_norm': 4.593271997244745, 'learning_rate': 1.9782509118103773e-05, 'epoch': 0.29}
{'loss': 0.243, 'grad_norm': 9.410652998034738, 'learning_rate': 1.9766758390915494e-05, 'epoch': 0.3}
{'loss': 0.2004, 'grad_norm': 3.9250148755618044, 'learning_rate': 1.9750463807653873e-05, 'epoch': 0.3}
{'loss': 0.2031, 'grad_norm': 7.699381474571478, 'learning_rate': 1.9733626275673e-05, 'epoch': 0.31}
{'loss': 0.2097, 'grad_norm': 5.702812345917418, 'learning_rate': 1.9716246732560715e-05, 'epoch': 0.32}
{'loss': 0.2134, 'grad_norm': 2.2059257213570005, 'learning_rate': 1.9698326146086446e-05, 'epoch': 0.32}
{'loss': 0.2085, 'grad_norm': 2.3938004480379416, 'learning_rate': 1.967986551414728e-05, 'epoch': 0.33}
{'loss': 0.204, 'grad_norm': 6.670542502945772, 'learning_rate': 1.9660865864712413e-05, 'epoch': 0.34}
{'loss': 0.1881, 'grad_norm': 5.254492171147148, 'learning_rate': 1.9641328255765916e-05, 'epoch': 0.34}
{'loss': 0.1966, 'grad_norm': 3.5948549815571074, 'learning_rate': 1.96212537752478e-05, 'epoch': 0.35}
{'loss': 0.2225, 'grad_norm': 6.251718505693831, 'learning_rate': 1.9600643540993453e-05, 'epoch': 0.36}
{'loss': 0.2245, 'grad_norm': 4.736248865547871, 'learning_rate': 1.9579498700671386e-05, 'epoch': 0.36}
{'loss': 0.1919, 'grad_norm': 5.449024350911763, 'learning_rate': 1.9557820431719333e-05, 'epoch': 0.37}
{'loss': 0.1946, 'grad_norm': 6.838259929427429, 'learning_rate': 1.9535609941278676e-05, 'epoch': 0.38}
{'loss': 0.2065, 'grad_norm': 5.3342146066073, 'learning_rate': 1.9512868466127232e-05, 'epoch': 0.38}
{'loss': 0.2106, 'grad_norm': 2.956260296022285, 'learning_rate': 1.9489597272610377e-05, 'epoch': 0.39}
{'loss': 0.2134, 'grad_norm': 4.1457946231735985, 'learning_rate': 1.9465797656570546e-05, 'epoch': 0.4}
{'loss': 0.2017, 'grad_norm': 4.28675579008748, 'learning_rate': 1.944147094327506e-05, 'epoch': 0.4}
{'loss': 0.2015, 'grad_norm': 3.4592647705153334, 'learning_rate': 1.9416618487342333e-05, 'epoch': 0.41}
{'loss': 0.207, 'grad_norm': 3.0143687055753503, 'learning_rate': 1.9391241672666438e-05, 'epoch': 0.42}
{'loss': 0.2342, 'grad_norm': 5.23016184240312, 'learning_rate': 1.936534191234006e-05, 'epoch': 0.43}
{'loss': 0.2074, 'grad_norm': 7.246031667589182, 'learning_rate': 1.9338920648575798e-05, 'epoch': 0.43}
{'loss': 0.1972, 'grad_norm': 4.47206435336619, 'learning_rate': 1.9311979352625837e-05, 'epoch': 0.44}
{'loss': 0.1831, 'grad_norm': 2.2220328241966194, 'learning_rate': 1.928451952470007e-05, 'epoch': 0.45}
{'loss': 0.2001, 'grad_norm': 6.3749345151693495, 'learning_rate': 1.9256542693882505e-05, 'epoch': 0.45}
{'loss': 0.2223, 'grad_norm': 7.362670378582657, 'learning_rate': 1.922805041804617e-05, 'epoch': 0.46}
{'loss': 0.1977, 'grad_norm': 3.909418490210292, 'learning_rate': 1.919904428376632e-05, 'epoch': 0.47}
{'loss': 0.1819, 'grad_norm': 1.4841476632778448, 'learning_rate': 1.916952590623212e-05, 'epoch': 0.47}
{'loss': 0.2047, 'grad_norm': 7.934872218427543, 'learning_rate': 1.9139496929156685e-05, 'epoch': 0.48}
{'loss': 0.203, 'grad_norm': 6.136707453479182, 'learning_rate': 1.910895902468557e-05, 'epoch': 0.49}
{'loss': 0.1942, 'grad_norm': 2.641066253106522, 'learning_rate': 1.907791389330363e-05, 'epoch': 0.49}
{'loss': 0.1988, 'grad_norm': 5.119867046276796, 'learning_rate': 1.904636326374036e-05, 'epoch': 0.5}
```

but with transformers==4.46 and tokenizers==0.20, I got following log
```
{'loss': 6.0957, 'grad_norm': 326.41692967255995, 'learning_rate': 1.4285714285714286e-06, 'epoch': 0.01}
{'loss': 6.0873, 'grad_norm': 362.4793134273326, 'learning_rate': 2.8571428571428573e-06, 'epoch': 0.01}
{'loss': 5.5501, 'grad_norm': 469.7133286045745, 'learning_rate': 4.2857142857142855e-06, 'epoch': 0.02}
{'loss': 2.0496, 'grad_norm': 128.57565055585513, 'learning_rate': 5.7142857142857145e-06, 'epoch': 0.03}
{'loss': 1.7157, 'grad_norm': 154.69659445182975, 'learning_rate': 7.1428571428571436e-06, 'epoch': 0.03}
{'loss': 1.5032, 'grad_norm': 80.56183461251769, 'learning_rate': 8.571428571428571e-06, 'epoch': 0.04}
{'loss': 2.4526, 'grad_norm': 144.80782611921217, 'learning_rate': 1e-05, 'epoch': 0.05}
{'loss': 1.491, 'grad_norm': 88.87223809082963, 'learning_rate': 1.1428571428571429e-05, 'epoch': 0.05}
{'loss': 1.3833, 'grad_norm': 53.34885973346151, 'learning_rate': 1.2857142857142859e-05, 'epoch': 0.06}
{'loss': 1.39, 'grad_norm': 88.53154954883871, 'learning_rate': 1.4285714285714287e-05, 'epoch': 0.07}
{'loss': 1.1586, 'grad_norm': 37.69262507317621, 'learning_rate': 1.5714285714285715e-05, 'epoch': 0.08}
{'loss': 1.2328, 'grad_norm': 53.89516384903442, 'learning_rate': 1.7142857142857142e-05, 'epoch': 0.08}
{'loss': 1.0825, 'grad_norm': 25.499290249923103, 'learning_rate': 1.8571428571428575e-05, 'epoch': 0.09}
{'loss': 1.2386, 'grad_norm': 39.75273167913203, 'learning_rate': 2e-05, 'epoch': 0.1}
{'loss': 1.1208, 'grad_norm': 31.84166673799887, 'learning_rate': 1.9999721578003894e-05, 'epoch': 0.1}
{'loss': 1.0301, 'grad_norm': 18.10387027655386, 'learning_rate': 1.9998886327519337e-05, 'epoch': 0.11}
{'loss': 1.0214, 'grad_norm': 46.415082496921244, 'learning_rate': 1.999749429505675e-05, 'epoch': 0.12}
{'loss': 1.0243, 'grad_norm': 26.172819371918056, 'learning_rate': 1.9995545558130624e-05, 'epoch': 0.12}
{'loss': 1.0618, 'grad_norm': 32.8178467266883, 'learning_rate': 1.9993040225255205e-05, 'epoch': 0.13}
{'loss': 1.0318, 'grad_norm': 32.451023626907336, 'learning_rate': 1.998997843593845e-05, 'epoch': 0.14}
{'loss': 1.0023, 'grad_norm': 17.84475523940106, 'learning_rate': 1.9986360360674252e-05, 'epoch': 0.14}
{'loss': 0.9969, 'grad_norm': 32.75048472420368, 'learning_rate': 1.9982186200932964e-05, 'epoch': 0.15}
{'loss': 0.8495, 'grad_norm': 32.48311045885641, 'learning_rate': 1.9977456189150164e-05, 'epoch': 0.16}
{'loss': 0.8677, 'grad_norm': 11.444676114248589, 'learning_rate': 1.9972170588713715e-05, 'epoch': 0.16}
{'loss': 0.8878, 'grad_norm': 29.4654509958042, 'learning_rate': 1.9966329693949098e-05, 'epoch': 0.17}
{'loss': 0.9476, 'grad_norm': 26.616862570368433, 'learning_rate': 1.9959933830103034e-05, 'epoch': 0.18}
{'loss': 0.821, 'grad_norm': 15.190232138539152, 'learning_rate': 1.9952983353325358e-05, 'epoch': 0.19}
{'loss': 0.9351, 'grad_norm': 36.65492430970284, 'learning_rate': 1.9945478650649192e-05, 'epoch': 0.19}
{'loss': 0.9148, 'grad_norm': 17.26496190829816, 'learning_rate': 1.9937420139969397e-05, 'epoch': 0.2}
{'loss': 0.8576, 'grad_norm': 10.882931442038617, 'learning_rate': 1.9928808270019297e-05, 'epoch': 0.21}
{'loss': 0.7812, 'grad_norm': 10.392507378853479, 'learning_rate': 1.9919643520345698e-05, 'epoch': 0.21}
{'loss': 0.8991, 'grad_norm': 22.1984649213213, 'learning_rate': 1.990992640128218e-05, 'epoch': 0.22}
{'loss': 0.7835, 'grad_norm': 17.513125527491848, 'learning_rate': 1.989965745392068e-05, 'epoch': 0.23}
{'loss': 0.9628, 'grad_norm': 238.8265212960502, 'learning_rate': 1.988883725008136e-05, 'epoch': 0.23}
{'loss': 0.915, 'grad_norm': 21.387955288481443, 'learning_rate': 1.9877466392280773e-05, 'epoch': 0.24}
{'loss': 0.8058, 'grad_norm': 14.83367719159884, 'learning_rate': 1.9865545513698304e-05, 'epoch': 0.25}
{'loss': 0.8877, 'grad_norm': 23.15792291999831, 'learning_rate': 1.9853075278140913e-05, 'epoch': 0.25}
{'loss': 0.8855, 'grad_norm': 22.80492807555942, 'learning_rate': 1.984005638000618e-05, 'epoch': 0.26}
{'loss': 0.8502, 'grad_norm': 16.096364538988734, 'learning_rate': 1.9826489544243623e-05, 'epoch': 0.27}
{'loss': 0.9165, 'grad_norm': 16.736536997061116, 'learning_rate': 1.981237552631434e-05, 'epoch': 0.27}
{'loss': 0.8233, 'grad_norm': 17.02372629853142, 'learning_rate': 1.9797715112148937e-05, 'epoch': 0.28}
{'loss': 0.8173, 'grad_norm': 16.25679618028616, 'learning_rate': 1.9782509118103773e-05, 'epoch': 0.29}
{'loss': 0.9026, 'grad_norm': 25.641003206555336, 'learning_rate': 1.9766758390915494e-05, 'epoch': 0.3}
{'loss': 0.7975, 'grad_norm': 14.984222585433809, 'learning_rate': 1.9750463807653873e-05, 'epoch': 0.3}
{'loss': 0.8157, 'grad_norm': 33.55068311038894, 'learning_rate': 1.9733626275673e-05, 'epoch': 0.31}
{'loss': 0.8181, 'grad_norm': 15.181503223362837, 'learning_rate': 1.9716246732560715e-05, 'epoch': 0.32}
```

Contributor guide

No contributing guide indexed for this repository

Research direction

No source files or tests are named. Start by reproducing the reported fine-tuning run with transformers 4.40.0, then compare it with transformers 4.46 and tokenizers 0.20 using the same custom video QA data and settings. Done means identifying the cause of the differing loss and gradient logs or documenting the relevant compatibility issue.

Written by the indexing model from the issue text.

Assessment

Tech stack
python
Domain
ai, machine-learning
Issue type
Bug
Difficulty
4/5
Estimated time
3-5 days
Activity status
Stale
Clarity
Needs clarification
Newbie friendliness
25/100

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.