allenai / allenai/longformer

Code to generate longformer-base-4096

Ouverte
#84 5 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
Python
Étoiles
2.2k
Forks
285
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

Hello,
I wonder if you have the code that generated [this pre-trained model](https://huggingface.co/allenai/longformer-base-4096#).
(or [longformer-large-4096-finetuned-triviaqa](https://huggingface.co/allenai/longformer-large-4096-finetuned-triviaqa))

I followed the steps in [your notebook](https://github.com/allenai/longformer/blob/master/scripts/convert_model_to_long.ipynb) and updated the[ triviaqa.py](https://github.com/allenai/longformer/blob/40377ddc43d5d446385503dd8255f7e75ded7811/scripts/triviaqa.py) file; it is attached.

However, I get some miss match dimension in linear operations as follow:
Traceback (most recent call last):
File "/home/arashari/longformer_original/scripts/triviaqa.py", line 760, in
main(args)
File "/home/arashari/longformer_original/scripts/triviaqa.py", line 752, in main
trainer.fit(model)
File "/usr/local/lib/python3.6/dist-packages/pytorch_lightning/trainer/trainer.py", line 979, in fit
self.single_gpu_train(model)
File "/usr/local/lib/python3.6/dist-packages/pytorch_lightning/trainer/distrib_parts.py", line 185, in single_gpu_train
self.run_pretrain_routine(model)
File "/usr/local/lib/python3.6/dist-packages/pytorch_lightning/trainer/trainer.py", line 1139, in run_pretrain_routine
False)
File "/usr/local/lib/python3.6/dist-packages/pytorch_lightning/trainer/evaluation_loop.py", line 293, in _evaluate
output = self.evaluation_forward(model, batch, batch_idx, dataloader_idx, test_mode)
File "/usr/local/lib/python3.6/dist-packages/pytorch_lightning/trainer/evaluation_loop.py", line 485, in evaluation_forward
output = model.validation_step(*args)
File "/home/arashari/longformer_original/scripts/triviaqa.py", line 440, in validation_step
output = self.forward(input_ids, input_mask, segment_ids, subword_starts, subword_ends)
File "/usr/local/lib/python3.6/dist-packages/apex/amp/_initialize.py", line 197, in new_fwd
**applier(kwargs, input_caster))
File "/home/arashari/longformer_original/scripts/triviaqa.py", line 362, in forward
logits = self.qa_outputs(sequence_output)
File "/usr/local/lib/python3.6/dist-packages/torch/nn/modules/module.py", line 550, in __call__
result = self.forward(*input, **kwargs)
File "/usr/local/lib/python3.6/dist-packages/torch/nn/modules/linear.py", line 87, in forward
return F.linear(input, self.weight, self.bias)
File "/usr/local/lib/python3.6/dist-packages/torch/nn/functional.py", line 1610, in linear
ret = torch.addmm(bias, input, weight.t())
RuntimeError: size mismatch, m1: [1 x 2376], m2: [768 x 2] at /pytorch/aten/src/THC/generic/THCTensorMathBlas.cu:283

Run time arguments are:
python -m triviaqa \
--train_dataset output/squad-wikipedia-train-4096.json \
--dev_dataset squad-wikipedia-dev-4096.json \
--gpus 0,1,2,3,4,5,6,7 --batch_size 1 --num_workers 4 \
--lr 0.00003 --warmup 1000 --epochs 4 --max_seq_len 4096 --doc_stride -1 \
--save_prefix data/output/ \
--seed 4321 \
--attention_mode 'sliding_chunks' \
--model_path roberta-base

Any comment/suggestion on this?

Further, I tried the [run_squad](https://github.com/huggingface/transformers/tree/master/examples/question-answering) from huggingface and seems like the converter (triviaqa to squad) does not add title; it is not compatible with this example.
For example it is complaining about fields such as "title".
Are you aware of any other converter?
[triviaqa.txt](https://github.com/allenai/longformer/files/4887535/triviaqa.txt)

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Évaluation

Cette issue n'a pas encore été évaluée.

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.