allenai / allenai/longformer

infer speed longformer vs bert

Offen
#183 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Python
Sterne
2.2k
Forks
285
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

I used bert-base-cased as the basic model and retrained my long-bert-512 .

long-bert settings:
attention windows (each layer is the same): 16
max_pos: 512

My sequence length is long enough. I think O(16\*512) window attention should be faster than O(512\*512) self-attention , however, I find that the inference time of long-bert-512 is more than bert-base-cased.

did I miss something?

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Bewertung

Dieses Issue wurde noch nicht bewertet.

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.