allenai / allenai/hyperdecoders
Using Separate Hypernetworks for Each Transformer Layer
Offen
- Vorherrschende Sprache
- Python
- Sterne
- 14
- Forks
- 3
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
Hello,
I noticed in the paper that a single hypernetwork is used to generate parameters for all layers. Have you tried using a separate hypernetwork for each Transformer layer? Would this lead to a larger performance improvement?
Thanks!
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Bewertung
Dieses Issue wurde noch nicht bewertet.