ewdlop / ewdlop/NLPNote

non self attention neural network

Open
#253 2 comments 0 reactions 0 assignees View on GitHub
documentation
Dominant language
Jupyter Notebook
Stars
2
Forks
0
PR merge metrics
No merged PRs in 30d

Description

ChatGPT:

如果你指的是沒有 self-attention 的神經網路,那其實就是傳統上在 Transformer 出現以前的各種架構,或者一些專門任務的網路設計。

我可以分幾類幫你整理,讓你看到哪些是「non self-attention」的:




1️⃣ 序列處理(NLP / 時序)




  • RNN(Recurrent Neural Network)




    • 按時間步長遞迴處理序列,每個步驟的輸入會依賴前一步的隱藏狀態。




    • 缺點:長距離依賴捕捉困難(梯度消失/爆炸)。






  • LSTM(Long Short-Term Memory)




    • 在 RNN 上加了 記憶單元 (cell state) 和閘門機制(input/forget/output gates),改善長距離依賴問題。






  • GRU(Gated Recurrent Unit)




    • LSTM 的簡化版本,計算量更小。







這些模型不會同時直接關注整個序列,而是透過遞迴「一步步傳遞」訊息,沒有 Transformer 的 self-attention 全局計算。





2️⃣ 圖像處理(CV)




  • CNN(Convolutional Neural Network)




    • 核心是卷積層(convolution layer)+ pooling layer




    • 卷積核只在局部區域滑動,因此它關注的只是局部空間資訊,而不是全域 self-attention。






  • ResNet、DenseNet、VGGNet




    • 都是 CNN 變種,重點在深度與殘差連接,依然不依賴 self-attention。








3️⃣ 樹狀 / 圖結構資料




  • GCN(Graph Convolutional Network)




    • 在圖節點與鄰居間進行訊息傳遞(message passing)。




    • 雖然也有「attention-based GNN」,但 GCN 本身不是 self-attention。






  • Tree-LSTM




    • 適合樹狀結構資料,訊息沿著樹結構傳遞,而不是全域關注。








4️⃣ 強化學習專用網路




  • DQN(Deep Q-Network)




    • 用 CNN 或 MLP 來近似 Q 值函數,沒有使用 self-attention。






  • Actor-Critic、PPO、SAC




    • Policy 與 Value 網路常用 MLP 或 CNN,而不是 Transformer。








🔍 總結對比

架構 | 是否用 self-attention | 全域依賴捕捉方式
-- | -- | --
RNN / LSTM / GRU | ❌ | 時序遞迴傳遞
CNN / ResNet | ❌ | 局部卷積 + 多層堆疊
GCN | ❌(基本版) | 圖鄰居聚合
Transformer | ✅ | Multi-Head Self-Attention



如果你要的話,我可以幫你整理一個

「Self-Attention vs Non-Self-Attention 神經網路全家桶對照表」

包含圖示和用途,這樣一眼就能看出差別。


你要我幫你畫出來嗎?

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.