non self attention neural network
- Dominant language
- Jupyter Notebook
- Stars
- 2
- Forks
- 0
- PR merge metrics
- No merged PRs in 30d
Description
ChatGPT:
如果你指的是沒有 self-attention 的神經網路,那其實就是傳統上在 Transformer 出現以前的各種架構,或者一些專門任務的網路設計。
我可以分幾類幫你整理,讓你看到哪些是「non self-attention」的:
1️⃣ 序列處理(NLP / 時序)
-
RNN(Recurrent Neural Network)
-
按時間步長遞迴處理序列,每個步驟的輸入會依賴前一步的隱藏狀態。
-
缺點:長距離依賴捕捉困難(梯度消失/爆炸)。
-
-
LSTM(Long Short-Term Memory)
-
在 RNN 上加了 記憶單元 (cell state) 和閘門機制(input/forget/output gates),改善長距離依賴問題。
-
-
GRU(Gated Recurrent Unit)
-
LSTM 的簡化版本,計算量更小。
-
這些模型不會同時直接關注整個序列,而是透過遞迴「一步步傳遞」訊息,沒有 Transformer 的 self-attention 全局計算。
2️⃣ 圖像處理(CV)
-
CNN(Convolutional Neural Network)
-
核心是卷積層(convolution layer)+ pooling layer
-
卷積核只在局部區域滑動,因此它關注的只是局部空間資訊,而不是全域 self-attention。
-
-
ResNet、DenseNet、VGGNet
-
都是 CNN 變種,重點在深度與殘差連接,依然不依賴 self-attention。
-
3️⃣ 樹狀 / 圖結構資料
-
GCN(Graph Convolutional Network)
-
在圖節點與鄰居間進行訊息傳遞(message passing)。
-
雖然也有「attention-based GNN」,但 GCN 本身不是 self-attention。
-
-
Tree-LSTM
-
適合樹狀結構資料,訊息沿著樹結構傳遞,而不是全域關注。
-
4️⃣ 強化學習專用網路
-
DQN(Deep Q-Network)
-
用 CNN 或 MLP 來近似 Q 值函數,沒有使用 self-attention。
-
-
Actor-Critic、PPO、SAC
-
Policy 與 Value 網路常用 MLP 或 CNN,而不是 Transformer。
-
🔍 總結對比
架構 | 是否用 self-attention | 全域依賴捕捉方式
-- | -- | --
RNN / LSTM / GRU | ❌ | 時序遞迴傳遞
CNN / ResNet | ❌ | 局部卷積 + 多層堆疊
GCN | ❌(基本版) | 圖鄰居聚合
Transformer | ✅ | Multi-Head Self-Attention
如果你要的話,我可以幫你整理一個
「Self-Attention vs Non-Self-Attention 神經網路全家桶對照表」
包含圖示和用途,這樣一眼就能看出差別。
你要我幫你畫出來嗎?
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.