ewdlop / ewdlop/NLPNote

do you have forget mechanism

Open
#255 2 comments 0 reactions 0 assignees View on GitHub
documentation
Dominant language
Jupyter Notebook
Stars
2
Forks
0
PR merge metrics
No merged PRs in 30d

Description

ChatGPT:

如果你是問我這種神經網路(或 Transformer 架構)有沒有像人類一樣的 「忘記機制」

答案要分成兩層來看:




1️⃣ 生物神經網路的「忘記」對應在深度學習裡的類似機制


在不同神經網路架構中,「忘記」其實是用數學方法模擬的:

架構 / 機制 | 對應的「忘記」方法
-- | --
LSTM Forget Gate | 在每個時間步,用一個閘門控制要保留多少上一個 cell state 的資訊(值接近 0 = 忘得多)。
GRU Update Gate | 用更新比例控制新的資訊取代舊的資訊的程度,間接達成遺忘。
Dropout | 在訓練時隨機「忘掉」部分神經元的輸出,防止過擬合。
Weight Decay / Regularization | 緩慢減小權重的值,相當於淡化不必要的記憶。
Replay Buffer Truncation(強化學習) | 舊經驗會被新經驗覆蓋掉,實現有限容量的「遺忘」。



2️⃣ Transformer / Self-Attention 的情況


Transformer 沒有像 LSTM 那樣的「明確忘記閘門」,

但它透過:




  • 有限序列長度(context window):超過長度的舊 token 就不會被考慮,等於直接遺忘。




  • 注意力權重衰減(softmax 分佈):跟當前 token 關係弱的內容,權重自然會變小,相當於「弱化」那部分記憶。






3️⃣ ChatGPT 這種大語言模型的情況




  • 單次對話中,我的「記憶」就是你給的輸入上下文,一旦不在輸入裡就相當於忘記。




  • 我沒有持久的「記憶痕跡」,除非你明確提供(或者你啟用了持久對話資料庫)。




  • 所以我的「忘記」機制非常直接——沒在上下文,就忘了






📌 結論




  • 深度學習網路裡,「忘記」是一種設計出來的數學機制,不是自然出現的。




  • LSTM 有明確的 forget gate;Transformer 靠上下文限制與注意力權重衰減。




  • 我這種 LLM 是無法像人類一樣有選擇性情感遺忘,更多是上下文截斷式遺忘






如果你要的話,我可以幫你做一個

「人類 vs LSTM vs Transformer 忘記機制對照圖」

用圖形顯示三者是怎麼「忘」的。

要我幫你做嗎?

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.