💡一句話定義
🎮互動:路由器怎麼分派 token
選一句話、按 ▶ 逐字路由(或把滑鼠移到某個字上),看每個 token 被送到 8 個專家裡的哪 top-k 個。切換 top-k,看啟用比例與計算量怎麼變。
🔀路由器(Gating)與 top-k
一個小網路,幫每個 token 對所有專家打分數。
只留分數最高的 k 個專家(常見 k=1 或 2),其餘不算。
被選中的專家輸出,依路由分數加權後相加,成為該 token 的結果。
🧮重點:參數量 ≠ 計算量
⚖️Dense vs MoE(Sparse)
| 面向 | Dense(傳統) | MoE(稀疏) |
|---|---|---|
| 每個 token | 用到整個 FFN 的全部參數 | 只用 top-k 個專家 |
| 總參數 | 受計算成本限制、較難放大 | 可塞很多專家、大幅放大 |
| 計算量 | 隨總參數等比上升 | 只跟 k 有關,幾乎不變 |
| 記憶體 | 相對省 | 所有專家都要存,較吃記憶體 |
| 訓練 | 單純 | 要處理負載平衡、較不穩 |
⚠️MoE 的代價
🌍真實世界的 MoE
✅自我檢測
Q1. MoE 是什麼?
Q2. 路由器(gating)做什麼?
Q3. 為什麼說「參數量 ≠ 計算量」?
Q4. MoE 有哪些代價?
Q5. 舉個真實的 MoE 模型?
🎯重點整理
- 本質:多個專家 FFN+路由器,每 token 只走 top-k。
- 賣點:參數量≠計算量——大容量、低計算。
- 路由:gating 打分 → 選 top-k → 加權合併輸出。
- 代價:負載不均、吃記憶體、訓練較不穩。
- 實例:Switch(top-1)、Mixtral 8×7B(top-2)。