🗺️ AI 學習與考證地圖
Mochi 穿著棋士羽織與藍色腰帶,開心舉起圍棋冠軍獎盃
跟著棋士 Mochi,拆解 AlphaGo 的思考方式。

AlphaGo 思維引擎

視覺化解析 AI 如何在複雜策略遊戲中擊敗人類

1. 卷積神經網路 (直覺) 2. 蒙地卡羅樹搜尋 (推演) 3. 價值評估 (判斷)
Mochi 穿著青綠分析背心與金色頭帶,專注比對棋盤熱點與搜尋樹
先看直覺選點,再看搜尋與勝率評估。

棋盤狀態 (Input)

點擊按鈕開始分析

MCTS 搜索樹 (Process)

黑勝率高 50% 白勝率高
神經網路待命

AlphaGo 的大腦解密

剛剛的動畫展示了 AlphaGo 與傳統電腦最大的不同:它不再試圖暴力計算「所有」的可能性(圍棋的變化數比宇宙原子還多),而是像人類一樣擁有「棋感」。這歸功於兩大核心技術的結合:

Mochi 穿著珊瑚色偵察外套與深藍領巾,舉牌尋找高機率落點
策略網路像落子偵察員,先挑出值得考慮的位置。
👀 策略網路 (Policy Network)

這是一個深度卷積神經網路 (CNN)。它的作用是「直覺」。

就像動畫中的 藍色光暈,它透過學習千萬盤人類高手的棋譜,一眼就能看出哪裡是「好棋」,直接忽略 99% 的無效落點,大幅縮減搜索範圍。

Mochi 穿著薰衣草色開衫與端正深藍眼鏡,溫和評估盤面勝率
價值網路像盤面裁判,判斷現在局勢有多有利。
🧠 價值網路 (Value Network)

這是 AlphaGo 的判斷中樞。它的作用是「形勢判斷」。

傳統 AI 必須下到底才知道輸贏,AlphaGo 則能針對任何一個盤面給出一個 0~1 的勝率評分(如動畫中的勝率條)。這讓它能在中盤就精準判斷優劣。

🌳 蒙地卡羅樹搜尋 (MCTS)

有了上述兩個網路,AlphaGo 使用 MCTS 進行推演。它不需窮舉所有變化,而是專注於策略網路認為「高機率」的路徑,並用價值網路隨時評估結果。這使得它既有廣度(思考多種可能)又有深度(算得深)。

Mochi 穿著森林綠探險披風並帶著金色羅盤,興奮探索蒙地卡羅搜尋樹
MCTS 沿著有希望的分支深入探索,把算力用在關鍵路徑上。

🏆 成就與關鍵指標

Elo 3500+
Elo 等級分
遠超人類頂尖 (約3000分)
4 : 1
2016 擊敗世界傳奇
李世乭 (Lee Sedol)
World No.1
被授予職業九段
與「名譽棋聖」稱號

🚀 應用場景延伸

AlphaGo 的技術不僅限於圍棋,其核心的「深度強化學習」已應用於更多領域:

Mochi 穿著深藍研究先鋒外套與珊瑚色領結,開心展示遊戲、科學與能源應用
從遊戲到科學與能源,相同的決策思路能延伸到真實世界。

📝 iPAS 考點提醒

AlphaGo 是深度學習結合搜尋的里程碑,常作 iPAS 的 AI 應用案例。重點:它結合深度神經網路(策略網路選點、價值網路評估盤面)與蒙地卡羅樹搜尋(MCTS),並用自我對弈強化學習持續變強。易混點:它不是單純監督式學習,而是監督加強化加搜尋的綜合;評估靠勝率與 Elo 等級分。情境:展示 RL 與搜尋如何在巨大狀態空間(圍棋)勝過人類。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

AlphaGo 是什麼、為何重要?

DeepMind 的圍棋 AI,2016 年擊敗世界頂尖棋士;首次在狀態空間巨大的圍棋上超越人類,是 AI 里程碑。

AlphaGo 用了哪些技術?

結合深度神經網路(策略網路加價值網路)與蒙地卡羅樹搜尋(MCTS),並用監督學習(人類棋譜)加強化學習(自我對弈)訓練。

策略網路和價值網路各做什麼?

策略網路預測下一步該下哪(縮小搜尋範圍);價值網路評估當前盤面勝率(取代昂貴的完整模擬),兩者讓 MCTS 更高效。

AlphaGo 和 AlphaZero 差在哪?

AlphaGo 用人類棋譜起步;AlphaZero 完全不用人類資料、純從自我對弈與規則學起,且通用於圍棋、西洋棋、將棋。

為什麼圍棋這麼難?

盤面組合數比宇宙原子還多、無法暴力窮舉;需要直覺(神經網路)加推演(樹搜尋)結合,才能有效決策。

🧭 相關主題

← 返回 AI 學習與考證地圖