AlphaGo 思維引擎

視覺化解析 AI 如何在複雜策略遊戲中擊敗人類

1. 卷積神經網路 (直覺) 2. 蒙地卡羅樹搜尋 (推演) 3. 價值評估 (判斷)

棋盤狀態 (Input)

點擊按鈕開始分析

MCTS 搜索樹 (Process)

黑勝率高 50% 白勝率高
神經網路待命

AlphaGo 的大腦解密

剛剛的動畫展示了 AlphaGo 與傳統電腦最大的不同:它不再試圖暴力計算「所有」的可能性(圍棋的變化數比宇宙原子還多),而是像人類一樣擁有「棋感」。這歸功於兩大核心技術的結合:

👀 策略網路 (Policy Network)

這是一個深度卷積神經網路 (CNN)。它的作用是「直覺」。

就像動畫中的 藍色光暈,它透過學習千萬盤人類高手的棋譜,一眼就能看出哪裡是「好棋」,直接忽略 99% 的無效落點,大幅縮減搜索範圍。

🧠 價值網路 (Value Network)

這是 AlphaGo 的判斷中樞。它的作用是「形勢判斷」。

傳統 AI 必須下到底才知道輸贏,AlphaGo 則能針對任何一個盤面給出一個 0~1 的勝率評分(如動畫中的勝率條)。這讓它能在中盤就精準判斷優劣。

🌳 蒙地卡羅樹搜尋 (MCTS)

有了上述兩個網路,AlphaGo 使用 MCTS 進行推演。它不需窮舉所有變化,而是專注於策略網路認為「高機率」的路徑,並用價值網路隨時評估結果。這使得它既有廣度(思考多種可能)又有深度(算得深)。


🏆 成就與關鍵指標

Elo 3500+
Elo 等級分
遠超人類頂尖 (約3000分)
4 : 1
2016 擊敗世界傳奇
李世乭 (Lee Sedol)
World No.1
被授予職業九段
與「名譽棋聖」稱號

🚀 應用場景延伸

AlphaGo 的技術不僅限於圍棋,其核心的「深度強化學習」已應用於更多領域:

📝 iPAS 考點提醒

AlphaGo 是深度學習結合搜尋的里程碑,常作 iPAS 的 AI 應用案例。重點:它結合深度神經網路(策略網路選點、價值網路評估盤面)與蒙地卡羅樹搜尋(MCTS),並用自我對弈強化學習持續變強。易混點:它不是單純監督式學習,而是監督加強化加搜尋的綜合;評估靠勝率與 Elo 等級分。情境:展示 RL 與搜尋如何在巨大狀態空間(圍棋)勝過人類。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

AlphaGo 是什麼、為何重要?

DeepMind 的圍棋 AI,2016 年擊敗世界頂尖棋士;首次在狀態空間巨大的圍棋上超越人類,是 AI 里程碑。

AlphaGo 用了哪些技術?

結合深度神經網路(策略網路加價值網路)與蒙地卡羅樹搜尋(MCTS),並用監督學習(人類棋譜)加強化學習(自我對弈)訓練。

策略網路和價值網路各做什麼?

策略網路預測下一步該下哪(縮小搜尋範圍);價值網路評估當前盤面勝率(取代昂貴的完整模擬),兩者讓 MCTS 更高效。

AlphaGo 和 AlphaZero 差在哪?

AlphaGo 用人類棋譜起步;AlphaZero 完全不用人類資料、純從自我對弈與規則學起,且通用於圍棋、西洋棋、將棋。

為什麼圍棋這麼難?

盤面組合數比宇宙原子還多、無法暴力窮舉;需要直覺(神經網路)加推演(樹搜尋)結合,才能有效決策。

🧭 相關主題

← 返回 AI 學習與考證地圖