視覺化解析 AI 如何在複雜策略遊戲中擊敗人類
剛剛的動畫展示了 AlphaGo 與傳統電腦最大的不同:它不再試圖暴力計算「所有」的可能性(圍棋的變化數比宇宙原子還多),而是像人類一樣擁有「棋感」。這歸功於兩大核心技術的結合:
這是一個深度卷積神經網路 (CNN)。它的作用是「直覺」。
就像動畫中的 藍色光暈,它透過學習千萬盤人類高手的棋譜,一眼就能看出哪裡是「好棋」,直接忽略 99% 的無效落點,大幅縮減搜索範圍。
這是 AlphaGo 的判斷中樞。它的作用是「形勢判斷」。
傳統 AI 必須下到底才知道輸贏,AlphaGo 則能針對任何一個盤面給出一個 0~1 的勝率評分(如動畫中的勝率條)。這讓它能在中盤就精準判斷優劣。
有了上述兩個網路,AlphaGo 使用 MCTS 進行推演。它不需窮舉所有變化,而是專注於策略網路認為「高機率」的路徑,並用價值網路隨時評估結果。這使得它既有廣度(思考多種可能)又有深度(算得深)。
AlphaGo 的技術不僅限於圍棋,其核心的「深度強化學習」已應用於更多領域:
AlphaGo 是深度學習結合搜尋的里程碑,常作 iPAS 的 AI 應用案例。重點:它結合深度神經網路(策略網路選點、價值網路評估盤面)與蒙地卡羅樹搜尋(MCTS),並用自我對弈強化學習持續變強。易混點:它不是單純監督式學習,而是監督加強化加搜尋的綜合;評估靠勝率與 Elo 等級分。情境:展示 RL 與搜尋如何在巨大狀態空間(圍棋)勝過人類。
想練情境題與詳解 → AI 學習與考證地圖
DeepMind 的圍棋 AI,2016 年擊敗世界頂尖棋士;首次在狀態空間巨大的圍棋上超越人類,是 AI 里程碑。
結合深度神經網路(策略網路加價值網路)與蒙地卡羅樹搜尋(MCTS),並用監督學習(人類棋譜)加強化學習(自我對弈)訓練。
策略網路預測下一步該下哪(縮小搜尋範圍);價值網路評估當前盤面勝率(取代昂貴的完整模擬),兩者讓 MCTS 更高效。
AlphaGo 用人類棋譜起步;AlphaZero 完全不用人類資料、純從自我對弈與規則學起,且通用於圍棋、西洋棋、將棋。
盤面組合數比宇宙原子還多、無法暴力窮舉;需要直覺(神經網路)加推演(樹搜尋)結合,才能有效決策。