棋類 AI 沒有「準確率」——它用對局說話。
Elo 把實力變成一個可比較的分數,分數差距能直接換算成預期勝率。
圍棋 AI 不像分類有「準確率」可看。衡量它強不強,靠的是對局表現:勝率(跟對手下贏的比例)與 Elo 等級分(西洋棋沿用的相對實力分數)。AlphaGo 透過自我對弈(self-play)不斷跟過去的自己對戰,Elo 一路飆升,最後超越人類世界冠軍。
自我對弈一代代變強,Elo 持續上升。
跟特定對手對戰,贏了幾成。
跟過去版本的自己對戰,產生訓練資料。
Elo 的精髓:兩位棋手的分數差距,可以直接換算成預期勝率。拖動雙方 Elo,看勝率怎麼變——差 400 分,強者約有 91% 勝率。這也是判斷 AI 是否「超越人類」的依據。
參考:人類頂尖棋手約 Elo 3600~3700,AlphaGo Zero 超過 5000。差距每多 ~400 分,勝率就往 90% 以上靠。
Elo 等級分:相對實力的標準刻度,可跨對手比較。勝率:對特定對手的直接成績。自我對弈進步曲線:看 Elo 是否仍在上升、有無收斂。
強化學習代理人(如 AlphaGo)的評估不靠準確率,iPAS RL 考點。重點:看對弈表現——勝率、Elo 等級分(與其他對手比較)、累積回報的學習曲線。易混點:RL 環境隨機、單局運氣大,需大量對局取平均;自我對弈(self-play)可能一起走偏,要對外部固定強對手測試。情境:評估遊戲 AI、棋類 AI 是否真的變強。
想練情境題與詳解 → AI 學習與考證地圖
主要看對弈表現——勝率、Elo 等級分(與其他對手或版本比較),以及在標準對手上的成績,而非單一準確率。
一種相對實力評分:贏強者加分多、輸弱者扣分多;用大量對局估出每個代理人的相對強度,常用於棋類與遊戲 AI。
看累積獎勵與回報隨訓練的學習曲線、勝率提升、與舊版自我對弈的勝率;穩定上升代表在學習。
環境隨機、策略互相影響、單局運氣成分大;需大量對局取平均、控制對手、注意過擬合到特定對手。
只跟自己比可能一起走偏;要對外部基準或固定強對手測試,確認是真的變強而非鑽自己的漏洞。