Elo · Win-Rate · Self-Play

AlphaGo 的評估指標

Elo 等級分 × 勝率

棋類 AI 沒有「準確率」——它用對局說話。
Elo 把實力變成一個可比較的分數,分數差距能直接換算成預期勝率。

勝率 = 1 / (1 + 10^(−ΔElo/400))
01 — 白話直覺

怎麼衡量一個棋類 AI 有多強?

圍棋 AI 不像分類有「準確率」可看。衡量它強不強,靠的是對局表現勝率(跟對手下贏的比例)與 Elo 等級分(西洋棋沿用的相對實力分數)。AlphaGo 透過自我對弈(self-play)不斷跟過去的自己對戰,Elo 一路飆升,最後超越人類世界冠軍。

Elo 曲線
越爬越高

自我對弈一代代變強,Elo 持續上升。

勝率
對局成績

跟特定對手對戰,贏了幾成。

自我對弈
Self-Play

跟過去版本的自己對戰,產生訓練資料。

02 — 核心互動

Elo 差距如何換算成勝率?

Elo 的精髓:兩位棋手的分數差距,可以直接換算成預期勝率。拖動雙方 Elo,看勝率怎麼變——差 400 分,強者約有 91% 勝率。這也是判斷 AI 是否「超越人類」的依據。

3600
3200
分數差
AI 預期勝率
評語

參考:人類頂尖棋手約 Elo 3600~3700,AlphaGo Zero 超過 5000。差距每多 ~400 分,勝率就往 90% 以上靠。

勝率 = 1 / (1 + 10^((Elo對手 − Elo我) / 400))
03 — 指標一覽

棋類 / 對弈 AI 怎麼評估?

Elo 等級分:相對實力的標準刻度,可跨對手比較。勝率:對特定對手的直接成績。自我對弈進步曲線:看 Elo 是否仍在上升、有無收斂。

優點

  • Elo 提供跨對手、可累積的實力刻度
  • 勝率直觀,直接對應「贏不贏」
  • 自我對弈不需人類棋譜也能無限變強

缺點 / 限制

  • Elo 是相對值,需有對手池才有意義
  • 可能出現「剋星」循環(A贏B、B贏C、C贏A)
  • 自我對弈可能陷入自我封閉的盲點

典型應用場景

♟️
棋類 AI
圍棋、西洋棋、將棋的實力評比
🏆
電競 AI
OpenAI Five、AlphaStar 的天梯分
🆚
模型對戰
用 Elo 排行不同模型版本

📝 iPAS 考點提醒

強化學習代理人(如 AlphaGo)的評估不靠準確率,iPAS RL 考點。重點:看對弈表現——勝率、Elo 等級分(與其他對手比較)、累積回報的學習曲線。易混點:RL 環境隨機、單局運氣大,需大量對局取平均;自我對弈(self-play)可能一起走偏,要對外部固定強對手測試。情境:評估遊戲 AI、棋類 AI 是否真的變強。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

怎麼評估像 AlphaGo 這種 RL 代理人?

主要看對弈表現——勝率、Elo 等級分(與其他對手或版本比較),以及在標準對手上的成績,而非單一準確率。

Elo 等級分是什麼?

一種相對實力評分:贏強者加分多、輸弱者扣分多;用大量對局估出每個代理人的相對強度,常用於棋類與遊戲 AI。

RL 訓練過程怎麼看進步?

看累積獎勵與回報隨訓練的學習曲線、勝率提升、與舊版自我對弈的勝率;穩定上升代表在學習。

為什麼 RL 評估特別難?

環境隨機、策略互相影響、單局運氣成分大;需大量對局取平均、控制對手、注意過擬合到特定對手。

自我對弈(self-play)評估要注意什麼?

只跟自己比可能一起走偏;要對外部基準或固定強對手測試,確認是真的變強而非鑽自己的漏洞。

🧭 相關主題

← 返回 AI 學習與考證地圖