OpenAI(GPT)、Google(Gemini)、Anthropic(Claude)的模型依推出日期回放:誰在領先、紀錄在哪一天被刷新。
截至資料截點 2026-10-08,各評測目前的最高分(點評測名稱可切換上方主圖):
僅呈現已收錄且可查核的模型,不宣稱涵蓋所有模型。
主圖每個發布群組只取一種設定:本評測中、目前已收錄且可顯示的最高分設定(列名旁的小字即該設定);這不是固定 max,也不代表各家算力相等。同分時依推理強度、來源主設定與 ID 決定。長條依分數排名,顯示截至該日的前幾名;同分時先推出者在前。上方三格與下方曲線是各家「截至該日」的最高分,所以只會持平或上升;某家推出較小的模型時,不會讓它的成績看起來倒退。
預設只用非估計分數。主圖略過缺測與未勾選的估計值,完整資料仍保留於模型明細;每個評測各自選取,不跨評測合併分數,不同評測分數不可直接互相比較。AA 綜合指數早期多為來源估計值,可在圖下方勾選「含來源估計值」,以斜紋長條標示,不視為實測。
播放時,每個有新模型的發布日會停留片刻,發布之間的空檔則快轉;動畫過渡不是每日測分,各模型使用目前快照的固定分數。
發布/可用日期決定進場時間,評測取得時間可能更晚。五筆日期已依官方可用時間校正;其他日期採 AA 目錄的發布群組日期,可能是公告、預覽或限制開放,不能一概視為公開正式推出。各推理設定共用群組日期,未逐一核對設定的可用日。
| 模型 | 發布/可用日期 | 分數/狀態 | 設定與日期依據 |
|---|
2026-10-08 補查 54 個 AA 公開模型頁面、71 個缺測格,未找到可安全補入同一設定與評測方法的新數值。缺值不代表模型從未被測試,也不代表其他地方絕對沒有成績。AA 的 116 格估計值原本就存在,開啟估計顯示並不是取得新的實測。
下列數字由模型供應商公布,題集、版本、推理設定或評判方法與 AA 主圖未能確認一致,保留作為補充。
| 官方版本/模型 | 評測與成績 | 條件差異與來源 |
|---|
GPQA 採 AA 的 198 題 Diamond 子集、四選一、pass@1。AA 將其移出綜合指數後仍有獨立報告,不可因部分欄位缺值就判斷未測試。其他推理設定的成績列於上方模型明細,主圖按目前評測選取最高分設定並明示;不同測試條件不合併。
此次為公開來源的有界補查;未建立帳號、API 金鑰或讀取付費資料,官方 API 文件的範例值也未作為最新成績。
看 benchmark 成績先問三件事:①測的是什麼能力(GPQA 是科學推理、HLE 是高難度學術問答、Arena 是人類偏好,不等於正確率);②測試條件是否相同(推理強度、能否用工具、題庫版本);③分數是實測還是估計。不同評測的分數不可直接比較;排行榜高分也不代表最適合你的任務,選模型還要一起看成本、延遲與資料安全。
把 OpenAI、Google、Anthropic 已收錄模型的評測分數,依模型推出日期排成時間軸回放。可切換 AA 綜合能力指數、GPQA Diamond、HLE、LiveBench、Arena 文字榜五種評測,看誰在領先、紀錄在哪一天被刷新。
不是。所有分數都來自同一份目前快照(AA 與 LiveBench 為 2026-10-08,Arena 為 2026-10-02 榜單),只是依推出日期回放,不代表當時的實測或排名。
三格與下方曲線是各家「截至當日的最高分」。這樣某家推出 Flash-Lite、nano 等較小的模型時,不會被誤看成整體退步;完整排名請看長條圖,按「顯示全部」可列出所有模型。
不行。GPQA Diamond 與 HLE 是答對率(%),LiveBench 是七類任務的平均分,AA 是綜合指數,Arena 是人類偏好評分(顯示 1000–1600 區間,不是百分比)。每個評測的尺度與條件不同,只能在同一個評測內比較。
缺測不等於零分,主圖直接略過,完整狀態列在「資料來源與模型明細」。AA 綜合能力指數的來源估計值預設隱藏,勾選「含來源估計值」後以斜紋長條標示,不視為實測。
Artificial Analysis 公開模型目錄與評測(AA 綜合指數、GPQA Diamond、HLE)、LiveBench 官方 2026-06-25 題庫版 CSV,以及 Arena 官方文字榜資料集(CC BY 4.0)。本站只做篩選、日期對映與視覺化,為獨立整理的比較工具,非官方網站。