把 Google 的開放模型 Gemma 4 直接放進手機,不連網、不上雲,在 iPhone 17 Pro Max 與 Pixel 10 上用同一段題目各跑 8 種組合,看 CPU、GPU、模型大小與 MTP 加速各自的差別,並整理出看懂這份數據需要的名詞。
GPU 全面勝出。E2B 用 GPU 讀題 1.4 秒、打字約 60 字/秒;用 CPU 是 2.9 秒、39 字/秒。讀題快約 2 倍、打字快約 1.5 倍。
GPU 讀題快,打字反而比 CPU 慢。E2B 用 GPU 讀題 1.5 秒(CPU 6.1 秒),但打字只有 14.6 字/秒(CPU 22.9 字/秒)。回答 150 字時兩者總時間差不多。
讀題靠算力、打字靠記憶體頻寬。讀題可以平行運算,GPU 在兩台都大幅加速;打字每個字都要把整個模型讀一遍,快慢取決於各手機的記憶體與引擎最佳化,所以結果不同。
MTP 加速這次沒有幫上忙。iPhone 搭 GPU 只快約 2%,其他組合大多變慢。
GPU 第一次要先編譯。Pixel 10 第一次載入要 26~35 秒,iPhone 約 8~9 秒;之後走快取,只要幾秒。
每次回答長度不同(144~412 字),所以比較時看「每秒字數」,不要直接比總秒數。
括號內是該次回答的字數。「載入」只在切換組合後第一次出現。
黃底=該手機「150 字估算」最短的組合。150 字估算=讀題秒數+150 ÷ 打字速度,是推算值。
單位:秒。讀題+打字=實測總計-載入。字數是該次回答實際產生的中文字數。
在 Pixel 10 上,E4B 的「實測總計」有時比 E2B 還短,看起來像大模型比較快。其實是兩個因素疊在一起:
想比得更公平,可以每種組合連跑兩次、只看第二次,並把回答長度限制得更緊。
模型、引擎和運算全部在手機裡完成。下圖是一段問題從送出到出現回答所經過的路徑:
組 prompt:把角色規則(system prompt)和這次的題目、參考資料放在一起。先把正確資料交給模型、要它只根據資料回答,叫做 grounding,可以降低幻覺。
對話模板與斷詞:引擎自動套上 Gemma 4 規定的對話格式,再把文字切成 token。
Prefill(讀題):整段 prompt 一次送進模型,每一層算出 Q、K、V,並把 K、V 存進 KV cache。能平行運算,所以 GPU 加速最明顯。
Decode(打字):每次只產生 1 個 token。新 token 跟 KV cache 做注意力運算,再用取樣挑出下一個字。每產生一個字都要把整個模型權重從記憶體讀一遍,所以速度受記憶體頻寬限制。
回傳:文字以串流方式一段段送回畫面。整個過程不需要網路,資料不會離開手機。
Gemma 4 共有 5 種尺寸,Google 只替 E2B、E4B 推出手機版。載入權重所需記憶體(Google 官方數字,已含約 20% 額外開銷、不含 KV cache):
結論:E2B、E4B 是 Google 專為手機設計的尺寸,E4B 大約就是現在手機上的實用上限;12B 以上適合電腦或伺服器。
邊緣 AI(Edge AI/On-device AI)是把模型放在手機、筆電等終端裝置上直接執行。好處是資料不離開裝置(隱私)、可以離線使用、少了往返雲端的網路延遲;代價是記憶體、算力、電量與散熱都有限,只能用小尺寸模型並搭配量化。考題常考這組取捨:強調隱私或離線 → 邊緣部署;需要大模型能力或集中管理 → 雲端部署。另一個常見考點:LLM 推論分兩段,Prefill(讀入整段提示)可以平行運算、吃算力;Decode(逐字產生)每一步都要讀一次權重、吃記憶體頻寬,KV cache 則用來避免重算前文。
想練情境題與詳解 → Akira iPAS AI 互動式考證地圖
可以,但只限小尺寸模型。本頁用 Google 官方的 LiteRT-LM 引擎,在手機上執行 Gemma 4 的 E2B 與 E4B 版本(4-bit 量化,模型檔約 2.6GB 與 3.7GB)。模型、引擎和運算全在手機內完成,不需要網路,資料也不會離開裝置。
不一定。本頁單次實測中,讀題(Prefill)階段 GPU 在兩台手機都明顯較快;但打字(Decode)階段,iPhone 的 GPU 約 60 字/秒勝過 CPU 的 39 字/秒,Pixel 10 反而是 GPU 14.6 字/秒輸給 CPU 22.9 字/秒。打字速度主要受記憶體頻寬與引擎最佳化影響,不只看算力。
Prefill 把整段提示一次送進模型,可以平行運算,所以主要吃算力;Decode 一次只產生一個 token,每產生一個都要把整個模型權重從記憶體讀一遍,所以受記憶體頻寬限制。KV cache 會把前文算過的 K、V 存起來,讓 Decode 不必每次重算前文。
12B 以上沒有 LiteRT-LM 的手機版模型檔;就算壓成 4-bit,光權重就約 6.7GB,再加上 KV cache,會超過手機給單一 App 的記憶體上限。模型越大,每個字要讀的資料越多,打字會更慢,長時間高負載也會讓手機發燙降頻。E4B 大約就是目前手機上的實用上限。
GPU 第一次使用時要先編譯,本頁實測 Pixel 10 需要 26~35 秒、iPhone 約 8~9 秒,之後走快取只要幾秒。所以比較效能時要看不含第一次載入的每秒數字,或讓每種組合連跑兩次、只看第二次。