🗺️ AI 學習與考證地圖
AI 治理 · 真實案例解剖

人在流程裡,判斷卻不在

Human out of the Meaningful Loop|星巴克韓國 Tank Day 事件

七名主管簽過名,最後由 CEO 核准,連法務都過了——沒有任何一個人提出疑慮,有人甚至連附件都沒打開。這不是「沒有人工審核」,而是人工審核只剩下一顆 Approve 按鈕

假 HITL橡皮圖章七層簽核全過法務也過了AI Failure 不是主因Oversight Failure 才是
Mochi 貓老師懷疑地看著一排只蓋章卻沒判斷的人工審核關卡

💡一句話定義

Mochi 貓老師擔心地讓核准章停在尚未打開的企劃附件前
Human out of the Meaningful Loop(也常被叫做 Failed HITLRubber-stamp HITL,橡皮圖章式人工審核):人確實在流程裡,但人的判斷沒有真正進入決策迴圈。簽核欄位有人簽名、流程圖上有審核節點,實際發生的卻只是一連串「看起來可以 → Approve」。

它跟最嚴格定義的 Human out of the loop(HOOTL)不一樣——HOOTL 是流程上根本沒有人;這個案例的流程上擠滿了人。正因為如此,它對企業更危險:因為所有的稽核紀錄、簽核截圖、內控文件看起來都是完整的

很多公司導入 AI Agent 之後會這樣想:「只要最後加一顆[人工確認]就叫安全。」
這個案例告訴我們:加了按鈕,不等於加了判斷。

📅事件經過

Mochi 貓老師驚訝地查看敏感日期與沒有標誌的隨行杯
先講清楚責任歸屬。這起事件的核心不是「AI 寫錯了」。涉案員工在調查中否認有嘲諷意圖,說法是「只是用了 AI、從未把這個活動跟光州事件聯想在一起」。但 AI 產出的東西之所以能一路走到全國上架,是因為後面每一道人工關卡都沒有發揮作用

AI Failure:不是重點。 Human Oversight Failure:這才是重點。

事實依據:韓國時報(The Korea Times)2026-05-26 針對新世界集團內部調查記者會的報導、路透社與 Al Jazeera 2026-05-19 關於 CEO 去職的報導、韓國多家媒體對文案內容的報導。本頁不轉載新聞照片;下方所有數字均標註出處。

🔍內部調查揭露了什麼

集團調查記者會的說明,幾乎是一份現成的「人工審核如何失效」教科書:

👥提案
由電商部門五名員工企劃並送審。調查認為其中部分人員對本國民主化歷史的認識不足,事發後仍未意識到事情的嚴重性。
✍️簽核
包含組長、經理、總監與 CEO 在內共七名主管與經理經手,沒有任何一人提出疑慮
📎連附件都沒開
調查明確指出:部分決策者根本沒有打開說明企劃的附件就核准,「習慣性地批准,不知道細節」。
⚖️法務也過了
集團高層原話:「它甚至通過了公司法務部門的審查。」——法務看的是法律風險,不是歷史與文化風險。
⏱️動機是「快」
「他們想要的就是加快行銷流程、盡快把活動上線。」速度成了唯一被優化的指標。
📆制度性盲點
集團坦承:電商部門幾乎每週都有活動,因為太頻繁,並不會每次都檢查上線日期是否撞到社會敏感事件
最後這一點是整起事件最值得記的地方:失效的不是某個人,是制度本身把這道檢查「設計成不做」。當一件事每週都要做 N 次,任何需要額外花時間的檢查都會被流程自然淘汰掉——除非它被做成強制的、機器會擋的關卡。

🧾簽核鏈:實際走法 vs 應該走法

Mochi 貓老師專注地用放大鏡逐層檢查簽核附件

同一條七層簽核鏈,左邊是內部調查描述的實際情形,右邊是同一關若真的執行審查會發生什麼。並排看最清楚的一件事:攔下它不需要更強的 AI、也不需要更多層簽核——七道關卡裡,任何一道真的做,這個案子就走不到上線。

依內部調查公開說明重建(共七名主管/經理經手,另經法務審查);各關職稱為示意。

關卡
實際發生:習慣性核准
應該發生:真的打開附件
① 企劃提案電商部門 5 人
用 AI 協助產生行銷素材,把「Tank Day」與「책상에 탁」的文案送出。調查指出部分成員對民主化歷史認識不足,事發後仍未意識到嚴重性。× 沒做:查上線日期是不是紀念日
先問一句「5/18 是什麼日子?」——這一秒鐘的查證,就能讓整個企劃在出生前被改掉。● 這一關該做:查上線日期是不是紀念日
② 組長第 1 道簽核
直屬主管照慣例放行。這個活動只是每週例行檔期之一。× 沒做:把日期與命名放在一起看
打開附件、看到「Tank」與日期並列,直接退件要求改期或改名。● 這一關該做:把日期與命名放在一起看
③ 經理第 2 道簽核
看到組長已簽,跟著簽。× 沒做:不把「前面簽過了」當成通過理由
不因為前一關簽了就跳過——獨立檢查一次,同樣會攔下來。● 這一關該做:獨立判斷,不繼承別人的簽名
④ 總監第 3 道簽核
連說明企劃的附件都沒有打開,「習慣性批准,不知道細節」。× 沒做:實際打開附件讀內容
開啟附件、完整讀過文案,發現「책상에 탁」的歷史聯想,立即升級為高風險案件。● 這一關該做:實際打開附件讀內容
⑤ 法務審查法務部門
通過。集團高層原話:「它甚至通過了公司法務部門的審查。」× 沒做:辨識這是文化風險、不是法律風險
標記「本案無法律問題,但屬社會敏感題材,須另送公關/在地文化審查」——把不屬於自己的風險明確交棒出去。● 這一關該做:辨識風險類型並轉介
⑥ 高階主管第 4 道簽核
流程要求的簽核之一,同樣沒有提出疑慮。× 沒做:質問排程理由
質疑「為什麼要挑 5/18 上線?」,要求提供敏感日曆比對結果。● 這一關該做:質問排程理由
⑦ CEO最終核准
最終核准。整條鏈七名主管與經理,沒有任何一人提出疑慮。× 沒做:對全國性曝光要求風險評估
即使前面都放行,最後一關仍可要求「全國性活動一律附上社會風險評估」才簽字。● 這一關該做:對全國性曝光要求風險評估
結果七關走完
放行 7/7,真正檢查內容的人數:0。活動全國上線。流程圖上有七個人工審核節點、稽核紀錄完整無缺——這就是假 HITL
只要其中一關認真做,就走不到上線。七道防線不必道道完美,需要的是至少有一道是真的
並排看才看得出來的事:右欄那七件事,沒有一件需要特殊技能或額外系統——都只是「把附件打開」「問一句為什麼是這天」。失效的從來不是能力,是誰也沒有義務真的去做。

🧭那這到底算哪一種 Loop?

Mochi 貓老師好奇歪頭比較四條不同的人機監督路徑

把「人的位置」跟「人的判斷有沒有真的發生」拆成兩件事來看,就清楚了(四種 Loop 的完整圖解見 四種 Loop 圖解):

狀況人在流程裡?判斷真的發生?分類
AI 寫文案 → AI 自己發布,沒有人看到Human out of the loop(HOOTL)
AI 寫文案 → AI 直接發布,人在旁邊監看、可隨時喊停是(監看)事後Human on the loop(HOTL)
AI 寫文案 → 人真的查歷史、文化、品牌風險 → 才批准有效的 HITL
AI 寫文案 → 七個人一路 Approve,但沒真的檢查假 HITL/Human out of the meaningful loop
所以這個案子最精準的一句話是:
問題不是「沒有 Human in the loop」,而是「Human was in the loop, but judgment was out of the loop」。
中文:人還在流程裡,但人的判斷已經離開流程。

Loop 類型判別器

讀情境、選分類,看看你抓不抓得到「假 HITL」

答對 0 / 6

互動:有效 HITL 的五個要件

Mochi 貓老師堅定地逐項檢查有效 HITL 的五個必要條件

「人工確認」要能真的擋下東西,這五件事缺一不可。點下面的方塊切換有/沒有,看看名稱會怎麼降級。

HITL 體檢表

看得到 → 看得懂 → 有時間判斷 → 知道風險 → 有權拒絕

具備要件5 / 5
實際上是有效 HITL
「有權拒絕」最容易被忽略。如果一個人提出疑慮之後,要自己扛下「你害活動延期」的責任,那他實質上就沒有拒絕權——制度會教會他按 Approve。設計審核流程時,提出質疑的成本必須低於放行的風險,這一條沒做到,其他四條都會慢慢腐蝕。

📉後果:可以量到的數字

Mochi 貓老師憂心地觀察事件後向下滑落的營運指標

這不是抽象的品牌傷害。以下為韓國多家媒體引用的支付資料統計(單位:億韓元/週)。

事件前後的每週結算金額

灰=論爭前基準線 紅=下滑期 綠=回升期

321.6
億韓元
236.9
億韓元
214.6
億韓元
244.3
億韓元
5/11–17
論爭前
5/18–24
論爭當週
5/25–31
次週
7 月第 1 週
回升期
論爭當週結算額236.9 億
較前一週−26.3%
金額減少−84.7 億
App 新安裝−23.6%
論爭當週由前一週的 321.6 億韓元掉到 236.9 億——一週少了 84.7 億韓元、−26.3%;同期 App 新安裝從 48,441 件掉到 36,994 件(−23.6%),食飲品牌新安裝排名從第 2 名掉到第 5 名。
次週再往下到 214.6 億,較論爭前累計 −33.3%——品牌傷害不是一週就結束的事。
到 7 月第 1 週回到 244.3 億,是事件後首次連兩週回升,但仍比論爭前低約 24%
一顆沒認真按的 Approve,代價是一個季度的營收曲線與一位 CEO 的職位。

數據出處:韓國多家媒體(首爾新聞、Financial News、YTN、Herald 經濟等)2026-05-27 引用的支付/App 統計;7 月第 1 週數字為同一系列後續報導。App 新安裝 48,441 → 36,994 件(−23.6%),同期食飲品牌新安裝排名由第 2 名掉到第 5 名。

🛠️那要怎麼做才不會變成橡皮圖章?

Mochi 貓老師安心地用盾牌與硬關卡守住真正有效的人為監督

這個案子的每一個失效點,都對應一個可以直接落地的做法:

失效點對應做法
沒人檢查上線日期敏感日曆做成系統硬檢查:國定紀念日、災難紀念日、歷史事件日期進資料庫,排程撞到就自動擋下並要求額外簽核。人記不住,也不該靠人記。
連附件都沒開簽核要留痕、要問問題:記錄附件是否被開啟、停留多久;核准時強制填「你檢查了哪三件事」,而不是只有一顆按鈕。
七個人看同一份摘要分工檢查清單:法務看法律、公關看輿情、在地團隊看歷史文化、品牌看調性。七個人看同一件事=重複七次同樣的盲點,不是七道防線。
法務過了就以為安全承認法律風險 ≠ 文化風險。高風險素材要走專門的「社會/歷史敏感度」審查,而不是塞進一般法務流程。
只想加快上線「擋下來」也有績效。如果流程只獎勵速度,那所有檢查點都會退化成 Approve。
AI 產出未被標記AI 生成內容強制標記來源與風險等級,高風險類別(歷史、政治、宗教、族群、災難)自動升級審查層級,並附上「AI 不知道的事」提醒。
給導入 AI Agent 的團隊:設計流程時,把「人工確認」這一格拆開來問五個問題——這個人看得到完整資料嗎?看得懂嗎?有時間看嗎?知道要看什麼風險嗎?擋下來不會被懲罰嗎?五個都是 Yes,才叫 Human in the loop;否則你加的只是一顆按鈕。

🎯重點整理

🧷核心一句話
人還在流程裡,但人的判斷已經離開流程。
🎭比 HOOTL 更危險
因為稽核紀錄、簽核截圖、內控文件看起來全都是完整的。
🧮五要件
看得到、看得懂、有時間判斷、知道風險、有權拒絕。缺一即降級。
🏗️制度大於個人
當一件事每週做 N 次,需要額外花時間的檢查會被流程自然淘汰——除非做成機器會擋的硬關卡。
⚖️責任歸屬
AI Failure 不是重點;Human Oversight Failure 才是。
📉代價是可量化的
週結算額 321.6 → 236.9 億韓元(−26.3%),App 新安裝 −23.6%,CEO 去職。

自我檢測

Q1. 為什麼這個案例不算最嚴格定義的 Human out of the loop?
因為流程上有人,而且不只一個——七名主管與經理經手、CEO 最終核准、還過了法務。HOOTL 指的是決策鏈上根本沒有人類介入點。這個案子的介入點很多,只是每一個都沒有真的產生判斷,所以更精準的說法是 Human out of the meaningful loop,或假 HITL/橡皮圖章式審核。
Q2. 那 Human on the loop(HOTL)跟這個差在哪?
HOTL 是設計上就讓 AI 先執行、人在旁邊監看並保留隨時介入與中止的權力,判斷發生在「事中或事後」。這個案子在設計上是 HITL——AI 產出必須先經人核准才能發布——只是核准這件事被做成了形式。是「設計是 HITL、實作退化成沒有判斷」,而不是刻意選了 HOTL。
Q3. 如果 AI 沒有參與,這件事就不會發生嗎?
不一定。AI 讓產出變快、變多,放大了審核端的壓力,但真正讓事情上線的是失效的簽核鏈。同樣的簽核鏈,人手寫的文案一樣會過。這也是為什麼把它歸類成治理問題、而不是模型問題。
Q4. 為什麼「法務審查過了」不能當成安全保證?
法務檢查的是法律責任(違法、侵權、不實廣告等),而這次的風險是歷史與文化敏感度——不違法,但會嚴重冒犯。風險類型不同,就需要不同的專業把關。把所有風險都丟給法務,等於預設「不違法=沒問題」。
Q5. 五要件裡哪一個最常被企業忽略?
「有權拒絕」。前四項還算容易寫進 SOP,但如果提出疑慮的人要承擔「害活動延期」的後果,制度實際上是在懲罰認真審查的人。久了之後,最理性的行為就是按 Approve。
Q6. 這個案例可以用在 iPAS 哪個考點?
AI 治理與導入(初級科目一、中級科目一)的人機協作與監督機制:Human-in/on/out of the loop 的區分、AI 生成內容的風險控管、以及「形式上的人工審核不等於有效監督」。也可以連到 EU AI Act 對高風險系統要求「有效的人為監督(effective human oversight)」——注意條文用的字是 effective。

📝 iPAS 考點提醒

人機協作與監督機制是 iPAS AI 治理與導入的重點(初級科目一、中級科目一)。三種模式要分清楚:Human-in-the-loop(HITL)=AI 產出必須先經人核准才能生效;Human-on-the-loop(HOTL)=AI 先執行、人監看並保有中止權;Human-out-of-the-loop(HOOTL)=決策鏈上沒有人類介入點。本案的關鍵在於第四種情況:流程設計是 HITL,但實作退化成「橡皮圖章」——七名主管與 CEO 全數簽核、還過了法務,卻無人提出疑慮,有人連附件都沒打開,精準的說法是 Human out of the meaningful loop/假 HITL。考點延伸:有效人為監督的五個要件(看得到、看得懂、有時間判斷、知道風險、有權拒絕),以及 EU AI Act 對高風險 AI 系統要求的是「有效的(effective)人為監督」而非形式上的簽核。責任歸屬記法:AI Failure 不是主因,Human Oversight Failure 才是。

延伸:人機協作模式四種 Loop 圖解EU AI Act可信賴 AI

❓ 常見問題

什麼是假 HITL(Rubber-stamp HITL)?

流程上有人工審核節點、也確實有人簽核,但人並未真的檢查內容,判斷沒有進入決策迴圈。表面稽核紀錄完整,實質等同無人監督,因此也被稱為 Human out of the meaningful loop。

星巴克韓國 Tank Day 事件為什麼是 AI 治理教材?

因為它的失效點不在 AI,而在人。企劃由電商部門員工借助 AI 產生,經七名主管與 CEO 簽核、並通過法務審查,卻無人提出疑慮,部分決策者連說明附件都沒有開啟就習慣性核准。它示範了「有人工審核不等於真的有人在審核」。

Human-in-the-loop 與 Human-on-the-loop 差在哪?

HITL 是 AI 產出必須先經人核准才能生效,判斷發生在事前;HOTL 是 AI 先執行、人在旁監看並保有隨時中止的權力,判斷發生在事中或事後。兩者都需要人真的具備判斷條件,否則都會退化成形式。

有效的人工審核需要哪些條件?

至少五項:看得到(能取得完整資料)、看得懂(具備判斷所需知識)、有時間判斷(不被時程壓成秒簽)、知道風險(清楚這一關要檢查什麼)、有權拒絕(擋下來不會被懲罰)。缺任一項,人工確認就會逐步退化成一顆 Approve 按鈕。

這起事件造成什麼具體損失?

依韓國媒體引用的支付統計,論爭當週(5/18–24)週結算金額由前一週的 321.6 億韓元降至 236.9 億韓元,減少約 84.7 億韓元、幅度 26.3%;同期 App 新安裝件數下降 23.6%。星巴克韓國 CEO 遭解任,集團會長公開道歉。

🧭 相關主題

← 返回 AI 學習與考證地圖