💡 一句話定義
Human out of the Meaningful Loop (也常被叫做 Failed HITL 或 Rubber-stamp HITL,橡皮圖章式人工審核 ):人確實在流程裡,但人的判斷沒有真正進入決策迴圈。 簽核欄位有人簽名、流程圖上有審核節點,實際發生的卻只是一連串「看起來可以 → Approve」。
它跟最嚴格定義的 Human out of the loop(HOOTL) 不一樣——HOOTL 是流程上根本沒有人;這個案例的流程上擠滿了人 。正因為如此,它對企業更危險:因為所有的稽核紀錄、簽核截圖、內控文件看起來都是完整的 。
很多公司導入 AI Agent 之後會這樣想:「只要最後加一顆[人工確認] 就叫安全。」
這個案例告訴我們:加了按鈕,不等於加了判斷。
📅 事件經過
2026-05-18 星巴克韓國電商部門推出「Tank Day(탱크데이) 」促銷,主打一款大容量隨行杯「tank」,文案中出現「책상에 탁 (在桌上敲一下)」。
同日 輿論隨即引爆。5 月 18 日是光州民主化運動紀念日 ——1980 年軍事政權出動包含戰車在內的部隊鎮壓光州要求民主的市民,造成大量死傷;而「책상을 탁 치니…」則讓人聯想到 1987 年學生朴鍾哲遭刑求致死後,當局用來掩飾死因的說法。活動數小時內下架。
2026-05-19 新世界集團會長親自下令解任星巴克韓國 CEO。集團表示另有一名相關高層也將去職。
2026-05-26 集團公布為期一週的內部調查結果,四位高層出面說明、會長當場道歉,坦承「行銷企劃與風險管理制度存在嚴重漏洞」。
後續 光州相關團體赴五一八民主廣場抗議;美國星巴克總部稱此事為「不可接受的行銷事件」,並表示正在強化內部控管與審查標準。
先講清楚責任歸屬。 這起事件的核心不是「AI 寫錯了」。涉案員工在調查中否認有嘲諷意圖,說法是「只是用了 AI 、從未把這個活動跟光州事件聯想在一起」。但 AI 產出的東西之所以能一路走到全國上架,是因為後面每一道人工關卡都沒有發揮作用 。
AI Failure:不是重點。 Human Oversight Failure:這才是重點。
事實依據:韓國時報(The Korea Times)2026-05-26 針對新世界集團內部調查記者會的報導、路透社與 Al Jazeera 2026-05-19 關於 CEO 去職的報導、韓國多家媒體對文案內容的報導。本頁不轉載新聞照片;下方所有數字均標註出處。
🔍 內部調查揭露了什麼
集團調查記者會的說明,幾乎是一份現成的「人工審核如何失效」教科書:
👥 提案 由電商部門五名員工 企劃並送審。調查認為其中部分人員對本國民主化歷史的認識不足 ,事發後仍未意識到事情的嚴重性。
✍️ 簽核 包含組長、經理、總監與 CEO 在內共七名主管與經理 經手,沒有任何一人提出疑慮 。
📎 連附件都沒開 調查明確指出:部分決策者根本沒有打開說明企劃的附件 就核准,「習慣性地批准,不知道細節」。
⚖️ 法務也過了 集團高層原話:「它甚至通過了公司法務部門的審查。 」——法務看的是法律風險,不是歷史與文化風險。
⏱️ 動機是「快」 「他們想要的就是加快行銷流程、盡快把活動上線。」速度成了唯一被優化的指標。
📆 制度性盲點 集團坦承:電商部門幾乎每週都有活動 ,因為太頻繁,並不會每次都檢查上線日期是否撞到社會敏感事件 。
最後這一點是整起事件最值得記的地方:失效的不是某個人,是制度本身把這道檢查「設計成不做」。 當一件事每週都要做 N 次,任何需要額外花時間的檢查都會被流程自然淘汰掉——除非它被做成強制的、機器會擋的關卡。
🧾 簽核鏈:實際走法 vs 應該走法
同一條七層簽核鏈,左邊是內部調查描述的實際情形 ,右邊是同一關若真的執行審查會發生什麼 。並排看最清楚的一件事:攔下它不需要更強的 AI、也不需要更多層簽核——七道關卡裡,任何一道真的做,這個案子就走不到上線。
依內部調查公開說明重建(共七名主管/經理經手,另經法務審查);各關職稱為示意。
關卡
實際發生:習慣性核准
應該發生:真的打開附件
① 企劃提案 電商部門 5 人
用 AI 協助產生行銷素材,把「Tank Day」與「책상에 탁」的文案送出。調查指出部分成員對民主化歷史認識不足,事發後仍未意識到嚴重性。× 沒做:查上線日期是不是紀念日
先問一句「5/18 是什麼日子?」——這一秒鐘的查證,就能讓整個企劃在出生前被改掉。● 這一關該做:查上線日期是不是紀念日
② 組長 第 1 道簽核
直屬主管照慣例放行。這個活動只是每週例行檔期之一。× 沒做:把日期與命名放在一起看
打開附件、看到「Tank」與日期並列,直接退件要求改期或改名。● 這一關該做:把日期與命名放在一起看
③ 經理 第 2 道簽核
看到組長已簽,跟著簽。× 沒做:不把「前面簽過了」當成通過理由
不因為前一關簽了就跳過——獨立檢查一次,同樣會攔下來。● 這一關該做:獨立判斷,不繼承別人的簽名
④ 總監 第 3 道簽核
連說明企劃的附件都沒有打開,「習慣性批准,不知道細節」。× 沒做:實際打開附件讀內容
開啟附件、完整讀過文案,發現「책상에 탁」的歷史聯想,立即升級為高風險案件。● 這一關該做:實際打開附件讀內容
⑤ 法務審查 法務部門
通過。集團高層原話:「它甚至通過了公司法務部門的審查。」× 沒做:辨識這是文化風險、不是法律風險
標記「本案無法律問題,但屬社會敏感題材,須另送公關/在地文化審查」——把不屬於自己的風險明確交棒出去。● 這一關該做:辨識風險類型並轉介
⑥ 高階主管 第 4 道簽核
流程要求的簽核之一,同樣沒有提出疑慮。× 沒做:質問排程理由
質疑「為什麼要挑 5/18 上線?」,要求提供敏感日曆比對結果。● 這一關該做:質問排程理由
⑦ CEO 最終核准
最終核准。整條鏈七名主管與經理,沒有任何一人提出疑慮。× 沒做:對全國性曝光要求風險評估
即使前面都放行,最後一關仍可要求「全國性活動一律附上社會風險評估」才簽字。● 這一關該做:對全國性曝光要求風險評估
結果 七關走完
放行 7/7,真正檢查內容的人數:0。 活動全國上線。流程圖上有七個人工審核節點、稽核紀錄完整無缺——這就是假 HITL 。
只要其中一關認真做,就走不到上線。 七道防線不必道道完美,需要的是至少有一道是真的 。
並排看才看得出來的事: 右欄那七件事,沒有一件需要特殊技能或額外系統——都只是「把附件打開」「問一句為什麼是這天」。失效的從來不是能力,是誰也沒有義務真的去做。
🧭 那這到底算哪一種 Loop?
把「人的位置」跟「人的判斷有沒有真的發生」拆成兩件事來看,就清楚了(四種 Loop 的完整圖解見 四種 Loop 圖解 ):
狀況 人在流程裡? 判斷真的發生? 分類
AI 寫文案 → AI 自己發布,沒有人看到 否 否 Human out of the loop(HOOTL)
AI 寫文案 → AI 直接發布,人在旁邊監看、可隨時喊停 是(監看) 事後 Human on the loop(HOTL)
AI 寫文案 → 人真的查歷史、文化、品牌風險 → 才批准 是 是 有效的 HITL
AI 寫文案 → 七個人一路 Approve,但沒真的檢查 是 否 假 HITL/Human out of the meaningful loop
所以這個案子最精準的一句話是:
問題不是「沒有 Human in the loop」,而是「Human was in the loop, but judgment was out of the loop」。
中文:人還在流程裡,但人的判斷已經離開流程。
Loop 類型判別器
讀情境、選分類,看看你抓不抓得到「假 HITL」
下一題 →
↺ 重來
答對 0 / 6
✅ 互動:有效 HITL 的五個要件
「人工確認」要能真的擋下東西,這五件事缺一不可 。點下面的方塊切換有/沒有,看看名稱會怎麼降級。
HITL 體檢表
看得到 → 看得懂 → 有時間判斷 → 知道風險 → 有權拒絕
全部具備(理想狀態)
套用星巴克案的實際狀況
「有權拒絕」最容易被忽略。 如果一個人提出疑慮之後,要自己扛下「你害活動延期」的責任,那他實質上就沒有拒絕權——制度會教會他按 Approve。設計審核流程時,提出質疑的成本必須低於放行的風險 ,這一條沒做到,其他四條都會慢慢腐蝕。
📉 後果:可以量到的數字
這不是抽象的品牌傷害。以下為韓國多家媒體引用的支付資料統計(單位:億韓元/週)。
事件前後的每週結算金額
灰=論爭前基準線 紅=下滑期 綠=回升期
5/11–17 論爭前
5/18–24 論爭當週
5/25–31 次週
7 月第 1 週 回升期
論爭當週結算額 236.9 億
較前一週 −26.3%
金額減少 −84.7 億
App 新安裝 −23.6%
論爭當週 由前一週的 321.6 億韓元掉到 236.9 億 ——一週少了 84.7 億韓元、−26.3% ;同期 App 新安裝從 48,441 件掉到 36,994 件(−23.6% ),食飲品牌新安裝排名從第 2 名掉到第 5 名。
次週 再往下到 214.6 億 ,較論爭前累計 −33.3% ——品牌傷害不是一週就結束的事。
到 7 月第 1 週 回到 244.3 億 ,是事件後首次連兩週回升,但仍比論爭前低約 24% 。
一顆沒認真按的 Approve,代價是一個季度的營收曲線與一位 CEO 的職位。
數據出處:韓國多家媒體(首爾新聞、Financial News、YTN、Herald 經濟等)2026-05-27 引用的支付/App 統計;7 月第 1 週數字為同一系列後續報導。App 新安裝 48,441 → 36,994 件(−23.6%),同期食飲品牌新安裝排名由第 2 名掉到第 5 名。
🛠️ 那要怎麼做才不會變成橡皮圖章?
這個案子的每一個失效點,都對應一個可以直接落地的做法:
失效點 對應做法
沒人檢查上線日期 把敏感日曆做成系統硬檢查 :國定紀念日、災難紀念日、歷史事件日期進資料庫,排程撞到就自動擋下並要求額外簽核。人記不住,也不該靠人記。
連附件都沒開 簽核要留痕、要問問題 :記錄附件是否被開啟、停留多久;核准時強制填「你檢查了哪三件事」,而不是只有一顆按鈕。
七個人看同一份摘要 分工檢查清單 :法務看法律、公關看輿情、在地團隊看歷史文化、品牌看調性。七個人看同一件事=重複七次同樣的盲點,不是七道防線。
法務過了就以為安全 承認法律風險 ≠ 文化風險 。高風險素材要走專門的「社會/歷史敏感度」審查,而不是塞進一般法務流程。
只想加快上線 讓「擋下來」也有績效 。如果流程只獎勵速度,那所有檢查點都會退化成 Approve。
AI 產出未被標記 AI 生成內容強制標記來源與風險等級 ,高風險類別(歷史、政治、宗教、族群、災難)自動升級審查層級,並附上「AI 不知道的事」提醒。
給導入 AI Agent 的團隊: 設計流程時,把「人工確認」這一格拆開來問五個問題——這個人看得到完整資料嗎?看得懂嗎?有時間看嗎?知道要看什麼風險嗎?擋下來不會被懲罰嗎? 五個都是 Yes,才叫 Human in the loop;否則你加的只是一顆按鈕。
🎯 重點整理
🧷 核心一句話 人還在流程裡,但人的判斷已經離開流程。
🎭 比 HOOTL 更危險 因為稽核紀錄、簽核截圖、內控文件看起來全都是完整的。
🧮 五要件 看得到、看得懂、有時間判斷、知道風險、有權拒絕。缺一即降級。
🏗️ 制度大於個人 當一件事每週做 N 次,需要額外花時間的檢查會被流程自然淘汰——除非做成機器會擋的硬關卡。
⚖️ 責任歸屬 AI Failure 不是重點;Human Oversight Failure 才是。
📉 代價是可量化的 週結算額 321.6 → 236.9 億韓元(−26.3%),App 新安裝 −23.6%,CEO 去職。
❓ 自我檢測
Q1. 為什麼這個案例不算最嚴格定義的 Human out of the loop?
因為流程上有人,而且不只一個——七名主管與經理經手、CEO 最終核准、還過了法務。HOOTL 指的是決策鏈上根本沒有人類介入點。這個案子的介入點很多,只是每一個都沒有真的產生判斷,所以更精準的說法是 Human out of the meaningful loop,或假 HITL/橡皮圖章式審核。
Q2. 那 Human on the loop(HOTL)跟這個差在哪?
HOTL 是設計上就讓 AI 先執行、人在旁邊監看並保留隨時介入與中止的權力,判斷發生在「事中或事後」。這個案子在設計上是 HITL——AI 產出必須先經人核准才能發布——只是核准這件事被做成了形式。是「設計是 HITL、實作退化成沒有判斷」,而不是刻意選了 HOTL。
Q3. 如果 AI 沒有參與,這件事就不會發生嗎?
不一定。AI 讓產出變快、變多,放大了審核端的壓力,但真正讓事情上線的是失效的簽核鏈。同樣的簽核鏈,人手寫的文案一樣會過。這也是為什麼把它歸類成治理問題、而不是模型問題。
Q4. 為什麼「法務審查過了」不能當成安全保證?
法務檢查的是法律責任(違法、侵權、不實廣告等),而這次的風險是歷史與文化敏感度——不違法,但會嚴重冒犯。風險類型不同,就需要不同的專業把關。把所有風險都丟給法務,等於預設「不違法=沒問題」。
Q5. 五要件裡哪一個最常被企業忽略?
「有權拒絕」。前四項還算容易寫進 SOP,但如果提出疑慮的人要承擔「害活動延期」的後果,制度實際上是在懲罰認真審查的人。久了之後,最理性的行為就是按 Approve。
Q6. 這個案例可以用在 iPAS 哪個考點?
AI 治理與導入(初級科目一、中級科目一)的人機協作與監督機制:Human-in/on/out of the loop 的區分、AI 生成內容的風險控管、以及「形式上的人工審核不等於有效監督」。也可以連到 EU AI Act 對高風險系統要求「有效的人為監督(effective human oversight)」——注意條文用的字是 effective。