InkMind Museum

多模態 AI 水墨博物館 · 見習策展人登錄中…

見習策展人
Ink Energy
30
多模態印章

目前任務

在大廳中點擊會發光的水墨畫,進入被「單模態迷霧」污染的展間。
展 間 選 單 · 點 擊 進 入

怎麼玩 InkMind Museum

你是「AI 博物館見習策展人」,六個展間被單模態迷霧污染了
1
進入展間

六幅水墨畫一字排開面向你:直接點畫作,或點下方展間選單都可以進入。六個展間 = 六種多模態 AI 技術。

2
跟著金色提示完成任務

展間裡照著 ① → ② → ③ 的順序操作;閃金光的按鈕就是你現在該點的地方。卡住了就按上方的「自動播放」看示範。

3
通過考驗,收集印章

完成任務後按「接受展間考驗」答一題。答對得 Ink Energy 與一枚印章;集滿 6 枚印章開啟最終展廳「共同向量宇宙」。

歡迎來到 InkMind Museum。六個展間一字排開——點擊畫作或下方選單即可進入。
EXHIBIT 01

文字 × 圖像 迴廊

Text + Image Gallery
Text encoder Text embedding Similarity comparison Best match
① 輸入一句描述(中英皆可),或點快速句
② 向量空間:看文字墨點飛向最相似的圖像墨點

相似 = 兩個 embedding 的方向接近(cosine similarity 越接近 1 越像)。

③ 點選你認為最匹配的展品
先輸入描述,觀察墨點落點,再選出最匹配的畫作。
一句話理解:文字和圖片可以轉成向量(embedding)後互相比對,相似的內容在向量空間中會靠近。
EXHIBIT 02

聲紋 × 文字 亭

Speech + Text Pavilion
Audio waveform ASR Transcript Text embedding
① 選一句語音,啟動水墨聲波裝置
② 聲波 → 音訊片段 → ASR → 文字卷軸 → 向量
選擇句子並播放,觀察聲音粒子如何流入文字卷軸。
一句話理解:語音可以先透過 ASR(自動語音辨識)轉成文字,再被語言模型理解與比對。
EXHIBIT 03

觀畫成句 堂

Image Caption Hall
Image patches Visual features Language decoder Caption
① 點擊畫作,喚醒 AI 的注意力光點
Step 1 · detect objects:偵測 boat(船)、river(河)、mist(霧)
Step 2 · understand relationships:船「漂浮在」霧中的河上
Step 3 · generate caption:由語言解碼器逐字生成描述
② 哪一句是好的 Caption?
好的 caption 必須忠實描述圖片中真正存在的物件與關係。
一句話理解:模型可以先抽取圖片的視覺特徵,再由語言解碼器把內容轉成自然語言描述。
EXHIBIT 04 · 核心展間

共感穹頂

CLIP Shared Embedding Dome
Image encoder Text encoder Shared embedding space Cosine similarity Nearest neighbor
① 把文字提示「投入」向量星雲(點擊即投入)

◇ 圖像點(金)與 △ 文字點(青)會落在同一個 shared embedding space;語意相同的會互相靠近。

拖曳旋轉星雲 · 點擊任兩點看 similarity
② 穹頂挑戰:找出最接近 "a temple in the mountains" 的圖片
系統會把查詢文字轉成向量,計算它與所有圖像點的 cosine similarity。
一句話理解:CLIP 把圖片和文字投射到同一個語意向量空間,讓「以文找圖、以圖找文」成為可能。
EXHIBIT 05

古籍檔案室

OCR + LLM Archive
Document image OCR boxes Extracted text LLM answer
① 一張掃描文件:AI 研討會入場券
② 問 LLM 一個問題(根據 OCR 結果回答)
請先啟動 OCR。OCR 負責「讀字」,LLM 負責「理解與回答」。
一句話理解:OCR 不是 LLM——OCR 把圖片裡的文字變成機器可讀文字;LLM 再根據這些文字做摘要、問答與推理。若 OCR 出錯,LLM 的答案也會跟著錯(garbage in, garbage out)。
EXHIBIT 06

資料觀星台

RAG + Chart Understanding Observatory
Question Query embedding Retrieve evidence Read chart/table Grounded answer + cite
① 觀星台中央:2021–2024 AI 課程報名人數
② 知識庫文件卡(RAG 檢索的候選證據)
③ 向 AI 提問(答案必須附上來源)
RAG 的回答必須根據檢索到的證據,找不到證據時要誠實說「Evidence not found」,不可以亂編。
一句話理解:RAG 讓 AI 回答前先「查資料」——從文件、表格與圖表中檢索證據,答案要有根據、有引用,因此能降低幻覺。
FINAL HALL

共同向量宇宙

Common Vector Universe
點擊任一資料粒子,看它來自哪一種 modality
總結:多模態 AI 的核心,是讓不同型態的資料(文字、圖像、語音、OCR 文字、文件、圖表)都能被轉成 embedding,進入共同語意空間,讓模型可以共同理解、比對、檢索與生成。
六種資料型態的粒子正流向中央的 shared semantic space……
EXHIBIT TRIAL · 展間考驗

SEAL