你以為讓 AI「看」張照片,它給出的描述就等於真相?最近學術界拋出一個不太妙的消息:我們身邊那些越來越聰明的多模態 AI,像是 OpenAI 的 ChatGPT 和 Anthropic 的 Claude,雖然能一邊聊天一邊分析圖像、甚至從文字生出圖片,但它們其實有「視覺幻覺」的毛病——換句話說,它們會用極度自信的語氣,告訴你一張根本不存在於圖片裡的東西。

這不是科幻情節,而是正在發生的現實。當我們越來越習慣把手機拍的照片丟給 AI 解讀,甚至開始依賴它來協助醫療影像判讀或監視器畫面分析時,這種「看似合理、實則荒謬」的幻覺現象,就成了必須正視的信任危機。

當「預測引擎」開始看圖說故事:視覺幻覺怎麼發生?

首先得理解一個核心事實:大型語言模型本質上就是一個「預測引擎」。它之所以這麼會聊天,是因為吃過海量文字和影像資料,學會了「哪幾個詞彙最常一起出現」,於是根據統計機率來吐出答案。問題就在這裡——這些模型缺乏對「真理」的明確規範,它們追求的是統計學上的合理性,而不是真實性

諾丁漢大學電腦視覺副教授 Michael Pound 說得直接:AI 的輸出僅具統計學上的合理性,而非真實。聽起來有點繞口?白話文就是:AI 看圖的時候,會根據「這個畫面通常會搭配哪些文字描述」來作答,而不是真的「看懂」圖片裡有什麼。所以當背景資訊和圖像內容互相矛盾時,幻覺就會更頻繁地冒出來。

根據《Communications of the ACM》的報導,Michael Pound 舉了一個很實際的例子:在醫學影像分析中,如果 AI 受到其他病患資料的干擾,它可能因此忽略圖片中實際存在的疾病跡象。換句話說,一位病患的 X 光片,可能因為 AI 曾經看過太多類似的「健康影像」,就被誤判為正常——而真正的病灶就這樣被跳過去了。

不只是「眼殘」那麼簡單:為什麼人類會原諒自己,卻無法原諒 AI?

話說回來,人類本來就常常看錯東西,不是嗎?我們會把衣架誤認成人影,也會在夜路中把貓咪看成不明物體。但加州柏克萊人工智慧研究實驗室(BAIR)的博士後研究員 David Chan 點出一個殘酷的事實:大眾對 AI 的期望值,遠比對人類自己還高。我們能接受朋友偶爾講錯話,卻無法容忍 ChatGPT 給出一個明顯錯誤的圖像描述——因為我們潛意識裡認為「機器就應該更精準」。

這就帶出一個更深層的問題:當 AI 的「視覺幻覺」發生在一般人可以即時驗證的情境,比方說你請它描述一張貓咪照片,牠說成狗,你可以立刻糾正。但如果場景換成盲人輔助科技呢?視障使用者完全無法自行驗證 AI 給出的環境描述是否正確——一個錯誤的「前方沒有障礙物」,可能就是一次嚴重的碰撞意外

同樣的邏輯也適用在自動駕駛車和安全監控影像分析上。當 AI 把行人誤判為陰影、或把紅燈看成綠燈,這不是「再 reload 一次就好」的問題,而是人命關天的風險。

現在的補救方式很「厚工」,而且效率低落

那麼,研究人員現在怎麼處理這個問題?目前常見的做法有兩種:一是針對特定任務的影像資料進行模型微調(fine-tuning),像是在自動駕駛車中額外導入光達(LiDAR)這類多餘感測器來交叉比對;二是所謂的「後驗證」(post-hoc verification)——用另一個 AI 模型來檢查原本 AI 的輸出。

但問題來了,後驗證這招不僅速度慢,而且它只能「拒絕」錯誤的回應,沒辦法直接修正內容。你可以想像成請兩個校對人員輪流看同一份稿子,第二個人只會跟你說「這句有錯」,但不會告訴你正確答案是什麼——對實際應用來說,幾乎沒有幫助。

從產業面來看,我認為視覺幻覺問題的嚴重性被多數企業低估了。很多新創團隊急著把多模態 AI 導入客服、醫療輔助、甚至法律文件審閱,卻忽略了「錯誤的自信輸出」比「拒絕回答」更危險。當一個 AI 用 95% 的置信度告訴你錯誤的資訊,使用者往往不會再去質疑它——這才是我最擔心的事。與其急著讓 AI 什麼都會看,不如先確保它「看不懂的時候會說不知道」。

突破關鍵:「REVERSE 框架」讓 AI 一邊輸出一邊抓錯

所幸,學術界已經在尋找更聰明的解法。一項名為「REVERSE 框架」的新方法被提出,它的核心概念很直覺:在 AI 生成回應的「過程中」同步檢查幻覺,而不是等它講完才來事後諸葛

這個框架透過訓練模型將輸出的詞語分類為「自信」或「不自信」,並在生成影像描述的過程中,即時給予每個詞彙一個信心評分。David Chan 形容這是一種「推論技巧」,能讓實際部署中的系統根據預期的錯誤率來靈活應對。換句話說,當 AI 對某個詞彙不太有把握時,系統可以即時調整回應策略——可能是換個說法,或是直接告知使用者「這個部分我不確定」。

不過,REVERSE 框架目前仍屬於「補破網」的階段,真正長遠的目標,是從源頭防止 AI 模型產生幻覺。研究人員正在探索讓模型進行「視覺推理」(visual reasoning)而非純文本推理——也就是讓 AI 真正去分析圖像的幾何結構與外觀特徵,而不是只靠「這個畫面通常會怎麼被描述」來瞎猜。

未來趨勢:AI 的可靠性,決定我們願意讓它走多遠

回過頭來看,視覺幻覺問題其實戳中了 AI 發展的一個根本矛盾:我們一方面希望模型無所不能,另一方面又要求它萬無一失。但現實是,一個靠機率運作的預測引擎,天生就不可能達到 100% 的正確率

從這裡推演下去,我認為接下來一到兩年內,我們會看到兩個明確的趨勢:第一,監管機構會開始針對多模態 AI 的「信心度標示」提出具體規範,要求模型在輸出時必須揭露每個判斷的可信區間;第二,市場會開始淘汰那些「只會講漂亮話、卻無法承擔錯誤責任」的 AI 應用,留下來的將是願意誠實面對自身局限性的產品。

對一般使用者來說,現階段最重要的一件事,就是永遠不要把 AI 的圖像描述當成「最終答案」。它可以是輔助工具、可以是靈感來源,但當你無法自行驗證它的輸出時——尤其是在醫療、安全、法律這類高風險領域——請務必把它當成「僅供參考」,而不是「絕對真理」。

畢竟,AI 的幻覺或許可以靠技術慢慢修補,但人類對它的信任,一旦瓦解就很難回來了。

本文改寫整理自公開新聞來源,原始報導由Yahoo奇摩新聞發布。

常見問題 FAQ

什麼是 AI 的「視覺幻覺」?

視覺幻覺是指多模態 AI 在分析圖像時,生成出看似合理但實際錯誤的描述或判斷,原因是 AI 本質上仰賴統計機率而非真實理解。

視覺幻覺會影響一般使用者的日常應用嗎?

會,尤其在自動駕駛、醫療影像分析、盲人輔助科技和安全監控等關鍵領域,任何錯誤都可能帶來實際風險。

REVERSE 框架是什麼?它能完全解決視覺幻覺嗎?

REVERSE 框架是一種在 AI 生成回應過程中同步檢查幻覺的方法,能即時修正錯誤,但目前仍屬補救措施,無法從源頭完全杜絕幻覺。

我該怎麼判斷 ChatGPT 或 Claude 給我的圖像描述是否正確?

最簡單的方法是交叉比對,將同一張圖片輸入不同 AI 模型,或自行肉眼確認;若無法驗證,請將輸出視為參考而非最終答案。

未來 AI 視覺幻覺問題有機會完全解決嗎?

研究人員正朝向視覺推理方向發展,讓 AI 分析圖像的幾何與外觀而非純文字推理,但基於 AI 的機率本質,完全消除幻覺仍具挑戰。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。