快速回答:Hallucination 是什麼?

Hallucination(AI 幻覺)是指 AI 模型生成看似正確、語句流暢,但實際上是錯誤或完全虛構的內容。AI 可能會編造不存在的論文、引用虛構的法條、捏造不存在的數據,而且說得非常有自信。所有的 LLM,包括 ChatGPT、Claude、Gemini,都會產生幻覺。這是目前技術的根本限制,不是某個模型的 bug。

Hallucination 的正式定義

在 AI 領域,Hallucination 是指模型生成的內容與訓練資料、使用者輸入或可驗證的現實事實不一致的現象。這個詞借用自精神醫學,用來描述 AI「看見」不存在的東西。

白話解釋

你大概遇過那種很自信的同事,什麼都能答,答得頭頭是道。但他不知道的時候不會說「我不確定」,會直接編一個聽起來很合理的答案。

AI 一樣。它的任務是「預測下一個最可能的字」,不是「說出事實」。資訊不夠的時候,它根據統計模式「填空」,生成聽起來像正確答案的內容。

為什麼 AI 會產生幻覺?

統計預測而非理解

LLM 的核心運作是 next-token prediction,預測下一個最可能出現的 token。它做的是高維度的模式比對,不是真的「理解」內容。當模式比對的結果跟事實對不上,幻覺就出來了。

訓練資料的限制

模型只知道訓練資料中包含的內容,而且有知識截止日。對於訓練資料中不存在或矛盾的資訊,模型只能靠「猜測」來填補。

自迴歸生成的累積錯誤

LLM 逐字生成回答,每個字的選擇都基於前面已生成的內容。一旦前面出現了輕微偏差,後續的生成會在這個偏差上繼續發展,導致錯誤越來越大。

缺乏自我修正機制

LLM 無法像人類一樣在說出某句話後「回頭檢查」是否正確。它沒有內建的事實查核機制。

幻覺的常見類型

類型 說明 例子
事實性錯誤 陳述與現實不符的「事實」 把某人的出生年份搞錯
虛構引用 編造不存在的論文、書籍或法條 引用一篇從未發表的學術論文
邏輯矛盾 前後文自相矛盾 先說 A > B,後來又說 B > A
數據編造 捏造看起來精確但虛假的統計數據 「根據 2025 年調查,87.3% 的...」
時間錯亂 混淆事件的時間順序或引用未來事件 把 2024 年的事描述為 2020 年發生

真實案例

律師引用不存在的判例

2023 年,紐約律師 Steven Schwartz 使用 ChatGPT 撰寫法律文件,引用了 6 個完全不存在的法院判例。法官發現後對其處以罰款。截至 2026 年初,全球已累計超過 1,745 起律師引用 AI 生成虛假法律引用的記錄案例,平均每天新增 5-6 起。美國俄勒岡州一位法官曾對兩名律師處以 110,000 美元罰款——AI 幻覺案件中最高的罰款紀錄——因為他們提交了 23 個虛構引用和 8 段編造的引文。

AI 編造學術論文

研究人員發現 LLM 會生成看似真實的學術引用,包含完整的作者名、期刊名和 DOI 編號,但這些論文完全不存在。如果沒有逐一查證就放進論文裡,審查根本抓不到。

醫療資訊錯誤

AI 聊天機器人在回答醫療問題時,可能生成看似專業但錯誤的醫療建議,例如錯誤的藥物劑量或不存在的藥物交互作用。

2026 年防範技術

RAG(檢索增強生成)

RAG 先從可信資料庫中檢索相關資訊,再讓 LLM 基於檢索結果生成回答。史丹佛大學研究發現,結合 RAG、RLHF 和防護欄,可以將幻覺減少 96%。

Grounding(接地)

將 LLM 的回答「錨定」在企業自有資料或可驗證的來源上,確保回答不是憑空捏造。

Citation 機制

要求 AI 在回答時附上引用來源,讓使用者可以驗證。Claude 和 Perplexity 等模型已內建此功能。

Agentic RAG

2026 年的進階方法:AI Agent 自主規劃多步驟檢索策略,智慧排序可靠來源,減少低品質資訊進入回答的機會。

信心校準(Confidence Calibration)

訓練模型在不確定時表達不確定性,不要硬給答案。

使用者自保指南

AI 說的任何事實、數據、引用,都要用獨立來源交叉驗證。請它附上來源連結,然後自己去檢查那些來源是不是真的存在。

特別注意過於精確的數據。AI 給出「87.3% 的企業已導入」這種精確百分比,往往是編造的。回答如果完美到每個面向都涵蓋、沒有任何不確定,反而要懷疑。

法律、醫療、財務這些高風險領域,AI 產出一定要經過專業人士審核。AI 的回答是起點,拿來當初步研究可以,直接當結論用會出事。

企業應對策略

先建立 AI 使用政策,明確規範哪些場景可以用 AI、哪些產出必須經過人類審核。技術面可以導入 RAG 架構,讓 AI 基於企業自有資料回答,減少幻覺風險。

流程上,AI 產出一律先經過人類審核再發布,不跳過中間步驟。定期檢查 AI 系統的產出品質、追蹤幻覺發生率,同時讓員工了解 AI 幻覺的風險,知道什麼時候該信、什麼時候該查。

常見誤解

「新模型不會幻覺」——所有 LLM 都會幻覺,包括最新的模型。新模型幻覺率可能較低,但不可能為零。這是目前技術的根本限制,不是單純的 bug。

「幻覺是 bug,總有一天會修好」——幻覺源於 LLM 的核心運作方式(next-token prediction),要完全消除,可能需要根本不同的技術架構。

「只有 ChatGPT 會幻覺」——ChatGPT、Claude、Gemini、Llama、DeepSeek 都會,差別只在幻覺率高低。

「AI 說得很有自信,所以應該是對的」——AI 的自信程度跟正確程度之間沒有可靠的關聯。它用同樣自信的語氣說對的和錯的內容。

常見問題 FAQ

什麼是 AI 幻覺?

AI 模型生成看似正確但實際錯誤或虛構的內容,包括編造事實、虛構引用、捏造數據。

為什麼 AI 會幻覺?

LLM 的核心是統計預測(next-token prediction),做的是模式比對,不是真的理解內容。模式比對結果跟事實對不上的時候,就會產生幻覺。

所有 AI 都會幻覺嗎?

是。ChatGPT、Claude、Gemini、Llama、DeepSeek 都會,差別在幻覺率高低。

怎麼判斷 AI 有沒有幻覺?

用獨立來源交叉驗證。精確數據、學術引用和法律條文是幻覺高發區,看到就去查。

RAG 能完全解決幻覺嗎?

不能完全解決,但能大幅降低。RAG 結合其他技術可減少高達 96% 的幻覺,零幻覺目前做不到。

AI 幻覺會造成什麼實際損害?

已有律師因引用 AI 虛構判例被罰款 11 萬美元,學術論文引用不存在的文獻也有案例。醫療和金融領域出錯的後果更嚴重。

未來能消除 AI 幻覺嗎?

短期內不太可能。幻覺源於 LLM 的核心架構,完全消除可能需要根本性的技術突破。目前的目標是把幻覺率壓到最低,同時建立偵測和防範機制。

使用 AI 時怎麼避免被幻覺誤導?

驗證 AI 的輸出、要求附上來源、高風險領域(法律、醫療、財務)由專業人士審核。

參考資料