快速回答:Hallucination 是什麼?
Hallucination(AI 幻覺)是指 AI 模型生成看似正確、語句流暢,但實際上是錯誤或完全虛構的內容。AI 可能會編造不存在的論文、引用虛構的法條、捏造不存在的數據,而且說得非常有自信。所有的 LLM,包括 ChatGPT、Claude、Gemini,都會產生幻覺。這是目前技術的根本限制,不是某個模型的 bug。
Hallucination 的正式定義
在 AI 領域,Hallucination 是指模型生成的內容與訓練資料、使用者輸入或可驗證的現實事實不一致的現象。這個詞借用自精神醫學,用來描述 AI「看見」不存在的東西。
白話解釋
你大概遇過那種很自信的同事,什麼都能答,答得頭頭是道。但他不知道的時候不會說「我不確定」,會直接編一個聽起來很合理的答案。
AI 一樣。它的任務是「預測下一個最可能的字」,不是「說出事實」。資訊不夠的時候,它根據統計模式「填空」,生成聽起來像正確答案的內容。
為什麼 AI 會產生幻覺?
統計預測而非理解
LLM 的核心運作是 next-token prediction,預測下一個最可能出現的 token。它做的是高維度的模式比對,不是真的「理解」內容。當模式比對的結果跟事實對不上,幻覺就出來了。
訓練資料的限制
模型只知道訓練資料中包含的內容,而且有知識截止日。對於訓練資料中不存在或矛盾的資訊,模型只能靠「猜測」來填補。
自迴歸生成的累積錯誤
LLM 逐字生成回答,每個字的選擇都基於前面已生成的內容。一旦前面出現了輕微偏差,後續的生成會在這個偏差上繼續發展,導致錯誤越來越大。
缺乏自我修正機制
LLM 無法像人類一樣在說出某句話後「回頭檢查」是否正確。它沒有內建的事實查核機制。
幻覺的常見類型
| 類型 | 說明 | 例子 |
|---|---|---|
| 事實性錯誤 | 陳述與現實不符的「事實」 | 把某人的出生年份搞錯 |
| 虛構引用 | 編造不存在的論文、書籍或法條 | 引用一篇從未發表的學術論文 |
| 邏輯矛盾 | 前後文自相矛盾 | 先說 A > B,後來又說 B > A |
| 數據編造 | 捏造看起來精確但虛假的統計數據 | 「根據 2025 年調查,87.3% 的...」 |
| 時間錯亂 | 混淆事件的時間順序或引用未來事件 | 把 2024 年的事描述為 2020 年發生 |
真實案例
律師引用不存在的判例
2023 年,紐約律師 Steven Schwartz 使用 ChatGPT 撰寫法律文件,引用了 6 個完全不存在的法院判例。法官發現後對其處以罰款。截至 2026 年初,全球已累計超過 1,745 起律師引用 AI 生成虛假法律引用的記錄案例,平均每天新增 5-6 起。美國俄勒岡州一位法官曾對兩名律師處以 110,000 美元罰款——AI 幻覺案件中最高的罰款紀錄——因為他們提交了 23 個虛構引用和 8 段編造的引文。
AI 編造學術論文
研究人員發現 LLM 會生成看似真實的學術引用,包含完整的作者名、期刊名和 DOI 編號,但這些論文完全不存在。如果沒有逐一查證就放進論文裡,審查根本抓不到。
醫療資訊錯誤
AI 聊天機器人在回答醫療問題時,可能生成看似專業但錯誤的醫療建議,例如錯誤的藥物劑量或不存在的藥物交互作用。
2026 年防範技術
RAG(檢索增強生成)
RAG 先從可信資料庫中檢索相關資訊,再讓 LLM 基於檢索結果生成回答。史丹佛大學研究發現,結合 RAG、RLHF 和防護欄,可以將幻覺減少 96%。
Grounding(接地)
將 LLM 的回答「錨定」在企業自有資料或可驗證的來源上,確保回答不是憑空捏造。
Citation 機制
要求 AI 在回答時附上引用來源,讓使用者可以驗證。Claude 和 Perplexity 等模型已內建此功能。
Agentic RAG
2026 年的進階方法:AI Agent 自主規劃多步驟檢索策略,智慧排序可靠來源,減少低品質資訊進入回答的機會。
信心校準(Confidence Calibration)
訓練模型在不確定時表達不確定性,不要硬給答案。
使用者自保指南
AI 說的任何事實、數據、引用,都要用獨立來源交叉驗證。請它附上來源連結,然後自己去檢查那些來源是不是真的存在。
特別注意過於精確的數據。AI 給出「87.3% 的企業已導入」這種精確百分比,往往是編造的。回答如果完美到每個面向都涵蓋、沒有任何不確定,反而要懷疑。
法律、醫療、財務這些高風險領域,AI 產出一定要經過專業人士審核。AI 的回答是起點,拿來當初步研究可以,直接當結論用會出事。
企業應對策略
先建立 AI 使用政策,明確規範哪些場景可以用 AI、哪些產出必須經過人類審核。技術面可以導入 RAG 架構,讓 AI 基於企業自有資料回答,減少幻覺風險。
流程上,AI 產出一律先經過人類審核再發布,不跳過中間步驟。定期檢查 AI 系統的產出品質、追蹤幻覺發生率,同時讓員工了解 AI 幻覺的風險,知道什麼時候該信、什麼時候該查。
常見誤解
「新模型不會幻覺」——所有 LLM 都會幻覺,包括最新的模型。新模型幻覺率可能較低,但不可能為零。這是目前技術的根本限制,不是單純的 bug。
「幻覺是 bug,總有一天會修好」——幻覺源於 LLM 的核心運作方式(next-token prediction),要完全消除,可能需要根本不同的技術架構。
「只有 ChatGPT 會幻覺」——ChatGPT、Claude、Gemini、Llama、DeepSeek 都會,差別只在幻覺率高低。
「AI 說得很有自信,所以應該是對的」——AI 的自信程度跟正確程度之間沒有可靠的關聯。它用同樣自信的語氣說對的和錯的內容。
常見問題 FAQ
什麼是 AI 幻覺?
AI 模型生成看似正確但實際錯誤或虛構的內容,包括編造事實、虛構引用、捏造數據。
為什麼 AI 會幻覺?
LLM 的核心是統計預測(next-token prediction),做的是模式比對,不是真的理解內容。模式比對結果跟事實對不上的時候,就會產生幻覺。
所有 AI 都會幻覺嗎?
是。ChatGPT、Claude、Gemini、Llama、DeepSeek 都會,差別在幻覺率高低。
怎麼判斷 AI 有沒有幻覺?
用獨立來源交叉驗證。精確數據、學術引用和法律條文是幻覺高發區,看到就去查。
RAG 能完全解決幻覺嗎?
不能完全解決,但能大幅降低。RAG 結合其他技術可減少高達 96% 的幻覺,零幻覺目前做不到。
AI 幻覺會造成什麼實際損害?
已有律師因引用 AI 虛構判例被罰款 11 萬美元,學術論文引用不存在的文獻也有案例。醫療和金融領域出錯的後果更嚴重。
未來能消除 AI 幻覺嗎?
短期內不太可能。幻覺源於 LLM 的核心架構,完全消除可能需要根本性的技術突破。目前的目標是把幻覺率壓到最低,同時建立偵測和防範機制。
使用 AI 時怎麼避免被幻覺誤導?
驗證 AI 的輸出、要求附上來源、高風險領域(法律、醫療、財務)由專業人士審核。
參考資料
- Hallucination (AI) — Wikipedia — AI 幻覺定義
- Survey on Hallucination in LLMs — LLM 幻覺綜述論文
- Prompt Engineering — Anthropic — Anthropic 減少幻覺的 Prompt 技巧