快速回答:Deepfake 是什麼?
Deepfake(深偽)是用 AI 技術生成的逼真假影片、假音訊或假圖片,讓目標人物看起來像在說或做他們從未說過或做過的事。這個技術可以讓一個人的臉出現在別人的身體上、模仿一個人的聲音說出任何話、或生成一個完全不存在的人的照片。
「Deepfake」這個詞結合了 Deep Learning(深度學習)和 Fake(假的)。名字來自 2017 年一個在 Reddit 上使用 AI 製作換臉影片的匿名使用者。
Deepfake 的正式定義
Deepfake 是利用深度學習技術(特別是生成對抗網路 GAN 和擴散模型 Diffusion Model)生成或修改的多媒體內容,使其呈現出從未實際發生的事件或言論,且視覺或聽覺上難以與真實內容區分。
白話解釋:Deepfake 就像什麼?
以前要做假照片,你需要 Photoshop 專家花好幾個小時才能做出一張「看起來像」的合成照。現在用 AI,幾分鐘就能做出一段逼真的影片——讓總統說出他沒說過的話、讓 CEO 在視訊中指示匯款、或把任何人的臉放到任何影片上。
而且品質已經好到一般人用肉眼很難分辨真假。
Deepfake 的技術原理
生成對抗網路(GAN)
早期的 Deepfake 主要使用 GAN(Generative Adversarial Network)。GAN 有兩個神經網路互相對抗:
生成器(Generator):負責生成假內容(例如合成的人臉)。 判別器(Discriminator):負責判斷內容是真的還是假的。
兩個網路互相訓練——生成器越來越擅長造假,判別器越來越擅長辨真假。最終生成器產出的內容連判別器都分不出來,也就是連 AI 自己都無法分辨真假。
擴散模型(Diffusion Model)
2024 年之後,許多 Deepfake 工具改用擴散模型。擴散模型的品質更高、更穩定。它的原理是先把圖片加入噪音直到變成隨機像素,再訓練模型學習如何一步步去除噪音還原圖片。學會了這個過程之後,模型就可以從純噪音開始,生成全新的逼真圖片。
自編碼器(Autoencoder)
換臉 Deepfake 常用的技術。先訓練一個編碼器把人臉壓縮成向量,再訓練一個解碼器從向量還原人臉。用 A 的臉訓練編碼器,用 B 的臉訓練解碼器,就可以把 A 的表情和動作「翻譯」成 B 的臉。
語音克隆
只需要幾秒到幾分鐘的目標人物語音樣本,AI 就可以生成該人的語音說出任何話。2026 年的語音克隆技術已經可以複製說話的節奏、語調、口音和情感。部分工具支援即時語音轉換——你說中文,輸出的是目標人物的聲音說中文。
Deepfake 的常見類型
| 類型 | 說明 | 製作難度 | 偵測難度 |
|---|---|---|---|
| 換臉(Face Swap) | 把 A 的臉換成 B 的臉 | 低 | 中 |
| 臉部重現(Face Reenactment) | 用 A 的表情控制 B 的臉 | 中 | 中高 |
| 語音克隆(Voice Clone) | 模仿目標人物的聲音 | 低 | 高 |
| 全身合成(Full Body) | 生成完整的人物影片 | 高 | 中 |
| 文字轉影片(Text-to-Video) | 用文字描述生成影片 | 中 | 低到中 |
| 完全虛構人物 | 生成不存在的人的照片/影片 | 低 | 高 |
2026 年的趨勢:即時 Deepfake。可以在視訊通話中即時換臉,讓對方以為在跟另一個人通話。這對商業詐欺構成嚴重威脅。
真實案例
CEO 語音詐欺(2019)
一家英國能源公司的高管接到一通電話,聲音聽起來是他的德國母公司 CEO,指示他緊急匯款 24.3 萬美元到匈牙利的供應商帳戶。高管照做了——後來發現電話中的聲音是 AI 模仿的。這是已知最早的 Deepfake 語音詐欺案之一。
香港跨國公司詐欺(2024)
一家跨國公司的香港分公司員工收到了來自「英國總部 CFO」的視訊會議邀請。會議中出現了多位「同事」的影像和聲音,指示他轉帳 2,560 萬美元。所有出現在視訊中的人都是 Deepfake。這個案件顯示 Deepfake 已經可以在視訊會議中同時模擬多個人。
政治操弄
2024 年美國大選期間,出現了多起用 AI 生成的假影片和假音訊,模仿政治候選人說出具有爭議性的言論。雖然這些內容後來被證實是 Deepfake,但在被揭穿之前已經被大量轉發,造成了輿論影響。
不雅內容
Deepfake 最早和最普遍的惡意用途。未經同意使用他人的臉孔生成不雅影片或圖片。受害者以女性為主。多國已經立法將這種行為列為犯罪。
如何辨識 Deepfake?
視覺線索
臉部邊緣。Deepfake 的人臉和周圍環境(頭髮、脖子、耳朵)的接合處可能有不自然的模糊或閃爍。特別注意耳垂、髮際線、和下巴線條。
眨眼頻率。早期的 Deepfake 很少眨眼(因為訓練資料中閉眼的照片較少),但這個問題在 2025 年之後已經被大幅改善。
牙齒和舌頭。嘴巴內部的細節(牙齒的形狀、舌頭的動態)仍然是 Deepfake 較弱的地方。
光線一致性。注意人臉上的光線方向是否與環境一致。Deepfake 有時候會出現臉上的光源方向跟背景不同的情況。
首飾和配件。眼鏡的反光、耳環、項鍊等細節在 Deepfake 中可能會出現不自然的變形或消失。
音訊線索
呼吸和停頓。真人說話會有自然的呼吸聲和思考停頓。AI 生成的語音可能太「流暢」——沒有「嗯」「呃」等填充詞。
情感不一致。語音的情感和說話內容不匹配。例如用嚴肅的語氣說開心的內容。
背景音。Deepfake 語音通常很「乾淨」——沒有環境背景音,或背景音不自然。
工具輔助
有專門的 Deepfake 偵測工具和服務(例如 Microsoft Video Authenticator、Intel FakeCatcher、各研究機構的偵測模型)。但要注意:偵測工具和造假工具在持續的技術軍備競賽中,偵測工具不一定能抓到最新的 Deepfake。
防範指南
個人防範
對任何「異常的視訊通話」保持警覺。如果老闆突然用視訊要求你緊急匯款,掛掉電話用其他方式(例如直接打到他的手機)確認。
減少公開的個人影音資料。你在網路上的照片和影片越多,被用來訓練 Deepfake 的素材就越多。不是說不能發——但要意識到這個風險。
建立「驗證碼」。在家庭成員之間約定一個只有彼此知道的暗號。接到可疑電話時,用這個暗號驗證對方身分。
企業防範
多因素驗證所有重大指令。任何涉及金錢轉帳、系統存取、或敏感操作的指令,不論來自視訊、電話還是 email,都要透過另一個管道確認。「CEO 在視訊會議上說要匯款」不等於「真的 CEO 真的要你匯款」。
建立異常操作的覆核流程。超過一定金額的轉帳需要多人簽核。緊急要求(「馬上做,不要問」)反而應該更仔細確認。
教育員工。讓員工知道 Deepfake 的存在和風險。定期做社交工程演練,包含 Deepfake 場景。
技術措施。使用數位簽章和內容真實性驗證技術(如 C2PA)。部署 Deepfake 偵測工具在關鍵流程中(例如視訊面試、線上客戶驗證)。
法律現況
台灣
目前沒有專門針對 Deepfake 的法律,但相關行為可能觸犯現有法律:
- 刑法第 310 條誹謗罪(散布不實言論)
- 個人資料保護法(未經同意使用他人影像)
- 刑法第 235 條散布猥褻物品罪(不雅 Deepfake 內容)
- 刑法詐欺罪(用 Deepfake 進行詐欺)
國際
韓國在 2024 年加重了 Deepfake 色情內容的刑罰。歐盟 AI Act 要求 AI 生成的內容必須標明。美國部分州(加州、德州等)有針對 Deepfake 的特定法律。
安全注意事項
Deepfake 技術本身是中性的——它也有正當的用途,例如電影特效、語言學習(用 AI 配音讓外語影片有自然的中文口型)、無障礙(為聾啞人士生成手語影片)。
但濫用的風險非常高。技術門檻越來越低——2026 年任何人用手機 App 就能做出基本的換臉影片。這代表偵測和防範不能只靠技術,還需要法律框架和社會教育。
飛飛的觀點:對 Deepfake 最好的防禦是「不信任」的習慣。接到任何異常的請求——不管看起來多麼逼真——都透過另一個管道確認。這個習慣不只防 Deepfake,也防所有類型的社交工程攻擊。
常見問題
Deepfake 容易做嗎?
2026 年已經有很多免費和付費的工具可以做基本的換臉和語音克隆。技術門檻很低。高品質的 Deepfake(能騙過專業人士的)需要更多的技術和計算資源。
怎麼知道一個影片是不是 Deepfake?
看臉部邊緣、光線一致性、嘴巴內部細節、首飾變形。聽音訊是否太「乾淨」、有沒有自然的呼吸和停頓。使用偵測工具。但目前沒有 100% 可靠的方法。
Deepfake 只被用來做壞事嗎?
不是。電影特效、語言學習、教育內容、無障礙服務都有正當的 Deepfake 應用。問題在於濫用——未經同意使用他人影像、詐欺、政治操弄。
Deepfake 在台灣犯法嗎?
沒有專門的法律,但相關行為可能觸犯誹謗罪、個資法、散布猥褻物品罪、詐欺罪等現行法律。立法者正在研議是否需要專門的 Deepfake 法律。
AI 可以偵測 Deepfake 嗎?
可以,但準確率不是 100%。偵測工具和造假工具在持續的軍備競賽中。最新的 Deepfake 技術可能騙過現有的偵測工具,偵測工具需要持續更新。
參考資料
- Deepfakes and Beyond(MIT Media Lab)
- C2PA Content Authenticity Initiative — c2pa.org
- 台灣刑法相關條文(全國法規資料庫)