Deepfake 是什麼?深偽技術原理、辨識方法與防範指南

快速回答:Deepfake 是什麼?

Deepfake(深偽)是用 AI 技術生成的逼真假影片、假音訊或假圖片,讓目標人物看起來像在說或做他們從未說過或做過的事。這個技術可以讓一個人的臉出現在別人的身體上、模仿一個人的聲音說出任何話、或生成一個完全不存在的人的照片。

「Deepfake」這個詞結合了 Deep Learning(深度學習)和 Fake(假的)。名字來自 2017 年一個在 Reddit 上使用 AI 製作換臉影片的匿名使用者。

Deepfake 的正式定義

Deepfake 是利用深度學習技術(特別是生成對抗網路 GAN 和擴散模型 Diffusion Model)生成或修改的多媒體內容,使其呈現出從未實際發生的事件或言論,且視覺或聽覺上難以與真實內容區分。

白話解釋:Deepfake 就像什麼?

以前要做假照片,你需要 Photoshop 專家花好幾個小時才能做出一張「看起來像」的合成照。現在用 AI,幾分鐘就能做出一段逼真的影片——讓總統說出他沒說過的話、讓 CEO 在視訊中指示匯款、或把任何人的臉放到任何影片上。

而且品質已經好到一般人用肉眼很難分辨真假。

Deepfake 的技術原理

生成對抗網路(GAN)

早期的 Deepfake 主要使用 GAN(Generative Adversarial Network)。GAN 有兩個神經網路互相對抗:

生成器(Generator):負責生成假內容(例如合成的人臉)。 判別器(Discriminator):負責判斷內容是真的還是假的。

兩個網路互相訓練——生成器越來越擅長造假,判別器越來越擅長辨真假。最終生成器產出的內容連判別器都分不出來,也就是連 AI 自己都無法分辨真假。

擴散模型(Diffusion Model)

2024 年之後,許多 Deepfake 工具改用擴散模型。擴散模型的品質更高、更穩定。它的原理是先把圖片加入噪音直到變成隨機像素,再訓練模型學習如何一步步去除噪音還原圖片。學會了這個過程之後,模型就可以從純噪音開始,生成全新的逼真圖片。

自編碼器(Autoencoder)

換臉 Deepfake 常用的技術。先訓練一個編碼器把人臉壓縮成向量,再訓練一個解碼器從向量還原人臉。用 A 的臉訓練編碼器,用 B 的臉訓練解碼器,就可以把 A 的表情和動作「翻譯」成 B 的臉。

語音克隆

只需要幾秒到幾分鐘的目標人物語音樣本,AI 就可以生成該人的語音說出任何話。2026 年的語音克隆技術已經可以複製說話的節奏、語調、口音和情感。部分工具支援即時語音轉換——你說中文,輸出的是目標人物的聲音說中文。

Deepfake 的常見類型

類型 說明 製作難度 偵測難度
換臉(Face Swap) 把 A 的臉換成 B 的臉
臉部重現(Face Reenactment) 用 A 的表情控制 B 的臉 中高
語音克隆(Voice Clone) 模仿目標人物的聲音
全身合成(Full Body) 生成完整的人物影片
文字轉影片(Text-to-Video) 用文字描述生成影片 低到中
完全虛構人物 生成不存在的人的照片/影片

2026 年的趨勢:即時 Deepfake。可以在視訊通話中即時換臉,讓對方以為在跟另一個人通話。這對商業詐欺構成嚴重威脅。

真實案例

CEO 語音詐欺(2019)

一家英國能源公司的高管接到一通電話,聲音聽起來是他的德國母公司 CEO,指示他緊急匯款 24.3 萬美元到匈牙利的供應商帳戶。高管照做了——後來發現電話中的聲音是 AI 模仿的。這是已知最早的 Deepfake 語音詐欺案之一。

香港跨國公司詐欺(2024)

一家跨國公司的香港分公司員工收到了來自「英國總部 CFO」的視訊會議邀請。會議中出現了多位「同事」的影像和聲音,指示他轉帳 2,560 萬美元。所有出現在視訊中的人都是 Deepfake。這個案件顯示 Deepfake 已經可以在視訊會議中同時模擬多個人。

政治操弄

2024 年美國大選期間,出現了多起用 AI 生成的假影片和假音訊,模仿政治候選人說出具有爭議性的言論。雖然這些內容後來被證實是 Deepfake,但在被揭穿之前已經被大量轉發,造成了輿論影響。

不雅內容

Deepfake 最早和最普遍的惡意用途。未經同意使用他人的臉孔生成不雅影片或圖片。受害者以女性為主。多國已經立法將這種行為列為犯罪。

如何辨識 Deepfake?

視覺線索

臉部邊緣。Deepfake 的人臉和周圍環境(頭髮、脖子、耳朵)的接合處可能有不自然的模糊或閃爍。特別注意耳垂、髮際線、和下巴線條。

眨眼頻率。早期的 Deepfake 很少眨眼(因為訓練資料中閉眼的照片較少),但這個問題在 2025 年之後已經被大幅改善。

牙齒和舌頭。嘴巴內部的細節(牙齒的形狀、舌頭的動態)仍然是 Deepfake 較弱的地方。

光線一致性。注意人臉上的光線方向是否與環境一致。Deepfake 有時候會出現臉上的光源方向跟背景不同的情況。

首飾和配件。眼鏡的反光、耳環、項鍊等細節在 Deepfake 中可能會出現不自然的變形或消失。

音訊線索

呼吸和停頓。真人說話會有自然的呼吸聲和思考停頓。AI 生成的語音可能太「流暢」——沒有「嗯」「呃」等填充詞。

情感不一致。語音的情感和說話內容不匹配。例如用嚴肅的語氣說開心的內容。

背景音。Deepfake 語音通常很「乾淨」——沒有環境背景音,或背景音不自然。

工具輔助

有專門的 Deepfake 偵測工具和服務(例如 Microsoft Video Authenticator、Intel FakeCatcher、各研究機構的偵測模型)。但要注意:偵測工具和造假工具在持續的技術軍備競賽中,偵測工具不一定能抓到最新的 Deepfake。

防範指南

個人防範

對任何「異常的視訊通話」保持警覺。如果老闆突然用視訊要求你緊急匯款,掛掉電話用其他方式(例如直接打到他的手機)確認。

減少公開的個人影音資料。你在網路上的照片和影片越多,被用來訓練 Deepfake 的素材就越多。不是說不能發——但要意識到這個風險。

建立「驗證碼」。在家庭成員之間約定一個只有彼此知道的暗號。接到可疑電話時,用這個暗號驗證對方身分。

企業防範

多因素驗證所有重大指令。任何涉及金錢轉帳、系統存取、或敏感操作的指令,不論來自視訊、電話還是 email,都要透過另一個管道確認。「CEO 在視訊會議上說要匯款」不等於「真的 CEO 真的要你匯款」。

建立異常操作的覆核流程。超過一定金額的轉帳需要多人簽核。緊急要求(「馬上做,不要問」)反而應該更仔細確認。

教育員工。讓員工知道 Deepfake 的存在和風險。定期做社交工程演練,包含 Deepfake 場景。

技術措施。使用數位簽章和內容真實性驗證技術(如 C2PA)。部署 Deepfake 偵測工具在關鍵流程中(例如視訊面試、線上客戶驗證)。

法律現況

台灣

目前沒有專門針對 Deepfake 的法律,但相關行為可能觸犯現有法律:

  • 刑法第 310 條誹謗罪(散布不實言論)
  • 個人資料保護法(未經同意使用他人影像)
  • 刑法第 235 條散布猥褻物品罪(不雅 Deepfake 內容)
  • 刑法詐欺罪(用 Deepfake 進行詐欺)

國際

韓國在 2024 年加重了 Deepfake 色情內容的刑罰。歐盟 AI Act 要求 AI 生成的內容必須標明。美國部分州(加州、德州等)有針對 Deepfake 的特定法律。

安全注意事項

Deepfake 技術本身是中性的——它也有正當的用途,例如電影特效、語言學習(用 AI 配音讓外語影片有自然的中文口型)、無障礙(為聾啞人士生成手語影片)。

但濫用的風險非常高。技術門檻越來越低——2026 年任何人用手機 App 就能做出基本的換臉影片。這代表偵測和防範不能只靠技術,還需要法律框架和社會教育。

飛飛的觀點:對 Deepfake 最好的防禦是「不信任」的習慣。接到任何異常的請求——不管看起來多麼逼真——都透過另一個管道確認。這個習慣不只防 Deepfake,也防所有類型的社交工程攻擊。

常見問題

Deepfake 容易做嗎?

2026 年已經有很多免費和付費的工具可以做基本的換臉和語音克隆。技術門檻很低。高品質的 Deepfake(能騙過專業人士的)需要更多的技術和計算資源。

怎麼知道一個影片是不是 Deepfake?

看臉部邊緣、光線一致性、嘴巴內部細節、首飾變形。聽音訊是否太「乾淨」、有沒有自然的呼吸和停頓。使用偵測工具。但目前沒有 100% 可靠的方法。

Deepfake 只被用來做壞事嗎?

不是。電影特效、語言學習、教育內容、無障礙服務都有正當的 Deepfake 應用。問題在於濫用——未經同意使用他人影像、詐欺、政治操弄。

Deepfake 在台灣犯法嗎?

沒有專門的法律,但相關行為可能觸犯誹謗罪、個資法、散布猥褻物品罪、詐欺罪等現行法律。立法者正在研議是否需要專門的 Deepfake 法律。

AI 可以偵測 Deepfake 嗎?

可以,但準確率不是 100%。偵測工具和造假工具在持續的軍備競賽中。最新的 Deepfake 技術可能騙過現有的偵測工具,偵測工具需要持續更新。

參考資料

  • Deepfakes and Beyond(MIT Media Lab)
  • C2PA Content Authenticity Initiative — c2pa.org
  • 台灣刑法相關條文(全國法規資料庫)