快速回答:Deep Learning 是什麼?
Deep Learning(DL,深度學習)是 Machine Learning 的子集,使用多層人工神經網路自動從原始資料中學習特徵,不需要人工設計特徵工程。你手機上的人臉解鎖、Google 翻譯、語音助理,以及 ChatGPT、Claude 等生成式 AI,背後都是 DL 在運作。
DL 的正式定義
Deep Learning 是機器學習(ML)的一個分支,使用由多個處理層(隱藏層)組成的人工神經網路,對資料進行多層次的抽象表示學習。「深度」指的就是神經網路中隱藏層的數量——層數越多,能學習的特徵就越複雜。
IBM、Google Cloud、SAP 的定義大同小異:用多層神經網路從大量資料中學習複雜模式,靈感來自人腦神經元的連接方式。不過要注意,「靈感來自」和「等同於」是兩回事——人工神經網路的運作方式和真正的生物神經系統差距很大,這個比喻只是幫助理解用的。
白話解釋
把 DL 想成一條工廠流水線。第一站只看邊緣和線條,第二站把邊緣組合成形狀,第三站把形狀組合成部件(眼睛、鼻子、耳朵),第四站把部件拼成物件,判斷「這是一隻貓」。每一層神經網路負責學一個層次的特徵,從簡單到複雜,最後得出結論。
飛飛在教課的時候喜歡用另一個比喻:想像你在學一門外語。一開始你只能認出單個字母,接著你學會把字母組成單字,然後理解文法把單字組成句子,最後你能讀懂一整篇文章的意思。DL 的「深度」就是這種從底層到高階的學習過程——每一層處理一個層次的資訊,層層堆疊才能理解複雜的內容。
ML vs DL 的關鍵差異:傳統 ML 需要人類告訴電腦「要注意什麼特徵」(特徵工程),DL 能自己從原始資料中發現該注意什麼。舉例來說,如果你要做一個辨識貓狗的系統,傳統 ML 需要工程師先定義哪些特徵重要(耳朵形狀、毛色分布、體型比例),然後把這些特徵的數值餵給模型。DL 則是直接丟一大堆貓和狗的照片給模型,它自己會學出哪些特徵有用。
神經網路怎麼運作?
神經元(Neuron)
人工神經元是神經網路的最小單位。它的工作流程可以用一個比喻來理解:想像一個評審在打分。這個評審會收到好幾項評比資料(輸入),每項資料有不同的重要性(權重)。評審把所有分數加權加總後,會設一個門檻——如果總分超過門檻就給通過,沒超過就不通過。這個門檻機制在技術上叫做激活函數(Activation Function),常見的有 ReLU(低於零就歸零)、Sigmoid(壓縮到 0 到 1 之間)等。
三層結構
神經網路分成三種層級:輸入層負責接收原始資料,隱藏層是中間的處理層,輸出層產出最終結果。
輸入層很好理解——如果你要辨識一張 28×28 像素的灰階數字圖片,輸入層就有 784 個神經元,每個對應一個像素的亮度值。
隱藏層是 DL 的核心。一個簡單的網路可能只有一兩層隱藏層,但現代的大型模型可以有幾十甚至幾百層。每一層的神經元從前一層的輸出中提取更高階的特徵。以圖片辨識為例,第一層可能學到線條和邊緣,第二層學到圓弧和角落,第三層學到眼睛和輪子的形狀,第四層就能判斷「這是一隻貓還是一台車」。
輸出層依任務而不同。分類任務的輸出層有幾個分類就有幾個神經元(例如辨識 0-9 數字就有 10 個),回歸任務可能只有一個輸出神經元。
學習過程:前向傳播與反向傳播
DL 的學習過程可以拆成兩步:
第一步是前向傳播(Forward Propagation)。資料從輸入層一路流向輸出層,每一層的神經元用自己的權重和激活函數處理後,把結果往下傳。走完這條路之後,在輸出層得到模型的預測結果。
第二步是反向傳播(Backpropagation)。拿預測結果和正確答案比較,算出差距多大(這個差距叫做損失,Loss)。然後從後往前,一層一層計算每個權重對這個差距的「貢獻」有多大,據此調整每個權重的數值,讓下一次的預測更準確。
飛飛喜歡用「射箭」的比喻來解釋:你第一次射箭偏左了,於是你把瞄準點往右調一點;第二次偏高了,再往下調一點。每次射完看結果再修正,反覆幾萬次之後,你就會射得越來越準。反向傳播就是這個「看結果、調修正」的過程,而梯度下降(Gradient Descent)就是背後的數學方法——它告訴你每個權重應該往哪個方向調、調多少,才能讓損失最小化。
學習率(Learning Rate)是一個重要的超參數。如果學習率太大,就像射箭時調整幅度太大,會在目標附近來回跳動永遠命中不了;如果學習率太小,調整的步伐太小,訓練時間會非常長,甚至卡在局部最小值。
三大神經網路架構
CNN(卷積神經網路)
CNN 專門處理圖片和空間資料。核心概念是用一個小型的「濾鏡」(卷積核,通常是 3×3 或 5×5 的矩陣)在圖片上滑動掃描,每掃一個位置就算出一個數值。不同的卷積核會偵測不同的特徵——有的偵測水平線、有的偵測垂直線、有的偵測圓弧。
飛飛的比喻是:想像你用一個放大鏡在一幅畫上面滑動。放大鏡一次只能看一小塊區域,但滑過整幅畫之後,你就掌握了所有局部特徵。CNN 的卷積核就是這個放大鏡,差別在於 CNN 會用很多個不同的放大鏡,每個負責找不同的特徵。
CNN 的另一個重要元素是池化層(Pooling Layer),它會對特徵圖做縮小處理(例如把 4 個像素取最大值變成 1 個),讓模型專注在重要特徵上,同時減少計算量。
CNN 擅長的應用:影像分類、物件偵測、人臉辨識、醫療影像分析、製造業瑕疵檢測。代表架構有 AlexNet(2012 年 ImageNet 比賽的突破者)、ResNet(引入殘差連接解決深層網路訓練困難的問題)、YOLO(即時物件偵測)。
台灣的應用案例:面板產業用 CNN 做瑕疵檢測,訓練模型辨識面板上的刮傷、亮點、色斑等缺陷,取代人眼檢測,效率提升數十倍。半導體產業用 CNN 分析晶圓的光學顯微鏡影像,偵測蝕刻缺陷和污染。台大醫院等機構也在研究用 CNN 分析 X 光片和 CT 掃描,輔助醫師診斷。
RNN(循環神經網路)
RNN 專門處理序列資料——時間上有先後順序的資料,像是語音、文字、股票價格。RNN 的特色是有「記憶」機制:每處理完一筆資料,會把部分結果傳給自己,作為處理下一筆資料時的參考。
比喻:你在讀一篇文章。讀到第三段的時候,你對第一段和第二段的內容還有印象,這些記憶會影響你怎麼理解第三段的意思。RNN 就是這樣運作的——它會把之前看過的資訊保留下來,影響對當前資料的判斷。
RNN 最大的問題是長程依賴(Long-term Dependency):當序列很長的時候,早期的資訊會在傳遞過程中逐漸消失,就像你讀一本小說到了第十章,可能已經忘了第一章的某些細節。LSTM(Long Short-Term Memory)和 GRU(Gated Recurrent Unit)透過設計精巧的「閘門」機制來緩解這個問題——它們可以選擇性地記住或遺忘資訊,讓重要的內容保留更久。
RNN 和 LSTM 曾經是自然語言處理和語音辨識的主力架構,但在 2017 年 Transformer 出現後,大部分的文字處理任務已經轉向使用 Transformer,因為後者在效率和效果上都更優秀。
Transformer
2017 年 Google 在 "Attention Is All You Need" 這篇論文中提出 Transformer 架構,徹底改變了 DL 的版圖。它的核心機制是「自注意力」(Self-Attention):處理一個序列時,不像 RNN 要一個一個按順序看,Transformer 可以同時看到序列中每一個位置和其他所有位置的關係。
飛飛的比喻:想像你在一間教室裡,RNN 是學生一個一個輪流發言,你要記住前面每個人說了什麼;Transformer 則是所有學生同時把自己的想法寫在白板上,每個人都能一眼看到所有人的內容,直接判斷誰的想法和自己最相關。這種「平行處理」的能力讓 Transformer 的訓練速度遠快於 RNN,也能處理更長的序列。
GPT 系列、Claude、BERT、ViT(Vision Transformer)都是基於 Transformer 架構。2026 年的 Transformer 已經跨足文字、圖片、音訊、影片的多模態處理,是目前最主流的 DL 架構。
| 架構 | 擅長領域 | 核心機制 | 代表應用 |
|---|---|---|---|
| CNN | 圖片 / 空間資料 | 卷積核掃描 | 人臉辨識、醫療影像、瑕疵檢測 |
| RNN | 序列 / 時間資料 | 循環記憶 | 語音辨識、時序預測 |
| Transformer | 文字 / 多模態 | 自注意力機制 | ChatGPT、Claude、BERT |
ML vs DL:到底差在哪?
| 面向 | Machine Learning | Deep Learning |
|---|---|---|
| 特徵工程 | 需要人工設計特徵 | 自動從原始資料提取特徵 |
| 資料需求 | 少量資料即可運作 | 通常需要大量資料 |
| 運算需求 | CPU 即可 | 通常需要 GPU / TPU |
| 可解釋性 | 較高(可以理解決策依據) | 較低(黑盒模型) |
| 訓練時間 | 較短(分鐘到小時) | 較長(小時到數週) |
| 適用場景 | 結構化資料、小型任務 | 圖片、語音、文字等非結構化資料 |
| 部署成本 | 較低 | 較高(推論也需較多資源) |
飛飛要強調:DL 不一定在所有任務上都比傳統 ML 好。如果你的資料量小(幾百到幾千筆)、特徵明確(例如年齡、收入、購買次數這種結構化數據),用傳統的隨機森林或 XGBoost 往往效果更好、速度更快、也更容易解釋。DL 真正的優勢在處理非結構化資料(圖片、聲音、文字),因為這些資料的特徵很難用人工方式定義。
2026 年 DL 最新趨勢
Foundation Models 已經成為基礎設施,企業不再從零訓練模型,直接在 Foundation Model 上微調或透過 API 呼叫。2026 年的主流 DL 模型同時處理文字、圖片、音訊和影片,多模態是標配。
硬體端也在變。透過量化、剪枝、知識蒸餾等壓縮技術,DL 模型可以跑在手機和 IoT 裝置上(Edge AI)。台灣在這個領域有獨特優勢——台積電的先進製程是 AI 晶片的關鍵供應鏈,聯發科的天璣系列處理器也在行動裝置端跑 DL 推論。
架構上,CNN + Transformer 的混合架構越來越常見,在影像任務上表現比純 CNN 或純 Transformer 更好。小型語言模型(SLM)的興起也是趨勢之一——不是每個任務都需要千億參數的大模型,7B 到 13B 參數的模型在特定任務上微調後,效果可以接近大模型,但推論成本低很多。
合成資料(Synthetic Data)的使用也越來越普遍。當真實資料不足或取得困難時(例如罕見疾病的醫療影像),可以用生成式 AI 產生合成訓練資料來補充。不過合成資料的品質直接影響模型的表現,使用時需要謹慎驗證。
另一個趨勢是可解釋 AI(Explainable AI,XAI)的發展。隨著 DL 模型在醫療、金融、司法等高風險場景的應用越來越多,監管機構和使用者對模型可解釋性的要求也在提高。Grad-CAM、SHAP、LIME 等工具可以幫助理解模型的決策依據,雖然還無法做到像傳統 ML 那樣透明,但至少能提供一些線索。
DL 可以做什麼?常見應用
你每天已經在用 DL 了:手機人臉解鎖、語音助理、Google Photos 照片搜尋、即時翻譯、社群平台的內容推薦,背後都是深度學習。
企業端的應用更深入。文件 OCR 讓紙本文件可以自動數位化,製造業品質檢測取代了人眼逐件檢查的辛苦工作,客服對話機器人可以處理七八成的常見問題,程式碼生成工具如 Copilot 讓工程師的生產力提升三到四成。
在台灣的實際應用方面:半導體產業用 DL 做晶圓缺陷偵測和良率預測;醫療機構用 DL 輔助分析病理切片和 X 光影像;金融業用 DL 做異常交易偵測和信用評分;製造業用 DL 做設備預測性維護,在機台故障前提前預警。台灣的農業也開始導入 DL——用影像辨識判斷水果的成熟度和品質等級,減少人力成本。
專業領域方面,醫療影像診斷、自動駕駛、蛋白質結構預測(AlphaFold)、藥物研發、氣象預測這些領域,DL 都是核心技術。值得注意的是 AlphaFold 對生物學研究的影響非常深遠——它能預測蛋白質的三維結構,而過去用實驗方法測定一個蛋白質結構可能需要幾個月到幾年。這個突破在藥物研發和疾病理解上打開了全新的可能性。
台灣的 AI 生態系也在蓬勃發展。國科會推動的 AI 計畫、各大學的 AI 研究中心、以及像台智雲(TWCC)提供的國家級 AI 運算平台,都在降低台灣企業和研究機構使用 DL 的門檻。製造業是台灣最早大規模採用 DL 的產業之一,因為台灣有大量的精密製造工廠,品質檢測和設備預測維護的需求很明確,DL 能帶來的效益也很直接。
DL 的風險與安全威脅
飛飛作為資安研究員,特別要從安全角度談 DL 的風險。
對抗樣本攻擊(Adversarial Examples):在輸入資料中加入人眼看不出的微小擾動就能騙過模型。舉例來說,研究人員在停車標誌上貼了幾張小貼紙,就讓自駕車的影像辨識系統把它誤判成速限標誌。這種攻擊在安全系統(人臉辨識門禁、自駕車、醫療診斷)上特別危險。飛飛在資安課程中會示範:用特定演算法生成的擾動圖片,人眼看起來和原圖一模一樣,但模型的判斷結果天差地遠。
模型反轉攻擊(Model Inversion):攻擊者透過大量查詢模型的 API,從回應中推斷訓練資料的內容。如果訓練資料包含個人資料(例如醫療紀錄),這就構成嚴重的隱私侵犯。台灣的個資法對這類資料有嚴格的保護要求。
資料投毒(Data Poisoning):在訓練資料中故意混入錯誤標註的資料,讓模型學到錯誤的規律。例如在垃圾郵件偵測的訓練資料中把正常郵件標註為垃圾郵件,模型就會學到錯誤的分類標準。如果攻擊者能影響訓練資料的來源,這種攻擊很難被發現。
模型竊取(Model Stealing):透過大量查詢目標模型的 API,收集輸入和輸出的配對資料,用這些資料訓練一個功能相近的「複製模型」。對於投入大量成本訓練模型的企業來說,這是智慧財產權的威脅。
黑盒問題(Black Box):DL 模型難以解釋為什麼做出某個決策。一個醫療影像模型告訴你「這張 X 光片有 87% 的機率是肺炎」,但醫師需要知道模型是看到了什麼才做出這個判斷。在金融場景也是如此——如果 AI 拒絕了一筆貸款申請,申請人有權要求知道原因。台灣的金管會對 AI 在金融業的應用也越來越關注可解釋性的要求。
過擬合和訓練資料的偏差也是安全隱患。如果訓練資料中某個族群的代表性不足,模型在該族群上的表現會特別差,在自動化決策場景中可能構成歧視。
環境成本方面,訓練大型 DL 模型消耗大量電力和運算資源。訓練一次 GPT-4 等級的模型,碳排放相當於數百趟跨國飛行。這是產業在追求更大更強模型時需要考量的議題。
DL 訓練的實務挑戰
訓練一個 DL 模型聽起來就是「丟資料進去、等它學完」,但實務上有很多眉角。
資料準備往往是最耗時的環節。訓練資料需要清洗(去除錯誤和重複)、標註(告訴模型正確答案是什麼)、以及分割(切成訓練集、驗證集、測試集)。在台灣的醫療影像應用中,一張 X 光片的標註需要有執照的放射科醫師來做,成本很高、速度很慢。
超參數調整是另一個挑戰。學習率、批次大小(Batch Size)、網路層數、每層的神經元數量、Dropout 比例——這些超參數的組合空間非常大,找到最佳組合往往需要大量的實驗。AutoML 工具可以自動化這個過程,但需要額外的運算資源。
訓練過程中的梯度問題也常見。梯度消失(Gradient Vanishing)是指梯度在反向傳播過程中越來越小,導致前面幾層幾乎學不到東西;梯度爆炸(Gradient Exploding)則相反,梯度越來越大導致訓練不穩定。ResNet 的殘差連接和 Batch Normalization 都是為了解決這類問題而設計的技巧。
模型部署也有學問。訓練好的模型要真正上線服務,需要考慮推論速度(使用者能接受多長的等待時間)、模型大小(要部署在什麼硬體上)、以及版本管理(模型更新時怎麼無縫切換)。台灣的中小企業在這方面的經驗通常不足,建議先從雲端 API 開始,有經驗後再考慮自行部署。
常見誤解
「DL 就是 AI」——DL 只是 AI 的一小部分。AI 還包括規則系統、搜尋演算法、強化學習等許多其他方法。
「DL 一定比傳統 ML 好」——對於結構化資料和小型資料集,傳統 ML 往往更好。飛飛在實務中見過不少案例,用 XGBoost 處理表格資料的效果比 DL 更好,而且訓練時間只需要幾分鐘。
「DL 需要超級電腦」——訓練大型模型確實需要強大的 GPU 叢集,但使用(推論)已可在手機上進行。而且隨著量化技術的進步,越來越多模型可以在消費級硬體上運行。
「DL 能理解內容」——DL 學習的是統計模式,不是真正的「理解」。一個翻譯模型不需要理解句子的意思,它只是根據訓練資料中的統計規律,預測什麼翻譯最合理。這也是為什麼 AI 有時候會產生看起來很有道理但事實上錯誤的輸出(幻覺問題)。
常見問題 FAQ
DL 和 ML 有什麼不同?
DL 是 ML 的子集。ML 需人工特徵工程,DL 自動提取特徵。DL 在處理非結構化資料(圖片、文字、語音)時特別強大,但在結構化資料(表格數據)上,傳統 ML 演算法如隨機森林和 XGBoost 往往表現得更好且更高效。
什麼是神經網路?
模仿人腦神經元連接方式設計的數學模型,由輸入層、隱藏層和輸出層組成。每個神經元接收上一層的輸出,經過加權加總和激活函數處理後,把結果傳給下一層。整個網路透過反覆訓練和調整權重來學習資料中的規律。
CNN 和 Transformer 差在哪?
CNN 用卷積核掃描圖片,擅長捕捉空間特徵(圖片中各區域的關係),運算效率高但處理長距離關係的能力有限。Transformer 用自注意力機制,能直接看到序列中所有位置的關係,擅長處理文字和長序列資料。2026 年 Transformer 已經跨足圖片和影片領域(ViT 架構),兩種架構的界限越來越模糊,混合架構也越來越常見。
DL 需要多少資料?
這取決於任務的複雜度。從頭訓練一個影像分類模型可能需要數萬到數十萬張圖片。但 Transfer Learning(遷移學習)可以大幅減少需求——先用大量通用資料訓練一個基礎模型,再用少量特定領域的資料微調。Few-shot Learning 甚至可以用幾個到幾十個範例就讓模型學會新任務。對台灣企業來說,善用 Transfer Learning 是降低門檻的關鍵。
學 DL 需要什麼基礎?
如果只是使用 API(例如呼叫 ChatGPT 或 Claude),不需要懂 DL 的原理。如果要自己建模和訓練,需要掌握 Python 程式語言、線性代數(矩陣運算)、微積分(偏微分用於理解梯度下降)、機率統計(理解損失函數和模型評估)。PyTorch 和 TensorFlow 是兩個主流的 DL 框架,建議從 PyTorch 開始學,因為它的設計更直覺。
DL 有哪些安全風險?
主要的安全風險包括:對抗樣本攻擊(用微小擾動騙過模型)、模型反轉攻擊(從模型回應推斷訓練資料)、資料投毒(汙染訓練資料)、模型竊取(複製模型功能)、過擬合(模型記住了訓練資料的細節包括個資)、以及黑盒不可解釋(無法說明決策依據)。企業在部署 DL 系統時需要有對應的安全評估和防護措施。
ChatGPT 用的是什麼 DL 技術?
ChatGPT 基於 Transformer 架構的大型語言模型(LLM),屬於 DL 的應用。它先用大量文字資料做預訓練,學習語言的統計規律,然後用人類回饋的強化學習(RLHF)讓回答更符合人類的期望。Claude 也是類似的技術路線,但在安全對齊的方法上有所不同。
DL 的運算需求高嗎?
訓練需要 GPU 或 TPU。以目前主流的 NVIDIA A100 GPU 為例,訓練一個中型模型可能需要數張 GPU 跑好幾天。推論(使用訓練好的模型)的成本低很多,透過量化壓縮後可以在手機或邊緣裝置上運行。台灣的企業如果只是要用現成的 API,不需要自己負擔這些硬體成本。
台灣企業要怎麼開始使用 DL?
對大部分台灣企業來說,直接使用雲端 API(ChatGPT API、Claude API、Google Cloud Vision)是最快的入門方式,不需要自己訓練模型。如果有特定領域的需求(例如辨識自家產品的瑕疵),可以用雲端服務提供的 AutoML 功能或請專業的 AI 服務公司協助。只有在資料量大、資安要求高、需求非常客製化的情況下,才需要考慮自己建模和訓練。
為什麼 DL 模型的參數量越來越大?
研究發現,增加模型參數量(搭配足夠的訓練資料和運算量)通常可以提升模型的能力,這被稱為 Scaling Laws(規模定律)。GPT-3 有 1,750 億參數,GPT-4 的參數量更大(OpenAI 未公開確切數字)。不過更大不一定更好——訓練成本和推論成本也會跟著上升,而且大模型在小型任務上可能大材小用。2026 年的趨勢是同時追求大模型的通用能力和小模型在特定任務上的經濟效益。
Transfer Learning 是什麼?和 DL 有什麼關係?
Transfer Learning(遷移學習)是 DL 中非常實用的技巧。概念是:先用大量通用資料訓練一個基礎模型(例如在幾百萬張圖片上訓練一個影像辨識模型),然後用少量特定領域的資料微調這個模型(例如用幾千張瑕疵圖片微調成晶圓瑕疵檢測模型)。這樣做的好處是不需要從零開始訓練,省時間也省資料。對於台灣很多資料量有限的中小企業來說,Transfer Learning 讓 DL 變得更實際可行。
DL 模型的推論延遲會影響使用體驗嗎?
會。推論延遲是指模型處理一筆輸入資料所需要的時間。對於即時應用(例如自駕車的影像辨識、語音助理),延遲太高會直接影響安全性和使用體驗。一般來說,使用者能接受的回應時間在幾百毫秒以內。模型壓縮技術(量化、剪枝、知識蒸餾)可以在少量犧牲精度的情況下大幅降低推論延遲。邊緣裝置上的推論延遲通常比雲端低,因為不需要網路傳輸的時間。
DL 和生成式 AI 是什麼關係?
生成式 AI(Generative AI)是 DL 的一種應用方向。傳統的 DL 主要用於分類和預測(例如辨識圖片中的物件),生成式 AI 則用 DL 來產生新的內容(文字、圖片、音樂、程式碼)。ChatGPT、Claude、Stable Diffusion、Midjourney 都是生成式 AI 的代表。它們背後的技術——Transformer 和擴散模型(Diffusion Model)——都屬於 DL 的範疇。
參考資料
- Deep Learning — Wikipedia — 深度學習定義
- Deep Learning — Goodfellow et al. — Deep Learning 教科書
- PyTorch Tutorials — PyTorch 官方教學
- Vaswani et al., "Attention Is All You Need" (2017) — Transformer 原始論文