快速回答:Neural Network 是什麼?
Neural Network(神經網路)是一種模仿人腦神經元連結方式的運算架構。它由大量的「節點」組成,每個節點接收輸入、做簡單的數學運算、再把結果傳給下一層。透過反覆調整節點之間的連結強度,神經網路能從資料中學會辨識模式,這就是現代 AI 能辨識圖片、理解語言、生成文字的底層技術。
神經網路的正式定義
神經網路是由人工神經元(Artificial Neuron)組成的計算模型,透過加權連結構成多層結構,並以數學最佳化方法(通常是梯度下降法搭配反向傳播演算法)來調整連結權重,使模型的輸出逐步逼近目標結果。
這個概念最早可以追溯到 1943 年 McCulloch 和 Pitts 提出的數學模型,而真正實用化是在 2012 年 AlexNet 贏得 ImageNet 競賽之後,GPU 運算能力和大量資料讓深層神經網路變得可行。
白話解釋:神經網路就像什麼?
想像一家公司要判斷一封信是不是垃圾郵件。
第一排員工各自負責看一個特徵:有沒有「免費」這個詞、寄件者是不是陌生人、有沒有奇怪的連結。每個人看完之後,給出一個分數,交給第二排的組長。
組長把這些分數加權彙整,再傳給最後一位主管做最終判斷:是垃圾郵件,還是正常信件。
如果判錯了,主管會回頭跟每個人說「你給的分數要調高一點」或「你那個指標沒那麼重要,權重降低」。這個調整過程反覆做幾百萬次之後,整個團隊就變得很準。
神經網路的運作邏輯就是這樣:一層一層傳遞資訊,判錯就回頭調整,直到準確率夠高。
神經網路怎麼運作
神經元(Neuron)
一個人工神經元做的事情很單純:
接收多個輸入值,每個輸入乘上一個權重(weight),全部加起來之後再加上一個偏差值(bias),最後通過一個「激活函數」(activation function)決定要不要把訊號傳出去。
用數學寫就是:output = activation(w1*x1 + w2*x2 + ... + bias)
激活函數的作用是引入非線性。如果沒有它,不管疊多少層,整個網路都只能算線性關係,根本處理不了圖片辨識或語言理解這種複雜問題。常見的激活函數包括 ReLU、Sigmoid 和 Tanh。
層(Layer)
神經網路由三種層組成:
輸入層(Input Layer)負責接收原始資料。如果是一張 28×28 的灰階圖片,輸入層就有 784 個神經元,每個對應一個像素值。
隱藏層(Hidden Layer)是做運算的地方。層數越多,網路能學到的模式就越複雜。當隱藏層超過兩層,就進入「深度學習」的範疇。
輸出層(Output Layer)給出最終結果。分類任務的輸出層通常有幾個類別就有幾個神經元,數值最高的那個就是模型的答案。
訓練:反向傳播
神經網路的學習過程分四步:
前向傳播:資料從輸入層一路算到輸出層,得到一個預測結果。
計算誤差:把預測結果和正確答案比對,用損失函數(Loss Function)算出差了多少。
反向傳播:從輸出層往回算,找出每個權重對誤差的貢獻有多大。這就是「反向傳播演算法」(Backpropagation)在做的事。
更新權重:根據每個權重的貢獻程度,微調它的數值,讓下一次的預測更接近正確答案。
這四步反覆做幾十萬到幾百萬次(每次用一批資料),模型的準確率就會慢慢提升。整個過程像老師批改考卷:看錯在哪、找出原因、針對性地糾正。
常見的神經網路架構
CNN(卷積神經網路)
Convolutional Neural Network 專門處理有空間結構的資料,最典型的就是圖片。
CNN 的核心是「卷積核」(Filter),一個小方塊在圖片上滑動,偵測局部特徵。淺層的卷積核抓邊緣和紋理,深層的抓更抽象的模式(臉型、物體輪廓)。
應用場景:影像辨識、醫療影像判讀、自動駕駛的物件偵測、工廠產線的瑕疵檢測。
RNN(循環神經網路)
Recurrent Neural Network 處理序列資料,特點是有「記憶」機制。前一個時間步的輸出會回饋給下一個時間步當作輸入,所以它能理解順序關係。
原始 RNN 有個問題:序列太長的時候,前面的資訊會「忘光」(梯度消失)。LSTM(長短期記憶)和 GRU 是改良版,加入了「記憶閘門」機制來決定哪些資訊該記、哪些該忘。
應用場景:語音辨識、時間序列預測、機器翻譯(已大部分被 Transformer 取代)。
Transformer
2017 年 Google 提出的架構,靠「自注意力機制」(Self-Attention)一次看完整個序列,不需要像 RNN 一步一步算。這讓它能大規模平行運算,訓練速度快很多。
GPT、Claude、Gemini 這些大型語言模型的底層全部都是 Transformer。它幾乎取代了 RNN 在自然語言處理的地位,也被引入到圖像(ViT)和語音領域。
詳細原理可以看:Transformer 是什麼?
GAN(生成對抗網路)
Generative Adversarial Network 由兩個網路對抗組成:生成器(Generator)負責創造假資料,判別器(Discriminator)負責分辨真假。兩個互相競爭,生成器越來越會騙人,判別器越來越會抓假。
GAN 曾經是圖像生成的主流技術,雖然現在 Diffusion Model 在圖像生成上更常用,但 GAN 在資料增強、超解析度和風格轉換等領域仍然有用。
神經網路能做什麼
影像辨識:辨識人臉、偵測物件、判讀醫療影像。
自然語言處理:翻譯、文字生成、情感分析、摘要。
語音處理:語音轉文字、文字轉語音、聲音合成。
遊戲與策略:AlphaGo 用神經網路評估棋局、遊戲 AI 用強化學習搭配神經網路做決策。
科學研究:蛋白質結構預測(AlphaFold)、藥物分子設計、氣候模擬。
神經網路的限制
黑盒問題:網路越深,越難解釋它為什麼做出某個判斷。對醫療、金融等需要解釋性的領域,這是嚴重的問題。
資料飢渴:訓練有效的神經網路通常需要大量標記資料。資料不夠的時候,模型容易過擬合(Overfitting),在訓練資料上表現很好,遇到新資料就失準。
運算成本高:訓練大型神經網路需要大量 GPU 和電力。GPT-4 等級的模型,單次訓練成本估計數千萬美元。
脆弱性:對輸入的微小擾動很敏感。在圖片上加一點人眼看不出的雜訊,就可能讓模型把熊貓判成長臂猿。
泛化困難:在特定資料集上表現優異,換到不同分布的資料可能直接失效。
安全與風險
對抗樣本攻擊(Adversarial Examples):攻擊者精心設計微小的擾動加到輸入資料上,讓神經網路做出錯誤判斷。這在自動駕駛場景特別危險,例如在停車標誌上貼幾張貼紙,可能讓 AI 誤判為速限標誌。
模型竊取(Model Extraction):透過大量查詢目標模型的 API,用回覆的結果訓練出一個功能相近的「影子模型」,等於偷了人家的智慧財產。
成員推論攻擊(Membership Inference):判斷某筆特定資料是否曾經被用來訓練模型。如果模型是用病患資料訓練的,這等於洩漏了個人隱私。
後門攻擊(Backdoor Attack):在訓練資料中注入帶有特定觸發模式的樣本,讓模型在遇到這個模式時做出指定的錯誤行為,平時卻表現正常,很難被偵測到。
供應鏈風險:使用別人訓練好的模型(預訓練模型)時,你無法完全確認模型裡有沒有藏後門或偏見。
台灣相關應用
半導體製造:台積電使用 CNN 做晶圓瑕疵檢測,取代部分人工目視檢查,速度和準確率都提升。
醫療影像:台灣多家醫學中心用神經網路輔助判讀 X 光、CT 和病理切片,協助醫師早期發現肺結節和病變。
金融風控:國內銀行用神經網路偵測異常交易模式,協助防堵詐騙和洗錢。
智慧交通:高速公路的車輛辨識和流量預測系統,底層也是 CNN 在做即時的影像分析。
知識檢測
讀完文章後,測試一下你對這個主題的理解。
常見問題 FAQ
Neural Network 和 Deep Learning 有什麼不同?
Deep Learning 是指使用「多層」(通常超過兩層隱藏層)神經網路的機器學習方法。所以 Deep Learning 是 Neural Network 的一個子集,專指那些比較深(層數多)的網路。
神經網路真的模仿大腦嗎?
最初的靈感確實來自生物神經元,但現代的人工神經網路和真正的大腦差異極大。真實的神經元用電化學訊號、有時間動態、連結方式完全不同。把它想成「借用了一個概念」比較準確。
訓練一個神經網路要多久?
差異極大。一個簡單的圖片分類模型可能用筆電幾分鐘就訓練完。GPT-4 等級的大型語言模型需要上千顆 GPU 跑好幾個月。取決於模型大小、資料量和硬體。
我需要 GPU 才能跑神經網路嗎?
訓練時幾乎一定需要 GPU(或 TPU)來加速。推論(用訓練好的模型做預測)時,小型模型用 CPU 就行,大型模型還是需要 GPU。雲端服務(AWS、GCP)可以按需租用 GPU。
為什麼神經網路有時候會出錯?
神經網路是從統計模式中學習的。它看過大量的「狗的圖片」後能認狗,但它並不真正「理解」狗是什麼。遇到和訓練資料分布不同的輸入(角度奇怪、光線異常),或者刻意設計的對抗樣本,就可能判斷失誤。
神經網路和傳統程式設計有什麼不同?
傳統程式設計是人寫規則,告訴電腦「如果 A 就做 B」。神經網路是給電腦大量範例,讓它自己學出規則。好處是能處理人類難以明確定義規則的問題(像辨識貓),壞處是你很難控制它學到了什麼。
初學者該怎麼學神經網路?
建議路線:先學 Python 基礎,接著用 PyTorch 或 TensorFlow 跑一個手寫數字辨識(MNIST)的範例,理解前向傳播和反向傳播的實際運作。理論方面,3Blue1Brown 的 YouTube 影片系列把直覺講得很清楚。
台灣有哪些學習資源?
台大的機器學習課程(李宏毅教授)在 YouTube 免費公開,是中文世界最受歡迎的 ML/DL 入門課程。此外,台灣人工智慧學校和各大學的推廣教育也有相關課程。
參考資料
- Neural Network — Wikipedia — 神經網路定義
- TensorFlow Playground — TensorFlow 神經網路互動教學
- Neural Networks — 3Blue1Brown — 3Blue1Brown 神經網路視覺化解說