快速回答:Neural Network 是什麼?

Neural Network(神經網路)是一種模仿人腦神經元連結方式的運算架構。它由大量的「節點」組成,每個節點接收輸入、做簡單的數學運算、再把結果傳給下一層。透過反覆調整節點之間的連結強度,神經網路能從資料中學會辨識模式,這就是現代 AI 能辨識圖片、理解語言、生成文字的底層技術。

神經網路的正式定義

神經網路是由人工神經元(Artificial Neuron)組成的計算模型,透過加權連結構成多層結構,並以數學最佳化方法(通常是梯度下降法搭配反向傳播演算法)來調整連結權重,使模型的輸出逐步逼近目標結果。

這個概念最早可以追溯到 1943 年 McCulloch 和 Pitts 提出的數學模型,而真正實用化是在 2012 年 AlexNet 贏得 ImageNet 競賽之後,GPU 運算能力和大量資料讓深層神經網路變得可行。

白話解釋:神經網路就像什麼?

想像一家公司要判斷一封信是不是垃圾郵件。

第一排員工各自負責看一個特徵:有沒有「免費」這個詞、寄件者是不是陌生人、有沒有奇怪的連結。每個人看完之後,給出一個分數,交給第二排的組長。

組長把這些分數加權彙整,再傳給最後一位主管做最終判斷:是垃圾郵件,還是正常信件。

如果判錯了,主管會回頭跟每個人說「你給的分數要調高一點」或「你那個指標沒那麼重要,權重降低」。這個調整過程反覆做幾百萬次之後,整個團隊就變得很準。

神經網路的運作邏輯就是這樣:一層一層傳遞資訊,判錯就回頭調整,直到準確率夠高。

神經網路怎麼運作

神經元(Neuron)

一個人工神經元做的事情很單純:

接收多個輸入值,每個輸入乘上一個權重(weight),全部加起來之後再加上一個偏差值(bias),最後通過一個「激活函數」(activation function)決定要不要把訊號傳出去。

用數學寫就是:output = activation(w1*x1 + w2*x2 + ... + bias)

激活函數的作用是引入非線性。如果沒有它,不管疊多少層,整個網路都只能算線性關係,根本處理不了圖片辨識或語言理解這種複雜問題。常見的激活函數包括 ReLU、Sigmoid 和 Tanh。

層(Layer)

神經網路由三種層組成:

輸入層(Input Layer)負責接收原始資料。如果是一張 28×28 的灰階圖片,輸入層就有 784 個神經元,每個對應一個像素值。

隱藏層(Hidden Layer)是做運算的地方。層數越多,網路能學到的模式就越複雜。當隱藏層超過兩層,就進入「深度學習」的範疇。

輸出層(Output Layer)給出最終結果。分類任務的輸出層通常有幾個類別就有幾個神經元,數值最高的那個就是模型的答案。

訓練:反向傳播

神經網路的學習過程分四步:

前向傳播:資料從輸入層一路算到輸出層,得到一個預測結果。

計算誤差:把預測結果和正確答案比對,用損失函數(Loss Function)算出差了多少。

反向傳播:從輸出層往回算,找出每個權重對誤差的貢獻有多大。這就是「反向傳播演算法」(Backpropagation)在做的事。

更新權重:根據每個權重的貢獻程度,微調它的數值,讓下一次的預測更接近正確答案。

這四步反覆做幾十萬到幾百萬次(每次用一批資料),模型的準確率就會慢慢提升。整個過程像老師批改考卷:看錯在哪、找出原因、針對性地糾正。

常見的神經網路架構

CNN(卷積神經網路)

Convolutional Neural Network 專門處理有空間結構的資料,最典型的就是圖片。

CNN 的核心是「卷積核」(Filter),一個小方塊在圖片上滑動,偵測局部特徵。淺層的卷積核抓邊緣和紋理,深層的抓更抽象的模式(臉型、物體輪廓)。

應用場景:影像辨識、醫療影像判讀、自動駕駛的物件偵測、工廠產線的瑕疵檢測。

RNN(循環神經網路)

Recurrent Neural Network 處理序列資料,特點是有「記憶」機制。前一個時間步的輸出會回饋給下一個時間步當作輸入,所以它能理解順序關係。

原始 RNN 有個問題:序列太長的時候,前面的資訊會「忘光」(梯度消失)。LSTM(長短期記憶)和 GRU 是改良版,加入了「記憶閘門」機制來決定哪些資訊該記、哪些該忘。

應用場景:語音辨識、時間序列預測、機器翻譯(已大部分被 Transformer 取代)。

Transformer

2017 年 Google 提出的架構,靠「自注意力機制」(Self-Attention)一次看完整個序列,不需要像 RNN 一步一步算。這讓它能大規模平行運算,訓練速度快很多。

GPT、Claude、Gemini 這些大型語言模型的底層全部都是 Transformer。它幾乎取代了 RNN 在自然語言處理的地位,也被引入到圖像(ViT)和語音領域。

詳細原理可以看:Transformer 是什麼?

GAN(生成對抗網路)

Generative Adversarial Network 由兩個網路對抗組成:生成器(Generator)負責創造假資料,判別器(Discriminator)負責分辨真假。兩個互相競爭,生成器越來越會騙人,判別器越來越會抓假。

GAN 曾經是圖像生成的主流技術,雖然現在 Diffusion Model 在圖像生成上更常用,但 GAN 在資料增強、超解析度和風格轉換等領域仍然有用。

神經網路能做什麼

影像辨識:辨識人臉、偵測物件、判讀醫療影像。

自然語言處理:翻譯、文字生成、情感分析、摘要。

語音處理:語音轉文字、文字轉語音、聲音合成。

遊戲與策略:AlphaGo 用神經網路評估棋局、遊戲 AI 用強化學習搭配神經網路做決策。

科學研究:蛋白質結構預測(AlphaFold)、藥物分子設計、氣候模擬。

神經網路的限制

黑盒問題:網路越深,越難解釋它為什麼做出某個判斷。對醫療、金融等需要解釋性的領域,這是嚴重的問題。

資料飢渴:訓練有效的神經網路通常需要大量標記資料。資料不夠的時候,模型容易過擬合(Overfitting),在訓練資料上表現很好,遇到新資料就失準。

運算成本高:訓練大型神經網路需要大量 GPU 和電力。GPT-4 等級的模型,單次訓練成本估計數千萬美元。

脆弱性:對輸入的微小擾動很敏感。在圖片上加一點人眼看不出的雜訊,就可能讓模型把熊貓判成長臂猿。

泛化困難:在特定資料集上表現優異,換到不同分布的資料可能直接失效。

安全與風險

對抗樣本攻擊(Adversarial Examples):攻擊者精心設計微小的擾動加到輸入資料上,讓神經網路做出錯誤判斷。這在自動駕駛場景特別危險,例如在停車標誌上貼幾張貼紙,可能讓 AI 誤判為速限標誌。

模型竊取(Model Extraction):透過大量查詢目標模型的 API,用回覆的結果訓練出一個功能相近的「影子模型」,等於偷了人家的智慧財產。

成員推論攻擊(Membership Inference):判斷某筆特定資料是否曾經被用來訓練模型。如果模型是用病患資料訓練的,這等於洩漏了個人隱私。

後門攻擊(Backdoor Attack):在訓練資料中注入帶有特定觸發模式的樣本,讓模型在遇到這個模式時做出指定的錯誤行為,平時卻表現正常,很難被偵測到。

供應鏈風險:使用別人訓練好的模型(預訓練模型)時,你無法完全確認模型裡有沒有藏後門或偏見。

台灣相關應用

半導體製造:台積電使用 CNN 做晶圓瑕疵檢測,取代部分人工目視檢查,速度和準確率都提升。

醫療影像:台灣多家醫學中心用神經網路輔助判讀 X 光、CT 和病理切片,協助醫師早期發現肺結節和病變。

金融風控:國內銀行用神經網路偵測異常交易模式,協助防堵詐騙和洗錢。

智慧交通:高速公路的車輛辨識和流量預測系統,底層也是 CNN 在做即時的影像分析。

知識檢測

讀完文章後,測試一下你對這個主題的理解。

常見問題 FAQ

Neural Network 和 Deep Learning 有什麼不同?

Deep Learning 是指使用「多層」(通常超過兩層隱藏層)神經網路的機器學習方法。所以 Deep Learning 是 Neural Network 的一個子集,專指那些比較深(層數多)的網路。

神經網路真的模仿大腦嗎?

最初的靈感確實來自生物神經元,但現代的人工神經網路和真正的大腦差異極大。真實的神經元用電化學訊號、有時間動態、連結方式完全不同。把它想成「借用了一個概念」比較準確。

訓練一個神經網路要多久?

差異極大。一個簡單的圖片分類模型可能用筆電幾分鐘就訓練完。GPT-4 等級的大型語言模型需要上千顆 GPU 跑好幾個月。取決於模型大小、資料量和硬體。

我需要 GPU 才能跑神經網路嗎?

訓練時幾乎一定需要 GPU(或 TPU)來加速。推論(用訓練好的模型做預測)時,小型模型用 CPU 就行,大型模型還是需要 GPU。雲端服務(AWS、GCP)可以按需租用 GPU。

為什麼神經網路有時候會出錯?

神經網路是從統計模式中學習的。它看過大量的「狗的圖片」後能認狗,但它並不真正「理解」狗是什麼。遇到和訓練資料分布不同的輸入(角度奇怪、光線異常),或者刻意設計的對抗樣本,就可能判斷失誤。

神經網路和傳統程式設計有什麼不同?

傳統程式設計是人寫規則,告訴電腦「如果 A 就做 B」。神經網路是給電腦大量範例,讓它自己學出規則。好處是能處理人類難以明確定義規則的問題(像辨識貓),壞處是你很難控制它學到了什麼。

初學者該怎麼學神經網路?

建議路線:先學 Python 基礎,接著用 PyTorch 或 TensorFlow 跑一個手寫數字辨識(MNIST)的範例,理解前向傳播和反向傳播的實際運作。理論方面,3Blue1Brown 的 YouTube 影片系列把直覺講得很清楚。

台灣有哪些學習資源?

台大的機器學習課程(李宏毅教授)在 YouTube 免費公開,是中文世界最受歡迎的 ML/DL 入門課程。此外,台灣人工智慧學校和各大學的推廣教育也有相關課程。

參考資料