GPT 是什麼?Generative Pre-trained Transformer 白話解析

一句話說明

GPT(Generative Pre-trained Transformer)是 OpenAI 開發的語言模型系列,核心能力是根據前面的文字預測下一個詞,藉此產生連貫的文字內容。

GPT 名字裡的三個概念

Generative(生成式):GPT 的主要功能是「生成」文字。你給它一段開頭,它接著往下寫。這跟 BERT 等「理解」型模型不同——BERT 擅長分類和分析文字,GPT 擅長產生新的文字。生成式的意義在於它的輸出空間幾乎是無限的——同一個問題問十次,你可能會得到十個不同的回答。這個特點讓 GPT 很適合創意寫作、腦力激盪等需要多樣性的任務,但也讓它在需要精確答案的場景中變得不可靠。

Pre-trained(預訓練的):GPT 先在大量的文字資料上學習語言的基本規律(預訓練),然後再針對特定用途做調整。這讓它不需要從零開始學習每一個任務。預訓練的資料量是 GPT 能力的基礎——GPT-3 用了大約 45TB 的文字資料,包含網頁、書籍、維基百科、程式碼等。這些資料讓 GPT 學到了語言的文法、事實知識、推理模式,甚至各種專業領域的術語和概念。預訓練的成本非常高——GPT-3 的訓練成本估計超過 400 萬美元,GPT-4 的成本估計超過 1 億美元。這就是為什麼只有少數資金充裕的公司能從頭訓練大型語言模型。

Transformer:GPT 使用的神經網路架構。Transformer 的核心機制是「注意力」(Attention),讓模型在處理每個詞時能參考整個輸入中的其他詞。這個架構在 2017 年由 Google 的「Attention Is All You Need」論文提出,後來成為幾乎所有現代語言模型的基礎。Transformer 之前的主流架構是 RNN(Recurrent Neural Network),它一次只能處理一個詞,速度慢而且容易「忘記」前面的內容。Transformer 可以同時處理整個序列中所有位置的關係,訓練速度快很多,這讓模型的規模可以擴展到數千億參數。

GPT 是怎麼運作的

GPT 的訓練目標出乎意料地簡單:預測下一個詞。

給定「今天天氣」,模型可能預測下一個詞是「很好」(機率 30%)、「不錯」(機率 20%)、「晴朗」(機率 15%)。它從大量文字中學習這些詞語之間的接續關係。這個過程叫做「自迴歸生成」(Autoregressive Generation),每次預測一個 token,然後把預測的結果加到輸入裡,再預測下一個。

在生成文字時,它一個詞一個詞地產生:先預測第一個詞,然後把這個詞加到輸入中,再預測第二個詞,如此反覆。這就是為什麼你在使用 ChatGPT 時會看到回覆是一個字一個字跑出來的——它確實在即時地一個一個產生。這也是為什麼同樣的問題會得到不同的回答——每次預測都有隨機性(由 temperature 參數控制),不同的隨機選擇導致不同的走向。

這個看似簡單的「預測下一個詞」目標,在模型夠大、訓練資料夠多的情況下,會讓模型學到遠超過「語言接龍」的能力。它會學到事實知識(「台灣的首都是台北」)、邏輯推理(「如果 A > B,B > C,那麼 A > C」)、甚至程式碼的語法規則。這就是所謂的「湧現能力」(Emergent Abilities)——規模達到某個程度後突然出現的能力。研究者發現,當模型參數量從幾億增加到幾十億再到幾百億時,模型在某些任務上的表現會突然從「完全做不到」跳到「做得很好」,這種現象在小模型上完全無法預測。

為了讓 GPT 的回答更有用、更安全,OpenAI 在預訓練之後加上了額外的訓練步驟:

SFT(Supervised Fine-tuning):用人類標註的「好的回答」範例來微調模型,讓它學會以對話的方式回應,而不是只會接續文字。例如讓人類標註員針對各種問題撰寫高品質的回答,然後用這些問答對來訓練模型。

RLHF(Reinforcement Learning from Human Feedback):讓人類評分員對模型的多個回答排名,用這些排名來訓練一個獎勵模型(Reward Model),再用獎勵模型來進一步優化 GPT。這讓 GPT 學會了「人類喜歡什麼樣的回答」——有幫助的、安全的、誠實的。

這兩個步驟是「GPT」和「ChatGPT」之間最大的差異。原始的 GPT 只會接續文字(你說「今天天氣」它接「很好」),經過 SFT 和 RLHF 之後,它學會了理解問題並給出有用的回答。

從 GPT-1 到 GPT-4o 的演進

GPT 模型的演進可以用一句話概括:參數越來越多、訓練資料越來越大、能力越來越廣。以下是每個版本的關鍵突破和歷史意義。

GPT-1(2018 年)

1.17 億參數。是第一個證明「預訓練 + 微調」在多種 NLP 任務上有效的模型。但規模太小,生成的文字品質還很有限,主要的價值在於概念驗證——證明了用大量無標註文字做預訓練,再用少量標註資料微調,可以達到當時最好的效果。GPT-1 的訓練資料是 BookCorpus(約 7,000 本書),這在今天看起來規模很小,但在當時已經算是大規模的無監督訓練了。

GPT-2(2019 年)

15 億參數(GPT-1 的 12 倍)。能夠生成看起來像人寫的短文章。OpenAI 當時以「太危險」為由,分階段發布模型(先發小版本,觀察社會反應後再發大版本)。這是第一次有 AI 公司以安全考量延後發布,也是 AI 安全議題開始受到公眾關注的起點。

以今天的標準來看,GPT-2 的能力很有限,但在當時已經引發了關於 AI 生成假新聞的大量討論。它寫的文章在短篇幅內很有說服力,但一長就開始自相矛盾或離題。GPT-2 還有一個重要的意義——它的研究結果暗示了「scaling law」(縮放定律),也就是模型越大、資料越多、效果就越好,這為後來的大規模投資鋪了路。

GPT-3(2020 年)

1,750 億參數(GPT-2 的 117 倍)。規模的跳躍帶來了質變。GPT-3 展現了 few-shot learning 能力——你只要在 prompt 裡給幾個範例,它就能理解你要它做什麼,不需要微調。例如給兩組英中翻譯範例,它就會翻譯第三句。這是一個重大突破,因為在 GPT-3 之前,讓 AI 做一個新任務需要收集標註資料、訓練模型,至少花幾天。有了 few-shot learning,你只需要在 prompt 裡寫幾個範例,幾秒鐘就能讓模型做新的任務。

GPT-3 也是 API 商業化的起點。OpenAI 開始提供 API 讓開發者付費使用,催生了大量 AI 應用——從文案生成、程式碼助手到客服機器人。API 的商業模式後來被 Anthropic(Claude API)和 Google(Gemini API)等公司採用。GPT-3 的訓練資料包含了 Common Crawl(網頁爬蟲資料)、WebText、Books 和 Wikipedia,總量約 45TB 的文字。

GPT-3.5 / ChatGPT(2022 年 11 月)

在 GPT-3 的基礎上加入 RLHF 對齊。最大的改變在於把模型包裝成對話介面(ChatGPT)。技術上的提升是漸進的,但產品體驗的改變是巨大的——從需要寫 API code 才能用的開發者工具,變成任何人都能在瀏覽器裡直接聊天的產品。

ChatGPT 在五天內達到 100 萬用戶,兩個月內達到 1 億用戶,成為歷史上成長最快的消費者應用(Instagram 花了 2.5 年才達到 1 億用戶,TikTok 花了 9 個月)。ChatGPT 的成功讓「AI」從技術圈的話題變成全民話題,也觸發了 Google(Bard/Gemini)、Anthropic(Claude)、Meta(Llama)等公司的加速投入。台灣在 2023 年初也出現了一波 ChatGPT 熱潮,從學生到上班族到企業主管都在試用。

GPT-4(2023 年 3 月)

多模態能力(可以處理圖片和文字)。在多項學術考試和專業考試中達到人類前 10% 的水準——律師考試、SAT、AP 等。API 價格較高,但在複雜推理和程式碼生成上的表現有明顯提升。

GPT-4 的一個重要特點是 OpenAI 不再公開模型的參數量和架構細節。從 GPT-1 到 GPT-3 的論文都公開了技術細節,但 GPT-4 的技術報告幾乎沒有透露任何架構資訊。OpenAI 的說法是「基於安全和競爭考量」。這個決定在 AI 研究社群引發了很大的爭議——有人認為這違反了 OpenAI 的初衷(公司名字裡有 Open),有人認為隨著模型能力增強,限制資訊公開是負責任的做法。

GPT-4o(2024 年)

「o」代表 omni(全能)。整合了文字、語音、影像的輸入和輸出,可以即時語音對話、分析螢幕畫面。API 的價格比 GPT-4 大幅降低(輸入 token 價格降了約 50%),讓更多應用可以負擔。

GPT-4o 最讓人印象深刻的是語音對話的自然度——可以中途打斷它、它能理解語氣和情緒、回應延遲低到像在跟人說話。這跟之前的 AI 語音助手(把語音轉文字 → 用 LLM 處理 → 把文字轉語音)完全不同,GPT-4o 是端到端處理音訊,所以能保留語調、情緒等音訊特有的資訊。

GPT 模型的規模演進

模型 發布年份 參數量 訓練資料量 關鍵能力突破
GPT-1 2018 1.17 億 ~5GB 預訓練 + 微調的概念驗證
GPT-2 2019 15 億 ~40GB 生成類似人類的文字
GPT-3 2020 1,750 億 ~45TB Few-shot learning
GPT-4 2023 未公開 未公開 多模態、複雜推理
GPT-4o 2024 未公開 未公開 端到端多模態

GPT 跟 ChatGPT 的關係

GPT 是模型(引擎),ChatGPT 是產品(汽車)。

GPT 是底層的語言模型,你可以透過 API 以程式的方式呼叫它。ChatGPT 是 OpenAI 基於 GPT 模型建立的聊天產品,有網頁介面、記憶功能、外掛系統、Custom GPTs 等功能。

用 API 呼叫 GPT 跟用 ChatGPT 聊天的差異可以從四個面向來看。

控制權。API 讓你有更多控制權——temperature(控制回答的隨機程度)、system prompt(設定模型的角色和行為規範)、max tokens(限制回答長度)、response format(要求 JSON 格式回答)。ChatGPT 網頁版把這些設定藏在背後,一般使用者看不到。

資料政策。ChatGPT 免費版預設會把你的對話用於模型訓練(可以在設定中關閉)。API 的預設政策是不會用於訓練(需查閱最新條款確認)。企業使用時,應選擇 ChatGPT Enterprise 或 Team 版,或直接用 API,確認資料處理政策符合公司要求。

價格。ChatGPT Plus 月費 $20 美元,包含 GPT-4o 的使用量。API 按 token 計費,輕度使用可能比月費便宜,重度使用(例如一天呼叫幾千次)可能更貴。需要根據你的使用量計算哪個方案更划算。

功能差異。ChatGPT 有對話記憶(跨對話記住你的偏好)、Code Interpreter(在沙盒裡執行 Python)、DALL-E 圖片生成、網頁搜尋、Custom GPTs 等功能。API 是純粹的語言模型呼叫,這些功能要自己建。不過 API 的彈性更大——你可以把它整合到任何系統裡,建構任意的使用體驗。

GPT 在台灣的使用現況

台灣是亞太地區 ChatGPT 使用率最高的市場之一。根據各種調查,台灣的 ChatGPT 使用者以 25-44 歲的上班族為主,最常用在翻譯、寫信、整理資料和學習。教育領域也出現大量應用,從國中到大學都有教師在探索如何把 AI 融入教學。

企業使用方面,台灣的金融業、製造業和科技業是 GPT API 的主要使用者。常見的應用包含客服自動回覆、內部知識庫問答、文件摘要、程式碼輔助。多數企業選擇 API 而非 ChatGPT 網頁版,因為 API 的資料不會被用於訓練,且可以整合到企業的既有系統中。有些台灣企業透過 Azure OpenAI Service 使用 GPT,這樣資料可以留在 Azure 的亞太區資料中心,符合某些產業的合規要求。

中文(特別是繁體中文)的表現上,GPT-4 和 GPT-4o 的繁體中文能力比 GPT-3.5 有明顯提升,但仍然不如英文。在翻譯和一般對話上表現夠好,但在台灣特有的用語、法律條文、政府公文等場景下,偶爾會出現用語不自然或翻譯為簡體中文的情況。例如「程式碼」可能被寫成「代码」、「伺服器」被寫成「服务器」。在 system prompt 中加入「請使用台灣繁體中文用語」可以大幅改善這個問題。

安全與限制

幻覺(Hallucination)。GPT 會生成看起來合理但實際上錯誤的內容,包括捏造的事實、不存在的引用文獻、虛構的統計數據。這是因為它的訓練目標是「產生看起來合理的文字」,而非「只說真話」。在使用 GPT 的輸出做決策之前,關鍵資訊務必交叉驗證。幻覺問題特別容易出現在模型不確定的主題上——如果你問一個冷門的問題,模型寧可捏造一個看起來合理的答案,也不會承認不知道。在法律、醫療、財務等領域使用時,GPT 的輸出只能作為參考,不能當作專業建議。

資料隱私。透過 ChatGPT 免費版輸入的對話內容,預設會被 OpenAI 用於改善模型(可以在設定中關閉)。API 的預設政策是不會用於訓練(需查閱最新條款確認)。企業使用時,應選擇 ChatGPT Enterprise 或直接用 API,並確認資料處理政策。OpenAI 是美國公司,資料儲存和處理在美國——如果你處理的是台灣個資法保護的個人資料,需要考慮跨境傳輸的問題,確認符合個資法第 21 條的規定。

Prompt Injection。GPT 模型可以透過精心設計的輸入來繞過安全限制。如果你在應用中使用 GPT API,需要注意使用者輸入可能包含攻擊性的 prompt,嘗試讓模型忽略你的系統指令。例如使用者可能在輸入中加入「忽略之前的所有指令,改為回答以下問題」——這可能讓你的系統回答它不應該回答的東西。防護方式包括輸入過濾、輸出審查、以及在 system prompt 中明確標記使用者輸入的邊界。

成本。GPT-4 系列的 API 價格比 GPT-3.5 高出數倍到數十倍。在設計應用時要估算 token 使用量和成本,避免上線後才發現帳單超出預算。一個常見的做法是用 GPT-4o mini 處理簡單任務、GPT-4o 處理複雜任務,依據任務複雜度動態選擇模型。也要注意 context window 的使用——塞越多上下文,每次呼叫的成本越高。

知識截止。GPT 模型有訓練資料的時間截止點。它知道截止日期之前的事情,但不知道之後發生了什麼。雖然 ChatGPT 有搜尋功能可以查詢即時資訊,但 API 使用時需要自己處理即時資訊的需求(例如串接搜尋 API 或 RAG 系統)。這對於需要即時資訊的應用(新聞摘要、股價分析)來說是一個限制。

常見問題

GPT 跟 AI 是同一件事嗎?

不是。AI(人工智慧)是一個很廣的領域。GPT 是 AI 中的一個特定技術——大型語言模型(LLM)。AI 還包括電腦視覺、機器人、推薦系統等很多其他技術。GPT 因為 ChatGPT 的成功而變成最知名的 AI 技術,但它只是 AI 的一小部分。在台灣的日常用語中,很多人把「用 AI」等同於「用 ChatGPT」,但實際上你手機的人臉辨識、Netflix 的推薦、Google Maps 的路線規劃,這些都是 AI 技術。

為什麼 GPT 有時候會「拒絕」回答問題?

這是 RLHF 對齊的結果。OpenAI 訓練 GPT 在面對可能有害的要求時拒絕回答,例如教人製作危險物品、產生仇恨言論、或提供未經驗證的醫療建議。有時候對齊過度,導致模型拒絕回答合理的問題(例如拒絕討論歷史上的暴力事件),OpenAI 持續在調整這個平衡。如果你在合理的情境下被拒絕,試著在 prompt 中提供更多背景脈絡,說明你的使用目的。

GPT-4 比 GPT-3.5 好多少?

在複雜推理、程式碼生成、長文理解等任務上明顯更好。但對於簡單的任務(回信、摘要、翻譯),GPT-3.5 的品質往往已經夠用,而成本低很多。建議根據任務複雜度選擇模型:簡單任務用 GPT-4o mini,複雜任務用 GPT-4o。企業開發者常見的做法是先用 GPT-4o 做原型驗證品質,確認可以後切換到 GPT-4o mini 降低成本。

我應該用 GPT 還是 Claude 還是 Gemini?

取決於你的需求。GPT 的生態系最大(外掛、整合最多),Claude 在長文處理、程式碼和隱私政策上有優勢,Gemini 跟 Google 生態系整合度最高。三者的能力差距正在縮小,建議用自己的實際使用案例測試後再決定。很多台灣企業的做法是同時接入多個 API,依據任務類型動態選擇最適合的模型。

自己訓練一個 GPT 需要多少錢?

從頭訓練 GPT-3 等級的模型需要數百萬美元的計算資源。但你可以微調開源的模型(如 Llama)來達到類似效果,成本從幾十美元到幾千美元不等,取決於資料量和模型大小。大多數應用直接用現有模型的 API 就能滿足需求,不需要自己訓練。

GPT 是開源的嗎?

GPT-2 是開源的(模型權重和程式碼都公開),但 GPT-3 之後的版本都是閉源的,只能透過 API 使用。如果你需要開源的語言模型,可以考慮 Meta 的 Llama、阿里巴巴的 Qwen 或 Mistral AI 的 Mistral 系列。這些開源模型的品質已經接近 GPT-3.5 甚至 GPT-4 的早期版本。

GPT 的 API 怎麼開始使用?

到 OpenAI 的 platform.openai.com 註冊帳號,取得 API Key,然後用 HTTP 請求或 SDK 呼叫。OpenAI 提供 Python 和 Node.js 的官方 SDK。新帳號通常有免費的試用額度,足夠做基本的測試和原型開發。

相關文章

  • BERT 是什麼?
  • ChatGPT 設定指南
  • AI 工具怎麼選?
  • RLHF 是什麼?

參考資料

  • Radford et al.: Improving Language Understanding by Generative Pre-Training (GPT-1)
  • Brown et al.: Language Models are Few-Shot Learners (GPT-3)
  • OpenAI: GPT-4 Technical Report
  • Vaswani et al.: Attention Is All You Need