Llama 是什麼?Meta 開源大型語言模型完整介紹

一句話說明

Llama 是 Meta(Facebook 母公司)推出的開源大型語言模型系列,讓開發者可以免費下載模型權重,在自己的硬體上跑 AI,不需要依賴任何雲端 API。

Llama 是什麼

Llama 的全名是 Large Language Model Meta AI,是 Meta 從 2023 年開始發布的一系列大型語言模型。跟 OpenAI 的 GPT 系列或 Google 的 Gemini 不同,Llama 把模型的權重(weights)公開釋出,任何人都可以下載、在自己的伺服器上執行、甚至微調成自己的版本。

這裡要釐清一個常見的混淆:Llama 經常被稱為「開源模型」,但嚴格來說它是「開放權重」(open-weight)模型。差別在哪裡?

真正的開源(open source)遵循 OSI(Open Source Initiative)的定義,代表程式碼和訓練資料都公開,而且授權條款不限制使用方式。Llama 公開了模型權重和推論程式碼,但訓練資料沒有公開,而且授權條款有商業使用的限制條件(例如月活躍用戶超過 7 億的企業需要額外申請授權)。

所以 Llama 的定位比較像是「開放權重、有條件商用」。你可以看到模型裡每一個參數的數值、可以在自己的機器上跑、可以拿來做商業應用,但你不知道它是用哪些資料訓練出來的,也不能在任何情境下都不受限地使用。

即便如此,Llama 在實務上帶來的影響跟開源差不多:它讓全世界的開發者、研究者和企業都能取得頂尖等級的語言模型,在上面建構自己的應用。在 Llama 之前,這種等級的模型只有少數幾家公司能使用。

從生態系的角度來看,Llama 的影響力遠超過模型本身。因為權重公開,社群在上面衍生出了數千個微調版本——針對中文優化的、針對程式碼生成的、針對醫療領域的、甚至移除了安全護欄的版本都有。像 HuggingFace 上以 Llama 為基底的衍生模型數量已經超過了任何其他開放權重模型系列。工具鏈也跟著完善,從量化工具(llama.cpp、GPTQ、AWQ)到推論框架(vLLM、TGI)到本地執行工具(Ollama),形成了一個龐大的生態系。

Meta 為什麼要開源 Llama

Meta 把花了大量資源訓練出來的模型免費送人,看起來不合商業邏輯。但仔細看就會發現,這個策略有很清楚的商業考量。

第一,建立生態系。當開發者都在 Llama 上面開發應用、微調模型、發布研究,整個生態系就圍繞著 Meta 的模型建構起來。這跟 Google 當年開源 Android 的邏輯類似——Android 免費,但 Google 透過它取得了行動裝置市場的主導地位。Meta 希望 Llama 成為 AI 領域的「Android」。

第二,跟 OpenAI 和 Google 競爭。Meta 在 AI 服務市場上跟 OpenAI(ChatGPT)和 Google(Gemini)直接競爭不太現實——它沒有像 ChatGPT 那樣的消費者產品。但透過開源,Meta 可以讓整個開發者社群幫忙改進模型、發現問題、建構工具鏈。用社群的力量去對抗競爭對手的封閉體系。

第三,利用社群的力量改進產品。開源之後,全世界的研究者都在用 Llama 做實驗、找漏洞、提出改進方案。這些回饋讓 Meta 自己的產品(Instagram、WhatsApp、Facebook 的 AI 功能)也跟著受益。等於是免費的外部研發力量。

第四,吸引和留住 AI 人才。頂尖的 AI 研究者傾向在開放的環境下工作,因為他們的研究成果可以發表論文、被同行引用。如果所有東西都是閉源的,對學術導向的研究者來說吸引力會降低。Llama 的開源策略讓 Meta 在搶人方面更有優勢。

第五,Meta 的核心營收來源是廣告,AI 模型本身不是它的商品。對 Meta 來說,Llama 是讓自家產品更好用的工具。把模型開放出去不會侵蝕它的營收,反而能透過生態系的壯大間接強化自己的平台。

第六,降低對外部供應商的依賴。如果整個產業都用 OpenAI 的模型,那 OpenAI 就有很大的議價權。Meta 推動開源生態系,等於是在產業層面降低了任何單一閉源供應商壟斷市場的風險。這也解釋了為什麼很多大型科技公司(即使跟 Meta 是競爭對手)都對 Llama 的開源表示歡迎。

Llama 版本演進

Llama 從 2023 年 2 月至今已經發布了多個主要版本,每一代在模型規模、訓練方法和可用性上都有明顯的進步。

Llama 1(2023 年 2 月)

Llama 1 是系列的起點。Meta 發布了四個尺寸的模型:7B、13B、33B 和 65B 參數。這些模型的訓練資料全部來自公開可取得的資料集,總量約 1.4 兆個 tokens。

Llama 1 原本只開放給學術研究者,需要申請才能取得權重。但發布後不久,權重就被洩漏到了網路上。這次洩漏事件反而讓 Llama 被更多人使用和研究,開源社群在上面做了大量的微調和改版(像是 Alpaca、Vicuna 等)。某種程度上,這次洩漏讓 Meta 看到了開源的潛力。

技術上,Llama 1 的 65B 模型在多項評測上的表現跟 Google 的 PaLM 540B 相當,代表它用更少的參數達到了更大模型的效能。這驗證了「高品質訓練資料加上更長的訓練時間」可以彌補模型規模的差距。

Llama 1 的訓練資料來源包括 CommonCrawl(網頁爬取資料,佔最大比例)、C4、GitHub 程式碼、Wikipedia、Books、ArXiv 論文和 StackExchange。Meta 特別強調所有訓練資料都是公開可取得的,沒有使用 Meta 旗下產品(Facebook、Instagram)的用戶資料。

Llama 2(2023 年 7 月)

Llama 2 是 Llama 系列真正走向商業化的版本。最大的改變有兩個。

第一,授權條款放寬。Llama 2 提供了商業使用授權,只要你的產品月活躍用戶不超過 7 億,就可以免費商用。這個門檻其實只有極少數公司會碰到(基本上就是 Meta 的直接競爭對手等級),對大部分企業來說等於是免費的。

第二,新增了 Chat 模型。除了基礎模型之外,Meta 還發布了經過 RLHF(Reinforcement Learning from Human Feedback,基於人類回饋的強化學習)訓練的對話版本。這意味著開發者可以直接拿 Llama 2 Chat 來做對話應用,不需要自己做 alignment 訓練。

模型尺寸有三種:7B、13B 和 70B。訓練資料量增加到 2 兆個 tokens,比 Llama 1 增加了 40%。70B 模型的效能在多項評測上接近 GPT-3.5 的水準。

Meta 也跟 Microsoft 合作,讓 Llama 2 可以直接在 Azure 雲端平台上取得,降低了企業使用的門檻。

Llama 2 的另一個技術改進是引入了更長的上下文窗口(4K tokens)和更好的推論效率。Meta 也發布了詳盡的技術報告,公開了訓練細節、安全性評估方法和紅隊測試結果,讓外界可以更好地理解模型的能力和限制。這種透明度在當時的大模型領域相當少見。

Llama 3(2024 年 4 月)

Llama 3 在訓練品質上有大幅的跳躍。主要的改變:

訓練資料量暴增到超過 15 兆個 tokens,是 Llama 2 的 7 倍以上。Meta 開發了更精細的資料清洗和去重流程,確保資料品質。

Tokenizer 從 SentencePiece 換成了基於 tiktoken 的版本,詞彙表從 32,000 個 tokens 擴大到 128,256 個。更大的詞彙表代表同樣的文字需要更少的 tokens 來表達,提高了效率。

模型尺寸為 8B 和 70B(參數量經過調整)。Llama 3 8B 在多項評測上超越了 Llama 2 70B,代表 Meta 在「讓小模型也很強」這件事上下了很多功夫。Llama 3 70B 的效能則接近 GPT-4 的早期版本。

初始發布時上下文窗口(context window)為 8K tokens。

Llama 3 還改進了模型架構的細節。它在所有尺寸的模型上都採用了 Grouped-Query Attention(GQA),而 Llama 2 只在 70B 上使用。這讓 8B 模型的推論速度更快、記憶體佔用更低。訓練過程也更精緻——Meta 使用了超過 16,000 張 H100 GPU 進行訓練,在工程規模上創下了開放權重模型的紀錄。

Llama 3.1(2024 年 7 月)

Llama 3.1 是 Llama 3 的擴展版本,帶來了幾個關鍵升級。

新增 405B 參數模型。這是當時最大的開放權重模型,效能在多項評測上跟 GPT-4o 和 Claude 3.5 Sonnet 相近。一個開放權重的模型能跟閉源商業模型打成平手,對整個產業影響重大。

上下文窗口擴展到 128K tokens。這讓 Llama 可以處理長文件、整本書籍、大型程式碼庫等場景。

多語言支援大幅提升,支援八種語言,包括英語、西班牙語、法語、德語、義大利語、葡萄牙語、印地語和泰語。

新增原生工具呼叫(tool use)能力。模型可以學會在適當的時機呼叫外部工具,像是搜尋引擎、計算器或 API,讓它的應用場景更廣。

Meta 同步釋出了 Llama Stack——一套標準化的工具和 API,包含推論、安全防護、記憶體管理、Agent 編排等功能。Llama Stack 的目標是讓開發者更容易在 Llama 上建構應用,類似於 OpenAI 的 API 生態系,但完全開放。

Llama 3.2(2024 年 9 月)

Llama 3.2 把 Llama 系列帶入了兩個新方向。

第一個方向是視覺(Vision)。新增了 11B 和 90B 的多模態模型,可以理解圖片內容、回答跟圖片相關的問題、從圖片中擷取資訊。這讓 Llama 從純文字模型升級為可以「看圖」的模型。

第二個方向是輕量化。新增了 1B 和 3B 的超小型模型,專門設計給手機和邊緣裝置使用。這些模型可以在沒有網路的情況下直接在手機上跑,適合需要離線 AI 能力或極低延遲的場景。

Llama 3.2 的意義在於,它表明 Meta 把 Llama 生態系的觸角從雲端伺服器延伸到了消費者裝置端。這跟 Meta 自身的硬體策略也有關——Meta 在 Ray-Ban 智慧眼鏡等裝置上需要輕量的 AI 模型,Llama 3.2 的小模型可以直接在這類裝置上運行。

值得注意的是,Llama 3.2 的視覺模型(11B 和 90B)在歐盟地區因為資料隱私法規的原因,初期並未提供下載。這反映了開放權重模型在全球不同法規環境下面臨的挑戰。

Llama 4(2025 年 4 月)

Llama 4 是系列的最新世代,引入了 Mixture-of-Experts(MoE)架構,跟之前的 Dense(稠密)架構有根本性的不同。

Scout 模型:總參數 109B,但因為採用 MoE 架構,每次推論只啟動 17B 的參數。這讓它的推論成本跟一個 17B 的 Dense 模型差不多,但知識容量是 109B 級別的。Scout 使用 16 個專家,每次啟動 1 個。它的上下文窗口達到 1,000 萬(10M)tokens,是目前開放權重模型中最長的,可以一次讀入數十本書或一整個程式碼庫。

Maverick 模型:規模更大的版本,同樣使用 MoE 架構,有 128 個專家。在多項評測上跟 GPT-4o 和 Gemini 2.0 Flash 競爭。

Llama 4 也是第一個從一開始就原生支援多模態的 Llama 版本——文字和圖片理解能力在預訓練階段就整合進去了,而 Llama 3.2 的視覺能力是後來才加上的。

不過 Llama 4 的發布也引發了一些爭議。部分社群成員和評測者指出,Meta 公布的 benchmark 成績跟獨立評測的結果有落差,特別是在某些推理任務上。這提醒了使用者:官方公布的評測數字只能當作參考,實際效能還是要在自己的任務上測試才準。

從 Llama 1 到 Llama 4 的發展軌跡可以看到幾個趨勢。訓練資料量從 1.4 兆 tokens 成長到數十兆 tokens,每一代都在翻倍。模型架構從單純的 Dense 走向 MoE,追求更好的效率。應用範圍從純文字擴展到多模態,從雲端伺服器延伸到手機和邊緣裝置。授權條款也越來越開放,門檻越來越低。

技術特色

Llama 系列在架構設計上採用了幾個關鍵的技術,讓它在同等參數量下有更好的效能表現。

分組查詢注意力(Grouped-Query Attention, GQA)。傳統的多頭注意力(Multi-Head Attention)中,每個 attention head 都有自己的 Key 和 Value 向量。GQA 讓多個 head 共用同一組 Key-Value,大幅減少了 KV cache 的記憶體佔用。以 Llama 2 70B 為例,它用 8 組 KV 服務 64 個 attention heads,記憶體節省了約 8 倍。這對長上下文推論特別重要——KV cache 通常是長文本推論時記憶體用盡的主因。

旋轉位置編碼(Rotary Position Embeddings, RoPE)。RoPE 透過旋轉矩陣把位置資訊編碼到 attention 的計算中,讓模型能理解 tokens 之間的相對位置。RoPE 的好處是可以外推——模型在訓練時用 4K 的上下文,但推論時可以透過調整 RoPE 的基頻參數(base frequency),延展到 128K 甚至更長的上下文。Llama 3.1 能支援 128K context 就是靠 RoPE 的外推能力。

SwiGLU 啟動函數。Llama 用 SwiGLU 取代了傳統 Transformer 中的 ReLU 啟動函數。SwiGLU 結合了 Swish 函數和 Gated Linear Unit 的概念,在實驗中展現出比 ReLU 更好的訓練效果。代價是每一層的 FFN 需要三個權重矩陣(比 ReLU 多一個),但效能提升的幅度大於額外計算的成本。

Mixture-of-Experts(Llama 4)。到了 Llama 4,Meta 首次在 Llama 中採用 MoE 架構。MoE 的核心概念是把模型的 FFN 層拆成多個「專家」子網路,每次只啟動其中幾個來處理輸入。Scout 的 109B 參數中,每次只啟動 17B,實現了「大知識容量、低計算成本」的效果。同時,MoE 架構讓 Meta 能把上下文窗口推到 10M tokens 的級別,因為推論計算量被大幅壓縮了。

RMSNorm 正規化。Llama 用 RMSNorm 取代了 LayerNorm,並且採用 Pre-Norm 架構(正規化放在 attention 和 FFN 之前)。RMSNorm 的計算比 LayerNorm 簡單,省略了均值的計算,訓練更穩定,推論也更快。

這些技術選擇加在一起,讓 Llama 在同等參數量下比很多同期的模型有更好的推論效率和生成品質。很多後來的開源模型(像是 Mistral、Yi、Qwen 等)也採用了類似的架構設計,可以說 Llama 在技術上影響了整個開源模型生態系的發展方向。

開源 vs 閉源模型比較

選擇 AI 模型時,開放權重模型和閉源模型各有優劣。以下用 Llama 與其他主流模型做比較:

比較項目 Llama(開放權重) GPT-4(OpenAI) Claude(Anthropic) Gemini(Google)
取得方式 免費下載權重 僅限 API 存取 僅限 API 存取 API 或 Google AI Studio
使用成本 硬體成本(自架)或第三方 API 依 token 計費 依 token 計費 依 token 計費
自訂程度 可微調、修改架構、蒸餾 有限微調(fine-tuning API) 無微調 有限微調
資料隱私 資料留在自己的環境 資料送到 OpenAI 伺服器 資料送到 Anthropic 伺服器 資料送到 Google 伺服器
部署彈性 本地、私有雲、任意雲端 只能用 OpenAI 的雲端 只能用 Anthropic 或 AWS Google Cloud 或 API
模型透明度 可以檢查所有參數 黑箱 黑箱 黑箱
效能上限 頂尖(405B 和 Llama 4 Maverick) 頂尖 頂尖 頂尖
維護責任 自行負責部署和更新 服務商負責 服務商負責 服務商負責

開放權重模型的核心優勢在於控制權——你控制資料流向、你決定模型怎麼運作、你不依賴任何單一供應商。但代價是你需要自己處理部署、更新和維護的工作。

閉源模型的核心優勢在於方便——註冊帳號、呼叫 API、拿到結果。不需要管 GPU、不需要懂模型架構、不需要擔心推論引擎的版本。但代價是你的資料和業務邏輯會經過別人的伺服器,而且你無法控制供應商的定價和政策變動。

實務上,很多企業會混合使用兩種模型。日常的一般性任務(內容生成、摘要、翻譯)用 Llama 自架來降低成本。對品質要求極高的任務(複雜推理、客戶面對的關鍵應用)用閉源 API 確保最好的結果。這種混合策略可以在成本和品質之間取得平衡,同時降低對單一供應商的依賴風險。

怎麼使用 Llama

使用 Llama 有好幾種方式,從「在自己的筆電上跑」到「在雲端用 API 呼叫」都有。

本地執行:Ollama。最簡單的方式是用 Ollama。Ollama 是一個開源工具,讓你用一行指令就能在自己的電腦上跑 Llama。安裝完之後,在終端機輸入 ollama run llama3.1 就可以開始對話。Ollama 會自動下載模型、處理量化、管理記憶體。適合開發者本地測試或個人使用。一台 16GB RAM 的電腦大約可以跑 8B 的模型;如果你的電腦有 32GB 以上的記憶體,可以嘗試跑量化過的 70B。

HuggingFace。Meta 官方會把 Llama 的權重發布到 HuggingFace 平台上。你可以用 HuggingFace 的 transformers 函式庫載入模型,搭配 PyTorch 進行推論或微調。這個方式適合需要深度客製化的研究者和工程師——你可以控制推論流程的每一個細節。HuggingFace 也提供 Inference Endpoints 服務,讓你不需要自己管 GPU 就能部署模型。

雲端供應商。如果你需要在企業環境中大規模部署 Llama,主要的雲端平台都有提供。AWS Bedrock 讓你用 API 的方式呼叫 Llama,不用管底層硬體。Azure 上透過 Azure AI 也提供 Llama 模型。Google Cloud 的 Vertex AI 同樣有 Llama 可以選用。用雲端供應商的好處是跟你既有的雲端架構整合方便,而且有企業級的 SLA 和合規認證。

第三方 API 供應商。Groq、Together AI、Fireworks AI 等服務商專門提供高速的 Llama 推論 API。特別是 Groq,它用自己研發的 LPU(Language Processing Unit)晶片來跑 Llama,推論速度比傳統 GPU 方案快很多。這類服務的定價通常比 OpenAI 和 Anthropic 便宜,因為 Llama 本身免費,服務商只收取推論的計算費用。

推論框架。如果你要自己管理推論伺服器,vLLM 和 TGI(Text Generation Inference)是兩個常用的推論框架。vLLM 用 PagedAttention 技術優化記憶體管理,可以讓同一張 GPU 同時服務更多請求。TGI 是 HuggingFace 開發的推論伺服器,部署流程比較簡單。兩個框架都提供跟 OpenAI 相容的 API 介面,讓你的程式碼可以在 Llama 和 OpenAI 之間輕鬆切換。

量化執行。如果你的 GPU 記憶體有限,可以用量化(Quantization)技術降低模型的精度來減少記憶體需求。常用的量化方法包括 GPTQ(GPU 量化,速度快)、AWQ(精度保持較好)和 GGUF(llama.cpp 使用的格式,支援 CPU 推論)。以 Llama 3.1 70B 為例,全精度(FP16)需要大約 140GB 記憶體,4-bit 量化後只需要約 35GB,一張 A100 80GB 就能放得下。量化會讓模型品質略有下降,但在大部分應用場景中,4-bit 量化的品質損失不到 5%,是一個很划算的取捨。

微調(Fine-tuning)。Llama 開放權重的一大優勢是你可以用自己的資料微調模型。最常用的方法是 LoRA(Low-Rank Adaptation)和 QLoRA(在量化模型上做 LoRA),只修改模型的一小部分參數,大幅降低微調所需的 GPU 資源。用 QLoRA 微調 Llama 3.1 8B,一張消費級的 RTX 4090(24GB VRAM)就能搞定。微調後的模型可以在特定領域(法律、醫療、金融、客服)上有顯著的效能提升。

適合什麼場景

企業私有部署。這是 Llama 最有價值的使用場景。如果你的企業處理機敏資料(醫療紀錄、金融交易、法律文件),把資料送到 OpenAI 或 Google 的伺服器可能違反法規或內部政策。Llama 可以部署在企業自己的伺服器上或私有雲中,資料不出公司的網路環境。在台灣,金融業和醫療業對資料主權的要求特別嚴格,本地部署的 Llama 是一個實際的選擇。

學術研究。研究者需要理解模型的內部運作,比如分析 attention pattern、檢視中間層的表示、做機制可解釋性(mechanistic interpretability)研究。閉源模型是黑箱,無法做這些事。Llama 公開了所有參數,是 AI 研究的重要基礎設施。很多 AI 安全方面的研究(像是對齊方法、紅隊測試)都是在 Llama 上進行的。

邊緣裝置和行動端。Llama 3.2 的 1B 和 3B 模型專門為手機和 IoT 裝置設計。可以在不需要網路連線的情況下提供 AI 功能——例如手機上的文字摘要、離線翻譯、本地語音助理。這在網路不穩定的環境下(例如工廠、偏遠地區)特別有用。

成本敏感的大規模應用。如果你的應用每天要處理幾百萬次 AI 呼叫,用 OpenAI 或 Anthropic 的 API 費用會非常可觀。自架 Llama 的固定成本(GPU 硬體或雲端實例)在高用量下通常比按次計費的 API 便宜很多。粗估規則:當你的月 API 費用持續超過自架方案月成本的兩到三倍時,就值得考慮轉向自架。搭配 Groq 或 Together AI 等提供 Llama 推論的第三方服務,也可以在不自架的情況下享有比閉源 API 更低的價格。

領域特化微調。Llama 可以用你自己的資料進行微調(fine-tuning),把通用模型變成你的領域專家。例如:用法律判決書微調出法律分析模型、用客服對話記錄微調出客服機器人、用醫療文獻微調出醫學問答系統。閉源模型的微調功能通常有限制,而且微調後的模型還是在別人的伺服器上。Llama 微調後的模型完全由你掌控。

台灣使用情境。在台灣,Llama 的使用有幾個特別相關的場景。半導體和電子製造業需要處理大量的內部技術文件和製程資料,這些資料高度機密,不適合透過外部 API 處理。金融機構受金管會的資料在地化規範約束,特定資料不能送出國外的伺服器。醫療院所的病歷和診斷報告受《個人資料保護法》約束,本地部署是合規的安全選擇。政府機關處理公文和內部資料也有類似的資安考量。這些場景中,在台灣的雲端(如 GCP 彰化機房)或自建伺服器上部署 Llama,可以同時滿足 AI 應用需求和法規合規要求。

安全注意事項

授權限制。Llama 的授權不是無限制的自由使用。Llama 2 和 Llama 3 的授權條款明確規定,月活躍用戶超過 7 億的產品需要向 Meta 申請額外授權。此外,你不能用 Llama 的輸出去訓練其他模型來跟 Llama 競爭(也就是不能拿 Llama 生成的資料去做蒸餾,訓練出另一個跟 Llama 搶市場的模型)。使用 Llama 之前,請仔細閱讀 Meta 的 Llama Community License Agreement 和 Acceptable Use Policy,確認你的使用場景不會觸及限制。

安全訓練的局限性。雖然 Meta 對 Llama 的 Chat 模型做了安全訓練(包括 RLHF 和紅隊測試),但開放權重的本質意味著任何人都可以移除這些安全防護。社群中有許多「去審查」版本的 Llama,移除了拒絕有害請求的能力。這跟閉源模型不同——你沒辦法下載 GPT-4 的權重來去掉它的安全護欄。企業在部署 Llama 時,需要自行建立額外的安全防護層,不能只依賴模型本身的安全訓練。

模型越獄(Jailbreaking)風險。即使是有安全訓練的 Llama Chat 模型,仍然可能被特定的 prompt 技巧繞過安全限制。因為 Llama 的權重是公開的,攻擊者可以研究模型的內部機制,找到更有效率的越獄方法。如果你的應用面對不受信任的使用者輸入,需要在模型之外加上額外的輸入過濾和輸出審查機制。

幻覺(Hallucination)。跟所有 LLM 一樣,Llama 會生成看起來正確但實際上錯誤的內容。Llama 的開放權重版本在某些任務上的幻覺率可能比經過更大規模 RLHF 訓練的閉源模型高。在需要事實準確性的場景(醫療、法律、財務),使用 Llama 的輸出時需要搭配外部知識庫檢索(RAG)或人工審核。

自架的維護負擔。選擇自架 Llama 意味著安全更新也要自己處理。當 Meta 發布新版本或安全修補時,你需要自行評估和升級。閉源 API 供應商會在後端自動更新,但自架環境不會。這包括推論框架(vLLM、TGI)的安全漏洞更新、作業系統和 GPU 驅動的更新等。

資料安全的責任轉移。雖然自架 Llama 可以讓資料留在自己的環境,但這也代表資料安全的責任全部在你身上。你需要自行確保 GPU 伺服器的存取控制、推論 API 的認證授權、日誌的管理和稽核。這些在使用 OpenAI 或 Anthropic 的 API 時是服務商負責的範疇。曾經有案例是企業把 Llama 的推論 API 暴露在公開網路上但沒有加認證機制,導致任何人都可以免費使用他們的 GPU 資源,甚至可以讀取其他使用者的對話內容。

模型供應鏈安全。從 HuggingFace 或其他來源下載模型權重時,要注意來源的可信度。有攻擊者會在社群平台上發布被植入惡意程式碼的「微調版本」。建議只從 Meta 官方的 HuggingFace 帳號或經過驗證的管道下載模型權重,並在載入模型前驗證檔案的雜湊值(checksum)。

常見問題

Llama 可以免費商用嗎?

可以,但有條件。如果你的產品或服務月活躍用戶不超過 7 億,在遵守 Meta 的 Community License Agreement 和 Acceptable Use Policy 的前提下,可以免費使用 Llama 進行商業用途。超過 7 億月活躍用戶的話,需要向 Meta 申請額外的授權。此外,你不能用 Llama 來訓練其他跟 Llama 競爭的語言模型。

我的電腦跑得動 Llama 嗎?

看你要跑哪個尺寸。Llama 3.2 1B 只需要大約 2GB 記憶體,大部分現代筆電都跑得動。Llama 3.1 8B 的量化版本(4-bit)大約需要 6GB VRAM 或 8-16GB 系統記憶體。70B 模型需要約 40GB VRAM(全精度)或用量化降到 24-32GB。405B 模型需要多張 A100 或 H100 GPU,一般人跑不動。用 Ollama 的話,它會自動幫你處理量化,盡量讓模型塞進你的硬體。

Llama 跟 ChatGPT 比起來怎麼樣?

直接比較要看具體版本和任務。Llama 3.1 405B 和 Llama 4 Maverick 在多項 benchmark 上跟 GPT-4o 相當。但 ChatGPT 的體驗包含了很多模型之外的東西——對話記憶、插件生態、網頁搜尋整合等。Llama 是一個模型,ChatGPT 是一個產品。如果你需要的是 API 呼叫的文本生成能力,兩者效能接近。如果你需要即開即用的對話產品,ChatGPT 更方便。Llama 的核心優勢在於你可以把它部署在自己的環境、用自己的資料微調、掌控每一個環節。

Llama 4 的 10M 上下文窗口實際上能用嗎?

Llama 4 Scout 的 10M token 上下文窗口確實是一個技術突破。在 Meta 的評測中,它在長上下文的「大海撈針」(needle-in-a-haystack)測試中表現良好。但實務上要注意幾件事:處理 10M tokens 的推論需要大量的 GPU 記憶體(光 KV cache 就需要數百 GB)、延遲會隨上下文長度增加、費用也會跟著上升。大部分應用場景用不到 10M 的上下文。如果你的任務可以用 RAG(檢索增強生成)解決,通常比塞入超長上下文更有效率也更經濟。

Llama 支援中文嗎?

Llama 的訓練資料以英文為主,但包含了部分中文語料。Llama 3 和之後的版本在中文的表現比早期版本好很多,可以做基本的中文理解和生成。但跟專門針對中文訓練的模型相比,Llama 在中文文學創作、成語理解、繁體中文的流暢度上仍有差距。如果你的應用主要面對繁體中文用戶,建議用中文語料對 Llama 做額外的微調,或者評估是否有更適合中文場景的模型選擇。另外要注意,Llama 3 的新 tokenizer 對中文的編碼效率有提升——同樣一段中文文字,Llama 3 需要的 tokens 比 Llama 2 少,代表處理中文的成本和速度都有改善。

相關文章

參考資料