一句話說明
自架開源 AI 模型讓資料完全留在本機,適合處理不能上傳到外部服務的敏感資料,但需要足夠的硬體資源,而且回答品質通常不如 ChatGPT 或 Claude 的頂級模型。
為什麼要自架
使用 ChatGPT、Claude、Gemini 等雲端服務時,你的 prompt 和對話內容會經過服務商的伺服器。對大多數用途來說這不是問題,但以下情境適合考慮自架:
處理公司內部機密文件(合約、財報、員工資料)需要 AI 輔助分析。
法規要求資料不能離開特定地理區域或組織邊界。
開發環境中需要 AI 協助但不能讓程式碼外傳(例如處理未公開的專利技術)。
想要離線使用 AI,不依賴網路連線。
需要大量 API 呼叫但不想承擔雲端服務的 token 費用。
Ollama:CLI 優先的本機 AI
Ollama 是目前最簡單的本機 AI 執行工具。
安裝(macOS):
curl -fsSL https://ollama.com/install.sh | sh
安裝(Linux):
curl -fsSL https://ollama.com/install.sh | sh
Windows 則從 Ollama 官網下載安裝檔。
下載並執行模型:
ollama pull llama3.1:8b
ollama run llama3.1:8b
這會下載 Llama 3.1 8B 參數模型(約 4.7GB)並啟動互動式對話。
Ollama 也提供 REST API,預設在 localhost:11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "用繁體中文解釋什麼是 Docker",
"stream": false
}'
這讓你可以把 Ollama 整合到自己的應用程式或工作流中。很多開源專案(如 Open WebUI)可以接上 Ollama 的 API 提供類似 ChatGPT 的網頁介面。
LM Studio:圖形化介面
LM Studio 適合不熟悉命令列的使用者。
安裝:從 LM Studio 官網下載對應作業系統的安裝檔(支援 macOS、Windows、Linux)。
使用流程:
- 開啟 LM Studio 後,在搜尋欄搜尋想要的模型名稱。
- 選擇適合你硬體的版本(通常選 GGUF 格式的量化版本)。
- 點擊下載,完成後在左側選單中載入模型。
- 切換到 Chat 頁面就可以開始對話。
LM Studio 也提供 Local Server 功能,啟動後會在本機開一個相容 OpenAI API 格式的端點。這代表很多支援 OpenAI API 的工具和程式碼可以直接改指向 LM Studio。
硬體需求
AI 模型的大小用參數量表示,參數越多,需要的記憶體越多,回答品質通常也越好。
7B-8B 參數模型(如 Llama 3.1 8B):最低 8GB RAM/VRAM。推論速度在 Apple M1 上約每秒 20-30 tokens,NVIDIA RTX 3060 上約 30-50 tokens/s。適合日常問答和簡單的程式碼輔助。
13B-14B 參數模型(如 Qwen 2.5 14B):建議 16GB RAM/VRAM。品質比 7B 明顯提升,特別是在複雜推理和中文能力上。
70B 參數模型(如 Llama 3.1 70B):需要 48GB 以上 VRAM(如 2 張 RTX 4090),或 64GB 以上 RAM(用 CPU 推論但速度很慢)。品質接近部分雲端服務的中階模型。
量化版本可以大幅降低記憶體需求。Q4_K_M 量化的 7B 模型只需要約 4.5GB,品質損失有限。Q2_K 量化壓縮更多但品質明顯下降。
Apple Silicon 的統一記憶體架構(CPU 和 GPU 共享 RAM)讓 Mac 成為跑本機 AI 的不錯選擇。M1 Pro 16GB 可以順跑 7B 模型,M2 Max 64GB 可以跑量化版的 70B 模型。
模型選擇指南
Llama 3.1(Meta):目前最成熟的開源模型系列。8B 版適合入門和輕量任務,70B 版適合需要較高品質的場景。多語言支援良好,包括繁體中文。
Qwen 2.5(阿里巴巴):中文能力在開源模型中表現突出。如果主要用途是中文對話和中文內容處理,Qwen 是值得考慮的選項。有 7B、14B、72B 等大小。
Mistral / Mixtral(Mistral AI):歐洲公司開發,在同參數量級中效能表現好。Mixtral 8x7B 使用 Mixture of Experts 架構,推論速度快但記憶體需求較大。
Gemma 2(Google):Google 開源的輕量模型。2B 版可以在手機上執行,9B 版品質不錯且效能好。
CodeGemma / DeepSeek Coder:專門針對程式碼任務微調的模型。如果主要用途是程式碼補全和生成,專用的 code 模型通常比通用模型表現好。
安全部署注意事項
Ollama 和 LM Studio 預設只監聽 localhost,外部無法存取。如果你需要讓其他設備或同事存取,需要特別注意:
不要直接暴露到公網:Ollama 的 API 沒有內建的認證機制。如果你設定 OLLAMA_HOST=0.0.0.0 讓它監聽所有介面,任何能連到你電腦的人都可以使用你的 AI 服務,甚至讀取模型的輸出。
如果需要遠端存取:用 reverse proxy(如 Nginx 或 Caddy)加上 HTTP Basic Auth 或 API Key 驗證。設定防火牆只允許特定 IP 存取。使用 HTTPS 加密傳輸。
Docker 部署的注意事項:
docker run -d --gpus all -p 127.0.0.1:11434:11434 ollama/ollama
綁定到 127.0.0.1 確保只有本機可以存取。不要用 -p 11434:11434(不指定 IP),這會監聽所有介面。
模型來源的安全:只從官方管道(Ollama Library、Hugging Face 的認證帳號)下載模型。社群微調的模型可能被植入惡意行為(例如在特定 prompt 下輸出有害內容),雖然目前沒有廣泛的案例,但這是理論上可行的攻擊方式。
自架 vs 雲端的取捨
自架的優勢:資料完全在本機,沒有隱私顧慮。沒有 API 使用費(但有硬體和電力成本)。不受雲端服務的速率限制。可以離線使用。
自架的劣勢:回答品質通常不如 GPT-4o、Claude Opus 等頂級模型。需要投資硬體和維護。沒有持續的模型更新(需要手動更新)。不支援多模態(大部分本機模型只處理文字)。
適合自架的團隊:有 IT 能力維護、有足夠硬體資源、有明確的資料安全需求。
不適合自架的情況:需要頂級回答品質、團隊沒有技術維護能力、或偶爾使用(雲端按量計費更划算)。
知識檢測
讀完文章後,測試一下你對這個主題的理解。
常見問題
Ollama 和 LM Studio 選哪個?
如果你熟悉命令列、需要 API 整合、或要在伺服器上部署,選 Ollama。如果你偏好圖形介面、想快速比較不同模型、或不想碰終端機,選 LM Studio。兩者可以共用相同的模型檔案(GGUF 格式)。
本機 AI 的回答品質和 ChatGPT 差多少?
7B-8B 的模型大約等於 GPT-3.5 的水準,能處理簡單問答和基本的程式碼任務。70B 的模型接近 GPT-4 的早期版本,但在複雜推理上仍有差距。如果你需要和 GPT-4o 或 Claude Opus 同等的品質,目前開源模型做不到。
可以用 AI 生成的資料來微調開源模型嗎?
技術上可以,但需要注意授權問題。OpenAI 和 Anthropic 的使用條款禁止用其輸出來訓練競爭模型。如果你用 ChatGPT 產生資料來微調 Llama,可能違反 OpenAI 的服務條款。用開源模型的輸出來微調另一個開源模型通常沒有這個問題。
自架 AI 需要多少電費?
一張 RTX 4090 滿載功耗約 450W。如果持續推論(企業級使用),每月電費約 2,000-3,000 台幣(以台灣工業電價計算)。如果只是個人偶爾使用,電費影響很小。相比之下,ChatGPT Plus 月費約 640 台幣,所以除非使用量非常大,雲端服務在成本上可能更划算。
開源模型有安全過濾嗎?
不一定。Llama 系列有基本的安全微調,會拒絕明顯有害的請求。但開源模型的安全過濾通常比商業模型(ChatGPT、Claude)寬鬆很多,甚至可以被簡單的 prompt 繞過。如果你把自架的 AI 開放給其他人使用,需要自行加入輸入和輸出的過濾機制。