快速回答:DeepSeek 是什麼?
DeepSeek 是中國公司深度求索(DeepSeek AI)開發的開源大型語言模型系列。它以低成本訓練和 MoE(Mixture of Experts)架構著稱,在數學推理和程式碼生成的表現接近 GPT-4 等級,同時將模型權重公開讓社群自由使用。對台灣使用者來說,能力很強,但資料主權和內容審查是需要認真評估的風險。
DeepSeek 公司背景
深度求索成立於 2023 年,總部在中國杭州。創辦人梁文鋒同時是量化對沖基金 High-Flyer(幻方量化)的負責人。幻方量化本身就有大量 GPU 資源用於量化交易,這些算力被轉用於訓練大型語言模型。
跟 OpenAI、Anthropic 這些公司相比,DeepSeek 的路線很不一樣。它從一開始就走開源路線,不靠 API 訂閱賺錢,而是把模型權重直接放出來,讓任何人都能下載、修改、部署。這使得它在開源社群中快速建立了影響力。
公司規模相對精簡,核心研究團隊約百人左右,但產出速度很快——從 V2 到 V3 到 R1,每次發布都能在基準測試上帶來明顯進步。
DeepSeek 的技術特色
MoE(Mixture of Experts)架構
DeepSeek 從 V2 開始採用 MoE 架構。簡單說,模型裡有很多組「專家」(Expert),每次推理時只啟動其中一部分,其餘的不參與計算。
好處是:模型的總參數量可以很大(知識容量高),但每次實際運算只用到一小部分參數,推理成本低很多。DeepSeek-V3 有 671B 總參數,但每次只啟動約 37B,相當於用小模型的算力跑大模型的效果。
低成本訓練
DeepSeek-V3 的訓練成本據稱約 557 萬美元,這個數字引起業界關注——同等級的模型訓練通常要幾千萬甚至上億美元。他們透過幾個方法壓低成本:
- FP8 混合精度訓練,減少記憶體和算力需求
- 自研的通訊優化框架,提高多卡訓練效率
- MoE 架構本身就比 Dense 模型省算力
- 利用幻方量化既有的 GPU 集群,不需額外租用
不過要注意,這個成本數字只包含最後一輪正式訓練,不包含前期的實驗、失敗的嘗試和基礎設施投入。實際總投入一定更高。
開源策略
DeepSeek 採用寬鬆的開源授權(MIT License),允許商業使用、修改和再分發。這讓它成為目前最受歡迎的開源 LLM 之一,在 Hugging Face 上的下載量很高。
開源帶來的生態效應:社群在它的基礎上做了大量微調版本,適用於各種語言和特定任務。你可以把 DeepSeek 當成基底模型,在自己的資料上做 fine-tuning。
主要模型版本
| 模型 | 總參數 | 啟動參數 | 發布時間 | 主要特色 |
|---|---|---|---|---|
| DeepSeek-V2 | 236B | 21B | 2024 Q2 | 首次引入 MoE + MLA 注意力機制 |
| DeepSeek-V3 | 671B | 37B | 2024 Q4 | 性能接近 GPT-4o,訓練成本極低 |
| DeepSeek-R1 | 671B | 37B | 2025 Q1 | 推理鏈模型,數學和程式碼表現突出 |
| DeepSeek-R1-Distill | 多種 | 1.5B–70B | 2025 Q1 | R1 蒸餾版,可在消費級硬體運行 |
DeepSeek-R1 是推理鏈(Chain of Thought)模型,類似 OpenAI 的 o1。它會先「想」一段推理過程,再給出最終答案,在數學、邏輯和程式碼任務上表現特別好。
蒸餾版(Distill)則是把大模型的能力「壓縮」到小模型裡,讓一般人用筆電或消費級顯卡就能跑。
DeepSeek vs ChatGPT vs Claude
| 面向 | DeepSeek | ChatGPT | Claude |
|---|---|---|---|
| 數學推理 | 強,R1 版接近 o1 | 強(o1/o3) | 中上 |
| 程式碼 | 強 | 強 | 強 |
| 中文理解 | 很好,原生中文訓練 | 好 | 好 |
| 長文寫作 | 中等 | 好 | 很好 |
| 安全護欄 | 弱,有政治審查 | 強 | 強 |
| 隱私保護 | 弱(資料存中國) | 中 | 中上 |
| 開源 | 是(MIT) | 否 | 否 |
| 價格 | 極低 / 可自架 | 中高 | 中高 |
DeepSeek 的強項:數學推理能力突出、中文表現好、可以完全自己部署不依賴外部服務、價格極低。
明顯弱點:涉及中國政治敏感話題時會拒絕回答或給出官方立場的答案;安全機制相對薄弱,比較容易被 jailbreak;對話的安全護欄不如 Claude 和 ChatGPT。
怎麼使用 DeepSeek
有幾種方式:
透過官方 API:到 platform.deepseek.com 註冊,取得 API key。介面和 OpenAI API 格式相容,很多工具可以直接切換。價格非常便宜,百萬 token 只要幾毛美金。
透過官方網頁 / App:chat.deepseek.com 提供免費使用,有 iOS 和 Android App。
本地部署:從 Hugging Face 下載模型權重,用 vLLM、Ollama、llama.cpp 等工具在自己的機器上跑。R1-Distill 的 7B 版本在一般筆電上就能運行。
透過第三方平台:很多雲端平台(Together AI、Fireworks、Groq)都有提供 DeepSeek 模型的託管服務。
台灣使用情境與注意事項
在台灣使用 DeepSeek,有幾個面向需要考慮。
個人學習和研究用途:如果你只是拿它來學程式、解數學題、寫個人專案,風險相對低。特別是本地部署的版本,資料完全不會外傳。
企業環境要三思:如果你的公司有客戶資料、營業秘密或個資,使用 DeepSeek 的官方 API 意味著資料會傳到中國伺服器。這在台灣的個資法和部分產業的合規要求下可能有問題。
內容審查:問到台灣主權、六四事件、西藏、新疆等話題時,DeepSeek 會拒絕回答或給出中國官方立場。這在教育或研究場景中需要注意。
建議做法:
- 個人非敏感用途可以直接用官方服務
- 涉及敏感資料的場景,用本地部署版本
- 企業用途建議自架,或改用有明確資料處理政策的服務商
- 不要在 DeepSeek 官方服務中輸入個資、公司機密或客戶資料
資安與隱私風險
使用 DeepSeek 時,有幾個安全面向要注意。
資料傳輸與儲存:使用官方 API 或網頁版,你的對話內容會傳送到中國伺服器。根據中國的資料安全法和國家情報法,中國政府有權要求企業配合提供資料。這跟使用美國服務商的風險性質不同——台灣和美國之間有一定的法律和外交框架,但和中國之間的情況更複雜。
內容過濾:DeepSeek 內建了配合中國法規的內容過濾機制。這會影響輸出的中立性,特別是涉及政治、歷史和敏感社會議題時。
開源模型的供應鏈風險:雖然模型權重是公開的,但社群通常只驗證了模型的「表現」,很難完整驗證訓練過程中是否被植入了後門或偏見。這是所有開源模型的通用問題,但考量到地緣政治因素,在使用中國來源的模型時值得多一層考慮。
Jailbreak 風險:相較於 Claude 和 ChatGPT,DeepSeek 的安全護欄較容易被繞過。如果你把它整合到面向使用者的應用中,需要在外層加上額外的安全檢查。
企業部署建議:
- 自架版本搭配企業級的輸入/輸出過濾
- 建立 AI 使用規範,明確哪些場景可以用、哪些不行
- 定期更新模型版本,關注安全公告
- 考慮使用 AI Gateway 來記錄和監控所有 API 呼叫
知識檢測
讀完文章後,測試一下你對這個主題的理解。
常見問題 FAQ
DeepSeek 免費嗎?
官方網頁版和 App 免費使用。API 收費但價格極低。開源模型可以免費下載和自行部署,不受使用限制。
DeepSeek 的中文能力如何?
很好。因為訓練資料包含大量中文語料,在中文理解和生成上的表現是同級模型中最好的之一。繁體中文也能處理,但對台灣用語的理解偶爾會偏向中國大陸的說法。
DeepSeek 可以取代 ChatGPT 嗎?
看你的用途。數學和程式碼任務上,DeepSeek-R1 的表現接近甚至超過 GPT-4o。但在安全性、穩定性和生態系完整度上,ChatGPT 仍然領先。如果你重視隱私和安全護欄,DeepSeek 目前還無法完全取代。
用 DeepSeek 有法律風險嗎?
目前台灣沒有法律禁止使用 DeepSeek。但如果你處理的是個資或受監管的資料,使用其官方服務(資料傳到中國)可能違反個資法或產業合規要求。本地部署則不受此限。
DeepSeek 會審查內容嗎?
會。涉及中國政治敏感話題(台灣地位、天安門、西藏、新疆等)時,官方版本會拒絕回答或輸出配合中國官方立場的內容。開源版本的審查較少,但基礎模型中仍可能殘留訓練時植入的偏向。
我可以在公司內部署 DeepSeek 嗎?
可以。MIT 授權允許商業使用。技術上你需要有足夠的 GPU 資源——完整版 V3/R1 需要多張 A100/H100,蒸餾版 7B 則在消費級顯卡上就能跑。建議搭配 vLLM 或 TGI 做推理服務。
DeepSeek-R1 和一般版本有什麼不同?
R1 是推理鏈模型,它會先展開思考過程再給答案。在需要多步驟推理的任務(數學證明、複雜程式邏輯、邏輯推理題)上表現明顯更好,但回應速度較慢、token 消耗較高。日常對話用一般版本就夠了。
DeepSeek 和 Llama 比起來如何?
兩者都是開源模型,但路線不同。Llama(Meta)走 Dense 架構,DeepSeek 走 MoE。在同等推理成本下,DeepSeek 通常表現更好。但 Llama 的生態系更成熟、社群微調版本更多,而且來自美國公司,在地緣政治敏感的場景中較少疑慮。
參考資料
- DeepSeek — DeepSeek 官方網站
- DeepSeek AI — GitHub — DeepSeek 開源模型程式碼與文件
- DeepSeek LLM: Scaling Open-Source Language Models — DeepSeek LLM 技術報告