快速回答:DeepSeek 是什麼?

DeepSeek 是中國公司深度求索(DeepSeek AI)開發的開源大型語言模型系列。它以低成本訓練和 MoE(Mixture of Experts)架構著稱,在數學推理和程式碼生成的表現接近 GPT-4 等級,同時將模型權重公開讓社群自由使用。對台灣使用者來說,能力很強,但資料主權和內容審查是需要認真評估的風險。

DeepSeek 公司背景

深度求索成立於 2023 年,總部在中國杭州。創辦人梁文鋒同時是量化對沖基金 High-Flyer(幻方量化)的負責人。幻方量化本身就有大量 GPU 資源用於量化交易,這些算力被轉用於訓練大型語言模型。

跟 OpenAI、Anthropic 這些公司相比,DeepSeek 的路線很不一樣。它從一開始就走開源路線,不靠 API 訂閱賺錢,而是把模型權重直接放出來,讓任何人都能下載、修改、部署。這使得它在開源社群中快速建立了影響力。

公司規模相對精簡,核心研究團隊約百人左右,但產出速度很快——從 V2 到 V3 到 R1,每次發布都能在基準測試上帶來明顯進步。

DeepSeek 的技術特色

MoE(Mixture of Experts)架構

DeepSeek 從 V2 開始採用 MoE 架構。簡單說,模型裡有很多組「專家」(Expert),每次推理時只啟動其中一部分,其餘的不參與計算。

好處是:模型的總參數量可以很大(知識容量高),但每次實際運算只用到一小部分參數,推理成本低很多。DeepSeek-V3 有 671B 總參數,但每次只啟動約 37B,相當於用小模型的算力跑大模型的效果。

低成本訓練

DeepSeek-V3 的訓練成本據稱約 557 萬美元,這個數字引起業界關注——同等級的模型訓練通常要幾千萬甚至上億美元。他們透過幾個方法壓低成本:

  • FP8 混合精度訓練,減少記憶體和算力需求
  • 自研的通訊優化框架,提高多卡訓練效率
  • MoE 架構本身就比 Dense 模型省算力
  • 利用幻方量化既有的 GPU 集群,不需額外租用

不過要注意,這個成本數字只包含最後一輪正式訓練,不包含前期的實驗、失敗的嘗試和基礎設施投入。實際總投入一定更高。

開源策略

DeepSeek 採用寬鬆的開源授權(MIT License),允許商業使用、修改和再分發。這讓它成為目前最受歡迎的開源 LLM 之一,在 Hugging Face 上的下載量很高。

開源帶來的生態效應:社群在它的基礎上做了大量微調版本,適用於各種語言和特定任務。你可以把 DeepSeek 當成基底模型,在自己的資料上做 fine-tuning。

主要模型版本

模型 總參數 啟動參數 發布時間 主要特色
DeepSeek-V2 236B 21B 2024 Q2 首次引入 MoE + MLA 注意力機制
DeepSeek-V3 671B 37B 2024 Q4 性能接近 GPT-4o,訓練成本極低
DeepSeek-R1 671B 37B 2025 Q1 推理鏈模型,數學和程式碼表現突出
DeepSeek-R1-Distill 多種 1.5B–70B 2025 Q1 R1 蒸餾版,可在消費級硬體運行

DeepSeek-R1 是推理鏈(Chain of Thought)模型,類似 OpenAI 的 o1。它會先「想」一段推理過程,再給出最終答案,在數學、邏輯和程式碼任務上表現特別好。

蒸餾版(Distill)則是把大模型的能力「壓縮」到小模型裡,讓一般人用筆電或消費級顯卡就能跑。

DeepSeek vs ChatGPT vs Claude

面向 DeepSeek ChatGPT Claude
數學推理 強,R1 版接近 o1 強(o1/o3) 中上
程式碼
中文理解 很好,原生中文訓練
長文寫作 中等 很好
安全護欄 弱,有政治審查
隱私保護 弱(資料存中國) 中上
開源 是(MIT)
價格 極低 / 可自架 中高 中高

DeepSeek 的強項:數學推理能力突出、中文表現好、可以完全自己部署不依賴外部服務、價格極低。

明顯弱點:涉及中國政治敏感話題時會拒絕回答或給出官方立場的答案;安全機制相對薄弱,比較容易被 jailbreak;對話的安全護欄不如 Claude 和 ChatGPT。

怎麼使用 DeepSeek

有幾種方式:

透過官方 API:到 platform.deepseek.com 註冊,取得 API key。介面和 OpenAI API 格式相容,很多工具可以直接切換。價格非常便宜,百萬 token 只要幾毛美金。

透過官方網頁 / App:chat.deepseek.com 提供免費使用,有 iOS 和 Android App。

本地部署:從 Hugging Face 下載模型權重,用 vLLM、Ollama、llama.cpp 等工具在自己的機器上跑。R1-Distill 的 7B 版本在一般筆電上就能運行。

透過第三方平台:很多雲端平台(Together AI、Fireworks、Groq)都有提供 DeepSeek 模型的託管服務。

台灣使用情境與注意事項

在台灣使用 DeepSeek,有幾個面向需要考慮。

個人學習和研究用途:如果你只是拿它來學程式、解數學題、寫個人專案,風險相對低。特別是本地部署的版本,資料完全不會外傳。

企業環境要三思:如果你的公司有客戶資料、營業秘密或個資,使用 DeepSeek 的官方 API 意味著資料會傳到中國伺服器。這在台灣的個資法和部分產業的合規要求下可能有問題。

內容審查:問到台灣主權、六四事件、西藏、新疆等話題時,DeepSeek 會拒絕回答或給出中國官方立場。這在教育或研究場景中需要注意。

建議做法:

  • 個人非敏感用途可以直接用官方服務
  • 涉及敏感資料的場景,用本地部署版本
  • 企業用途建議自架,或改用有明確資料處理政策的服務商
  • 不要在 DeepSeek 官方服務中輸入個資、公司機密或客戶資料

資安與隱私風險

使用 DeepSeek 時,有幾個安全面向要注意。

資料傳輸與儲存:使用官方 API 或網頁版,你的對話內容會傳送到中國伺服器。根據中國的資料安全法和國家情報法,中國政府有權要求企業配合提供資料。這跟使用美國服務商的風險性質不同——台灣和美國之間有一定的法律和外交框架,但和中國之間的情況更複雜。

內容過濾:DeepSeek 內建了配合中國法規的內容過濾機制。這會影響輸出的中立性,特別是涉及政治、歷史和敏感社會議題時。

開源模型的供應鏈風險:雖然模型權重是公開的,但社群通常只驗證了模型的「表現」,很難完整驗證訓練過程中是否被植入了後門或偏見。這是所有開源模型的通用問題,但考量到地緣政治因素,在使用中國來源的模型時值得多一層考慮。

Jailbreak 風險:相較於 Claude 和 ChatGPT,DeepSeek 的安全護欄較容易被繞過。如果你把它整合到面向使用者的應用中,需要在外層加上額外的安全檢查。

企業部署建議:

  • 自架版本搭配企業級的輸入/輸出過濾
  • 建立 AI 使用規範,明確哪些場景可以用、哪些不行
  • 定期更新模型版本,關注安全公告
  • 考慮使用 AI Gateway 來記錄和監控所有 API 呼叫

知識檢測

讀完文章後,測試一下你對這個主題的理解。

常見問題 FAQ

DeepSeek 免費嗎?

官方網頁版和 App 免費使用。API 收費但價格極低。開源模型可以免費下載和自行部署,不受使用限制。

DeepSeek 的中文能力如何?

很好。因為訓練資料包含大量中文語料,在中文理解和生成上的表現是同級模型中最好的之一。繁體中文也能處理,但對台灣用語的理解偶爾會偏向中國大陸的說法。

DeepSeek 可以取代 ChatGPT 嗎?

看你的用途。數學和程式碼任務上,DeepSeek-R1 的表現接近甚至超過 GPT-4o。但在安全性、穩定性和生態系完整度上,ChatGPT 仍然領先。如果你重視隱私和安全護欄,DeepSeek 目前還無法完全取代。

用 DeepSeek 有法律風險嗎?

目前台灣沒有法律禁止使用 DeepSeek。但如果你處理的是個資或受監管的資料,使用其官方服務(資料傳到中國)可能違反個資法或產業合規要求。本地部署則不受此限。

DeepSeek 會審查內容嗎?

會。涉及中國政治敏感話題(台灣地位、天安門、西藏、新疆等)時,官方版本會拒絕回答或輸出配合中國官方立場的內容。開源版本的審查較少,但基礎模型中仍可能殘留訓練時植入的偏向。

我可以在公司內部署 DeepSeek 嗎?

可以。MIT 授權允許商業使用。技術上你需要有足夠的 GPU 資源——完整版 V3/R1 需要多張 A100/H100,蒸餾版 7B 則在消費級顯卡上就能跑。建議搭配 vLLM 或 TGI 做推理服務。

DeepSeek-R1 和一般版本有什麼不同?

R1 是推理鏈模型,它會先展開思考過程再給答案。在需要多步驟推理的任務(數學證明、複雜程式邏輯、邏輯推理題)上表現明顯更好,但回應速度較慢、token 消耗較高。日常對話用一般版本就夠了。

DeepSeek 和 Llama 比起來如何?

兩者都是開源模型,但路線不同。Llama(Meta)走 Dense 架構,DeepSeek 走 MoE。在同等推理成本下,DeepSeek 通常表現更好。但 Llama 的生態系更成熟、社群微調版本更多,而且來自美國公司,在地緣政治敏感的場景中較少疑慮。

參考資料