一句話說明

AI 圖片生成工具各有強項:Midjourney 的美感最好、DALL-E 和 ChatGPT 整合最方便、Stable Diffusion 可以自架保有資料控制權,但三者的版權條款和使用限制差異很大。

三大工具功能比較

以下是三個工具的核心功能和特性比較:

比較項目 Midjourney DALL-E (OpenAI) Stable Diffusion
使用方式 Discord / 網站 ChatGPT 整合 / API 本機安裝 / 雲端
上手難度 最低 中高
美感品質 最高 依模型而異
文字渲染 最好 依模型而異
客製化程度 最高
資料隱私 上傳至 Midjourney 上傳至 OpenAI 自架可完全自控
開源
中文 Prompt 支援 支援 依模型而異

Midjourney 詳細介紹

Midjourney 是目前市面上產出圖片美感最高的 AI 繪圖工具之一。它的使用方式從早期只能透過 Discord 操作,到現在已經有獨立的 Midjourney 網站,操作體驗改善了很多。使用者只要在介面中輸入文字 prompt,系統就會在大約 30-60 秒內產生四張圖片。畫風預設偏向藝術感,色彩和構圖在三個工具中通常表現最出色,適合需要高品質視覺素材的場景。

定價方面,Midjourney 提供多個方案等級。Basic Plan 月費 10 美元,大約可以產生 200 張圖,適合個人偶爾使用。Standard Plan 月費 30 美元,提供 15 小時的快速生成時間和無限量的慢速生成。Pro Plan 月費 60 美元,快速生成時間增加到 30 小時,還提供 Stealth Mode,你的圖片不會出現在公開的社群展示區。對於企業用戶或需要保護商業機密的設計案,Stealth Mode 是一個重要的隱私功能。

Midjourney 的特色功能在過去一年有顯著升級。Style Reference 讓你上傳一張參考圖片,系統會模仿該圖的風格來生成新圖。Vary Region 可以選取圖片中的特定區域做局部修改,例如只換掉背景或修改某個物件。Zoom Out 功能可以把畫布向外擴展,產生更寬廣的場景。Blend 功能則可以混合多張圖片的視覺風格。這些功能的組合讓使用者對產出結果有更精細的控制。

在台灣的企業環境中,Midjourney 最常被用於社群行銷素材、簡報插圖、和電商產品情境圖的製作。一些設計公司會先用 Midjourney 做概念發想,再由設計師進行後製調整。要注意的是,Midjourney 的所有圖片預設會出現在社群展示區,除非你使用 Pro Plan 的 Stealth Mode,否則其他使用者可以看到你生成的圖片和使用的 prompt。

DALL-E(OpenAI)詳細介紹

DALL-E 是 OpenAI 開發的圖片生成模型,目前最新版本整合在 ChatGPT 中。它最大的優勢是和 ChatGPT 的對話整合非常自然。你可以用普通中文描述你想要的圖片,例如「幫我畫一個穿白色實驗袍的科學家在現代化實驗室裡看顯微鏡」,ChatGPT 會自動把你的描述轉換成適當的 prompt 來生成圖片。這種對話式的操作方式讓完全沒有接觸過 AI 繪圖的使用者也能很快上手。

定價方面,DALL-E 包含在 ChatGPT Plus 訂閱中(月費 20 美元),不需要額外付費。如果透過 OpenAI API 使用,則按張計費,費用依解析度和品質而異。對於已經在用 ChatGPT Plus 的使用者來說,DALL-E 等於是附帶的功能,不需要另外訂閱其他服務。

DALL-E 的文字渲染能力在三個工具中表現最好。如果你需要在圖片中包含英文文字,例如招牌、書封、或簡報素材中的標語,DALL-E 可以正確顯示大部分英文文字。相較之下,Midjourney 和 Stable Diffusion 在文字渲染上常常出現變形或錯字。DALL-E 也支援 inpainting,你可以在生成的圖片或上傳的圖片上選取特定區域做修改,這對於精細調整很有用。

在對話中,你可以持續對圖片提出修改要求。例如生成一張辦公室場景後,你可以說「把牆壁改成木質紋理」、「加一盆綠色植物在桌子左邊」,ChatGPT 會基於你的指示更新圖片。這種迭代式的工作流程在三個工具中是最直覺的。

Stable Diffusion 詳細介紹

Stable Diffusion 是一個開源的圖片生成模型,由 Stability AI 開發。和 Midjourney、DALL-E 最大的不同是:你可以把整個模型下載到自己的電腦上執行。這代表你的圖片生成過程完全在本機進行,不需要把任何資料上傳到外部伺服器。對於重視資料隱私的企業或處理敏感視覺資料的場景,這是其他兩個工具無法提供的優勢。

自架 Stable Diffusion 需要一台有 NVIDIA GPU 的電腦。操作介面通常使用社群開發的工具,最主流的有 ComfyUI 和 Automatic1111(SDWUI)。ComfyUI 使用節點式的工作流程,適合需要高度客製化和複雜流程的使用者。Automatic1111 提供比較傳統的網頁介面,適合剛入門的使用者。兩者都是免費開源的。如果不想自架,也可以使用 Stability AI 的 DreamStudio 雲端服務,按 credit 計費。

Stable Diffusion 的生態系非常豐富。社群開發了大量的 LoRA(Low-Rank Adaptation)模型,可以為 Stable Diffusion 加上特定的風格或主題。例如有專門的動漫風格 LoRA、水彩風格 LoRA、或特定攝影風格的 LoRA。ControlNet 則是一個控制生成結構的工具,可以用骨架圖、深度圖、或邊緣偵測圖來精確控制人物姿勢和場景構圖。這些社群資源讓 Stable Diffusion 的可能性遠超過另外兩個工具。

定價方面,自架的唯一成本是硬體。如果你已經有一台配備 NVIDIA GPU 的電腦,只需要安裝軟體就可以開始使用,後續的生成不需要任何費用。長期大量使用的情況下,自架的成本效益比訂閱制服務好很多。

硬體需求(自架 Stable Diffusion)

如果你考慮自架 Stable Diffusion,以下是硬體需求的參考:

等級 GPU VRAM 使用體驗
最低門檻 RTX 3060 8 GB 可以跑,速度較慢
建議配置 RTX 4070 12 GB 流暢使用,可跑大部分模型
進階配置 RTX 4090 24 GB 高解析度、批次生成快速
Apple Silicon M1 Pro 以上 16 GB+ 可用 MPS 加速,效能中等

AMD GPU 有社群開發的 ROCm 支援,但相容性和穩定度不如 NVIDIA 的 CUDA。如果你是為了跑 Stable Diffusion 而購買顯示卡,建議選擇 NVIDIA。RAM 方面建議至少 16 GB,如果要同時載入多個 LoRA 模型,32 GB 會更從容。儲存空間方面,基礎模型加上常用的 LoRA 和 ControlNet 模型,大約需要 50-100 GB 的硬碟空間。

Prompt 撰寫技巧

AI 繪圖的 prompt 和文字 AI 的 prompt 邏輯不同。文字 AI 可以用自然語言描述,繪圖 AI 通常需要更結構化的描述方式。掌握好 prompt 技巧可以大幅提升生成圖片的品質和可控性。

基本結構建議按照:主體 + 風格 + 細節 + 技術參數 的順序來組織 prompt。

一般描述:幫我畫一個在辦公室工作的人
結構化 prompt:professional woman working at desk, modern office, 
natural lighting, laptop and coffee, minimalist interior, 
photorealistic style, 4k, shallow depth of field

提高品質的關鍵詞:high quality, detailed, professional, 4k, sharp focus, high resolution。這些品質提示詞在 Midjourney 和 Stable Diffusion 中通常能有效提升產出品質。DALL-E 內部已經有品質優化機制,所以加不加品質詞的差異比較小。

負面 prompt(Negative Prompt)是 Stable Diffusion 和 Midjourney 支援的功能,用來告訴 AI 不要產生什麼。常用的負面提示詞包括:

--no text, watermark, blurry, distorted, low quality, 
deformed hands, extra fingers, cropped, out of frame

手指畸形和多餘的手指是 AI 繪圖最常見的瑕疵之一。在負面 prompt 中加入 deformed hands 和 extra fingers 可以降低這類問題的發生率,但無法完全避免。生成人物圖片時,建議多產幾張,選擇手部表現最自然的那張。

中文 prompt 的使用:Midjourney 和 DALL-E 都支援中文輸入,你可以直接用中文描述需求。但在實務上,英文 prompt 通常能產生更精確的結果,因為模型的訓練資料以英文為主。飛飛的做法是先用中文描述想要的畫面,確認需求後再翻譯成英文作為正式的 prompt。如果你不確定某些專業視覺描述的英文說法,可以請 ChatGPT 幫你翻譯和優化 prompt。

進階技巧方面,可以使用權重語法來強調或弱化某些元素。Midjourney 用 :: 語法(例如 background::0.5 降低背景的比重),Stable Diffusion 用括號語法(例如 (red dress:1.5) 強調紅色洋裝)。

版權與商業使用

版權是 AI 繪圖在商業使用時最容易被忽略但最重要的問題。三個工具的授權條款差異很大,在將 AI 生成的圖片用於商業用途之前,務必了解各平台的政策。

Midjourney 的授權條款:付費用戶擁有生成圖片的商業使用權。但有一個重要的門檻限制——如果你的公司年營收超過 100 萬美元,必須使用 Pro 方案或更高的等級。免費試用期間產生的圖片使用 CC BY-NC 4.0 授權,明確禁止商業使用。這代表你不能用試用期間生成的圖片來做商業海報、產品包裝、或任何營利用途的設計。

DALL-E 的授權條款:OpenAI 的政策相對簡單明確,使用者擁有所有生成圖片的權利,包括商業使用,且不限定付費等級。這是三個工具中對商業使用最寬鬆的條款。不過,OpenAI 保留使用生成圖片來改善服務的權利(除非你在設定中關閉了資料訓練選項)。如果你生成的圖片涉及商業機密(例如未公開的產品設計概念),建議在設定中確認訓練選項已關閉。

Stable Diffusion 的授權條款:因為是開源模型,自架生成的圖片沒有平台方的版權限制,你可以自由使用在任何商業用途。但這裡有一個容易忽略的細節——如果你使用社群開發的 LoRA 模型或 checkpoint,需要檢查該模型的授權條款。有些社群模型使用限制商業使用的授權,有些則完全開放。在 Civitai 等模型分享網站上,每個模型都會標註授權類型,下載前要確認。

台灣的法律現況:台灣目前對 AI 生成圖片的著作權認定沒有明確的法規。根據智慧財產局的解釋函,「純由 AI 自動生成、不具備人類精神創作」的作品可能不受著作權保護。這代表如果你只是輸入一個簡單的 prompt 然後直接使用 AI 產出的圖片,這張圖片的著作權保護可能很薄弱。但如果你在 prompt 中投入了有創意性的描述、經過多次迭代調整、並且在生成後做了後製修改,你可能有較強的著作權主張基礎——不過這在法律上尚未有判例確認。

建議做法是:將 AI 生成的圖片視為「素材」而非「成品」。在 AI 產出的基礎上做人工調整和設計,一方面增加著作權保護的強度,另一方面也能提升成品的品質和獨特性。

內容政策差異

三個平台對生成內容的限制政策不同,這會影響你能用它們做什麼:

DALL-E 的內容政策最嚴格。它不允許生成真實人物的肖像(包括名人和公眾人物)、暴力或血腥場景、色情或性暗示內容、仇恨或歧視性內容。如果你的 prompt 觸及這些限制,系統會主動拒絕並說明原因。這種嚴格的政策對企業用戶來說反而是優點——你不太可能用 DALL-E 意外生成會引起爭議的內容。

Midjourney 的內容政策介於中間。它禁止生成明確的暴力、色情、和仇恨內容,但對真實人物的限制執行程度不太一致。在某些情況下,Midjourney 可以生成類似特定名人風格的圖片,這可能帶來肖像權的法律風險。

Stable Diffusion 自架版本沒有內建的內容過濾機制(雖然可以自行加入 Safety Checker 模組)。這意味著使用者需要自行負責確保生成內容的合法性和倫理性。在企業環境中導入自架 Stable Diffusion 時,IT 部門應該配置適當的內容過濾機制,避免員工生成不當內容。

安全注意事項

上傳圖片的隱私風險

使用 img2img(圖片轉圖片)或 inpainting 功能時,你上傳的原始圖片會被傳送到 Midjourney 或 OpenAI 的伺服器。在使用這些功能之前,需要確認上傳的圖片不包含機密資訊。常見的風險情境包括:白板上的會議記錄和策略規劃、螢幕截圖中的未公開產品介面、設計稿和品牌標誌的早期版本、包含客戶資料的文件照片。

如果需要處理含有敏感內容的圖片,自架的 Stable Diffusion 是唯一不需要上傳到外部伺服器的選項。所有處理都在你自己的硬體上完成,資料不會離開你的控制範圍。

Deepfake 風險

AI 圖片生成技術的進步也帶來了 deepfake 的風險。在企業環境中需要特別注意以下幾點:

不要用 AI 生成模擬真實員工或客戶的照片。即使是用於內部簡報或行銷素材,未經本人同意使用其肖像可能違反個人資料保護法。台灣的個人資料保護法對肖像資料的蒐集和利用有明確的規範,AI 生成的擬真肖像也可能適用。

在社群媒體或行銷素材中使用 AI 生成的圖片時,建議標註「AI Generated」或「AI 生成」。台灣目前沒有強制標註的法規,但歐盟 AI Act 已經要求 AI 生成內容必須標註。提前養成標註的習慣,既是建立品牌信任的做法,也是為未來可能的法規做準備。

不要使用他人的照片作為 AI 繪圖模型的訓練資料,除非已經取得明確的書面授權。在台灣,未經同意使用他人肖像訓練 AI 模型可能涉及個資法和著作權法的爭議。

浮水印和來源追蹤

DALL-E 和 Midjourney 會在生成的圖片中嵌入隱藏的浮水印,使用 C2PA(Coalition for Content Provenance and Authenticity)metadata 標準。這個浮水印不會影響圖片的視覺品質,但可以用來追蹤圖片的 AI 生成來源。在部分情境下,這可能影響你的品牌形象——如果有人用支援 C2PA 的工具檢查你的行銷素材,會發現這些圖片是 AI 生成的。

自架 Stable Diffusion 生成的圖片不會自動加入這類 metadata,但你可以選擇性地加入 C2PA 標記,以符合透明度的要求。

企業導入的安全建議

在企業中導入 AI 繪圖工具時,建議制定內部使用規範。規範內容至少應該包含:允許使用的工具清單和方案等級、禁止上傳的資料類型(機密文件、客戶資料、未公開產品設計)、AI 生成圖片的標註政策、版權歸屬的內部定義(由誰產生的歸誰管)、以及出現爭議時的處理流程。在台灣的中小企業中,許多公司還沒有建立這類規範,導致員工在不了解風險的情況下使用 AI 繪圖工具,可能讓公司陷入版權或隱私的法律風險。

工作流建議

行銷素材製作流程

一個典型的 AI 繪圖工作流程如下:首先用中文描述你需要的視覺概念,確認方向後將描述轉換成英文 prompt。接著在選定的工具中生成 4-8 張圖片,從中挑選最接近需求的 1-2 張。然後用工具內建的功能(如 Vary Region 或 inpainting)做局部調整。最後在設計軟體(如 Figma、Photoshop)中做後製,加上品牌元素和文字。

選擇工具的決策矩陣

如果你的需求是快速產出高品質的藝術風格圖片,Midjourney 最適合。如果你已經在用 ChatGPT,想用最低的學習成本開始使用 AI 繪圖,DALL-E 最方便。如果你的專案對資料隱私有嚴格要求,或是需要高度客製化(訓練自己的風格模型),Stable Diffusion 是唯一的選擇。

很多團隊實務上會同時使用多個工具。例如用 Midjourney 做概念發想和 mood board,用 DALL-E 做快速的文字素材,用 Stable Diffusion 處理需要特定風格或隱私保護的案子。

常見問題

AI 生成的圖片可以註冊商標嗎?

目前大多數國家(包括台灣)的智慧財產局對此沒有明確規範。商標註冊的重點在於識別性和使用意圖,而非創作方式。AI 生成的 logo 在技術上可以提出商標申請,但如果有人質疑其原創性,可能面臨爭議。建議用 AI 產生初稿後,由設計師做調整和優化,增加人工創作的比重,強化商標申請的基礎。

Midjourney 產生的圖片被其他人拿去用怎麼辦?

如果你是付費用戶,你擁有該圖片的使用權。但因為 AI 生成圖片的著作權認定尚不明確,要主張侵權可能比傳統著作物困難。實務上的做法是:將重要的商業用圖做額外的人工修改,增加原創性的主張基礎。另外保留生成過程的截圖和 prompt 記錄,作為你是原始生成者的證據。

需要多好的電腦才能跑 Stable Diffusion?

最低建議是 NVIDIA GPU 8GB VRAM(如 RTX 3060),這個配置可以跑基礎模型但速度較慢。舒適使用建議 12GB VRAM(如 RTX 4070),可以流暢使用大部分模型和 ControlNet。產出速度和品質和 VRAM 大小正相關。AMD GPU 有社群支援但穩定性不如 NVIDIA。Apple Silicon Mac 可以用 MPS 加速,M1 Pro 以上的機種效能堪用,但整體速度仍然比同等級 NVIDIA GPU 慢約 2-3 倍。

AI 繪圖會取代設計師嗎?

AI 改變了設計流程,但沒有取代設計師的跡象。AI 擅長快速產生視覺概念和變體,但設計師的價值在於品牌策略、用戶體驗設計、排版規劃、和最終品質把關。很多設計師已經把 AI 當作加速工具,用於 mood board 製作、快速原型、和風格探索。在台灣的設計產業中,會使用 AI 工具的設計師反而更有競爭力,因為他們可以在更短的時間內產出更多的方案給客戶選擇。

用 AI 生成的圖片作為網站素材有什麼風險?

主要風險有兩方面。第一是版權爭議,確認你使用的方案允許商業用途,免費版通常有限制。第二是品牌辨識度的問題——如果多個網站使用類似的 AI 生成圖片(相同 prompt 很可能產生類似結果),你的網站會缺乏視覺獨特性。建議在 AI 生成的基礎上做客製化調整,加入品牌色彩和獨特元素。另外也要注意圖片的品質一致性,避免同一個頁面混用不同風格的 AI 圖片,這會讓網站看起來不專業。

三個工具可以同時使用嗎?有什麼衝突?

沒有技術上的衝突,很多團隊會同時使用多個工具。實務上的考量是成本(Midjourney + ChatGPT Plus 月費共 50 美元)和管理複雜度(不同工具產出的素材需要統一管理版權記錄)。建議建立一份素材使用記錄表,記錄每張圖片用哪個工具生成、使用的 prompt、以及對應的授權條款,方便未來追溯。