Midjourney 是什麼?AI 繪圖工具使用指南白話解析

一句話說明

Midjourney 是一個 AI 圖片生成服務,你用文字描述想要的畫面,它幫你生成圖片。目前主要透過 Discord 和網頁介面操作。

Midjourney 的運作方式

跟 ChatGPT 用文字回答問題類似,Midjourney 用圖片回應你的文字描述。你輸入「一隻穿西裝的貓坐在辦公桌前開會,水彩風格」,它就會生成四張符合描述的圖片讓你挑選。

技術上,Midjourney 使用的是擴散模型(Diffusion Model)。簡單來說,它先從一張全是雜訊的圖片開始,然後逐步「去噪」,每一步讓圖片更接近你描述的內容。這個過程通常需要幾十秒到一分鐘。

操作介面

Discord

Midjourney 最早也最主要的操作方式。你加入 Midjourney 的 Discord 伺服器,在對話頻道中輸入指令。核心指令是 /imagine,後面接你的 prompt(圖片描述)。

/imagine prompt: a cyberpunk city street in Taipei at night, neon lights, rain, cinematic lighting --ar 16:9 --v 6

生成的四張圖片會直接顯示在 Discord 的對話中。你可以用按鈕選擇放大(Upscale)某一張,或根據某一張生成變體(Variation)。

網頁介面

Midjourney 後來推出了網頁介面(midjourney.com),提供更直覺的操作方式。功能包括圖片瀏覽和管理、prompt 編輯器、風格探索。對不熟悉 Discord 的使用者來說更友善。

Prompt 結構

Midjourney 的 prompt 可以拆成幾個部分:

主體描述:你想要畫什麼。「一隻柴犬在日本街道上跑步」。越具體越好,模糊的描述會得到模糊的結果。

風格指定:你想要什麼風格。可以指定畫風(watercolor、oil painting、digital art)、攝影風格(portrait、landscape、macro)、藝術運動(impressionism、art nouveau)、或參考特定的視覺風格(studio ghibli style、vaporwave)。

技術參數:用 -- 開頭的參數控制生成的技術細節。

常用參數

--ar(Aspect Ratio):設定圖片比例。--ar 16:9 是寬螢幕,--ar 9:16 是直式(適合手機桌布或 IG 限動),--ar 1:1 是正方形。

--v(Version):指定使用的模型版本。每個版本的畫風和能力不同。v6 偏向寫實,v5 偏向藝術風格。新版本通常在文字理解和細節處理上更好。

--style:在同一個版本內切換不同的風格傾向。--style raw 會減少 Midjourney 自動添加的美化效果,產出更接近你 prompt 原始描述的結果。

--no:排除你不想要的元素。--no text 可以避免圖片中出現文字(AI 生成的文字通常是亂碼)。

--chaos:控制生成結果的多樣性。數值越高(0-100),四張圖的差異越大。在探索階段可以設高一點,找到方向後再降低。

--seed:用特定的隨機種子產生可重現的結果。如果你想在某張滿意的圖片基礎上做微調,記下它的 seed 值很有用。

定價

Midjourney 沒有免費方案(曾經有,但因為使用量太大而取消)。

Basic Plan:月繳約 10 美元,每月約 200 張圖片的生成額度(以快速模式計算),適合偶爾使用。

Standard Plan:月繳約 30 美元,每月約 900 張快速生成額度,加上無限制的慢速生成(relax mode)。適合需要大量生成的創作者。

Pro Plan:月繳約 60 美元,更多快速生成額度和隱密模式(stealth mode,你的 prompt 和生成結果不會公開在社群中)。

Mega Plan:月繳約 120 美元,最大的快速生成額度。

跟 DALL-E 和 Stable Diffusion 的比較

Midjourney 的優勢是「美感」。它生成的圖片在構圖、光影、色彩上通常是三者中最有藝術感的。缺點是你對生成過程的控制有限——你主要透過文字描述來引導,沒辦法像 Stable Diffusion 那樣用 ControlNet 精確控制構圖。

DALL-E(OpenAI 開發)的優勢是文字理解能力強。它比較擅長理解複雜的描述和空間關係(「紅色球在藍色箱子的左邊」)。整合在 ChatGPT 中,使用體驗最流暢。缺點是美感通常不如 Midjourney。

Stable Diffusion 的優勢是開源、可以本機執行。你可以在自己的電腦上跑,完全控制資料。有大量的社群模型和外掛(ControlNet、LoRA、各種細分風格模型)。缺點是需要技術知識來設定和優化,需要有獨立顯卡(至少 6GB VRAM)。

如果你重視美感和易用性,選 Midjourney。如果你重視資料隱私和深度客製化,選 Stable Diffusion 自架。如果你已經在用 ChatGPT 生態系,DALL-E 是最方便的選擇。

安全與限制

版權和商用。Midjourney 的條款允許付費用戶將生成的圖片用於商業目的。但如果你在 prompt 中使用了特定藝術家的名字來模仿其風格,這在法律上存在爭議。多位藝術家已經對 AI 圖片生成公司提起訴訟,相關判例仍在發展中。

免費版的圖片預設是公開的。如果你在 Discord 公開頻道或不使用 stealth mode 生成圖片,你的 prompt 和結果會被其他人看到。涉及商業機密的設計概念,建議使用 Pro 以上方案的 stealth mode。

AI 生成圖片的辨識。AI 生成的圖片在細節上仍然有破綻:手指數量異常、文字變形、背景物件透視不一致、對稱物件的不對稱。雖然每個版本都在改進,但用放大鏡檢查仍然能發現痕跡。

深偽和詐騙風險。AI 圖片生成技術可以被用於製作假新聞照片、假產品照、假身分證件等。Midjourney 的內容政策禁止生成寫實的公眾人物圖片和暴力色情內容,但政策的執行有漏洞。C2PA 數位浮水印標準正在發展中,未來可能成為驗證圖片真實性的工具。

在台灣的使用情境。台灣的設計師和行銷人員是 Midjourney 的主要使用族群。常見的應用包括:社群貼文的配圖、簡報視覺設計、產品概念圖、品牌風格探索。要注意的是,台灣目前對 AI 生成作品的著作權認定尚無明確法規判例,使用時建議加入人工修改元素以強化著作權主張。

知識檢測

讀完文章後,測試一下你對這個主題的理解。

常見問題

Midjourney 生成的圖片有版權嗎?

根據目前的法律趨勢,純粹由 AI 生成的圖片可能不受著作權保護(美國著作權局已有類似判決)。但如果你在 AI 生成的基礎上做了顯著的人工修改和創意編輯,修改後的作品可能主張著作權。台灣的智慧財產局尚未對此做出明確裁定。

不懂英文可以用 Midjourney 嗎?

可以。Midjourney 支援中文 prompt,但英文 prompt 的理解度通常更好。建議先用中文構思畫面,再翻譯成英文輸入。也可以先用中文描述,讓 ChatGPT 幫你翻譯成適合 Midjourney 的英文 prompt。

生成一張圖要多久?

快速模式通常 30 秒到 1 分鐘。Relax 模式可能需要幾分鐘到十幾分鐘,取決於伺服器負載。Upscale(放大)通常需要額外 30 秒到 1 分鐘。

Midjourney 可以生成 Logo 嗎?

可以用來做 Logo 的概念發想和風格探索,但直接把 AI 生成的圖當作正式 Logo 通常不夠好。AI 生成的 Logo 往往細節不夠精準、不適合縮小使用、也可能跟其他作品相似。建議用 Midjourney 探索方向,再由設計師用向量工具重新繪製。

公司可以直接用 Midjourney 的圖片做廣告嗎?

Midjourney 的商用條款允許付費用戶商用,但需要注意兩個風險:一是版權爭議(如果生成的圖片跟某個受保護的作品太相似),二是品牌形象風險(消費者可能對明顯的 AI 生成圖片反感)。建議在 AI 生成的基礎上做人工修飾,而非直接使用原始輸出。

相關文章

參考資料

  • Midjourney 官方文件
  • 美國著作權局 AI 生成作品相關判決
  • C2PA 數位內容來源標準