一句話說明
Midjourney 是一個 AI 圖片生成服務,你用文字描述想要的畫面,它幫你生成圖片。目前主要透過 Discord 和網頁介面操作。
Midjourney 的運作方式
跟 ChatGPT 用文字回答問題類似,Midjourney 用圖片回應你的文字描述。你輸入「一隻穿西裝的貓坐在辦公桌前開會,水彩風格」,它就會生成四張符合描述的圖片讓你挑選。
技術上,Midjourney 使用的是擴散模型(Diffusion Model)。簡單來說,它先從一張全是雜訊的圖片開始,然後逐步「去噪」,每一步讓圖片更接近你描述的內容。這個過程通常需要幾十秒到一分鐘。
操作介面
Discord
Midjourney 最早也最主要的操作方式。你加入 Midjourney 的 Discord 伺服器,在對話頻道中輸入指令。核心指令是 /imagine,後面接你的 prompt(圖片描述)。
/imagine prompt: a cyberpunk city street in Taipei at night, neon lights, rain, cinematic lighting --ar 16:9 --v 6
生成的四張圖片會直接顯示在 Discord 的對話中。你可以用按鈕選擇放大(Upscale)某一張,或根據某一張生成變體(Variation)。
網頁介面
Midjourney 後來推出了網頁介面(midjourney.com),提供更直覺的操作方式。功能包括圖片瀏覽和管理、prompt 編輯器、風格探索。對不熟悉 Discord 的使用者來說更友善。
Prompt 結構
Midjourney 的 prompt 可以拆成幾個部分:
主體描述:你想要畫什麼。「一隻柴犬在日本街道上跑步」。越具體越好,模糊的描述會得到模糊的結果。
風格指定:你想要什麼風格。可以指定畫風(watercolor、oil painting、digital art)、攝影風格(portrait、landscape、macro)、藝術運動(impressionism、art nouveau)、或參考特定的視覺風格(studio ghibli style、vaporwave)。
技術參數:用 -- 開頭的參數控制生成的技術細節。
常用參數
--ar(Aspect Ratio):設定圖片比例。--ar 16:9 是寬螢幕,--ar 9:16 是直式(適合手機桌布或 IG 限動),--ar 1:1 是正方形。
--v(Version):指定使用的模型版本。每個版本的畫風和能力不同。v6 偏向寫實,v5 偏向藝術風格。新版本通常在文字理解和細節處理上更好。
--style:在同一個版本內切換不同的風格傾向。--style raw 會減少 Midjourney 自動添加的美化效果,產出更接近你 prompt 原始描述的結果。
--no:排除你不想要的元素。--no text 可以避免圖片中出現文字(AI 生成的文字通常是亂碼)。
--chaos:控制生成結果的多樣性。數值越高(0-100),四張圖的差異越大。在探索階段可以設高一點,找到方向後再降低。
--seed:用特定的隨機種子產生可重現的結果。如果你想在某張滿意的圖片基礎上做微調,記下它的 seed 值很有用。
定價
Midjourney 沒有免費方案(曾經有,但因為使用量太大而取消)。
Basic Plan:月繳約 10 美元,每月約 200 張圖片的生成額度(以快速模式計算),適合偶爾使用。
Standard Plan:月繳約 30 美元,每月約 900 張快速生成額度,加上無限制的慢速生成(relax mode)。適合需要大量生成的創作者。
Pro Plan:月繳約 60 美元,更多快速生成額度和隱密模式(stealth mode,你的 prompt 和生成結果不會公開在社群中)。
Mega Plan:月繳約 120 美元,最大的快速生成額度。
跟 DALL-E 和 Stable Diffusion 的比較
Midjourney 的優勢是「美感」。它生成的圖片在構圖、光影、色彩上通常是三者中最有藝術感的。缺點是你對生成過程的控制有限——你主要透過文字描述來引導,沒辦法像 Stable Diffusion 那樣用 ControlNet 精確控制構圖。
DALL-E(OpenAI 開發)的優勢是文字理解能力強。它比較擅長理解複雜的描述和空間關係(「紅色球在藍色箱子的左邊」)。整合在 ChatGPT 中,使用體驗最流暢。缺點是美感通常不如 Midjourney。
Stable Diffusion 的優勢是開源、可以本機執行。你可以在自己的電腦上跑,完全控制資料。有大量的社群模型和外掛(ControlNet、LoRA、各種細分風格模型)。缺點是需要技術知識來設定和優化,需要有獨立顯卡(至少 6GB VRAM)。
如果你重視美感和易用性,選 Midjourney。如果你重視資料隱私和深度客製化,選 Stable Diffusion 自架。如果你已經在用 ChatGPT 生態系,DALL-E 是最方便的選擇。
安全與限制
版權和商用。Midjourney 的條款允許付費用戶將生成的圖片用於商業目的。但如果你在 prompt 中使用了特定藝術家的名字來模仿其風格,這在法律上存在爭議。多位藝術家已經對 AI 圖片生成公司提起訴訟,相關判例仍在發展中。
免費版的圖片預設是公開的。如果你在 Discord 公開頻道或不使用 stealth mode 生成圖片,你的 prompt 和結果會被其他人看到。涉及商業機密的設計概念,建議使用 Pro 以上方案的 stealth mode。
AI 生成圖片的辨識。AI 生成的圖片在細節上仍然有破綻:手指數量異常、文字變形、背景物件透視不一致、對稱物件的不對稱。雖然每個版本都在改進,但用放大鏡檢查仍然能發現痕跡。
深偽和詐騙風險。AI 圖片生成技術可以被用於製作假新聞照片、假產品照、假身分證件等。Midjourney 的內容政策禁止生成寫實的公眾人物圖片和暴力色情內容,但政策的執行有漏洞。C2PA 數位浮水印標準正在發展中,未來可能成為驗證圖片真實性的工具。
在台灣的使用情境。台灣的設計師和行銷人員是 Midjourney 的主要使用族群。常見的應用包括:社群貼文的配圖、簡報視覺設計、產品概念圖、品牌風格探索。要注意的是,台灣目前對 AI 生成作品的著作權認定尚無明確法規判例,使用時建議加入人工修改元素以強化著作權主張。
知識檢測
讀完文章後,測試一下你對這個主題的理解。
常見問題
Midjourney 生成的圖片有版權嗎?
根據目前的法律趨勢,純粹由 AI 生成的圖片可能不受著作權保護(美國著作權局已有類似判決)。但如果你在 AI 生成的基礎上做了顯著的人工修改和創意編輯,修改後的作品可能主張著作權。台灣的智慧財產局尚未對此做出明確裁定。
不懂英文可以用 Midjourney 嗎?
可以。Midjourney 支援中文 prompt,但英文 prompt 的理解度通常更好。建議先用中文構思畫面,再翻譯成英文輸入。也可以先用中文描述,讓 ChatGPT 幫你翻譯成適合 Midjourney 的英文 prompt。
生成一張圖要多久?
快速模式通常 30 秒到 1 分鐘。Relax 模式可能需要幾分鐘到十幾分鐘,取決於伺服器負載。Upscale(放大)通常需要額外 30 秒到 1 分鐘。
Midjourney 可以生成 Logo 嗎?
可以用來做 Logo 的概念發想和風格探索,但直接把 AI 生成的圖當作正式 Logo 通常不夠好。AI 生成的 Logo 往往細節不夠精準、不適合縮小使用、也可能跟其他作品相似。建議用 Midjourney 探索方向,再由設計師用向量工具重新繪製。
公司可以直接用 Midjourney 的圖片做廣告嗎?
Midjourney 的商用條款允許付費用戶商用,但需要注意兩個風險:一是版權爭議(如果生成的圖片跟某個受保護的作品太相似),二是品牌形象風險(消費者可能對明顯的 AI 生成圖片反感)。建議在 AI 生成的基礎上做人工修飾,而非直接使用原始輸出。
相關文章
參考資料
- Midjourney 官方文件
- 美國著作權局 AI 生成作品相關判決
- C2PA 數位內容來源標準