Stable Diffusion 是什麼?開源 AI 繪圖工具白話解析

一句話說明

Stable Diffusion 是一個開源的 AI 圖片生成模型,你可以在自己的電腦上執行,不需要付費、不需要連網、也不受平台內容審查限制。

運作原理:從雜訊到圖片

Stable Diffusion 屬於「擴散模型」家族。它的運作邏輯可以用修復照片來理解。

想像一張照片被嚴重刮花,幾乎看不出原本的內容。如果你修復過上百萬張照片,你會慢慢學會「這種刮痕底下通常是什麼」。Stable Diffusion 做的就是這件事——它在訓練階段看了幾十億張圖片和對應的文字描述,學會了「什麼樣的雜訊底下,對應什麼樣的圖片」。

技術上,這個過程分兩步:

前向過程(Forward Process):對一張乾淨的圖片逐步加入隨機雜訊,直到變成純粹的噪點。這一步只在訓練時發生。每一步加入的雜訊量由「噪聲排程」(Noise Schedule)控制,通常用線性或餘弦排程。整個過程大約分成 1000 步,最後圖片完全變成隨機雜訊,看不出任何原始資訊。

反向過程(Reverse Process):從一團隨機雜訊開始,模型預測並移除雜訊,逐步還原出一張圖片。當你輸入文字提示詞(Prompt),模型會參考文字描述來決定「還原」成什麼樣子。反向過程是模型學習的重點——它要學會在每一步預測「當前這一步的雜訊長什麼樣」,然後把它移除。

潛在空間:為什麼叫「Stable」

Stable Diffusion 的「Stable」來自它在「潛在空間」(Latent Space)而非像素空間中運算。這個設計是它能在消費級硬體上執行的關鍵原因。

傳統的擴散模型(如 DDPM)直接在圖片的像素空間中做加噪和去噪。一張 512x512 的 RGB 圖片有 786,432 個數值,運算量非常大。Stable Diffusion 先用一個 VAE(Variational Autoencoder,變分自編碼器)把圖片壓縮成小尺寸的潛在表示。512x512 的圖片被壓縮成 64x64 的潛在向量,資料量縮小了 64 倍。

擴散過程在這個壓縮的潛在空間裡進行,運算量大幅降低。去噪完成後,再用 VAE 的解碼器把潛在向量放大回原始解析度的圖片。這個壓縮過程是有損的,但 VAE 經過訓練後,能保留圖片中人眼重視的視覺資訊,細微的損失通常察覺不到。

這個在潛在空間做擴散的方法叫做 Latent Diffusion Model(LDM),是 2022 年 Rombach 等人在論文中提出的。Stable Diffusion 就是 LDM 的實作。

文字怎麼控制圖片生成

當你輸入一段 Prompt(例如「一隻橘貓坐在窗邊,窗外是夕陽」),模型怎麼知道要畫什麼?

Stable Diffusion 使用 CLIP(Contrastive Language-Image Pretraining)模型作為文字編碼器。CLIP 是 OpenAI 訓練的模型,它同時看過大量的圖片和文字配對,學會了把文字和圖片映射到同一個向量空間。「夕陽」這個詞的向量,跟夕陽照片的向量距離很近。

你輸入的 Prompt 會被 CLIP 轉換成一組向量。在每一步去噪的過程中,這組向量會透過 Cross-Attention 機制注入到去噪網路(U-Net)中,引導去噪的方向。模型不是「畫出」你描述的東西,而是在去噪過程中,讓結果朝著與你的文字描述最匹配的方向還原。

CFG(Classifier-Free Guidance)控制文字引導的強度。去噪時,模型同時預測「有文字引導」和「沒有文字引導」兩種結果,然後把差異放大。CFG 值越高,生成結果越貼合文字描述,但也越不自然、越有「過度飽和」的感覺。通常 CFG 值設定在 7-12 之間比較平衡。設太低(3 以下)圖片會很模糊、跟文字無關;設太高(20 以上)圖片會出現色彩過飽和和形變。

開源的意義

Stable Diffusion 和 Midjourney、DALL-E 最大的差異在於:它是開源的。

模型權重公開下載。任何人都可以從 Hugging Face 取得模型檔案,不需要申請、不需要訂閱。SD 1.5 的模型大約 4GB,SDXL 大約 6.5GB,SD3 Medium 大約 4GB。

可以在本機執行。圖片生成的過程完全在你的電腦上完成,資料不會上傳到任何伺服器。這對處理商業機密素材(例如未發布的產品設計概念圖)特別重要。

沒有內容審查限制。平台型工具(Midjourney、DALL-E)會過濾特定類型的生成內容,自架的 Stable Diffusion 沒有這層限制——當然,這也意味著使用者必須自行承擔法律和倫理責任。

可以自訂訓練。透過 LoRA(Low-Rank Adaptation)或 DreamBooth,你可以用少量圖片(10-20 張)微調模型,讓它學會特定的風格或角色。這在商業應用中非常有價值——你可以訓練模型學會你的品牌視覺風格,生成風格一致的素材。

社群生態豐富。Civitai 和 Hugging Face 上有數萬個社群訓練的 LoRA 和 Checkpoint,涵蓋各種風格(寫實、動漫、水彩、油畫、像素風等)。社群的活躍度是閉源工具無法比擬的。

版本演進

了解不同版本的差異很重要,因為社群的資源和教學往往針對特定版本。

SD 1.5(2022 年 10 月)是目前社群資源最豐富的版本。預設生成 512x512 圖片,模型大約 4GB。LoRA、ControlNet 等生態工具最成熟。如果你是初學者,SD 1.5 的教學資源最多、外掛最豐富、問題最容易找到解答。缺點是解析度較低,文字理解能力較弱。

SDXL(2023 年 7 月)大幅提升了圖片品質和文字理解能力。預設生成 1024x1024 圖片,模型大約 6.5GB,需要更多 VRAM。SDXL 使用了雙重文字編碼器(CLIP ViT-L 和 OpenCLIP ViT-bigG),文字理解能力明顯進步。生成的圖片在細節、光影、構圖上都比 SD 1.5 好很多。

SD3 / SD3.5(2024 年)使用了新的 DiT(Diffusion Transformer)架構取代 U-Net,在文字渲染和畫面一致性上有進步。但因為授權條款的限制和社群生態還不成熟,採用率低於預期。

Flux(2024 年)由 Stable Diffusion 的原始開發者成立的 Black Forest Labs 發布,在部分評測指標上超越 SDXL。開源版本 Flux.1-dev 已經吸引了不少社群關注。

實際怎麼用

目前最常見的三個使用介面:

WebUI(Automatic1111/Forge)是最早流行的瀏覽器操作介面,功能多、外掛生態豐富,適合想要細調各種參數的使用者。安裝後打開瀏覽器就能用,支援 LoRA 載入、ControlNet 姿勢控制、圖生圖(img2img)、Inpainting、Outpainting 等功能。Forge 是 WebUI 的分支,針對 SDXL 和低 VRAM 做了最佳化,生成速度通常比原版 WebUI 快 30-50%。

ComfyUI 是節點式工作流介面,每個步驟都是一個可拖拉的節點。初學者的學習門檻較高,但工作流程可以存成模板重複使用,適合需要批次生成或複雜流程的進階使用者。ComfyUI 對記憶體的使用更有效率,而且支援更多新架構(如 Flux)的速度通常比 WebUI 快。2026 年 ComfyUI 的社群成長速度已經超過 WebUI。

Fooocus 是針對簡化操作設計的介面,外觀類似 Midjourney 的簡潔風格。只需要輸入 Prompt 就能生成,預設參數已經調好,適合不想碰進階設定的使用者。底層使用 SDXL,品質不錯。

安裝流程(以 WebUI/Forge 為例)大致是:安裝 Python 3.10 和 Git、下載 WebUI 的 GitHub 專案、執行安裝腳本、下載模型(Checkpoint)放到指定資料夾、啟動後在瀏覽器打開 127.0.0.1:7860 就能用。整個過程在順利的情況下大約 30 分鐘,但如果 Python 環境有問題或 NVIDIA 驅動版本不對,可能需要更多除錯時間。

進階工具

LoRA(Low-Rank Adaptation)是最常用的風格微調方式。用少量圖片(10-50 張)訓練出的小型附加模型,可以疊加在基礎模型上,改變生成風格或加入特定角色。檔案通常只有 10-200MB,社群分享非常活躍。Civitai 上有超過十萬個 LoRA 可以下載。訓練自己的 LoRA 需要一張 8GB 以上 VRAM 的 GPU,訓練時間從幾十分鐘到幾小時不等。

ControlNet 是控制生成構圖的工具,解決了「AI 畫出來的構圖不是我要的」這個常見問題。你可以用骨架圖控制人物姿勢、用線稿控制輪廓、用深度圖控制空間遠近、用邊緣偵測圖控制形狀。ControlNet 讓 Stable Diffusion 從「隨機生成」變成「可控生成」,在商業應用中價值很高。

Inpainting 選取圖片中的一部分區域,讓 AI 重新生成該區域的內容,其他部分保持不變。適合局部修改。例如把人物的衣服顏色改掉、把背景中的物件移除、或是把一張照片中損壞的部分修復。

Outpainting 則是向外延伸圖片的邊界,讓 AI 生成原本圖片範圍以外的內容。適合把一張正方形的圖片擴展成寬螢幕比例。

img2img(圖生圖)用一張現有的圖片作為起點,搭配文字 Prompt 來引導生成。你可以畫一張粗糙的草稿,用 img2img 讓 AI 把它「精緻化」,同時保留你的構圖和配色。Denoising Strength 參數控制 AI 改動的程度:設太低(0.2 以下)幾乎不改;設太高(0.8 以上)基本上完全重畫。通常 0.4-0.7 之間是比較好的範圍。

硬體需求

Stable Diffusion 對硬體有一定要求,主要瓶頸在顯示卡的 VRAM(視訊記憶體)。

基本可用:NVIDIA GPU 6GB VRAM(如 GTX 1660),可以跑 SD 1.5 生成 512x512 的圖片,每張約需 20-40 秒。SDXL 跑不太動或速度很慢。

流暢使用:NVIDIA GPU 8-12GB VRAM(如 RTX 3060 12GB / RTX 4060 Ti 16GB),SD 1.5 和 SDXL 都能跑,支援 ControlNet 和 LoRA。RTX 3060 12GB 是目前性價比最高的選擇。

進階使用:NVIDIA GPU 16GB+ VRAM(如 RTX 4080 16GB / RTX 4090 24GB),可以跑大型模型、高解析度(1024x1024 甚至 2048x2048)、批次生成。RTX 4090 生成一張 SDXL 1024x1024 的圖片只要 3-5 秒。

AMD 顯示卡透過 ROCm 也可以使用,但驅動支援不如 NVIDIA 穩定,社群除錯資源也少很多。Apple Silicon(M1/M2/M3/M4)透過 Core ML 或 MPS 可以執行,M2 Ultra 的表現接近 RTX 3060。沒有獨立顯示卡的電腦也能用純 CPU 跑,但一張圖可能要 5-10 分鐘,通常不實用。

記憶體(RAM)建議至少 16GB,32GB 更好。硬碟空間至少準備 30-50GB,因為模型、LoRA、外掛加起來很佔空間。

如果不想買 GPU,雲端方案是另一個選擇。Google Colab(免費版有 GPU 限制,Pro 版每月 $10 美元)、RunPod(按小時計費,RTX 4090 大約 $0.69/hr)、Vast.ai(社群 GPU 租賃,價格通常更便宜但穩定性不一定)。

和其他工具的比較

比較項目 Stable Diffusion Midjourney DALL-E 3 Flux
價格 免費(需自備硬體) $10-60/月 ChatGPT Plus $20/月 免費(需自備硬體)
執行方式 本機或自架 Discord 或網頁 ChatGPT 內建 本機或 API
開源 是(部分)
資料隱私 資料不離開電腦 圖片上傳雲端 圖片上傳 OpenAI 本機版不上傳
自訂能力 極高(LoRA、ControlNet) 中(社群發展中)
上手難度 很低
圖片品質 取決於模型和參數 穩定且偏藝術風 風格通用 接近 Midjourney
中文 Prompt 部分模型支援 支援但英文較佳 支援 部分模型支援

選擇建議:如果重視資料隱私或需要大量客製化(自訂風格、角色、品牌視覺),Stable Diffusion 適合。如果要快速出圖且不介意資料上雲,Midjourney 或 DALL-E 更方便。如果預算有限但願意花時間學,Stable Diffusion 的長期成本最低。

常見錯誤與解決方法

Prompt 太短或太模糊。「畫一隻貓」生成的結果會非常隨機。好的 Prompt 需要包含主體、風格、細節、光線等資訊。例如:「一隻橘色虎斑貓坐在木質窗台上,窗外是雪景,柔和的自然光,寫實風格,高解析度,淺景深」。

忽略 Negative Prompt。Negative Prompt 告訴模型「不要生成什麼」,對品質影響很大。常用的 Negative Prompt 包括:「low quality, blurry, deformed, extra fingers, bad anatomy, watermark, text」。不加 Negative Prompt,手指變形和水印出現的機率會高很多。

解析度設錯。SD 1.5 最適合 512x512 或 512x768,SDXL 最適合 1024x1024 或 1024x768。如果在 SD 1.5 上設定 1024x1024,很容易出現畫面重複(兩個頭、兩個身體)的問題,因為模型在訓練時沒見過那麼高的解析度。

下載了不適合的模型。Civitai 上的模型分為 SD 1.5 和 SDXL 兩大系列,不能混用。SD 1.5 的 LoRA 不能用在 SDXL 的 Checkpoint 上,反之亦然。下載前確認模型標註的基礎架構。

VRAM 不足導致崩潰。如果你的 GPU 只有 6-8GB VRAM,開啟 ControlNet 或載入多個 LoRA 時可能會爆記憶體。解決方法:用 Forge 替代原版 WebUI(記憶體管理更好)、啟用 xformers 或 --medvram 參數、降低解析度。

安全與限制

版權爭議尚未解決。Stable Diffusion 的訓練資料包含大量網路上的圖片,其中許多受著作權保護。多起訴訟仍在進行中(如 Getty Images v. Stability AI),2025 年部分案件已有初步裁決但沒有形成明確的判例法。商業使用前需要評估法律風險,特別是如果生成結果與知名藝術家的風格高度相似的情況。

生成的圖片品質不穩定。同樣的 Prompt 可能產出品質差異很大的結果,需要反覆調整參數和提示詞。在商業場景中,你可能需要生成 10 張圖才能得到 1-2 張可用的,這在「看得到的效率」上可能不如預期。

NSFW 內容風險。開源意味著沒有平台層的內容過濾。企業部署時需要自行加上內容安全過濾機制。可以使用 Safety Checker(SD 內建但可被關閉)或外部的 NSFW 偵測 API。

模型版本更新快。從 SD 1.5 到 SDXL 到 SD3 到 Flux,每個版本的 LoRA 和外掛不一定相容。你花時間學會的工作流程、收集的模型和 LoRA,可能在下一個版本出來後部分失效。社群資源碎片化是持續存在的問題。

硬體門檻排除部分使用者。雖然比訓練模型便宜得多,但對非技術背景的使用者來說,設定 Python 環境、安裝 CUDA 驅動、選擇模型和參數仍然是顯著的障礙。

模型來源的安全風險。從不明來源下載的模型檔案(.safetensors 或 .ckpt)可能包含惡意程式碼。.ckpt 格式特別危險,因為它本質上是可執行的 Python 程式。建議只下載 .safetensors 格式的模型,並且只從 Hugging Face 官方帳號或 Civitai 信譽良好的上傳者下載。

生成圖片中的文字仍然是弱點。雖然 SDXL 和 Flux 在文字渲染上有進步,但中文字的生成仍然幾乎不可能正確。需要文字的設計素材建議在後製階段手動加上。

常見問題

Stable Diffusion 真的免費嗎?

模型本身免費下載和使用,但你需要自備硬體(一張夠力的 GPU),電費也要自己出。如果用雲端 GPU(如 Google Colab、RunPod),按使用時間計費,每小時大約 $0.3-1.5 美元。長期大量使用的話,自備一張 RTX 3060 12GB(新品大約台幣 8,000-10,000 元)會比雲端便宜。

用 Stable Diffusion 生成的圖片可以商用嗎?

目前法律上沒有明確的全球性判例。部分模型(如 SDXL)的授權條款允許商業使用生成的圖片,但如果生成結果明顯複製了訓練資料中的受保護作品,仍可能有侵權風險。建議商業使用前做三件事:確認所用模型的授權條款、避免在 Prompt 中指定特定藝術家的名字、保留生成記錄以備查核。

需要會寫程式才能用嗎?

不需要。WebUI、ComfyUI、Fooocus 都提供圖形化介面,安裝過程有大量中文教學資源。但基本的終端機操作(安裝 Python 環境、下載模型檔案、用 pip 裝套件)是必要的。如果你連終端機都不想碰,Fooocus 的一鍵安裝包是最簡單的選擇。

Stable Diffusion 能生成中文字嗎?

圖片中的文字生成是所有 AI 繪圖工具的弱項。英文字在 SDXL 和 Flux 中的正確率已經大幅改善,但中文字的筆畫複雜度遠高於英文,幾乎無法正確生成。需要文字的設計建議在 Photoshop、Canva 等後製工具中手動加上。

在公司裡自架 Stable Diffusion 需要注意什麼?

資料安全方面,自架的優勢在於圖片不會外傳,但要確保模型來源可信(從 Hugging Face 官方帳號或 Civitai 信譽良好的帳號下載 .safetensors 格式)。管理方面,建議訂定使用規範,明確哪些類型的圖片不能生成,並記錄使用日誌以供稽核。技術方面,考慮用 ComfyUI 的 API 模式或 Stable Diffusion WebUI API 整合到內部系統中,讓非技術人員也能透過簡化的介面使用。

SD 1.5、SDXL、SD3 該用哪個?

2026 年的建議:如果你剛入門、硬體有限(8GB VRAM 以下),從 SD 1.5 開始,教學資源最多。如果你有 12GB 以上 VRAM,直接用 SDXL,品質好很多。SD3 除非你有特定需求(例如文字渲染),否則目前社群生態不如 SDXL 成熟。Flux 值得關注,但生態系還在建立中。

相關文章

參考資料

  • Stability AI 官方文件
  • Automatic1111 WebUI GitHub
  • ComfyUI GitHub
  • Rombach et al., "High-Resolution Image Synthesis with Latent Diffusion Models" (2022)