一句話說明
Stable Diffusion 是一個開源的 AI 圖片生成模型,你可以在自己的電腦上執行,不需要付費、不需要連網、也不受平台內容審查限制。
運作原理:從雜訊到圖片
Stable Diffusion 屬於「擴散模型」家族。它的運作邏輯可以用修復照片來理解。
想像一張照片被嚴重刮花,幾乎看不出原本的內容。如果你修復過上百萬張照片,你會慢慢學會「這種刮痕底下通常是什麼」。Stable Diffusion 做的就是這件事——它在訓練階段看了幾十億張圖片和對應的文字描述,學會了「什麼樣的雜訊底下,對應什麼樣的圖片」。
技術上,這個過程分兩步:
前向過程(Forward Process):對一張乾淨的圖片逐步加入隨機雜訊,直到變成純粹的噪點。這一步只在訓練時發生。每一步加入的雜訊量由「噪聲排程」(Noise Schedule)控制,通常用線性或餘弦排程。整個過程大約分成 1000 步,最後圖片完全變成隨機雜訊,看不出任何原始資訊。
反向過程(Reverse Process):從一團隨機雜訊開始,模型預測並移除雜訊,逐步還原出一張圖片。當你輸入文字提示詞(Prompt),模型會參考文字描述來決定「還原」成什麼樣子。反向過程是模型學習的重點——它要學會在每一步預測「當前這一步的雜訊長什麼樣」,然後把它移除。
潛在空間:為什麼叫「Stable」
Stable Diffusion 的「Stable」來自它在「潛在空間」(Latent Space)而非像素空間中運算。這個設計是它能在消費級硬體上執行的關鍵原因。
傳統的擴散模型(如 DDPM)直接在圖片的像素空間中做加噪和去噪。一張 512x512 的 RGB 圖片有 786,432 個數值,運算量非常大。Stable Diffusion 先用一個 VAE(Variational Autoencoder,變分自編碼器)把圖片壓縮成小尺寸的潛在表示。512x512 的圖片被壓縮成 64x64 的潛在向量,資料量縮小了 64 倍。
擴散過程在這個壓縮的潛在空間裡進行,運算量大幅降低。去噪完成後,再用 VAE 的解碼器把潛在向量放大回原始解析度的圖片。這個壓縮過程是有損的,但 VAE 經過訓練後,能保留圖片中人眼重視的視覺資訊,細微的損失通常察覺不到。
這個在潛在空間做擴散的方法叫做 Latent Diffusion Model(LDM),是 2022 年 Rombach 等人在論文中提出的。Stable Diffusion 就是 LDM 的實作。
文字怎麼控制圖片生成
當你輸入一段 Prompt(例如「一隻橘貓坐在窗邊,窗外是夕陽」),模型怎麼知道要畫什麼?
Stable Diffusion 使用 CLIP(Contrastive Language-Image Pretraining)模型作為文字編碼器。CLIP 是 OpenAI 訓練的模型,它同時看過大量的圖片和文字配對,學會了把文字和圖片映射到同一個向量空間。「夕陽」這個詞的向量,跟夕陽照片的向量距離很近。
你輸入的 Prompt 會被 CLIP 轉換成一組向量。在每一步去噪的過程中,這組向量會透過 Cross-Attention 機制注入到去噪網路(U-Net)中,引導去噪的方向。模型不是「畫出」你描述的東西,而是在去噪過程中,讓結果朝著與你的文字描述最匹配的方向還原。
CFG(Classifier-Free Guidance)控制文字引導的強度。去噪時,模型同時預測「有文字引導」和「沒有文字引導」兩種結果,然後把差異放大。CFG 值越高,生成結果越貼合文字描述,但也越不自然、越有「過度飽和」的感覺。通常 CFG 值設定在 7-12 之間比較平衡。設太低(3 以下)圖片會很模糊、跟文字無關;設太高(20 以上)圖片會出現色彩過飽和和形變。
開源的意義
Stable Diffusion 和 Midjourney、DALL-E 最大的差異在於:它是開源的。
模型權重公開下載。任何人都可以從 Hugging Face 取得模型檔案,不需要申請、不需要訂閱。SD 1.5 的模型大約 4GB,SDXL 大約 6.5GB,SD3 Medium 大約 4GB。
可以在本機執行。圖片生成的過程完全在你的電腦上完成,資料不會上傳到任何伺服器。這對處理商業機密素材(例如未發布的產品設計概念圖)特別重要。
沒有內容審查限制。平台型工具(Midjourney、DALL-E)會過濾特定類型的生成內容,自架的 Stable Diffusion 沒有這層限制——當然,這也意味著使用者必須自行承擔法律和倫理責任。
可以自訂訓練。透過 LoRA(Low-Rank Adaptation)或 DreamBooth,你可以用少量圖片(10-20 張)微調模型,讓它學會特定的風格或角色。這在商業應用中非常有價值——你可以訓練模型學會你的品牌視覺風格,生成風格一致的素材。
社群生態豐富。Civitai 和 Hugging Face 上有數萬個社群訓練的 LoRA 和 Checkpoint,涵蓋各種風格(寫實、動漫、水彩、油畫、像素風等)。社群的活躍度是閉源工具無法比擬的。
版本演進
了解不同版本的差異很重要,因為社群的資源和教學往往針對特定版本。
SD 1.5(2022 年 10 月)是目前社群資源最豐富的版本。預設生成 512x512 圖片,模型大約 4GB。LoRA、ControlNet 等生態工具最成熟。如果你是初學者,SD 1.5 的教學資源最多、外掛最豐富、問題最容易找到解答。缺點是解析度較低,文字理解能力較弱。
SDXL(2023 年 7 月)大幅提升了圖片品質和文字理解能力。預設生成 1024x1024 圖片,模型大約 6.5GB,需要更多 VRAM。SDXL 使用了雙重文字編碼器(CLIP ViT-L 和 OpenCLIP ViT-bigG),文字理解能力明顯進步。生成的圖片在細節、光影、構圖上都比 SD 1.5 好很多。
SD3 / SD3.5(2024 年)使用了新的 DiT(Diffusion Transformer)架構取代 U-Net,在文字渲染和畫面一致性上有進步。但因為授權條款的限制和社群生態還不成熟,採用率低於預期。
Flux(2024 年)由 Stable Diffusion 的原始開發者成立的 Black Forest Labs 發布,在部分評測指標上超越 SDXL。開源版本 Flux.1-dev 已經吸引了不少社群關注。
實際怎麼用
目前最常見的三個使用介面:
WebUI(Automatic1111/Forge)是最早流行的瀏覽器操作介面,功能多、外掛生態豐富,適合想要細調各種參數的使用者。安裝後打開瀏覽器就能用,支援 LoRA 載入、ControlNet 姿勢控制、圖生圖(img2img)、Inpainting、Outpainting 等功能。Forge 是 WebUI 的分支,針對 SDXL 和低 VRAM 做了最佳化,生成速度通常比原版 WebUI 快 30-50%。
ComfyUI 是節點式工作流介面,每個步驟都是一個可拖拉的節點。初學者的學習門檻較高,但工作流程可以存成模板重複使用,適合需要批次生成或複雜流程的進階使用者。ComfyUI 對記憶體的使用更有效率,而且支援更多新架構(如 Flux)的速度通常比 WebUI 快。2026 年 ComfyUI 的社群成長速度已經超過 WebUI。
Fooocus 是針對簡化操作設計的介面,外觀類似 Midjourney 的簡潔風格。只需要輸入 Prompt 就能生成,預設參數已經調好,適合不想碰進階設定的使用者。底層使用 SDXL,品質不錯。
安裝流程(以 WebUI/Forge 為例)大致是:安裝 Python 3.10 和 Git、下載 WebUI 的 GitHub 專案、執行安裝腳本、下載模型(Checkpoint)放到指定資料夾、啟動後在瀏覽器打開 127.0.0.1:7860 就能用。整個過程在順利的情況下大約 30 分鐘,但如果 Python 環境有問題或 NVIDIA 驅動版本不對,可能需要更多除錯時間。
進階工具
LoRA(Low-Rank Adaptation)是最常用的風格微調方式。用少量圖片(10-50 張)訓練出的小型附加模型,可以疊加在基礎模型上,改變生成風格或加入特定角色。檔案通常只有 10-200MB,社群分享非常活躍。Civitai 上有超過十萬個 LoRA 可以下載。訓練自己的 LoRA 需要一張 8GB 以上 VRAM 的 GPU,訓練時間從幾十分鐘到幾小時不等。
ControlNet 是控制生成構圖的工具,解決了「AI 畫出來的構圖不是我要的」這個常見問題。你可以用骨架圖控制人物姿勢、用線稿控制輪廓、用深度圖控制空間遠近、用邊緣偵測圖控制形狀。ControlNet 讓 Stable Diffusion 從「隨機生成」變成「可控生成」,在商業應用中價值很高。
Inpainting 選取圖片中的一部分區域,讓 AI 重新生成該區域的內容,其他部分保持不變。適合局部修改。例如把人物的衣服顏色改掉、把背景中的物件移除、或是把一張照片中損壞的部分修復。
Outpainting 則是向外延伸圖片的邊界,讓 AI 生成原本圖片範圍以外的內容。適合把一張正方形的圖片擴展成寬螢幕比例。
img2img(圖生圖)用一張現有的圖片作為起點,搭配文字 Prompt 來引導生成。你可以畫一張粗糙的草稿,用 img2img 讓 AI 把它「精緻化」,同時保留你的構圖和配色。Denoising Strength 參數控制 AI 改動的程度:設太低(0.2 以下)幾乎不改;設太高(0.8 以上)基本上完全重畫。通常 0.4-0.7 之間是比較好的範圍。
硬體需求
Stable Diffusion 對硬體有一定要求,主要瓶頸在顯示卡的 VRAM(視訊記憶體)。
基本可用:NVIDIA GPU 6GB VRAM(如 GTX 1660),可以跑 SD 1.5 生成 512x512 的圖片,每張約需 20-40 秒。SDXL 跑不太動或速度很慢。
流暢使用:NVIDIA GPU 8-12GB VRAM(如 RTX 3060 12GB / RTX 4060 Ti 16GB),SD 1.5 和 SDXL 都能跑,支援 ControlNet 和 LoRA。RTX 3060 12GB 是目前性價比最高的選擇。
進階使用:NVIDIA GPU 16GB+ VRAM(如 RTX 4080 16GB / RTX 4090 24GB),可以跑大型模型、高解析度(1024x1024 甚至 2048x2048)、批次生成。RTX 4090 生成一張 SDXL 1024x1024 的圖片只要 3-5 秒。
AMD 顯示卡透過 ROCm 也可以使用,但驅動支援不如 NVIDIA 穩定,社群除錯資源也少很多。Apple Silicon(M1/M2/M3/M4)透過 Core ML 或 MPS 可以執行,M2 Ultra 的表現接近 RTX 3060。沒有獨立顯示卡的電腦也能用純 CPU 跑,但一張圖可能要 5-10 分鐘,通常不實用。
記憶體(RAM)建議至少 16GB,32GB 更好。硬碟空間至少準備 30-50GB,因為模型、LoRA、外掛加起來很佔空間。
如果不想買 GPU,雲端方案是另一個選擇。Google Colab(免費版有 GPU 限制,Pro 版每月 $10 美元)、RunPod(按小時計費,RTX 4090 大約 $0.69/hr)、Vast.ai(社群 GPU 租賃,價格通常更便宜但穩定性不一定)。
和其他工具的比較
| 比較項目 | Stable Diffusion | Midjourney | DALL-E 3 | Flux |
|---|---|---|---|---|
| 價格 | 免費(需自備硬體) | $10-60/月 | ChatGPT Plus $20/月 | 免費(需自備硬體) |
| 執行方式 | 本機或自架 | Discord 或網頁 | ChatGPT 內建 | 本機或 API |
| 開源 | 是 | 否 | 否 | 是(部分) |
| 資料隱私 | 資料不離開電腦 | 圖片上傳雲端 | 圖片上傳 OpenAI | 本機版不上傳 |
| 自訂能力 | 極高(LoRA、ControlNet) | 低 | 低 | 中(社群發展中) |
| 上手難度 | 高 | 低 | 很低 | 高 |
| 圖片品質 | 取決於模型和參數 | 穩定且偏藝術風 | 風格通用 | 接近 Midjourney |
| 中文 Prompt | 部分模型支援 | 支援但英文較佳 | 支援 | 部分模型支援 |
選擇建議:如果重視資料隱私或需要大量客製化(自訂風格、角色、品牌視覺),Stable Diffusion 適合。如果要快速出圖且不介意資料上雲,Midjourney 或 DALL-E 更方便。如果預算有限但願意花時間學,Stable Diffusion 的長期成本最低。
常見錯誤與解決方法
Prompt 太短或太模糊。「畫一隻貓」生成的結果會非常隨機。好的 Prompt 需要包含主體、風格、細節、光線等資訊。例如:「一隻橘色虎斑貓坐在木質窗台上,窗外是雪景,柔和的自然光,寫實風格,高解析度,淺景深」。
忽略 Negative Prompt。Negative Prompt 告訴模型「不要生成什麼」,對品質影響很大。常用的 Negative Prompt 包括:「low quality, blurry, deformed, extra fingers, bad anatomy, watermark, text」。不加 Negative Prompt,手指變形和水印出現的機率會高很多。
解析度設錯。SD 1.5 最適合 512x512 或 512x768,SDXL 最適合 1024x1024 或 1024x768。如果在 SD 1.5 上設定 1024x1024,很容易出現畫面重複(兩個頭、兩個身體)的問題,因為模型在訓練時沒見過那麼高的解析度。
下載了不適合的模型。Civitai 上的模型分為 SD 1.5 和 SDXL 兩大系列,不能混用。SD 1.5 的 LoRA 不能用在 SDXL 的 Checkpoint 上,反之亦然。下載前確認模型標註的基礎架構。
VRAM 不足導致崩潰。如果你的 GPU 只有 6-8GB VRAM,開啟 ControlNet 或載入多個 LoRA 時可能會爆記憶體。解決方法:用 Forge 替代原版 WebUI(記憶體管理更好)、啟用 xformers 或 --medvram 參數、降低解析度。
安全與限制
版權爭議尚未解決。Stable Diffusion 的訓練資料包含大量網路上的圖片,其中許多受著作權保護。多起訴訟仍在進行中(如 Getty Images v. Stability AI),2025 年部分案件已有初步裁決但沒有形成明確的判例法。商業使用前需要評估法律風險,特別是如果生成結果與知名藝術家的風格高度相似的情況。
生成的圖片品質不穩定。同樣的 Prompt 可能產出品質差異很大的結果,需要反覆調整參數和提示詞。在商業場景中,你可能需要生成 10 張圖才能得到 1-2 張可用的,這在「看得到的效率」上可能不如預期。
NSFW 內容風險。開源意味著沒有平台層的內容過濾。企業部署時需要自行加上內容安全過濾機制。可以使用 Safety Checker(SD 內建但可被關閉)或外部的 NSFW 偵測 API。
模型版本更新快。從 SD 1.5 到 SDXL 到 SD3 到 Flux,每個版本的 LoRA 和外掛不一定相容。你花時間學會的工作流程、收集的模型和 LoRA,可能在下一個版本出來後部分失效。社群資源碎片化是持續存在的問題。
硬體門檻排除部分使用者。雖然比訓練模型便宜得多,但對非技術背景的使用者來說,設定 Python 環境、安裝 CUDA 驅動、選擇模型和參數仍然是顯著的障礙。
模型來源的安全風險。從不明來源下載的模型檔案(.safetensors 或 .ckpt)可能包含惡意程式碼。.ckpt 格式特別危險,因為它本質上是可執行的 Python 程式。建議只下載 .safetensors 格式的模型,並且只從 Hugging Face 官方帳號或 Civitai 信譽良好的上傳者下載。
生成圖片中的文字仍然是弱點。雖然 SDXL 和 Flux 在文字渲染上有進步,但中文字的生成仍然幾乎不可能正確。需要文字的設計素材建議在後製階段手動加上。
常見問題
Stable Diffusion 真的免費嗎?
模型本身免費下載和使用,但你需要自備硬體(一張夠力的 GPU),電費也要自己出。如果用雲端 GPU(如 Google Colab、RunPod),按使用時間計費,每小時大約 $0.3-1.5 美元。長期大量使用的話,自備一張 RTX 3060 12GB(新品大約台幣 8,000-10,000 元)會比雲端便宜。
用 Stable Diffusion 生成的圖片可以商用嗎?
目前法律上沒有明確的全球性判例。部分模型(如 SDXL)的授權條款允許商業使用生成的圖片,但如果生成結果明顯複製了訓練資料中的受保護作品,仍可能有侵權風險。建議商業使用前做三件事:確認所用模型的授權條款、避免在 Prompt 中指定特定藝術家的名字、保留生成記錄以備查核。
需要會寫程式才能用嗎?
不需要。WebUI、ComfyUI、Fooocus 都提供圖形化介面,安裝過程有大量中文教學資源。但基本的終端機操作(安裝 Python 環境、下載模型檔案、用 pip 裝套件)是必要的。如果你連終端機都不想碰,Fooocus 的一鍵安裝包是最簡單的選擇。
Stable Diffusion 能生成中文字嗎?
圖片中的文字生成是所有 AI 繪圖工具的弱項。英文字在 SDXL 和 Flux 中的正確率已經大幅改善,但中文字的筆畫複雜度遠高於英文,幾乎無法正確生成。需要文字的設計建議在 Photoshop、Canva 等後製工具中手動加上。
在公司裡自架 Stable Diffusion 需要注意什麼?
資料安全方面,自架的優勢在於圖片不會外傳,但要確保模型來源可信(從 Hugging Face 官方帳號或 Civitai 信譽良好的帳號下載 .safetensors 格式)。管理方面,建議訂定使用規範,明確哪些類型的圖片不能生成,並記錄使用日誌以供稽核。技術方面,考慮用 ComfyUI 的 API 模式或 Stable Diffusion WebUI API 整合到內部系統中,讓非技術人員也能透過簡化的介面使用。
SD 1.5、SDXL、SD3 該用哪個?
2026 年的建議:如果你剛入門、硬體有限(8GB VRAM 以下),從 SD 1.5 開始,教學資源最多。如果你有 12GB 以上 VRAM,直接用 SDXL,品質好很多。SD3 除非你有特定需求(例如文字渲染),否則目前社群生態不如 SDXL 成熟。Flux 值得關注,但生態系還在建立中。
相關文章
參考資料
- Stability AI 官方文件
- Automatic1111 WebUI GitHub
- ComfyUI GitHub
- Rombach et al., "High-Resolution Image Synthesis with Latent Diffusion Models" (2022)