同樣一句 prompt,為什麼別人的圖比你好看?AI 繪圖 prompt 結構完整拆解

你有沒有遇過這種情況:看到別人分享的 AI 圖,構圖漂亮、光線對、風格統一,然後你輸入差不多的描述,出來的東西完全不是那回事。
問題通常不是模型差,是 prompt 的結構出了事。這篇就來把這件事講清楚——不是叫你背範本,而是讓你理解為什麼某些寫法有效,這樣換一個題目你也能自己組出來。
開始之前你需要準備什麼
工具上,目前主流的 AI 繪圖平台有幾個方向:
- Midjourney:風格完整度最高,適合想要「好看」優先的人
- Stable Diffusion(本地或 ComfyUI):彈性最大,但學習曲線陡
- ChatGPT(DALL-E 底層):門檻最低,直接在對話框輸入就能跑,功能說明這篇有寫過
- Adobe Firefly、Ideogram:版權相對乾淨,適合商業用途
這篇講的 prompt 邏輯是通用的,不綁單一平台。不過如果你剛入門、只是想先把圖生出來,ChatGPT 是最省事的起點。
第一步:先確定「主體」,這是整張圖的錨
Prompt 的核心永遠是「你要畫什麼」。但光說 a woman 沒用,模型會自己補一堆預設值,出來的東西你沒辦法預期。
有效的主體描述包含:
- 是誰 / 是什麼(人物、物件、場景)
- 在做什麼動作
- 在哪裡(環境背景)
例子:
- 爛的:
a woman sitting - 好的:
a woman sitting at a wooden desk, reading a book, in a cozy home library with floor-to-ceiling shelves
差異在資訊密度。後者給了模型足夠的約束,它能發揮的「亂填」空間就小很多。
第二步:指定風格,別讓模型自己猜
風格是最容易被忽略、但影響最大的一塊。你可以透過幾個維度來指定:
藝術媒介:oil painting、watercolor、3D render、flat vector illustration
畫風參考:in the style of Studio Ghibli、cinematic photography、concept art
年代感:1980s retro、90s anime aesthetic、modern minimalist
白話講就是:你腦袋裡有個「這張圖應該長什麼感覺」的畫面,你要把那個感覺翻譯成 prompt 裡的關鍵字。如果你說不清楚,模型只能靠訓練資料裡的統計平均值幫你填,結果往往是那種沒特色的「AI 圖感」。
第三步:加入光線與色調,這是專業感的來源
同一個場景,光線描述不同,圖的質感可以差很多。這是 prompt 裡最容易被新手忽略的部分,但效果非常明顯。
幾個常用關鍵字:
golden hour lighting:黃昏溫暖光,人像最常用soft diffused light:柔光,適合靜物或室內dramatic side lighting:戲劇性側光,有張力neon-lit:霓虹氛圍,賽博龐克感overcast natural light:陰天自然光,適合寫實場景
色調方面,你可以直接說 muted earth tones、cool blue palette、high contrast black and white,這些描述在大部分模型上都能觸發一致的色彩處理。
第四步:描述構圖與鏡頭角度
構圖決定視覺重心在哪。幾個實用關鍵字:
close-up portrait:臉部特寫wide establishing shot:廣角環境全景bird's eye view:俯視角low angle shot:仰角,讓主體顯得強大rule of thirds composition:三分構圖
如果你想要那種「電影截圖感」,加上 cinematic composition, 16:9 aspect ratio 通常很有效。
第五步:用負向 prompt 排除你不想要的東西
這是 Stable Diffusion 系的核心技巧,Midjourney 用 --no 參數,ChatGPT 則是在 prompt 裡直接說「不要 X」。
常見排除項目:
blurry, low quality, distorted:排除模糊與畫質問題extra fingers, bad anatomy:排除人體結構錯誤watermark, text, logo:排除不必要的文字oversaturated colors:排除過度飽和
你可以把它想成:正向 prompt 是在說「我要什麼」,負向 prompt 是在說「這些出現了就算失敗」。兩個配合用,命中率會明顯提升。
常見錯誤與怎麼避開
錯誤一:prompt 太短,以為越簡單越好 AI 繪圖跟 ChatGPT 對話不一樣,後者可以靠上下文補足資訊,但圖像生成沒有「你懂我意思吧」這回事。資訊不足,模型就自己填,填的不一定是你要的。
錯誤二:把所有形容詞堆在一起,沒有結構
beautiful amazing stunning gorgeous magical fantasy landscape 這種寫法,模型其實處理不了這麼多強調語氣疊在一起的情況。挑最關鍵的 2-3 個,比堆一堆有效。
錯誤三:忽略畫面比例
Midjourney 有 --ar 16:9、--ar 1:1 這類參數,其他平台也有類似設定。沒指定的話,預設比例不一定符合你的用途(例如你要做 banner 卻跑出方圖)。
錯誤四:風格描述太抽象
很美的感覺、有點夢幻 這類描述沒用。要轉成模型能識別的關鍵字:ethereal, dreamlike soft focus, pastel color palette。
進階技巧:用「權重」強調關鍵元素
Midjourney 支援 (keyword::2) 這種語法來提高某個詞的權重,Stable Diffusion 也有類似的 (keyword:1.5) 格式。
例如你想強調某個特定光線效果:
a forest path, (golden hour lighting::2), soft mist, wide shot
這樣光線相關的處理會比其他元素更被優先考慮。
另外,如果你要維持跨圖一致的風格(比如做一個角色的多張圖),可以把固定的風格描述存成「style template」,每次只換主體描述,其他部分照抄。這個工作流在 Midjourney 和 ChatGPT 的比較這篇有順帶提到各平台的風格一致性差異。
你的第一張圖出來之後,這樣檢查
生完圖之後,用這幾個問題快速判斷要不要繼續改 prompt:
- 主體有沒有出現,還是被背景淹掉?→ 加強主體描述的資訊密度
- 風格對不對?→ 確認風格關鍵字有沒有被其他描述稀釋
- 光線感對不對?→ 這通常是最快見效的調整點
- 有沒有奇怪的結構錯誤(多手指、扭曲臉)?→ 加進負向 prompt
通常改個 2-3 輪就能穩定在你想要的方向。記住,prompt 工程本來就是迭代的過程,第一次不對很正常,關鍵是你知道哪個環節出問題、改哪裡。
常見問題
AI 繪圖 prompt 要用中文還是英文寫?
大部分主流模型(Midjourney、Stable Diffusion)用英文效果會更穩定,因為訓練資料以英文為主。ChatGPT 的圖像生成對中文支援較好,但如果你要精確控制風格細節,還是建議用英文關鍵字,尤其是光線、風格、構圖這幾個維度。
prompt 要寫多長才夠?有沒有字數建議?
沒有固定字數,但一般建議涵蓋:主體描述、風格、光線、構圖四個維度。大概 30-80 個英文單字是常見的有效範圍。太短會讓模型自己填空,太長反而可能讓各描述互相稀釋。
負向 prompt 一定要加嗎?
不是必填,但如果你的圖一直出現特定問題(手指變形、畫質模糊、多餘文字),負向 prompt 是最直接的修正方式。Midjourney 用 --no 參數,ChatGPT 則直接在指令裡說「不要出現 X」。
同樣的 prompt 每次跑出來都不一樣,怎麼辦?
這是生成式 AI 的基本特性,每次都帶有隨機性。如果你想要更穩定的結果,可以固定 seed 值(Midjourney 用 --seed 參數),或把最成功的一張圖作為參考圖輸入,讓模型在這個基礎上做變化。
可以直接說「幫我畫一張像電影海報的圖」嗎?
可以,但這種描述太抽象,結果會很不穩定。建議把「電影海報感」拆解成具體關鍵字:cinematic lighting、dramatic composition、bold typography(如果需要文字)、high contrast。越具體,命中率越高。
分享這篇



