Seedance 的提示詞是否在拓寬影視工業的進入門檻?
生成影片的 prompt 不是抽卡的咒語,是影視工業製作過程中所有決策的集合體。
多年前有一本書《人人都是產品經理》鼓舞著許多人踏進科技公司當牛馬;2026 年的現在,綁定信用卡、輸入提示詞就能生成影片。影視工業經歷過那麼多次攝製器材的演化之後,這是第一次出現基因突變類型的變異:你只要能打字就行。
Seedance 官方教學建議的提示詞進階公式:精準主體 + 動作細節 + 場景環境 + 光影色調 + 鏡頭運鏡 + 視覺風格 + 畫質 + 約束條件
來自 Seedance 官方建議的提示詞結構讓普通用戶窺見了至今仍顯得神秘的影視工業從業者的工作內容。我們都聽過選角、演技、場景、美術、攝影、燈光、故事版、分鏡、故事結構等名詞;但隨著 ComfyUI、FLUX、Stable Diffusion 的出現,影視工業近百年累積的成果正在被「輸入提示詞」與「抽卡」拆解。
燈光師在片場可能會這麼說:「窗外那顆 12K 先穿一層 1/2 Grid,色溫維持 5600K。人物右臉反光太多,負補再靠近一點;key 收半檔。背景的 practical 留在 3200K,不要搶過人物,冷暖關係才會留在畫面裡。」
這幾句在片場不是裝飾性的術語,而是一連串具體決策:光從哪裡來、要多硬、人物的臉保留多少陰影、背景和主體怎麼拉開。但一個燈光都沒扛過的你我他在提示詞裡寫下:「窗外冷色日光、人物右側陰影、背景保留暖色實景燈」,就可能得到類似的效果。
好好好,大不了抽卡。BytePlus 的 Seedance 2.0 一秒大概 4.5 元,生成一支 10 秒的影片大於 45 元,抽 10 次要花大約 450 元,這是個划算的內容創作未來(?)。
模型成為了你的攝製組(信用卡額度是你的製片)
一名穿著棒球外套的中年男子,在便利商店門口停下腳步、轉頭望向街道;深夜城市街角,雨剛停,地面積水反光;招牌的冷白光從側面打在他臉上,背景是暖黃路燈;鏡頭由中景緩慢推近到胸上景;寫實電影感、輕微顆粒;4K、細節豐富;不要字幕、不要浮水印。
當你送出這段 prompt 的時候,恭喜你,你是一位能被 Seedance 認可的導演了。
一句話,八個決策。你剛剛同時當完了選角、演員、美術、燈光、攝影和調光師,還順手把後期也管了。但在以前要拍一個畫面,你得先找人:誰掌鏡、誰佈光、誰搭景、誰選演員,最後還得有人替這一切買單。現在你坐在螢幕前,模型把這些工種暫時塞進同一個介面裡。你寫的每一句 prompt,都在同時交代好幾件事。
- 誰在畫面裡;
- 人怎麼走、怎麼停、什麼時候該哭;
- 他站在哪裡、窗外是什麼天氣;
- 鏡頭離他多遠、往哪裡移;
- 畫面要冷一點、舊一點。
現在,你要顧慮的是信用卡額度夠不夠,畢竟你的攝製組不會抱怨你又改主意,而你的信用卡帳單則是一個月一次提醒你要付錢。
還需要學會什麼才能開始用 AI 生成影片?
別再找課程上了,直接開始「玩」才是學會的第一步。
鏡頭:你早已被訓練出觀眾想看什麼
你大概知道影視劇中配角都怎麼自取滅亡的。鏡頭會先拍這群人發生爭執、配角自作聰明帶人離開,過 2-3 分鐘鏡頭切到這群人在光源差的場景渾身顫抖、拿著絕對來不及揮舞的武器,然後怪物就從奇怪的角度把這群配角(以及龍套)給滅了。
這套順序不是你天生就懂,是你看電影、動畫、MV、短影片、韓國條漫、日漫時,一格一格被訓練出來的。
漫畫把這件事教得特別直接:遠景先告訴你人在哪裡,下一格切到手上的東西,再來一格才給表情。電影則多了配樂、即時動效、演員的台詞功力。其實你早就被影視工業、動漫產業訓練出一定的審美,只是從來沒有什麼機會去表達你個人定義的視覺美感。
故事板:你腦中那部片的底稿
故事板不是把畫畫得多漂亮,也不是先把整支片想完。它只是幫你把腦中同時冒出來的畫面排隊。模型最怕的,是你把人物、情緒、轉折、場景和十種運鏡一次塞進一段話,然後期待它自己剪成電影。
例如,你想拍「一個人在雨夜的車站等不到人」,可以先只排三格:
- 空曠月台的遠景,雨水打在鐵軌上;
- 人物站在站牌下,低頭看著沒有亮起的手機;
- 手機畫面熄掉,他抬頭,最後一班車從身後呼嘯而過。
這裡還沒有完整劇本,卻已經有了空間、人物、情緒和節奏。你可以從一張漫畫、一個 MV 片段,或一段自己很熟的電影場景開始練習:不要急著複製它的風格,先把它為什麼讓你想看下去拆出來。
創作主權始終在你
模型不會拒絕你的 prompt。
你寫「一個很美的雨夜」,各家模型一定給得出東西:濕掉的地面、路燈的光暈,可能還有一把傘。看起來還行。但問題就在這裡,為什麼你願意接受這麼簡單的 prompt 所產出的視覺內容?回頭看片場那位燈光師。他能一口氣下五個指令,不是因為他背過術語,是因為他知道自己要哪一種好看。你寫不出「1/2 Grid」沒關係,但你得先回答同一個問題:你要的是哪一種雨夜?
街道凹陷處的積水、大風大雨吹過的路樹、最高速的雨刷依然沒有作用的暴雨都可以是雨夜。
上一節那三格也是同樣的道理——空月台、沒亮起的手機、身後的末班車。這件事其實有前例:AI coding 剛起來的時候,大家花了很長時間研究 prompt engineering——同一個模型,指令怎麼寫,產出天差地遠。影片這邊正在發生一模一樣的事,只是還沒有人好好替它命名,姑且叫它 Video Prompt Optimizing。差別在於,寫程式的 prompt 追求的是正確,而拍影片的 prompt 追求的是你腦中那個畫面。
而且很幸運的是,視覺沒有正確的解答,你總能通過社群網絡找到你的觀眾。
畫面沒有標準答案,你的想像力決定模型的上限。同樣是抽卡,那 450 元買到的可以是完全不同的東西:不知道自己要什麼的人,是在買選項——抽十次,挑一個最順眼的;知道自己要什麼的人,是在買精度——抽三次,比對哪一次最接近腦子裡那個畫面,然後停手。
不要讓模型填滿你沒定義的畫面。就算你的鏡頭設計還不成熟,那仍然是你的決定;一旦你不決定,決定的就是模型。不要當被模型使用的人類。
先去拍一支
找一幕你一直記得的漫畫、電影或生活片段的文本,在腦海中拆成三個分鏡。 然後去 fuse 告訴你的攝製組:Act 1,要拍什麼、怎麼拍。
