AI 生成影片真的會看故事板?Seedance 2.5 把 8 格分鏡全用上了 的文章封面

AI 生成影片真的會看故事板?Seedance 2.5 把 8 格分鏡全用上了

我們把 16:9 與 9:16 多宮格分鏡圖逐格對回 60fps 成片。P01–P08 全部出現;P02/P03 的黏連和 Desktop Act 3 的大跳切,也把我們沒寫清楚的運鏡當場抓包。

教學
發布
更新

簡單講:故事板好用、字節跳動工程師牛逼! Seedance 2.5 不止看了還把鏡頭的連續性做出來了,而且看得比我們第一次做的對照表還仔細。彷彿在嫌棄我們團隊怎麼那麼偷懶。

兩支成片都找得到 P01–P08。直式 P01 在第 3 秒又出現一次,P02 的構圖一路活到 P03 開始,Mobile P07 也比我們原本標記的位置早了 0.1 秒。這幾格是編輯回看文章時抓出來的。我們只好把 FFmpeg 再打開,半秒、半秒往回找。

不出意外的話,這時候肯定要寫跟意外相關的論述了,沒,沒那麼多意外,這樣的內容生成過程 ( 互動式創作 ),我們誠心建議中小規模的 youtuber、個體創作者、普通用戶,將故事板視作影片生成前的必備素材之一。

故事板真的有效嗎?P01–P08 一格都沒漏

這次一共送出六次生成:Desktop 的 Act 1、2、3 各一次,Mobile 也各一次。每個 Act 只使用自己的故事板區段;Act 3 再加入同一比例的 Act 2 尾幀,鎖定下一段開場。

Act 使用的分鏡 事件
Act 1 P01–P03 貓蜷縮、抬頭、伸掌試水
Act 2 P04–P06 紙船發光、貓踏水、鼻尖靠近
Act 3 P07–P08 紙船浮起、貓跟著紙船離場

重抽代表格後,八格的落點如下。我們把這些 frame 當成視覺證據,不拿它們冒充模型承諾的逐格時間表。

分鏡 Act 16:9 代表格 9:16 代表格
P01 Act 1 1.500 秒,f90 3.000 秒,f180(P01→P02 邊界)
P02 Act 1 7.500 秒,f450 8.000 秒,f480
P03 Act 1 9.167 秒,f550 9.167 秒,f550
P04 Act 2 12.033 秒,f722 12.033 秒,f722
P05 Act 2 17.800 秒,f1068 19.000 秒,f1140
P06 Act 2 22.500 秒,f1350 22.500 秒,f1350
P07 Act 3 31.500 秒,f1890 34.200 秒,f2052
P08 Act 3 36.000 秒,f2160 41.000 秒,f2460

完整故事與六次生成流程另見〈用 AI 做影片:一艘紙船來接一隻貓〉。這篇把注意力留給故事板、Prompt 與成片。

Multi-panel storyboard reference:BytePlus 官方到底支持什麼

BytePlus 在 Seedance 2.5 Prompt Guide 裡把這項能力稱為 Multi-panel storyboard reference。官方示例用九宮格安排整體鏡頭結構、景別與運鏡節奏;同一份文件也提醒,多宮格不會逐格逐幀照抄,生成影片仍有自己的活動空間。需要更嚴格對齊時,官方建議拆成多張 keyframe reference。BytePlus 官方文件

我們就照這個尺度驗收:順序有沒有走完、構圖關係有沒有留下、事件有沒有發生。門在哪一秒關上,或紙船向左多飄了一點,沒有一票否決權。

成片前:八格圖先把 45 秒的故事釘在牆上

故事板在生成前就已經值回票價。P01–P08 給了故事共同索引,我們可以直接說「Act 2 從 P04 開始」或「P07 要接 Act 2 尾幀」,不用每次重新描述整個雨夜。

實際送進 Desktop 生成的 16:9 多宮格

16:9 橫式八格故事板,依左至右、由上而下呈現貓蜷縮在破紙箱旁、抬頭看紙船、伸掌試水、紙船微光、貓靠近紙船、鼻尖貼近、紙船浮起,以及貓跟著紙船走入雨街。

16:9 多宮格。Seedream 5.0 Lite生成的時候順手裁掉了 P01–P03 標題

實際送進 Mobile 生成的 9:16 多宮格

9:16 直式八格故事板,依左至右、由上而下呈現貓蜷縮在破紙箱旁、紙船靠近、伸掌試水、紙船微光、貓靠近紙船、鼻尖貼近、紙船浮起,以及貓跟著紙船走入雨街。

9:16 多宮格。這次 Seedream 5.0 Lite 好心腸還留了一半的上緣。

兩支來源成片都是 60fps。我們以景別、主體相對位置、視線、前掌方向、門框、積水和離場方向找代表格。16:9 就保留橫式可讀尺寸,9:16 也維持直式;沒有理由把兩種比例硬壓成同一個框。

Act 1:P01 在第 3 秒回來,P02/P03 接得像同一鏡

P01:第 3 秒同時住著兩個分鏡

1.500 秒的橫式代表格已經證明 P01 進了成片。直式的 3.000 秒更值得停一下:紙船進到前景,貓還縮在紙箱旁。左邊是 P01,右邊卻已經聞得到 P02。

16:9

P01 16:9 左右對照:左為正式多宮格分鏡,右為 1.500 秒的成片代表格;貓蜷縮在破紙箱旁。

P01,16:9。成片代表格為 1.500 秒、f90。

9:16

P01 9:16 左右對照:左為正式多宮格分鏡,右為 3.000 秒的邊界影格;貓仍蜷縮,紙船已進入前景。

P01→P02 邊界,9:16。成片影格為 3.000 秒、f180。

回看實際提交的 P01,最後一句很有份量:

P01,0–3秒:中近景、固定機位。貓蜷縮在濕紙箱旁,身體縮成球狀,頭低埋於前肢之間,尾巴環繞軀幹;雨水落在貓與前方積水上,積水映著霓虹的彩色倒影。結束時貓仍蜷縮未動。

FFmpeg 在直式 Act 1 偵測到的第一個明顯切點是 2.950 秒。成片能確認的是:切換後還留著 P01「仍蜷縮未動」的結束狀態,P02 的紙船已經進場。

第 3 秒這格沒有乾淨地站隊。它把 P01 的結束狀態和 P02 的開始事件疊在一起。對故事來說很順,對逐格驗收的人來說則是一張小考卷。

如果你對運鏡有很高的要求,那我們的建議是先讓老闆儲值。

P02:來了,比我們第一次標記的時間晚

P02 的核心關係是貓在一側、紙船在另一側,貓抬頭盯著船。橫式在 7.500 秒最清楚,直式則落在 8.000 秒。此時 P03 的探掌動作已經開始冒頭,這正是兩格看起來黏在一起的原因。這邊再次證明了影片生成模型真的太偉大了,提示詞讓 Seedance 2.5 生成( 拍攝 )連續性的動作。

畢竟對我們來說,要發通告請活生生的貓咪來演出這 45 秒的短影片的話,那會亮燈的紙船,我們得準備起碼10艘,還怕貓咪看不上紙船呢。

16:9|左為正式分鏡;右為成片

P02 16:9 左右對照:左為正式多宮格分鏡,右為 7.500 秒的成片代表格;貓在左、紙船在右,前掌準備探出。

P02,16:9。成片代表格為 7.500 秒、f450。P03 動作已開始。

9:16|左為正式分鏡;右為成片

P02 9:16 左右對照:左為正式多宮格分鏡,右為 8.000 秒的成片代表格;貓與紙船保留分鏡的左右關係。

P02,9:16。成片代表格為 8.000 秒、f480。P02 的構圖延續進 P03。

P03:模型有切鏡,只是我們把兩句運鏡寫得太像

完整探掌姿勢在兩支片的 9.167 秒都很清楚。P03 沒有失蹤,貓沒有斷腿( 不然導演肯定又想起他那兩隻貓貓了 )。

16:9

P03 16:9 左右對照:左為正式多宮格分鏡,右為 9.167 秒的成片代表格;貓壓低身體,把右前掌伸向紙船。

P03,16:9。成片代表格為 9.167 秒、f550。

9:16

P03 9:16 左右對照:左為正式多宮格分鏡,右為 9.167 秒的成片代表格;貓把前掌探向積水上的紙船。

P03,9:16。成片代表格為 9.167 秒、f550。

把 7.000、7.500、8.000 秒排在一起,事情就很明白。Desktop 在 7.133 秒附近切鏡,Mobile 在 7.217 秒附近切鏡;兩支片都有切。新鏡頭仍沿用貓與船的空間關係,P03 的動作直接在 P02 的舞台上發生。

16:9|P02→P03,每 0.5 秒抽一

16:9 Act 1 在 7.000、7.500、8.000 秒的三格時間帶;畫面由貓注視紙船過渡到抬掌試探。

9:16|P02→P03,每 0.5 秒抽一格

9:16 Act 1 在 7.000、7.500、8.000 秒的三格時間帶;P02 的貓船關係延續到 P03 起身探掌。

我們當時交出去的攝影指令只有這個精度:

P02,3–7秒:中近景、跟拍。……鏡頭順著貓的視線帶到紙船。 P03,7–12秒:中景、跟隨。……貓起身側身面向積水,右前腳掌懸空探出。

「跟拍」與「跟隨」沒有拉開機位差。Prompt 也沒指定第二次切換後的攝影軸、左右位置和開場構圖。模型交出了三個鏡頭,後兩鏡卻像同一段動作的延長版。這一球算我們的。

如果重寫,我們會把切點直接釘死( 給 AI 潤稿就會這樣,釘死這個詞很 coding 啊 )在可見結果上:

P02 維持正面中近景至結束,貓在後、船在前。7 秒硬切至 P03 側面中景,保持 180 度軸線;貓在畫面左側、紙船在右前景,切換後貓才起身探掌。

Act 2:P04–P06 幾乎照表操課

Act 2 生成時增加了時長。橫式片段是 15.033 秒,直式片段是 17.020 秒,兩邊的停留時間不同,三個節拍仍照 P04、P05、P06 排下去。

P04:紙船置中,光從水面出現

16:9|左為正式分鏡;右為成片 我們很喜歡這個處理,畢竟誰能拒絕貓咪的腳掌?

P04 16:9 左右對照:左為正式多宮格分鏡,右為 12.033 秒的成片代表格;紙船置於霓虹積水中央。

P04,16:9。成片代表格為 12.033 秒、f722。

9:16|左為正式分鏡;右為成片 我們團隊對於 Seedream 5.0 Lite 生成的故事板圖片並沒有什麼高要求,大致能像就好了,畢竟字節跳動還沒上市,我們一直買 token 真的是有點心疼老闆。

P04 9:16 左右對照:左為正式多宮格分鏡,右為 12.033 秒的成片代表格;發光紙船居中,貓從畫面邊緣靠近。

P04,9:16。成片代表格為 12.033 秒、f722。

P05:貓臉、前掌與紙船排成一條線

16:9|左為正式分鏡;右為成片

P05 16:9 左右對照:左為正式多宮格分鏡,右為 17.800 秒的成片代表格;貓臉和前掌靠近發光紙船。

P05,16:9。成片代表格為 17.800 秒、f1068。

9:16|左為正式分鏡;右為成片

P05 9:16 左右對照:左為正式多宮格分鏡,右為 19.000 秒的成片代表格;貓臉、前掌和紙船沿畫面中軸排列。

P05,9:16。成片代表格為 19.000 秒、f1140。

P06:鼻尖靠近發光紙船

P06 是全片最老實的幾格之一。貓臉從上方壓進畫面,紙船留在鼻尖下方,水面接住倒影。

16:9|左為正式分鏡;右為成片

P06 16:9 左右對照:左為正式多宮格分鏡,右為 22.500 秒的成片代表格;貓鼻尖正對發光紙船和倒影。

P06,16:9。成片代表格為 22.500 秒、f1350。

9:16|左為正式分鏡;右為成片

P06 9:16 左右對照:左為正式多宮格分鏡,右為 22.500 秒的成片代表格;貓臉、彩色紙船和水中倒影沿中軸排列。

P06,9:16。成片代表格為 22.500 秒、f1350。

Act 3:首幀接上了,Desktop 卻一刀切進大遠景

Act 3 先吃進同一比例的 Act 2 尾幀。這張圖定義貓鼻、紙船、積水、反光與鏡頭方向,P07、P08 再接手後續動作。

16:9|左為 Act 2 尾幀;右為 Act 3 第一幀

16:9 生成交接左右對照:左為 Act 2 尾幀與首幀參考,右為 Act 3 第一個解碼幀;鬍鬚、船緣和水面反射略有位移。

16:9 生成交接。兩張畫面接近,細節仍有重算。

9:16|左為 Act 2 尾幀;右為 Act 3 第一幀

9:16 生成交接左右對照:左為 Act 2 尾幀與首幀參考,右為 Act 3 第一個解碼幀;眼睛、船身和倒影略有差異。

9:16 生成交接。首幀約束有生效,像素沒有凍結。

最終剪輯另外挑接點。橫式使用 f1619→f1620,也就是 26.983→27.000 秒;直式使用 f1709→f1710,也就是 28.483→28.500 秒。生成參考和剪輯選擇各做各的工作。

我們用 FFmpeg 比對接縫、裁出剪點,再把每個比例的三個 Act 合成一支。後來也把同一套檢查與剪接流程整理成公開的 Curtoom video-clip-stitching skill

Cat Mobile 的 Act 2 到 Act 3 接縫比較圖。上排是直接串接,Act 3 開頭約半秒幾乎不動;下排移除開頭 30 幀並加入 0.1 秒溶接;底部曲線顯示兩種剪法的逐幀運動量。

同一個 Mobile 02→03 接縫。直接串接會留下約 0.5 秒的 dead water;裁掉 Act 3 開頭 30 幀並做 0.1 秒溶接後,動作接了起來。接縫前後的運動量比也從 0.54 變成 1.45。

同一秒素材,以 0.5 倍速循環。左邊的 raw join 會停一下;右邊的 final cut 繼續往前。

16:9|左為剪點前;右為剪點後

16:9 最終剪點左右對照:左為 26.983 秒的剪點前影格,右為 27.000 秒的剪點後影格;船身與水面有輕微位移。

9:16|左為剪點前;右為剪點後

9:16 最終剪點左右對照:左為 28.483 秒的剪點前影格,右為 28.500 秒的剪點後影格;位置與反光略有改變。

P07:Mobile 抵達全身中景,Desktop 還沒站穩

16:9|左為正式分鏡;右為成片

P07 16:9 左右對照:左為正式多宮格分鏡,右為 31.500 秒的成片代表格;紙船浮起,貓仰頭跟隨。

P07,16:9。成片代表格為 31.500 秒、f1890;浮起事件成立,畫面仍偏近。

9:16|左為正式分鏡;右為成片

P07 9:16 左右對照:左為正式多宮格分鏡,右為 34.200 秒的成片代表格;開門、全身貓與半空紙船同時入鏡。

P07,9:16。成片代表格改核為 34.200 秒、f2052;下一個代表時點已切入 P08。

P08:兩支片都離場,走法完全不同

16:9|左為正式分鏡;右為成片

P08 16:9 左右對照:左為正式多宮格分鏡,右為 36.000 秒的成片代表格;貓和紙船從便利商店大景橫向離開。

P08,16:9。成片代表格為 36.000 秒、f2160。事件成立,方向改成店前橫移。

9:16|左為正式分鏡;右為成片

P08 9:16 左右對照:左為正式多宮格分鏡,右為 41.000 秒的成片代表格;貓和紙船沿便利商店旁的雨街走遠。

P08,9:16。成片代表格為 41.000 秒、f2460。背影與街道縱深都保留下來。

Desktop 的跳切發生在成片約 32.77 秒。32.700 秒還是貓臉與紙船的偏近景,32.800 秒已經把兩個主體縮成店門前的小點。Mobile 也在 34.300 秒切鏡;直式畫面切前已抵達全身,切後仍看得清楚貓、門與紙船。

16:9|Desktop Act 3 切前/切後

16:9 Desktop Act 3 切鏡對照:32.700 秒仍是貓與紙船的偏近景,32.800 秒直接進入便利商店大遠景。

9:16|Mobile Act 3 切前/切後

9:16 Mobile Act 3 切鏡對照:34.200 秒完整呈現站立貓、開門與紙船,34.300 秒切到更廣的街道畫面。

這一刀是我們自己寫進去的。以下節錄景別與運鏡句,省略素材標籤與後續動作:

P07,0–6秒:鏡頭從首幀自然開始,連續拉遠並微微升高,最後停在中景。

P08,6–12秒:大遠景、鏡頭緩慢後退。

開頭又明說「由兩個鏡頭剪接而成」。模型在約 5.8 秒完成切鏡,幾乎貼著 6 秒分界。P07 的「中景」成了上一鏡終點,P08 的「大遠景」成了下一鏡起跑點;「緩慢後退」只管切進去之後。

我們腦中的畫面可以寫得更準:

P08 從 P07 結尾的中景接續,先維持貓與紙船可辨識的全身比例與左右位置,再隨鏡頭緩慢後退;結尾才抵達大遠景。

把「大遠景」從開場條件搬到結束狀態,整個鏡頭的脾氣就會改變。

我們沒寫好的運鏡,模型全部照單全收

抽完這批影格,我們記下三件事:

  • 寫了時間段,也要寫切換後的新機位。P02/P03 有切點,攝影語法卻太接近。
  • 景別放在句首,可能直接成為起始狀態。這次 Desktop P08 就從大遠景起跑。
  • 一個運鏡至少要交代起點、方向、速度與停點。「跟拍」兩個字只夠開工,不夠驗收。

偏差也不需要全部消滅。Desktop 的橫向離場沒有毀掉故事,貓仍然跟著紙船離開,我們就把它留在成片裡。若主體消失、順序顛倒或離場關係被破壞,才值得重做。

故事板真的有用,攝影機還是得自己顧

生成前,我們拿八格分配 Act 和鏡頭。生成後,我們拿同一張圖對答案:哪些構圖真的進片、哪些動作延後、哪一刀來自 Prompt 裡的留白,全都看得見。

六次提交給了同一個答案:兩張多宮格故事板都進了片,P01–P08 一格沒掉。樣本只有六次,成功率和 Prompt 區塊權重先不裝懂。

故事板交代故事往哪走。攝影機怎麼走,還是我們的作業。

需要通用的接鏡方法,可回到〈用 AI 做影片:讓每個鏡頭接得上的簡單 Storyboard〉;實際提交的三段 Prompt 與原始稿差異,見〈Seedance 2.5 Prompt 實戰:我們第一版寫得很滿,鏡頭卻被講亂了〉。

系列文章 SERIES用 AI 做影片4
  1. 01用 AI 做影片:提示詞就是你的影片
  2. 02用 AI 做影片:先決定從文字、圖片還是腳本開始
  3. 03用 AI 做影片:讓每個鏡頭接得上的簡單 Storyboard
  4. 04用 AI 做影片:一艘紙船來接一隻貓,我們真的把它拍出來了
推薦閱讀 RECOMMENDED
教學Seedance 2.5 Prompt Skill 到底管什麼?參考圖、故事板與首幀一次拆開教學用 AI 做一支短片:從腳本到成片的完整工作流,以及它真正的成本