
AI 生成影片真的會看故事板?Seedance 2.5 把 8 格分鏡全用上了
我們把 16:9 與 9:16 多宮格分鏡圖逐格對回 60fps 成片。P01–P08 全部出現;P02/P03 的黏連和 Desktop Act 3 的大跳切,也把我們沒寫清楚的運鏡當場抓包。
簡單講:故事板好用、字節跳動工程師牛逼! Seedance 2.5 不止看了還把鏡頭的連續性做出來了,而且看得比我們第一次做的對照表還仔細。彷彿在嫌棄我們團隊怎麼那麼偷懶。
兩支成片都找得到 P01–P08。直式 P01 在第 3 秒又出現一次,P02 的構圖一路活到 P03 開始,Mobile P07 也比我們原本標記的位置早了 0.1 秒。這幾格是編輯回看文章時抓出來的。我們只好把 FFmpeg 再打開,半秒、半秒往回找。
不出意外的話,這時候肯定要寫跟意外相關的論述了,沒,沒那麼多意外,這樣的內容生成過程 ( 互動式創作 ),我們誠心建議中小規模的 youtuber、個體創作者、普通用戶,將故事板視作影片生成前的必備素材之一。
故事板真的有效嗎?P01–P08 一格都沒漏
這次一共送出六次生成:Desktop 的 Act 1、2、3 各一次,Mobile 也各一次。每個 Act 只使用自己的故事板區段;Act 3 再加入同一比例的 Act 2 尾幀,鎖定下一段開場。
| Act | 使用的分鏡 | 事件 |
|---|---|---|
| Act 1 | P01–P03 | 貓蜷縮、抬頭、伸掌試水 |
| Act 2 | P04–P06 | 紙船發光、貓踏水、鼻尖靠近 |
| Act 3 | P07–P08 | 紙船浮起、貓跟著紙船離場 |
重抽代表格後,八格的落點如下。我們把這些 frame 當成視覺證據,不拿它們冒充模型承諾的逐格時間表。
| 分鏡 | Act | 16:9 代表格 | 9:16 代表格 |
|---|---|---|---|
| P01 | Act 1 | 1.500 秒,f90 | 3.000 秒,f180(P01→P02 邊界) |
| P02 | Act 1 | 7.500 秒,f450 | 8.000 秒,f480 |
| P03 | Act 1 | 9.167 秒,f550 | 9.167 秒,f550 |
| P04 | Act 2 | 12.033 秒,f722 | 12.033 秒,f722 |
| P05 | Act 2 | 17.800 秒,f1068 | 19.000 秒,f1140 |
| P06 | Act 2 | 22.500 秒,f1350 | 22.500 秒,f1350 |
| P07 | Act 3 | 31.500 秒,f1890 | 34.200 秒,f2052 |
| P08 | Act 3 | 36.000 秒,f2160 | 41.000 秒,f2460 |
完整故事與六次生成流程另見〈用 AI 做影片:一艘紙船來接一隻貓〉。這篇把注意力留給故事板、Prompt 與成片。
Multi-panel storyboard reference:BytePlus 官方到底支持什麼
BytePlus 在 Seedance 2.5 Prompt Guide 裡把這項能力稱為 Multi-panel storyboard reference。官方示例用九宮格安排整體鏡頭結構、景別與運鏡節奏;同一份文件也提醒,多宮格不會逐格逐幀照抄,生成影片仍有自己的活動空間。需要更嚴格對齊時,官方建議拆成多張 keyframe reference。BytePlus 官方文件
我們就照這個尺度驗收:順序有沒有走完、構圖關係有沒有留下、事件有沒有發生。門在哪一秒關上,或紙船向左多飄了一點,沒有一票否決權。
成片前:八格圖先把 45 秒的故事釘在牆上
故事板在生成前就已經值回票價。P01–P08 給了故事共同索引,我們可以直接說「Act 2 從 P04 開始」或「P07 要接 Act 2 尾幀」,不用每次重新描述整個雨夜。
實際送進 Desktop 生成的 16:9 多宮格

16:9 多宮格。Seedream 5.0 Lite生成的時候順手裁掉了 P01–P03 標題
實際送進 Mobile 生成的 9:16 多宮格

9:16 多宮格。這次 Seedream 5.0 Lite 好心腸還留了一半的上緣。
兩支來源成片都是 60fps。我們以景別、主體相對位置、視線、前掌方向、門框、積水和離場方向找代表格。16:9 就保留橫式可讀尺寸,9:16 也維持直式;沒有理由把兩種比例硬壓成同一個框。
Act 1:P01 在第 3 秒回來,P02/P03 接得像同一鏡
P01:第 3 秒同時住著兩個分鏡
1.500 秒的橫式代表格已經證明 P01 進了成片。直式的 3.000 秒更值得停一下:紙船進到前景,貓還縮在紙箱旁。左邊是 P01,右邊卻已經聞得到 P02。
16:9

P01,16:9。成片代表格為 1.500 秒、f90。
9:16

P01→P02 邊界,9:16。成片影格為 3.000 秒、f180。
回看實際提交的 P01,最後一句很有份量:
P01,0–3秒:中近景、固定機位。貓蜷縮在濕紙箱旁,身體縮成球狀,頭低埋於前肢之間,尾巴環繞軀幹;雨水落在貓與前方積水上,積水映著霓虹的彩色倒影。結束時貓仍蜷縮未動。
FFmpeg 在直式 Act 1 偵測到的第一個明顯切點是 2.950 秒。成片能確認的是:切換後還留著 P01「仍蜷縮未動」的結束狀態,P02 的紙船已經進場。
第 3 秒這格沒有乾淨地站隊。它把 P01 的結束狀態和 P02 的開始事件疊在一起。對故事來說很順,對逐格驗收的人來說則是一張小考卷。
如果你對運鏡有很高的要求,那我們的建議是先讓老闆儲值。
P02:來了,比我們第一次標記的時間晚
P02 的核心關係是貓在一側、紙船在另一側,貓抬頭盯著船。橫式在 7.500 秒最清楚,直式則落在 8.000 秒。此時 P03 的探掌動作已經開始冒頭,這正是兩格看起來黏在一起的原因。這邊再次證明了影片生成模型真的太偉大了,提示詞讓 Seedance 2.5 生成( 拍攝 )連續性的動作。
畢竟對我們來說,要發通告請活生生的貓咪來演出這 45 秒的短影片的話,那會亮燈的紙船,我們得準備起碼10艘,還怕貓咪看不上紙船呢。
16:9|左為正式分鏡;右為成片

P02,16:9。成片代表格為 7.500 秒、f450。P03 動作已開始。
9:16|左為正式分鏡;右為成片

P02,9:16。成片代表格為 8.000 秒、f480。P02 的構圖延續進 P03。
P03:模型有切鏡,只是我們把兩句運鏡寫得太像
完整探掌姿勢在兩支片的 9.167 秒都很清楚。P03 沒有失蹤,貓沒有斷腿( 不然導演肯定又想起他那兩隻貓貓了 )。
16:9

P03,16:9。成片代表格為 9.167 秒、f550。
9:16

P03,9:16。成片代表格為 9.167 秒、f550。
把 7.000、7.500、8.000 秒排在一起,事情就很明白。Desktop 在 7.133 秒附近切鏡,Mobile 在 7.217 秒附近切鏡;兩支片都有切。新鏡頭仍沿用貓與船的空間關係,P03 的動作直接在 P02 的舞台上發生。
16:9|P02→P03,每 0.5 秒抽一

9:16|P02→P03,每 0.5 秒抽一格

我們當時交出去的攝影指令只有這個精度:
P02,3–7秒:中近景、跟拍。……鏡頭順著貓的視線帶到紙船。 P03,7–12秒:中景、跟隨。……貓起身側身面向積水,右前腳掌懸空探出。
「跟拍」與「跟隨」沒有拉開機位差。Prompt 也沒指定第二次切換後的攝影軸、左右位置和開場構圖。模型交出了三個鏡頭,後兩鏡卻像同一段動作的延長版。這一球算我們的。
如果重寫,我們會把切點直接釘死( 給 AI 潤稿就會這樣,釘死這個詞很 coding 啊 )在可見結果上:
P02 維持正面中近景至結束,貓在後、船在前。7 秒硬切至 P03 側面中景,保持 180 度軸線;貓在畫面左側、紙船在右前景,切換後貓才起身探掌。
Act 2:P04–P06 幾乎照表操課
Act 2 生成時增加了時長。橫式片段是 15.033 秒,直式片段是 17.020 秒,兩邊的停留時間不同,三個節拍仍照 P04、P05、P06 排下去。
P04:紙船置中,光從水面出現
16:9|左為正式分鏡;右為成片 我們很喜歡這個處理,畢竟誰能拒絕貓咪的腳掌?

P04,16:9。成片代表格為 12.033 秒、f722。
9:16|左為正式分鏡;右為成片 我們團隊對於 Seedream 5.0 Lite 生成的故事板圖片並沒有什麼高要求,大致能像就好了,畢竟字節跳動還沒上市,我們一直買 token 真的是有點心疼老闆。

P04,9:16。成片代表格為 12.033 秒、f722。
P05:貓臉、前掌與紙船排成一條線
16:9|左為正式分鏡;右為成片

P05,16:9。成片代表格為 17.800 秒、f1068。
9:16|左為正式分鏡;右為成片

P05,9:16。成片代表格為 19.000 秒、f1140。
P06:鼻尖靠近發光紙船
P06 是全片最老實的幾格之一。貓臉從上方壓進畫面,紙船留在鼻尖下方,水面接住倒影。
16:9|左為正式分鏡;右為成片

P06,16:9。成片代表格為 22.500 秒、f1350。
9:16|左為正式分鏡;右為成片

P06,9:16。成片代表格為 22.500 秒、f1350。
Act 3:首幀接上了,Desktop 卻一刀切進大遠景
Act 3 先吃進同一比例的 Act 2 尾幀。這張圖定義貓鼻、紙船、積水、反光與鏡頭方向,P07、P08 再接手後續動作。
16:9|左為 Act 2 尾幀;右為 Act 3 第一幀

16:9 生成交接。兩張畫面接近,細節仍有重算。
9:16|左為 Act 2 尾幀;右為 Act 3 第一幀

9:16 生成交接。首幀約束有生效,像素沒有凍結。
最終剪輯另外挑接點。橫式使用 f1619→f1620,也就是 26.983→27.000 秒;直式使用 f1709→f1710,也就是 28.483→28.500 秒。生成參考和剪輯選擇各做各的工作。
我們用 FFmpeg 比對接縫、裁出剪點,再把每個比例的三個 Act 合成一支。後來也把同一套檢查與剪接流程整理成公開的 Curtoom video-clip-stitching skill。

同一個 Mobile 02→03 接縫。直接串接會留下約 0.5 秒的 dead water;裁掉 Act 3 開頭 30 幀並做 0.1 秒溶接後,動作接了起來。接縫前後的運動量比也從 0.54 變成 1.45。
同一秒素材,以 0.5 倍速循環。左邊的 raw join 會停一下;右邊的 final cut 繼續往前。
16:9|左為剪點前;右為剪點後

9:16|左為剪點前;右為剪點後

P07:Mobile 抵達全身中景,Desktop 還沒站穩
16:9|左為正式分鏡;右為成片

P07,16:9。成片代表格為 31.500 秒、f1890;浮起事件成立,畫面仍偏近。
9:16|左為正式分鏡;右為成片

P07,9:16。成片代表格改核為 34.200 秒、f2052;下一個代表時點已切入 P08。
P08:兩支片都離場,走法完全不同
16:9|左為正式分鏡;右為成片

P08,16:9。成片代表格為 36.000 秒、f2160。事件成立,方向改成店前橫移。
9:16|左為正式分鏡;右為成片

P08,9:16。成片代表格為 41.000 秒、f2460。背影與街道縱深都保留下來。
Desktop 的跳切發生在成片約 32.77 秒。32.700 秒還是貓臉與紙船的偏近景,32.800 秒已經把兩個主體縮成店門前的小點。Mobile 也在 34.300 秒切鏡;直式畫面切前已抵達全身,切後仍看得清楚貓、門與紙船。
16:9|Desktop Act 3 切前/切後

9:16|Mobile Act 3 切前/切後

這一刀是我們自己寫進去的。以下節錄景別與運鏡句,省略素材標籤與後續動作:
P07,0–6秒:鏡頭從首幀自然開始,連續拉遠並微微升高,最後停在中景。
P08,6–12秒:大遠景、鏡頭緩慢後退。
開頭又明說「由兩個鏡頭剪接而成」。模型在約 5.8 秒完成切鏡,幾乎貼著 6 秒分界。P07 的「中景」成了上一鏡終點,P08 的「大遠景」成了下一鏡起跑點;「緩慢後退」只管切進去之後。
我們腦中的畫面可以寫得更準:
P08 從 P07 結尾的中景接續,先維持貓與紙船可辨識的全身比例與左右位置,再隨鏡頭緩慢後退;結尾才抵達大遠景。
把「大遠景」從開場條件搬到結束狀態,整個鏡頭的脾氣就會改變。
我們沒寫好的運鏡,模型全部照單全收
抽完這批影格,我們記下三件事:
- 寫了時間段,也要寫切換後的新機位。P02/P03 有切點,攝影語法卻太接近。
- 景別放在句首,可能直接成為起始狀態。這次 Desktop P08 就從大遠景起跑。
- 一個運鏡至少要交代起點、方向、速度與停點。「跟拍」兩個字只夠開工,不夠驗收。
偏差也不需要全部消滅。Desktop 的橫向離場沒有毀掉故事,貓仍然跟著紙船離開,我們就把它留在成片裡。若主體消失、順序顛倒或離場關係被破壞,才值得重做。
故事板真的有用,攝影機還是得自己顧
生成前,我們拿八格分配 Act 和鏡頭。生成後,我們拿同一張圖對答案:哪些構圖真的進片、哪些動作延後、哪一刀來自 Prompt 裡的留白,全都看得見。
六次提交給了同一個答案:兩張多宮格故事板都進了片,P01–P08 一格沒掉。樣本只有六次,成功率和 Prompt 區塊權重先不裝懂。
故事板交代故事往哪走。攝影機怎麼走,還是我們的作業。
需要通用的接鏡方法,可回到〈用 AI 做影片:讓每個鏡頭接得上的簡單 Storyboard〉;實際提交的三段 Prompt 與原始稿差異,見〈Seedance 2.5 Prompt 實戰:我們第一版寫得很滿,鏡頭卻被講亂了〉。
