用 AI 做一支短片:從腳本到成片的完整工作流,以及它真正的成本

用 AI 做一支兩到五分鐘的短片,會碰到三十到六十個鏡頭、好幾個場景,和在這個規模才會出現的所有問題。這篇走完從腳本到輸出的整條工作流,最後用唯一一部公開全部製作過程、用 AI 做出來的長片的數字,算一次它要花多少錢。

教學
發布
更新

十五秒的片段和三分鐘的短片是兩種東西,長度只是差別裡最小的一項。

十五秒可以靠一次生成、一個 prompt、一個運氣好的 take 撐過去。三分鐘有四十個鏡頭、三四個場景、至少兩個要在每一場都長得像自己的角色、一條配樂,還有剪輯。這些問題在十五秒裡都不存在,而且它們會累積:第 12 鏡漂掉的角色,第 13 到 40 鏡都得跟著修。

這篇寫給做過片段、想用 AI 做一支短片的人,最後回答那個大家都會問、很少有人正面回答的問題:到底要花多少錢?

這篇說的「短片」是什麼?超過一場戲,問題就全變了

這篇說的短片是:一個有頭有尾的故事,橫跨不只一個場景,片長兩到五分鐘,畫面用 AI 生成。通常是三十到六十個鏡頭。

把線畫在「不只一個場景」,是因為困難住在場景之間。同一個場景、同一個地點、同一種光、同一套衣服,工具維持穩定的能力很好。換場景,什麼都可以變,也就是說什麼都可能出錯:臉、衣服、門的顏色、一天中的時間。

所以底下的工作流,其實是一套「撐過換場」的習慣。如果你只需要一個場景,用 AI 做影片的入門篇是比較短的路。

還沒生成就決定了成敗:腳本、分鏡、資產鎖定

這是大家最常跳過的部分,也是決定這支片成不成立的部分。

2026 年,Higgsfield 發表了一部用 AI 做的 95 分鐘長片《Hell Grind》:十五人團隊、十四天的生成期、預算低於五十萬美元,並且把整個製作過程公開——每一個 prompt、每一份素材、每一條工作規則。我們逐資料夾數過那份專案資料,發現比頭條數字更有用的一件事:他們的 prompt 越拍越長。開拍第一天前後生成的場次,單個 prompt 的中位長度約 7,000 字元;到第十四天,約 32,500 字元。兩週長了四倍。後期的 prompt 多出了整段整段早期沒有的東西:明確的約束、鏡頭規則、聲音規範。他們事後公開的那份「製作聖經」,實際上是「如果重來一次,第一天就該寫好的東西」。

做三分鐘的短片,你不需要三萬字的 prompt。但在生成任何東西之前,你需要同樣的四樣:

  1. 腳本。 三分鐘大約是三個拍點的故事:一個處境、一個轉折、一個結果。害怕正式劇本格式的話,用散文寫就好。重點是每一場戲都有存在的理由。
  2. 分鏡表。 每一場拆成鏡頭,每一鏡有景別、角度、運鏡和時長。分鏡腳本怎麼寫:把一場戲拆成鏡頭用一個完整案例走過這件事,附格式。
  3. 帶起訖狀態的分鏡。 生成的鏡頭,起始狀態和結束狀態那兩欄是必填。每一鏡都得知道上一鏡把東西留在哪裡。讓每個鏡頭接得上的簡單 Storyboard講的就是為什麼和怎麼做。
  4. 鎖定的資產。 每個角色一張參考圖(正面、側面、穿著戲服),每個場景一張,每個重要道具一張。先生成這些、確認、然後不再動它們。之後每一鏡都參考它們。在這套工作流裡,選角就是資產鎖定。

往下走之前的一個測試:別人只靠你這些文件,能不能生成這支片? 如果答案是「他們得來問我」,文件就還沒寫完。

生成:一次一鏡,錯了先別改 prompt

生成的單位是鏡頭:一次五到十秒,分鏡表一列一列來,起訖狀態寫進 prompt,鎖定的資產當參考圖附上。

接下來三條紀律,決定你最後拿到的是一支片,還是一個裝滿片段的資料夾:

先一個字都不改。 take 不對的時候,先用完全一樣的 prompt 再生成一次,再決定要不要改。影片模型有隨機性;很多「prompt 寫錯了」其實是「這個 take 錯了」,同樣的輸入下一個 take 可能就對。連續兩三個一模一樣的 take 都錯在同一個地方,你才知道問題在 prompt。

然後一次只改一行。 真的要改,改一件事:動作、或鏡頭、或光。一次改三件事,你永遠不知道是哪一件修好了它,也就沒辦法把這個修法帶到下一鏡。

記 take 紀錄。 鏡號、第幾個 take、改了什麼、結果、收不收。前十個鏡頭會覺得是官僚作業,到第三十鏡它會變成你手上最值錢的文件,因為它告訴你這個模型做不到哪一類鏡頭,你該改寫那些鏡頭,別無限重抽。

一鏡要抽幾次才算正常?《Hell Grind》是唯一公開數字的大型專案:全片 115,446 次生成,其中 88.8% 是影片,對上大約 570 個成片鏡頭,算下來每一個進成片的鏡頭背後大約 180 支生成的影片。那是十五個人在追求長片品質。你做三分鐘短片的數字會低很多,但形狀一樣:收下的那一個 take 只是全部 take 的一小部分,而那個比例就是這支片真正的成本。下面會算給你看。

換了場景,角色還是同一個人嗎?

跨場景的一致性是短片最常死掉的地方,而它大部分在生成之前、在資產鎖定那一步就決定了。在那之上再加三個習慣:

  • 每一鏡都附參考,包括看起來不需要的。 角色只是遠景裡一個剪影的那一鏡,也要附角色參考圖。漂移是從你以為不重要的鏡頭開始的。
  • 把結束畫面往前帶。 第 7 鏡的最後一格,是第 8 鏡的參考圖,只要兩鏡是連續的。這是最便宜的連續性工具。
  • 替漂移編預算。 有些鏡頭光是為了讓臉或衣服不變,就會多花好幾個 take。開始前先在分鏡表上把它們標成高風險(人群、換裝、角色第一次出現的新角度),多出來的 take 就在計畫內。

一個鏡頭怎麼樣都撐不住的時候,解法常常在上游:一張更乾淨的參考圖,或者把那一鏡改寫,讓危險的元素在畫面裡變小。同一個難鏡頭抽第四十次,是最貴的答案。

聲音、剪輯、輸出:資料夾裡的片段還不是一部片

片子是在剪輯的時候出現的。在那之前你只有一個資料夾,裡面每一段各自看起來都還可以。

  • 對白。 早點決定角色是在鏡頭前開口,還是整支片靠旁白和聲音帶。生成的鏡頭前說話,每一句都要撐住對嘴和聲音身分;旁白只要撐住聲音。第一支片,旁白加上有表情但不開口的表演,是比較寬容的選擇。
  • 配樂與音效。 一致的聲底(環境音、空間感)是讓分開生成的鏡頭聽起來在同一個地方的東西。先鋪好聲底再判斷鏡頭接不接得起來;一半的「這兩鏡不搭」其實是因為沒有聲音。
  • 剪。 先照分鏡表順序組起來,再照節奏剪。要有鏡頭被丟掉的心理準備。四十個生成的鏡頭常常只有三十二個進片,而 take 紀錄會告訴你被丟掉的那八個,正好是你抽得最辛苦的。這很正常。
  • 輸出。 先出一支你生成過的最高品質母版,再出各平台版本。需要直式版本,回到分鏡重做一份;把橫式母版裁成直的,裁不出好結果。

用 AI 做一支三分鐘的短片,會超過一萬塊臺幣嗎?

公式很短:

總成本 ≈(鏡頭數 × 每鏡 take 數 × 每個 take 的價格)+ 固定成本(聲音、音樂、訂閱、你的時間)

所有的爭論都在「每鏡 take 數」裡面。每個 take 的價格寫在模型的價目表上;每鏡 take 數寫在你的 take 紀錄上。

先把價目表擺出來。用兩個有公開按秒牌價的影片模型:BytePlus ModelArk 上的 Seedance 2.0,和 MiniMax 開放平台的 H3,兩者都是 pay-as-you-go、按輸出秒數計費(2026-08-25 查證官方價目頁;牌價、無輸入影片、不含限時折扣):

模型 解析度 每秒 一個 6 秒的 take
MiniMax H3 768P $0.08 $0.48
MiniMax H3 2K $0.13 $0.78
Seedance 2.0 480p $0.07 $0.42
Seedance 2.0 720p $0.15 $0.90
Seedance 2.0 1080p $0.37 $2.22
Seedance 2.0 4K $0.78 $4.68

價目頁上有幾個細節會影響估算。Seedance 按 token 計價(秒數 × 寬 × 高 × 幀率 ÷ 1024),同一個解析度換一種長寬比,價格會差一點,上表是 16:9;只對成功生成的影片收費。H3 的參考圖前五張免費、第六張起每張 $0.04,聲音輸入免費。Seedance 2.5 列在同一頁,每秒大約是 2.0 的 1.5 倍。

用三分鐘、四十個鏡頭算一次。每個 take 生成 6 秒,剪輯時修到平均 4.5 秒,把整部片生成一遍是 240 秒,成片 180 秒。你付的是生成的秒數;用成片秒數去估,是最常見的失準。

情境 每鏡 take 數 生成秒數 H3 768P H3 2K Seedance 2.0 720p Seedance 2.0 1080p
每一次都一次成功 1 240 $19 $31 $36 $89
謹慎的業餘者 5 1,200 $96 $156 $180 $444
要求高、有幾場難戲的業餘者 20 4,800 $380 $620 $720 $1,780
《Hell Grind》的比例 180 43,200 $3,500 $5,600 $6,500 $16,000

回到標題的問題:一萬塊臺幣(三百美元上下)夠不夠用 AI 做一支三分鐘的短片?每鏡五個 take 以內、不用 1080p,夠;到了二十個 take,最便宜的檔也要三百八十美元,全部超過。

第一列是行銷暗示你的數字。最後一列是一個工作室為了追求長片品質所用的 take 比例,換算到三分鐘。第一支短片通常落在第二和第三列之間,把它往第二列推,靠的是上面「還沒生成就決定了成敗」那一節,換更好的模型幫不上忙。花在分鏡表和資產鎖定上的每一個小時,都是一列你不用付錢的 take。

還有一個可以直接從價目表讀出來的省法。MiniMax 把「抽」和「定稿」分開計價:768P 生成 $0.08/秒,收下的那個 take 再升成 2K 是 $0.05/秒(原任務用過的輸入素材會再計一次;純文字或五張內參考圖的任務沒有這筆)。丟掉的 take 用便宜的檔抽,只替留下來的那一個付高解析度的錢。Seedance 沒有同樣的升檔項目,但原則一樣:草稿用 480p 抽,鏡頭定了再用 720p 或 1080p 生成;那是另一次生成,畫面會有出入。

公式藏起來的兩種成本:

  • 時間。 每鏡二十個 take,四十個鏡頭就是八百次生成要一個一個看。看,是工作,要用天來算。
  • 會過期的點數。 按月歸零的訂閱點數會催你在準備好之前就開始生成。前製先在紙上做完;紙不會過期。

真的有人用 AI 做出電影了嗎?要去哪裡看?

真的有人用 AI 做出電影了嗎? 有。《Hell Grind》(2026)是一部 95 分鐘、畫面用 AI 生成的長片,十五個人、十四天生成期、預算低於五十萬美元,2026 年 5 月在坎城影展場外放映,整個製作過程公開。影音平台和專收這類作品的影展上還有很多短的。

哪裡可以看用 AI 做的短片? 模型廠商自己的頻道會把工作流影片和成片放在一起,這很有用,因為你看得到過程;策展型的片庫和影展收其他的。看的時候把 take 紀錄放在心裡:好的那幾支,通常是前製看得出來的那幾支。


這樣做出來的短片是一個小型的製作,有電影一直以來就有的每一個階段,只有一件事搬了家:錢和力氣離開了片場,去了兩個地方,你在生成之前寫的那些文件,和你丟掉的那些 take。

把文件寫好。把 take 數清楚。工作流裡其他的一切,都是為了讓這兩個數字變小。

推薦閱讀 RECOMMENDED
教學AI 影片延長後接起來會卡?不是幀重複,是動作斷了半秒教學Seedance 2.5 Prompt Skill 到底管什麼?參考圖、故事板與首幀一次拆開