選角變成資產鎖定,攝影變成 prompt 工程:Hell Grind 的 254 萬字 的文章封面

選角變成資產鎖定,攝影變成 prompt 工程:Hell Grind 的 254 萬字

我們拿到《Hell Grind》兩個場次的完整 prompt 語料:868 份、254 萬字。逐字分析後發現,其中只有 223 份是真正寫過的,其餘全是同一份文字再送一次。生產級的 prompt 讀起來像一份合約——而寫這份合約的兩件事,本質上就是選角和攝影。

概念
發布
更新

上一篇我們拆了《Hell Grind》的帳本:115,446 次生成換 95 分鐘成片。這一篇看更小的東西——prompt 本身。

我們手上有這部片兩個場次的完整 prompt 語料:868 份,254 萬個英文單字——換算成字元是 1,620 萬。先從最早生成的冷開場說起——251 支成片,以及每一支對應的完整 prompt。把它們逐字比對之後,最重要的發現只有一個數字:251 支影片,只來自 65 個 prompt

這個數字背後,是兩個職能的變形記。

選角變成資產鎖定

先看 prompt 的開頭。冷開場每一份 prompt 的第一段,幾乎都是同一塊文字:主角的完整外觀描述——815 個字元,從膚色、角的形狀、眼睛的光,寫到左臂焦黑龜裂中透出的電藍色光。這段描述在 251 份 prompt 裡逐字出現了 160 次,一個字都沒有改過。場景的描述塊更長(1,242 字元),逐字出現了 230 次。

為什麼要這樣做?因為生成模型沒有記憶。你在這個鏡頭裡不把主角講完整,下個鏡頭他就換了一張臉、換了一件衣服。所以每個角色在開拍前就被做成一份「資產」:一段鎖死的文字描述,加一組參考圖。之後的每一個 prompt,都原封不動地帶上這份資產。

他們的角色參考圖做法也值得單獨記一筆:一張臉部特寫、一張正面全身、一張背面全身——而正面全身圖是去掉頭的。因為實測發現,模型在遠景會去抓全身圖上那張又小又糊的臉;把頭去掉,模型就只剩特寫那一張臉可以抓。角色的每個狀態也是獨立資產:濕身、帶傷、換裝,各有各的描述,絕不混寫。資產鎖定前還要通過壓力測試——十次生成、十次都認得出來,才准進生產。

資產鎖定有它的代價,而代價寫在後期場次的語料裡。我們另外分析了後期 Scene 74 的全部 617 份 prompt,發現三分之一的篇幅在對抗自己的參考資產NO SAFETY-GLASSES 出現在 215 份裡(34.8%),只因為那個角色的參考圖戴著護目鏡;NOT muscularNOT bulky 各出現 142 份與 122 份,因為模型的先驗會自動把主角畫壯。

換句話說,鎖定一份資產,等於同時繼承了那張圖上所有你沒打算要的東西——而且往後每一份 prompt 都得再花一次力氣把它推開。

把這整套流程換到傳統片場的語言裡,它就是選角加定妝:確定這個角色長什麼樣、每個造型狀態長什麼樣,然後在整個拍攝期內鎖死。調 prompt 的第一件事,其實就是在做選角——差別只在於,這裡的演員每一場都會失憶,所以定妝照必須印在每一頁劇本上。

攝影變成 prompt 工程

資產塊之後,才是這個鏡頭本身。這一段讀起來完全不像「描述畫面」,更像一份技術合約。

冷開場的 prompt 中位 12,619 字元,裡面平均有 10.4 個硬約束詞——NEVER、EXACT、LOCKED、Do NOT。空間用一段被鎖定的文字平面圖固定:祭壇在中右、屍體的頭朝鏡頭方向、攝影機永遠停在屍原這一側、絕不跨過 180 度軸線。運鏡風格具名到攝影指導:手持、有呼吸感、永不鎖死機位。連光都有守恆律:一個光源、一個陰影方向,「永遠不准有兩個太陽」。

動作指令另有一套語法紀律:只寫正向動作。不寫「不要向後倒」——模型會忽略否定詞,甚至反著做——要寫「向前撲倒」。畫面上排除什麼,用「畫面裡有什麼」來寫:「正好三個人,正好一條水晶手臂,在右臂,永不越過肩膀」。

這就是「攝影變成 prompt 工程」的具體含義:機位、軸線、光比、調度,這些過去靠攝影組在現場執行的決定,現在全部前移成文字,而且必須寫成禁得起模型曲解的合約條文。它和上一節的資產鎖定本質上是同一件事——在生成之前,把不確定性鎖死

先是一行都不改,然後才是一次改一行

回到那個數字:251 支成片、65 個 prompt。

其中 54 組 prompt 全文一字不差——平均每個 prompt 被抽了 3.9 次,最狠的一個 prompt 原樣抽了 16 次。我們對相近 prompt 做了逐行比對,同組之間的文字差異中位數是 0 行。

那 16 次長什麼樣,直接看:

同一份 prompt 一字不改抽 16 次的成果對照:十六格畫面的景別、構圖、光線與閃電顏色各不相同,但角色的雙眼藍光、犄角與手臂電藍裂紋在每一格都維持一致

同一份 prompt、一字未改,連抽 16 次的結果。每一格取自該次生成的成片。

這張圖同時說明了兩件事。被鎖死的東西真的鎖住了——藍色發光的眼睛、犄角、左臂裂縫裡的電藍色光,十六格全在。沒被鎖死的東西則完全隨機——景別從大遠景到眼睛特寫,光線從紅色閃電到藍色電弧,構圖沒有兩格一樣。

所以抽 16 次賭的是那些寫不進合約的部分:這一次的鏡頭剛好停在對的距離、這一道閃電剛好打在對的時機。合約管得住角色是誰,管不住這一秒的運氣。

也就是說,冷開場的迭代模式是:鎖定文字、反覆抽卡、從結果裡挑

後期場次讓這件事的形狀更清楚。Scene 74 的抽卡率跟冷開場幾乎一模一樣(平均 3.91 次對 3.86 次,最大家族同樣是 16),但送出的時間戳揭穿了一件事:同一份 prompt 的重複送出,間隔中位數只有 6 秒,93% 的多抽家族在提交序上完全連續。六秒不夠看完一支影片。那是一次按 16 發。整個場次有 73.8% 的送出字元屬於重複投遞

他們的正式規則「一次只改一行、每次改動記錄在案」,是建立在這個更底層的紀律之上的——先確認這份合約值得執行,再談逐條修訂。一份 prompt 抽 16 次而一字不改,意味著他們把 prompt 當成了可重複執行的規格,而不是一次性的許願。

兩週後的模板,整套換掉了

冷開場是全片最早生成的場次之一。兩週之後的 Scene 74 是全片的最後一場——暴風雪停了,主角跪在雪原上,戰友的屍體躺在他兩側。

Scene 74 的三個鏡頭:遠景是主角跪在雪原上、屍體橫在前景;俯拍是三人躺成頭朝彼此的陣形;特寫是主角滿臉血、緩緩舉起手中的白色晶體

Scene 74 的三個鏡頭,各取自一支成片。跟冷開場的地獄岩漿是完全相反的兩個世界。

這一場的 prompt 中位長度是 20,963 字元,比冷開場的 12,619 多了六成。但長度只是表面。真正的發現在於零繼承

把兩份 prompt 的骨架並排,一眼就看得出來不是同一種文件。冷開場是三個大寫標記,然後 STRICT: 底下一整段把所有事情塞完——鏡頭、五個 beat、對白、否定約束,全部擠在同一段裡:

EXACT 2 CHARACTERS
GEO SPATIAL LAYOUT (locked across every CO shot — pure spatial map):
STRICT: ...BEAT 1... BEAT 2... BEAT 3... BEAT 4... BEAT 5...(一整段寫完)

Scene 74 拆成八個具名區塊,各管一件事:

SCENE NOTE          LIGHTING
CHARACTERS          COLOR
CONTINUITY          SKIN
SPATIAL LAYOUT      ACTING

(原文的每一個標頭左右都各夾一個火焰符號,這裡略去不影響結構。)

我們把兩場語料做了 12-gram 比對:重疊為零。同一批語料折半互比的正控制是 97.4%,所以這個零足以排除方法失靈:兩代 prompt 之間真的沒有任何逐字沿用。冷開場那套骨架整組消失了——STRICT 從 100% 掉到 6%,GEO SPATIAL LAYOUT 從 70% 掉到 0%;取而代之的是一組符號包夾的具名標頭(SCENE NOTECHARACTERSCONTINUITY),617 份 prompt 用了 100%。

連約束的寫法都換了一代。冷開場打的是籠統的「別像遊戲畫面」,Scene 74 打的是十幾個具體失效模式:NO LUT(98.9%)、NO BREATHING(42%)、NO SOBBING(35%)——每一條都對應一次真的被生出來過的錯誤。descriptor 的複製方式也碎了:冷開場是一塊 1,242 字元的場景描述貼滿全場,Scene 74 則裂成上百個鏡次局部塊(跨檔重複的長行仍佔 unique 體積的 44.5%)。

而且換代不只發生在兩場之間。單看 Scene 74 這七天,場內自己就走完三代:T1 是巨型 prompt(中位 25.6k 字元、一份寫滿 6 個 cut、整套攝影段);T2 砍成四段並抽出 LOOK PRESETT3 長出角色錨定塊(ANCHORHARD LOCK 從 0% 到九成)並開始明寫每一鏡的秒數(4%→87%)。

所以那條線一點也不平滑,它是一連串推倒重來。

會這樣不難理解:每個小組負責自己的場次,各自收斂出自己的模板,沒有人在中途統一格式,直到收工後才被整理成一份統一的「製作聖經」。所以你今天看到的那份開源方法論,是 14 天實戰的追認總結——而我們手上這批冷開場 prompt,是它還沒定型時的化石。

界線,以及下一步

如實交代這份分析的邊界:我們手上這 868 份語料(冷開場 251、Scene 74 617)全部是影片 prompt。角色資產圖的製作端(臉部生成、圖片編輯的 prompt)不在手上,該部分的描述引自官方公開的製作說明——我們實測覆蓋的是「資產被引用」的那一端,逐字複製的紀律在這一端得到了完整驗證。

至於這 65 個 prompt 本身——它們已經開源了。下一步我們打算做一件更直接的事:真的拿去跑,看看同樣的合約,在不同的模型手上會履行成什麼樣子。


資料與方法:prompt 語料為《Hell Grind》公開專案的兩批全量語料——冷開場 251 對 prompt 與成片(2026-08-14 取得與分析),以及後期 Scene 74 的 617 份 prompt(2026-08-17,該場全量)。字數以空白切分計詞,對象是剝除中繼資料後的 prompt 正文:cold open 251 份為 510,977 詞/3,294,500 字元,Scene 74 617 份為 2,037,456 詞/12,914,457 字元,合計 2,548,433 詞/16,208,957 字元;標題所稱「254 萬字」指的是英文單字數。重複偵測採全文分組與逐行集合比對;長度統計一律為全量語料的字元中位數,與早期以 API 抽樣(每場最新 60 筆)得到的長度序列不可混用,本文採前者。12-gram 比對附同語料折半的正控制(97.4%)以排除方法失靈。角色資產製作端描述引自 Higgsfield 公開製作說明(查證於 2026-08-14)。

推薦閱讀 RECOMMENDED
概念「有了 AI,你也可以當導演」:這句話一年前叫 vibe coding概念50 萬美元、14 天、11.5 萬次生成:一部 AI 電影的效率真實形狀