用 AI 做影片:提示詞就是你的影片 的文章封面

用 AI 做影片:提示詞就是你的影片

不需要先成為導演或剪輯師。從一個想法、幾張參考圖和簡單分鏡開始,把 AI 生成片段整理成一支真正能發布的短片。

教學
發布
更新

你花了大概 10 美金,用一句話生成了約莫 15 秒的影片,期間大概重新生成了 3 次。然後你上傳到社交媒體,或者發給朋友看看。這個行為難以為繼的是:你不知道下一次你想當導演的時候要抽幾次卡。這次幸運點花了 10 美金,下一次呢?

就算某一次你抽到一段很好看的鏡頭——畫面完整、光線也漂亮——它仍然不是一支影片。它沒有開始和結束,不知道要給誰看,也沒有聲音、字幕,更不知道下一個鏡頭該接什麼。

對於第一次或剛開始做 AI 影片的你,第一個問題應該是:「你有沒有辦法用文字,描述出模型也能『理解』的提示詞?」為了讓過程具體一點,歡迎這篇文章的主角:妙脆角貓。

妙脆角貓:身形渾圓的橘白貓,兩隻耳朵是妙脆角玉米脆片

AI 影片的第一步:影片生成模型完全不懂你

普通人第一次做 AI 影片,最容易犯的錯是直接把腦海中的畫面寫成提示詞。

提示詞:「妙脆角貓誤闖摩天大樓」

恭喜字節跳動、恭喜 Kling、恭喜 minimax、恭喜所有的視頻模型、算力供應商收穫了一位綁定信用卡的用戶,我們預估他抽卡的次數可以贊助 AI 影片產業鏈一個瞬間的電費。

但如果這樣寫提示詞呢?

將 img_1 貓耳朵為妙脆角的貓定義為妙脆角貓。

鏡頭 1:午後時分,img_1 妙脆角貓從黃銅旋轉門縫鑽進挑高大廳,驚慌失措地在人流之間奔跑,貓腳不斷地在拋光大理石地面上打滑。鏡頭貼地低角度跟拍,暖金色陽光穿過落地玻璃帷幕,在地面切出長條光束。

全程畫面高清電影紀實風,35mm 鏡頭質感,淺景深,輕微手持晃動,色調暖金與冷灰藍對比,光影柔和;嚴格保持 img_1 妙脆角貓的外觀、材質、配色與身體比例穩定不變形、不重新設計;全程每一幀都必須保持 img_1 妙脆角貓的耳朵為妙脆角餅乾本體,不得變回普通貓耳或長出毛髮;全片僅出現這一隻角色,維持四足行走,不擬人化直立;背景人物保持虛化,不出現清晰人臉;動作自然流暢,無卡頓無閃爍;畫面中不出現任何文字、字幕、浮水印或商標;環境音效自然。

同一隻貓、同一個想法,差別只在提示詞有沒有把模型需要知道的事說清楚:主角長什麼樣、場景在哪裡、發生什麼動作、鏡頭怎麼移動。這段提示詞不是魔法,它只是把一連串你本來就要做的決定,先用文字寫了下來。

把一個想法拆成幾個簡單鏡頭

回頭看那段有效的提示詞:它已經不是「一句話」了——裡面有主角、有場景、有動作。把這些內容從一段文字攤開成一張表,就是分鏡清單(shot list)。你別急著找模板來套,網上的模板都比不上 google sheet 方便。

「妙脆角貓誤闖摩天大樓」是一句話,而「鏡頭」則是描述這句話的工具。

鏡頭 要出現啥 會怎麼動?
1 主角和場景 妙脆角貓從旋轉門出現
2 牠越走越深入 妙脆角貓在大廳流竄
3 結尾 妙脆角貓停在電梯門前

這裡沒有複雜的劇本格式。每一列只回答一件事:你想要觀眾需要看到什麼。

如果一個鏡頭同時要貓溜進門、搭電梯、嚇到路人、再看到天際線,模型就必須替你猜事件順序。把它拆成兩到三個鏡頭,通常比再加十個形容詞有效。

拆完之後,從頭讀一次:

  • 少了任何一鏡,故事還看得懂嗎?
  • 兩個鏡頭是不是在交代同一件事?
  • 有沒有一個鏡頭只是漂亮,但沒有推動故事?

延伸思考:給誰看?發在哪裡?

先準備參考圖和簡單分鏡,不要急著按生成

這一步只要做兩個決定:哪些東西不能讓模型每次重新發明,以及鏡頭排在一起會不會出事。 第一個決定的答案,就是你要準備的參考圖。參考圖不是越多越好,每張最好只負責一件清楚的事:

  • 角色參考:妙脆角貓的臉、配色、體型與辨識特徵;
  • 場景參考:大樓門口、大廳、辦公樓層與天台的空間關係;
  • 氣氛參考:時間是白天還是黃昏、玻璃帷幕的反光、室內的冷暖色;
  • 構圖參考:每個鏡頭大概從哪裡看、貓放在畫面哪裡。

如果同一張參考圖既要控制角色、場景、光線,又要模型模仿一個完全不同的動作,你會容易陷入編輯提示詞的地獄,不過這些模型公司會很開心就是了,抽卡反正你要付錢嘛。

第二個決定要靠一份最簡單的分鏡故事板(storyboard)。它不需要畫得漂亮,火柴人、截圖、照片拼貼都可以,你可以叫 ChatGPT 給你出故事板,先評估靜態畫面遠比直接抽卡來得重要。影片生成模型不是你,直接抽卡只會佔你信用卡額度。運氣好一次就成,運氣不好就是在轉扭蛋。

怎麼那麼多生成選項:文字、圖片與模型怎麼選?

你不必整支影片都用同一種生成方式。

如果只是探索大樓大廳長什麼樣,文字生成影片可以快速提供不同可能;如果主角外觀和構圖已經確定,先做一張參考圖再生成影片,通常比較容易控制;如果某個鏡頭已經有可用素材,也沒有理由為了「全片都是 AI」而重新生成。

三種輸入各自換到多少控制權、準備成本差多少、什麼時候該混著用,見〈第 2 篇:先決定從文字、圖片還是腳本開始〉。我們可以預期影片生成模型肯定會在未來提供越長時間的生成結果,但這並不代表你就會轉到你要的扭蛋。

最基礎的文字生影片,那就是完全交給模型控制。 圖片或影片生成影片是最容易入門的進階操作,但往往也容易陷入抽卡循環。

所以,前期的準備至關重要:

  • 這一鏡必須保留什麼?
  • 哪些部分可以讓模型自由發揮?
  • 這一鏡最容易失敗的是人物、動作、場景,還是鏡頭?
  • 什麼條件達到後,我就願意把它放進成片?

一段可用鏡頭至少要符合這支影片真正需要的條件。例如你對鏡頭 2 的設計是呈現妙脆角貓在大廳流竄,那麼背景遠處路人的細節有點模糊,可能可以靠縮短鏡頭或景深隱藏;但如果貓憑空多了一隻,或配色整個變了,這一鏡就沒有完成任務。

我們注意到一個現象,用戶對於 AI 影片的接受度很高,瑕疵反而成了 AI 影片的特色。

結果不對時:改描述、換參考圖、局部修,還是重做?

看到錯誤時,先不要立刻把整段提示詞重寫。

這一步的決定只有一個:是不是單個鏡頭承受太多事情了。你會看到社群上有人在分享他們的成果,但他們不太告訴你這個提示詞是反覆測試了多少次。

本文的妙脆角貓誤闖摩天大樓,我們測試了2個版本的提示詞、抽了8次卡!

八次生成結果的縮圖網格:妙脆角貓在摩天大樓旋轉門與大廳的不同版本

創意的起點是動起來

把你一閃而過的念頭,直接發送給 AI 影片工具,別去學複雜的參數設定,輸入你的念頭,無腦送出開始。這個時刻,你已經是個尊貴的導演 消費者

當模型已經把行業知識收在裡面、直接輸出成你看得見的畫面,踏入影片創作的第一步就不再是背攝影術語,也不是看完 YouTube 上的口播教學。

AI 工具的出現,終結了先學會再動手的古典範式。直接把你生成的第一支影片發給朋友看、發布到社交媒體上——先求好玩,是當代影片創作的起手式。前文提及的那些術語,是影片創作過程更好玩的「道具」,那是第二隻、第三隻的影片再開始加入的元素。先完成一支。然後再決定下一支要在哪裡做得更好。

Alchemint 也推出了 AI 影片製作工具, 免費送你故事文本以及生成一張Storyboard 故事板, 去玩玩看

fuse 首頁首屏:輸入一句話就能產出整卷分鏡的介面,標示首卷分鏡免費、免綁信用卡、免註冊試用、輸出無水印

系列文章 SERIES用 AI 做影片4
  1. 01用 AI 做影片:提示詞就是你的影片你在這裡
  2. 02用 AI 做影片:先決定從文字、圖片還是腳本開始
  3. 03用 AI 做影片:讓每個鏡頭接得上的簡單 Storyboard
  4. 04用 AI 做影片:一艘紙船來接一隻貓,我們真的把它拍出來了
推薦閱讀 RECOMMENDED
教學Seedance 2.5 Prompt Skill 到底管什麼?參考圖、故事板與首幀一次拆開教學用 AI 做一支短片:從腳本到成片的完整工作流,以及它真正的成本