AI 生影片的真實距離:一整天、NT$92,換一支 15 秒廣告

實驗 2026-08-05 · Satsuma Creative · 閱讀 15 分鐘

全部畫面 AI 生成,一整天的積分帳單是新台幣 92 元。這篇要講的不是 AI 好厲害,而是那 92 塊買到了什麼、買不到什麼——包括三個提示詞救不了的限制。

2026 年 8 月 5 日,我用一天的時間,從零做出一支 15 秒的直式廣告。全部畫面都是 AI 生成的。這一天的積分帳單是新台幣 92 元。

三張 AI 生成的分鏡圖:辦公室、台北街道、義大利麵店,同一名上班族女生
三個鏡頭的分鏡圖,全部 AI 生成。同一個角色、三個場景,總共 3 積分(約新台幣 0.5 元)。

這篇文章要講的不是「AI 好厲害」,而是那 92 塊錢買到了什麼、以及買不到什麼。因為後者才是決定你該不該用它的關鍵。

為什麼要做這個實驗

我想幫自己的 LINE bot「就吃這」拍一支 Reels 廣告。內容很簡單:一個上班族女生中午決定不了吃什麼,用了服務,走出去,吃到一碗義大利麵。

傳統做法:找演員、借場地、拍一天、剪一週。就算最低規格,五位數跑不掉。

所以問題很直接——AI 生影片現在到底能做到哪一步?

我選的工具是 LibTV(中國 LiblibAI 出的 AI 影片平台)。它有一個官方 CLI,可以用指令操作,適合串成產線。順帶一提,這是中國平台,註冊要大陸手機號、付費要支付寶,而且站台在北京、從台灣直連是不通的——我最後是把 API 流量繞過自己的雲端主機才連上。這件事本身就說明了一部分成本不在帳單上。

先看真實價目

LibTV 平台用「積分」計價。我實測出來的單價:

動作 積分 耗時
劇本 → 分鏡表 6 73 秒
一張分鏡圖 1 34 秒
5 秒影片(720P) 40 2–10 分鐘
15 秒影片(720P,一鏡到底) 120 8 分鐘
一段 TTS 配音 約 31 23 秒

規律很乾淨:影片就是 8 積分/秒,跟你選哪個模型沒關係,480P 減半、1080P 加倍。只有旗艦模型另計,貴 3.35 倍。

我買的是月費 ¥59(約 NT$254)、每月 1500 積分的方案,換算下來 1 積分約 NT$0.17

所以:

  • 這支片的畫面素材(分鏡圖 + 三鏡影片,含十輪試錯):250 積分,NT$42。一次到位不試錯的話是 152 積分,NT$26
  • 加上配音:281 積分,NT$48
  • 整天的實驗總共 546 積分,NT$92——多出來的那 45 塊,是摸索平台、加上一條後來被我放棄的技術路線

⚠️ 一個容易誤判的地方:訂閱積分每 31 天重置,不累積。 年繳看起來便宜,但你不能存到專案爆發那個月一次用完。這對接案的人很重要。

第一個真問題:不是畫質,是一致性

畫質早就不是問題了。我生的台北騎樓有機車、有紅底招牌、有正午硬光,一眼就是台灣。義大利麵店坐滿人、白煙升起、背景客人虛焦。

真正的難題是:三個鏡頭裡的主角,要是同一個人。

這件事我試了三種做法,結果差很大:

做法 場景 角色
什麼都不做 ✅ 場景很好 ❌ 三鏡三個人
把角色定裝圖當「參考圖」餵進去 ❌ 場景全毀 ✅ 完全一致
把角色外貌用文字寫進提示詞

中間那列是最反直覺的。我原本以為「給它一張角色照片」是最直接的解法,結果模型把參考圖的背景和構圖也一起複製了——辦公室、街道、麵店三個場景全部變成定裝圖那張灰色棚拍站姿,只剩一盤麵孤零零放在灰背景前的木桌上。

上排:給了角色參考圖,三個場景全變成灰色棚拍背景。下排:改用文字描述角色,場景與角色都正確
上排是「給參考圖」的結果——辦公室、街道、麵店三個場景全被參考圖的灰棚背景吃掉,第三張只剩一盤麵孤零零放在灰背景前。下排是改用文字描述角色之後,場景回來了,服裝髮型也一致。

原因不難理解:所謂「圖生圖」是拿整張圖當起點,它沒辦法只抄人不抄背景。

最後有效的是最土的方法:不給圖,把「及肩黑髮、灰色短袖、米色寬褲、深色背包」寫成文字塞進每一個鏡頭的提示詞。四張圖的服裝髮型完全一致,而三個場景都保住了。

這裡的教訓可以推廣到所有生成式工具:參考素材給得越多,控制力不一定越強,因為你沒辦法指定「只參考這部分」。有時候用文字描述,反而比給範例更精準。

第二個真問題:運鏡越少越穩

我原本的分鏡裡,第二個鏡頭是「鏡頭跟著她側移」。生出來的結果,客戶第一句話是「這裡好像掉幀」。

我去量了——150 幀全部是獨立畫面,沒有任何重複。技術上完全正常。

問題出在別的地方:跟拍時,她在畫面裡的位置固定、背景橫向滑動,但 AI 生的腿部擺動頻率跟背景移動速度對不上。大腦抓到這個不一致,就判定為「卡頓」。

我試著改成固定機位,結果更糟——我在提示詞裡寫「背景保持靜止」,本意是固定「機位」,模型卻理解成固定「背景」,把大部分路人凍成雕像,只有幾個還在動。半凍結比全動或全靜都更詭異。

最後有效的做法是換方向:讓她朝著鏡頭走過來。

上排:鏡頭跟拍側移,人物在畫面中位置幾乎不動。下排:改成朝鏡頭走來,人物逐格變大
上排是跟拍——她在畫面裡的位置幾乎沒變,靠背景滑動表示前進,觀感就是「原地踏步」。下排改成朝鏡頭走來,位移靠人物逐格變大呈現,一次就對了。

深度方向的移動,位移主要靠人物尺寸變化呈現,不需要腿和背景嚴格同步。一次就對了。

三個鏡頭最後全部是固定機位。而三支裡一開始就最穩的,正是唯一一開始就沒有運鏡的那支。

這條可以直接抄走:用 AI 生影片,預設固定機位,除非有非動不可的理由。

第三個問題沒有解法:沒有 seed,只有重骰

前面兩個問題都能靠更好的提示詞解決。這個不行。

傳統剪接裡,你會說「這裡再拉 0.5 秒」「這個表情太誇張,收一點」。那是調整

在這裡不存在調整,只有重新骰一次。我改第二鏡的提示詞改了三次,每一次都是全新的一支影片——不是把上一支改好,是重新生成一支不一樣的。這些模型沒有提供固定隨機種子的參數,所以「同樣的東西,只改一個地方」做不到。

這個限制比它聽起來嚴重。它意味著:

  • 你不能微調,只能接受或重來
  • 每次重來都是完整的費用和完整的等待
  • 你永遠不知道下一次會不會比這次差

我第三鏡第一次生出來,她全程盯著鏡頭、表情浮誇、嘴裡的麵在下一格消失。第二次改成「視線落在食物上、不看鏡頭、表情克制」就對了。但那是運氣的一部分——同樣的提示詞再跑一次,結果會不一樣。

有一種東西 AI 不能生:真實的產品畫面

我原本的腳本裡,要出現地圖、找店家、實際的 LINE 對話畫面。

這些不能用 AI 生。生出來的 LINE 介面必然是假的——按鈕位置不對、卡片長相不對、字體不對。而且拿假介面去宣傳真產品,那不是技術問題,是誠信問題。

所以整個腳本的結構被迫改變:拿手機的鏡頭一律讓螢幕背對鏡頭,只拍手勢和表情。廣告賣的變成「決定完之後那段路走起來很輕鬆」,而不是「你看這個介面多好用」。

事後看,這個限制反而讓廣告變好了。但那是意外,不是設計。

任何需要展示真實介面的產品廣告,那一段一定得自己錄。 這一點沒有繞路。

所以我另外做了一個工具

實驗做到一半,我停下來寫了一個網頁工具。不是因為官方介面不好,是因為它跟我要做的事不是同一件事

官方給的是一張畫布:節點拖來拖去、線接來接去,適合一個人邊玩邊想。我要的是一條產線:劇本進去、成片出來,中間每一步都可以退回去重做。

自製的分鏡工作台:左邊是劇本與全域參數,右邊是分鏡卡片牆,每張卡顯示圖與影片兩段狀態
自製的分鏡工作台。左欄是劇本、全域參數與角色定裝圖,右欄是卡片牆。每張卡片上「🖼 圖」與「🎬 影片」是兩段獨立狀態。

差別具體在四件事:

一、批次,不是一格一格點。 三十個鏡頭排進佇列,跑完通知我,不用守著螢幕。

二、版本疊在同一張卡上。 同一個鏡頭重生五次,那是「這一鏡的五個版本」,不是畫布上散落的五個節點。挑片時用鍵盤 翻,Enter 選定。導演在挑的是「這鏡要哪一版」,不是「這一百張圖裡哪張好」。

三、成本帳本。 平台只告訴你剩多少積分,不會告訴你「這支片花了多少」——因為它不知道哪些節點屬於同一支片。工具自己記帳,按下「全部生成」之前先跳出「預估消耗 120 積分」。

四、也是最重要的一條:兩段式鎖。

分鏡圖 1 積分,影片 40 積分,差 40 倍。所以工具把每個鏡頭拆成兩段狀態:分鏡圖沒定稿之前,那一鏡的「生影片」按鈕是鎖住的、灰的、按不下去

這條規則救了我很多錢。實驗過程中我為了調整構圖,分鏡圖總共重生了十輪——如果那十輪是在影片層做的,就是 400 積分而不是 10 積分。

工具最有價值的功能,常常不是「讓你能做什麼」,而是「不讓你做什麼」

寫工具時撞到的三件事

這一段偏技術,不感興趣可以跳過。但其中兩點是任何要串接生成式 API 的人都會遇到的。

一、提交是排隊的,執行才是並行的。

我一開始同時送出六個生成任務,五個立刻失敗,錯誤訊息是「正在發起任務,請稍候」。查了才知道:平台方案寫的「8 個並發任務」指的是同時執行的上限,不是同時提交。送出這個動作本身是序列化的。

正確做法是交錯送出(實測 6 秒間隔安全),撞到就退避重試——而且這種失敗不能算生成失敗,因為根本還沒送出去,一毛錢都沒扣。這個區分很重要:真正的生成失敗要停下來讓人看,排隊撞車要自動重試。

二、官方工具自己也有 bug。

平台提供了一個「從劇本自動生成分鏡圖組」的指令,聽起來正是我要的。實際跑下去,它產出的每個節點都帶著一個叫 promptMagic 的欄位——而平台上所有模型的規格都不接受這個欄位。100% 驗證失敗。

我繞過去的方法是自己讀分鏡表、自己建節點。多花兩小時,但至少能跑。

這件事的意義不在那個 bug,在於:把別人的工具當黑箱用,你就只能等它修。 願意拆開看一層,通常都有繞路。

三、結果一定要鏡像到自己的硬碟。

生成出來的圖和影片放在對方的 CDN 上。那個連結會不會過期、哪天會不會清檔、從台灣連不連得到,都不在我的控制範圍。所以工具一偵測到結果就立刻下載到本機,介面永遠讀本地檔案,遠端網址只留著除錯用。

一支 15 秒的片大約 30 MB,三十鏡的專案約 1 GB。硬碟很便宜,重生很貴。

但工具解決不了的

講完好處要講清楚邊界:上面四件事全部是流程摩擦,不是生成品質。

前面提到的三個限制——沒有 seed 只能重骰、真實產品介面生不出來、音畫各自獨立——工具一個都解決不了。它們是模型層的限制,不是介面層的。

我花在工具上的時間,換到的是「同樣的錢可以多試幾次、不會手滑燒掉 40 倍的成本、素材不會弄丟」。這很值得,但它不會讓成片離「可以交付」更近一步。

所以它到底是什麼

一天下來,我的結論是:

它是素材工廠,不是成片產線。

真正被自動化的部分很實在:

  • 劇本丟進去,自動拆成分鏡表,附景別、光線、運鏡提示。品質意外地高,會抓到伏筆(我劇本裡寫「左手背有舊燙疤」,它在手部特寫那一鏡特地寫出來)
  • 場景生成幾乎不用修
  • 角色一致性解決了
  • 15 秒一鏡到底,零漂移

但要交付一支完整的片,後製工時省不掉多少:

  • 配音生出來 10.6 秒,畫面 15.1 秒——音畫是各自獨立的,沒有任何同步機制
  • 片尾字卡要自己打(讓 AI 生中文字會出亂碼字形)
  • 背景音樂要自己配
  • 每個鏡頭都是整齊的 5 秒,但真正的剪接是「這鏡 3.2 秒、那鏡 6.8 秒」
  • 要角色開口說話對嘴,得先有音檔才能生畫面,順序整個反過來

誰該用、怎麼用

我認為現階段有三種划算的用法:

一、情境 B-roll。 廣告裡那些「人在生活」的空鏡——走路、吃飯、發呆、看手機。這些跟你自己拍的實拍剪在一起,成本降得很有感。

二、分鏡預覽。 實拍之前先把構圖和節奏生出來看,比手繪 storyboard 快,也比口頭描述具體。一張圖 NT$0.17,你可以把整支片先「拍」一遍再決定要不要真的拍。

三、社群短素材。 粗糙度可接受的場合,直接出片。

不划算的是「交付給客戶的完整成片」。那個距離還在。

最後

一整天,92 塊錢。其中 42 塊變成那支片的素材,剩下的 50 塊買的是「知道它做不到什麼」。

我覺得這個交換很值得。因為邊界摸清楚之後,下一支片就不用一整天了——而且我很確定它做得到什麼、做不到什麼,不會在客戶面前承諾我兌現不了的東西。

這大概是所有 AI 工具最實際的用法:先花一次成本把天花板量出來,之後每一次都在自己知道的範圍裡工作。