Claude Opus 5.5 做影片到底有多強?一次看懂能力、Token 消耗與 AI 影片工作流
- 從 Prompt、程式碼到 Renderer,拆解程式化影片能力、Token 成本與 Agentic Video Production。 -
最近我一直在研究 Claude Opus 5.5 做影片的案例。越看越覺得,這波值得注意的事情,不是「Claude 也會做影片了」,而是 AI 開始能把影片製作當成軟體工程專案來完成。
這和我們熟悉的 Veo、Seedance、MiniMax H3 等生成式影片工具,走的是不同路線。以前常見的流程是:
1 | 提示詞 → 影片生成模型 → MP4 |
而程式化影片的流程更像:
1 | 提示詞 → AI Agent → 程式碼 → 動畫引擎 → Render → MP4 |
Anthropic 在 2026 年 9 月 22 日推出 Claude Opus 5.5,官方將它定位為適合長時間 Agentic Coding 與知識工作的模型。這篇文章談的「做影片」,是讓模型在 Agent 工具、動畫框架與 Renderer 的協助下寫程式、反覆檢查並組裝成片;不是把 Opus 5.5 當成直接生成電影鏡頭的影片模型。Anthropic:Claude Opus 5.5
Claude Opus 5.5 做影片,實際上是在做什麼?
如果你交代 Agent:「幫我製作一支 90 秒的科普動畫」,它可以先協助拆解主題與旁白,再規劃分鏡、場景、動畫節奏和字幕,接著在有提供適當工具與執行環境的前提下,建立 HTML、Canvas、SVG、Three.js 或 Remotion 專案,執行程式、檢查輸出、修改動畫,最後再串接 TTS、字幕或 FFmpeg。
所以更精確地說,Claude 負責理解需求、產生與修改程式、安排工具;動畫引擎負責呈現畫面;TTS、音效、FFmpeg 或剪輯工具則完成聲音與影片輸出。模型能否直接操作這些工具,要看你使用的 Agent、權限與環境設定。它不會只靠模型本身就自動完成上述每一步。
| 環節 | Agent 可協助的工作 | 實際執行者 |
|---|---|---|
| 企劃與分鏡 | 拆解主題、旁白、Scene 與時間軸 | Claude 與創作者 Review |
| 動畫實作 | 建立 SVG、Canvas、Three.js 或 Remotion 程式 | Agent 編輯檔案,動畫框架執行 |
| 聲音與字幕 | 整理旁白、字幕和時間標記,呼叫 TTS | 外部 TTS、字幕工具或剪輯軟體 |
| 輸出與檢查 | 呼叫 Render、讀取輸出結果並修正問題 | Renderer、FFmpeg 與可用的 QA 工具 |
影片不是單純的媒體檔案,也可以是一套可重複產生影片的程式專案。這個差異,是理解 Opus 5.5 影片工作流的起點。
為什麼 Agent 做影片可能會累積數百萬 Token?
我看到的個別案例分享中,有人提到用 Opus 5.5 做一支科普動畫,約 30 分鐘完成,整段 Agent 工作階段累積約 500~600 萬 Token。這是單一案例的分享,不是 Anthropic 公布的影片製作平均值;如果沒有 API usage 明細、平台計算方式和完整執行紀錄,也無法單憑總 Token 數推算出精確費用。
Agent 不是只回答一次。它可能反覆讀取需求和程式、執行專案、檢查輸出、修正錯誤,再重跑 Render。程式碼量、工具輸出、Context 長度、修改輪數、QA 次數,都會讓不同專案的用量差很多。
比起只看成片幾分鐘,更有參考價值的問題是:有多少個 Scene?Agent 讀了多少程式和輸出?改了幾輪?重跑幾次?有沒有用 Prompt Caching?是否加入 TTS、音訊分析或自動 QA?
Token 總量不等於同價的計費量
以 Anthropic API 公布的 Claude Opus 5.5 標準價格為例,每百萬 Token 的一般 Input 為 US$4、Output 為 US$20;5 分鐘 Cache Write 為 US$5、1 小時 Cache Write 為 US$8,Cache Read 為 US$0.20。這些是本文撰寫時的 API 價格;不同產品方案、雲端平台、快速模式或後續調價可能不同,實際估價請以官方價格頁為準。
| 計費項目 | 用途概念 | Opus 5.5 標準 API 價格(每百萬 Token) |
|---|---|---|
| Input | 送進模型、未命中快取的內容 | US$4 |
| Cache Write | 首次將可重用內容寫入快取 | 5 分鐘 US$5;1 小時 US$8 |
| Cache Read | 後續讀取已快取的內容 | US$0.20 |
| Output | 模型產生的文字或程式碼 | US$20 |
假設一份用量報表中,Input 是 100 萬、Cache Read 是 400 萬、Output 是 100 萬,這三類加總是 600 萬 Token;依上述標準 API 價格試算,這三項約為 US$24.80,尚未計入 Cache Write、其他平台費用或可能適用的價格條件。這只是示範算法,不代表前面提到的個案實際帳單。
看帳單或用量頁面時,先確認 Input、Cache Write、Cache Read 與 Output 的定義,以及介面是否已將快取項目包含在總數裡,再分項估價;不要把所有 Token 都乘上 Output 的單價。
影片長度只能當粗略參考
下面是原稿提出的工作量區間,只適合當作概念估算,不是官方規格、業界平均或保證值。影片腳本是否既有、場景複雜度、程式碼是否重用、Context 管理、Agent 次數及平台記帳方式,都可能讓結果大幅不同。
| 製作規模 | 原稿提出的 Token 概念區間 |
|---|---|
| 簡單 10~20 秒 Motion Graphics | 數十萬 Token 等級 |
| 30~60 秒程式動畫 | 數十萬到百萬 Token 等級 |
| 約 90 秒科普動畫 | 百萬 Token 等級 |
| 複雜 MV 或多場景長時間自主 Agent | 數百萬,甚至可能超過千萬 Token |
哪些影片適合用程式來做?
程式動畫特別適合畫面元素可明確描述、位置與時間能被控制的內容。它不是每種影片的替代方案,但在資訊正確、文字清晰或需要重複修改時,有自己的優勢。
Motion Graphics 與品牌動畫
動態文字、Logo Animation、資訊圖表、數字動畫、線條、粒子、UI 動畫、字幕和轉場,都很適合用程式精準控制。若指定顯示「2026 AI Agent」,程式就能照規格排版,不會像影像生成一樣把字形畫錯。真正的品牌標誌仍應使用已核實的素材檔,不能讓模型憑空仿製。
科普與知識型動畫
以「疫苗如何作用?」為例,可以將內容拆成免疫系統、抗原、抗體和記憶細胞,再為每個段落建立 Scene,串上旁白、字幕和動畫。這類影片若重點在資訊清楚、流程正確與方便修訂,SVG 或 Canvas 動畫有時比直接生成影像更合適。科學內容仍需專業查核,動畫只負責呈現,不能代替事實驗證。
像素風 MV 與歌詞動畫
可將歌詞與音樂段落整理成時間軸,為每段設計 Pixel Art 場景,再用程式控制角色、背景和字幕切換,最後把音樂、畫面與字幕合成。這讓大量重複的時間軸工作更容易自動化,但美術方向、歌詞解讀與節奏感仍值得由人 Review。
Data Visualization Video
給 Agent 一份 sales.csv,讓它協助找出重點、建立圖表、編寫旁白,再輸出 60 秒報告影片。這裡最重要的是數字從資料讀取,而不是讓生成模型自行猜測。例如營收 NT$3,582,000,就要由資料欄位帶入畫面,並驗證計算與標示正確。
生成式影片搭配 Motion Graphics
實務上不必在「AI 影片」和「程式動畫」之間二選一。可以用生成式影片提供人物、場景或電影感素材,再由程式動畫加上字幕、Logo、圖表、歌詞、轉場與時間軸,最後使用 FFmpeg 或剪輯軟體合成。
| 工作路線 | 主要負責內容 | 常見適用場景 |
|---|---|---|
| Generative Video | 生成角色、場景、鏡頭與氛圍 | 真人感、電影畫面、場景運鏡 |
| Programmatic Video | 以程式控制文字、圖表、UI 和動畫 | 資訊圖表、教學、品牌字卡、歌詞動畫 |
| 混合工作流 | 生成式素材加上程式化資訊與剪輯 | 品牌影片、音樂 MV、知識型短片 |
影片也開始變成軟體專案
以前要把片中的「2025」改成「2026」,可能得回剪輯軟體逐段修改。如果影片以程式生成,年份可以是變數;公司名稱、品牌色、業績資料與語言也可以從設定檔或資料表帶入。
同一套模板因此有機會產生 A 公司、B 公司和 C 公司版本,或依照不同資料自動更新圖表。這時,產物不只有 MP4,也包含一套可維護、可重複執行的 Video Generator。
但程式化並不代表沒有 QA。仍要檢查字幕是否正確、圖表是否引用正確資料、音畫是否同步、輸出解析度和影片長度是否符合規格。自動 Render 只是流程的一部分,不能取代成片檢查。
Video Engineering Prompt:把影片需求寫成規格
傳統 AI Video Prompt 常描述鏡頭、光線、角色、運鏡與風格。程式化影片還需要把需求寫成 Agent 能執行的製作規格,例如:
- 解析度、畫面比例與輸出格式
- 每個 Scene 的內容、順序與 Duration
- Timeline、轉場、動畫與 easing
- 字型、Typography、字幕與安全區
- 旁白、TTS、音效、音樂和音訊時間點
- 使用的 Renderer、Render 指令和檔案結構
- QA 條件:文字、資料、時間長度、解析度與輸出檔案
這已經很接近一份影片 PRD。Prompt 不只是說「做得漂亮一點」,還要交代輸入素材、限制、時間軸、驗收條件和交付格式。規格越清楚,Agent 就越容易在可檢查的範圍內工作。
下一階段:Agentic Video Production
我會把這種做法稱為 Agentic Video Production(Agent 化影片製作):人提供主題、音樂、歌詞、素材和輸出要求,Agent 協助規劃、寫程式、呼叫工具、Render,再根據檢查結果修正。
人仍然要負責方向、審美、素材權利與最後 Review。Agent 可以接手很多重複的製作步驟,但工具是否能互相呼叫、影片能否一次做對、素材是否合用,都取決於實際工作流和 QA。
所以我看 Claude Opus 5.5 做影片,真正感興趣的不是「Claude 會生成影片了」,而是:影片製作也開始能透過自然語言和程式工作流來建構。這件事和 Vibe Coding 很像,讓不熟悉動畫或剪輯的人,也有機會把自己的影片製作流程做成可重複使用的工具。
如果你也在建立自己的影片流程,可以延伸閱讀用 Codex 打造 AI 影片工廠與AI 影片生成的價值轉移。
常見問答 (FAQ)
Q1:Claude Opus 5.5 可以直接輸出 MP4 嗎?
Opus 5.5 本身不是專門直接輸出影片畫面的生成模型。它可以在提供 Agent、程式執行環境與相關工具時,協助產生動畫程式、呼叫 Renderer 或 FFmpeg,再把輸出組合成影片;實際能力取決於你配置的工具和工作流。
Q2:Agent 工作階段累積 600 萬 Token,代表影片要花很多錢嗎?
不能只看總 Token 數。一般 Input、Cache Write、Cache Read 與 Output 的價格不同,也要確認平台報表如何計算快取用量。最好取得實際用量明細,依模型、平台和當時價格分項估算;沒有明細時,個案總數只能作為工作量參考。
Q3:什麼類型的影片最適合用程式製作?
需要精確文字、數據、圖表、UI、字幕、時間軸或多版本重複輸出的影片,通常較適合程式化動畫。真人表演、電影感鏡頭與複雜場景可搭配生成式影片,再用程式處理資訊圖層、字幕和剪輯。