跳到主要內容

部落格

不定期分享最新資訊文章

  • article-當 AI 生成影片比你看得還快:真正的「無限影片」開始了

    2026/9/1

    AI工具 內容行銷 影音行銷
    當 AI 生成影片比你看得還快:真正的「無限影片」開始了

    15 秒的 AI 影片,要生成多久? 9 秒。 乍看之下,好像只是 AI 影片又變快了。 但我覺得,真正值得注意的根本不是「9 秒」。 而是 AI 影片跨過了一條很重要的線:生成速度,開始超過播放速度。 這件事可能比「畫質又提升多少」重要得多。 本文提到的 H3 Max、Infinite Slop、Nothing, Forever,以及影片生成成本,依使用者提供的觀察與估算整理。模型版本、服務狀態、推論速度與價格都可能變動,實際使用時仍應以當下方案為準。 只要生成速度超過播放速度,影片就可以沒有結局8 月 29 日,fal 工程師 Rehan Sheikh 把影片生成模型接上 Twitch,做了一台永遠播不完的「無限跨次元電視」。 底下跑的是 fal 的 H3 Max。官方數字是:5 秒影片,3 秒內生成。後來獨立開發者 Pieter Levels 實測,15 秒影片大約 9 秒跑完。 為什麼這個數字重要? 因為只要: 生成時間 < 播放時間 當你還在看前面 15 秒時,AI 已經把後面 15 秒生好了。你開始看第二段,AI 又繼續生成第三段。 115 秒 → 15 秒 → 15 秒 → 15 秒 → …… 只要生成佇列沒有中斷,理論上就能永遠延伸下去。 觀眾正在做什麼 AI 同時在做什麼 播放第 1 段 15 秒影片 生成第 2 段 15 秒影片 播放第 2 段 15 秒影片 生成第 3 段 15 秒影片 播放第 3 段 15 秒影片 生成第 4 段 15 秒影片 所以未來 AI 影片模型比的,可能不再只是: 一次可以生成幾秒? 而是: 能不能永遠比觀眾快一步? 這會把 AI 影片的競爭,從「單次生成品質」推向「持續生成能力」。 三年前,無限的是劇本,不是畫面其實「永遠播不完的 AI 節目」,三年前就有人做過。 2022 年底,Twitch 出現一個很有名的頻道:Nothing, Forever。它可以 24 小時不斷演出 AI 情境喜劇。 但當年的方法其實完全不同。 角色、場景與 3D 資產都事先準備好,再由 Unity 即時排列組合。AI 主要負責生成對白。 換句話說,當時比較像: 1AI 編劇 + TTS + 遊戲引擎 三年前我們做到的是:劇本永遠寫不完。 但今天不一樣。 人物可以生成,場景可以生成,動作可以生成,鏡頭可以生成。甚至連「下一秒的世界長什麼樣子」,都可以下一秒再決定。 Nothing, Forever Infinite Video 角色、場景與 3D 資產預先準備 人物、場景與鏡頭可以即時生成 AI 主要生成對白 AI 直接生成畫面本身 無限延伸的是劇本 無限延伸的是世界 所以我覺得這次最值得記住的一句話是: 三年前,無限的是劇本。現在,無限的是畫面本身。 AI 開始即時生成世界,而不只是幫你做影片更有趣的事情,很快就發生了。 十幾個小時後,Pieter Levels 自己做了一個互動版本:Infinite Slop。 觀眾在聊天室輸入什麼,AI 就嘗試把它變成下一段影片,而且還會試著延續前面的故事。 例如有人說:「讓恐龍出現。」下一段真的可以出現恐龍。有人說:「去東京。」故事就可以往東京發展。 這時候,整個媒體邏輯其實已經變了: 1觀眾 → AI → 影片 → 觀眾 → AI → 下一段影片 觀眾不只是 Audience,觀眾本身開始變成 Prompt。 以前是創作者先完成內容,再交給觀眾觀看;現在則可能是觀眾提供方向,AI 即時生成內容,再把新的內容交回觀眾。 這已經不只是「AI 幫你做影片」,而是 AI 開始替你生成一個可以持續變化的世界。 為什麼 AI 電影可能不是最有趣的終點?現在大家聊 AI Video,很容易問: 什麼時候可以直接生成一部兩小時電影? 但這可能是在用舊媒體的框架,理解一個新媒體。 因為如果影片可以即時生成,為什麼還一定要是一部固定的電影? 它可能變成: AI 實境秀 AI VTuber AI 兒童故事 AI 連續劇 AI NPC 世界 AI 購物頻道 永遠不會完結的直播節目 更進一步,未來甚至可能不是「100 萬人看同一部電影」,而是「100 萬人看 100 萬個版本」。 你喜歡懸疑,AI 就讓故事更懸疑。你喜歡東京,故事就往東京發展。某一段你快轉,AI 知道你沒興趣;某個角色出現時你停留很久,AI 知道你可能喜歡他。 影片開始不是「播放給你看」,而是:一邊播放,一邊為你生成。 今天我們叫: Video on Demand 未來搞不好會變成: Reality on Demand 你選的不再是哪一部影片,而是: 今天,我想進入什麼世界? 如果你想先理解 AI 影片時代需要哪些判斷能力,也可以延伸閱讀〈學 AI 影片,你最不該做的,可能是先去學怎麼當導演〉。 真正卡住 AI 的不是技術,而是推論成本不過,現在真正卡住 AI 的,已經不是技術。 是錢。 Rehan Sheikh 後來自己算了一筆帳:如果 H3 Max 480p 標準價格以每秒成品影片 0.05 美元計算,24 小時不停生成的成本大約是: 一天:約 4,320 美元 一個月:約 129,600 美元 一年:接近 158 萬美元 而且這還只是影片推論成本,還沒有算頻寬、儲存、直播服務、監控與其他營運支出。 因此現在其實是一個很有趣的階段:能力已經到了,速度開始到了,但經濟模型還沒到。 Infinite Slop 能一直跑,其中一個原因就是 fal 在贊助運算成本。這也提醒我們,Demo 可以先證明「做得到」,但要變成真正的新媒體,還需要讓它「長期付得起」。 接下來真正值得觀察的,不只是「下一代模型快多少」,而是三條曲線: 曲線 代表的問題 能力 ↑ AI 能不能生成更穩定、更連貫的世界? 速度 ↑↑ 能不能持續跑在觀眾播放速度之前? 成本 ↓ 這種內容能不能長時間、低成本運作? 當這三條線真正交會,Infinite Video 才會從一個很酷的 Demo,變成真正的新媒體。 9 秒只是數字,跨過那條線才是新聞所以如果只把這件事情理解成: 現在 AI 生成 15 秒影片只要 9 秒。 我覺得反而小看它了。 真正重要的是:AI 影片第一次開始生得比人類看得還快。 今天是 9 秒,以後可能是 6 秒、3 秒,甚至接近即時。 當「生成速度 > 消費速度」之後,我們真正該問的就不再是: AI 可以幫我多快做完一支影片? 而是: 如果影片根本不需要做完呢? 沒有固定片長,沒有固定劇本,也沒有真正的大結局。甚至每個人看到的,都不是同一個故事。 我覺得 AI Video 下一階段真正有意思的方向,可能不是「把現在的影片做得更便宜」,而是開始出現以前根本不存在的內容形式。 從生成影片,到生成節目,最後可能是:即時生成一個你正在觀看的世界。 常見問答 (FAQ)Q1:什麼叫做 AI 影片的生成速度超過播放速度?如果一段 15 秒影片可以在 9 秒內生成,代表觀眾播放前一段影片時,AI 有機會提前準備好下一段。當生成時間持續小於播放時間,內容就能透過分段接續,理論上不斷延伸。 Q2:Infinite Video 和 Nothing, Forever 有什麼不同?Nothing, Forever 主要使用預先準備的角色、場景與 3D 資產,再由 AI 生成對白並即時排列;Infinite Video 則進一步讓人物、場景、動作與鏡頭都能即時生成,因此無限延伸的不只是劇本,也包含畫面世界。 Q3:為什麼即時生成影片不一定會先變成兩小時 AI 電影?因為即時生成允許內容依觀眾輸入、停留與互動持續改變,固定片長的電影不一定能發揮這種特性。AI 實境秀、互動連續劇、AI NPC 世界或個人化直播,可能更符合這種新媒體形式。 Q4:目前 Infinite Video 最大的限制是什麼?目前最大的限制之一是推論成本。即使影片生成速度已經快到能追上播放,若每秒成品影片的成本仍然很高,長時間直播就很難形成可持續的商業模式;模型能力、速度與成本必須同時改善。

  • article-AI 讓做 MV 變簡單了,但我反而花更多時間

    2026/9/1

    AI工具 影音行銷
    AI 讓做 MV 變簡單了,但我反而花更多時間

    最近認真玩了一輪「AI 做音樂 MV」。 從歌曲、拆歌詞、想故事、做分鏡、生圖、圖轉影片,一路做到最後剪接。 做完之後,我最大的感覺不是: 「AI 現在好厲害,連 MV 都會做了。」 而是—— 現在真的不是「做不做得到」的問題,而是「你想花多少時間,把它做到多好」。 而且我後來發現,這件事情其實不只適用 AI 影片,也正在改變我們使用 AI 做任何事情的方式。 從一首歌到完整 MV,第一次完成已經不再是最大門檻以前如果我要自己做一支 MV,我不會攝影、不會動畫、不會特效,也沒有演員、場地或製作團隊。 很多想法不是不好,是真的做不到。😂 但現在完全不一樣。 不會寫歌,AI 可以幫你寫。 不會做分鏡,AI 可以幫你拆。 不會畫畫,AI 可以幫你生圖。 不會拍影片,AI 可以幫你生成。 甚至連分鏡、生圖、動畫、剪接都不想一個一個處理,現在也開始有工具可以直接從一首歌產生完整 MV。 如果你想先理解 AI 影片創作中「看懂、判斷與指揮」的重要性,也可以延伸閱讀:學 AI 影片,你最不該做的,可能是先去學怎麼當導演。 所以我覺得,AI 真正厲害的地方不只是: 讓專業的人做得更快。 而是: 讓以前根本沒有生產能力的人,也拿到了入場券。 以前「想到」跟「做到」中間,隔著大量的專業技能。 AI 正在把這個距離快速縮短。 「做到」變簡單了,「做好」卻沒有這是我實際做完之後,覺得最有趣的地方。 以前你的能力可能只能做到 30 分,做到 30 分,你就停了,因為第 31 分你根本不知道怎麼做。 現在 AI 五分鐘可能就把你送到 70 分。 然後麻煩來了。 人物好像可以再一致一點? 重跑。 這個運鏡有點怪? 重跑。 副歌都進來了,畫面是不是應該再炸一點? 再跑。 這幕換成特寫好像更有感覺? 再來一次。 結果做到 80 分之後,你又突然看得到 90 分。 所以我發現一個很有趣的現象: AI 降低的是「第一次完成」的成本,卻沒有同步降低「最後 10 分」的成本。 甚至有時候反而讓你花更多時間。 因為以前是: 「做不到。」 現在變成: 「好像還可以再好一點。」😂 當生成變便宜,最昂貴的反而是選擇以前做一張圖很貴,所以不會隨便做 20 張。 現在不好看,再生四張;還是不喜歡,再四張。 影片也是,音樂也是,文案也是。 AI 解決了「沒有選擇」的問題,卻製造出另一個問題: 選擇太多。 所以當生成成本下降之後,我覺得另一種成本反而正在快速上升: 決策成本。 AI 可以幫你產生 100 個答案,但它沒有自動解決一個更重要的問題: 這 100 個裡面,哪一個值得留下? 所以未來真正厲害的人,可能不一定是 Prompt 寫最長、AI 工具會最多的人。 而是能從一堆「都還不錯」的東西裡,快速判斷: 哪一個真的比較好。 AI 正在把我們從「製作者」變成「決策者」以前我們學的是: 我會 Photoshop。 我會 Premiere。 我會攝影。 我會動畫。 我們的價值很大一部分來自: 「我會做。」 但當 AI 越來越會「做」之後,人的工作其實開始往上一層移。 從: 「這個怎麼做?」 慢慢變成: 「為什麼要這樣做?」 這個鏡頭為什麼需要特寫? 這段副歌為什麼應該換場景? 這個角色為什麼不能笑? 這支 MV 到底想讓觀眾感受到什麼? 所以我一直不太認同「有了 AI,人人都是導演」。 比較準確的說法應該是: AI 讓每個人突然擁有了一支以前養不起的製作團隊。 但有了一百個很會做事的員工,不代表你突然變成一個很會做決策的老闆。 這是兩件完全不同的事情。 做 AI MV,其實是在配置時間、金錢與控制權我現在做 AI MV,反而不會先問: 「哪個模型最強?」 而是先問: 「這支影片值得我花多少時間?」 不同做法,其實是在交換三樣東西:時間、金錢、控制權。 你更在意的事情 可以採取的方式 交換出去的資源 想省錢 使用免費額度,自己慢慢做 時間 想要更好的畫面 花錢換更高階的影片模型 金錢 想要最高控制權 自己拆分鏡、生圖、圖轉影片、剪接 時間與操作複雜度 想要快速完成 直接把歌曲交給 AI MV 工具 控制權 它們沒有哪一種比較高級,其實只是在交換不同資源。 真正重要的是: 你知不知道這一次該把資源押在哪裡。 先做爛,再做好:我現在的三輪工作法這是這次實測之後,我自己很想留下來的方法。 第一輪:先問「有沒有?」先把完整的東西跑出來,不要先問漂不漂亮。 歌曲有沒有對上? 故事有沒有開始和結束? 分鏡有沒有跑完? 畫面有沒有剪成一支完整的 MV? 第二輪:再問「對不對?」故事對不對? 節奏對不對? 情緒對不對? 畫面方向對不對? 這一輪是在確認:這支影片到底是不是你想做的那支影片。 第三輪:最後問「好不好?」確認方向之後,才開始處理人物一致性、畫面品質、運鏡與細節。 順序真的差很多。 不然你很容易花兩個小時—— 把一個根本不該存在的鏡頭,做得非常漂亮。🤣 AI 時代,停止也是一種創作能力這可能是我這次最大的體悟。 圖片可以無限重生。 影片可以無限重跑。 文案可以無限重寫。 音樂可以無限改版。 以前最大的問題是: 「我做不到。」 未來最大的問題可能變成: 「我永遠覺得還可以再改一下。」 當生成成本越來越低,「再試一次」的誘惑反而會越來越大。 所以真正有效率的人,未必是生成最快的人,而是知道: 什麼值得做到 95 分。 什麼做到 80 分就該交出去。 什麼做到 60 分,其實已經完成它的任務。 這不是降低標準,而是先判斷這個成果要完成什麼任務,再決定品質要到哪裡。 我現在給自己的 AI 創作原則很簡單: 先用 AI 買速度,再決定哪裡值得買品質。 先快速看到結果,再決定值不值得繼續投入時間。 因為 AI 真正替我們省下來的,不應該只是「做事的時間」,而是讓我們可以把時間重新分配到: 判斷、故事、品味、策略,以及真正重要的細節。 所以這次做 AI 音樂 MV,我最後學到最有價值的,反而不是怎麼做 MV,而是三個問題: 什麼值得做? 值得做到什麼程度? 什麼時候該停? 當「做得到」越來越便宜,「知道什麼值得做」反而會越來越貴。 這可能才是接下來真正值得學的 AI 能力。 常見問答 (FAQ)Q1:AI 音樂 MV 通常會經過哪些製作流程?一支 AI 音樂 MV 可以從歌曲開始,依序進行歌詞拆解、故事構思、分鏡設計、生圖、圖轉影片與最後剪接;也可以把歌曲交給整合型 AI MV 工具快速產出初版。 Q2:AI 做 MV 最能降低的是哪一種成本?AI 最明顯降低的是「第一次完成」的成本,讓沒有攝影、動畫或特效專業的人也能快速做出完整版本;但最後的品質修整與取捨不一定因此變快。 Q3:做 AI MV 時,應該怎麼選擇工具或模型?先依影片值得投入的程度配置時間、金錢與控制權:想省錢就用免費額度慢慢做,想要更好的畫面就提高預算,想保有最高控制權就自行拆分鏡、生圖、圖轉影片與剪接。 Q4:為什麼建議用「先做爛,再做好」的方法?因為先完成完整初版,才能先檢查故事、節奏、情緒與畫面方向是否正確;方向確認後再投入人物一致性、運鏡和細節,能避免把大量時間花在不該存在的鏡頭上。 Q5:AI 創作時,怎麼判斷什麼時候該停止修改?先看成果要完成的任務,再設定品質門檻:重要作品可以做到更高品質,一般測試或需要快速交付的內容做到足以完成任務即可,不必因為還能再生成一次就無限重跑。

  • article-學 AI 影片,你最不該做的,可能是先去學怎麼當導演

    2026/8/30

    AI自動化 AI工具 影音行銷
    學 AI 影片,你最不該做的,可能是先去學怎麼當導演

    最近 AI 影片越來越強。 Seedance、Google Flow、Veo 這些工具出現之後,我發現一個很有趣的現象:很多人在學 AI 影片時,第一個反應竟然是—— 我要不要先學攝影? 我要不要學分鏡? 我要不要學景別與運鏡? 我要不要先去上導演課? 但我最近反而越來越覺得:如果你的目標是做 AI 短影音,最不需要做的事情,可能就是先把自己訓練成一個導演。 這不是因為導演不重要。恰恰相反,是因為導演本身是一門太專業、太完整的工作。 本文提到的 Seedance、Google Flow、Veo 與其他 AI 工具,是用來說明這個工作觀念的例子,不是永久性的工具排名。實際功能與品質仍會隨模型版本、方案與使用情境變動;真正值得留下來的,是你如何定義目標、判斷結果,以及指揮 AI 把作品完成。 先別急著把自己訓練成導演傳統影視教育有一套完整的知識體系:構圖、景別、鏡頭語言、燈光、場面調度、攝影機運動、剪輯、聲音與敘事。 這些知識當然都有價值。問題是:你真的需要全部學會,才有資格做 AI 影片嗎? 想想看,有了 Vibe Coding,你不需要先花一年把 Python、JavaScript、資料庫、前後端全部學完,才有資格請 AI 幫你做網站。 有了 Suno,你也不需要先學會和弦、編曲與完整樂理,才有資格做一首歌。 有了生成式 AI,你同樣不用先念完設計系,學完色彩學、排版與構圖,才能做一張社群圖片。 同樣的事情,正在發生在影片領域。 所以 AI 影片真正值得研究的問題,不是: 我要怎麼成為導演? 而是: 我要怎麼讓 AI 成為我的導演? 這個差別會改變你的學習順序。你不必先把所有專業技能都收集完,才開始創作;你應該先知道自己要達成什麼結果,再學會如何讓 AI 提出方案,最後判斷哪個方案值得留下。 導演知識仍然重要,但不必一次學完整套「不必先成為導演」很容易被誤解成「什麼都不用懂」。我認為也不是。 這就跟 Vibe Coding 一樣。真正厲害的人,不一定需要自己寫完每一行程式碼,但他通常看得出來 AI 哪裡寫得不好、哪裡不符合需求、哪裡可能造成風險。 AI 影片也是如此。你不一定要親自拍攝或操作攝影機,但最好能判斷: 為什麼這顆鏡頭沒有壓迫感? 為什麼人物看起來很假? 為什麼這個轉場的 AI 味很重? 為什麼角色明明沒有改變,下一個鏡頭卻像換了一個人? 為什麼故事此處應該緊張,觀眾看了卻完全沒有感覺? 你需要的不是完整的導演專業,而是足以看懂與驗收影片的基本素養。 AI Video Literacy 是什麼?我會把這種能力稱為 AI Video Literacy,也就是 AI 影片素養。 它不要求你親自完成所有拍攝工作,而是要求你能在 AI 參與製作時完成四件事: 能力 你需要做的事 看懂 看出畫面、節奏、角色與情緒是否符合預期。 判斷 分辨產出是有效解法,還是只是看起來很華麗。 指揮 把觀眾、情緒、故事與商業目標交代給 AI。 修正 找出失敗原因,提出下一輪更具體的調整。 這四件事比背熟多少個運鏡名詞,更接近 AI 時代的影片工作。 Prompt 應該從控制攝影機,轉向描述觀眾意圖以前我們寫 AI 影片提示詞,很容易寫成一張施工圖: 35mm 鏡頭,低機位,攝影機向右環繞,人物往左走兩步,鏡頭慢慢推近,接著快速切換特寫。 這種寫法並沒有錯。當你需要精準控制畫面、維持角色連貫,或模型還無法理解抽象指令時,具體的視覺描述仍然有用。 但如果模型本身已經越來越懂攝影、構圖與運鏡,另一種 Prompt 會變得更重要:不要只告訴 AI 攝影機怎麼動,也要告訴 AI 你希望觀眾感受到什麼。 例如: 前三秒必須讓觀眾感覺事情不太對勁。 人物表面非常有自信,但觀眾要比角色更早發現危險。 這一段需要逐漸增加壓迫感,最後兩秒突然反轉。 接下來才讓 AI 思考:要用低機位、推鏡、手持、快速切鏡、特寫,還是完全不同的方法? 這是一個重要轉變:從控制畫面,變成描述意圖。 好的 AI 影片工作流,不是永遠只用抽象描述,也不是把每一個畫面細節都寫死,而是先說清楚結果,再依照模型與任務需要補上視覺限制。順序可以是: 先定義觀眾與商業目標。 再描述希望觀眾產生的情緒與行動。 請 AI 提出腳本、分鏡與視覺方案。 人再挑選、修改並補充必要的攝影細節。 短影音的基本單位,可能已經不是鏡頭,而是注意力如果你今天做的是電影,當然可以研究電影導演;但如果你做的是 TikTok、Reels 或 Shorts,我反而會建議你多研究短影音創作者。 因為兩者面對的是完全不同的戰場。 電影導演思考的是: 這個故事怎麼說最好? 短影音創作者第一個問題卻是: 怎樣讓他不要滑走? 電影可以用五分鐘鋪陳一個角色,短影音可能連五秒都沒有。你的觀眾正躺在床上,一隻手拿著手機;上一支是美女,下一支是貓,再下一支是搞笑影片,而你的作品夾在中間。 他沒有義務理解你的藝術理念,甚至沒有義務給你十秒。 因此,短影音真正的基本單位,可能已經不是「鏡頭」,而是注意力。 我甚至會把「分鏡設計」重新稱為「注意力設計」。一支 30 秒短影音可以先用這樣的方式規劃: 時間 注意力任務 0–2 秒 停滑:讓觀眾立刻感覺有事情值得看。 2–5 秒 建立問題:讓觀眾知道自己為什麼要繼續看。 5–10 秒 第一次刺激:提供新的資訊、畫面或情緒變化。 10–18 秒 衝突升級:讓問題變得更難、更急或更意外。 18–25 秒 答案/反轉:回收前面的期待,或重新定義問題。 25–30 秒 高潮/CTA:把情緒推到最高點,再引導下一個行動。 這不是保證每支影片都有效的公式,而是一個讓你在安排鏡頭之前,先安排觀眾注意力的思考框架。 當你這樣看影片,景別、構圖與運鏡就會回到正確的位置:它們是工具,不是目的。真正的目的,是讓觀眾接下來三秒仍然想看。 如果你還在建立短影音的受眾與內容定位,也可以延伸閱讀本站的〈建立你的短影音定位策略:用對內容才會被看見〉,先把「誰會看」與「為什麼值得看」想清楚。 用五層能力,重新設計 AI 影片學習路徑如果要重新設計一套 AI 影片學習方法,我會把它拆成五層。這五層不是線性課綱,而是每一次製作都可以回頭檢查的順序。 1. Audience:誰會看?先不要急著問「要用哪個工具」,先問: 這支影片是給誰看的? 他現在處於什麼情境? 他為什麼會在這一秒停下來? 他看完之後,應該產生什麼理解或行動? 受眾不是影片完成後才拿來解釋成效的名詞,而是生成腳本與畫面之前的輸入條件。沒有受眾,AI 很容易做出所有人都看得懂、卻沒有人特別想看的內容。 2. Emotion:你要讓他感受到什麼?接著要決定主要情緒:好奇、害怕、爽、笑、驚訝、感動,或是其他更精準的感受。 情緒不是在 Prompt 裡塞幾個形容詞就完成了。你要知道情緒如何逐步發生:開頭先讓觀眾不安,中段讓他以為自己猜到了答案,最後再透過反轉改變理解。這些情緒變化,才是 AI 需要協助你設計的內容。 3. Story:怎麼讓人想知道結局?一支短影音不一定要有複雜劇情,但通常需要清楚的注意力路徑: Hook → 衝突 → 升級 → 反轉 → Payoff 這裡的 Hook 不只是第一句台詞或第一個畫面,而是觀眾願意繼續看下去的理由。衝突讓問題成立,升級讓觀眾不能太早離開,反轉重新安排理解,Payoff 則回收前面的期待。 如果故事本身沒有讓人想知道結局,再漂亮的 AI 畫面也可能只是短暫的視覺展示。 4. Visual:現在才讓 AI 規劃畫面到了這一層,才開始處理場景、角色、構圖、景別、運鏡、光影與視覺效果。 這時候導演知識就會變得很有用,但它的角色是「幫你判斷與溝通」,而不是一道必須先修完的入場考試。 你可以請 AI 根據前面三層提出多個版本,再檢查: 這個畫面是否真的服務情緒? 運鏡是否讓觀眾更接近衝突? 角色在不同鏡頭裡是否仍然一致? 視覺效果是否搶走了故事重點? 如果你想把這一層落成更具體的分鏡工作流,可以參考本站的〈用 AI 快速生成短影音?九宮格分鏡技巧解決人物變形〉。那是一種實作方法,不代表所有 AI 影片都必須使用九宮格。 5. Iteration:生成只是開始最後一層是 Iteration,也就是反覆迭代:生成、挑選、修改、A/B Test,再生成。 很多人把 AI 影片想成「Prompt 寫好,按下生成,作品完成」。但真正的製作能力,往往體現在你能不能看出第一版為什麼不對,並把問題轉成下一輪可執行的調整。 例如: 觀眾沒有停下來,可能是 Hook 不清楚,而不一定是畫質不夠高。 角色看起來不一致,可能需要先固定角色描述與參考素材,而不只是再加更多形容詞。 反轉沒有感覺,可能是前段沒有埋下足夠的期待,而不只是剪接速度太慢。 工具會換,模型會換,按鈕的位置也會換;但觀眾為什麼停下來、為什麼看完、為什麼分享與購買,沒有那麼快改變。 AI 短影音能力,是流量、故事、審美與 AI 的交集如果要重新定義 AI 短影音能力,我會把它寫成: AI 短影音能力 = 網紅的流量感 × 編劇的故事感 × 最低限度的導演審美 × AI 的執行力 你不需要變成 Joeman,也不需要變成電影導演,更不用先花三年把所有影視專業學完。 但你要開始知道: 什麼東西大家會看? 什麼故事大家會想知道結局? 什麼畫面看起來是好的? 什麼樣的節奏能讓人看完? 怎麼把這些意圖交給 AI? 這幾件事組合起來,才是能真正落地的 AI 影片能力。 下一步不只是 Vibe Filming,而是 AI 製片人現在的 AI 製片流程,大概還是: 人 → Prompt → AI → 影片 但再往下一個階段走,我認為可能會變成: 人 → 商業目標 → AI Agent → 完整影片 例如,未來你可能只需要說: 我要賣這盒中秋禮盒,TA 是 30–45 歲女性。請研究近期熱門的送禮短影音,整理爆款影片常見的 Hook,設計三個不同版本。每支 20 秒,前兩秒要能停滑,中間至少出現一次情緒反轉,最後導到 LINE。演員、場景、腳本、分鏡、B-roll、運鏡、音樂、字幕與剪輯節奏,請全部提出規劃。 接下來,Agent 可能協助完成研究爆款、分析模式、寫腳本、做分鏡、生成素材、配音、配樂與剪輯,最後把多個版本交給你比較。這裡描述的是一個未來工作流想像,不是對目前所有工具能力的保證。 到了那一天,人真正重要的工作,可能只剩下一件事:判斷。 這是不是我要的? 這是不是我的品牌? 這是不是我的觀眾會看的? 這是不是能達成我的商業目的? 所以 AI 時代,我們不一定每個人都需要成為導演,但每個人都要開始學會另一個角色:AI 製片人。 傳統導演想的是: 這顆鏡頭我要怎麼拍? AI 製片人想的卻是: 我要什麼結果? 誰會看? 我要讓他產生什麼感覺? 為什麼他會看完? AI,你給我三種最好的做法。 這可能才是 AI 影片真正的 Vibe Filming。 不是你把每一顆鏡頭都想清楚,再命令 AI 忠實執行;而是你知道自己要去哪裡,然後讓 AI 幫你找到更好的路。 結語:真正的差距在於判斷與指揮未來真正拉開差距的,可能不是誰最會下運鏡指令,而是誰最會提出意圖、判斷結果,然後指揮 AI 把作品做到最好。 這也是為什麼 AI 影片素養比「背熟某個工具的按鈕位置」更值得學。當工具與模型不斷更換,你仍然可以從受眾、情緒、故事、視覺與迭代五個層次重新開始。 如果你也在建立更完整的人機協作能力,可以延伸閱讀本站的〈4D Framework:比 Prompt Engineering 更完整的 AI Fluency 框架〉,把「委派、描述、判斷、盡責」的思考方式帶回 AI 影片之外的工作。 常見問答 (FAQ)Q1:學 AI 影片之前,一定要先學完整套導演或攝影專業嗎?不一定。若目標是製作 AI 短影音,應先學會定義受眾、情緒、故事與商業目標,再補足能看懂和判斷畫面的基本導演審美;不需要先把完整影視專業學完才開始創作。 Q2:AI 影片 Prompt 應該寫攝影機指令,還是描述觀眾感受?兩者都可以使用,但建議先描述觀眾、情緒與故事意圖,再依任務需要補充景別、運鏡、角色與畫面限制。這樣 AI 有機會提出多種視覺解法,而不是只照著一張固定施工圖執行。 Q3:為什麼短影音要先做注意力設計,而不是先做分鏡?因為短影音觀眾可能在幾秒內滑走。先規劃停滑、問題、刺激、衝突、反轉與 CTA 等注意力任務,能讓景別、構圖與運鏡服務觀眾留存,而不是只追求畫面漂亮。 Q4:AI Video Literacy 具體包含哪些能力?AI Video Literacy 包含看懂、判斷、指揮與修正四種能力。你要能看出影片哪裡不符合預期、說明問題原因、把意圖交給 AI,並根據結果提出下一輪可執行的修改方向。 Q5:什麼是 AI 製片人?AI 製片人是以商業目標、受眾、情緒與成果為核心,指揮 AI 規劃腳本、分鏡、素材、聲音與剪輯,並負責比較與判斷最終結果的人。他不必親自完成每一個技術步驟,但必須對作品方向與採用結果負責。

  • article-用 Codex 打造 AI 影片工廠:串接六大 AI 能力的完整工作流

    2026/8/14

    AI自動化 AI工具 Codex 影音行銷
    用 Codex 打造 AI 影片工廠:串接六大 AI 能力的完整工作流

    很多人問我:「現在最好用的 AI 影片工具是哪一套?」 我的答案通常是:這個問題問錯了。 真正重要的,不是哪一套工具最厲害,而是你能不能把不同 AI 的能力串成一條穩定的工作流。 現在做影片,已經不像以前一樣,只靠一套剪輯軟體完成所有工作。比較理想的做法,是讓 Codex 這類 AI Coding Agent 擔任總指揮,依照不同任務,自動呼叫適合的模型與工具。 換句話說,Codex 串接的不是工具,而是 AI 的能力(Capabilities)。工具會一直變,模型會一直更新,但能力分工、檔案規格與工作流程,才是真正值得建立的資產。 先換一個問題:你真正要建立的是什麼?如果把影片製作拆開來看,會發現「做一支影片」其實包含許多不同任務:企劃內容、設計畫面、生成鏡頭、組合素材、整理聲音與字幕,最後還要輸出成不同平台需要的版本。 這些任務不一定要由同一個工具完成。更穩定的架構,是先定義每一段需要的能力,再讓 Codex 依序傳遞中間產物。 階段 AI 能力 主要輸出 工具例 1 內容企劃 腳本、分鏡、Prompt ChatGPT 2 視覺生成 人物、場景、商品與 B-roll 圖像 GPT Image、FLUX 3 影片生成 Image to Video、Text to Video 鏡頭 Higgsfield、Seedance 2、Google Veo 4 影片組裝 字幕、動畫、配樂與完整成片 HyperFrames 5 理解與剪輯 逐字稿、精彩片段與社群版剪輯 Whisper、FFmpeg、ChatCut 6 批量生產 不同平台與資料版本的影片 Remotion 這樣的分層有一個重要好處:未來即使替換其中一個模型,也不需要把整條生產線重新設計。 Codex 如何串起整條 AI 影片工作流?整個流程可以想像成一條由中間產物連接的 Pipeline: 1234567891011ChatGPT(腳本企劃) ↓GPT Image/FLUX(圖片生成) ↓Higgsfield/Seedance 2/Google Veo(影片生成) ↓HyperFrames(影片組裝) ↓Whisper/FFmpeg/ChatCut(字幕與剪輯) ↓Remotion(批量輸出) Codex 的角色不是把所有工作都自己做完,而是讀取前一步的成果、判斷下一步需要的能力、整理檔案與指令,並在每個階段保留可檢查的輸出。這種角色比較接近製片人、技術導演與自動化流程管理者的結合。 如果你還不熟悉如何把需求拆成 AI 能理解的任務,也可以先參考GPT-5-Codex Prompting 完全指南,先建立清楚描述目標、限制與輸出格式的習慣。 第一步:建立內容企劃能力影片的第一步不是生影片,而是先把內容想清楚。 Codex 可以先呼叫 ChatGPT,協助完成: 主題發想與受眾分析 市場與內容方向整理 腳本撰寫 分鏡規劃 人物與場景設定 生圖 Prompt 生影片 Prompt 這一階段的重點,是不要只留下聊天視窗裡的一段文字,而是把成果整理成下一階段可以讀取的檔案,例如: 123script.mdstoryboard.jsonprompts/ script.md 可以保存旁白與台詞,storyboard.json 可以描述鏡頭順序、場景與畫面任務,prompts/ 則集中保存圖片與影片生成提示。當格式固定下來,後續換主題或換模型時,就不必從零開始整理。 這一步就像整個影片團隊的企劃與編劇:先決定要說什麼,再決定要怎麼拍、怎麼生成。 第二步:建立視覺生成能力腳本完成後,才開始建立畫面。依照需求,可以生成: 人物形象 場景設計 商品圖片 B-roll 素材 背景素材 GPT Image 與 FLUX 可以作為視覺生成能力的工具例。若影片需要固定角色或品牌視覺,還要額外建立一致的人物設定、服裝、色彩與場景規則,讓每一張圖片都能回到同一套視覺語言。 這一階段相當於美術設計與攝影團隊。重要的不是一次生成一張漂亮圖片,而是讓圖片能夠服務分鏡,並且能在後續影片生成與剪輯階段持續使用。 第三步:建立影片生成能力有了圖片與腳本之後,再交給影片生成模型處理動態鏡頭。常見任務包括: Image to Video Text to Video 廣告運鏡 電影感鏡頭 AI 動畫 不同模型可以依鏡頭需求分工。以這篇文章的工作流示例來看,可以先把 Higgsfield 放在人物運鏡與廣告風格的候選位置,把 Seedance 2 放在電影感或創意鏡頭的候選位置,把 Google Veo 放在高品質影片生成的候選位置。 這不是一份永久不變的模型排名。模型能力、方案與使用限制都會更新,因此比較穩健的做法,是讓 Codex 根據鏡頭類型、角色一致性、畫面風格與當下可用資源選擇模型,而不是把整個流程綁死在單一服務上。 第四步:用 HyperFrames 組裝成真正的影片生成出許多片段,不等於完成一支影片。素材完成後,還需要把內容組裝成有節奏、有品牌識別的成片,例如加入: 字幕 動畫 Logo 配樂 視覺效果 片頭與片尾 HyperFrames 可以被理解成影片組裝引擎,而不只是單純的剪輯工具。它的價值在於能把素材、版面、動畫與時間軸規則整合起來,讓 Codex 可以透過程式與 Skills 參與影片製作流程。 如果專案已安裝相應的官方 Skills,Codex 就能讀取組裝規格,依照腳本與素材產出可重複調整的影片結構。這也讓「改一個標題、換一段素材、調整一個轉場」不必每次都重新手動排版。 第五步:加入影片理解與剪輯能力如果影片工作流還包含真人拍攝素材,Codex 可以再協調 Whisper、FFmpeg 與 ChatCut,處理過去最花時間的剪輯工作: 語音辨識與逐字稿 自動建立字幕 去除停頓 找出精彩片段 合併影片 節奏調整 畫面裁切 輸出社群短影音格式 這裡的關鍵是先讓影片被「理解」,再決定要怎麼剪。逐字稿可以協助找到重點段落,時間軸與音訊資訊則可以交給 FFmpeg 或其他剪輯工具處理,最後再由 ChatCut 等工具完成更細緻的整理。 第六步:用 Remotion 建立批量生產能力當單支影片的流程穩定後,下一步就是把它變成可以重複執行的模板。 Remotion 的優勢,在於可以用程式與資料驅動影片輸出。只要保留固定的版型與動畫規則,再替換標題、圖片、數字、旁白或產品資料,就能產生不同版本的影片。 適合批量生產的內容包括: YouTube 影片 Facebook Reels Instagram Reels TikTok Shorts AI 新聞 排行榜 KPI 報表 商品介紹 每日市場資訊 如果你想深入了解用 React 與 AI Agent 程式化製作影片,也可以延伸閱讀Remotion 與 AI Agent 的程式化影片實戰教學。 批量化的重點不是一次產生很多影片,而是先把輸入資料、模板規則與輸出格式定義清楚。當資料一換就能產生不同版本,影片才真正從「一次性作品」變成「可持續運轉的內容產品」。 如何把工具流程升級成能力流程?要讓這座 AI 影片工廠長期運作,可以先建立三個原則。 1. 為每一段定義輸入與輸出每個階段都應該清楚知道自己接收什麼、產生什麼。例如內容企劃輸出腳本與分鏡,視覺生成讀取分鏡並輸出圖片,影片生成再讀取圖片與鏡頭描述。輸入輸出越清楚,替換工具時越容易。 2. 保留中間產物,不要只保存最後的 MP4腳本、分鏡、Prompt、素材、逐字稿與剪輯設定,都是未來重做與批量生產的重要資產。只留下最後一支影片,就很難追蹤問題,也很難快速產出下一個版本。 3. 先自動化一個瓶頸,再逐步擴充不需要一開始就把六個階段全部自動化。可以先從最耗時的部分開始:沒有內容就先自動化企劃,有真人素材就先處理逐字稿與字幕,已經有固定版型則先導入 Remotion。當單段流程穩定後,再把它接到下一段。 真正該建立的是能力,不是工具很多人一看到新的 AI,就開始問:「要不要換工具?」 但更重要的問題是:你的工作流是否建立在可替換的能力上? 今天影片生成可能是 Seedance 2,明天可能換成另一套更新、更快或更符合預算的模型。如果流程建立在某一套工具的操作介面上,就得跟著工具重新學習;但如果流程建立在以下能力上: 內容企劃能力 視覺生成能力 影片生成能力 影片組裝能力 剪輯能力 批量生產能力 那麼未來只需要替換其中一個模型,整條工作流依然可以持續運作。 這也是 AI 影片工廠真正有價值的地方。AI 不只是幫你做出一支影片,而是幫你建立一座可以持續運轉、持續調整、持續產生內容的生產系統。 你目前最想自動化的是哪一段?是腳本、圖片、影片生成、剪輯,還是整條工作流?歡迎留言分享你的需求,之後也可以再依照不同情境拆解更多實戰案例。 常見問答 (FAQ)Q1:Codex 會直接取代所有 AI 影片工具嗎?不會。Codex 在這條工作流裡比較像總指揮與流程協調者,負責理解任務、整理檔案、呼叫合適的模型與傳遞中間產物;真正負責生成圖片、影片、字幕或動畫的,仍然是各階段對應的模型與工具。 Q2:第一次建立 AI 影片工作流,應該先自動化哪一段?應該先從目前最耗時、最容易重複的瓶頸開始。沒有穩定內容來源,可以先從腳本與分鏡企劃開始;有大量真人素材,可以先自動化逐字稿、字幕與精彩片段整理;已經有固定版型,則可以先用 Remotion 建立批量輸出。 Q3:Higgsfield、Seedance 2 與 Google Veo 要怎麼選?應該依照鏡頭任務、人物一致性、運鏡風格、畫面品質與當下可用的方案來選擇,而不是把某一個模型視為永久最佳答案。本文的工具分工是工作流示例,實際能力與限制仍應以使用當下的官方文件與測試結果為準。 Q4:要不要一開始就把整條影片流程全自動化?不建議。比較穩健的做法是先讓一個階段穩定運作,保留腳本、品牌視覺與成片的人工審核,再逐步把已驗證的規則交給下一階段。這樣能降低錯誤累積,也比較容易找到是哪一段造成品質問題。 Q5:這套工作流可以批量產生不同平台的影片嗎?可以。只要先把版型、資料欄位、字幕規則與輸出格式定義好,就能透過 Remotion 等程式化工具替換內容,產生 YouTube、Reels、TikTok 或 Shorts 等不同版本。不過每個平台的比例、節奏與文字安全區仍應個別設計與驗收。

  • article-MiniMax H3 第三條路:先租 GPU,還是該買 RTX 5090?

    2026/8/14

    AI自動化 AI工具 Codex 影音行銷
    MiniMax H3 第三條路:先租 GPU,還是該買 RTX 5090?

    最近我一直在糾結一個問題: 如果接下來要認真玩 AI 生成影片,我到底要不要買一台地端設備? 原因很簡單。 最近開始研究 MiniMax H3、ComfyUI 這類開源影片生成模型,越研究越覺得有趣。尤其模型開放之後,除了生成影片,也可以自己控制 ComfyUI Workflow、安裝節點、替換模型、調整參數,甚至進一步交給 Codex 這種 AI Coding Agent 自動操作。 問題也跟著來了:硬體怎麼辦? 以我參考的 H3 實測來看,單張 RTX 5090 就能跑起來。聽起來很好,直到查了一下 RTX 5090 的價格…… 嗯。 冷靜。 我只是想生成影片,不是準備開礦場。 後來我才發現,這不一定是「買硬體」和「買平台點數」的二選一。中間還有一條路:租一台需要時才開機的 GPU 電腦。 為什麼想玩 MiniMax H3,卻先卡在硬體?開源影片模型最吸引人的地方,是自由度突然變高: 可以修改 ComfyUI Workflow。 可以選擇不同模型、量化版本與節點。 可以讀取完整 Log,自己找出錯誤原因。 可以把生成流程串進腳本、API 或 Agent 工作流。 但自由度通常也代表環境管理成本。CUDA、PyTorch、顯示卡記憶體、模型檔案、Custom Nodes,每一項都可能成為新的排錯題目。 所以真正要比較的,不只是「哪裡生成一支影片最便宜」,而是: 我需要的是一個幫我生成影片的服務,還是一台可以由我自己控制的 AI 工作站? 第一條路:自己買 RTX 5090,換取完整控制權自己買一台足夠強的電腦,安裝 RTX 5090,再架起 ComfyUI,當然是最自由的方案。 模型放在自己的機器裡,Workflow 自己改,Custom Nodes 想裝多少就裝多少,也不用擔心平台哪一天把某個模型或節點移除。若未來想做: 1Codex → ComfyUI → MiniMax H3 → 自動生成影片 地端設備的控制權確實最高。 買設備真正貴的,不只有顯示卡一張 RTX 5090 還需要足以餵飽它的 CPU、主機板、電源、散熱、記憶體與儲存空間。整套設備的前期成本,很快就不是「買張顯卡玩玩看」的等級。 而且還有一個容易被忽略的問題:你花十幾萬買設備,不代表每天都在生成影片。 可能今天研究 H3 三小時,明天忙著上課,接下來三天根本沒碰。GPU 就坐在那裡發呆,但設備的折舊、電力、維護與佔用空間仍然存在。 如果生成需求已經穩定、每天都會使用,這些固定成本可以被大量工作攤平;如果還在探索階段,買設備就未必是最合理的第一步。 第二條路:使用 LiblibAI,省下環境管理成本我前陣子一直在看 LiblibAI(有些人也會叫它 LibTV)。這種平台最大的優點只有一句話:真的很方便。 不用處理 CUDA,不用自己安裝 PyTorch,不用管理顯示卡記憶體,也不用先下載幾十 GB 的模型。通常只要購買點數、選擇模型、上傳圖片、輸入 Prompt,就可以開始生成。 對一般使用者來說,我仍然很推薦這條路。平台把底層 GPU、模型部署與大部分環境問題包起來,學習成本低很多;如果目標只是「幫我生成一支 H3 影片」,這樣的抽象化非常舒服。 但平台服務和自己的工作站是兩件事LiblibAI 的取捨也很明確: 平台提供什麼模型,基本上就從什麼模型裡選。 Workflow、Custom Nodes 與參數能改到什麼程度,取決於平台開放的範圍。 Log、依賴套件與底層錯誤不一定能完整取得。 如果想讓 Codex 自己安裝節點、修改 Workflow、讀 Log、修錯誤再重跑,會受到平台介面與 API 能力限制。 因此,LiblibAI 比較像是租用一個「AI 影片服務」;你得到的是快速產出,而不是一台完整可控的 GPU 電腦。 第三條路:租用雲端 GPU,保留 ComfyUI 的自由度我看到一篇 MiniMax H3 的實測文章後,才意識到原來還有第三種做法:不買 RTX 5090,而是直接租一張。 作者使用 RunPod 開啟 RTX 5090 GPU 主機,掛上 ComfyUI Template,自己下載 MiniMax H3、安裝節點、查看 Log;用完後直接 Terminate。文章記錄的整個上午帳單是 US$2.07。 RunPod 公開頁面在本文整理時顯示的 RTX 5090 價格約為 US$0.99/小時、32GB VRAM。價格、庫存、區域與方案都可能變動,實際使用時仍應以當下頁面為準。 這種模式的核心概念是: 1234今天要研究 H3 → 開一台 GPU研究三小時 → 依實際使用時間付費Workflow 跑完 → 關機或 Terminate明天沒工作 → 不啟動,就不支付 GPU 運算時間 你仍然要自己處理 ComfyUI、模型、節點與 Workflow,但也因此保留了足夠的控制權。對想把 Codex 接進流程的人來說,這更接近「租一台遠端工作站」,而不是使用一個封裝好的生成按鈕。 買硬體、買點數、租 GPU:差異在哪裡? 比較項目 買 RTX 5090 LiblibAI RunPod/Vast.ai 前期成本 高 低 低 你取得的東西 自己的完整工作站 AI 生成服務 可自行管理的 GPU 主機 ComfyUI 控制 完整 依平台提供 高,依主機與方案而定 自裝節點、替換模型 可以 受平台限制 可以,仍需自己部署 Log 與錯誤排查 完整 受平台限制 通常較完整 Codex 自動控制 很適合 取決於平台 API 很適合 硬體維護 自己處理 不用處理 由供應商處理主機,環境仍由自己管理 不使用時成本 設備仍然持有 依方案與點數規則 GPU 可不用就不開,但儲存等費用需另外確認 新手難度 高 最低 中高 這張表最重要的差異,不是誰的單價最低,而是「你租到什麼」。 LiblibAI 是租 AI 影片服務。 RunPod 或 Vast.ai 是租 GPU 電腦。 RunPod、Vast.ai、SaladCloud,應該怎麼看?RunPod:先把環境與 Workflow 玩熟如果是第一次從平台生成服務轉向自建 ComfyUI,我會先選 RunPod。原因不是它一定最便宜,而是比較符合「開一台機器,自己安裝、自己觀察、自己排錯」的學習方式。 適合先完成這幾件事: 確認 MiniMax H3 在目標 GPU 上能否穩定執行。 把模型、Custom Nodes 與 ComfyUI Workflow 記錄下來。 了解模型載入、生成、輸出與下載各階段的耗時。 讓 Codex 能透過腳本或遠端指令執行固定流程。 Vast.ai:更像 GPU 版的 AirbnbVast.ai 的特色是 GPU Marketplace,價格會受到供需、主機狀態、地區與租用方式影響。RTX 5090、4090、A100、H100 等不同規格,都可能在市場上找到可租用的主機。 它的彈性與價格可能很吸引人,但選擇主機時需要更仔細檢查 VRAM、磁碟、網路、映像檔、持久化方式與實際可用性。 SaladCloud:價格低,但更適合標準化的容器工作負載原文整理的公開資訊中,SaladCloud 的 Batch RTX 5090 價格約為 US$0.25~0.294/小時,比 RunPod 公開價格低很多。 不過,價格不能單獨拿來比較。SaladCloud 比較偏向 Container 化的工作負載,不一定適合第一次研究 ComfyUI 時,想登入一台機器慢慢安裝節點、看 Log、修改環境的情境。 我的順序會是: 12345先用 RunPod 熟悉環境 ↓再用 Vast.ai 比較不同 GPU 市場 ↓Workflow 與部署容器化後,再研究 SaladCloud Codex、ComfyUI 與 H3,可以組成什麼工作流?這件事情真正讓我興奮的,不只是省下幾美元,而是 GPU 運算可以和 Agent 工作流接在一起。 例如一支 60 秒影片,可以先由 Codex 協助拆解: 1234567891011121360 秒影片 ↓拆成 4 個 15 秒 Segment ↓每個 Segment 包含 3 個 Shot ↓MiniMax H3 生成 4 段影片 ↓FFmpeg 自動合併 ↓字幕/配音/BGM ↓完成 在這個流程裡,Codex 可以負責規劃與執行腳本,ComfyUI 負責節點式生成,雲端 GPU 負責短時間的大量運算,最後再把影片抓回本機完成後製。 本機的 Mac 不需要一直負責暴力運算,只要負責指揮與驗收即可。 多鏡頭 Prompt:減少人力審片,不代表可以省略驗收原文實測提到,作者原本以為 H3 的 15 秒長影片很容易自己亂切鏡,但在 Prompt 裡加入明確的時間與鏡頭標記後,模型曾按照指定時間切換鏡頭: 12345678[Shot A] At 00:00.000桌腳低角度,空鏡[Shot B] At 00:05.000切到整個房間的大遠景[Shot C] At 00:10.000切回桌腳特寫 這個結果很值得研究,因為它代表一支 15 秒影片不一定只能服務一個鏡頭。理論上,原本的: 15 秒 × 12 次生成 可能改成: 115 秒 × 4 次生成,每次包含 3 顆鏡頭 GPU 運算量不一定比較少,甚至可能更多;但人只需要先審 4 個 Segment,而不是 12 個短片段。 這裡仍要保留一個重要前提:時間標記是值得測試的 Prompt 策略,不代表每次生成都能完全照做。正式交付前,還是要檢查鏡頭切換、角色連貫性、動作與音畫同步。 用運算時間粗估 AI 影片的邊際成本假設一支 15 秒影片的生成時間約 5 分鐘,RunPod GPU 價格以 US$0.99/小時粗估: 1235 分鐘 ÷ 60 × US$0.99≈ US$0.0825≈ US$0.08 也就是說,在「GPU 持續運算、只計算 GPU 時間」的理論模型裡,一小時大約可以跑 12 支 15 秒影片,一支影片的 GPU 運算成本約為 US$0.08。 若用原文整理的 SaladCloud Batch 價格區間估算: 125 分鐘 ÷ 60 × US$0.25~0.294≈ US$0.021~0.0245 但這些都不是完整製作成本,至少還要納入: 啟動主機與載入模型的時間。 Prompt 測試與失敗重跑。 模型下載、磁碟與持久化儲存。 上傳、下載與網路流量。 GPU 閒置但仍在計費的時間。 人工審片、剪輯、字幕、配音與配樂。 這個粗估的價值,不是宣稱每支影片只要幾美分,而是讓人看見:當 Workflow 固定下來後,真正需要優化的可能是「讓 GPU 不要等待」以及「讓人不要陪著 GPU 等待」。 三種方案,分別適合什麼人?完全不想碰技術:選 LiblibAI如果只想快速生成內容,不想處理 CUDA、模型、節點和環境依賴,LiblibAI 這類平台會是最省時間的選擇。你付費購買的是便利性與整合好的生成服務。 每天大量生成,而且需求已經穩定:計算是否值得買地端如果每天都要生成、Workflow 長期固定,而且設備會持續使用,地端 RTX 5090 才有機會透過高使用率攤平前期成本。這時候還要把電力、維護、升級與設備折舊納入計算。 想玩最新開源模型,又想讓 Codex 控制流程:先租 GPU如果和我一樣,想自己改 ComfyUI、安裝節點、替換模型、讀 Log,也不想一開始就投入十幾萬買設備,RunPod 會是一個合理的起點。 等 Workflow、Prompt、模型版本與部署方式都穩定後,再比較 Vast.ai 或 SaladCloud,甚至重新計算是否值得購買地端設備。 我的結論:先租 GPU,再決定要不要買設備我現在對這三條路的理解很簡單: LiblibAI:租用 AI 影片服務,最省環境管理時間。 RunPod/Vast.ai:租用 GPU 電腦,保留 ComfyUI 與 Workflow 的控制權。 地端 RTX 5090:購買長期使用的 AI 工作站,固定成本高但自由度最高。 所以,如果只是偶爾研究模型,我不會急著買 RTX 5090。我會先租 GPU,把完整工作流跑通,並記錄實際的 GPU 使用時間、模型載入時間、失敗重跑比例、儲存費與人工審片時間。 半年後如果真的每天大量生成,再用這些真實數據回頭計算買設備是否划算;如果新模型需要更大的 VRAM,也可以直接更換租用的 GPU,不需要賣二手顯卡、升級電源、換主機板或處理散熱。 我最喜歡這個模式的地方是:把昂貴的 GPU,變成需要時才叫來上班的臨時 AI 員工。 當 ComfyUI Workflow、Prompt、模型與 Codex 自動化都整理好之後,AI 影片製作就不再只是「使用一個 AI 工具」,而可能變成一條可以由 Agent 自動執行的生產線。 真正值得期待的,也許不只是生成一支影片便宜多少,而是 GPU 可以自己跑,人不用陪它跑。 延伸閱讀 Qwen-Image-Edit 入門教學:不用安裝也能輕鬆玩轉 AI 圖像編輯:先從線上工具理解模型與 ComfyUI 的差異。 AI 工具名詞全解析:一次搞懂 MCP、Skill 與 CLI 的差異與應用場景:理解 AI Agent 如何透過不同工具執行工作。 參考資料與價格提醒 MiniMax H3 第三條路|原文實測 RunPod|RTX 5090 GPU LiblibAI|AI 生成/ComfyUI 平台 Vast.ai|GPU Marketplace SaladCloud|Container/GPU 運算 本文中的價格、GPU 規格、生成時間與成本試算,都是根據提供的原文實測與公開頁面資訊整理。雲端 GPU 價格、庫存、方案、儲存與流量費用會隨時間和使用條件變動,實際使用前請以各平台當下公告為準。 常見問答 (FAQ)Q1:想玩 MiniMax H3,一定要先買 RTX 5090 嗎?不一定。如果目前仍在研究模型、測試 Workflow,或每週只使用幾個小時,可以先租用雲端 GPU;只有在生成量穩定、長期高使用率時,才值得進一步計算購買地端設備的回本時間。 Q2:LiblibAI 和 RunPod 的本質差異是什麼?LiblibAI 比較像租用整合好的 AI 影片服務;RunPod 則比較像租用一台 GPU 電腦。前者省去環境管理,後者保留 ComfyUI、模型、節點與 Log 的較高控制權。 Q3:租用雲端 GPU 後,就完全不需要處理技術設定了嗎?不是。租用 GPU 可以省下購買與維護實體硬體,但你通常仍要處理 ComfyUI、模型下載、Custom Nodes、Workflow、依賴套件、儲存空間與錯誤排查。它的難度低於自行購買整台工作站,但高於直接使用點數平台。 Q4:一支 15 秒影片約 US$0.08,是否就是完整製作成本?不是。US$0.08 只是以 5 分鐘生成時間和 US$0.99/小時 GPU 價格計算的純運算時間粗估,尚未包含模型載入、失敗重跑、儲存、網路流量、GPU 閒置與人工後製成本。 Q5:為什麼把 60 秒影片拆成 4 段 15 秒,而不是生成 12 段 5 秒?在某些能理解時間與鏡頭標記的模型中,15 秒片段可以嘗試包含多個 Shot,讓人先審 4 個 Segment,而不是 12 個短片段。這可能降低人工審片數量,但不保證運算量更少,也仍需要檢查鏡頭切換與內容連貫性。

  • article-用 Google Gemini 當剪輯助手:6 個提示詞,讓剪輯從苦力變策略,一天出 4 支成片

    2026/3/3

    內容行銷 影音行銷 Gemini
    用 Google Gemini 當剪輯助手:6 個提示詞,讓剪輯從苦力變策略,一天出 4 支成片

    还在一帧一帧手剪视频?把 Google Gemini 当剪辑助手,一天直接出 4 条成片。下面这 6 个提示词,把剪辑从“苦力活”,变成“策略活”👇— 摆烂程序媛 (@wanerfu) March 1, 2026 靈感整理自 X 貼文:https://x.com/i/status/2027958008026972389 剪片最耗的不是「會不會剪」,而是:找重點、想節奏、對齊風格、反覆調整。把這些「腦力活」交給 Google Gemini,你就能把時間留給真正值錢的部分:審美、決策、把關。 這篇整理 6 個提示詞(Prompt),你可以照順序走一輪,把剪輯從苦力活升級成策略活,產出速度會明顯拉起來。 核心觀念:AI 做策略大腦,人做美感總監 AI 擅長:拆結構、拆敘事、列節奏、找切點、補 B-roll、建議參數 人擅長:選鏡頭、品味判斷、節奏微調、情緒拿捏、最後一哩路的「好看」 你會更像導演/製片,而不是時間軸工人。 使用方式:一支片的 6 步工作流 先用「剪輯計畫」把整支片的節奏藍圖定好 用「風格匹配」把爆款節奏模型對齊 用「敘事提升」把腳本剪得更順更有衝擊 用「技術調整」定輸出參數避免畫質翻車 用「素材審查」從原始素材抓亮點與弱點 用「剪輯回饋」當第二雙眼睛做 QA 1)剪輯計畫:先做藍圖,不要邊剪邊想用途:像專業剪輯師先做「剪輯大綱」,包含節奏、切割點、B 素材、轉場設計,目標是維持注意力。 提示詞: 12345678910你是專業影片剪輯師。請審查以下素材描述,制定「精準剪輯計畫」,包含:1) 整體節奏(快/慢、段落長度、注意力鉤子)2) 關鍵切割點(哪些句子/畫面要切、為什麼)3) B-roll 規劃(需要哪些補畫面、放在哪裡)4) 轉場與視覺節奏(硬切/轉場/推拉/節奏點)5) 字幕與重點文字(哪些字要放大、哪些要上屏)目標:保持觀眾注意力,避免分心與拖沓。素材描述:[貼上素材描述/時間軸摘要/重點段落] 2)風格匹配:拆解參考影片,複製「節奏模型」 用途:你不是在抄內容,而是在複製「剪輯語法」:切割密度、節奏、字幕、音效、色調。 提示詞: 1234567891011121314151617你是專業影片剪輯師。請分析以下參考影片的剪輯風格,並拆解成可複製的規則:- 切割密度:平均幾秒一切?什麼時候加速?- 時序:先結論後鋪陳?還是故事推進?- 調色:整體偏暖/偏冷?對比與飽和大概落點?- 音效:哪些地方加強節奏?轉場音效用法?- 文字:字幕樣式、關鍵字上屏策略、資訊密度最後,請把這套規則「套用到」我的主題,給我具體剪輯建議與段落安排。我的主題:[主題一句話 / 影片目的]參考影片連結(或描述):[貼上連結/貼上描述]我的素材概況:[拍攝場景、人物、鏡頭類型、長度、重點] 3)敘事提升:讓資訊更清楚、情緒更有力 用途:把「講得完」變「想看完」。AI 很會抓:冗詞、順序、重點句、情緒落點。 提示詞: 123456789101112你是內容導演 + 剪輯總監。請審查以下腳本,提出「剪輯層面」的敘事優化建議:- 哪些段落應刪除(理由:重複/無推進/無價值)- 哪些段落應重排(理由:理解成本/張力/節奏)- 哪些句子要強調(可做:放大字、停頓、B-roll、音效)- 開頭 3 秒鉤子怎麼做更強- 結尾怎麼收才會讓人想收藏/留言/轉發目標觀眾:[觀眾輪廓/痛點/想解決的事]腳本:[貼上腳本全文] 4)技術調整:輸出設定不要再靠猜 用途:不同平台、不同風格,輸出參數差很多。先定好,避免畫面糊、聲音炸、被平台壓縮。 提示詞: 12345678910111213141516請根據以下「平台」與「風格」,建議最佳輸出設定,並給出你推薦的原因:- 解析度與比例(例如 9:16 / 16:9)- 幀率(FPS)- 位元率(Bitrate)- 編碼(H.264/H.265 等)- 音訊(取樣率、位元率、響度建議)- 字幕安全區與清晰度注意事項平台:[YouTube / IG Reels / TikTok / B 站 / 小紅書...]影片風格:[教學 / Vlog / 訪談 / 口播 / 產品展示...]素材規格(若知道):[原始解析度/幀率/相機或手機型號] 5)素材審查:先找亮點與弱點,再開始剪 用途:把「挑鏡頭、找精華」交給 AI,特別適合一堆長素材、訪談、口播、活動紀錄。 提示詞: 1234567891011請以「剪輯師審素材」的角度,根據以下素材描述/時間碼筆記,給我:1) 精彩片段候選(為什麼精彩、適合放哪)2) 弱點與需要避開的段落(拖、贅、雜音、重複)3) 建議切割點與節奏(哪裡該快剪、哪裡該停)4) 建議補的 B-roll 清單(具體到畫面類型)5) 建議的成片結構(段落順序)目標:乾淨、專業、有節奏、有重點。素材描述/時間碼筆記:[貼上你的紀錄,例如 00:00-01:20 介紹、01:20-02:10 亮點...] 6)剪輯回饋:把 Gemini 當第二雙眼睛做 QA 用途:你剪完常會「看久了看不出問題」。讓 AI 針對節奏、音訊、調色、清晰度給修改清單。 提示詞: 12345678910111213請以「成片檢查」角度,評估我這支已剪影片,並提出可執行的修改建議:- 節奏:哪裡太慢/太快、什麼點應更早切- 流暢:段落銜接是否順、是否缺關鍵資訊- 音訊:人聲是否清楚、背景音是否干擾、音量是否一致- 調色:是否一致、是否過暗/過飽和- 清晰:字幕是否易讀、資訊密度是否過高最後給我「優先順序」:哪些改動最划算、效果最大。影片目標與平台:[平台/目標,例如提高完播或導流]影片時間軸摘要(或你自寫的版本紀錄):[例如:00:00 鉤子、00:03 結論、00:10 解法...] 加速小技巧:讓 AI 回答更準的 3 個輸入你提供的「素材描述」越具體,回覆越像你的專屬剪輯師: 1. 一句話目標:這支片要讓觀眾看完做什麼?(收藏/留言/點連結/買單) 2. 受眾輪廓:新手/進階/專業?痛點是什麼? 3. 時間碼筆記:不需要逐字稿,有「段落 + 時間」就很夠用 結語:你把時間花在哪裡,就會變成什麼樣的剪輯師 當 AI 幫你把策略、結構、節奏先打底,你就能把力氣用在「更像作品」的地方:更準的鏡頭、更漂亮的節奏、更好的品味、更一致的整體感。

  • article-用 AI 快速生成短影音?九宮格分鏡技巧解決人物變形

    2026/3/3

    影音行銷 Gemini
    用 AI 快速生成短影音?九宮格分鏡技巧解決人物變形

    大家好,我是享哥。現在用 AI 已經可以快速生成令人驚豔的短影片!今天這篇教學,我將詳細分享如何透過「九宮格圖片生成法」,一次產出連貫且人物一致的分鏡,並結合 Grok 等 AI 工具,快速製作出高畫質的短影音。 核心概念:為什麼要用「九宮格」生成分鏡?製作 AI 短影片要流暢,最怕遇到人物特徵或風格中途跑掉。我們核心的做法是一次生成一個九宮格的完整圖片。 給 AI 一個完整故事後,透過分鏡圖片一次生成九張,不僅能確保內容結構的完整性,人物也比較不會發生改變。這個技巧能幫我們省去大量反覆微調人物一致性的時間。 AI 影片生成 4 步實戰工作流第一步:請 AI 構思短影音與分鏡腳本萬事起頭難,首先我們要給 AI 一個方向。你可以請 AI(例如 Gemini)幫忙想一個一分鐘的短影音故事腳本。 以「金融槓桿小惡魔講解川普關稅政策」為例,先讓 AI 生成基礎故事,你可以與它反覆討論、修改並調整出想要的內容。確認內容後,再根據腳本,請 AI 規劃九張分鏡圖片的腳本,必須明確指出每個畫面的: 畫面內容 鏡頭語言與視覺效果 腳本關鍵對白 第二步:生成 3x3 九宮格圖片與 Grok 提示詞有了分鏡腳本,接下來就需要將文字具象化為畫面。請根據腳本內容,讓 AI 生成一張完整的九宮格圖片。建議的設定參數如下: 1234- 圖片佈局:九宮格 3x3 格式- 圖片比例:16:9 (若要做直式短影音可改為 9:16)- 圖片限制:畫面中絕對不要包含任何文字- 畫面解析度:4K (為了盡量提升生成圖片的細節) 目前這類生成的完整圖片尺寸大約是 2752 x 1536,做為後續短影片分割的素材已經相當夠用。同時,記得請 AI 將剛才的分鏡腳本,轉換為 Grok 格式的影片生成提示詞(包含中英文提示詞、運鏡動作與對白),為下一步做準備。 第三步:利用工具進行圖片分割拿到九宮格圖片後,我們需要將其裁切成九張獨立的圖。 在開始做第一張影片之前,你可以直接使用我製作的小工具——九宮格圖片分割工具。只要將生成的九宮格圖片丟進工具中,它就能幫你快速分割,讓你一鍵將九張獨立的分鏡圖全部下載下來。 九宮格圖片分割工具 第四步:使用 Grok 進行動態影片生成因為我們是採取「單張圖片轉影片」的模式,不一定要使用即夢或是可靈等具備高階首尾幀技術的影片生成工具,Grok 就是一個非常合適且強大的選擇。 進入 Grok 後,依照順序將分割好的單張圖片上傳,並把第二步準備好的「中文提示詞與對白」丟上去,Grok 就可以直接開始生成影片。 畫質提升關鍵:Grok 影片升級與下載技巧影片生成後,旁邊會有一個下載按鈕,但下載前請特別注意這個細節! 在還沒有點擊任何設定前,直接下載的影片大概都只有 480p 的一般畫質。請務必點擊畫面上的「升級影片」選項,將影片升級為 HD 畫質。 12- 一般畫質:480p- HD 畫質:解析度將提升至 1504 x 832 升級為 HD 後再下載,能夠大幅彌補原本單張圖片裁切後解析度的不足,讓最終成品的視覺體驗更好。 後期剪輯與應用場景將九段高畫質 (HD) 的影片片段都下載下來後,就可以丟入剪輯軟體中進行最後處理。你可以篩選最好的片段、加上字幕、添加音效特效,或是利用變速的方式去做節奏管理。剪輯完成後,就會是一支極具質感的 AI 短影片。 AI 影片的時代已經來臨!我們如何透過這些 AI 應用工具,以前所未有的速度完成從「文字變圖片、圖片變影片」的工作流,並將內容成功渲染出去,不管是對自媒體經營還是電商行銷,都是一個非常強大的槓桿。 常見問答 (FAQ)Q1:為什麼做 AI 短影音時,要先生成九宮格分鏡圖,而不是一張一張單獨生成?因為一次生成同一組九個畫面,角色外型、服裝、風格與場景調性通常會更一致。若分開逐張生成,很容易出現人物臉型改變、色調跑掉或鏡頭風格不連續的問題,後面剪輯時會更難處理。 Q2:九宮格圖片一定要做成 16:9 嗎?直式短影音怎麼辦?不一定。如果你的內容主要發布在 YouTube Shorts、Instagram Reels 或 TikTok,建議一開始就改成 9:16 構圖;如果想同時兼顧橫式與直式版本,可以先明確告訴 AI 你的輸出平台,再決定九宮格整體比例,避免後續裁切時把主體切掉。 Q3:用 Grok 做圖片轉影片時,提示詞要寫得多細?越具體越好。至少要包含畫面主體、人物動作、鏡頭運動、情緒氛圍與台詞內容。若只給一句很簡短的描述,生成結果通常會偏隨機;把每格分鏡的鏡頭語言與對白先寫清楚,影片的可控性會高很多。 Q4:九宮格分割後的單張圖片解析度會不會不夠?有可能,所以文章裡才會特別建議先用 4K 九宮格圖片,並在 Grok 生成完成後記得升級成 HD 再下載。這兩個步驟能有效減少分割後單張圖片細節不足的問題,讓最後串接起來的影片看起來更穩定。 Q5:這套工作流適合哪些人使用?很適合自媒體創作者、短影音操盤手、課程講師、品牌行銷人員與電商團隊。只要你常常需要把一個觀點快速變成有角色、有節奏的短影片,這種「先分鏡、再分割、再逐格生影片」的方法,會比從零硬做整支影片更省時間。 希望以上的實戰分享對大家有幫助,想了解更多 AI 應用,歡迎關注我、訂閱我,謝謝大家!

  • article-如何使用 Remotion 與 AI 自動化生成科普短影音:喵喵經濟學人

    2026/3/2

    AI自動化 影音行銷 Remotion
    如何使用 Remotion 與 AI 自動化生成科普短影音:喵喵經濟學人

    Hello 我是享哥。今天要跟大家分享一套強大的自動化影音工具——Remotion。 如果你還不會安裝 Remotion,非常推薦直接將它的官方網站網址丟給 AI 助手,請 AI 提供安裝指令,就能輕鬆完成基礎環境的建置。 什麼是喵喵經濟學人?解析自動化短影音工作流在環境安裝完畢後,今天要為大家測試網路上討論度極高的專案:「喵喵經濟學人」。 這是一個專門用於自動化製作 9:16 火柴人風格短影片的工具,特別適合用來做心理學與經濟學的科普。它提供了一套非常完整的標準化工作流,涵蓋了以下核心環節: 腳本撰寫 配音生成 畫面繪製 Remotion 影片最終合成 也就是說,只要餵給它故事腳本,系統就能自動生成對應的圖片、文字內容與配音,並一鍵合成完整的短影音。你還能在核心參數中,彈性設定喜歡的音色與圖片風格。 實戰教學:如何用 AI 生成一分鐘經濟學短片?接下來,我將實際演示如何請 AI 產出一支一分鐘的短影音。這支影片的內容,是透過「喵喵經濟學人」來解析美國與以色列對抗伊朗的事件,會如何影響世界經濟。 步驟一:設定故事核心與隱喻腳本首先,我們來到 Antigravity 介面,輸入指令:「Create video 一分鐘短影片,內容是喵喵經濟學人講解美國和以色列攻打伊朗,對於世界經濟的影響」。 系統會開始引用對應的 Skill(記得事前需要先建立好一個 Skill 來引用)。接著,它會根據設定好的核心主題進行創作。為了讓科普內容更生動,系統大量使用了隱喻的方式來呈現國際衝突: 沙漠悍貓國:代表以色列 波斯貓國:代表伊朗 黑色的魚油:代表石油 罐罐通膨與貓薄荷:代表經濟與物價影響 步驟二:API 替代方案與自動生成在語音生成的部分,系統預設使用的是 Minimax 的 API。但因為我目前沒有提供該 API,所以我改用 Edge TTS 來作為語音替代方案,並完成相關的基礎設定。 當 Plan 與 Task 都設定完畢後,系統就會進入生成與處理階段。處理完成後,程式會在 Out 資料夾中將圖片與影片進行完整合成,最終輸出一支完整的短片。 常見問題與解決方案:遇到「全紫畫面」怎麼辦?在自動化生成的過程中,難免會遇到一些突發狀況。 舉例來說,我第一次生成時,合成出的影片竟然是「全紫色」且完全沒有圖片。遇到這種情況我們應該怎麼辦呢? 因為我是使用 Gemini 模型,我的解法是請模型利用 nano banana 去生成影片所需的相關圖片。雖然這個方法沒有辦法一次並行生成所有圖片,系統必須一張一張慢慢排程製作,過程中偶爾也會遇到失敗的情況;但只要耐心等待,它最終會慢慢把腳本裡所有的圖片素材逐一產出。將素材補齊後,就可以順利合併成最終的影片了。 結語以上就是透過 Remotion 程式,串接 AI 自動生成與剪輯影片的完整過程。 今天就跟大家分享介紹到這邊,影片最後我會放上成品給大家參考,有需要的朋友可以繼續往後觀看。想要了解更多 AI 自動化實用工具與工作流應用,歡迎關注並且訂閱我,謝謝大家今天的收看與支持!

  • article-Remotion × AI Agent:用 React 與 AI 程式化製作影片的完整實戰教學

    2026/1/23

    AI Agent 影音行銷 Remotion
    Remotion × AI Agent:用 React 與 AI 程式化製作影片的完整實戰教學

    做影片很累,傳統剪輯軟體又貴又花時間。你可能以為想做出好影片,非得精通 Premiere 或 Final Cut 不可。其實不用,現在的趨勢是「用程式碼做影片」。 Remotion 這個工具,讓你可以用寫 React 的方式「編譯」出 MP4。加上最新的 AI Agent 技術,甚至連程式碼都不用自己寫。只要一句話,系統自動幫你把影片「算」出來。 用程式寫影片的底層邏輯Remotion 的核心理念叫做「Make videos programmatically」。這聽起來很硬核,但邏輯其實很性感。它把影片的每一幀,都變成了可控的程式碼參數。 以前你需要用滑鼠在時間軸上拉來拉去,還要對齊到崩潰。現在透過 API,你可以精準控制像素的運動。這不僅是工具的轉換,更是生產力的槓桿。 關鍵在於它最近推出的 Agent Skills 功能。這讓 Claude 或 GPT-4 這樣的 AI 模型,能夠讀懂 Remotion 的操作手冊。AI 不再只是瞎猜,而是拿著說明書在幫你蓋房子。 環境建置的關鍵細節開始之前,先在桌面建個資料夾,打開終端機。輸入以下指令初始化專案: 12npx create-video@latest 這一步很簡單,但接下來的選項決定成敗。系統會問你一連串設定: Template: 選 Blank TailwindCSS: 建議選 Yes Add Agent Skills: **請務必、絕對要選 Yes** 這不是選配,這是讓 AI 能夠自動寫作的靈魂。選了它,專案裡才會下載給 AI 看的文檔與技能樹。沒選這個,AI 寫出來的程式碼大概率跑不動。 讓 AI 接手繁瑣工作安裝完依賴套件並啟動開發伺服器後,你會看到瀏覽器跳出預覽畫面。這時,請打開支援 AI 的編輯器(如 Antigravity 或 Cursor)。我們準備開始下指令。 直接在對話框輸入你的需求,模型建議選擇邏輯較強的 Claude 4.5 Sonnet: 「幫我做一支 10 秒介紹 n8n 的短影片,內容要酷炫。」 AI 會先讀取專案裡的 SKILL.md,理解它能做什麼。接著它會規劃場景、設計動畫,然後直接修改 Root.tsx。它會自己寫 Component,自己加 Fade in/out 效果,甚至自己除錯。 反直覺的效率優勢你可能覺得寫程式做影片很反直覺。但當你想要微調字體大小,或是想統一所有轉場的速度時,改一行程式碼,比在傳統軟體軌道上一個個點開調整快太多了。 這就是「可程式化」的降維打擊。範例中,AI 自動生成了包含 Logo 動畫與卡片介紹的 9 秒影片。如果不滿意,只要動動嘴(Prompt)或動動手指(Code)微調即可。 確認無誤後,輸入渲染指令: 12npx remotion render AI 通常連這行指令都會幫你準備好。按下 Enter,一個真實的 MP4 檔案就會出現在輸出資料夾。 60/40 的人機協作法則別指望 AI 一次給你 100% 的完美成品,那是不切實際的幻想。聰明的做法是讓 AI 搞定 60% 的苦工。讓它完成架構搭建、基礎動畫邏輯與素材佔位。 剩下的 **40%**,靠你的人類美感去微調程式碼。這種工作流比從零開始剪輯快,又比全靠 AI 抽卡精準。這才是 Remotion 結合 Agent 的真正威力。

  • article-AI 影片字幕工作流:結合 Gemini 與剪映的極速上字幕教學

    2025/12/9

    AI自動化 影音行銷 Gemini
    AI 影片字幕工作流:結合 Gemini 與剪映的極速上字幕教學

    這套流程解決了影片創作者在製作字幕時的三個核心問題: 專業術語準確率:確保 GenAI、LLM、Python 等詞彙不被聽錯。 閱讀體驗優化:自動加中英空格、去除口語贅詞(然後、那個)、符合人眼閱讀的斷句。 極速同步:利用「文稿匹配」功能,免去手動對時間軸的繁瑣過程。 🛠️ 準備工具 剪映 / CapCut 電腦版 Google AI Studio (網頁版,建議使用 Gemini 3 Pro 模型,免費且 Token 上限極高) 步驟一:音頻導出在剪映/CapCut 完成剪輯後,先不要上字幕,執行以下操作: 點選 導出。 僅勾選 「音頻導出」 (格式選 MP3 或 AAC 即可)。 💡 優化點: 處理長影片(超過 30 分鐘)時,建議每 15-20 分鐘切一段導出,避免剪映免費版「文稿匹配」的字數限制。 步驟二:AI 聽寫與校正這是最關鍵的一步。我們不只是要「轉錄」,更是要讓 AI 幫我們「潤飾」。 前往 Google AI Studio。 模型選擇 Gemini 3 Pro。 將導出的 MP3 檔案拖入對話框。 輸入下方的 【提示詞】: AI 影片字幕提示詞 為什麼這樣設計? Step 1 術語確認:把 “Notion” 聽成 “Nation” 是不專業的。先讓 AI 問你,只需 30 秒確認,就能保證後面 100% 正確。 斷句控制(優化點):手機直式影片(Reels/Shorts)字幕不宜過長,提示詞中已加入控制,確保閱讀體驗。 💡 使用小撇步 遇到極短音頻(< 3分鐘):Gemini 通常會很有自信,它會直接跳過 Step 1 給您全文,達到「秒出」的效果。 遇到新專案/新主題:如果你這支影片是講一個全新的工具(例如突然要講 “Cursor” 編輯器),您在貼上 Prompt 之後,可以順手在 # Context & Vocabulary 那邊補上 “Cursor” 這個字,這樣一次就會準。 關於「文稿匹配」:複製 AI 輸出的文字後,在剪映中選擇「文稿匹配」時,記得檢查一下第一句是否對齊。只要第一句對了,後面通常 99% 都是準的。 您可以現在就拿一段最近錄製的音檔(或上面那支 YouTube 影片的音頻)去 Google AI Studio 試跑一次,看看效果是否符合您的期待! 步驟三:極速匹配拿到 AI 生成的完美文本後: 複製 AI 輸出的全部文字。 回到 剪映 / CapCut。 點擊 「文本」 -> 「智能文本」 -> 「文稿匹配」。 貼上文字,點擊「開始匹配」。 實測結果: 99% 準確的字幕會自動對齊音軌。 🌟 進階場景分流根據您不同的產出需求,這裡提供兩個分支技巧: 場景 A:製作「雙語字幕」短影音如果您想做像國外科技博主那種中英雙語字幕: AI 生成 SRT:在 Google AI Studio 完成中文稿後,多加一道指令: 「請將上述內容翻譯成英文,並將兩者合併為 SRT 格式(第一行為中文,第二行為英文)。」 導入剪映:將 AI 生成的代碼存為 .srt 檔,直接拖入剪映。 場景 B:超長課程影片 (>30min)剪映的「文稿匹配」有時對長文本不穩定。 分段處理:如筆記所述,將音頻切成 10-15 分鐘一段。 SRT 暴力解法:如果不想分段,直接請 Gemini 輸出「帶時間軸的 SRT 格式」。 Prompt 補充指令:「請直接輸出 SRT 字幕格式,不需要與我確認術語。」 雖然 Gemini 的時間軸不如專門軟體(如 Whisper)精準到毫秒,但對於說話清晰的教學影片通常夠用,導入後只需微調。 參考文章: AI 字幕工作流完整教學/提示詞 秒殺剪映的AI字幕工作流!准確率高達99%,完全免費!