跳到主要內容

部落格

不定期分享最新資訊文章

  • article-我覺得 VoiceStudio 最值得注意的地方,根本不是免費

    2026/9/15

    AI自動化 AI工具 影音行銷
    我覺得 VoiceStudio 最值得注意的地方,根本不是免費

    最近看到一套開源 AI 語音工具 VoiceStudio。 它可以在自己的電腦執行,支援 TTS、語音複製、多角色語音與影片配音,也不需要每個月再付一筆訂閱費。 看到這裡,很多人的第一個反應可能是: 那我是不是可以不用訂 ElevenLabs 了? 但我研究完之後,反而覺得「免費」可能是這套工具最不重要的地方。 真正讓我感興趣的是另外一件事情: AI 配音,正在從一個「工具」,變成 AI 工作流裡的一個「節點」。 本文談的是我對 VoiceStudio 與本地語音工作流的觀察,不是對不同語音服務的固定排名。實際功能、模型支援、硬體需求與授權方式,都應以當下的專案文件與模型授權條款為準。 我們現在用 AI,其實還是在「操作軟體」想一下現在大部分人怎麼做 AI 影片。 先叫 ChatGPT 寫腳本。 複製文字。 打開配音網站。 貼上文字。 選聲音。 按生成。 下載音檔。 再打開剪輯軟體。 匯入音訊、對字幕、找 B-roll、剪輯、輸出。 看起來整個流程用了很多 AI,但其實中間有一個很重要的角色一直沒有消失: 你。 你還是那個負責把 A 工具的結果複製到 B 工具,再把 B 工具的結果下載下來丟進 C 工具的人。 換句話說,AI 很厲害,但你還是一個「AI 工具操作員」。 這也是我之前思考 AI 影片工廠時,會把腳本、配音、字幕、素材與剪輯拆成不同能力的原因。可以先參考用 Codex 打造 AI 影片工廠:串接六大 AI 能力的完整工作流,影片工廠真正要處理的,不只是多找到幾個好用工具,而是讓每個能力可以被下一個步驟穩定接住。 真正的改變,是你連 VoiceStudio 都不用打開VoiceStudio 讓我感興趣的,不只是它可以在本地執行。 而是這類工具開始提供 API、MCP 之類可以讓其他程式直接呼叫的介面。 這件事情看起來很工程師,對內容創作者其實非常重要。 因為當一個 AI 工具可以被程式呼叫之後,「人」就不一定要站在中間了。 例如我最近一直在研究 AI 自動剪輯。 理想中的流程不是: 1我打開 ChatGPT → 打開配音軟體 → 打開剪輯軟體 而是: 1234567891011121314151617文章完成 ↓AI 自動整理成短影音腳本 ↓自動送進本地 Voice Clone ↓產生我的聲音 ↓自動分析旁白時間軸 ↓自動尋找 B-roll ↓自動產生字幕與字卡 ↓自動剪輯 ↓輸出成片 如果這條流程真的串起來,我根本不需要知道 VoiceStudio 的「生成」按鈕在哪裡,甚至不用打開 VoiceStudio。 因為它已經從「我要操作的軟體」,變成「我的 AI 員工背後會使用的一項能力」。 我覺得這才是接下來真正重要的改變。 以後我們可能不會在意「你用哪一套 AI」現在很多人在比較: ChatGPT 還是 Claude? ElevenLabs 還是 VoiceStudio? 這個生圖模型比較強,還是那個比較強? 這些當然重要,但如果 Agent 的發展繼續下去,我猜這些問題的重要性會慢慢降低。 因為使用者最後看到的可能根本不是工具。 你只會跟 AI 說: 把這篇文章做成三支短影音。 剩下的事情由 Agent 自己決定。 1234567需要寫腳本,就呼叫文字模型需要圖片,就呼叫生圖模型需要我的聲音,就呼叫本地 Voice Clone需要字幕,就呼叫語音辨識需要素材,就去素材庫搜尋需要剪輯,就呼叫影片處理工具最後丟三支影片給我挑 這時候,ChatGPT、VoiceStudio、FFmpeg、Whisper 或其他模型,全部退到後台。 使用者根本不需要看到它們。 這不代表底層工具不重要,而是工具的價值開始從「使用者介面有多順」延伸到「能不能穩定成為其他系統可呼叫的能力」。 本地 AI 真正有趣的地方,也不只是省錢很多人談 Local AI,第一件事情就是算成本: ElevenLabs 一個月多少錢? 本地模型是不是免費? 跑在自己的電腦上是不是比較便宜? 如果只是偶爾做幾支影片,我甚至覺得這不是最重要的問題。 雲端服務通常比較方便,模型可能也更穩定;本地方案則會多出硬體、安裝、更新、維護與排錯成本。軟體可以免費使用,也不代表每個語音模型都能免費商用,實際使用前仍要確認各自的授權條款。 真正有趣的是: 當 AI 能力搬到自己的電腦,它開始變成你可以控制的基礎設施。 不用每一次都開網頁。 不用每一次都上傳資料。 也不用每一次都等人按下「生成」。 只要電腦開著,Agent 就可以自己呼叫。 這對一天做一支影片的人,差異可能還不大。 但如果未來你不是一天做一支,而是讓 AI 一次處理 20 支、50 支,甚至 100 支內容,整個思考方式就完全不一樣了。 你不再是在找: 最好用的 AI 配音網站。 你是在建立: 我的 AI 內容基礎設施。 聲音,也正在變成一種可以重複使用的數位資產另外一個我覺得很有意思的變化,是「自己的聲音」。 以前聲音不是資產。我要錄一段新的內容,就必須重新開麥克風講一次。 講錯一句,重新錄。 課程改了一句,重新錄。 想做英文版,再錄一次。 但是 Voice Clone 出現之後,邏輯開始改變。 我的聲音可以被抽象成一個可以重複呼叫的能力。 今天拿來做短影音。 明天拿來補錄線上課程。 後天文章自動轉 Podcast。 甚至同一支內容自動產生不同語言版本。 所以未來自媒體經營者要管理的,可能不只有文章、圖片、影片與 Prompt,還會多一個東西: 自己的 Voice Profile。 它會跟 Logo、品牌色、字型、人物 LoRA 一樣,逐漸變成個人品牌的數位資產。 但這種資產也需要被好好管理:聲音樣本的保存、誰可以呼叫、哪些內容可以生成、是否允許商用,以及被濫用時如何撤銷,都不能只靠「模型很像」來處理。 把「我是誰」和「我要怎麼說」拆開這件事對自動剪影片非常重要。 一支短影音不可能從頭到尾都使用同一種情緒: 開頭 Hook 可能要比較興奮 中段解釋要穩定清楚 提醒風險時要嚴肅 講到反差時可能要驚訝 最後 CTA 又要比較親切 因此,Voice Engine 可以拆成兩層: 我是誰: 聲音的音色、辨識度與個人品牌特徵。 我要怎麼說: 情緒、語速、停頓、重音與表達方式。 理想的流程會是: 1234567891011腳本 ↓AI 理解內容 ↓判斷每一段情緒 ↓選擇語速與表達方式 ↓Voice Clone 生成 ↓送進剪輯流程 這時候 AI 就不只是單純「念稿」,而是開始理解:這句話應該怎麼說。 如果你也在處理影片聲音,可以延伸參考短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流。克隆旁白解決的是「誰在說」,SFX 與混音則決定觀眾「聽起來感覺如何」,兩者應該放在同一條聲音工作流裡設計。 我不太想問「VoiceStudio 能不能取代 ElevenLabs」因為我覺得這個問題太小了。 ElevenLabs 好不好用?當然好用。 VoiceStudio 免費嗎?軟體本身確實可以免費使用,但實際使用的語音模型仍要確認各自授權。 真正值得測試的是: 我能不能把 VoiceStudio 塞進自己的 AI Short Factory,然後以後根本不用打開它? 如果可以,那代表配音這件事情已經從: 我要做的工作 變成: AI 自己會完成的一個步驟 再往後,生圖是一個節點,配音是一個節點,字幕是一個節點,B-roll 是一個節點,剪輯是一個節點,發布也可能是一個節點。 當這些節點全部串起來,我們真正建立的就不再是一堆 AI 工具,而是一條: AI 內容生產線。 所以 VoiceStudio 免費這件事情,我當然很開心。 但比免費更讓我興奮的是: 我們正在慢慢進入一個「不用操作 AI 工具」的時代。 真正值錢的能力,也會從「你會多少 AI 工具」,逐漸變成: 你能不能把這些 AI 能力,組成一套會自己工作的系統? 這可能才是 AI 自媒體下一階段真正拉開差距的地方。 常見問答 (FAQ)Q1:VoiceStudio 最值得注意的地方是免費嗎?不只是免費。更值得注意的是,VoiceStudio 這類本地語音工具若能透過 API 或 MCP 被其他程式呼叫,就有機會成為 AI 內容工作流裡的語音節點,讓配音從手動操作變成可重複執行的步驟。 Q2:接進 AI 工作流後,還需要打開 VoiceStudio 嗎?理想上不需要。當 Agent 已經能透過 API 或 MCP 呼叫語音能力,使用者只要提出「把文章做成短影音」這類目標,VoiceStudio 可以在後台完成配音;但實際能否做到,仍取決於工具提供的介面、設定方式與整合品質。 Q3:本地 AI 語音一定比較省錢嗎?不一定。本地執行可能減少訂閱或按量計費,但仍要計入硬體、安裝、更新、維護、電力與排錯成本;此外,軟體免費也不代表所使用的語音模型都允許免費商用,必須逐一確認授權。 Q4:自己的 Voice Profile 可以當成個人品牌資產嗎?可以把它視為一種可重複呼叫的數位資產,但需要同時管理聲音樣本、存取權限、生成範圍、商用許可與撤銷機制。聲音相似度只是品質的一部分,不等於完整的品牌治理。

  • article-【30 秒 AI 影片,模型只花 513 元,為什麼報價可以是一萬元?】

    2026/9/15

    商業策略 內容行銷 影音行銷
    【30 秒 AI 影片,模型只花 513 元,為什麼報價可以是一萬元?】

    先說結論:AI 影片最貴的可能從來不是模型,而是把 500 秒垃圾變成 30 秒作品的人。 文中的模型單價與金額,都是用來說明估價邏輯的示例,實際費用會隨模型版本、解析度、平台方案與計價方式變動。真正值得留下來的,不是某個當下單價,而是如何把採用率、修改量與人力一起放進成本模型。 30 秒成片,為什麼不能只用「秒數 × 單價」?最近 AI 影片越來越強,我也開始看到一個很有趣的問題: 「現在 AI 生成影片這麼便宜,那做一支 30 秒影片,到底應該收多少錢?」 很多人第一個想到的算法是: 130 秒 × 模型每秒單價 假設模型生成一秒 11 元,那 30 秒就是: 130 × 11 = 330 元 所以一支 30 秒 AI 影片,成本才 330 元? 如果只是生成一段素材自己玩,這樣算沒有什麼問題。 但如果今天是客戶付錢,要你交出一支「可以用的商業成片」,事情完全不一樣。 因為 AI 影片最大的成本,從來不是「生成」,而是: 你生成了一大堆,最後到底有多少能用? AI 影片最容易被忽略的成本:抽卡假設最後成片需要 30 秒,你不可能剛好生成 30 秒,然後 30 秒全部拿來用。 人物可能崩掉,手可能有問題,商品 Logo 變形,表情不對,運鏡突然抽風,前後鏡頭接不起來。 甚至畫面都沒問題,你只是單純覺得: 「這顆不好看。」 於是重抽。 這就是大家常講的「抽卡」。 如果最後生成了 150 秒素材,只有 30 秒進入成片,那麼你的「採用率」就是: 130 ÷ 150 = 20% 換句話說,成片每留下 1 秒,背後平均有 4 秒被丟掉。 所以我在估 AI 影片成本時,比起模型一秒多少錢,我其實更在意另一個數字:採用率。 粗略規劃時,我可能會先這樣抓: 專案情境 初步採用率估算 社群短影音 約 40% 一般商用敘事影片 約 20% 高規格長片 約 10% 這不是什麼業界公定標準,只是讓自己不要活在「AI 每次生成都會成功」的幻想裡。 同一個模型,採用率不同,成本可以差四倍假設今天使用的模型是每生成一秒 11 元,做一支 30 秒影片: 採用率 估算生成量 模型成本 40% 30 ÷ 0.4 = 75 秒 75 × 11 = 825 元 20% 30 ÷ 0.2 = 150 秒 150 × 11 = 1,650 元 10% 30 ÷ 0.1 = 300 秒 300 × 11 = 3,300 元 有沒有發現一件很有意思的事情? 模型完全沒有換,影片長度也完全沒有換。 光是「採用率」不同,模型成本就差了四倍。 所以我現在反而覺得,AI 影片真正的技術,不只是會不會生成,而是你能不能提高採用率。 會做角色設定、Reference、分鏡、首尾幀、鏡頭拆解、素材控制、提示詞工程的人,真正省下來的不是按按鈕的時間,而是少抽很多次卡。 需要 3 秒,不代表只付 3 秒例如一顆鏡頭,我最後只需要 3 秒,但模型一次可能生成 5 秒。 第一次不行,再來。 第二次人物表情怪怪的,再來。 第三次商品變形,再來。 第四次終於可以。 最後時間軸上只有 3 秒,但實際付費生成了 20 秒。 所以如果真的要精算,我會看另一個數字: 1有效採用率 = 實際進入成片秒數 ÷ 實際付費生成秒數 這個數字,比「我今天生成了幾顆鏡頭」更值得追蹤。因為真正影響成本的,是付費生成了多少,以及最後有多少秒成功進入交付版本。 客戶修改:最容易低估的第二輪抽卡第一版完成之後,客戶說: 「這邊人物可以笑一點嗎?」 真人拍攝的後製,也許還有一些調整空間。 但 AI 影片很可能不是把嘴角往上拉一點就結束。你得重新生成整顆鏡頭,然後重新面對一次人物、服裝、商品、背景、運鏡與光線全部變動的風險。 更刺激的是:你原本只想修改 A,AI 很可能順便幫你把 B、C、D 也改了。 所以一般委製案,我會先保留大約 20% 的修改預備量。 我的快速估算公式會變成: 1模型費 = 成片秒數 ÷ 採用率 × (1 + 修改率) × 每秒生成單價 但這還只是模型費。 案例:30 秒影片,模型費可能真的只有 513 元假設今天做一支 30 秒直式社群影片: 使用 Seedance 2・720p,每生成一秒約 5.7 元。 採用率抓 40%。 修改預備量抓 20%。 那麼估算生成量是: 130 ÷ 40% × 1.2 = 90 秒生成量 模型費就是: 190 × 5.7 = 513 元 模型費:513 元。 很便宜吧? 問題來了。 假設一位初階製作者,一天人力成本抓 2,000 元,整個專案工作五天: 12,000 × 5 = 10,000 元 模型加人力: 1513 + 10,000 = 10,513 元 模型費只占大約 4.9%,剩下約 95.1% 都是人。 客戶真正買的到底是什麼?這也是我覺得現在 AI 影片市場最容易誤會的地方。 客戶看到的是: 「你不就是打 Prompt,然後按生成嗎?」 但真正的工作可能是: 企劃 腳本 分鏡 角色設定 場景設定 提示詞 生成 挑片 補生成 角色一致性 QC 商品 QC 剪輯 字幕 配音 音樂 調色 輸出 客戶溝通 修改 所以如果要更精準估價,我甚至不會只寫: 1人力費 = 人日單價 × 工作人日 而會拆成: 1專案成本 = 前期製作 + AI 生成 + 後期製作 + 專案管理 前期製作包含企劃、腳本、分鏡、角色與場景設定;AI 生成包含抽卡、補生成與修改預備量;後期製作包含剪輯、字幕、配音、音樂、調色與輸出;專案管理則包含溝通、版本整理、回饋整合與交付。 這和價值堆疊如何讓產品不再被說太貴的邏輯很接近:不是把一個總價藏起來,而是讓客戶看見交付價值是由哪些工作組成。 因為客戶付的從來不是那 513 元的 GPU 費用,他真正付錢買的是:有人可以把幾百秒充滿不確定性的 AI 素材,收斂成最後可以交付的 30 秒。 生成成本正在下降,但「選擇成本」沒有這可能才是 AI 影像產業接下來真正有趣的地方。 以前拍影片最大的問題是:「拍不到。」 所以你需要攝影棚、攝影機、燈光、演員、場景、攝影師、美術與製片。每按一次快門都有成本。 但生成式 AI 把這件事情反過來了。 未來最大的問題可能不是: 「做不出來。」 而是: 「做得出來的東西太多了。」 100 顆鏡頭都可以生成。問題是: 哪一顆能用? 哪一顆最好? 哪一顆符合品牌? 哪一顆人物沒有跑掉? 哪一顆商品沒有變形? 哪兩顆接起來才合理? 哪一顆值得繼續修改? 這些全部都是人的判斷。 所以我甚至認為,未來 AI 影片產業真正稀缺的能力,會慢慢從單純的 Production,轉向: 1Direction + Selection + QC 導演能力、選擇能力與品質控制能力。 如果你想進一步理解如何把抽卡整理成可以重複執行的流程,也可以延伸閱讀AI 影片真正的分水嶺:從 Prompt 到專家 Skill 的製片工作流。 100 分鐘 AI 電影,真的只要 20 萬元?我們再把尺度拉大。 假設要製作一部 100 分鐘 AI 電影: 總片長:6,000 秒。 使用 Seedance 2.5・1080p,每生成一秒約 21.3 元。 高規格長片採用率抓 10%。 先不加入修改預備量,估算生成量是: 16,000 ÷ 10% = 60,000 秒生成量 模型成本: 160,000 × 21.3 = 1,278,000 元 光模型就大約 128 萬元。 假設再投入 450 個人日,每人日平均 5,000 元: 1450 × 5,000 = 2,250,000 元 模型加人力: 11,278,000 + 2,250,000 = 3,528,000 元 如果再把約 20% 的生成修改預備量加到模型費: 11,278,000 × 1.2 + 2,250,000 = 3,783,600 元 整體約 378 萬元左右。 而且這還沒有完整納入劇本開發、專業配音、演員、音樂、混音、法務、授權、製片管理、發行與行銷。 所以 AI 電影確實有可能把過去需要幾千萬、甚至上億元才能完成的事情,壓到非常誇張的價格;但也不是「我有二十萬元、一台電腦,再加上一個很模糊的故事概念」就可以拍電影了。 模型越便宜,專業 AI 影片製作者不一定越便宜這可能是最反直覺的一件事。 我反而認為,接下來模型價格還會繼續下降,生成速度會繼續提高,畫面品質也會繼續變好。 「把畫面生出來」這件事情,會愈來愈不值錢。 但這不代表專業 AI 影片製作者的價格,也一定跟著往下掉。 因為當每個人一天都可以生成幾百、幾千段影片之後,真正稀缺的東西反而變成: 知道什麼值得留下來的人。 所以未來客戶付錢買的,不會只是: 「幫我生成 30 秒影片。」 而是: 「幫我從幾百秒垃圾裡,得到最後這 30 秒。」 AI 讓畫面出現得愈來愈便宜,但把畫面變成作品,依然很貴。 而且我猜,這件事情短期內不會改變。 常見問答 (FAQ)Q1:一支 30 秒 AI 影片的模型成本到底是多少?模型成本沒有固定答案,至少要同時看每秒生成單價、採用率與修改預備量。以本文的示例計算,30 秒成片、40% 採用率、20% 修改預備量與每秒 5.7 元的模型,模型費約為 513 元。 Q2:什麼是 AI 影片的採用率與有效採用率?採用率是「成片秒數 ÷ 生成素材總秒數」;有效採用率則是「實際進入成片秒數 ÷ 實際付費生成秒數」。後者會把每次重抽與模型實際計費的秒數一起納入,更適合用來追蹤專案成本。 Q3:為什麼模型只花 513 元,客戶報價卻可能超過一萬元?因為客戶購買的不只是模型生成,而是企劃、腳本、分鏡、角色與場景設定、抽卡、挑片、QC、剪輯、配音、音樂、調色、溝通與修改等完整交付。本文示例中,模型費約占 4.9%,主要成本來自五天的人力與判斷。 Q4:AI 影片應該怎麼快速估算模型費?可以先使用「模型費 = 成片秒數 ÷ 採用率 × (1 + 修改率) × 每秒生成單價」估算,再另外加上前期製作、後期製作與專案管理。採用率不是公定標準,應依角色一致性、商品辨識、鏡頭複雜度與客戶修改風險調整。 Q5:100 分鐘 AI 電影是不是只要二十萬元就能完成?不能只用模型單價判斷。依本文的示例,6,000 秒成片、10% 採用率、每秒 21.3 元模型費、450 個人日與 20% 生成修改預備量,模型加人力約需 378 萬元,且尚未計入劇本、配音、音樂、法務、授權、製片、發行與行銷。

  • article-【Google Flow 的 /orbit 到底是什麼?從 Veo 到 Omni Flash,一次搞懂 AI 影片的運鏡指令】

    2026/9/14

    AI工具 影音行銷 Gemini
    【Google Flow 的 /orbit 到底是什麼?從 Veo 到 Omni Flash,一次搞懂 AI 影片的運鏡指令】

    最近我看到一個有趣的 Google Flow 用法:生成影片時,只輸入 /orbit,畫面就像替主體加上環繞運鏡。其他人也會整理 /dollyin、/tracking、/lowangle、/macro、/goldenhour、/ugcunboxing 等斜線寫法,看起來很像產品裡藏了一套秘密指令。 研究後我更想弄清楚的,不是還有幾百個指令,而是這些詞背後共通的攝影語言。理解鏡頭怎麼移動、如何構圖、光線如何呈現,才能把這些概念帶到 Veo、Gemini Omni Flash,或其他能以自然語言生成影片的模型。 /orbit 是 Google Flow 的官方指令嗎?目前查閱 Google Flow 的官方影片建立說明,流程是用提示詞描述場景,再選擇模型、比例與片長;我沒有在這份說明中找到 /orbit 或名為 Google Flow Slash Command API 的公開指令定義。因此,較穩妥的理解是:這些斜線詞是創作者整理的 Prompt Shorthand(提示詞快捷寫法),不是已確認的官方 API。 這不代表輸入 /orbit 一定沒有作用,而是不能假設斜線會觸發一個保證存在的程式指令。實際生成可能受 orbit 這個詞、上下文與各模型的語意理解影響;想讓需求更清楚,可以把它改寫成完整句子: 1The camera smoothly orbits around the subject. orbit 本身就是常見的攝影運鏡概念。類似地,dolly in 是攝影機向主體推進,tracking shot 是跟著人物或物件移動,low-angle shot 是低角度拍攝,macro shot 是微距特寫,而 golden hour 描述的是接近日出或日落的暖色光線。 真正值得記住的是可跨模型使用的攝影語言如果只記 /orbit,介面改版或另一個模型不認得斜線寫法時,這個捷徑就可能失效。若記住 Orbit Shot=環繞運鏡,你就能再補上方向、幅度、速度與主體位置,把同一個想法展開成不同細節層級的提示詞。 在 Google Flow 裡,影片模型與支援功能會因選用的模型而不同;官方也建議生成前確認目前的模型與設定。Gemini Omni Flash 官方提示指南則明確提到場景、鏡頭運動、光線與情緒等描述方式。這些資料支持「攝影語言可以用自然語言表達」的做法,但不代表所有模型都會以相同方式遵循提示詞。 把 AI 影片提示詞拆成五個層級以 Orbit 為例,可以從一個簡短概念逐步增加控制資訊: Level 1:先給運鏡名稱1/orbit 這是最精簡的快捷寫法,只表達「希望鏡頭環繞主體」。 Level 2:回到標準攝影語言1Orbit around the subject. 拿掉斜線後,仍然保留同一個運鏡概念。 Level 3:加入方向與速度1The camera slowly orbits clockwise around the subject. 現在提示詞多了慢速與順時針兩個條件。 Level 4:補上角度、距離與主體位置1The camera performs a slow 180-degree clockwise orbit around the subject, maintaining a constant distance and keeping the subject centered. 除了環繞方向與速度,也交代移動幅度、攝影機距離和主體在畫面中的位置。 Level 5:寫成一段有時間節奏的導演腳本12345Single continuous shot. No cuts.[0-2s] Static medium shot.[2-7s] Slow 180-degree clockwise orbit around the subject. Maintain a constant camera distance and keep the subject centered.[7-10s] Lower the camera and settle into a low-angle hero shot.Warm golden-hour rim lighting. Keep the subject visually consistent. No dialogue. 到這一層,提示詞已經交代鏡頭何時開始移動、移動多久、最後停在哪裡。時間標記可以幫模型理解節奏與順序,但它仍是生成提示,不是逐格精準的剪輯時間軸;實際結果要看模型、版本與生成設定。 一個運鏡有五個可調整的控制維度/orbit 只說出運鏡名稱。若想減少生成結果像抽卡,可以把它拆成五個方向來描述: 控制維度 可以描述的內容 方向 順時針、逆時針、由左向右、由右向左 幅度 45 度、90 度、180 度或完整 360 度 速度 非常慢、緩慢、快速或急速 距離 貼近主體、遠距環繞、維持固定距離 結束畫面 特寫、低角度英雄鏡頭、主體背後或正面 例如,A slow 180-degree clockwise orbit, maintaining a constant distance, ending in a low-angle close-up hero shot. 就比單獨輸入 /orbit 多交代了可供模型參考的畫面條件。提示詞不一定要很長,重點是把真正重要的控制維度說清楚。 Veo 的攝影積木與 Omni Flash 的時間軸寫法教學時,我會用「攝影積木」介紹 Veo:主體、動作、景別、運鏡、光線與聲音,再依需要組合。到了 Gemini Omni Flash,我會多練習用時間軸描述一段連續鏡頭,明確寫出每一段的畫面變化。 這是方便理解提示詞的教學方式,不代表 Veo 只能用積木、Omni Flash 才能用時間碼。Gemini Omni Flash 的官方指南說明,模型預設可能嘗試生成多個鏡頭;若需要單一連續畫面,可以寫明 In a single continuous shot 或 No scene cuts,並以時間標記交代事件發生順序。不同模型與 Flow 功能的支援狀況仍可能不同,使用前應確認當下選取的模型與設定。 以 10 秒商品廣告為例,可以這樣寫: 12345Single continuous shot. No cuts.[0-3s] Close-up product shot. A bottle sits on a reflective black surface.[3-7s] The camera slowly orbits clockwise around the bottle while gently pushing in.[7-10s] The camera settles into a low-angle hero shot.Warm golden-hour rim lighting. Keep the product label consistent. No dialogue. 這段提示詞不只說「環繞」,也說明何時開始、同時搭配什麼動作、最後停在哪個景別。若你想先把多個鏡頭的順序規劃好,也可以延伸閱讀用 AI 快速生成短影音?九宮格分鏡技巧解決人物變形。 把 Slash Commands 當成攝影積木,而不是終點這些斜線寫法仍然很好用,尤其適合初學者快速記住攝影概念。可以先整理成自己的攝影積木: 運鏡: /orbit、/dollyin、/dollyout、/tracking、/handheld、/fpv 景別與角度: /closeup、/macro、/lowangle、/highangle、/pov 光線: /goldenhour、/backlight、/rimlight、/neonlight 商品畫面: /productreveal、/productspin、/ugcunboxing 特效: /smokereveal、/liquid、/disintegrate 新手可以先用 /orbit,再加上 /lowangle 或 /goldenhour。需要更明確的控制時,就把積木展開成自然語言: 1Single continuous cinematic shot. The camera slowly orbits 180 degrees clockwise around the subject while maintaining a constant distance. Use a low camera angle with warm golden-hour backlighting. Keep the subject centered and visually consistent. No cuts. 斜線詞是入口;一旦寫清楚畫面條件,這些攝影概念便不綁定某個介面或模型。 Prompt 正在變成一種導演介面以前我們可能只寫「一個男人走在東京街頭,電影感」,再看看模型會給什麼。現在可以把想法拆成鏡頭腳本: 0–2 秒先保持固定中景。 2–7 秒開始順時針環繞 180 度,人物留在畫面中央。 7 秒後降低機位,停在低角度英雄鏡頭。 整段不要切鏡,並維持人物的外觀與服裝。 這不只是描述「我要什麼畫面」,而是把運鏡、景別、速度、方向、距離、光線、動作和時間順序,組合成模型看得懂的執行腳本。當你學會的是這套攝影語言,換 Veo、Gemini Omni Flash 或其他自然語言影片模型時,就有一組可以重新測試與調整的基礎。 官方文件參考 Google Flow:建立影片 Google Flow:模型與支援功能 Google AI for Developers:Gemini Omni Flash 影片生成與提示指南 常見問答 (FAQ)Q1:/orbit 是 Google Flow 的官方指令嗎?目前查閱的 Google Flow 官方說明沒有把 /orbit 定義為公開指令或 Slash Command API。把它當成創作者的提示詞快捷寫法較穩妥,若需要明確表達環繞鏡頭,可直接寫 The camera orbits around the subject.。 Q2:/orbit 這種寫法可以直接用在 Gemini Omni Flash 嗎?Orbit 的運鏡概念可以用在 Gemini Omni Flash,但不要假設斜線語法一定通用。可改寫成自然語言,例如 The camera slowly orbits clockwise around the subject.,再依輸出結果調整方向、速度與幅度。 Q3:怎麼讓 AI 影片的運鏡方向和幅度更明確?在提示詞中直接寫出順時針或逆時針、移動 90 度或 180 度,以及運鏡速度、與主體的距離和結束景別。條件越具體,模型越能以這些資訊作為生成參考,但結果仍可能因模型與設定而不同。 Q4:AI 影片可以依照秒數執行運鏡嗎?可以用 [0-3s]、[3-7s] 這類時間標記描述事件順序與節奏。Gemini Omni Flash 官方提示指南有時間碼範例;時間標記仍屬自然語言提示,不保證逐秒或逐格精準執行。 Q5:一套運鏡快捷詞能套用在所有 AI 影片模型嗎?運鏡、景別與光線等攝影概念可以跨模型重用,但各模型的功能、版本與語意遵循程度不同。保留攝影概念,再把快捷詞展開成清楚的自然語言,並依實際輸出測試調整。

  • article-AI 長片真正的突破,不是模型變強,而是終於有人把「抽卡」變成製片流程

    2026/9/14

    AI工具 影音行銷 Higgsfield
    AI 長片真正的突破,不是模型變強,而是終於有人把「抽卡」變成製片流程

    最近看到 Higgsfield 公開約 95 分鐘的 AI 長片《HELL GRIND》。只看表面,很容易把焦點放在「AI 已經能做 95 分鐘電影了」;但我研究它公開的製作專案後,反而覺得更值得注意的,是團隊開始把角色、場景、鏡頭與生成素材當成一套製片系統來管理。 Higgsfield 的官方專案頁提到,公開內容包含每個場景背後的 prompts、assets 與 generations;Higgsfield 執行長 Alex Mashrabov 也在公開貼文中稱它為 95 分鐘 AI 電影。 對我來說,真正重要的不是長度,而是這部片讓一個問題變得更清楚: 如何把「抽卡」,變成製片? 為什麼 AI 長片不能只靠「不行就重抽」?做 10 秒或 30 秒的影片,寫 Prompt、生圖、試運鏡,畫面不對就再生成一次,偶爾還撐得住。但當作品長到 5 分鐘、20 分鐘,甚至 95 分鐘,每一鏡都靠運氣成功,就很難維持角色、場景和敘事的連貫。 長片需要的不只是單一鏡頭「看起來不錯」,還要讓觀眾相信:這是同一個角色、同一個世界,故事也在往前走。鏡頭一換,門不能無故換邊;角色換個狀態,衣服和傷勢不能忽然重置;前一鏡的動作,也要能接到下一鏡。 所以 AI 長片遇到的核心問題,已不只是「怎麼寫出更好的 Prompt」,而是「怎麼讓每次生成都能接回同一部作品」。 人物不該只是一段 Prompt,而是一組角色資產以前我們可能會在每個鏡頭重寫一次:「一名 32 歲亞洲男性,短黑髮,穿黑色外套……」然後希望模型記得他是誰。 長片製作更需要一份 Character Bible,先把角色定義成可重複引用的資產: 長相、身形比例與辨識特徵 服裝、髮型與會隨劇情改變的物件 聲音、語速、口音與說話習慣 表情、姿勢和具有辨識度的小動作 角色在不同場次中的狀態與變化 角色狀態也要拆開管理。乾淨的日常造型、淋雨後、受傷後或滿臉血,對應的是不同的造型狀態;如果每次都把多種狀態混在同一段描述裡,模型便可能把它們混合到不該出現的鏡頭。 這不代表角色 Asset 可以保證模型永遠不漂移,而是讓每一鏡有一致的參照。當角色跑掉時,也比較容易追問:是參照圖不夠清楚、狀態版本用錯,還是鏡頭本身要求太多? 場景不是背景圖,而是一個固定的虛擬片場場景連戲常比角色更容易出錯。 想像第一個鏡頭的門在左側,換個機位後卻跑到右邊;桌子忽然不見,窗戶又多出一扇。單看每一格也許說得過去,剪在一起就會穿幫。 因此,除了描述「這裡看起來像什麼」,還要建立空間地圖,固定重要物件和角色之間的關係。例如: 訓練墊位於房間中央 門固定在左側遠牆 窗戶在右後方,桌子在入口右側 角色 A 與門之間約有八公尺距離 這些資訊讓換機位不等於重新發明一個房間。它更像真正的片場:攝影機可以移動,但場景的空間關係不會跟著重新生成。 我把這種做法想成 AI 的「虛擬片場」。過去我們一直在練習怎麼描述畫面;長篇影像還需要我們定義畫面所在的世界。 不要只叫 AI 演情緒,要描述看得見的身體行為如果只寫「男人非常憤怒」,模型可能把情緒演成瞪眼、皺眉、咬牙、握拳,全部一起上,反而失去可信度。 更可控的方式,是把抽象情緒拆成鏡頭看得見的行為: 下巴繃緊,停頓兩秒 視線落在地面,不看對方 鼻血流到嘴唇,卻沒有伸手擦掉 呼吸逐漸加快,但肩膀保持僵硬 這不是單純把情緒形容得更長,而是把「表演」轉成可觀察、可檢查的身體訊號。我會把這種思路稱為 Performance Engineering:不是要求模型抽象地「演得更好」,而是把表演拆成具體的動作、節奏與反應。 把鏡頭設計成可診斷的 Shot,而不是塞滿一段 Prompt一個 Shot 若同時要求角色轉身、拿起道具、穿過房間、打鬥、說台詞,再加上複雜運鏡,模型失敗時就很難判斷是哪個條件造成問題。 先定義這一鏡最重要的動作、人物位置、鏡頭目的和結尾狀態,再決定要不要拆成兩鏡。若攝影機運動與角色動作彼此衝突,或同一鏡塞了太多事件,即使 Prompt 更長,也不一定會更穩。 我會用「10–15 次診斷線」提醒自己:同一個 Shot 反覆生成仍不成立時,先停止只改幾個形容詞;拆鏡、減少動作、換機位,或重新設計動作節拍。這是用來避免盲目重抽的工作參考,不是所有模型都適用的官方硬性門檻;真正的停損點仍要看鏡頭難度、成本和可接受品質。 如果你想進一步看分鏡如何協助人物一致,可以延伸閱讀本站的AI 九宮格分鏡技巧;九宮格是一種方法,不代表每部片都必須採用。 不是消滅抽卡,而是把抽卡工程化AI 影片仍然會生成失敗。差別在於,失敗後我們能不能找出問題、留下紀錄,並只重做需要修正的部分。 可以把工作拆成一條可追蹤的製作管線: Story → Bible → Asset → Scene → Shot → Generation → QC → Editing 當一個 Shot 不理想時,先診斷角色狀態、空間設定、動作複雜度、鏡頭運動和模型限制,再決定是重抽、簡化還是拆鏡。這樣每次生成才會變成有理由的測試,而不是沒有上下文的下一次嘗試。 AI 影片高手可能不只是最會寫 Prompt 的人如果 AI 影片逐漸走向 10 分鐘、30 分鐘或更長的敘事作品,真正拉開差距的能力可能會變成: 角色與場景資產管理 Story Bible、Character Bible 與 Shot List Continuity 連戲檢查 版本、生成紀錄與失敗診斷 素材篩選、品質檢查與剪輯決策 這些能力比某一款模型的熟悉度更有機會跨工具沿用。今天的 Shot 可以換成漫畫分格,留下 Story、Character 和 Scene 也可以支援小說或品牌故事。模型會換,對作品的拆解、管理和判斷能力卻能帶到下一個工具。 如果你想看如何把多種 AI 能力串成完整影片產線,可以延伸閱讀本站的用 Codex 打造 AI 影片工廠;而AI 影片素養與創作者工作方法則談到創作者如何從生成者走向製片與判斷者。 工作流,才是 AI 內容能跨模型累積的資產模型一定會一直更新。今天是 Higgsfield,明天可能是 Seedance、Veo、Kling,之後也可能出現另一套更強的生成工具。 如果能力只建立在「我很會用某一個模型」,工具換掉,很多技巧就要重來。但若你建立的是 Story、Bible、Asset、Scene、Shot、Generation、QC 到 Editing 的工作流,就能依不同模型重新安排生成工具,而不必把整個製作方法一起推倒重來。 AI 內容的下一階段,也許不是一鍵生成,而是我們開始知道怎麼管理生成、如何找到失敗原因,以及怎麼把 AI 產出的零件組織成一部作品。 《HELL GRIND》值得研究的地方,不只是「AI 能不能拍電影」,而是它讓我們看到人如何透過角色資產、虛擬片場、鏡頭設計與品質檢查,和 AI 一起把電影做出來。 常見問答 (FAQ)Q1:AI 影片製作中的 Production Engineering 是什麼?Production Engineering 是把故事、角色、場景、鏡頭、生成、品質檢查與剪輯整理成可追蹤、可診斷、可重做的製作流程,而不只是逐鏡撰寫 Prompt。 Q2:Character Bible 能保證 AI 角色每一鏡都一致嗎?不能。Character Bible 提供可重複使用的角色外觀、服裝、聲音和狀態參照,幫助團隊減少重新描述並定位偏差;最後仍要逐鏡檢查與修正。 Q3:AI 長片為什麼需要場景空間地圖?空間地圖能固定門窗、家具、角色和重要道具的位置關係,讓不同機位的鏡頭仍像發生在同一個場景,降低場景佈局前後矛盾的風險。 Q4:AI 影片的「10–15 次規則」是官方標準嗎?不是普遍適用的官方標準。本文把 10–15 次當作提醒創作者停止盲目重抽、回頭診斷 Shot 設計的工作參考;實際次數應依鏡頭難度、生成成本與品質要求調整。 Q5:這套 AI 製片流程只能用在 Higgsfield 嗎?不能。角色與場景管理、Shot 拆解、生成紀錄和品質檢查等概念可用於其他影片模型;但各模型支援的參照方式、控制能力與工作介面會不同,實作時仍需依版本調整。

  • article-AI 影片真正的分水嶺:從 Prompt 到專家 Skill 的製片工作流

    2026/9/14

    AI工具 AI Agent 影音行銷
    AI 影片真正的分水嶺:從 Prompt 到專家 Skill 的製片工作流

    AI 影視最近兩個案例,指向同一件事AI 影片最近有兩件事,我覺得值得放在一起看。 第一件,是 Higgsfield 公開了 95 分鐘 AI 長片《HELL GRIND》的製作專案,讓外界能查看影片背後的提示詞與製作素材。Higgsfield 官方專案頁 第二件,是我看到一位漫劇創作者在抖音談劇本創作與進階 Skill;他也公開了一套把編劇、角色與場景資產、分鏡、提示詞和品質檢查串起來的工作流程。抖音影片|公開的漫劇製作 Skill 乍看之下,這是兩種不同的 AI 影片案例。但放在一起,我看到的是同一個轉變:AI 影視真正的分水嶺,可能已不只是模型,而是「工作流」。 我把這種變化濃縮成一句有點殘酷的話:「學得慢的,直接不用學了。」不是專業不重要,而是有些人不必再從空白頁開始,把流程每一步都重新摸索一次;他們可以先安裝一套專家整理好的 Skill,再把時間用在判斷和修正上。 以前學 AI 影片,我們常常是在學怎麼抽卡人物不像?改 Prompt。場景跑掉?再補幾句。角色換個角度就變了樣?重抽。運鏡不對?繼續試。 所以過去一段時間,大家忙著學提示詞、運鏡術語和模型參數。但模型、介面與生成能力一直在變,今天摸熟的技巧,下一次更新後可能就被新的功能或工作方式取代。 反覆試生成並沒有消失,只是單靠「再改幾個字、再抽一次」很難穩定地做完一支片。更值得整理的,是故事如何拆解、角色和場景如何管理、鏡頭如何判斷,以及什麼結果可以留下。 專家的方法,開始被封裝成 Skill以小說改編成短劇為例,完整工作不只有「寫一段好 Prompt」。它可能包括故事分析、劇本結構、節奏與 Hook、角色設定、場景和道具資產、分鏡規劃、生成提示,以及逐步檢查成品。 這些步驟可以整理成一套 Skill:明確說明何時使用、要收哪些輸入、依什麼規則執行、要輸出什麼,以及在哪些地方停下來檢查。AI Agent 便能按照這套流程做事,而不是每次都靠使用者在聊天視窗重講一遍。 公開的漫劇 Skill 範例,就把製作拆成劇本、台詞診斷、資產鎖定、分鏡、提示詞渲染和獨立質檢等階段。這不是保證任何人安裝後都能做出熱門作品;它展示的是,原本藏在熟手腦中的步驟,開始能以結構化方法傳給 AI 執行。 一條可理解的製作管線大致會是: 1234567891011小說/故事 ↓編劇 Skill ↓角色與場景 Asset ↓Storyboard Skill ↓大量生成與品質檢查 ↓剪輯與輸出 這和我先前寫過的從提示詞到 Skill:打造高效率 AI 工作流有相同的底層觀念:把反覆重講的規則、固定格式、機械式步驟和修正經驗拆開,整理成可以重複使用的模組。 為什麼 Asset 會比一段角色 Prompt 更可靠?Higgsfield 公開《HELL GRIND》的專案素材,讓大家看到長片製作不只是每一鏡各寫一段描述。角色、場景、服裝、道具與不同狀態,都可以先整理成可重複引用的 Asset。 角色不是只有一張「長相描述」。製作時可能需要正常、淋濕、受傷或換裝等不同狀態;場景也不只是一段文字,還可能需要固定的空間關係、光線和可用角度。先把這些資料整理起來,之後做新鏡頭就不必每次從頭解釋整個世界。 這不代表模型從此不會漂移。Asset 的價值是提供更穩定的參照、減少重複整理,讓團隊更容易定位問題和重新生成;最後仍然需要有人檢查角色、場景和鏡頭是否接得起來。 《HELL GRIND》提醒我們:沒有告別抽卡,只是把抽卡工程化《HELL GRIND》的製作數字,讓我更確定這點。Screen Daily 報導引述製作方資料指出,前 25 分鐘用了 16,181 次影片生成,最後選出 253 個鏡頭,約是每個入選鏡頭對應數十次生成的量級。Screen Daily 報導 這是單一製作案例的數字,不是每部 AI 影片都適用的固定比例。但它清楚提醒我們:AI 影片不是按一次生成,就會自動得到可用成片。生成失敗並不可怕;更重要的是流程能不能記錄素材、比較版本、辨認問題,並只重跑需要修正的鏡頭。 於是製作方式從: 1人 → Prompt → 抽卡 → 不滿意 → 重抽 逐漸往這種工作流靠近: 1234567891011Story Bible ↓Character Bible 與場景 Asset ↓Storyboard 與 Shot 規格 ↓多輪生成 ↓人工/AI 輔助 QC ↓挑選、重跑與剪輯 抽卡仍然存在,只是它不再只是隨手試運氣,而是被納入一套可追蹤、可重跑、可檢查的製作管線。 未來稀缺的,可能是把專業整理成系統的人未來真正厲害的人,不一定是 Prompt 寫得最長的人,而是最會把專業拆成可執行步驟的人。 導演知道鏡頭怎麼服務情緒;編劇知道衝突和節奏如何推進;攝影師知道光線、構圖和視角如何影響觀感;剪輯師知道什麼時候該留下、什麼時候觀眾會離開。這些專業判斷,才是建立 Skill 時最有價值的內容。 一套可用的 Skill,也不只是把 Prompt 改個名字。它通常還需要清楚的輸入與輸出、可重用的素材、檢查標準、失敗時的處理方式,以及必要的人工作業關卡。少了這些,Agent 只會更快速地重複同一種錯誤。 如果想把 AI 影片流程往更完整的製作系統延伸,也可以參考我整理的用 Codex 打造 AI 影片工廠。而在生成能力普及、產量快速增加之後,為什麼「會生成影片」本身可能不再稀缺,也可延伸閱讀生成影片普及後,真正稀缺的是什麼。 學 AI,不如開始把自己會的東西教給 AIPrompt 的寫法會變,模型也會更新;但故事怎麼拆、角色怎麼管理、畫面怎麼判斷、什麼內容值得留下,仍然是專業的一部分。 所以現在學 AI,我不會只叫大家背更多提示詞。我更想問:哪些判斷你每天都在重複?哪些規則每次都要重新交代?哪些錯誤其實可以用檢查表提早抓到? 把這些經驗整理起來,先讓 AI 照流程執行,再由你把關品質。以前我們學會使用 AI;下一個階段,或許是把自己會的事情整理成 Skill,教會 AI 如何一起完成工作。 當越來越多人的專業被封裝成 Skill,真正的競爭才正要開始。 常見問答 (FAQ)Q1:AI 影片製作中的 Skill 是什麼?Skill 是一套可由 AI Agent 依循的任務規則與流程,通常會定義使用時機、輸入資料、執行步驟、輸出格式和檢查標準。它能減少每次重講流程,但不保證生成結果一定正確或符合品質要求。 Q2:有了 Skill,就不用學 Prompt 或專業知識了嗎?不是。Skill 可以把重複的操作規則整理起來,但使用者仍要提供目標與背景,並運用故事、影像、節奏和品質判斷來驗收結果。減少的是每次從零描述流程,不是專業判斷本身。 Q3:為什麼角色與場景要先整理成 Asset?把角色、場景、服裝、道具和狀態整理成可重複引用的 Asset,有助於維持不同鏡頭的參照一致,也讓團隊更容易找出需要修正的素材。模型仍可能產生偏差,因此 Asset 不能取代逐鏡檢查。 Q4:《HELL GRIND》的生成次數代表每個 AI 鏡頭都要生成 64 次嗎?不代表。製作方提供給媒體的數字是《HELL GRIND》前 25 分鐘用了 16,181 次影片生成,選出 253 個鏡頭,約為 64 次生成對應一個入選鏡頭的整體比值;這是該片的製作案例,不是普遍標準。 Q5:要怎麼開始把自己的專業整理成 Skill?先挑一個反覆執行、容易出錯的工作,記錄必要輸入、每一步的判斷規則、預期輸出和驗收條件;再把可重用的角色/場景/素材與檢查表整理好,讓 AI 先依流程執行,並在關鍵步驟保留人工審核。

  • article-【AI 短劇的下一站,可能不是抖音,而是 Steam】

    2026/9/14

    AI工具 內容行銷 影音行銷
    【AI 短劇的下一站,可能不是抖音,而是 Steam】

    當內容都能生成,下一步也許是讓人走進故事前幾天我看到一個很誇張的數字:2026 年上半年,抖音端上線超過 22 萬部 AI 劇漫劇。 這裡先補充統計口徑。DataEye 的《2026 上半年 AI 劇漫劇數據報告》統計的是「AI 劇漫劇」,涵蓋 AI 真人劇、AI 漫劇等不同形式,不能直接把 22.19 萬部說成全部都是真人影像短劇。報告摘要指出,其中有 1,055 部播放量破億,約占 0.48%。DataEye 報告摘要 這些數字讓我開始想:當 AI 劇漫劇多到這個程度,下一步會發生什麼? 答案可能不是只生成更多影片,而是讓觀眾走進故事裡。 最近我在 Steam 看到《幸存者笔记(Survivor’s Notes)》,覺得它讓這個方向變得具體。遊戲的 AI 生成內容聲明寫著:「All in-game materials are generated by AI.」也就是開發者表示,遊戲內的素材都是透過 AI 生成。Steam 遊戲頁面 這背後有意思的地方,不只是「AI 做了一款遊戲」,而是生成影像、互動選擇與遊戲系統開始出現在同一個作品裡。 它像一部「可以玩的 AI 短劇」《幸存者笔记》是一款全動態影像(FMV)生存遊戲。故事設定在 2026 年,全球爆發喪屍危機;玩家會跟著角色推進劇情,並透過選擇與快速反應事件,走進不同劇情分支與結局。Steam 遊戲介紹 如果先把遊戲類型放在一旁,它呈現的組合很像: AI 影像+互動敘事+QTE+分支劇情+多重結局。 但有一點要分清楚:Steam 頁面說明了玩家選擇會推進不同分支與結局,並沒有表示遊戲會依照每位玩家的輸入,即時生成全新的劇情。因此,這款作品能讓我們看到「AI 生成素材與互動影遊放在一起」的可能性;它本身還不能證明即時生成式戲劇已經成熟。 AI 影片可能讓分支劇情的影像製作變便宜以前拍一部真人互動電影,劇情走到第三集時,如果出現兩個選項:救女主角,或是不救,後面可能就要準備兩套劇本、場景、演出與剪輯版本。 如果故事繼續分成 A1、A2、B1、B2,製作量會跟著分支增加。演員、攝影、燈光、道具、剪輯與後製,也可能需要再投入一輪。 AI 影像帶來的變化,是創作者或許能以較低的成本製作另一條影像支線。過去新增一個分支,常常意味著「再拍一次」;未來某些情境可能變成「再生成、再挑選與再剪輯一次」。 這不代表新增分支會變成零成本。故事是否連貫、角色是否一致、畫面能否接起來、選擇有沒有意義,仍要有人設計與驗收。AI 降低的可能是部分影像製作門檻,內容設計與整合工作依然存在。這是我從生成影像與互動遊戲結合所看到的趨勢,不是《幸存者笔记》已公開的成本數據。 AI 短劇的下一站,可能不是「更多」現在大家還在比較:一天能生成幾支影片、角色能不能維持一致、運鏡像不像電影、畫面有沒有 4K。 這些能力會繼續進步。當多數人都能生成漂亮影片,「漂亮」本身可能就不再稀缺。 真正值得投入的,會是世界觀、角色、衝突、選擇、後果與情緒。觀眾為什麼想知道下一個選擇會帶來什麼?他們又為什麼願意在故事裡繼續走下去? 這已經不只是 AI 影片的問題,而是互動內容怎麼設計。 如果你也在思考 AI 影片產量增加後,創作者還能靠什麼取得注意力,可以延伸閱讀我寫的生成影片普及後,真正稀缺的是什麼;若想從創作者能力來看,也可以參考AI 影片素養與工作方法。 從觀眾到參與者:生成式戲劇的想像傳統電影是看故事,短影音是滑故事,連續短劇是追故事。下一個階段或許會是進入故事、親自做選擇。 例如,一部修仙題材的短劇演到一半,問你:「加入魔宗,還是拜入正道?」你選了魔宗,後續角色關係、任務與影片就隨之改變;另一位觀眾選擇正道,走進的可能是不同版本。 再往前一步,AI 也許能依據選擇、角色關係、道具與前情,生成下一段劇情。這種作品不只提供固定的兩三條支線,而是讓每位玩家都能走進一個略有不同的故事版本。 我會把這個方向稱為 Generative Drama,生成式戲劇。它目前更像一種內容設計的想像與目標,不是《幸存者笔记》已提供的功能。要真的做到,還得解決角色一致性、劇情品質、分支管理、生成成本與觀眾體驗等問題。 Vibe Coding 與 AI 影片正在合流以前做影片的人和做遊戲的人,常是兩群不同的創作者。現在,一個人可能用 AI 寫世界觀、劇本與角色,生成圖片、影片、配音和音樂,再請 Coding Agent 串起選項、劇情樹、存檔、成就、QTE、角色數值與結局。 最後的作品可以是 Web App、手機 App,或一款上架 Steam 的互動影遊。當創作流程從視覺素材一路延伸到程式與互動邏輯,就很難再只用「導演」、「遊戲開發者」、「程式設計師」或「內容創作者」其中一個身分概括。 他們可能是在建立一個世界,讓別人進來探索。 我更在意的是:能建立什麼值得走進去的世界?「AI 影片能不能取代真人拍攝?」或許不是最有意思的問題。 當影片開始變成可以由程式生成與串接的素材,我們能不能建立一些過去成本太高、做不起來的內容? 十年前,我們把文字變成網站;後來把圖片和影片變成社群內容。現在,文字、圖片、聲音、影片、3D 與程式碼,都正在變成可以生成與組合的素材。 所以下一步,可能不是再做一支更漂亮的 AI 影片,而是把素材串起來,建立一個觀眾可以走進去、做選擇,而且每個人的故事都不一樣的世界。 看到《幸存者笔记》時,我想到的不是「AI 現在連 Steam 遊戲都能做了」,而是 AI 短劇下一個值得探索的戰場,可能根本不在短影音平台。 當生成影片越來越便宜,我們要學的也許不只是怎麼生成影片,而是怎麼建立一個值得別人走進去的世界。 常見問答 (FAQ)Q1:AI 短劇和互動影遊有什麼不同?AI 短劇通常以觀看連續影像為主;互動影遊會讓玩家透過選擇或操作影響劇情分支。兩者結合時,影像提供故事呈現,互動系統則讓玩家參與故事走向。 Q2:《幸存者笔记》會依照玩家選擇即時生成新劇情嗎?目前 Steam 頁面說明玩家選擇與 QTE 會推進不同分支和結局,但沒有說明遊戲會在遊玩當下即時生成新劇情。因此不能把它直接當成已成熟的即時生成式戲劇案例。 Q3:AI 影片會讓互動劇情變成零成本嗎?不會。AI 可能降低部分影像素材的製作成本,但劇本、角色連貫、分支設計、剪輯、測試與品質檢查仍需要投入。每增加一條分支,也會增加整合與驗收工作。 Q4:什麼是 Generative Drama(生成式戲劇)?Generative Drama 是依據觀眾或玩家的選擇生成後續劇情的內容構想。相較於固定分支,它希望讓不同玩家走進各自稍有差異的故事;目前仍須處理劇情品質、角色一致性、成本與分支管理等問題。

  • article-【36 秒就誕生一部 AI 短劇後,我反而覺得「會生成影片」開始不值錢了】

    2026/9/14

    AI工具 內容行銷 影音行銷
    【36 秒就誕生一部 AI 短劇後,我反而覺得「會生成影片」開始不值錢了】

    你花一天做一支 AI 影片,別人一週已經做完 60 集連續劇最近看到一個數字,我覺得做 AI 影片的人真的要警覺了。 平均每 36 秒,就有一部 AI 短劇上線。 不是一支 10 秒、15 秒的 AI 炫技影片。 是「一部短劇」。 根據中央社引述澎湃新聞的統計,2025 年 8 月抖音新上線的 AI 劇只有 655 部;一年後,這個數字已達 74,313 部,占當月新劇的 75.4%。報導另指出,2026 年 7 月平均每 36 秒就有一部新的 AI 劇上線。中央社報導 更誇張的是,有些團隊已經可以做到: 5 個人,一週做完 60 集。 成本甚至不到傳統真人短劇的十分之一。 這些是媒體採訪中的個別團隊案例,不代表所有 AI 短劇都能達到相同產能或成本。不同作品的類型、品質和成本計算範圍,會讓估算出現落差。5 人團隊 7 天完成 60 集的報導、BBC 中文採訪報導存檔、另一份製作成本估算 所以當大家還在研究: 「哪個 AI 影片模型比較強?」 「提示詞怎麼寫?」 「怎麼保持角色一致?」 「怎麼做運鏡?」 我反而開始想另外一個問題: 如果影片已經多到每 36 秒就生出一部,那「會生成影片」這項能力,到底還值多少錢? 而這波 AI 短劇爆發,甚至已經養出一個以前不存在的新職業: 「抽卡師」。 什麼是「抽卡師」?不是遊戲裡抽 SSR 的那種抽卡。 現在 AI 還沒有強到你丟一本劇本進去,它就直接吐出 60 集可以播的連續劇。 所以中間還需要大量人工工作。 例如把劇本拆成場景、角色、表情、動作、鏡位、光線、運鏡,再交給模型生成。 但生成出來的東西不一定能用。 可能角色變臉。 可能手指壞掉。 可能運鏡很怪。 可能情緒完全不對。 所以你要一直生成。 生成 10 個、20 個、50 個版本,再從裡面挑一個最好的。 很像抽卡。 於是「抽卡師」就出現了。 有些複雜素材的提示詞,甚至可以寫到 5,000 字。 所以現在厲害的抽卡師,其實已經有點像: 半個導演+半個攝影+半個 AI 模型操作員。 但我反而覺得,這個職業可能不會存在太久。 因為「抽卡」本身,就是 AI 還不夠成熟的產物為什麼今天需要抽卡? 因為 AI 不穩定。 同樣一句提示詞生成十次,可能得到十種結果。 所以需要人一直生成、一直挑。 但如果未來模型可以直接讀完整劇本呢? 它自己理解人物。 自己維持角色一致性。 自己拆分鏡。 自己設計鏡位。 自己控制演員表情。 自己產生不同 Take。 甚至自己判斷哪個 Take 最好。 那還需要一個人在那邊「抽卡」嗎? 可能不用。 所以我認為: 「抽卡師」不是 AI 時代的終極新職業,而是一個過渡型職業。 就像以前很多人專門幫忙切版、修圖、上字幕。 技術進步之後,這些工作不一定完全消失,但市場價值會快速下降。 真正留下來的,反而不是「會生成的人」。 而是: 知道什麼值得生成,以及知道什麼值得留下的人。 更可怕的是,AI 已經把「內容產能」打爆了DataEye 研究院的《2026 上半年 AI 劇漫劇數據報告》統計,2026 年上半年抖音端新上線 22.19 萬部 AI 劇漫劇,其中 1,055 部播放量破億,占 0.48%。DataEye 報告摘要 如果把 5,000 萬播放當作一條粗略的盈虧平衡線,能跨過去的比例大約只有 1.3%。 換句話說: 大約做 77 部,才有一部可能跨過這條線。 這裡的 5,000 萬次播放,是 DataEye 報告採用的抖音端盈虧平衡參考線;報告也提醒,這組數據不代表所有平台與全行業的情況。它不是每一部短劇通用的保本保證。DataEye 報告摘要 這個數字才是我覺得真正值得注意的地方。 因為它告訴我們: AI 解決了「做不出來」的問題。 卻製造了一個更嚴重的問題: 大家都做得出來。 以前拍一部短劇,要演員、攝影、燈光、場地、後製。 有這些門檻存在,本身就會過濾掉大量競爭者。 現在門檻突然被 AI 打掉。 結果不是每個人都成功。 而是內容開始大爆炸。 當內容生產成本趨近於零,內容本身就會開始通膨這件事情不只發生在 AI 短劇。 我覺得接下來所有自媒體都會遇到。 文章。 圖片。 短影音。 Podcast。 知識圖卡。 電子書。 甚至線上課程。 以前一個人一週做三支影片,很厲害。 AI 出現後,一個人一天做 30 支都不是問題。 但問題來了。 當每個人都能一天做 30 支影片,你一天做 30 支影片還算優勢嗎? 不算。 這就像以前會 Photoshop 是一項專業。 後來大家都有 Canva。 現在連 Canva 都不用開,跟 AI 講一句話就做好了。 當「製作能力」被普及之後,製作能力本身的價格就會下降。 所以我最近越來越確定一件事: AI 時代真正稀缺的,不會是內容。 而是: 注意力。 所以我現在看 AI 自媒體,已經不太在意「一天可以生幾支影片」很多 AI 自媒體教學還停留在: AI 寫文案。 AI 生圖片。 AI 生影片。 AI 配音。 AI 剪輯。 AI 自動發布。 最後告訴你: 「一個人也可以經營十個帳號。」 技術上當然可以。 但這可能正在回答一個錯誤的問題。 真正的問題不是: 「我怎麼一天生 100 支影片?」 而是: 「當全世界每天多出一億支 AI 影片,為什麼有人要停下來看我的?」 這兩個問題,難度完全不同。 前一個問題是 Production。 後一個問題是 Content。 甚至再往上一層,是: Taste、Story、Distribution。 你選什麼題目? 前三秒講什麼? 故事怎麼鋪? 情緒怎麼拉? 什麼地方觀眾會滑走? 什麼東西值得被分享? 觀眾為什麼記得你? 這些能力,反而會隨著 AI 變強而變得更重要。 如果你想從「做得出影片」往「知道該做什麼」前進,可以延伸閱讀我寫過的 AI 影片素養與創作者工作方法;而選題、定位與觀眾需求,也和 短影音定位策略 密切相關。 所以未來最值錢的人,可能不是最會用 AI 的人而是最知道: 「AI 應該做什麼」的人。 AI 可以幫你一次生成 100 個鏡頭。 但你要知道哪一個是好鏡頭。 AI 可以寫 100 個 Hook。 但你要知道哪一句觀眾會停下來。 AI 可以一天產出 100 支影片。 但你要知道哪一支值得做。 所以我反而覺得「抽卡師」這個職業很有象徵意義。 今天我們還在抽「畫面」。 再過一陣子,我們可能開始抽「故事」。 抽「廣告」。 抽「課程」。 抽「產品」。 AI 可以無限生成選項。 但真正的能力,會從「生成」轉移到「選擇」。 這可能才是生成式 AI 發展到下一階段後,最值得學的一件事。 以前我們害怕: AI 會不會讓我做不出東西? 現在真正該擔心的可能已經變成: 當所有人都做得出來,我憑什麼被選中? 常見問答 (FAQ)Q1:AI 影片生成能力變普及後,學會生成還有價值嗎?有價值,但它不再是唯一差異。生成能降低製作門檻;選題、故事、審美、品質判斷與發行,會更直接影響觀眾是否停留與分享。 Q2:「抽卡師」會成為長期職業嗎?目前它反映了生成結果不穩定、需要反覆產生與人工挑選的工作。模型若能更穩定地理解劇本、維持角色並評估鏡頭,這項工作的內容可能改變;它是否消失,仍取決於技術與製作流程如何演進。 Q3:AI 影片創作者要怎麼從大量內容中被看見?先從觀眾與題目開始,再設計前三秒、故事節奏、情緒轉折和分享理由。大量產出只能增加選項,不能代替對內容品質與發行方式的判斷。 Q4:5,000 萬次播放是所有 AI 短劇的固定回本門檻嗎?不是。這是 DataEye《2026 上半年 AI 劇漫劇數據報告》用來估算抖音端盈虧平衡的參考線;作品類型、成本與發行條件不同,實際回本門檻也會不同。

  • article-AI 自動剪片做到最後,我才發現真正缺的是自己的聲音 API

    2026/9/11

    AI自動化 AI工具 影音行銷
    AI 自動剪片做到最後,我才發現真正缺的是自己的聲音 API

    最近我一直在調整自己的 AI 自動剪影片流程。 文章可以自動改成短影音腳本。 知識圖卡可以自動生成。 字幕可以自動上。 B-roll 可以自動配。 重點遮罩、動畫、轉場,甚至剪輯節奏,也都可以慢慢交給 AI。 但做到最後,我突然發現一件事。 真正還沒有被自動化的,反而是: 我的聲音。 如果每一支影片最後還是要自己重新錄旁白,那前面再怎麼自動,其實都還差最後一哩。 所以我最近開始重新研究「克隆音」。 但這次我不是想找一個: 可以把我的聲音複製得很像的 AI 工具。 我想的是另一件事: 能不能把我的聲音,直接變成 AI 自動剪片系統裡的一個 API? AI 自動剪片為什麼會卡在最後一哩?一條完整的影片工作流,現在已經可以拆成很多個可被自動化的能力: 文章自動改成短影音腳本 知識圖卡自動生成 字幕自動上稿 B-roll 自動配對 重點遮罩、動畫與轉場自動完成 剪輯節奏交給 AI 協助判斷 這些環節都完成後,旁白卻可能還是要由本人重新錄製。對個人創作者來說,這不只是多花一點時間,也會讓整套「內容工廠」在最後一步停住。 這也是我開始重新研究 Voice Clone 的原因。不過,我真正想找的不是另一個獨立工具,而是一個能被工作流穩定呼叫的聲音元件。 這個方向,也可以接到我之前整理的用 Codex 打造 AI 影片工廠:串接六大 AI 能力的完整工作流。影片工廠不只要能產生畫面,也要能把聲音當成可替換、可擴充的能力。 克隆音已經從模型訓練,走向可呼叫的工作流元件以前講 Voice Clone,很容易想到一個完整的模型訓練專案: 錄很多音訊。 整理資料。 訓練模型。 等待幾個小時。 得到一個自己的聲音模型。 但現在很多 Zero-shot TTS,已經可以只用一小段參考音訊,直接模仿聲音的音色。像是我目前正在看的: IndexTTS-2.5 Qwen3-TTS Chatterbox V3 GPT-SoVITS CosyVoice 3 Fish Speech 這些模型與版本是我目前的研究方向與工作流示例,不代表固定排名;支援的語言、情緒控制、硬體需求與授權方式,都可能隨版本和方案變動,實際使用前仍要回到各專案的官方文件確認。 有些情境甚至不需要 Fine-tune。你只要給它: 一段你的聲音 一段新的文字 它就可以直接嘗試用你的音色把文字說出來。 這讓克隆音慢慢從「模型訓練專案」,變成「可以被工作流直接呼叫的元件」。 對我來說,理想的介面不是讓剪輯系統知道底下使用哪一套模型,而是把底層差異藏起來: 12345請用我的聲音念這段文字 ↓ Voice Engine API ↓ 回傳 WAV 或音訊檔 為什麼我現在最想研究地端克隆音?如果要把克隆音塞進自動剪影片流程裡,地端有很多優勢。重點不只是省 API 費用,更重要的是控制權。 我可以自己決定: 腳本怎麼切句 一次生成多少字 情緒怎麼控制 專有名詞怎麼唸 要不要快取 生成失敗怎麼重試 哪些段落要重新生成 如何把引擎包成 REST API 最後,剪輯系統根本不用知道底下是哪一套模型。它只要送出文字與必要參數,拿回一段可以繼續進入剪輯流程的音訊。 這種抽象層很重要。今天底層是 IndexTTS,明天換成 Qwen3-TTS,甚至某一批任務改走雲端 API,上層的影片工作流都不必整套重寫。 MacBook 也能先把 Prototype 跑起來這是我最近覺得很有意思的地方。 以我目前看到的 IndexTTS-2.5 使用情境來說,它已經能在 Apple Silicon 的 MPS 環境進行推論。也就是說,M1、M2、M3、M4 這些 Mac,都有機會直接拿自己的 GPU 做實驗。 我自己的 MacBook Pro M2 Pro、16GB Unified Memory,也可以先拿來做 Prototype。 當然,16GB 記憶體不算多。如果一次生成很長的旁白,或同時開著許多應用程式,記憶體仍然會吃緊。這裡的重點不是宣稱 Mac 可以取代所有 GPU Server,而是: 30 秒短影音 1 分鐘旁白 課程分段音訊 這些任務已經足以讓個人開發者研究整條流程,先驗證切句、快取、重試與剪輯串接,再決定是否需要更大的硬體。 換句話說,不一定要先買 RTX 4090,也不一定要一開始就租 GPU Server。一台手邊的 Mac,就可以先把 Voice Engine 的 Prototype 跑起來。實際效能仍會受到模型版本、量化方式、音訊長度、背景程序與安裝環境影響。 評估克隆音,真正的重點不只是「像不像」以前評估克隆音,我們可能只問: 像本人嗎? 但真正要放進內容工廠,至少還要再問: 台灣國語自然嗎? 情緒夠不夠自然? 長文會不會開始飄? 停頓是不是像真人? 專有名詞會不會亂唸? 同一個 Voice 能不能跨語言使用? 生成速度夠不夠快? 「85% 像本人」可能還不夠。如果它每次都把 Claude 唸錯、Gemini 唸得怪怪的、ComfyUI 亂念,或把 n8n 的讀法弄得不一致,影片仍然會出戲。 所以我甚至開始想做一份自己的專有名詞發音字典。腳本進入 TTS 之前,先自動做文字前處理: 名詞 預期處理 Claude 固定適合旁白的讀法 Gemini 固定適合旁白的讀法 Anthropic 固定適合旁白的讀法 n8n 固定適合旁白的讀法 這些讀法不一定要交給模型臨場猜,而是先在 TTS 前統一替換或標記。久了以後,這套 Voice Engine 不只會越來越像我的音色,也會越來越接近我的內容風格。 如果你也在處理影片聲音,可以先參考短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流。克隆旁白解決的是「誰在說」,SFX 與混音則決定觀眾「聽起來感覺如何」,兩者應該放在同一條聲音工作流裡設計。 把「我是誰」和「我要怎麼說」拆開這件事對自動剪影片非常重要。 一支短影音不可能從頭到尾都使用同一種情緒: 開頭 Hook 可能要比較興奮 中段解釋要穩定清楚 提醒風險時要嚴肅 講到反差時可能要驚訝 最後 CTA 又要比較親切 因此,Voice Engine 可以拆成兩層: 我是誰: 聲音的音色、辨識度與個人品牌特徵。 我要怎麼說: 情緒、語速、停頓、重音與表達方式。 理想的流程會是: 1234567891011腳本 ↓AI 理解內容 ↓判斷每一段情緒 ↓選擇語速與表達方式 ↓克隆音生成 ↓送進剪輯流程 這時候 AI 就不只是單純「念稿」,而是開始理解:這句話應該怎麼說。 不想自己維護模型,雲端 TTS 也已經很成熟地端是我目前很想研究的方向,但如果不想自己維護模型,雲端方案其實已經很方便。以我目前的觀察,值得放進測試清單的包括: ElevenLabs MiniMax Fish Audio Qwen/CosyVoice Cloud Cartesia PlayHT Resemble AI Google Chirp 3 Azure Custom Voice HeyGen Synthesia 每一家定位不一樣,這份清單是研究與選型的起點,不是永久排名。若要找一個成熟基準,我會先看 ElevenLabs;如果主要做中文短影音,我會想測 MiniMax;如果在意情緒、角色感、Podcast 或漫劇,Fish Audio 會是值得研究的方向;如果以後要做即時 Voice Agent,則可以研究 Cartesia。 雲端最大的好處是不用自己處理: CUDA MPS 記憶體配置 模型環境損壞 硬體升級 API Key 拿到就可以接。對大量生產來說,這確實很省事;但費用、資料處理政策、延遲、速率限制與語音授權,仍然要依各家最新方案確認。 地端和雲端不是二選一,而是混合式 Voice Engine所以我現在反而不覺得這是一場「地端 vs 雲端」的戰爭。更合理的做法,可能是建立一層混合式 Voice Engine: 任務情境 可以優先測試的方向 平常的短影音與開發測試 地端 IndexTTS、Qwen3-TTS 或 Chatterbox 突然出現大量任務 切換 MiniMax API 英文或多語言內容 切換 ElevenLabs 情緒較重的內容 測試 Fish Audio 即時 AI Agent 對話 研究 Cartesia 這個概念其實跟現在使用 LLM 很像。我們已經不太會只問:「全世界最好的 AI 模型是哪一個?」而是開始問:「這個任務,現在應該用哪一個模型?」 未來 TTS 很可能也會一樣。真正重要的不是押中唯一答案,而是把模型做成可以替換的底層能力,讓上層工作流按照任務、成本、延遲、語言與情緒需求選擇引擎。 Voice Conversion:先把話說好,再換成我的聲音這次研究時,我看到 Seed-VC 這類 Voice Conversion 技術,反而讓我產生另一個想法。 也許不一定要要求同一套 TTS 同時做到: 聲音像我 情緒自然 節奏漂亮 表達生動 全部一次完成。 可以拆開處理:先找一個最會「說話」的 AI,讓它負責情緒、節奏、停頓與表達,再用 Voice Conversion 把聲音換成我的音色。 1234567最佳 TTS ↓先把話說好 ↓Voice Conversion ↓換成我的聲音 這個思路很有意思,因為它把「講得好」和「像我」拆成兩個不同問題。有時候,拆開反而更容易做到,也更容易針對每一段找出可以改善的地方。 我真正想做的,是自己的 Voice Layer所以我現在真正想做的,其實不是找最好用的克隆音。 我想做的是自己的Voice Layer。 未來不管是: 短影音 線上課程 Podcast AI 新聞 數位分身 AI Agent 互動式課程 全部都可以呼叫同一層聲音服務。 輸入文字以後,它自己決定: 該用哪個 Voice Engine 該用什麼情緒 語速多少 專有名詞怎麼念 是否需要快取或重新生成 最後回傳一段聽起來像我的聲音。 到了這一步,克隆音就不再只是一個 AI 工具,而會變成個人品牌的一層基礎設施。 我現在越來越覺得,AI 自動剪片真正的最後一哩,不是剪輯,而是: 讓整套系統,真正開始用你的聲音說話。 常見問答 (FAQ)Q1:什麼是個人的 Voice Layer?Voice Layer 是放在內容工作流和底層 TTS/Voice Conversion 模型之間的一層聲音服務。它可以統一處理音色、情緒、語速、專有名詞、快取、錯誤重試與模型切換,讓影片、課程、Podcast 或 AI Agent 都用同一個介面呼叫聲音能力。 Q2:做地端克隆音一定要先買 RTX 4090 嗎?不一定。以文章中的 Prototype 情境來說,Apple Silicon Mac 的 MPS 可以先用於短影音、短旁白或課程分段音訊測試;但長音訊、批次任務和多工執行仍可能受到 16GB Unified Memory 等硬體限制,實際速度要依模型版本與設定測試。 Q3:地端 Voice Clone 和雲端 TTS 應該怎麼選?如果在意資料控制、成本可預測、切句與重試邏輯,地端比較適合做日常與 Prototype;如果需要大量生產、快速接 API 或多語言服務,雲端比較省維護成本。更彈性的做法是建立混合式 Voice Engine,依任務切換不同引擎。 Q4:克隆音怎麼避免把 Claude、Gemini 或 n8n 唸錯?可以在文字送進 TTS 前建立專有名詞發音字典,先把 Claude、Gemini、Anthropic、n8n 等詞轉成固定讀法或標記,再進行語音生成。這比每次都讓模型自行猜讀音,更容易維持影片之間的一致性。 Q5:Voice Conversion 和 TTS 有什麼差別?TTS 主要負責把文字說成語音,通常也會處理語速、情緒、停頓與表達;Voice Conversion 則是在已有語音表現的基礎上轉換音色。兩者可以拆開使用:先用擅長表達的 TTS 把話說好,再用 Voice Conversion 換成個人音色。

  • article-短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流

    2026/9/9

    AI工具 影音行銷
    短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流

    做短影音時,很多人會把注意力放在畫面:怎麼剪、怎麼轉場、怎麼加字幕、怎麼做 B-roll。 但實際剪完之後,常常會發現一件事: 畫面看起來沒問題,卻總覺得少了一點「節奏」。 很多時候,差的就是音效(Sound Effects, SFX)。 音效不是拿來吵,也不是每一刀都要加一個「咻」。真正好的音效,是幫畫面增加「感覺」。 畫面放大時,觀眾不只看到 Zoom,也聽到 Whoosh;重點字出現時,不只看到文字跳出來,也同時聽到 Ding 或 Impact。這些聲音會讓觀眾更自然地感受到: 「這裡有變化。」 這件事其實也跟 Pattern Interrupt 很有關係: 畫面的 Pattern Interrupt 是看得到的變化,音效則是聽得到的 Pattern Interrupt。 先把短影音聲音拆成三層如果你剛開始剪影片,不需要一次學很複雜。先把短影音的聲音分成三層,就能建立清楚的混音順序。 第一層:人聲 Voice人聲最重要。不管配樂多好聽、音效多厲害,只要觀眾聽不清楚你在講什麼,整支影片基本上就失敗了。 第二層:背景音樂 BGMBGM 負責情緒與整體氣氛,例如科技感、輕快、溫暖、懸疑、熱血或專業感。這一層可以用 Suno 產生;如果你在意公開播放或商業使用,也可以先參考在 Suno 做了一首歌,想公開播放?小心踩雷!《安心播放三重門》正式指南。 第三層:音效 SFXSFX 負責節奏與強調,例如: 咻!叮!啵!砰!喀! 短影音真正開始「有剪輯感」,很多時候就是從這一層開始。 所以我建議固定採用這個順序: 人聲 → BGM → SFX 先讓人聲清楚,再加入音樂,最後才用音效補節奏。 新手先用剪映內建音效就夠了如果平常使用剪映或 CapCut,其實內建音效已經可以應付大部分短影音需求。CapCut 官方的 Sound Effects 頁面提供 Transition、Magic、Laugh、Fight、Horror 等分類,也可以搜尋 whoosh、click、explosion 等關鍵字。 基本操作邏輯很簡單: 音訊 → 音效 → 搜尋 有一個很建議新手記住的技巧: 中文搜尋不到,就搜尋英文。 很多常用的短影音音效,本來就是用英文名稱分類。先從搜尋開始,不需要一開始就下載一大堆素材。 短影音最常用的音效,先記住這些其實不需要收藏幾百個音效。先掌握下面這些,就已經可以應付大部分 Reels、Shorts 與商品短影音。 音效 可以搜尋 適合使用情境 咻、刷過 Whoosh / Swoosh / Swish 畫面切換、Punch In 輕微咻聲 Soft Whoosh 圖卡、字幕出現 叮 Ding / Chime 答案、重點、完成 啵 Pop 圖示、文字跳出 點擊聲 Click / Tap App、按鈕、介面操作 撞擊聲 Impact / Hit 強調重點句 低沉轟聲 Boom / Bass Hit 震撼、結論、反轉 上升音 Riser / Rise 揭曉之前、製造期待 低頻下降 Bass Drop / Sub Drop 反轉、結論 掃過 Sweep 轉場 故障聲 Glitch AI、科技、錯誤 閃亮聲 Sparkle / Magic / Twinkle AI 生成、變身、完成 相機快門 Camera Shutter 照片、Before / After 打字 Typing / Keyboard ChatGPT、電腦操作 通知 Notification LINE、訊息、提醒 錯誤聲 Error / Buzzer NG、錯誤觀念 嗶聲 Beep 警告、消音 唱片急停 Record Scratch 反轉、「等等!」 倒轉 Rewind 回到前面重新解釋 心跳 Heartbeat 緊張、倒數 掌聲 Applause / Cheer 成功、完成 金幣聲 Coin / Cash Register 價格、營收、賺錢 如果你真的只想先背幾個,我會挑這 8 個: Whoosh、Ding、Pop、Click、Impact、Riser、Glitch、Sparkle 先把這八個用熟,比收藏 500 個音效更有用。 音效應該放在哪裡?先對齊畫面變化這才是真正重要的地方。不是「有 Cut 就放音效」,而是問自己: 這個畫面變化,有沒有需要讓觀眾聽見? Punch In:畫面拉近時人物本來是中景,講到: 「但真正重要的是這件事。」 畫面突然拉近,這時候可以放一個 Whoosh,讓放大的感覺更明顯。 大字突然出現畫面跳出: 錯! 可以配 Impact。視覺與聲音會同時告訴觀眾: 這一句很重要。 正確答案出現例如: 「答案就是 ChatGPT。」 配 Ding,會產生「答案揭曉」的感覺。 三個項目依序出現畫面依序出現: ChatGPT Pop Gemini Pop Claude Pop 這種音效不是拿來炫技,而是在幫觀眾感受到「一、二、三」的節奏。 AI 生成完成例如: Before ↓ AI 處理 ↓ After 最後成果出現時,可以配 Sparkle / Magic,讓觀眾自然理解:「完成了。」 如果你也在處理字幕與剪映流程,可以延伸閱讀 AI 影片字幕工作流:結合 Gemini 與剪映的極速上字幕教學;字幕與音效同樣都需要對齊畫面節奏。 音效不是越多越好這是新手非常容易犯的錯。有人第一次發現 Whoosh 很好用,就開始: 咻、咻、咻、咻、咻…… 每一個轉場都放,最後反而很累。 音效跟 Pattern Interrupt 一樣: 重點不是多,而是放在該放的地方。 可以先用下面這個簡單原則判斷: 畫面狀況 音效建議 一般 Cut 不一定需要音效 有明顯動作 可以考慮 Whoosh 有重要資訊 可以考慮 Ding、Pop、Impact 有情緒轉折 可以考慮 Record Scratch、Bass Drop、Riser 有特殊場景 才需要特殊環境音或 AI 生成音效 剪映找不到時,從 Mixkit 與 Pixabay 補素材Mixkit:建立免費 SFX 素材庫如果剪映裡真的找不到,我第一個會推薦學員去 Mixkit。 Mixkit 提供大量免費 Sound Effects,包含 Swoosh、Transition、時鐘、掌聲、電話鈴聲與科技類音效。官方頁面也將素材分成 Transition、Impact、Whoosh、Click、Ding、Notification、Glitch 等類型,適合用英文關鍵字快速搜尋。 Mixkit 的說明指出,Sound Effects 可用在個人與商業專案,例如 YouTube、社群內容與線上行銷廣告,且不強制署名。不過,實際使用前仍建議查看素材頁與當下授權條款。 所以很適合先搜尋: whoosh impact click notification 然後下載幾個自己喜歡的版本。 Pixabay:免費、可修改,但要看完整授權Pixabay 不只有圖片和影片,也有音訊與 Sound Effects。 依 Pixabay 目前的 Content License Summary,一般內容可以免費使用、修改,也不強制署名;但不能把原始素材單獨拿去重新販售或散布。如果素材含有可辨識的商標、Logo 或品牌,商業使用可能還有額外限制;某些內容也可能涉及第三方的著作權、商標權或肖像權。 因此,如果是 YouTube、Reels、Shorts 或商業社群影片,Pixabay 很方便,但不要把「免費」直接等同於「任何情境都不用確認授權」。 我的順序通常會是: 剪映內建 → Mixkit → Pixabay 大部分需求到這裡就能解決。 什麼時候才需要 AI 生成音效?當你要的聲音很具體,而素材庫不好找時,才值得使用 AI。 例如: 一列火車從遠方靠近,先聽到警笛,再經過身旁。 或是: 未來科技實驗室裡,機械手臂啟動的聲音。 又或者: 一顆巨大水滴落進金屬容器,再產生長尾回音。 這種聲音不太適合一直翻音效庫,直接用 AI 描述反而更快。 Adobe Firefly Sound Effects:特殊音效首選Adobe Firefly 現在提供 Generate Sound Effects,可以直接用文字描述音效,也能上傳影片或音訊作為參考,還能用自己的聲音或錄音來引導生成。 依 Adobe 目前官方說明,免費帳號有每日免費生成額度;正式版 Firefly 產出的 Sound Effects,在遵守 Adobe 指南與商業版本條件下,可用於商業用途。音效檔可下載為 WAV;上傳影片或音訊作為組合素材時,目前支援的檔案最長為 30 秒。功能、額度與授權都可能調整,正式使用前請再次查看 Adobe Firefly 說明 與官方 Sound Effect Generator 頁面。 例如輸入: distant passenger train horn approaching, realistic railway ambience 就可以生成「遠方列車逐漸靠近的警笛與環境聲」方向的音效。 如果我是現在重新設計這堂課,我會把 Firefly 排成: 特殊音效 AI 首選 ElevenLabs:適合快速試做與比較如果你以前有用 ElevenLabs 生音效,現在仍然可以繼續用。它的 Sound Effects 功能可以直接用文字生成指定聲音。 依 ElevenLabs 目前官方方案頁,免費帳號每月有 10,000 credits,約可進行 50 次 Sound Effects generation,單段最長 30 秒;但免費方案標示為 Personal use only,商業用途需要付費方案。付費帳號的 Sound Effects 可依方案用於商業影片、YouTube、社群與廣告。方案、額度與授權可能變動,請以 ElevenLabs Sound Effects 的最新說明為準。 因此我會這樣分: 課堂練習、測試ElevenLabs Free 很適合先測試提示詞與聲音方向。 客戶影片、正式商業用途先確認授權,或使用符合需求的付費方案。 AI 音效提示詞,也有公式其實跟 AI 生圖、AI 生影片很像,不要只輸入: 火車聲。 資訊太少。 我會用這個公式: 聲音主體 + 動作 + 距離 + 環境 + 強度 + 時長 + 排除項目 火車警笛 Realistic passenger train horn approaching from a distance, outdoor railway ambience, powerful but natural, 3 seconds, clean sound effect, no music, no speech. 短 Whoosh Short soft whoosh, fast left-to-right motion, clean video transition sound, 0.5 second, no music. Ding Single bright notification ding, crisp and clean, positive feeling, 0.5 second, no background music. 重點撞擊 Deep cinematic impact hit, short and powerful, strong low-frequency punch, 1 second, no music. 你會發現,提示詞不是寫得很文青,而是: 把你想聽到的聲音講清楚。 建立自己的 SFX Starter Pack短影音剪久了之後,不需要每次重新搜尋。我建議建立自己的音效資料夾: 123456789101112131415161718192021222324252627282930313233SFX Starter Pack01_Transitions whoosh_soft whoosh_fast swoosh sweep02_UI click tap ding pop notification03_Emphasis impact_soft impact_heavy boom bass_drop04_Emotion fail_buzzer record_scratch sparkle applause05_Ambience typing camera crowd street rain 差不多 20 個左右,就已經可以剪非常多影片。 重點不是蒐集音效,而是: 慢慢建立自己熟悉、知道什麼時候可以用的音效庫。 把整個短影音音訊流程串起來如果是新手,我會建議固定這個工作流: 先處理人聲 ↓ Suno 產生 BGM ↓ 剪映加入常用 SFX ↓ 找不到特殊音效? ↓ Adobe Firefly/ElevenLabs 生成 ↓ 最後混音與檢查 音量可以先從下面的數字當作「起始參考」。以下比較接近剪輯軟體中的峰值概念,不是所有素材都必須固定在同一個數字: 🎤 人聲:約 -3 ~ -6 dB 💥 SFX:約 -10 ~ -15 dB 🎵 BGM:約 -18 ~ -24 dB 最後還是要依素材、播放設備與平台需求調整。最重要的只有一句: 最後用耳朵確認,人聲永遠要最清楚。 給新手最簡單的結論如果不想一次學太多工具,可以先記這三個: 剪映處理 80% 常用音效。 Mixkit建立自己的免費 SFX 素材庫。 Adobe Firefly Sound Effects處理素材庫找不到的特殊聲音。 然後 Suno 負責 BGM。 這樣其實就已經是一套很完整的短影音聲音工作流。 真正讓影片變好看的,不是音效越多,而是你開始知道: 哪一個地方,需要讓觀眾不只「看到變化」,還要「聽到變化」。 這才是音效在短影音裡真正的價值。 常見問答 (FAQ)Q1:短影音裡的 SFX 和 BGM 有什麼差別?BGM 負責整支影片的情緒與背景氣氛;SFX 負責對齊畫面中的動作、重點與轉折,讓觀眾在特定瞬間「聽到變化」。兩者都不能蓋過清楚的人聲。 Q2:短影音每一次 Cut 都需要加入音效嗎?不需要。一般 Cut 可以不加音效;有明顯動作、重要資訊、情緒轉折或特殊場景時,再考慮使用 Whoosh、Ding、Impact、Riser 或環境音。 Q3:新手應該先用哪一個工具找音效?建議先用剪映或 CapCut 內建音效,再用 Mixkit 與 Pixabay 補充免費素材;只有當素材庫找不到具體聲音時,才使用 Adobe Firefly 或 ElevenLabs 生成。 Q4:AI 生成音效可以直接用在商業影片嗎?要看工具、方案與當下授權條款。Adobe Firefly 官方目前說明商業版本產出的音效可依指南用於商業用途;ElevenLabs 則標示免費方案限個人使用,商業用途需使用符合條件的付費方案。Mixkit 與 Pixabay 也各自有授權限制,正式使用前應查看最新官方條款。 Q5:AI 音效提示詞要寫哪些資訊?至少寫清楚聲音主體、動作、距離、環境、強度、時長與排除項目,例如「遠方靠近的列車警笛、戶外鐵路環境、自然但有力量、3 秒、不要音樂與人聲」。

  • article-當 AI 生成影片比你看得還快:真正的「無限影片」開始了

    2026/9/1

    AI工具 內容行銷 影音行銷
    當 AI 生成影片比你看得還快:真正的「無限影片」開始了

    15 秒的 AI 影片,要生成多久? 9 秒。 乍看之下,好像只是 AI 影片又變快了。 但我覺得,真正值得注意的根本不是「9 秒」。 而是 AI 影片跨過了一條很重要的線:生成速度,開始超過播放速度。 這件事可能比「畫質又提升多少」重要得多。 本文提到的 H3 Max、Infinite Slop、Nothing, Forever,以及影片生成成本,依使用者提供的觀察與估算整理。模型版本、服務狀態、推論速度與價格都可能變動,實際使用時仍應以當下方案為準。 只要生成速度超過播放速度,影片就可以沒有結局8 月 29 日,fal 工程師 Rehan Sheikh 把影片生成模型接上 Twitch,做了一台永遠播不完的「無限跨次元電視」。 底下跑的是 fal 的 H3 Max。官方數字是:5 秒影片,3 秒內生成。後來獨立開發者 Pieter Levels 實測,15 秒影片大約 9 秒跑完。 為什麼這個數字重要? 因為只要: 生成時間 < 播放時間 當你還在看前面 15 秒時,AI 已經把後面 15 秒生好了。你開始看第二段,AI 又繼續生成第三段。 115 秒 → 15 秒 → 15 秒 → 15 秒 → …… 只要生成佇列沒有中斷,理論上就能永遠延伸下去。 觀眾正在做什麼 AI 同時在做什麼 播放第 1 段 15 秒影片 生成第 2 段 15 秒影片 播放第 2 段 15 秒影片 生成第 3 段 15 秒影片 播放第 3 段 15 秒影片 生成第 4 段 15 秒影片 所以未來 AI 影片模型比的,可能不再只是: 一次可以生成幾秒? 而是: 能不能永遠比觀眾快一步? 這會把 AI 影片的競爭,從「單次生成品質」推向「持續生成能力」。 三年前,無限的是劇本,不是畫面其實「永遠播不完的 AI 節目」,三年前就有人做過。 2022 年底,Twitch 出現一個很有名的頻道:Nothing, Forever。它可以 24 小時不斷演出 AI 情境喜劇。 但當年的方法其實完全不同。 角色、場景與 3D 資產都事先準備好,再由 Unity 即時排列組合。AI 主要負責生成對白。 換句話說,當時比較像: 1AI 編劇 + TTS + 遊戲引擎 三年前我們做到的是:劇本永遠寫不完。 但今天不一樣。 人物可以生成,場景可以生成,動作可以生成,鏡頭可以生成。甚至連「下一秒的世界長什麼樣子」,都可以下一秒再決定。 Nothing, Forever Infinite Video 角色、場景與 3D 資產預先準備 人物、場景與鏡頭可以即時生成 AI 主要生成對白 AI 直接生成畫面本身 無限延伸的是劇本 無限延伸的是世界 所以我覺得這次最值得記住的一句話是: 三年前,無限的是劇本。現在,無限的是畫面本身。 AI 開始即時生成世界,而不只是幫你做影片更有趣的事情,很快就發生了。 十幾個小時後,Pieter Levels 自己做了一個互動版本:Infinite Slop。 觀眾在聊天室輸入什麼,AI 就嘗試把它變成下一段影片,而且還會試著延續前面的故事。 例如有人說:「讓恐龍出現。」下一段真的可以出現恐龍。有人說:「去東京。」故事就可以往東京發展。 這時候,整個媒體邏輯其實已經變了: 1觀眾 → AI → 影片 → 觀眾 → AI → 下一段影片 觀眾不只是 Audience,觀眾本身開始變成 Prompt。 以前是創作者先完成內容,再交給觀眾觀看;現在則可能是觀眾提供方向,AI 即時生成內容,再把新的內容交回觀眾。 這已經不只是「AI 幫你做影片」,而是 AI 開始替你生成一個可以持續變化的世界。 為什麼 AI 電影可能不是最有趣的終點?現在大家聊 AI Video,很容易問: 什麼時候可以直接生成一部兩小時電影? 但這可能是在用舊媒體的框架,理解一個新媒體。 因為如果影片可以即時生成,為什麼還一定要是一部固定的電影? 它可能變成: AI 實境秀 AI VTuber AI 兒童故事 AI 連續劇 AI NPC 世界 AI 購物頻道 永遠不會完結的直播節目 更進一步,未來甚至可能不是「100 萬人看同一部電影」,而是「100 萬人看 100 萬個版本」。 你喜歡懸疑,AI 就讓故事更懸疑。你喜歡東京,故事就往東京發展。某一段你快轉,AI 知道你沒興趣;某個角色出現時你停留很久,AI 知道你可能喜歡他。 影片開始不是「播放給你看」,而是:一邊播放,一邊為你生成。 今天我們叫: Video on Demand 未來搞不好會變成: Reality on Demand 你選的不再是哪一部影片,而是: 今天,我想進入什麼世界? 如果你想先理解 AI 影片時代需要哪些判斷能力,也可以延伸閱讀〈學 AI 影片,你最不該做的,可能是先去學怎麼當導演〉。 真正卡住 AI 的不是技術,而是推論成本不過,現在真正卡住 AI 的,已經不是技術。 是錢。 Rehan Sheikh 後來自己算了一筆帳:如果 H3 Max 480p 標準價格以每秒成品影片 0.05 美元計算,24 小時不停生成的成本大約是: 一天:約 4,320 美元 一個月:約 129,600 美元 一年:接近 158 萬美元 而且這還只是影片推論成本,還沒有算頻寬、儲存、直播服務、監控與其他營運支出。 因此現在其實是一個很有趣的階段:能力已經到了,速度開始到了,但經濟模型還沒到。 Infinite Slop 能一直跑,其中一個原因就是 fal 在贊助運算成本。這也提醒我們,Demo 可以先證明「做得到」,但要變成真正的新媒體,還需要讓它「長期付得起」。 接下來真正值得觀察的,不只是「下一代模型快多少」,而是三條曲線: 曲線 代表的問題 能力 ↑ AI 能不能生成更穩定、更連貫的世界? 速度 ↑↑ 能不能持續跑在觀眾播放速度之前? 成本 ↓ 這種內容能不能長時間、低成本運作? 當這三條線真正交會,Infinite Video 才會從一個很酷的 Demo,變成真正的新媒體。 9 秒只是數字,跨過那條線才是新聞所以如果只把這件事情理解成: 現在 AI 生成 15 秒影片只要 9 秒。 我覺得反而小看它了。 真正重要的是:AI 影片第一次開始生得比人類看得還快。 今天是 9 秒,以後可能是 6 秒、3 秒,甚至接近即時。 當「生成速度 > 消費速度」之後,我們真正該問的就不再是: AI 可以幫我多快做完一支影片? 而是: 如果影片根本不需要做完呢? 沒有固定片長,沒有固定劇本,也沒有真正的大結局。甚至每個人看到的,都不是同一個故事。 我覺得 AI Video 下一階段真正有意思的方向,可能不是「把現在的影片做得更便宜」,而是開始出現以前根本不存在的內容形式。 從生成影片,到生成節目,最後可能是:即時生成一個你正在觀看的世界。 常見問答 (FAQ)Q1:什麼叫做 AI 影片的生成速度超過播放速度?如果一段 15 秒影片可以在 9 秒內生成,代表觀眾播放前一段影片時,AI 有機會提前準備好下一段。當生成時間持續小於播放時間,內容就能透過分段接續,理論上不斷延伸。 Q2:Infinite Video 和 Nothing, Forever 有什麼不同?Nothing, Forever 主要使用預先準備的角色、場景與 3D 資產,再由 AI 生成對白並即時排列;Infinite Video 則進一步讓人物、場景、動作與鏡頭都能即時生成,因此無限延伸的不只是劇本,也包含畫面世界。 Q3:為什麼即時生成影片不一定會先變成兩小時 AI 電影?因為即時生成允許內容依觀眾輸入、停留與互動持續改變,固定片長的電影不一定能發揮這種特性。AI 實境秀、互動連續劇、AI NPC 世界或個人化直播,可能更符合這種新媒體形式。 Q4:目前 Infinite Video 最大的限制是什麼?目前最大的限制之一是推論成本。即使影片生成速度已經快到能追上播放,若每秒成品影片的成本仍然很高,長時間直播就很難形成可持續的商業模式;模型能力、速度與成本必須同時改善。