跳到主要內容

部落格

不定期分享最新資訊文章

  • article-我覺得 VoiceStudio 最值得注意的地方,根本不是免費

    2026/9/15

    AI自動化 AI工具 影音行銷
    我覺得 VoiceStudio 最值得注意的地方,根本不是免費

    最近看到一套開源 AI 語音工具 VoiceStudio。 它可以在自己的電腦執行,支援 TTS、語音複製、多角色語音與影片配音,也不需要每個月再付一筆訂閱費。 看到這裡,很多人的第一個反應可能是: 那我是不是可以不用訂 ElevenLabs 了? 但我研究完之後,反而覺得「免費」可能是這套工具最不重要的地方。 真正讓我感興趣的是另外一件事情: AI 配音,正在從一個「工具」,變成 AI 工作流裡的一個「節點」。 本文談的是我對 VoiceStudio 與本地語音工作流的觀察,不是對不同語音服務的固定排名。實際功能、模型支援、硬體需求與授權方式,都應以當下的專案文件與模型授權條款為準。 我們現在用 AI,其實還是在「操作軟體」想一下現在大部分人怎麼做 AI 影片。 先叫 ChatGPT 寫腳本。 複製文字。 打開配音網站。 貼上文字。 選聲音。 按生成。 下載音檔。 再打開剪輯軟體。 匯入音訊、對字幕、找 B-roll、剪輯、輸出。 看起來整個流程用了很多 AI,但其實中間有一個很重要的角色一直沒有消失: 你。 你還是那個負責把 A 工具的結果複製到 B 工具,再把 B 工具的結果下載下來丟進 C 工具的人。 換句話說,AI 很厲害,但你還是一個「AI 工具操作員」。 這也是我之前思考 AI 影片工廠時,會把腳本、配音、字幕、素材與剪輯拆成不同能力的原因。可以先參考用 Codex 打造 AI 影片工廠:串接六大 AI 能力的完整工作流,影片工廠真正要處理的,不只是多找到幾個好用工具,而是讓每個能力可以被下一個步驟穩定接住。 真正的改變,是你連 VoiceStudio 都不用打開VoiceStudio 讓我感興趣的,不只是它可以在本地執行。 而是這類工具開始提供 API、MCP 之類可以讓其他程式直接呼叫的介面。 這件事情看起來很工程師,對內容創作者其實非常重要。 因為當一個 AI 工具可以被程式呼叫之後,「人」就不一定要站在中間了。 例如我最近一直在研究 AI 自動剪輯。 理想中的流程不是: 1我打開 ChatGPT → 打開配音軟體 → 打開剪輯軟體 而是: 1234567891011121314151617文章完成 ↓AI 自動整理成短影音腳本 ↓自動送進本地 Voice Clone ↓產生我的聲音 ↓自動分析旁白時間軸 ↓自動尋找 B-roll ↓自動產生字幕與字卡 ↓自動剪輯 ↓輸出成片 如果這條流程真的串起來,我根本不需要知道 VoiceStudio 的「生成」按鈕在哪裡,甚至不用打開 VoiceStudio。 因為它已經從「我要操作的軟體」,變成「我的 AI 員工背後會使用的一項能力」。 我覺得這才是接下來真正重要的改變。 以後我們可能不會在意「你用哪一套 AI」現在很多人在比較: ChatGPT 還是 Claude? ElevenLabs 還是 VoiceStudio? 這個生圖模型比較強,還是那個比較強? 這些當然重要,但如果 Agent 的發展繼續下去,我猜這些問題的重要性會慢慢降低。 因為使用者最後看到的可能根本不是工具。 你只會跟 AI 說: 把這篇文章做成三支短影音。 剩下的事情由 Agent 自己決定。 1234567需要寫腳本,就呼叫文字模型需要圖片,就呼叫生圖模型需要我的聲音,就呼叫本地 Voice Clone需要字幕,就呼叫語音辨識需要素材,就去素材庫搜尋需要剪輯,就呼叫影片處理工具最後丟三支影片給我挑 這時候,ChatGPT、VoiceStudio、FFmpeg、Whisper 或其他模型,全部退到後台。 使用者根本不需要看到它們。 這不代表底層工具不重要,而是工具的價值開始從「使用者介面有多順」延伸到「能不能穩定成為其他系統可呼叫的能力」。 本地 AI 真正有趣的地方,也不只是省錢很多人談 Local AI,第一件事情就是算成本: ElevenLabs 一個月多少錢? 本地模型是不是免費? 跑在自己的電腦上是不是比較便宜? 如果只是偶爾做幾支影片,我甚至覺得這不是最重要的問題。 雲端服務通常比較方便,模型可能也更穩定;本地方案則會多出硬體、安裝、更新、維護與排錯成本。軟體可以免費使用,也不代表每個語音模型都能免費商用,實際使用前仍要確認各自的授權條款。 真正有趣的是: 當 AI 能力搬到自己的電腦,它開始變成你可以控制的基礎設施。 不用每一次都開網頁。 不用每一次都上傳資料。 也不用每一次都等人按下「生成」。 只要電腦開著,Agent 就可以自己呼叫。 這對一天做一支影片的人,差異可能還不大。 但如果未來你不是一天做一支,而是讓 AI 一次處理 20 支、50 支,甚至 100 支內容,整個思考方式就完全不一樣了。 你不再是在找: 最好用的 AI 配音網站。 你是在建立: 我的 AI 內容基礎設施。 聲音,也正在變成一種可以重複使用的數位資產另外一個我覺得很有意思的變化,是「自己的聲音」。 以前聲音不是資產。我要錄一段新的內容,就必須重新開麥克風講一次。 講錯一句,重新錄。 課程改了一句,重新錄。 想做英文版,再錄一次。 但是 Voice Clone 出現之後,邏輯開始改變。 我的聲音可以被抽象成一個可以重複呼叫的能力。 今天拿來做短影音。 明天拿來補錄線上課程。 後天文章自動轉 Podcast。 甚至同一支內容自動產生不同語言版本。 所以未來自媒體經營者要管理的,可能不只有文章、圖片、影片與 Prompt,還會多一個東西: 自己的 Voice Profile。 它會跟 Logo、品牌色、字型、人物 LoRA 一樣,逐漸變成個人品牌的數位資產。 但這種資產也需要被好好管理:聲音樣本的保存、誰可以呼叫、哪些內容可以生成、是否允許商用,以及被濫用時如何撤銷,都不能只靠「模型很像」來處理。 把「我是誰」和「我要怎麼說」拆開這件事對自動剪影片非常重要。 一支短影音不可能從頭到尾都使用同一種情緒: 開頭 Hook 可能要比較興奮 中段解釋要穩定清楚 提醒風險時要嚴肅 講到反差時可能要驚訝 最後 CTA 又要比較親切 因此,Voice Engine 可以拆成兩層: 我是誰: 聲音的音色、辨識度與個人品牌特徵。 我要怎麼說: 情緒、語速、停頓、重音與表達方式。 理想的流程會是: 1234567891011腳本 ↓AI 理解內容 ↓判斷每一段情緒 ↓選擇語速與表達方式 ↓Voice Clone 生成 ↓送進剪輯流程 這時候 AI 就不只是單純「念稿」,而是開始理解:這句話應該怎麼說。 如果你也在處理影片聲音,可以延伸參考短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流。克隆旁白解決的是「誰在說」,SFX 與混音則決定觀眾「聽起來感覺如何」,兩者應該放在同一條聲音工作流裡設計。 我不太想問「VoiceStudio 能不能取代 ElevenLabs」因為我覺得這個問題太小了。 ElevenLabs 好不好用?當然好用。 VoiceStudio 免費嗎?軟體本身確實可以免費使用,但實際使用的語音模型仍要確認各自授權。 真正值得測試的是: 我能不能把 VoiceStudio 塞進自己的 AI Short Factory,然後以後根本不用打開它? 如果可以,那代表配音這件事情已經從: 我要做的工作 變成: AI 自己會完成的一個步驟 再往後,生圖是一個節點,配音是一個節點,字幕是一個節點,B-roll 是一個節點,剪輯是一個節點,發布也可能是一個節點。 當這些節點全部串起來,我們真正建立的就不再是一堆 AI 工具,而是一條: AI 內容生產線。 所以 VoiceStudio 免費這件事情,我當然很開心。 但比免費更讓我興奮的是: 我們正在慢慢進入一個「不用操作 AI 工具」的時代。 真正值錢的能力,也會從「你會多少 AI 工具」,逐漸變成: 你能不能把這些 AI 能力,組成一套會自己工作的系統? 這可能才是 AI 自媒體下一階段真正拉開差距的地方。 常見問答 (FAQ)Q1:VoiceStudio 最值得注意的地方是免費嗎?不只是免費。更值得注意的是,VoiceStudio 這類本地語音工具若能透過 API 或 MCP 被其他程式呼叫,就有機會成為 AI 內容工作流裡的語音節點,讓配音從手動操作變成可重複執行的步驟。 Q2:接進 AI 工作流後,還需要打開 VoiceStudio 嗎?理想上不需要。當 Agent 已經能透過 API 或 MCP 呼叫語音能力,使用者只要提出「把文章做成短影音」這類目標,VoiceStudio 可以在後台完成配音;但實際能否做到,仍取決於工具提供的介面、設定方式與整合品質。 Q3:本地 AI 語音一定比較省錢嗎?不一定。本地執行可能減少訂閱或按量計費,但仍要計入硬體、安裝、更新、維護、電力與排錯成本;此外,軟體免費也不代表所使用的語音模型都允許免費商用,必須逐一確認授權。 Q4:自己的 Voice Profile 可以當成個人品牌資產嗎?可以把它視為一種可重複呼叫的數位資產,但需要同時管理聲音樣本、存取權限、生成範圍、商用許可與撤銷機制。聲音相似度只是品質的一部分,不等於完整的品牌治理。

  • article-【Google Flow 的 /orbit 到底是什麼?從 Veo 到 Omni Flash,一次搞懂 AI 影片的運鏡指令】

    2026/9/14

    AI工具 影音行銷 Gemini
    【Google Flow 的 /orbit 到底是什麼?從 Veo 到 Omni Flash,一次搞懂 AI 影片的運鏡指令】

    最近我看到一個有趣的 Google Flow 用法:生成影片時,只輸入 /orbit,畫面就像替主體加上環繞運鏡。其他人也會整理 /dollyin、/tracking、/lowangle、/macro、/goldenhour、/ugcunboxing 等斜線寫法,看起來很像產品裡藏了一套秘密指令。 研究後我更想弄清楚的,不是還有幾百個指令,而是這些詞背後共通的攝影語言。理解鏡頭怎麼移動、如何構圖、光線如何呈現,才能把這些概念帶到 Veo、Gemini Omni Flash,或其他能以自然語言生成影片的模型。 /orbit 是 Google Flow 的官方指令嗎?目前查閱 Google Flow 的官方影片建立說明,流程是用提示詞描述場景,再選擇模型、比例與片長;我沒有在這份說明中找到 /orbit 或名為 Google Flow Slash Command API 的公開指令定義。因此,較穩妥的理解是:這些斜線詞是創作者整理的 Prompt Shorthand(提示詞快捷寫法),不是已確認的官方 API。 這不代表輸入 /orbit 一定沒有作用,而是不能假設斜線會觸發一個保證存在的程式指令。實際生成可能受 orbit 這個詞、上下文與各模型的語意理解影響;想讓需求更清楚,可以把它改寫成完整句子: 1The camera smoothly orbits around the subject. orbit 本身就是常見的攝影運鏡概念。類似地,dolly in 是攝影機向主體推進,tracking shot 是跟著人物或物件移動,low-angle shot 是低角度拍攝,macro shot 是微距特寫,而 golden hour 描述的是接近日出或日落的暖色光線。 真正值得記住的是可跨模型使用的攝影語言如果只記 /orbit,介面改版或另一個模型不認得斜線寫法時,這個捷徑就可能失效。若記住 Orbit Shot=環繞運鏡,你就能再補上方向、幅度、速度與主體位置,把同一個想法展開成不同細節層級的提示詞。 在 Google Flow 裡,影片模型與支援功能會因選用的模型而不同;官方也建議生成前確認目前的模型與設定。Gemini Omni Flash 官方提示指南則明確提到場景、鏡頭運動、光線與情緒等描述方式。這些資料支持「攝影語言可以用自然語言表達」的做法,但不代表所有模型都會以相同方式遵循提示詞。 把 AI 影片提示詞拆成五個層級以 Orbit 為例,可以從一個簡短概念逐步增加控制資訊: Level 1:先給運鏡名稱1/orbit 這是最精簡的快捷寫法,只表達「希望鏡頭環繞主體」。 Level 2:回到標準攝影語言1Orbit around the subject. 拿掉斜線後,仍然保留同一個運鏡概念。 Level 3:加入方向與速度1The camera slowly orbits clockwise around the subject. 現在提示詞多了慢速與順時針兩個條件。 Level 4:補上角度、距離與主體位置1The camera performs a slow 180-degree clockwise orbit around the subject, maintaining a constant distance and keeping the subject centered. 除了環繞方向與速度,也交代移動幅度、攝影機距離和主體在畫面中的位置。 Level 5:寫成一段有時間節奏的導演腳本12345Single continuous shot. No cuts.[0-2s] Static medium shot.[2-7s] Slow 180-degree clockwise orbit around the subject. Maintain a constant camera distance and keep the subject centered.[7-10s] Lower the camera and settle into a low-angle hero shot.Warm golden-hour rim lighting. Keep the subject visually consistent. No dialogue. 到這一層,提示詞已經交代鏡頭何時開始移動、移動多久、最後停在哪裡。時間標記可以幫模型理解節奏與順序,但它仍是生成提示,不是逐格精準的剪輯時間軸;實際結果要看模型、版本與生成設定。 一個運鏡有五個可調整的控制維度/orbit 只說出運鏡名稱。若想減少生成結果像抽卡,可以把它拆成五個方向來描述: 控制維度 可以描述的內容 方向 順時針、逆時針、由左向右、由右向左 幅度 45 度、90 度、180 度或完整 360 度 速度 非常慢、緩慢、快速或急速 距離 貼近主體、遠距環繞、維持固定距離 結束畫面 特寫、低角度英雄鏡頭、主體背後或正面 例如,A slow 180-degree clockwise orbit, maintaining a constant distance, ending in a low-angle close-up hero shot. 就比單獨輸入 /orbit 多交代了可供模型參考的畫面條件。提示詞不一定要很長,重點是把真正重要的控制維度說清楚。 Veo 的攝影積木與 Omni Flash 的時間軸寫法教學時,我會用「攝影積木」介紹 Veo:主體、動作、景別、運鏡、光線與聲音,再依需要組合。到了 Gemini Omni Flash,我會多練習用時間軸描述一段連續鏡頭,明確寫出每一段的畫面變化。 這是方便理解提示詞的教學方式,不代表 Veo 只能用積木、Omni Flash 才能用時間碼。Gemini Omni Flash 的官方指南說明,模型預設可能嘗試生成多個鏡頭;若需要單一連續畫面,可以寫明 In a single continuous shot 或 No scene cuts,並以時間標記交代事件發生順序。不同模型與 Flow 功能的支援狀況仍可能不同,使用前應確認當下選取的模型與設定。 以 10 秒商品廣告為例,可以這樣寫: 12345Single continuous shot. No cuts.[0-3s] Close-up product shot. A bottle sits on a reflective black surface.[3-7s] The camera slowly orbits clockwise around the bottle while gently pushing in.[7-10s] The camera settles into a low-angle hero shot.Warm golden-hour rim lighting. Keep the product label consistent. No dialogue. 這段提示詞不只說「環繞」,也說明何時開始、同時搭配什麼動作、最後停在哪個景別。若你想先把多個鏡頭的順序規劃好,也可以延伸閱讀用 AI 快速生成短影音?九宮格分鏡技巧解決人物變形。 把 Slash Commands 當成攝影積木,而不是終點這些斜線寫法仍然很好用,尤其適合初學者快速記住攝影概念。可以先整理成自己的攝影積木: 運鏡: /orbit、/dollyin、/dollyout、/tracking、/handheld、/fpv 景別與角度: /closeup、/macro、/lowangle、/highangle、/pov 光線: /goldenhour、/backlight、/rimlight、/neonlight 商品畫面: /productreveal、/productspin、/ugcunboxing 特效: /smokereveal、/liquid、/disintegrate 新手可以先用 /orbit,再加上 /lowangle 或 /goldenhour。需要更明確的控制時,就把積木展開成自然語言: 1Single continuous cinematic shot. The camera slowly orbits 180 degrees clockwise around the subject while maintaining a constant distance. Use a low camera angle with warm golden-hour backlighting. Keep the subject centered and visually consistent. No cuts. 斜線詞是入口;一旦寫清楚畫面條件,這些攝影概念便不綁定某個介面或模型。 Prompt 正在變成一種導演介面以前我們可能只寫「一個男人走在東京街頭,電影感」,再看看模型會給什麼。現在可以把想法拆成鏡頭腳本: 0–2 秒先保持固定中景。 2–7 秒開始順時針環繞 180 度,人物留在畫面中央。 7 秒後降低機位,停在低角度英雄鏡頭。 整段不要切鏡,並維持人物的外觀與服裝。 這不只是描述「我要什麼畫面」,而是把運鏡、景別、速度、方向、距離、光線、動作和時間順序,組合成模型看得懂的執行腳本。當你學會的是這套攝影語言,換 Veo、Gemini Omni Flash 或其他自然語言影片模型時,就有一組可以重新測試與調整的基礎。 官方文件參考 Google Flow:建立影片 Google Flow:模型與支援功能 Google AI for Developers:Gemini Omni Flash 影片生成與提示指南 常見問答 (FAQ)Q1:/orbit 是 Google Flow 的官方指令嗎?目前查閱的 Google Flow 官方說明沒有把 /orbit 定義為公開指令或 Slash Command API。把它當成創作者的提示詞快捷寫法較穩妥,若需要明確表達環繞鏡頭,可直接寫 The camera orbits around the subject.。 Q2:/orbit 這種寫法可以直接用在 Gemini Omni Flash 嗎?Orbit 的運鏡概念可以用在 Gemini Omni Flash,但不要假設斜線語法一定通用。可改寫成自然語言,例如 The camera slowly orbits clockwise around the subject.,再依輸出結果調整方向、速度與幅度。 Q3:怎麼讓 AI 影片的運鏡方向和幅度更明確?在提示詞中直接寫出順時針或逆時針、移動 90 度或 180 度,以及運鏡速度、與主體的距離和結束景別。條件越具體,模型越能以這些資訊作為生成參考,但結果仍可能因模型與設定而不同。 Q4:AI 影片可以依照秒數執行運鏡嗎?可以用 [0-3s]、[3-7s] 這類時間標記描述事件順序與節奏。Gemini Omni Flash 官方提示指南有時間碼範例;時間標記仍屬自然語言提示,不保證逐秒或逐格精準執行。 Q5:一套運鏡快捷詞能套用在所有 AI 影片模型嗎?運鏡、景別與光線等攝影概念可以跨模型重用,但各模型的功能、版本與語意遵循程度不同。保留攝影概念,再把快捷詞展開成清楚的自然語言,並依實際輸出測試調整。

  • article-AI 長片真正的突破,不是模型變強,而是終於有人把「抽卡」變成製片流程

    2026/9/14

    AI工具 影音行銷 Higgsfield
    AI 長片真正的突破,不是模型變強,而是終於有人把「抽卡」變成製片流程

    最近看到 Higgsfield 公開約 95 分鐘的 AI 長片《HELL GRIND》。只看表面,很容易把焦點放在「AI 已經能做 95 分鐘電影了」;但我研究它公開的製作專案後,反而覺得更值得注意的,是團隊開始把角色、場景、鏡頭與生成素材當成一套製片系統來管理。 Higgsfield 的官方專案頁提到,公開內容包含每個場景背後的 prompts、assets 與 generations;Higgsfield 執行長 Alex Mashrabov 也在公開貼文中稱它為 95 分鐘 AI 電影。 對我來說,真正重要的不是長度,而是這部片讓一個問題變得更清楚: 如何把「抽卡」,變成製片? 為什麼 AI 長片不能只靠「不行就重抽」?做 10 秒或 30 秒的影片,寫 Prompt、生圖、試運鏡,畫面不對就再生成一次,偶爾還撐得住。但當作品長到 5 分鐘、20 分鐘,甚至 95 分鐘,每一鏡都靠運氣成功,就很難維持角色、場景和敘事的連貫。 長片需要的不只是單一鏡頭「看起來不錯」,還要讓觀眾相信:這是同一個角色、同一個世界,故事也在往前走。鏡頭一換,門不能無故換邊;角色換個狀態,衣服和傷勢不能忽然重置;前一鏡的動作,也要能接到下一鏡。 所以 AI 長片遇到的核心問題,已不只是「怎麼寫出更好的 Prompt」,而是「怎麼讓每次生成都能接回同一部作品」。 人物不該只是一段 Prompt,而是一組角色資產以前我們可能會在每個鏡頭重寫一次:「一名 32 歲亞洲男性,短黑髮,穿黑色外套……」然後希望模型記得他是誰。 長片製作更需要一份 Character Bible,先把角色定義成可重複引用的資產: 長相、身形比例與辨識特徵 服裝、髮型與會隨劇情改變的物件 聲音、語速、口音與說話習慣 表情、姿勢和具有辨識度的小動作 角色在不同場次中的狀態與變化 角色狀態也要拆開管理。乾淨的日常造型、淋雨後、受傷後或滿臉血,對應的是不同的造型狀態;如果每次都把多種狀態混在同一段描述裡,模型便可能把它們混合到不該出現的鏡頭。 這不代表角色 Asset 可以保證模型永遠不漂移,而是讓每一鏡有一致的參照。當角色跑掉時,也比較容易追問:是參照圖不夠清楚、狀態版本用錯,還是鏡頭本身要求太多? 場景不是背景圖,而是一個固定的虛擬片場場景連戲常比角色更容易出錯。 想像第一個鏡頭的門在左側,換個機位後卻跑到右邊;桌子忽然不見,窗戶又多出一扇。單看每一格也許說得過去,剪在一起就會穿幫。 因此,除了描述「這裡看起來像什麼」,還要建立空間地圖,固定重要物件和角色之間的關係。例如: 訓練墊位於房間中央 門固定在左側遠牆 窗戶在右後方,桌子在入口右側 角色 A 與門之間約有八公尺距離 這些資訊讓換機位不等於重新發明一個房間。它更像真正的片場:攝影機可以移動,但場景的空間關係不會跟著重新生成。 我把這種做法想成 AI 的「虛擬片場」。過去我們一直在練習怎麼描述畫面;長篇影像還需要我們定義畫面所在的世界。 不要只叫 AI 演情緒,要描述看得見的身體行為如果只寫「男人非常憤怒」,模型可能把情緒演成瞪眼、皺眉、咬牙、握拳,全部一起上,反而失去可信度。 更可控的方式,是把抽象情緒拆成鏡頭看得見的行為: 下巴繃緊,停頓兩秒 視線落在地面,不看對方 鼻血流到嘴唇,卻沒有伸手擦掉 呼吸逐漸加快,但肩膀保持僵硬 這不是單純把情緒形容得更長,而是把「表演」轉成可觀察、可檢查的身體訊號。我會把這種思路稱為 Performance Engineering:不是要求模型抽象地「演得更好」,而是把表演拆成具體的動作、節奏與反應。 把鏡頭設計成可診斷的 Shot,而不是塞滿一段 Prompt一個 Shot 若同時要求角色轉身、拿起道具、穿過房間、打鬥、說台詞,再加上複雜運鏡,模型失敗時就很難判斷是哪個條件造成問題。 先定義這一鏡最重要的動作、人物位置、鏡頭目的和結尾狀態,再決定要不要拆成兩鏡。若攝影機運動與角色動作彼此衝突,或同一鏡塞了太多事件,即使 Prompt 更長,也不一定會更穩。 我會用「10–15 次診斷線」提醒自己:同一個 Shot 反覆生成仍不成立時,先停止只改幾個形容詞;拆鏡、減少動作、換機位,或重新設計動作節拍。這是用來避免盲目重抽的工作參考,不是所有模型都適用的官方硬性門檻;真正的停損點仍要看鏡頭難度、成本和可接受品質。 如果你想進一步看分鏡如何協助人物一致,可以延伸閱讀本站的AI 九宮格分鏡技巧;九宮格是一種方法,不代表每部片都必須採用。 不是消滅抽卡,而是把抽卡工程化AI 影片仍然會生成失敗。差別在於,失敗後我們能不能找出問題、留下紀錄,並只重做需要修正的部分。 可以把工作拆成一條可追蹤的製作管線: Story → Bible → Asset → Scene → Shot → Generation → QC → Editing 當一個 Shot 不理想時,先診斷角色狀態、空間設定、動作複雜度、鏡頭運動和模型限制,再決定是重抽、簡化還是拆鏡。這樣每次生成才會變成有理由的測試,而不是沒有上下文的下一次嘗試。 AI 影片高手可能不只是最會寫 Prompt 的人如果 AI 影片逐漸走向 10 分鐘、30 分鐘或更長的敘事作品,真正拉開差距的能力可能會變成: 角色與場景資產管理 Story Bible、Character Bible 與 Shot List Continuity 連戲檢查 版本、生成紀錄與失敗診斷 素材篩選、品質檢查與剪輯決策 這些能力比某一款模型的熟悉度更有機會跨工具沿用。今天的 Shot 可以換成漫畫分格,留下 Story、Character 和 Scene 也可以支援小說或品牌故事。模型會換,對作品的拆解、管理和判斷能力卻能帶到下一個工具。 如果你想看如何把多種 AI 能力串成完整影片產線,可以延伸閱讀本站的用 Codex 打造 AI 影片工廠;而AI 影片素養與創作者工作方法則談到創作者如何從生成者走向製片與判斷者。 工作流,才是 AI 內容能跨模型累積的資產模型一定會一直更新。今天是 Higgsfield,明天可能是 Seedance、Veo、Kling,之後也可能出現另一套更強的生成工具。 如果能力只建立在「我很會用某一個模型」,工具換掉,很多技巧就要重來。但若你建立的是 Story、Bible、Asset、Scene、Shot、Generation、QC 到 Editing 的工作流,就能依不同模型重新安排生成工具,而不必把整個製作方法一起推倒重來。 AI 內容的下一階段,也許不是一鍵生成,而是我們開始知道怎麼管理生成、如何找到失敗原因,以及怎麼把 AI 產出的零件組織成一部作品。 《HELL GRIND》值得研究的地方,不只是「AI 能不能拍電影」,而是它讓我們看到人如何透過角色資產、虛擬片場、鏡頭設計與品質檢查,和 AI 一起把電影做出來。 常見問答 (FAQ)Q1:AI 影片製作中的 Production Engineering 是什麼?Production Engineering 是把故事、角色、場景、鏡頭、生成、品質檢查與剪輯整理成可追蹤、可診斷、可重做的製作流程,而不只是逐鏡撰寫 Prompt。 Q2:Character Bible 能保證 AI 角色每一鏡都一致嗎?不能。Character Bible 提供可重複使用的角色外觀、服裝、聲音和狀態參照,幫助團隊減少重新描述並定位偏差;最後仍要逐鏡檢查與修正。 Q3:AI 長片為什麼需要場景空間地圖?空間地圖能固定門窗、家具、角色和重要道具的位置關係,讓不同機位的鏡頭仍像發生在同一個場景,降低場景佈局前後矛盾的風險。 Q4:AI 影片的「10–15 次規則」是官方標準嗎?不是普遍適用的官方標準。本文把 10–15 次當作提醒創作者停止盲目重抽、回頭診斷 Shot 設計的工作參考;實際次數應依鏡頭難度、生成成本與品質要求調整。 Q5:這套 AI 製片流程只能用在 Higgsfield 嗎?不能。角色與場景管理、Shot 拆解、生成紀錄和品質檢查等概念可用於其他影片模型;但各模型支援的參照方式、控制能力與工作介面會不同,實作時仍需依版本調整。

  • article-AI 影片真正的分水嶺:從 Prompt 到專家 Skill 的製片工作流

    2026/9/14

    AI工具 AI Agent 影音行銷
    AI 影片真正的分水嶺:從 Prompt 到專家 Skill 的製片工作流

    AI 影視最近兩個案例,指向同一件事AI 影片最近有兩件事,我覺得值得放在一起看。 第一件,是 Higgsfield 公開了 95 分鐘 AI 長片《HELL GRIND》的製作專案,讓外界能查看影片背後的提示詞與製作素材。Higgsfield 官方專案頁 第二件,是我看到一位漫劇創作者在抖音談劇本創作與進階 Skill;他也公開了一套把編劇、角色與場景資產、分鏡、提示詞和品質檢查串起來的工作流程。抖音影片|公開的漫劇製作 Skill 乍看之下,這是兩種不同的 AI 影片案例。但放在一起,我看到的是同一個轉變:AI 影視真正的分水嶺,可能已不只是模型,而是「工作流」。 我把這種變化濃縮成一句有點殘酷的話:「學得慢的,直接不用學了。」不是專業不重要,而是有些人不必再從空白頁開始,把流程每一步都重新摸索一次;他們可以先安裝一套專家整理好的 Skill,再把時間用在判斷和修正上。 以前學 AI 影片,我們常常是在學怎麼抽卡人物不像?改 Prompt。場景跑掉?再補幾句。角色換個角度就變了樣?重抽。運鏡不對?繼續試。 所以過去一段時間,大家忙著學提示詞、運鏡術語和模型參數。但模型、介面與生成能力一直在變,今天摸熟的技巧,下一次更新後可能就被新的功能或工作方式取代。 反覆試生成並沒有消失,只是單靠「再改幾個字、再抽一次」很難穩定地做完一支片。更值得整理的,是故事如何拆解、角色和場景如何管理、鏡頭如何判斷,以及什麼結果可以留下。 專家的方法,開始被封裝成 Skill以小說改編成短劇為例,完整工作不只有「寫一段好 Prompt」。它可能包括故事分析、劇本結構、節奏與 Hook、角色設定、場景和道具資產、分鏡規劃、生成提示,以及逐步檢查成品。 這些步驟可以整理成一套 Skill:明確說明何時使用、要收哪些輸入、依什麼規則執行、要輸出什麼,以及在哪些地方停下來檢查。AI Agent 便能按照這套流程做事,而不是每次都靠使用者在聊天視窗重講一遍。 公開的漫劇 Skill 範例,就把製作拆成劇本、台詞診斷、資產鎖定、分鏡、提示詞渲染和獨立質檢等階段。這不是保證任何人安裝後都能做出熱門作品;它展示的是,原本藏在熟手腦中的步驟,開始能以結構化方法傳給 AI 執行。 一條可理解的製作管線大致會是: 1234567891011小說/故事 ↓編劇 Skill ↓角色與場景 Asset ↓Storyboard Skill ↓大量生成與品質檢查 ↓剪輯與輸出 這和我先前寫過的從提示詞到 Skill:打造高效率 AI 工作流有相同的底層觀念:把反覆重講的規則、固定格式、機械式步驟和修正經驗拆開,整理成可以重複使用的模組。 為什麼 Asset 會比一段角色 Prompt 更可靠?Higgsfield 公開《HELL GRIND》的專案素材,讓大家看到長片製作不只是每一鏡各寫一段描述。角色、場景、服裝、道具與不同狀態,都可以先整理成可重複引用的 Asset。 角色不是只有一張「長相描述」。製作時可能需要正常、淋濕、受傷或換裝等不同狀態;場景也不只是一段文字,還可能需要固定的空間關係、光線和可用角度。先把這些資料整理起來,之後做新鏡頭就不必每次從頭解釋整個世界。 這不代表模型從此不會漂移。Asset 的價值是提供更穩定的參照、減少重複整理,讓團隊更容易定位問題和重新生成;最後仍然需要有人檢查角色、場景和鏡頭是否接得起來。 《HELL GRIND》提醒我們:沒有告別抽卡,只是把抽卡工程化《HELL GRIND》的製作數字,讓我更確定這點。Screen Daily 報導引述製作方資料指出,前 25 分鐘用了 16,181 次影片生成,最後選出 253 個鏡頭,約是每個入選鏡頭對應數十次生成的量級。Screen Daily 報導 這是單一製作案例的數字,不是每部 AI 影片都適用的固定比例。但它清楚提醒我們:AI 影片不是按一次生成,就會自動得到可用成片。生成失敗並不可怕;更重要的是流程能不能記錄素材、比較版本、辨認問題,並只重跑需要修正的鏡頭。 於是製作方式從: 1人 → Prompt → 抽卡 → 不滿意 → 重抽 逐漸往這種工作流靠近: 1234567891011Story Bible ↓Character Bible 與場景 Asset ↓Storyboard 與 Shot 規格 ↓多輪生成 ↓人工/AI 輔助 QC ↓挑選、重跑與剪輯 抽卡仍然存在,只是它不再只是隨手試運氣,而是被納入一套可追蹤、可重跑、可檢查的製作管線。 未來稀缺的,可能是把專業整理成系統的人未來真正厲害的人,不一定是 Prompt 寫得最長的人,而是最會把專業拆成可執行步驟的人。 導演知道鏡頭怎麼服務情緒;編劇知道衝突和節奏如何推進;攝影師知道光線、構圖和視角如何影響觀感;剪輯師知道什麼時候該留下、什麼時候觀眾會離開。這些專業判斷,才是建立 Skill 時最有價值的內容。 一套可用的 Skill,也不只是把 Prompt 改個名字。它通常還需要清楚的輸入與輸出、可重用的素材、檢查標準、失敗時的處理方式,以及必要的人工作業關卡。少了這些,Agent 只會更快速地重複同一種錯誤。 如果想把 AI 影片流程往更完整的製作系統延伸,也可以參考我整理的用 Codex 打造 AI 影片工廠。而在生成能力普及、產量快速增加之後,為什麼「會生成影片」本身可能不再稀缺,也可延伸閱讀生成影片普及後,真正稀缺的是什麼。 學 AI,不如開始把自己會的東西教給 AIPrompt 的寫法會變,模型也會更新;但故事怎麼拆、角色怎麼管理、畫面怎麼判斷、什麼內容值得留下,仍然是專業的一部分。 所以現在學 AI,我不會只叫大家背更多提示詞。我更想問:哪些判斷你每天都在重複?哪些規則每次都要重新交代?哪些錯誤其實可以用檢查表提早抓到? 把這些經驗整理起來,先讓 AI 照流程執行,再由你把關品質。以前我們學會使用 AI;下一個階段,或許是把自己會的事情整理成 Skill,教會 AI 如何一起完成工作。 當越來越多人的專業被封裝成 Skill,真正的競爭才正要開始。 常見問答 (FAQ)Q1:AI 影片製作中的 Skill 是什麼?Skill 是一套可由 AI Agent 依循的任務規則與流程,通常會定義使用時機、輸入資料、執行步驟、輸出格式和檢查標準。它能減少每次重講流程,但不保證生成結果一定正確或符合品質要求。 Q2:有了 Skill,就不用學 Prompt 或專業知識了嗎?不是。Skill 可以把重複的操作規則整理起來,但使用者仍要提供目標與背景,並運用故事、影像、節奏和品質判斷來驗收結果。減少的是每次從零描述流程,不是專業判斷本身。 Q3:為什麼角色與場景要先整理成 Asset?把角色、場景、服裝、道具和狀態整理成可重複引用的 Asset,有助於維持不同鏡頭的參照一致,也讓團隊更容易找出需要修正的素材。模型仍可能產生偏差,因此 Asset 不能取代逐鏡檢查。 Q4:《HELL GRIND》的生成次數代表每個 AI 鏡頭都要生成 64 次嗎?不代表。製作方提供給媒體的數字是《HELL GRIND》前 25 分鐘用了 16,181 次影片生成,選出 253 個鏡頭,約為 64 次生成對應一個入選鏡頭的整體比值;這是該片的製作案例,不是普遍標準。 Q5:要怎麼開始把自己的專業整理成 Skill?先挑一個反覆執行、容易出錯的工作,記錄必要輸入、每一步的判斷規則、預期輸出和驗收條件;再把可重用的角色/場景/素材與檢查表整理好,讓 AI 先依流程執行,並在關鍵步驟保留人工審核。

  • article-【GPT-6 Astra 正在把 Vibe Coding,推向 Vibe World Building】

    2026/9/14

    AI工具 AI Agent Vibe Coding
    【GPT-6 Astra 正在把 Vibe Coding,推向 Vibe World Building】

    以前我們講 Vibe Coding,常見的想像是:「一句話,AI 幫我做網站、寫 App。」 但最近看到幾個 GPT-6 Astra 搭配 Unreal Engine、Blender 與 Three.js 的案例,我開始覺得,下一階段可能不只是 Vibe Coding,而是 Vibe World Building。 你不只是叫 AI 寫程式,而是讓 Agent 進入專業工具,協助建立角色、遊戲與可以互動的世界。更有意思的是:AI 越能操作專業軟體,我反而越覺得 Domain Knowledge 會變得更重要。 以下案例依照作者公開展示整理,重點是觀察工作方法,不代表每個人使用相同模型、方案與工具設定都能得到相同結果;實際能力也會隨版本、權限與專案環境變動。 AI 開始進入專業工具,而不只生成程式碼Vibe Coding 把「描述需求、產出程式」變得更容易;而這幾個 3D 案例再往前一步:Agent 開始操作 Unreal Engine、Blender 或 Three.js 專案,建立內容、反覆修改,並把場景、規則與互動組合在一起。 這個轉變不只是「AI 會不會 3D」,而是工作環境開始從人操作的軟體,變成 Agent 也能操作與檢查的執行環境。 案例一:從一個物件,走向逐街建構曼哈頓Matt Shumer 分享 GPT-6 Astra 在 Unreal Engine 中建構曼哈頓場景的過程,並描述它花了一週逐街完成細節。這已經不是只要求 AI「放一棟房子、加幾棵樹」,而是把工作尺度拉到街道與街區。 他也展示過另一個 Unreal Engine 世界:場景裡有以 Astra 驅動的角色 Agent,並以共同生存為目標互動。這讓「建構世界」不只包含空間,也開始包含世界中的行動者與互動規則。 當場景從單一物件擴大到街區,問題自然會延伸到道路與建築的空間關係、資產管理、場景分工與驗收方式。若要進一步投入正式製作,效能、碰撞、載入策略與可維護性仍需要另外檢查;一段令人驚豔的展示,不等於所有製作環節都已完成。 來源:Matt Shumer 的曼哈頓建構展示、Astra Agent 世界展示。 案例二:拓撲不一致,就改用離散 Mesh 切換角色表情常用 Blendshape 做平滑變化,但這類頂點形變通常仰賴相容的網格拓撲與頂點對應。若不同 AI 生成的表情 Mesh 拓撲不一致,就不一定能直接做傳統的平滑 Morph。 Nano 分享的 Blender 做法不是硬把所有網格變成同一種拓撲,而是換個解題方向:先把不同表情的 Mesh 對齊;切換時顯示目標表情,並把未啟用的 Mesh 縮小、藏進角色頭部,再透過 Blender Driver 控制切換。 這不是 Blendshape 的平滑融合,而是離散表情切換。它用明確的取捨避開拓撲限制,適合某些表情展示情境,卻不能因此宣稱能取代所有臉部動畫流程或提供連續的表情過渡。 我覺得這個案例特別值得看,不是因為 Astra 知道 Blender 哪個按鈕在哪裡,而是 Nano 知道問題來自哪裡,並知道還有哪些方法可以繞過去。 來源:Nano 在 Blender 中切換角色表情的展示與提示詞。 案例三:一款跑酷遊戲背後,是一整套產品規則MSB 使用 GPT-6 Astra 搭配 Three.js 分享豎屏跑酷遊戲《THE LAST GATE》。看起來是讓角色往前跑,拆開需求後卻是一組完整的遊戲系統: 玩家通過加減乘除算術門時,隊伍人數會即時改變。 撞上障礙物會造成實際隊員損失,而且畫面人數要和遊戲中的真實人數一致。 終點遭遇會依最後存活的隊員人數決定。 需求包含三條短路線、即時重試,以及帶 Seed 的輸入回放。 這已經不是「幫我做一個 Three.js Demo」,而是把玩法規則、3D 場景、互動、狀態變化與可重現測試一起交給 Agent 處理。作品是否能投入正式產品,仍要再驗收效能、操控手感與程式維護性;但需求本身已經從一句畫面描述,長成可檢查的產品規格。 來源:MSB 的《THE LAST GATE》公開貼文。 三個案例,代表三種建構尺度 尺度 案例 真正要處理的問題 世界級 Unreal Engine 曼哈頓與 Agent 世界 空間關係、場景組織、資產與行動者 角色級 Blender 離散表情切換 拓撲限制、替代方案與表情控制 產品級 Three.js《THE LAST GATE》 遊戲規則、互動狀態、重試與回放 我看到的不是「GPT-6 Astra 很會 3D」而已,而是 AI 開始透過專業工具,把世界、角色與產品的不同層次串起來。 AI 越會操作軟體,Domain Knowledge 為什麼越重要?很多人看到 AI 越來越會用 Blender,第一個反應可能是:「那以後是不是不用學 Blender 了?」 我反而覺得,答案可能剛好相反。 真正厲害的不是 Agent 知道哪個按鈕在哪裡,而是有人知道問題為什麼發生、有哪些限制、什麼 workaround 可行,以及最後怎樣才算完成。 如果你知道 Blendshape、Topology、Mesh、Driver 是什麼,才比較可能看出表情網格不相容的原因,並想到可以改用離散切換。若連問題的語言都不熟悉,就很難把這種解法交代給 Agent,也不容易判斷結果有沒有真的做到。 所以 AI 淘汰的可能不是「懂 Blender 的人」,而是只知道 Blender 按鈕在哪裡、卻說不清楚問題與完成標準的人。 以前你懂 Blender,還得親手操作每一步;懂遊戲設計,也可能得等工程師把規則寫出來。Agent 改變的是專業知識的產能:你可以把問題、限制、不要採用的方法、可行的 workaround 與驗收標準交給 Agent,再由專業工具把它落地。 Domain Knowledge × Agent × Professional Tools 專業知識負責判斷,Agent 負責執行,專業工具負責把想法變成可以檢查與迭代的成果。 如果你想延伸看「如何把領域經驗交給 AI 軟體化」,可以讀我之前寫的把專業知識變成軟體;關於 Vibe Coding 如何改變軟體價值,也可參考專業知識與 Vibe Coding 的商業機會。 Vibe Coding 的下一階段,可能是 Vibe Anything以前學 Photoshop、Blender 或 Unreal Engine,常常代表自己要親手完成大量操作。未來你或許不必逐一操作每個按鈕,但仍需要理解這個領域有哪些物件與規則、問題通常出在哪裡、有哪些解法,以及如何驗收。 Vibe Coding 可能只是第一站。接下來還會有 Vibe 3D、Vibe Game Development、Vibe Animation,甚至 Vibe Engineering 與 Vibe World Building。關鍵不是「每套軟體的按鈕都記熟了沒」,而是當 AI 已經能操作工具時,你知不知道該交代什麼、該限制什麼,又該如何判斷它做得對不對。 常見問答 (FAQ)Q1:Vibe World Building 和 Vibe Coding 有什麼不同?Vibe Coding 通常聚焦於用自然語言描述需求、讓 AI 產生或修改程式;Vibe World Building 則把 Agent 帶進 Unreal Engine、Blender、Three.js 等專業環境,處理場景、角色、規則與互動,目標尺度從一段程式碼擴大到可探索或可玩的世界。 Q2:為什麼 AI 越會操作 Blender,專業知識反而越重要?專業知識能幫你定義問題、提供限制、選擇 workaround,並訂出驗收標準。Agent 可以執行很多操作,但仍需要有人判斷網格、表情或動畫是否符合實際用途。 Q3:不同拓撲的表情 Mesh 可以直接做平滑 Blendshape 嗎?不一定。傳統 Blendshape 的頂點形變需要相容的網格與頂點對應;若拓撲不同,可能要先整理網格,或採用像案例中的離散 Mesh 切換。離散切換不等於平滑表情融合,也不是適用所有角色動畫的通用替代方案。 Q4:AI 做出的 3D 遊戲展示,就等於可以正式上線嗎?不等於。除了畫面與主要玩法,仍要測試效能、操控、錯誤狀態、裝置相容性與後續維護。案例呈現的是 Agent 能協助建構與實作的範圍,正式產品仍需要明確的驗收與測試。 Q5:想開始用 Agent 建立 3D 或遊戲專案,最先要準備什麼?先把目標拆成可檢查的規則:有哪些物件、它們如何互動、哪些限制不能違反,以及怎樣算完成。從小範圍任務開始,讓 Agent 執行後再用專業知識檢查結果,會比只要求「做得漂亮」更容易迭代。

  • article-【AI 短劇的下一站,可能不是抖音,而是 Steam】

    2026/9/14

    AI工具 內容行銷 影音行銷
    【AI 短劇的下一站,可能不是抖音,而是 Steam】

    當內容都能生成,下一步也許是讓人走進故事前幾天我看到一個很誇張的數字:2026 年上半年,抖音端上線超過 22 萬部 AI 劇漫劇。 這裡先補充統計口徑。DataEye 的《2026 上半年 AI 劇漫劇數據報告》統計的是「AI 劇漫劇」,涵蓋 AI 真人劇、AI 漫劇等不同形式,不能直接把 22.19 萬部說成全部都是真人影像短劇。報告摘要指出,其中有 1,055 部播放量破億,約占 0.48%。DataEye 報告摘要 這些數字讓我開始想:當 AI 劇漫劇多到這個程度,下一步會發生什麼? 答案可能不是只生成更多影片,而是讓觀眾走進故事裡。 最近我在 Steam 看到《幸存者笔记(Survivor’s Notes)》,覺得它讓這個方向變得具體。遊戲的 AI 生成內容聲明寫著:「All in-game materials are generated by AI.」也就是開發者表示,遊戲內的素材都是透過 AI 生成。Steam 遊戲頁面 這背後有意思的地方,不只是「AI 做了一款遊戲」,而是生成影像、互動選擇與遊戲系統開始出現在同一個作品裡。 它像一部「可以玩的 AI 短劇」《幸存者笔记》是一款全動態影像(FMV)生存遊戲。故事設定在 2026 年,全球爆發喪屍危機;玩家會跟著角色推進劇情,並透過選擇與快速反應事件,走進不同劇情分支與結局。Steam 遊戲介紹 如果先把遊戲類型放在一旁,它呈現的組合很像: AI 影像+互動敘事+QTE+分支劇情+多重結局。 但有一點要分清楚:Steam 頁面說明了玩家選擇會推進不同分支與結局,並沒有表示遊戲會依照每位玩家的輸入,即時生成全新的劇情。因此,這款作品能讓我們看到「AI 生成素材與互動影遊放在一起」的可能性;它本身還不能證明即時生成式戲劇已經成熟。 AI 影片可能讓分支劇情的影像製作變便宜以前拍一部真人互動電影,劇情走到第三集時,如果出現兩個選項:救女主角,或是不救,後面可能就要準備兩套劇本、場景、演出與剪輯版本。 如果故事繼續分成 A1、A2、B1、B2,製作量會跟著分支增加。演員、攝影、燈光、道具、剪輯與後製,也可能需要再投入一輪。 AI 影像帶來的變化,是創作者或許能以較低的成本製作另一條影像支線。過去新增一個分支,常常意味著「再拍一次」;未來某些情境可能變成「再生成、再挑選與再剪輯一次」。 這不代表新增分支會變成零成本。故事是否連貫、角色是否一致、畫面能否接起來、選擇有沒有意義,仍要有人設計與驗收。AI 降低的可能是部分影像製作門檻,內容設計與整合工作依然存在。這是我從生成影像與互動遊戲結合所看到的趨勢,不是《幸存者笔记》已公開的成本數據。 AI 短劇的下一站,可能不是「更多」現在大家還在比較:一天能生成幾支影片、角色能不能維持一致、運鏡像不像電影、畫面有沒有 4K。 這些能力會繼續進步。當多數人都能生成漂亮影片,「漂亮」本身可能就不再稀缺。 真正值得投入的,會是世界觀、角色、衝突、選擇、後果與情緒。觀眾為什麼想知道下一個選擇會帶來什麼?他們又為什麼願意在故事裡繼續走下去? 這已經不只是 AI 影片的問題,而是互動內容怎麼設計。 如果你也在思考 AI 影片產量增加後,創作者還能靠什麼取得注意力,可以延伸閱讀我寫的生成影片普及後,真正稀缺的是什麼;若想從創作者能力來看,也可以參考AI 影片素養與工作方法。 從觀眾到參與者:生成式戲劇的想像傳統電影是看故事,短影音是滑故事,連續短劇是追故事。下一個階段或許會是進入故事、親自做選擇。 例如,一部修仙題材的短劇演到一半,問你:「加入魔宗,還是拜入正道?」你選了魔宗,後續角色關係、任務與影片就隨之改變;另一位觀眾選擇正道,走進的可能是不同版本。 再往前一步,AI 也許能依據選擇、角色關係、道具與前情,生成下一段劇情。這種作品不只提供固定的兩三條支線,而是讓每位玩家都能走進一個略有不同的故事版本。 我會把這個方向稱為 Generative Drama,生成式戲劇。它目前更像一種內容設計的想像與目標,不是《幸存者笔记》已提供的功能。要真的做到,還得解決角色一致性、劇情品質、分支管理、生成成本與觀眾體驗等問題。 Vibe Coding 與 AI 影片正在合流以前做影片的人和做遊戲的人,常是兩群不同的創作者。現在,一個人可能用 AI 寫世界觀、劇本與角色,生成圖片、影片、配音和音樂,再請 Coding Agent 串起選項、劇情樹、存檔、成就、QTE、角色數值與結局。 最後的作品可以是 Web App、手機 App,或一款上架 Steam 的互動影遊。當創作流程從視覺素材一路延伸到程式與互動邏輯,就很難再只用「導演」、「遊戲開發者」、「程式設計師」或「內容創作者」其中一個身分概括。 他們可能是在建立一個世界,讓別人進來探索。 我更在意的是:能建立什麼值得走進去的世界?「AI 影片能不能取代真人拍攝?」或許不是最有意思的問題。 當影片開始變成可以由程式生成與串接的素材,我們能不能建立一些過去成本太高、做不起來的內容? 十年前,我們把文字變成網站;後來把圖片和影片變成社群內容。現在,文字、圖片、聲音、影片、3D 與程式碼,都正在變成可以生成與組合的素材。 所以下一步,可能不是再做一支更漂亮的 AI 影片,而是把素材串起來,建立一個觀眾可以走進去、做選擇,而且每個人的故事都不一樣的世界。 看到《幸存者笔记》時,我想到的不是「AI 現在連 Steam 遊戲都能做了」,而是 AI 短劇下一個值得探索的戰場,可能根本不在短影音平台。 當生成影片越來越便宜,我們要學的也許不只是怎麼生成影片,而是怎麼建立一個值得別人走進去的世界。 常見問答 (FAQ)Q1:AI 短劇和互動影遊有什麼不同?AI 短劇通常以觀看連續影像為主;互動影遊會讓玩家透過選擇或操作影響劇情分支。兩者結合時,影像提供故事呈現,互動系統則讓玩家參與故事走向。 Q2:《幸存者笔记》會依照玩家選擇即時生成新劇情嗎?目前 Steam 頁面說明玩家選擇與 QTE 會推進不同分支和結局,但沒有說明遊戲會在遊玩當下即時生成新劇情。因此不能把它直接當成已成熟的即時生成式戲劇案例。 Q3:AI 影片會讓互動劇情變成零成本嗎?不會。AI 可能降低部分影像素材的製作成本,但劇本、角色連貫、分支設計、剪輯、測試與品質檢查仍需要投入。每增加一條分支,也會增加整合與驗收工作。 Q4:什麼是 Generative Drama(生成式戲劇)?Generative Drama 是依據觀眾或玩家的選擇生成後續劇情的內容構想。相較於固定分支,它希望讓不同玩家走進各自稍有差異的故事;目前仍須處理劇情品質、角色一致性、成本與分支管理等問題。

  • article-【36 秒就誕生一部 AI 短劇後,我反而覺得「會生成影片」開始不值錢了】

    2026/9/14

    AI工具 內容行銷 影音行銷
    【36 秒就誕生一部 AI 短劇後,我反而覺得「會生成影片」開始不值錢了】

    你花一天做一支 AI 影片,別人一週已經做完 60 集連續劇最近看到一個數字,我覺得做 AI 影片的人真的要警覺了。 平均每 36 秒,就有一部 AI 短劇上線。 不是一支 10 秒、15 秒的 AI 炫技影片。 是「一部短劇」。 根據中央社引述澎湃新聞的統計,2025 年 8 月抖音新上線的 AI 劇只有 655 部;一年後,這個數字已達 74,313 部,占當月新劇的 75.4%。報導另指出,2026 年 7 月平均每 36 秒就有一部新的 AI 劇上線。中央社報導 更誇張的是,有些團隊已經可以做到: 5 個人,一週做完 60 集。 成本甚至不到傳統真人短劇的十分之一。 這些是媒體採訪中的個別團隊案例,不代表所有 AI 短劇都能達到相同產能或成本。不同作品的類型、品質和成本計算範圍,會讓估算出現落差。5 人團隊 7 天完成 60 集的報導、BBC 中文採訪報導存檔、另一份製作成本估算 所以當大家還在研究: 「哪個 AI 影片模型比較強?」 「提示詞怎麼寫?」 「怎麼保持角色一致?」 「怎麼做運鏡?」 我反而開始想另外一個問題: 如果影片已經多到每 36 秒就生出一部,那「會生成影片」這項能力,到底還值多少錢? 而這波 AI 短劇爆發,甚至已經養出一個以前不存在的新職業: 「抽卡師」。 什麼是「抽卡師」?不是遊戲裡抽 SSR 的那種抽卡。 現在 AI 還沒有強到你丟一本劇本進去,它就直接吐出 60 集可以播的連續劇。 所以中間還需要大量人工工作。 例如把劇本拆成場景、角色、表情、動作、鏡位、光線、運鏡,再交給模型生成。 但生成出來的東西不一定能用。 可能角色變臉。 可能手指壞掉。 可能運鏡很怪。 可能情緒完全不對。 所以你要一直生成。 生成 10 個、20 個、50 個版本,再從裡面挑一個最好的。 很像抽卡。 於是「抽卡師」就出現了。 有些複雜素材的提示詞,甚至可以寫到 5,000 字。 所以現在厲害的抽卡師,其實已經有點像: 半個導演+半個攝影+半個 AI 模型操作員。 但我反而覺得,這個職業可能不會存在太久。 因為「抽卡」本身,就是 AI 還不夠成熟的產物為什麼今天需要抽卡? 因為 AI 不穩定。 同樣一句提示詞生成十次,可能得到十種結果。 所以需要人一直生成、一直挑。 但如果未來模型可以直接讀完整劇本呢? 它自己理解人物。 自己維持角色一致性。 自己拆分鏡。 自己設計鏡位。 自己控制演員表情。 自己產生不同 Take。 甚至自己判斷哪個 Take 最好。 那還需要一個人在那邊「抽卡」嗎? 可能不用。 所以我認為: 「抽卡師」不是 AI 時代的終極新職業,而是一個過渡型職業。 就像以前很多人專門幫忙切版、修圖、上字幕。 技術進步之後,這些工作不一定完全消失,但市場價值會快速下降。 真正留下來的,反而不是「會生成的人」。 而是: 知道什麼值得生成,以及知道什麼值得留下的人。 更可怕的是,AI 已經把「內容產能」打爆了DataEye 研究院的《2026 上半年 AI 劇漫劇數據報告》統計,2026 年上半年抖音端新上線 22.19 萬部 AI 劇漫劇,其中 1,055 部播放量破億,占 0.48%。DataEye 報告摘要 如果把 5,000 萬播放當作一條粗略的盈虧平衡線,能跨過去的比例大約只有 1.3%。 換句話說: 大約做 77 部,才有一部可能跨過這條線。 這裡的 5,000 萬次播放,是 DataEye 報告採用的抖音端盈虧平衡參考線;報告也提醒,這組數據不代表所有平台與全行業的情況。它不是每一部短劇通用的保本保證。DataEye 報告摘要 這個數字才是我覺得真正值得注意的地方。 因為它告訴我們: AI 解決了「做不出來」的問題。 卻製造了一個更嚴重的問題: 大家都做得出來。 以前拍一部短劇,要演員、攝影、燈光、場地、後製。 有這些門檻存在,本身就會過濾掉大量競爭者。 現在門檻突然被 AI 打掉。 結果不是每個人都成功。 而是內容開始大爆炸。 當內容生產成本趨近於零,內容本身就會開始通膨這件事情不只發生在 AI 短劇。 我覺得接下來所有自媒體都會遇到。 文章。 圖片。 短影音。 Podcast。 知識圖卡。 電子書。 甚至線上課程。 以前一個人一週做三支影片,很厲害。 AI 出現後,一個人一天做 30 支都不是問題。 但問題來了。 當每個人都能一天做 30 支影片,你一天做 30 支影片還算優勢嗎? 不算。 這就像以前會 Photoshop 是一項專業。 後來大家都有 Canva。 現在連 Canva 都不用開,跟 AI 講一句話就做好了。 當「製作能力」被普及之後,製作能力本身的價格就會下降。 所以我最近越來越確定一件事: AI 時代真正稀缺的,不會是內容。 而是: 注意力。 所以我現在看 AI 自媒體,已經不太在意「一天可以生幾支影片」很多 AI 自媒體教學還停留在: AI 寫文案。 AI 生圖片。 AI 生影片。 AI 配音。 AI 剪輯。 AI 自動發布。 最後告訴你: 「一個人也可以經營十個帳號。」 技術上當然可以。 但這可能正在回答一個錯誤的問題。 真正的問題不是: 「我怎麼一天生 100 支影片?」 而是: 「當全世界每天多出一億支 AI 影片,為什麼有人要停下來看我的?」 這兩個問題,難度完全不同。 前一個問題是 Production。 後一個問題是 Content。 甚至再往上一層,是: Taste、Story、Distribution。 你選什麼題目? 前三秒講什麼? 故事怎麼鋪? 情緒怎麼拉? 什麼地方觀眾會滑走? 什麼東西值得被分享? 觀眾為什麼記得你? 這些能力,反而會隨著 AI 變強而變得更重要。 如果你想從「做得出影片」往「知道該做什麼」前進,可以延伸閱讀我寫過的 AI 影片素養與創作者工作方法;而選題、定位與觀眾需求,也和 短影音定位策略 密切相關。 所以未來最值錢的人,可能不是最會用 AI 的人而是最知道: 「AI 應該做什麼」的人。 AI 可以幫你一次生成 100 個鏡頭。 但你要知道哪一個是好鏡頭。 AI 可以寫 100 個 Hook。 但你要知道哪一句觀眾會停下來。 AI 可以一天產出 100 支影片。 但你要知道哪一支值得做。 所以我反而覺得「抽卡師」這個職業很有象徵意義。 今天我們還在抽「畫面」。 再過一陣子,我們可能開始抽「故事」。 抽「廣告」。 抽「課程」。 抽「產品」。 AI 可以無限生成選項。 但真正的能力,會從「生成」轉移到「選擇」。 這可能才是生成式 AI 發展到下一階段後,最值得學的一件事。 以前我們害怕: AI 會不會讓我做不出東西? 現在真正該擔心的可能已經變成: 當所有人都做得出來,我憑什麼被選中? 常見問答 (FAQ)Q1:AI 影片生成能力變普及後,學會生成還有價值嗎?有價值,但它不再是唯一差異。生成能降低製作門檻;選題、故事、審美、品質判斷與發行,會更直接影響觀眾是否停留與分享。 Q2:「抽卡師」會成為長期職業嗎?目前它反映了生成結果不穩定、需要反覆產生與人工挑選的工作。模型若能更穩定地理解劇本、維持角色並評估鏡頭,這項工作的內容可能改變;它是否消失,仍取決於技術與製作流程如何演進。 Q3:AI 影片創作者要怎麼從大量內容中被看見?先從觀眾與題目開始,再設計前三秒、故事節奏、情緒轉折和分享理由。大量產出只能增加選項,不能代替對內容品質與發行方式的判斷。 Q4:5,000 萬次播放是所有 AI 短劇的固定回本門檻嗎?不是。這是 DataEye《2026 上半年 AI 劇漫劇數據報告》用來估算抖音端盈虧平衡的參考線;作品類型、成本與發行條件不同,實際回本門檻也會不同。

  • article-AI 自動剪片做到最後,我才發現真正缺的是自己的聲音 API

    2026/9/11

    AI自動化 AI工具 影音行銷
    AI 自動剪片做到最後,我才發現真正缺的是自己的聲音 API

    最近我一直在調整自己的 AI 自動剪影片流程。 文章可以自動改成短影音腳本。 知識圖卡可以自動生成。 字幕可以自動上。 B-roll 可以自動配。 重點遮罩、動畫、轉場,甚至剪輯節奏,也都可以慢慢交給 AI。 但做到最後,我突然發現一件事。 真正還沒有被自動化的,反而是: 我的聲音。 如果每一支影片最後還是要自己重新錄旁白,那前面再怎麼自動,其實都還差最後一哩。 所以我最近開始重新研究「克隆音」。 但這次我不是想找一個: 可以把我的聲音複製得很像的 AI 工具。 我想的是另一件事: 能不能把我的聲音,直接變成 AI 自動剪片系統裡的一個 API? AI 自動剪片為什麼會卡在最後一哩?一條完整的影片工作流,現在已經可以拆成很多個可被自動化的能力: 文章自動改成短影音腳本 知識圖卡自動生成 字幕自動上稿 B-roll 自動配對 重點遮罩、動畫與轉場自動完成 剪輯節奏交給 AI 協助判斷 這些環節都完成後,旁白卻可能還是要由本人重新錄製。對個人創作者來說,這不只是多花一點時間,也會讓整套「內容工廠」在最後一步停住。 這也是我開始重新研究 Voice Clone 的原因。不過,我真正想找的不是另一個獨立工具,而是一個能被工作流穩定呼叫的聲音元件。 這個方向,也可以接到我之前整理的用 Codex 打造 AI 影片工廠:串接六大 AI 能力的完整工作流。影片工廠不只要能產生畫面,也要能把聲音當成可替換、可擴充的能力。 克隆音已經從模型訓練,走向可呼叫的工作流元件以前講 Voice Clone,很容易想到一個完整的模型訓練專案: 錄很多音訊。 整理資料。 訓練模型。 等待幾個小時。 得到一個自己的聲音模型。 但現在很多 Zero-shot TTS,已經可以只用一小段參考音訊,直接模仿聲音的音色。像是我目前正在看的: IndexTTS-2.5 Qwen3-TTS Chatterbox V3 GPT-SoVITS CosyVoice 3 Fish Speech 這些模型與版本是我目前的研究方向與工作流示例,不代表固定排名;支援的語言、情緒控制、硬體需求與授權方式,都可能隨版本和方案變動,實際使用前仍要回到各專案的官方文件確認。 有些情境甚至不需要 Fine-tune。你只要給它: 一段你的聲音 一段新的文字 它就可以直接嘗試用你的音色把文字說出來。 這讓克隆音慢慢從「模型訓練專案」,變成「可以被工作流直接呼叫的元件」。 對我來說,理想的介面不是讓剪輯系統知道底下使用哪一套模型,而是把底層差異藏起來: 12345請用我的聲音念這段文字 ↓ Voice Engine API ↓ 回傳 WAV 或音訊檔 為什麼我現在最想研究地端克隆音?如果要把克隆音塞進自動剪影片流程裡,地端有很多優勢。重點不只是省 API 費用,更重要的是控制權。 我可以自己決定: 腳本怎麼切句 一次生成多少字 情緒怎麼控制 專有名詞怎麼唸 要不要快取 生成失敗怎麼重試 哪些段落要重新生成 如何把引擎包成 REST API 最後,剪輯系統根本不用知道底下是哪一套模型。它只要送出文字與必要參數,拿回一段可以繼續進入剪輯流程的音訊。 這種抽象層很重要。今天底層是 IndexTTS,明天換成 Qwen3-TTS,甚至某一批任務改走雲端 API,上層的影片工作流都不必整套重寫。 MacBook 也能先把 Prototype 跑起來這是我最近覺得很有意思的地方。 以我目前看到的 IndexTTS-2.5 使用情境來說,它已經能在 Apple Silicon 的 MPS 環境進行推論。也就是說,M1、M2、M3、M4 這些 Mac,都有機會直接拿自己的 GPU 做實驗。 我自己的 MacBook Pro M2 Pro、16GB Unified Memory,也可以先拿來做 Prototype。 當然,16GB 記憶體不算多。如果一次生成很長的旁白,或同時開著許多應用程式,記憶體仍然會吃緊。這裡的重點不是宣稱 Mac 可以取代所有 GPU Server,而是: 30 秒短影音 1 分鐘旁白 課程分段音訊 這些任務已經足以讓個人開發者研究整條流程,先驗證切句、快取、重試與剪輯串接,再決定是否需要更大的硬體。 換句話說,不一定要先買 RTX 4090,也不一定要一開始就租 GPU Server。一台手邊的 Mac,就可以先把 Voice Engine 的 Prototype 跑起來。實際效能仍會受到模型版本、量化方式、音訊長度、背景程序與安裝環境影響。 評估克隆音,真正的重點不只是「像不像」以前評估克隆音,我們可能只問: 像本人嗎? 但真正要放進內容工廠,至少還要再問: 台灣國語自然嗎? 情緒夠不夠自然? 長文會不會開始飄? 停頓是不是像真人? 專有名詞會不會亂唸? 同一個 Voice 能不能跨語言使用? 生成速度夠不夠快? 「85% 像本人」可能還不夠。如果它每次都把 Claude 唸錯、Gemini 唸得怪怪的、ComfyUI 亂念,或把 n8n 的讀法弄得不一致,影片仍然會出戲。 所以我甚至開始想做一份自己的專有名詞發音字典。腳本進入 TTS 之前,先自動做文字前處理: 名詞 預期處理 Claude 固定適合旁白的讀法 Gemini 固定適合旁白的讀法 Anthropic 固定適合旁白的讀法 n8n 固定適合旁白的讀法 這些讀法不一定要交給模型臨場猜,而是先在 TTS 前統一替換或標記。久了以後,這套 Voice Engine 不只會越來越像我的音色,也會越來越接近我的內容風格。 如果你也在處理影片聲音,可以先參考短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流。克隆旁白解決的是「誰在說」,SFX 與混音則決定觀眾「聽起來感覺如何」,兩者應該放在同一條聲音工作流裡設計。 把「我是誰」和「我要怎麼說」拆開這件事對自動剪影片非常重要。 一支短影音不可能從頭到尾都使用同一種情緒: 開頭 Hook 可能要比較興奮 中段解釋要穩定清楚 提醒風險時要嚴肅 講到反差時可能要驚訝 最後 CTA 又要比較親切 因此,Voice Engine 可以拆成兩層: 我是誰: 聲音的音色、辨識度與個人品牌特徵。 我要怎麼說: 情緒、語速、停頓、重音與表達方式。 理想的流程會是: 1234567891011腳本 ↓AI 理解內容 ↓判斷每一段情緒 ↓選擇語速與表達方式 ↓克隆音生成 ↓送進剪輯流程 這時候 AI 就不只是單純「念稿」,而是開始理解:這句話應該怎麼說。 不想自己維護模型,雲端 TTS 也已經很成熟地端是我目前很想研究的方向,但如果不想自己維護模型,雲端方案其實已經很方便。以我目前的觀察,值得放進測試清單的包括: ElevenLabs MiniMax Fish Audio Qwen/CosyVoice Cloud Cartesia PlayHT Resemble AI Google Chirp 3 Azure Custom Voice HeyGen Synthesia 每一家定位不一樣,這份清單是研究與選型的起點,不是永久排名。若要找一個成熟基準,我會先看 ElevenLabs;如果主要做中文短影音,我會想測 MiniMax;如果在意情緒、角色感、Podcast 或漫劇,Fish Audio 會是值得研究的方向;如果以後要做即時 Voice Agent,則可以研究 Cartesia。 雲端最大的好處是不用自己處理: CUDA MPS 記憶體配置 模型環境損壞 硬體升級 API Key 拿到就可以接。對大量生產來說,這確實很省事;但費用、資料處理政策、延遲、速率限制與語音授權,仍然要依各家最新方案確認。 地端和雲端不是二選一,而是混合式 Voice Engine所以我現在反而不覺得這是一場「地端 vs 雲端」的戰爭。更合理的做法,可能是建立一層混合式 Voice Engine: 任務情境 可以優先測試的方向 平常的短影音與開發測試 地端 IndexTTS、Qwen3-TTS 或 Chatterbox 突然出現大量任務 切換 MiniMax API 英文或多語言內容 切換 ElevenLabs 情緒較重的內容 測試 Fish Audio 即時 AI Agent 對話 研究 Cartesia 這個概念其實跟現在使用 LLM 很像。我們已經不太會只問:「全世界最好的 AI 模型是哪一個?」而是開始問:「這個任務,現在應該用哪一個模型?」 未來 TTS 很可能也會一樣。真正重要的不是押中唯一答案,而是把模型做成可以替換的底層能力,讓上層工作流按照任務、成本、延遲、語言與情緒需求選擇引擎。 Voice Conversion:先把話說好,再換成我的聲音這次研究時,我看到 Seed-VC 這類 Voice Conversion 技術,反而讓我產生另一個想法。 也許不一定要要求同一套 TTS 同時做到: 聲音像我 情緒自然 節奏漂亮 表達生動 全部一次完成。 可以拆開處理:先找一個最會「說話」的 AI,讓它負責情緒、節奏、停頓與表達,再用 Voice Conversion 把聲音換成我的音色。 1234567最佳 TTS ↓先把話說好 ↓Voice Conversion ↓換成我的聲音 這個思路很有意思,因為它把「講得好」和「像我」拆成兩個不同問題。有時候,拆開反而更容易做到,也更容易針對每一段找出可以改善的地方。 我真正想做的,是自己的 Voice Layer所以我現在真正想做的,其實不是找最好用的克隆音。 我想做的是自己的Voice Layer。 未來不管是: 短影音 線上課程 Podcast AI 新聞 數位分身 AI Agent 互動式課程 全部都可以呼叫同一層聲音服務。 輸入文字以後,它自己決定: 該用哪個 Voice Engine 該用什麼情緒 語速多少 專有名詞怎麼念 是否需要快取或重新生成 最後回傳一段聽起來像我的聲音。 到了這一步,克隆音就不再只是一個 AI 工具,而會變成個人品牌的一層基礎設施。 我現在越來越覺得,AI 自動剪片真正的最後一哩,不是剪輯,而是: 讓整套系統,真正開始用你的聲音說話。 常見問答 (FAQ)Q1:什麼是個人的 Voice Layer?Voice Layer 是放在內容工作流和底層 TTS/Voice Conversion 模型之間的一層聲音服務。它可以統一處理音色、情緒、語速、專有名詞、快取、錯誤重試與模型切換,讓影片、課程、Podcast 或 AI Agent 都用同一個介面呼叫聲音能力。 Q2:做地端克隆音一定要先買 RTX 4090 嗎?不一定。以文章中的 Prototype 情境來說,Apple Silicon Mac 的 MPS 可以先用於短影音、短旁白或課程分段音訊測試;但長音訊、批次任務和多工執行仍可能受到 16GB Unified Memory 等硬體限制,實際速度要依模型版本與設定測試。 Q3:地端 Voice Clone 和雲端 TTS 應該怎麼選?如果在意資料控制、成本可預測、切句與重試邏輯,地端比較適合做日常與 Prototype;如果需要大量生產、快速接 API 或多語言服務,雲端比較省維護成本。更彈性的做法是建立混合式 Voice Engine,依任務切換不同引擎。 Q4:克隆音怎麼避免把 Claude、Gemini 或 n8n 唸錯?可以在文字送進 TTS 前建立專有名詞發音字典,先把 Claude、Gemini、Anthropic、n8n 等詞轉成固定讀法或標記,再進行語音生成。這比每次都讓模型自行猜讀音,更容易維持影片之間的一致性。 Q5:Voice Conversion 和 TTS 有什麼差別?TTS 主要負責把文字說成語音,通常也會處理語速、情緒、停頓與表達;Voice Conversion 則是在已有語音表現的基礎上轉換音色。兩者可以拆開使用:先用擅長表達的 TTS 把話說好,再用 Voice Conversion 換成個人音色。

  • article-【342 個免費 3D Prompt,我看到的不是提示詞資料庫,而是 3D Vibe Coding 正在成形】

    2026/9/10

    AI工具 AI Agent Vibe Coding
    【342 個免費 3D Prompt,我看到的不是提示詞資料庫,而是 3D Vibe Coding 正在成形】

    最近發現一個滿值得收藏的網站:Tripo 3D Prompts。 它整理了超過 300 個免費的 AI 3D Prompt 與實際案例,內容涵蓋 Three.js、Blender、WebGPU、Browser Game、角色建模、3D 世界與各種互動效果。 資料註記:2026 年 9 月 10 日查閱時,官方頁面顯示 342 個案例,數量會持續更新。網站會區分作者公開的原始 Prompt,以及依公開作品整理的任務描述;使用時可以先查看個別案例的來源標示。 如果只是把它當成「Prompt 大全」,其實有點可惜。 因為我看了一輪之後,真正讓我感興趣的不是這 300 多條 Prompt,而是: 3D Vibe Coding 的方法論,好像已經慢慢成形了。 以前 Vibe Coding 做網站,現在開始「做世界」這一兩年大家講 Vibe Coding,最常看到的還是: 「幫我做一個官網。」 「幫我做一個管理後台。」 「幫我做一個 SaaS。」 「幫我做一個小工具。」 本質上,大部分還是 2D Web UI。 但 Tripo 3D Prompts 裡面,已經開始出現很多完全不同的東西。 例如 Three.js 3D 遊戲、卡丁車競速、飛行模擬器、第三人稱射擊遊戲、3D 解謎、互動式中國庭院、梵谷畫作 3D 世界、WebGPU Soft Body、Blender 建模與動畫…… 甚至可以拿一張圖片或一段影片當參考,要求 AI 重建成可以互動的 Three.js 3D 場景。官方就收錄了依參考影片重建 Three.js 場景的案例,呈現這種從視覺參考出發的需求描述。 這件事代表一個很有意思的變化。 以前我們 Vibe Coding 是: Prompt → 網頁 現在開始變成: Prompt → 場景 → 物件 → 物理 → 互動 → 世界 我會把它叫做:3D Vibe Coding。 這個網站真正值得學的,不是 Copy Prompt看到 300 多個 Prompt,第一個直覺一定是:「太好了,以後直接複製貼上。」 但我反而覺得,這是最可惜的使用方式。 因為真正值得研究的是:這些厲害的 3D Prompt,到底是怎麼描述需求的? 我整理之後發現,好的 3D Vibe Coding Prompt,大致可以拆成類似的結構: Reference → World → Assets → Mechanics → Interaction → Camera → UI → Feedback Loop → Acceptance Criteria 這是我從案例整理出的需求拆解方式,不是網站規定的唯一格式。換成比較好理解的問題,就是: 需求層次 要描述清楚的事情 Reference:參考資料 參考哪張圖片、哪段影片或哪個作品? World:世界 場景長什麼樣?空間與路線怎麼安排? Assets:素材 需要哪些角色、車輛、建築與道具? Mechanics:機制 移動、物理、碰撞與遊戲規則如何運作? Interaction:互動 玩家可以做什麼?怎麼控制? Camera:鏡頭 鏡頭要跟隨、環繞,還是自由移動? UI:介面 操作提示、狀態與 HUD 要顯示什麼? Feedback Loop:回饋迴圈 怎麼執行、觀察結果,再修改? Acceptance Criteria:驗收標準 哪些條件成立,才算完成? 這跟我們平常說「幫我做一個 3D 賽車遊戲」,差非常多。 例如今天我要做卡丁車。與其只描述「我要一款賽車遊戲」,不如拆成: 世界長什麼樣?賽道怎麼設計? 車子如何控制?有沒有甩尾? 碰撞怎麼處理?鏡頭怎麼跟車? 怎麼計算圈數?有沒有 Checkpoint? AI 對手怎麼跑?HUD 顯示什麼? 什麼情況算完成遊戲? 當這些東西被描述清楚之後,AI 面對的就不再是一句模糊的願望,而是一份可以執行的規格。 不要 Copy Prompt,要 Copy Architecture這也是我現在看這類 Prompt Library 最大的心得。 Prompt 本身很快就會過時。 今天 GPT-6 Astra 很強,明天可能又有新的模型。今天某一條 Prompt 很厲害,幾個月後模型能力提升,也許一句話就做得到。模型的表現也會隨版本、方案與任務改變,不需要把當下的選擇當成永久排名。 但是,Architecture 不容易過時。 例如你找到一個很棒的 Kart Racing 案例,真正應該留下來的是: 12345678910賽道系統→ 車輛控制→ Vehicle Physics(車輛物理)→ Drift(甩尾)→ Checkpoint(檢查點)→ Lap System(圈數系統)→ AI Opponent(AI 對手)→ Follow Camera(跟隨鏡頭)→ HUD(遊戲資訊介面)→ Win Condition(獲勝條件) 這整組就是一個 Racing Game Pattern。 下一次根本不需要重新想。 你可以把 Roblox 風格換成科幻城市,也可以換成台灣夜市,甚至可以變成「享哥 AI 賽車學院」。 美術全部換掉,但是底層 Pattern 保留下來。 這才是我認為 AI 時代真正值得累積的東西。 更大的變化,是 AI 開始自己「看結果」還有一個地方,我覺得比 3D 本身更值得注意。 以前我們使用 AI Coding 的流程通常是: 下 Prompt → AI 寫程式碼 → 執行 → 人類看結果 → 告訴 AI 哪裡不對 → AI 修改 問題是,中間那個「看結果的人」一直都是我們。 但現在開始不一樣。 當工作環境具備執行、截圖與視覺理解能力,新的工作流可以變成: 1234567891011121314151617Prompt↓AI 建構↓執行↓Screenshot↓AI 自己看畫面↓跟 Reference 比較↓找出差異↓修改↓重新執行 這個差異非常大。 因為 AI 不再只是 Coding Agent,它開始變成 Visual QA Agent。 以前我們叫 AI:「幫我寫 Three.js。」 未來比較可能變成:「這是我要的參考畫面,你自己做到像為止。」 當然,「畫面像」還不是全部驗收。卡丁車能不能控制、圈數有沒有算對、碰撞是否正常,仍要搭配實際操作與功能測試;截圖主要幫助檢查視覺差異。 這也呼應我之前整理的 Agent Harness 觀念:除了模型會不會寫程式,讓它能執行、觀察、修正的工作環境,同樣關鍵。 Tripo 在這裡扮演什麼角色?這也是我一開始容易搞混的地方。 Tripo 3D Prompts 本身比較像 3D Vibe Coding 靈感與 Pattern Library。 真正需要 3D 模型時,則可以再透過 Tripo Studio 之類的 AI 3D 工具,從文字或圖片產生角色、車輛、建築、道具等 3D Assets。Tripo 官方功能介紹也將文字與圖片生成 3D 模型列為核心能力。 於是整條 Workflow 就變得很有意思。如果由我來串接,會是: 1234567891011Tripo Prompts 找案例→ 找到接近的 Pattern→ Codex 分析案例→ 產生 PRD(產品需求文件)→ 建立 Three.js Prototype→ AI 產生 3D Assets→ 匯入場景→ 執行測試→ Screenshot→ AI 視覺檢查→ 自動修改 這已經不是以前那種「AI 幫我產一個 3D 模型」,而是一條逐漸完整的 AI 3D Production Pipeline。 這裡描述的是把不同工具接起來的工作流程構想;免費 Prompt Library 與模型生成服務是不同環節,實際生成的可用功能與額度,仍以各工具當下的方案為準。 如果是我,我甚至不會只收藏 342 個 Prompt我反而會再做下一步:把這 300 多個案例重新分類。 例如: Three.js Interactive Pattern Racing Game Pattern Third Person Game Pattern 3D World Pattern Blender Modeling Pattern Physics Simulation Pattern WebGPU Interaction Pattern Product Visualization Pattern 然後把它們做成自己的 3D Vibe Coding Skill。 以後我只需要跟 Codex 說:「幫我做一款 3D 卡丁車遊戲。」 Skill 自己判斷: Game → Racing → Third Person → Vehicle Physics 接著載入對應的 Pattern,然後自己: Plan → Build → Run → Screenshot → Compare → Fix 這是我希望進一步做出的 Skill 設計方向。要讓它實際運作,還需要把分類規則、範例、工具操作與驗收條件整理好。 如果你還不熟悉 Skill、MCP 與 CLI 的分工,可以先看這篇工具名詞整理。 到了這時候,「342 個 Prompt」就不再只是收藏在瀏覽器書籤裡面的資料,而是變成 AI 可以重複使用的能力。 我覺得 3D Vibe Coding 會是下一個很好玩的方向前幾天我才在想:現在用 Three.js + Vibe Coding,到底能不能做一款類似卡丁車的瀏覽器遊戲? 看完這批案例之後,我的答案已經不是「能不能」,而是: 我們接下來可以做到多複雜? 因為當 Coding Agent、Three.js、Blender、AI 3D Model、Browser Automation、Computer Use、Visual QA 這些能力開始接起來之後,門檻正在快速下降。 以前做一個 3D 世界,你可能要會建模、材質、Lighting、動畫、Three.js、物理引擎、Game Logic、UI、程式設計…… 現在慢慢變成: 你負責描述世界,AI 負責把世界建構出來。 所以 Tripo 3D Prompts 最值得收藏的,可能不是那 342 個 Prompt,而是它讓我們提前看到了一件事情: Vibe Coding 的下一站,可能不只是做網站。 而是開始做遊戲、做空間、做互動、做模擬,甚至直接做一個可以走進去的世界。 而我們現在,可能才剛走到 3D Vibe Coding 的第一章。 常見問答 (FAQ)Q1:Tripo 3D Prompts 是什麼?可以免費使用嗎?Tripo 3D Prompts 是免費瀏覽的 AI 3D 提示詞與案例資料庫,涵蓋 Three.js、Blender、瀏覽器遊戲與互動場景。2026 年 9 月 10 日查閱時顯示 342 個案例;部分是作者原始 Prompt,部分是依公開作品整理的任務描述。免費瀏覽案例,不代表搭配使用的模型生成或程式開發工具都沒有費用。 Q2:3D Vibe Coding 與一般 Vibe Coding 有什麼不同?本文用 3D Vibe Coding 描述透過 AI 建構 3D 場景與互動體驗的做法。相較於常見的 2D 網頁介面,它還需要把世界、物件、物理、操作、鏡頭與遊戲規則描述清楚,讓需求從一句願望變成可以執行及驗收的規格。 Q3:為什麼要 Copy Architecture,而不只複製 Prompt?Prompt 的效果容易隨模型與任務改變,但架構與互動模式可以重複使用。例如賽車遊戲的車輛控制、甩尾、檢查點、圈數、對手、跟隨鏡頭與獲勝條件,都可以整理成 Racing Game Pattern,再換成不同場景與美術風格。 Q4:AI 可以只靠 Screenshot 完成 3D 遊戲驗收嗎?不行。Screenshot 適合協助比較構圖、材質、光線與介面等視覺差異;車輛操作、碰撞、圈數與獲勝條件,仍需要實際操作與功能測試。完整回饋迴圈應包含建構、執行、截圖、比較、修改,以及相關功能的再次驗證。 Q5:如何把 Tripo 案例整理成自己的 3D Vibe Coding Skill?可以先按賽車、第三人稱遊戲、3D 世界、Blender 建模、物理模擬或產品展示分類,再把各類案例的需求結構、操作方式、參考素材與驗收條件整理成 Pattern。最後將選擇 Pattern 的規則與 Plan、Build、Run、Screenshot、Compare、Fix 流程寫入 Skill,並接上實際可用的工具。

  • article-短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流

    2026/9/9

    AI工具 影音行銷
    短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流

    做短影音時,很多人會把注意力放在畫面:怎麼剪、怎麼轉場、怎麼加字幕、怎麼做 B-roll。 但實際剪完之後,常常會發現一件事: 畫面看起來沒問題,卻總覺得少了一點「節奏」。 很多時候,差的就是音效(Sound Effects, SFX)。 音效不是拿來吵,也不是每一刀都要加一個「咻」。真正好的音效,是幫畫面增加「感覺」。 畫面放大時,觀眾不只看到 Zoom,也聽到 Whoosh;重點字出現時,不只看到文字跳出來,也同時聽到 Ding 或 Impact。這些聲音會讓觀眾更自然地感受到: 「這裡有變化。」 這件事其實也跟 Pattern Interrupt 很有關係: 畫面的 Pattern Interrupt 是看得到的變化,音效則是聽得到的 Pattern Interrupt。 先把短影音聲音拆成三層如果你剛開始剪影片,不需要一次學很複雜。先把短影音的聲音分成三層,就能建立清楚的混音順序。 第一層:人聲 Voice人聲最重要。不管配樂多好聽、音效多厲害,只要觀眾聽不清楚你在講什麼,整支影片基本上就失敗了。 第二層:背景音樂 BGMBGM 負責情緒與整體氣氛,例如科技感、輕快、溫暖、懸疑、熱血或專業感。這一層可以用 Suno 產生;如果你在意公開播放或商業使用,也可以先參考在 Suno 做了一首歌,想公開播放?小心踩雷!《安心播放三重門》正式指南。 第三層:音效 SFXSFX 負責節奏與強調,例如: 咻!叮!啵!砰!喀! 短影音真正開始「有剪輯感」,很多時候就是從這一層開始。 所以我建議固定採用這個順序: 人聲 → BGM → SFX 先讓人聲清楚,再加入音樂,最後才用音效補節奏。 新手先用剪映內建音效就夠了如果平常使用剪映或 CapCut,其實內建音效已經可以應付大部分短影音需求。CapCut 官方的 Sound Effects 頁面提供 Transition、Magic、Laugh、Fight、Horror 等分類,也可以搜尋 whoosh、click、explosion 等關鍵字。 基本操作邏輯很簡單: 音訊 → 音效 → 搜尋 有一個很建議新手記住的技巧: 中文搜尋不到,就搜尋英文。 很多常用的短影音音效,本來就是用英文名稱分類。先從搜尋開始,不需要一開始就下載一大堆素材。 短影音最常用的音效,先記住這些其實不需要收藏幾百個音效。先掌握下面這些,就已經可以應付大部分 Reels、Shorts 與商品短影音。 音效 可以搜尋 適合使用情境 咻、刷過 Whoosh / Swoosh / Swish 畫面切換、Punch In 輕微咻聲 Soft Whoosh 圖卡、字幕出現 叮 Ding / Chime 答案、重點、完成 啵 Pop 圖示、文字跳出 點擊聲 Click / Tap App、按鈕、介面操作 撞擊聲 Impact / Hit 強調重點句 低沉轟聲 Boom / Bass Hit 震撼、結論、反轉 上升音 Riser / Rise 揭曉之前、製造期待 低頻下降 Bass Drop / Sub Drop 反轉、結論 掃過 Sweep 轉場 故障聲 Glitch AI、科技、錯誤 閃亮聲 Sparkle / Magic / Twinkle AI 生成、變身、完成 相機快門 Camera Shutter 照片、Before / After 打字 Typing / Keyboard ChatGPT、電腦操作 通知 Notification LINE、訊息、提醒 錯誤聲 Error / Buzzer NG、錯誤觀念 嗶聲 Beep 警告、消音 唱片急停 Record Scratch 反轉、「等等!」 倒轉 Rewind 回到前面重新解釋 心跳 Heartbeat 緊張、倒數 掌聲 Applause / Cheer 成功、完成 金幣聲 Coin / Cash Register 價格、營收、賺錢 如果你真的只想先背幾個,我會挑這 8 個: Whoosh、Ding、Pop、Click、Impact、Riser、Glitch、Sparkle 先把這八個用熟,比收藏 500 個音效更有用。 音效應該放在哪裡?先對齊畫面變化這才是真正重要的地方。不是「有 Cut 就放音效」,而是問自己: 這個畫面變化,有沒有需要讓觀眾聽見? Punch In:畫面拉近時人物本來是中景,講到: 「但真正重要的是這件事。」 畫面突然拉近,這時候可以放一個 Whoosh,讓放大的感覺更明顯。 大字突然出現畫面跳出: 錯! 可以配 Impact。視覺與聲音會同時告訴觀眾: 這一句很重要。 正確答案出現例如: 「答案就是 ChatGPT。」 配 Ding,會產生「答案揭曉」的感覺。 三個項目依序出現畫面依序出現: ChatGPT Pop Gemini Pop Claude Pop 這種音效不是拿來炫技,而是在幫觀眾感受到「一、二、三」的節奏。 AI 生成完成例如: Before ↓ AI 處理 ↓ After 最後成果出現時,可以配 Sparkle / Magic,讓觀眾自然理解:「完成了。」 如果你也在處理字幕與剪映流程,可以延伸閱讀 AI 影片字幕工作流:結合 Gemini 與剪映的極速上字幕教學;字幕與音效同樣都需要對齊畫面節奏。 音效不是越多越好這是新手非常容易犯的錯。有人第一次發現 Whoosh 很好用,就開始: 咻、咻、咻、咻、咻…… 每一個轉場都放,最後反而很累。 音效跟 Pattern Interrupt 一樣: 重點不是多,而是放在該放的地方。 可以先用下面這個簡單原則判斷: 畫面狀況 音效建議 一般 Cut 不一定需要音效 有明顯動作 可以考慮 Whoosh 有重要資訊 可以考慮 Ding、Pop、Impact 有情緒轉折 可以考慮 Record Scratch、Bass Drop、Riser 有特殊場景 才需要特殊環境音或 AI 生成音效 剪映找不到時,從 Mixkit 與 Pixabay 補素材Mixkit:建立免費 SFX 素材庫如果剪映裡真的找不到,我第一個會推薦學員去 Mixkit。 Mixkit 提供大量免費 Sound Effects,包含 Swoosh、Transition、時鐘、掌聲、電話鈴聲與科技類音效。官方頁面也將素材分成 Transition、Impact、Whoosh、Click、Ding、Notification、Glitch 等類型,適合用英文關鍵字快速搜尋。 Mixkit 的說明指出,Sound Effects 可用在個人與商業專案,例如 YouTube、社群內容與線上行銷廣告,且不強制署名。不過,實際使用前仍建議查看素材頁與當下授權條款。 所以很適合先搜尋: whoosh impact click notification 然後下載幾個自己喜歡的版本。 Pixabay:免費、可修改,但要看完整授權Pixabay 不只有圖片和影片,也有音訊與 Sound Effects。 依 Pixabay 目前的 Content License Summary,一般內容可以免費使用、修改,也不強制署名;但不能把原始素材單獨拿去重新販售或散布。如果素材含有可辨識的商標、Logo 或品牌,商業使用可能還有額外限制;某些內容也可能涉及第三方的著作權、商標權或肖像權。 因此,如果是 YouTube、Reels、Shorts 或商業社群影片,Pixabay 很方便,但不要把「免費」直接等同於「任何情境都不用確認授權」。 我的順序通常會是: 剪映內建 → Mixkit → Pixabay 大部分需求到這裡就能解決。 什麼時候才需要 AI 生成音效?當你要的聲音很具體,而素材庫不好找時,才值得使用 AI。 例如: 一列火車從遠方靠近,先聽到警笛,再經過身旁。 或是: 未來科技實驗室裡,機械手臂啟動的聲音。 又或者: 一顆巨大水滴落進金屬容器,再產生長尾回音。 這種聲音不太適合一直翻音效庫,直接用 AI 描述反而更快。 Adobe Firefly Sound Effects:特殊音效首選Adobe Firefly 現在提供 Generate Sound Effects,可以直接用文字描述音效,也能上傳影片或音訊作為參考,還能用自己的聲音或錄音來引導生成。 依 Adobe 目前官方說明,免費帳號有每日免費生成額度;正式版 Firefly 產出的 Sound Effects,在遵守 Adobe 指南與商業版本條件下,可用於商業用途。音效檔可下載為 WAV;上傳影片或音訊作為組合素材時,目前支援的檔案最長為 30 秒。功能、額度與授權都可能調整,正式使用前請再次查看 Adobe Firefly 說明 與官方 Sound Effect Generator 頁面。 例如輸入: distant passenger train horn approaching, realistic railway ambience 就可以生成「遠方列車逐漸靠近的警笛與環境聲」方向的音效。 如果我是現在重新設計這堂課,我會把 Firefly 排成: 特殊音效 AI 首選 ElevenLabs:適合快速試做與比較如果你以前有用 ElevenLabs 生音效,現在仍然可以繼續用。它的 Sound Effects 功能可以直接用文字生成指定聲音。 依 ElevenLabs 目前官方方案頁,免費帳號每月有 10,000 credits,約可進行 50 次 Sound Effects generation,單段最長 30 秒;但免費方案標示為 Personal use only,商業用途需要付費方案。付費帳號的 Sound Effects 可依方案用於商業影片、YouTube、社群與廣告。方案、額度與授權可能變動,請以 ElevenLabs Sound Effects 的最新說明為準。 因此我會這樣分: 課堂練習、測試ElevenLabs Free 很適合先測試提示詞與聲音方向。 客戶影片、正式商業用途先確認授權,或使用符合需求的付費方案。 AI 音效提示詞,也有公式其實跟 AI 生圖、AI 生影片很像,不要只輸入: 火車聲。 資訊太少。 我會用這個公式: 聲音主體 + 動作 + 距離 + 環境 + 強度 + 時長 + 排除項目 火車警笛 Realistic passenger train horn approaching from a distance, outdoor railway ambience, powerful but natural, 3 seconds, clean sound effect, no music, no speech. 短 Whoosh Short soft whoosh, fast left-to-right motion, clean video transition sound, 0.5 second, no music. Ding Single bright notification ding, crisp and clean, positive feeling, 0.5 second, no background music. 重點撞擊 Deep cinematic impact hit, short and powerful, strong low-frequency punch, 1 second, no music. 你會發現,提示詞不是寫得很文青,而是: 把你想聽到的聲音講清楚。 建立自己的 SFX Starter Pack短影音剪久了之後,不需要每次重新搜尋。我建議建立自己的音效資料夾: 123456789101112131415161718192021222324252627282930313233SFX Starter Pack01_Transitions whoosh_soft whoosh_fast swoosh sweep02_UI click tap ding pop notification03_Emphasis impact_soft impact_heavy boom bass_drop04_Emotion fail_buzzer record_scratch sparkle applause05_Ambience typing camera crowd street rain 差不多 20 個左右,就已經可以剪非常多影片。 重點不是蒐集音效,而是: 慢慢建立自己熟悉、知道什麼時候可以用的音效庫。 把整個短影音音訊流程串起來如果是新手,我會建議固定這個工作流: 先處理人聲 ↓ Suno 產生 BGM ↓ 剪映加入常用 SFX ↓ 找不到特殊音效? ↓ Adobe Firefly/ElevenLabs 生成 ↓ 最後混音與檢查 音量可以先從下面的數字當作「起始參考」。以下比較接近剪輯軟體中的峰值概念,不是所有素材都必須固定在同一個數字: 🎤 人聲:約 -3 ~ -6 dB 💥 SFX:約 -10 ~ -15 dB 🎵 BGM:約 -18 ~ -24 dB 最後還是要依素材、播放設備與平台需求調整。最重要的只有一句: 最後用耳朵確認,人聲永遠要最清楚。 給新手最簡單的結論如果不想一次學太多工具,可以先記這三個: 剪映處理 80% 常用音效。 Mixkit建立自己的免費 SFX 素材庫。 Adobe Firefly Sound Effects處理素材庫找不到的特殊聲音。 然後 Suno 負責 BGM。 這樣其實就已經是一套很完整的短影音聲音工作流。 真正讓影片變好看的,不是音效越多,而是你開始知道: 哪一個地方,需要讓觀眾不只「看到變化」,還要「聽到變化」。 這才是音效在短影音裡真正的價值。 常見問答 (FAQ)Q1:短影音裡的 SFX 和 BGM 有什麼差別?BGM 負責整支影片的情緒與背景氣氛;SFX 負責對齊畫面中的動作、重點與轉折,讓觀眾在特定瞬間「聽到變化」。兩者都不能蓋過清楚的人聲。 Q2:短影音每一次 Cut 都需要加入音效嗎?不需要。一般 Cut 可以不加音效;有明顯動作、重要資訊、情緒轉折或特殊場景時,再考慮使用 Whoosh、Ding、Impact、Riser 或環境音。 Q3:新手應該先用哪一個工具找音效?建議先用剪映或 CapCut 內建音效,再用 Mixkit 與 Pixabay 補充免費素材;只有當素材庫找不到具體聲音時,才使用 Adobe Firefly 或 ElevenLabs 生成。 Q4:AI 生成音效可以直接用在商業影片嗎?要看工具、方案與當下授權條款。Adobe Firefly 官方目前說明商業版本產出的音效可依指南用於商業用途;ElevenLabs 則標示免費方案限個人使用,商業用途需使用符合條件的付費方案。Mixkit 與 Pixabay 也各自有授權限制,正式使用前應查看最新官方條款。 Q5:AI 音效提示詞要寫哪些資訊?至少寫清楚聲音主體、動作、距離、環境、強度、時長與排除項目,例如「遠方靠近的列車警笛、戶外鐵路環境、自然但有力量、3 秒、不要音樂與人聲」。