跳到主要內容

部落格

不定期分享最新資訊文章

  • article-我覺得 VoiceStudio 最值得注意的地方,根本不是免費

    2026/9/15

    AI自動化 AI工具 影音行銷
    我覺得 VoiceStudio 最值得注意的地方,根本不是免費

    最近看到一套開源 AI 語音工具 VoiceStudio。 它可以在自己的電腦執行,支援 TTS、語音複製、多角色語音與影片配音,也不需要每個月再付一筆訂閱費。 看到這裡,很多人的第一個反應可能是: 那我是不是可以不用訂 ElevenLabs 了? 但我研究完之後,反而覺得「免費」可能是這套工具最不重要的地方。 真正讓我感興趣的是另外一件事情: AI 配音,正在從一個「工具」,變成 AI 工作流裡的一個「節點」。 本文談的是我對 VoiceStudio 與本地語音工作流的觀察,不是對不同語音服務的固定排名。實際功能、模型支援、硬體需求與授權方式,都應以當下的專案文件與模型授權條款為準。 我們現在用 AI,其實還是在「操作軟體」想一下現在大部分人怎麼做 AI 影片。 先叫 ChatGPT 寫腳本。 複製文字。 打開配音網站。 貼上文字。 選聲音。 按生成。 下載音檔。 再打開剪輯軟體。 匯入音訊、對字幕、找 B-roll、剪輯、輸出。 看起來整個流程用了很多 AI,但其實中間有一個很重要的角色一直沒有消失: 你。 你還是那個負責把 A 工具的結果複製到 B 工具,再把 B 工具的結果下載下來丟進 C 工具的人。 換句話說,AI 很厲害,但你還是一個「AI 工具操作員」。 這也是我之前思考 AI 影片工廠時,會把腳本、配音、字幕、素材與剪輯拆成不同能力的原因。可以先參考用 Codex 打造 AI 影片工廠:串接六大 AI 能力的完整工作流,影片工廠真正要處理的,不只是多找到幾個好用工具,而是讓每個能力可以被下一個步驟穩定接住。 真正的改變,是你連 VoiceStudio 都不用打開VoiceStudio 讓我感興趣的,不只是它可以在本地執行。 而是這類工具開始提供 API、MCP 之類可以讓其他程式直接呼叫的介面。 這件事情看起來很工程師,對內容創作者其實非常重要。 因為當一個 AI 工具可以被程式呼叫之後,「人」就不一定要站在中間了。 例如我最近一直在研究 AI 自動剪輯。 理想中的流程不是: 1我打開 ChatGPT → 打開配音軟體 → 打開剪輯軟體 而是: 1234567891011121314151617文章完成 ↓AI 自動整理成短影音腳本 ↓自動送進本地 Voice Clone ↓產生我的聲音 ↓自動分析旁白時間軸 ↓自動尋找 B-roll ↓自動產生字幕與字卡 ↓自動剪輯 ↓輸出成片 如果這條流程真的串起來,我根本不需要知道 VoiceStudio 的「生成」按鈕在哪裡,甚至不用打開 VoiceStudio。 因為它已經從「我要操作的軟體」,變成「我的 AI 員工背後會使用的一項能力」。 我覺得這才是接下來真正重要的改變。 以後我們可能不會在意「你用哪一套 AI」現在很多人在比較: ChatGPT 還是 Claude? ElevenLabs 還是 VoiceStudio? 這個生圖模型比較強,還是那個比較強? 這些當然重要,但如果 Agent 的發展繼續下去,我猜這些問題的重要性會慢慢降低。 因為使用者最後看到的可能根本不是工具。 你只會跟 AI 說: 把這篇文章做成三支短影音。 剩下的事情由 Agent 自己決定。 1234567需要寫腳本,就呼叫文字模型需要圖片,就呼叫生圖模型需要我的聲音,就呼叫本地 Voice Clone需要字幕,就呼叫語音辨識需要素材,就去素材庫搜尋需要剪輯,就呼叫影片處理工具最後丟三支影片給我挑 這時候,ChatGPT、VoiceStudio、FFmpeg、Whisper 或其他模型,全部退到後台。 使用者根本不需要看到它們。 這不代表底層工具不重要,而是工具的價值開始從「使用者介面有多順」延伸到「能不能穩定成為其他系統可呼叫的能力」。 本地 AI 真正有趣的地方,也不只是省錢很多人談 Local AI,第一件事情就是算成本: ElevenLabs 一個月多少錢? 本地模型是不是免費? 跑在自己的電腦上是不是比較便宜? 如果只是偶爾做幾支影片,我甚至覺得這不是最重要的問題。 雲端服務通常比較方便,模型可能也更穩定;本地方案則會多出硬體、安裝、更新、維護與排錯成本。軟體可以免費使用,也不代表每個語音模型都能免費商用,實際使用前仍要確認各自的授權條款。 真正有趣的是: 當 AI 能力搬到自己的電腦,它開始變成你可以控制的基礎設施。 不用每一次都開網頁。 不用每一次都上傳資料。 也不用每一次都等人按下「生成」。 只要電腦開著,Agent 就可以自己呼叫。 這對一天做一支影片的人,差異可能還不大。 但如果未來你不是一天做一支,而是讓 AI 一次處理 20 支、50 支,甚至 100 支內容,整個思考方式就完全不一樣了。 你不再是在找: 最好用的 AI 配音網站。 你是在建立: 我的 AI 內容基礎設施。 聲音,也正在變成一種可以重複使用的數位資產另外一個我覺得很有意思的變化,是「自己的聲音」。 以前聲音不是資產。我要錄一段新的內容,就必須重新開麥克風講一次。 講錯一句,重新錄。 課程改了一句,重新錄。 想做英文版,再錄一次。 但是 Voice Clone 出現之後,邏輯開始改變。 我的聲音可以被抽象成一個可以重複呼叫的能力。 今天拿來做短影音。 明天拿來補錄線上課程。 後天文章自動轉 Podcast。 甚至同一支內容自動產生不同語言版本。 所以未來自媒體經營者要管理的,可能不只有文章、圖片、影片與 Prompt,還會多一個東西: 自己的 Voice Profile。 它會跟 Logo、品牌色、字型、人物 LoRA 一樣,逐漸變成個人品牌的數位資產。 但這種資產也需要被好好管理:聲音樣本的保存、誰可以呼叫、哪些內容可以生成、是否允許商用,以及被濫用時如何撤銷,都不能只靠「模型很像」來處理。 把「我是誰」和「我要怎麼說」拆開這件事對自動剪影片非常重要。 一支短影音不可能從頭到尾都使用同一種情緒: 開頭 Hook 可能要比較興奮 中段解釋要穩定清楚 提醒風險時要嚴肅 講到反差時可能要驚訝 最後 CTA 又要比較親切 因此,Voice Engine 可以拆成兩層: 我是誰: 聲音的音色、辨識度與個人品牌特徵。 我要怎麼說: 情緒、語速、停頓、重音與表達方式。 理想的流程會是: 1234567891011腳本 ↓AI 理解內容 ↓判斷每一段情緒 ↓選擇語速與表達方式 ↓Voice Clone 生成 ↓送進剪輯流程 這時候 AI 就不只是單純「念稿」,而是開始理解:這句話應該怎麼說。 如果你也在處理影片聲音,可以延伸參考短影音音效怎麼選?從剪映內建到 AI 生成,一次搞懂 SFX 工作流。克隆旁白解決的是「誰在說」,SFX 與混音則決定觀眾「聽起來感覺如何」,兩者應該放在同一條聲音工作流裡設計。 我不太想問「VoiceStudio 能不能取代 ElevenLabs」因為我覺得這個問題太小了。 ElevenLabs 好不好用?當然好用。 VoiceStudio 免費嗎?軟體本身確實可以免費使用,但實際使用的語音模型仍要確認各自授權。 真正值得測試的是: 我能不能把 VoiceStudio 塞進自己的 AI Short Factory,然後以後根本不用打開它? 如果可以,那代表配音這件事情已經從: 我要做的工作 變成: AI 自己會完成的一個步驟 再往後,生圖是一個節點,配音是一個節點,字幕是一個節點,B-roll 是一個節點,剪輯是一個節點,發布也可能是一個節點。 當這些節點全部串起來,我們真正建立的就不再是一堆 AI 工具,而是一條: AI 內容生產線。 所以 VoiceStudio 免費這件事情,我當然很開心。 但比免費更讓我興奮的是: 我們正在慢慢進入一個「不用操作 AI 工具」的時代。 真正值錢的能力,也會從「你會多少 AI 工具」,逐漸變成: 你能不能把這些 AI 能力,組成一套會自己工作的系統? 這可能才是 AI 自媒體下一階段真正拉開差距的地方。 常見問答 (FAQ)Q1:VoiceStudio 最值得注意的地方是免費嗎?不只是免費。更值得注意的是,VoiceStudio 這類本地語音工具若能透過 API 或 MCP 被其他程式呼叫,就有機會成為 AI 內容工作流裡的語音節點,讓配音從手動操作變成可重複執行的步驟。 Q2:接進 AI 工作流後,還需要打開 VoiceStudio 嗎?理想上不需要。當 Agent 已經能透過 API 或 MCP 呼叫語音能力,使用者只要提出「把文章做成短影音」這類目標,VoiceStudio 可以在後台完成配音;但實際能否做到,仍取決於工具提供的介面、設定方式與整合品質。 Q3:本地 AI 語音一定比較省錢嗎?不一定。本地執行可能減少訂閱或按量計費,但仍要計入硬體、安裝、更新、維護、電力與排錯成本;此外,軟體免費也不代表所使用的語音模型都允許免費商用,必須逐一確認授權。 Q4:自己的 Voice Profile 可以當成個人品牌資產嗎?可以把它視為一種可重複呼叫的數位資產,但需要同時管理聲音樣本、存取權限、生成範圍、商用許可與撤銷機制。聲音相似度只是品質的一部分,不等於完整的品牌治理。

  • article-【30 秒 AI 影片,模型只花 513 元,為什麼報價可以是一萬元?】

    2026/9/15

    商業策略 內容行銷 影音行銷
    【30 秒 AI 影片,模型只花 513 元,為什麼報價可以是一萬元?】

    先說結論:AI 影片最貴的可能從來不是模型,而是把 500 秒垃圾變成 30 秒作品的人。 文中的模型單價與金額,都是用來說明估價邏輯的示例,實際費用會隨模型版本、解析度、平台方案與計價方式變動。真正值得留下來的,不是某個當下單價,而是如何把採用率、修改量與人力一起放進成本模型。 30 秒成片,為什麼不能只用「秒數 × 單價」?最近 AI 影片越來越強,我也開始看到一個很有趣的問題: 「現在 AI 生成影片這麼便宜,那做一支 30 秒影片,到底應該收多少錢?」 很多人第一個想到的算法是: 130 秒 × 模型每秒單價 假設模型生成一秒 11 元,那 30 秒就是: 130 × 11 = 330 元 所以一支 30 秒 AI 影片,成本才 330 元? 如果只是生成一段素材自己玩,這樣算沒有什麼問題。 但如果今天是客戶付錢,要你交出一支「可以用的商業成片」,事情完全不一樣。 因為 AI 影片最大的成本,從來不是「生成」,而是: 你生成了一大堆,最後到底有多少能用? AI 影片最容易被忽略的成本:抽卡假設最後成片需要 30 秒,你不可能剛好生成 30 秒,然後 30 秒全部拿來用。 人物可能崩掉,手可能有問題,商品 Logo 變形,表情不對,運鏡突然抽風,前後鏡頭接不起來。 甚至畫面都沒問題,你只是單純覺得: 「這顆不好看。」 於是重抽。 這就是大家常講的「抽卡」。 如果最後生成了 150 秒素材,只有 30 秒進入成片,那麼你的「採用率」就是: 130 ÷ 150 = 20% 換句話說,成片每留下 1 秒,背後平均有 4 秒被丟掉。 所以我在估 AI 影片成本時,比起模型一秒多少錢,我其實更在意另一個數字:採用率。 粗略規劃時,我可能會先這樣抓: 專案情境 初步採用率估算 社群短影音 約 40% 一般商用敘事影片 約 20% 高規格長片 約 10% 這不是什麼業界公定標準,只是讓自己不要活在「AI 每次生成都會成功」的幻想裡。 同一個模型,採用率不同,成本可以差四倍假設今天使用的模型是每生成一秒 11 元,做一支 30 秒影片: 採用率 估算生成量 模型成本 40% 30 ÷ 0.4 = 75 秒 75 × 11 = 825 元 20% 30 ÷ 0.2 = 150 秒 150 × 11 = 1,650 元 10% 30 ÷ 0.1 = 300 秒 300 × 11 = 3,300 元 有沒有發現一件很有意思的事情? 模型完全沒有換,影片長度也完全沒有換。 光是「採用率」不同,模型成本就差了四倍。 所以我現在反而覺得,AI 影片真正的技術,不只是會不會生成,而是你能不能提高採用率。 會做角色設定、Reference、分鏡、首尾幀、鏡頭拆解、素材控制、提示詞工程的人,真正省下來的不是按按鈕的時間,而是少抽很多次卡。 需要 3 秒,不代表只付 3 秒例如一顆鏡頭,我最後只需要 3 秒,但模型一次可能生成 5 秒。 第一次不行,再來。 第二次人物表情怪怪的,再來。 第三次商品變形,再來。 第四次終於可以。 最後時間軸上只有 3 秒,但實際付費生成了 20 秒。 所以如果真的要精算,我會看另一個數字: 1有效採用率 = 實際進入成片秒數 ÷ 實際付費生成秒數 這個數字,比「我今天生成了幾顆鏡頭」更值得追蹤。因為真正影響成本的,是付費生成了多少,以及最後有多少秒成功進入交付版本。 客戶修改:最容易低估的第二輪抽卡第一版完成之後,客戶說: 「這邊人物可以笑一點嗎?」 真人拍攝的後製,也許還有一些調整空間。 但 AI 影片很可能不是把嘴角往上拉一點就結束。你得重新生成整顆鏡頭,然後重新面對一次人物、服裝、商品、背景、運鏡與光線全部變動的風險。 更刺激的是:你原本只想修改 A,AI 很可能順便幫你把 B、C、D 也改了。 所以一般委製案,我會先保留大約 20% 的修改預備量。 我的快速估算公式會變成: 1模型費 = 成片秒數 ÷ 採用率 × (1 + 修改率) × 每秒生成單價 但這還只是模型費。 案例:30 秒影片,模型費可能真的只有 513 元假設今天做一支 30 秒直式社群影片: 使用 Seedance 2・720p,每生成一秒約 5.7 元。 採用率抓 40%。 修改預備量抓 20%。 那麼估算生成量是: 130 ÷ 40% × 1.2 = 90 秒生成量 模型費就是: 190 × 5.7 = 513 元 模型費:513 元。 很便宜吧? 問題來了。 假設一位初階製作者,一天人力成本抓 2,000 元,整個專案工作五天: 12,000 × 5 = 10,000 元 模型加人力: 1513 + 10,000 = 10,513 元 模型費只占大約 4.9%,剩下約 95.1% 都是人。 客戶真正買的到底是什麼?這也是我覺得現在 AI 影片市場最容易誤會的地方。 客戶看到的是: 「你不就是打 Prompt,然後按生成嗎?」 但真正的工作可能是: 企劃 腳本 分鏡 角色設定 場景設定 提示詞 生成 挑片 補生成 角色一致性 QC 商品 QC 剪輯 字幕 配音 音樂 調色 輸出 客戶溝通 修改 所以如果要更精準估價,我甚至不會只寫: 1人力費 = 人日單價 × 工作人日 而會拆成: 1專案成本 = 前期製作 + AI 生成 + 後期製作 + 專案管理 前期製作包含企劃、腳本、分鏡、角色與場景設定;AI 生成包含抽卡、補生成與修改預備量;後期製作包含剪輯、字幕、配音、音樂、調色與輸出;專案管理則包含溝通、版本整理、回饋整合與交付。 這和價值堆疊如何讓產品不再被說太貴的邏輯很接近:不是把一個總價藏起來,而是讓客戶看見交付價值是由哪些工作組成。 因為客戶付的從來不是那 513 元的 GPU 費用,他真正付錢買的是:有人可以把幾百秒充滿不確定性的 AI 素材,收斂成最後可以交付的 30 秒。 生成成本正在下降,但「選擇成本」沒有這可能才是 AI 影像產業接下來真正有趣的地方。 以前拍影片最大的問題是:「拍不到。」 所以你需要攝影棚、攝影機、燈光、演員、場景、攝影師、美術與製片。每按一次快門都有成本。 但生成式 AI 把這件事情反過來了。 未來最大的問題可能不是: 「做不出來。」 而是: 「做得出來的東西太多了。」 100 顆鏡頭都可以生成。問題是: 哪一顆能用? 哪一顆最好? 哪一顆符合品牌? 哪一顆人物沒有跑掉? 哪一顆商品沒有變形? 哪兩顆接起來才合理? 哪一顆值得繼續修改? 這些全部都是人的判斷。 所以我甚至認為,未來 AI 影片產業真正稀缺的能力,會慢慢從單純的 Production,轉向: 1Direction + Selection + QC 導演能力、選擇能力與品質控制能力。 如果你想進一步理解如何把抽卡整理成可以重複執行的流程,也可以延伸閱讀AI 影片真正的分水嶺:從 Prompt 到專家 Skill 的製片工作流。 100 分鐘 AI 電影,真的只要 20 萬元?我們再把尺度拉大。 假設要製作一部 100 分鐘 AI 電影: 總片長:6,000 秒。 使用 Seedance 2.5・1080p,每生成一秒約 21.3 元。 高規格長片採用率抓 10%。 先不加入修改預備量,估算生成量是: 16,000 ÷ 10% = 60,000 秒生成量 模型成本: 160,000 × 21.3 = 1,278,000 元 光模型就大約 128 萬元。 假設再投入 450 個人日,每人日平均 5,000 元: 1450 × 5,000 = 2,250,000 元 模型加人力: 11,278,000 + 2,250,000 = 3,528,000 元 如果再把約 20% 的生成修改預備量加到模型費: 11,278,000 × 1.2 + 2,250,000 = 3,783,600 元 整體約 378 萬元左右。 而且這還沒有完整納入劇本開發、專業配音、演員、音樂、混音、法務、授權、製片管理、發行與行銷。 所以 AI 電影確實有可能把過去需要幾千萬、甚至上億元才能完成的事情,壓到非常誇張的價格;但也不是「我有二十萬元、一台電腦,再加上一個很模糊的故事概念」就可以拍電影了。 模型越便宜,專業 AI 影片製作者不一定越便宜這可能是最反直覺的一件事。 我反而認為,接下來模型價格還會繼續下降,生成速度會繼續提高,畫面品質也會繼續變好。 「把畫面生出來」這件事情,會愈來愈不值錢。 但這不代表專業 AI 影片製作者的價格,也一定跟著往下掉。 因為當每個人一天都可以生成幾百、幾千段影片之後,真正稀缺的東西反而變成: 知道什麼值得留下來的人。 所以未來客戶付錢買的,不會只是: 「幫我生成 30 秒影片。」 而是: 「幫我從幾百秒垃圾裡,得到最後這 30 秒。」 AI 讓畫面出現得愈來愈便宜,但把畫面變成作品,依然很貴。 而且我猜,這件事情短期內不會改變。 常見問答 (FAQ)Q1:一支 30 秒 AI 影片的模型成本到底是多少?模型成本沒有固定答案,至少要同時看每秒生成單價、採用率與修改預備量。以本文的示例計算,30 秒成片、40% 採用率、20% 修改預備量與每秒 5.7 元的模型,模型費約為 513 元。 Q2:什麼是 AI 影片的採用率與有效採用率?採用率是「成片秒數 ÷ 生成素材總秒數」;有效採用率則是「實際進入成片秒數 ÷ 實際付費生成秒數」。後者會把每次重抽與模型實際計費的秒數一起納入,更適合用來追蹤專案成本。 Q3:為什麼模型只花 513 元,客戶報價卻可能超過一萬元?因為客戶購買的不只是模型生成,而是企劃、腳本、分鏡、角色與場景設定、抽卡、挑片、QC、剪輯、配音、音樂、調色、溝通與修改等完整交付。本文示例中,模型費約占 4.9%,主要成本來自五天的人力與判斷。 Q4:AI 影片應該怎麼快速估算模型費?可以先使用「模型費 = 成片秒數 ÷ 採用率 × (1 + 修改率) × 每秒生成單價」估算,再另外加上前期製作、後期製作與專案管理。採用率不是公定標準,應依角色一致性、商品辨識、鏡頭複雜度與客戶修改風險調整。 Q5:100 分鐘 AI 電影是不是只要二十萬元就能完成?不能只用模型單價判斷。依本文的示例,6,000 秒成片、10% 採用率、每秒 21.3 元模型費、450 個人日與 20% 生成修改預備量,模型加人力約需 378 萬元,且尚未計入劇本、配音、音樂、法務、授權、製片、發行與行銷。

  • article-【Google Flow 的 /orbit 到底是什麼?從 Veo 到 Omni Flash,一次搞懂 AI 影片的運鏡指令】

    2026/9/14

    AI工具 影音行銷 Gemini
    【Google Flow 的 /orbit 到底是什麼?從 Veo 到 Omni Flash,一次搞懂 AI 影片的運鏡指令】

    最近我看到一個有趣的 Google Flow 用法:生成影片時,只輸入 /orbit,畫面就像替主體加上環繞運鏡。其他人也會整理 /dollyin、/tracking、/lowangle、/macro、/goldenhour、/ugcunboxing 等斜線寫法,看起來很像產品裡藏了一套秘密指令。 研究後我更想弄清楚的,不是還有幾百個指令,而是這些詞背後共通的攝影語言。理解鏡頭怎麼移動、如何構圖、光線如何呈現,才能把這些概念帶到 Veo、Gemini Omni Flash,或其他能以自然語言生成影片的模型。 /orbit 是 Google Flow 的官方指令嗎?目前查閱 Google Flow 的官方影片建立說明,流程是用提示詞描述場景,再選擇模型、比例與片長;我沒有在這份說明中找到 /orbit 或名為 Google Flow Slash Command API 的公開指令定義。因此,較穩妥的理解是:這些斜線詞是創作者整理的 Prompt Shorthand(提示詞快捷寫法),不是已確認的官方 API。 這不代表輸入 /orbit 一定沒有作用,而是不能假設斜線會觸發一個保證存在的程式指令。實際生成可能受 orbit 這個詞、上下文與各模型的語意理解影響;想讓需求更清楚,可以把它改寫成完整句子: 1The camera smoothly orbits around the subject. orbit 本身就是常見的攝影運鏡概念。類似地,dolly in 是攝影機向主體推進,tracking shot 是跟著人物或物件移動,low-angle shot 是低角度拍攝,macro shot 是微距特寫,而 golden hour 描述的是接近日出或日落的暖色光線。 真正值得記住的是可跨模型使用的攝影語言如果只記 /orbit,介面改版或另一個模型不認得斜線寫法時,這個捷徑就可能失效。若記住 Orbit Shot=環繞運鏡,你就能再補上方向、幅度、速度與主體位置,把同一個想法展開成不同細節層級的提示詞。 在 Google Flow 裡,影片模型與支援功能會因選用的模型而不同;官方也建議生成前確認目前的模型與設定。Gemini Omni Flash 官方提示指南則明確提到場景、鏡頭運動、光線與情緒等描述方式。這些資料支持「攝影語言可以用自然語言表達」的做法,但不代表所有模型都會以相同方式遵循提示詞。 把 AI 影片提示詞拆成五個層級以 Orbit 為例,可以從一個簡短概念逐步增加控制資訊: Level 1:先給運鏡名稱1/orbit 這是最精簡的快捷寫法,只表達「希望鏡頭環繞主體」。 Level 2:回到標準攝影語言1Orbit around the subject. 拿掉斜線後,仍然保留同一個運鏡概念。 Level 3:加入方向與速度1The camera slowly orbits clockwise around the subject. 現在提示詞多了慢速與順時針兩個條件。 Level 4:補上角度、距離與主體位置1The camera performs a slow 180-degree clockwise orbit around the subject, maintaining a constant distance and keeping the subject centered. 除了環繞方向與速度,也交代移動幅度、攝影機距離和主體在畫面中的位置。 Level 5:寫成一段有時間節奏的導演腳本12345Single continuous shot. No cuts.[0-2s] Static medium shot.[2-7s] Slow 180-degree clockwise orbit around the subject. Maintain a constant camera distance and keep the subject centered.[7-10s] Lower the camera and settle into a low-angle hero shot.Warm golden-hour rim lighting. Keep the subject visually consistent. No dialogue. 到這一層,提示詞已經交代鏡頭何時開始移動、移動多久、最後停在哪裡。時間標記可以幫模型理解節奏與順序,但它仍是生成提示,不是逐格精準的剪輯時間軸;實際結果要看模型、版本與生成設定。 一個運鏡有五個可調整的控制維度/orbit 只說出運鏡名稱。若想減少生成結果像抽卡,可以把它拆成五個方向來描述: 控制維度 可以描述的內容 方向 順時針、逆時針、由左向右、由右向左 幅度 45 度、90 度、180 度或完整 360 度 速度 非常慢、緩慢、快速或急速 距離 貼近主體、遠距環繞、維持固定距離 結束畫面 特寫、低角度英雄鏡頭、主體背後或正面 例如,A slow 180-degree clockwise orbit, maintaining a constant distance, ending in a low-angle close-up hero shot. 就比單獨輸入 /orbit 多交代了可供模型參考的畫面條件。提示詞不一定要很長,重點是把真正重要的控制維度說清楚。 Veo 的攝影積木與 Omni Flash 的時間軸寫法教學時,我會用「攝影積木」介紹 Veo:主體、動作、景別、運鏡、光線與聲音,再依需要組合。到了 Gemini Omni Flash,我會多練習用時間軸描述一段連續鏡頭,明確寫出每一段的畫面變化。 這是方便理解提示詞的教學方式,不代表 Veo 只能用積木、Omni Flash 才能用時間碼。Gemini Omni Flash 的官方指南說明,模型預設可能嘗試生成多個鏡頭;若需要單一連續畫面,可以寫明 In a single continuous shot 或 No scene cuts,並以時間標記交代事件發生順序。不同模型與 Flow 功能的支援狀況仍可能不同,使用前應確認當下選取的模型與設定。 以 10 秒商品廣告為例,可以這樣寫: 12345Single continuous shot. No cuts.[0-3s] Close-up product shot. A bottle sits on a reflective black surface.[3-7s] The camera slowly orbits clockwise around the bottle while gently pushing in.[7-10s] The camera settles into a low-angle hero shot.Warm golden-hour rim lighting. Keep the product label consistent. No dialogue. 這段提示詞不只說「環繞」,也說明何時開始、同時搭配什麼動作、最後停在哪個景別。若你想先把多個鏡頭的順序規劃好,也可以延伸閱讀用 AI 快速生成短影音?九宮格分鏡技巧解決人物變形。 把 Slash Commands 當成攝影積木,而不是終點這些斜線寫法仍然很好用,尤其適合初學者快速記住攝影概念。可以先整理成自己的攝影積木: 運鏡: /orbit、/dollyin、/dollyout、/tracking、/handheld、/fpv 景別與角度: /closeup、/macro、/lowangle、/highangle、/pov 光線: /goldenhour、/backlight、/rimlight、/neonlight 商品畫面: /productreveal、/productspin、/ugcunboxing 特效: /smokereveal、/liquid、/disintegrate 新手可以先用 /orbit,再加上 /lowangle 或 /goldenhour。需要更明確的控制時,就把積木展開成自然語言: 1Single continuous cinematic shot. The camera slowly orbits 180 degrees clockwise around the subject while maintaining a constant distance. Use a low camera angle with warm golden-hour backlighting. Keep the subject centered and visually consistent. No cuts. 斜線詞是入口;一旦寫清楚畫面條件,這些攝影概念便不綁定某個介面或模型。 Prompt 正在變成一種導演介面以前我們可能只寫「一個男人走在東京街頭,電影感」,再看看模型會給什麼。現在可以把想法拆成鏡頭腳本: 0–2 秒先保持固定中景。 2–7 秒開始順時針環繞 180 度,人物留在畫面中央。 7 秒後降低機位,停在低角度英雄鏡頭。 整段不要切鏡,並維持人物的外觀與服裝。 這不只是描述「我要什麼畫面」,而是把運鏡、景別、速度、方向、距離、光線、動作和時間順序,組合成模型看得懂的執行腳本。當你學會的是這套攝影語言,換 Veo、Gemini Omni Flash 或其他自然語言影片模型時,就有一組可以重新測試與調整的基礎。 官方文件參考 Google Flow:建立影片 Google Flow:模型與支援功能 Google AI for Developers:Gemini Omni Flash 影片生成與提示指南 常見問答 (FAQ)Q1:/orbit 是 Google Flow 的官方指令嗎?目前查閱的 Google Flow 官方說明沒有把 /orbit 定義為公開指令或 Slash Command API。把它當成創作者的提示詞快捷寫法較穩妥,若需要明確表達環繞鏡頭,可直接寫 The camera orbits around the subject.。 Q2:/orbit 這種寫法可以直接用在 Gemini Omni Flash 嗎?Orbit 的運鏡概念可以用在 Gemini Omni Flash,但不要假設斜線語法一定通用。可改寫成自然語言,例如 The camera slowly orbits clockwise around the subject.,再依輸出結果調整方向、速度與幅度。 Q3:怎麼讓 AI 影片的運鏡方向和幅度更明確?在提示詞中直接寫出順時針或逆時針、移動 90 度或 180 度,以及運鏡速度、與主體的距離和結束景別。條件越具體,模型越能以這些資訊作為生成參考,但結果仍可能因模型與設定而不同。 Q4:AI 影片可以依照秒數執行運鏡嗎?可以用 [0-3s]、[3-7s] 這類時間標記描述事件順序與節奏。Gemini Omni Flash 官方提示指南有時間碼範例;時間標記仍屬自然語言提示,不保證逐秒或逐格精準執行。 Q5:一套運鏡快捷詞能套用在所有 AI 影片模型嗎?運鏡、景別與光線等攝影概念可以跨模型重用,但各模型的功能、版本與語意遵循程度不同。保留攝影概念,再把快捷詞展開成清楚的自然語言,並依實際輸出測試調整。

  • article-AI 長片真正的突破,不是模型變強,而是終於有人把「抽卡」變成製片流程

    2026/9/14

    AI工具 影音行銷 Higgsfield
    AI 長片真正的突破,不是模型變強,而是終於有人把「抽卡」變成製片流程

    最近看到 Higgsfield 公開約 95 分鐘的 AI 長片《HELL GRIND》。只看表面,很容易把焦點放在「AI 已經能做 95 分鐘電影了」;但我研究它公開的製作專案後,反而覺得更值得注意的,是團隊開始把角色、場景、鏡頭與生成素材當成一套製片系統來管理。 Higgsfield 的官方專案頁提到,公開內容包含每個場景背後的 prompts、assets 與 generations;Higgsfield 執行長 Alex Mashrabov 也在公開貼文中稱它為 95 分鐘 AI 電影。 對我來說,真正重要的不是長度,而是這部片讓一個問題變得更清楚: 如何把「抽卡」,變成製片? 為什麼 AI 長片不能只靠「不行就重抽」?做 10 秒或 30 秒的影片,寫 Prompt、生圖、試運鏡,畫面不對就再生成一次,偶爾還撐得住。但當作品長到 5 分鐘、20 分鐘,甚至 95 分鐘,每一鏡都靠運氣成功,就很難維持角色、場景和敘事的連貫。 長片需要的不只是單一鏡頭「看起來不錯」,還要讓觀眾相信:這是同一個角色、同一個世界,故事也在往前走。鏡頭一換,門不能無故換邊;角色換個狀態,衣服和傷勢不能忽然重置;前一鏡的動作,也要能接到下一鏡。 所以 AI 長片遇到的核心問題,已不只是「怎麼寫出更好的 Prompt」,而是「怎麼讓每次生成都能接回同一部作品」。 人物不該只是一段 Prompt,而是一組角色資產以前我們可能會在每個鏡頭重寫一次:「一名 32 歲亞洲男性,短黑髮,穿黑色外套……」然後希望模型記得他是誰。 長片製作更需要一份 Character Bible,先把角色定義成可重複引用的資產: 長相、身形比例與辨識特徵 服裝、髮型與會隨劇情改變的物件 聲音、語速、口音與說話習慣 表情、姿勢和具有辨識度的小動作 角色在不同場次中的狀態與變化 角色狀態也要拆開管理。乾淨的日常造型、淋雨後、受傷後或滿臉血,對應的是不同的造型狀態;如果每次都把多種狀態混在同一段描述裡,模型便可能把它們混合到不該出現的鏡頭。 這不代表角色 Asset 可以保證模型永遠不漂移,而是讓每一鏡有一致的參照。當角色跑掉時,也比較容易追問:是參照圖不夠清楚、狀態版本用錯,還是鏡頭本身要求太多? 場景不是背景圖,而是一個固定的虛擬片場場景連戲常比角色更容易出錯。 想像第一個鏡頭的門在左側,換個機位後卻跑到右邊;桌子忽然不見,窗戶又多出一扇。單看每一格也許說得過去,剪在一起就會穿幫。 因此,除了描述「這裡看起來像什麼」,還要建立空間地圖,固定重要物件和角色之間的關係。例如: 訓練墊位於房間中央 門固定在左側遠牆 窗戶在右後方,桌子在入口右側 角色 A 與門之間約有八公尺距離 這些資訊讓換機位不等於重新發明一個房間。它更像真正的片場:攝影機可以移動,但場景的空間關係不會跟著重新生成。 我把這種做法想成 AI 的「虛擬片場」。過去我們一直在練習怎麼描述畫面;長篇影像還需要我們定義畫面所在的世界。 不要只叫 AI 演情緒,要描述看得見的身體行為如果只寫「男人非常憤怒」,模型可能把情緒演成瞪眼、皺眉、咬牙、握拳,全部一起上,反而失去可信度。 更可控的方式,是把抽象情緒拆成鏡頭看得見的行為: 下巴繃緊,停頓兩秒 視線落在地面,不看對方 鼻血流到嘴唇,卻沒有伸手擦掉 呼吸逐漸加快,但肩膀保持僵硬 這不是單純把情緒形容得更長,而是把「表演」轉成可觀察、可檢查的身體訊號。我會把這種思路稱為 Performance Engineering:不是要求模型抽象地「演得更好」,而是把表演拆成具體的動作、節奏與反應。 把鏡頭設計成可診斷的 Shot,而不是塞滿一段 Prompt一個 Shot 若同時要求角色轉身、拿起道具、穿過房間、打鬥、說台詞,再加上複雜運鏡,模型失敗時就很難判斷是哪個條件造成問題。 先定義這一鏡最重要的動作、人物位置、鏡頭目的和結尾狀態,再決定要不要拆成兩鏡。若攝影機運動與角色動作彼此衝突,或同一鏡塞了太多事件,即使 Prompt 更長,也不一定會更穩。 我會用「10–15 次診斷線」提醒自己:同一個 Shot 反覆生成仍不成立時,先停止只改幾個形容詞;拆鏡、減少動作、換機位,或重新設計動作節拍。這是用來避免盲目重抽的工作參考,不是所有模型都適用的官方硬性門檻;真正的停損點仍要看鏡頭難度、成本和可接受品質。 如果你想進一步看分鏡如何協助人物一致,可以延伸閱讀本站的AI 九宮格分鏡技巧;九宮格是一種方法,不代表每部片都必須採用。 不是消滅抽卡,而是把抽卡工程化AI 影片仍然會生成失敗。差別在於,失敗後我們能不能找出問題、留下紀錄,並只重做需要修正的部分。 可以把工作拆成一條可追蹤的製作管線: Story → Bible → Asset → Scene → Shot → Generation → QC → Editing 當一個 Shot 不理想時,先診斷角色狀態、空間設定、動作複雜度、鏡頭運動和模型限制,再決定是重抽、簡化還是拆鏡。這樣每次生成才會變成有理由的測試,而不是沒有上下文的下一次嘗試。 AI 影片高手可能不只是最會寫 Prompt 的人如果 AI 影片逐漸走向 10 分鐘、30 分鐘或更長的敘事作品,真正拉開差距的能力可能會變成: 角色與場景資產管理 Story Bible、Character Bible 與 Shot List Continuity 連戲檢查 版本、生成紀錄與失敗診斷 素材篩選、品質檢查與剪輯決策 這些能力比某一款模型的熟悉度更有機會跨工具沿用。今天的 Shot 可以換成漫畫分格,留下 Story、Character 和 Scene 也可以支援小說或品牌故事。模型會換,對作品的拆解、管理和判斷能力卻能帶到下一個工具。 如果你想看如何把多種 AI 能力串成完整影片產線,可以延伸閱讀本站的用 Codex 打造 AI 影片工廠;而AI 影片素養與創作者工作方法則談到創作者如何從生成者走向製片與判斷者。 工作流,才是 AI 內容能跨模型累積的資產模型一定會一直更新。今天是 Higgsfield,明天可能是 Seedance、Veo、Kling,之後也可能出現另一套更強的生成工具。 如果能力只建立在「我很會用某一個模型」,工具換掉,很多技巧就要重來。但若你建立的是 Story、Bible、Asset、Scene、Shot、Generation、QC 到 Editing 的工作流,就能依不同模型重新安排生成工具,而不必把整個製作方法一起推倒重來。 AI 內容的下一階段,也許不是一鍵生成,而是我們開始知道怎麼管理生成、如何找到失敗原因,以及怎麼把 AI 產出的零件組織成一部作品。 《HELL GRIND》值得研究的地方,不只是「AI 能不能拍電影」,而是它讓我們看到人如何透過角色資產、虛擬片場、鏡頭設計與品質檢查,和 AI 一起把電影做出來。 常見問答 (FAQ)Q1:AI 影片製作中的 Production Engineering 是什麼?Production Engineering 是把故事、角色、場景、鏡頭、生成、品質檢查與剪輯整理成可追蹤、可診斷、可重做的製作流程,而不只是逐鏡撰寫 Prompt。 Q2:Character Bible 能保證 AI 角色每一鏡都一致嗎?不能。Character Bible 提供可重複使用的角色外觀、服裝、聲音和狀態參照,幫助團隊減少重新描述並定位偏差;最後仍要逐鏡檢查與修正。 Q3:AI 長片為什麼需要場景空間地圖?空間地圖能固定門窗、家具、角色和重要道具的位置關係,讓不同機位的鏡頭仍像發生在同一個場景,降低場景佈局前後矛盾的風險。 Q4:AI 影片的「10–15 次規則」是官方標準嗎?不是普遍適用的官方標準。本文把 10–15 次當作提醒創作者停止盲目重抽、回頭診斷 Shot 設計的工作參考;實際次數應依鏡頭難度、生成成本與品質要求調整。 Q5:這套 AI 製片流程只能用在 Higgsfield 嗎?不能。角色與場景管理、Shot 拆解、生成紀錄和品質檢查等概念可用於其他影片模型;但各模型支援的參照方式、控制能力與工作介面會不同,實作時仍需依版本調整。

  • article-AI 影片真正的分水嶺:從 Prompt 到專家 Skill 的製片工作流

    2026/9/14

    AI工具 AI Agent 影音行銷
    AI 影片真正的分水嶺:從 Prompt 到專家 Skill 的製片工作流

    AI 影視最近兩個案例,指向同一件事AI 影片最近有兩件事,我覺得值得放在一起看。 第一件,是 Higgsfield 公開了 95 分鐘 AI 長片《HELL GRIND》的製作專案,讓外界能查看影片背後的提示詞與製作素材。Higgsfield 官方專案頁 第二件,是我看到一位漫劇創作者在抖音談劇本創作與進階 Skill;他也公開了一套把編劇、角色與場景資產、分鏡、提示詞和品質檢查串起來的工作流程。抖音影片|公開的漫劇製作 Skill 乍看之下,這是兩種不同的 AI 影片案例。但放在一起,我看到的是同一個轉變:AI 影視真正的分水嶺,可能已不只是模型,而是「工作流」。 我把這種變化濃縮成一句有點殘酷的話:「學得慢的,直接不用學了。」不是專業不重要,而是有些人不必再從空白頁開始,把流程每一步都重新摸索一次;他們可以先安裝一套專家整理好的 Skill,再把時間用在判斷和修正上。 以前學 AI 影片,我們常常是在學怎麼抽卡人物不像?改 Prompt。場景跑掉?再補幾句。角色換個角度就變了樣?重抽。運鏡不對?繼續試。 所以過去一段時間,大家忙著學提示詞、運鏡術語和模型參數。但模型、介面與生成能力一直在變,今天摸熟的技巧,下一次更新後可能就被新的功能或工作方式取代。 反覆試生成並沒有消失,只是單靠「再改幾個字、再抽一次」很難穩定地做完一支片。更值得整理的,是故事如何拆解、角色和場景如何管理、鏡頭如何判斷,以及什麼結果可以留下。 專家的方法,開始被封裝成 Skill以小說改編成短劇為例,完整工作不只有「寫一段好 Prompt」。它可能包括故事分析、劇本結構、節奏與 Hook、角色設定、場景和道具資產、分鏡規劃、生成提示,以及逐步檢查成品。 這些步驟可以整理成一套 Skill:明確說明何時使用、要收哪些輸入、依什麼規則執行、要輸出什麼,以及在哪些地方停下來檢查。AI Agent 便能按照這套流程做事,而不是每次都靠使用者在聊天視窗重講一遍。 公開的漫劇 Skill 範例,就把製作拆成劇本、台詞診斷、資產鎖定、分鏡、提示詞渲染和獨立質檢等階段。這不是保證任何人安裝後都能做出熱門作品;它展示的是,原本藏在熟手腦中的步驟,開始能以結構化方法傳給 AI 執行。 一條可理解的製作管線大致會是: 1234567891011小說/故事 ↓編劇 Skill ↓角色與場景 Asset ↓Storyboard Skill ↓大量生成與品質檢查 ↓剪輯與輸出 這和我先前寫過的從提示詞到 Skill:打造高效率 AI 工作流有相同的底層觀念:把反覆重講的規則、固定格式、機械式步驟和修正經驗拆開,整理成可以重複使用的模組。 為什麼 Asset 會比一段角色 Prompt 更可靠?Higgsfield 公開《HELL GRIND》的專案素材,讓大家看到長片製作不只是每一鏡各寫一段描述。角色、場景、服裝、道具與不同狀態,都可以先整理成可重複引用的 Asset。 角色不是只有一張「長相描述」。製作時可能需要正常、淋濕、受傷或換裝等不同狀態;場景也不只是一段文字,還可能需要固定的空間關係、光線和可用角度。先把這些資料整理起來,之後做新鏡頭就不必每次從頭解釋整個世界。 這不代表模型從此不會漂移。Asset 的價值是提供更穩定的參照、減少重複整理,讓團隊更容易定位問題和重新生成;最後仍然需要有人檢查角色、場景和鏡頭是否接得起來。 《HELL GRIND》提醒我們:沒有告別抽卡,只是把抽卡工程化《HELL GRIND》的製作數字,讓我更確定這點。Screen Daily 報導引述製作方資料指出,前 25 分鐘用了 16,181 次影片生成,最後選出 253 個鏡頭,約是每個入選鏡頭對應數十次生成的量級。Screen Daily 報導 這是單一製作案例的數字,不是每部 AI 影片都適用的固定比例。但它清楚提醒我們:AI 影片不是按一次生成,就會自動得到可用成片。生成失敗並不可怕;更重要的是流程能不能記錄素材、比較版本、辨認問題,並只重跑需要修正的鏡頭。 於是製作方式從: 1人 → Prompt → 抽卡 → 不滿意 → 重抽 逐漸往這種工作流靠近: 1234567891011Story Bible ↓Character Bible 與場景 Asset ↓Storyboard 與 Shot 規格 ↓多輪生成 ↓人工/AI 輔助 QC ↓挑選、重跑與剪輯 抽卡仍然存在,只是它不再只是隨手試運氣,而是被納入一套可追蹤、可重跑、可檢查的製作管線。 未來稀缺的,可能是把專業整理成系統的人未來真正厲害的人,不一定是 Prompt 寫得最長的人,而是最會把專業拆成可執行步驟的人。 導演知道鏡頭怎麼服務情緒;編劇知道衝突和節奏如何推進;攝影師知道光線、構圖和視角如何影響觀感;剪輯師知道什麼時候該留下、什麼時候觀眾會離開。這些專業判斷,才是建立 Skill 時最有價值的內容。 一套可用的 Skill,也不只是把 Prompt 改個名字。它通常還需要清楚的輸入與輸出、可重用的素材、檢查標準、失敗時的處理方式,以及必要的人工作業關卡。少了這些,Agent 只會更快速地重複同一種錯誤。 如果想把 AI 影片流程往更完整的製作系統延伸,也可以參考我整理的用 Codex 打造 AI 影片工廠。而在生成能力普及、產量快速增加之後,為什麼「會生成影片」本身可能不再稀缺,也可延伸閱讀生成影片普及後,真正稀缺的是什麼。 學 AI,不如開始把自己會的東西教給 AIPrompt 的寫法會變,模型也會更新;但故事怎麼拆、角色怎麼管理、畫面怎麼判斷、什麼內容值得留下,仍然是專業的一部分。 所以現在學 AI,我不會只叫大家背更多提示詞。我更想問:哪些判斷你每天都在重複?哪些規則每次都要重新交代?哪些錯誤其實可以用檢查表提早抓到? 把這些經驗整理起來,先讓 AI 照流程執行,再由你把關品質。以前我們學會使用 AI;下一個階段,或許是把自己會的事情整理成 Skill,教會 AI 如何一起完成工作。 當越來越多人的專業被封裝成 Skill,真正的競爭才正要開始。 常見問答 (FAQ)Q1:AI 影片製作中的 Skill 是什麼?Skill 是一套可由 AI Agent 依循的任務規則與流程,通常會定義使用時機、輸入資料、執行步驟、輸出格式和檢查標準。它能減少每次重講流程,但不保證生成結果一定正確或符合品質要求。 Q2:有了 Skill,就不用學 Prompt 或專業知識了嗎?不是。Skill 可以把重複的操作規則整理起來,但使用者仍要提供目標與背景,並運用故事、影像、節奏和品質判斷來驗收結果。減少的是每次從零描述流程,不是專業判斷本身。 Q3:為什麼角色與場景要先整理成 Asset?把角色、場景、服裝、道具和狀態整理成可重複引用的 Asset,有助於維持不同鏡頭的參照一致,也讓團隊更容易找出需要修正的素材。模型仍可能產生偏差,因此 Asset 不能取代逐鏡檢查。 Q4:《HELL GRIND》的生成次數代表每個 AI 鏡頭都要生成 64 次嗎?不代表。製作方提供給媒體的數字是《HELL GRIND》前 25 分鐘用了 16,181 次影片生成,選出 253 個鏡頭,約為 64 次生成對應一個入選鏡頭的整體比值;這是該片的製作案例,不是普遍標準。 Q5:要怎麼開始把自己的專業整理成 Skill?先挑一個反覆執行、容易出錯的工作,記錄必要輸入、每一步的判斷規則、預期輸出和驗收條件;再把可重用的角色/場景/素材與檢查表整理好,讓 AI 先依流程執行,並在關鍵步驟保留人工審核。

  • article-我把 ChatGPT 接上自己的開發台 MCP,AI Coding 開始變成一條「軟體開發流水線」

    2026/9/14

    AI Agent Codex ChatGPT
    我把 ChatGPT 接上自己的開發台 MCP,AI Coding 開始變成一條「軟體開發流水線」

    最近我開始把 ChatGPT 接進原本提供給 Codex、Claude 使用的開發台 MCP。最有意思的地方,不是讓 ChatGPT 跟 Codex 搶著寫程式,而是把需求討論、工作規劃、程式實作與 Review 拆成不同角色。 我可以先讓 ChatGPT 查看開發台允許提供的專案脈絡,協助分析問題、整理風險與驗收條件,再透過 MCP 建立 Ticket,交給 Codex 接手。完成後,再把差異與測試結果交回來 Review。 以這個工作方式來看,分析和由 ChatGPT 發起的 MCP 操作使用 ChatGPT 端的可用額度,Codex 的工程執行則在 Codex 的工作環境中進行。乍看之下,好像終於能把 ChatGPT 每月訂閱用得更完整了 😂。但額度和費用會依方案、整合方式與工具呼叫而變化,這不是接上 MCP 就一定省錢的保證。 真正值得注意的,是 AI Coding 開始從「一個 Agent 包辦所有事」,走向「一組 Agent 按照分工接力完成工作」。 ChatGPT 不一定要寫程式,也能參與開發使用 Codex 時,我們常把需求理解、讀取 Context、規劃、修改、測試、Review 和下一步討論,全塞在同一個 Agent 裡。專案越大,耗費的時間和額度往往不只來自寫程式,也包括理解專案、追蹤進度、檢查結果和重新安排工作。 如果有一套開發台 MCP 能提供必要的專案狀態、Session 摘要或 Ticket 操作,ChatGPT 就可以先負責需要大量溝通和判斷的工作:釐清需求、找出風險、拆出可執行的工作,再把任務交給 Codex。 以一次長時間的工作樹合併任務為例,當 Codex 已經執行很久,我不一定要繼續在同一個 Agent 裡討論下一步。我可以請 ChatGPT 根據開發台提供的狀態,檢查目前結果、列出可改善處與潛在風險,再整理成一張 Codex 能接手的票。 這樣一來,ChatGPT 的價值不在於「代替 Codex 寫另一份程式」,而在於把模糊的討論轉成清楚、有優先順序、可以驗收的工作。 把不同角色接成一條開發流程如果把工作拆開來看,分工可以是: ChatGPT:需求分析與 Review。 協助釐清問題、檢查現況、拆解任務、補充驗收條件,並Review Codex 回報的結果。 開發台 MCP:提供連接與操作能力。 依照開發台實際設計,讀取被允許的 Context、建立或更新 Ticket、傳遞執行結果與工作狀態。 Codex:工程實作與驗證。 根據 Ticket 修改程式、執行測試,並回報差異、失敗項目和未解風險。 人:決定優先順序與重要操作。 確認需求、核准高影響變更,決定是否 Commit、Merge 或關閉 Ticket。 整體流程就會像這樣: 12345678910111213人提出需求 ↓ChatGPT 取得允許使用的專案脈絡並分析 ↓MCP 建立 Ticket,記錄工作範圍與驗收條件 ↓Codex 實作並執行測試 ↓開發台回報差異、測試結果與阻礙 ↓ChatGPT Review,整理下一步 ↓人確認是否 Commit、Merge 或關票 這條流程不代表每個 MCP 都有 Session、Ticket 或 Git 管理功能。MCP 規格提供的是連接模型應用與外部能力的通用介面;例如伺服器可以依實作提供可呼叫的 Tools、可讀取的 Resources 和 Prompts。開發台是否保存狀態、能不能開票或執行 Git 操作,仍要看實際 MCP Server 和周邊系統怎麼設計。MCP 官方規格:Server Features 因此我會把 MCP 想成這條流程的「連接層」,而不是整套開發管理系統本身。Session 保存、Ticket 欄位、權限控管、測試流程與工作狀態,都是 Harness 和開發台需要另外規劃的部分。 Agent Harness 讓模型有地方工作這個分工也呼應我最近一直在研究的觀念:Agent = Model + Harness。 大家常比較 GPT、Claude、Gemini 或 Codex 的模型能力。模型當然重要,但如果整條流程、專案脈絡和驗收方式都綁在單一模型裡,每次換模型都可能得重新建立工作方式。 如果自己的開發 Harness 已經整理好 Context、Tools、Ticket、Memory、Test、Git 和 Review Loop,模型就比較像其中一個可以調度的元件。今天可以 ChatGPT 規劃、Codex 執行;明天也可以換成另一個模型負責分析或 Review,再由適合的 Agent 實作。 這種可替換性不是插上另一個模型就會自動發生。不同模型可用的工具、輸入輸出格式和權限都可能不同,還是要有穩定的工作契約:任務怎麼交接、結果怎麼回報、測試如何判斷通過、失敗時誰要處理。 如果你想延伸理解 Harness 在 AI 開發流程中的位置,也可以閱讀從 Skill 到 Agent Harness:讓 AI 從知道怎麼做,走到真正完成工作;MCP、Skill 與 CLI 的分工則可參考AI 工具名詞全解析。 把 Ticket 寫成 Agent 能接手的工作Ticket 是這條流程能不能穩定運作的關鍵。若只有一句「幫我改善這段程式」,接手的 Agent 仍要猜背景、範圍和完成標準。每張票可以固定包含: 12345678910111213ticket_id: 自動產生title: 清楚描述要交付的結果background: 相關的專案脈絡problem: 目前遇到的問題priority: 優先級affected_files: 已知的相關檔案dependencies: 前置工作或相依項目acceptance_criteria: - 可明確驗收的條件test_requirements: - 完成前必須執行的檢查review_notes: 已知風險、限制或 Review 重點 其中 affected_files 可以列出已知範圍,但不應阻止 Codex 在檢查專案後指出還有其他必要檔案。真正重要的是 problem 說得清楚,acceptance_criteria 可以驗收,test_requirements 也符合專案實際狀況。 當 Ticket 結構固定,ChatGPT 就比較能把分析結果轉成工程任務;Codex 也能根據明確的交付條件回報完成、未完成與阻礙,而不是只回一句「已處理」。 下一場競爭可能是誰的 Harness 更完整當多個 Agent 開始分工,真正需要設計的就不只 Prompt,還包括它們共同使用的工作環境: Agent 能讀到哪些 Context,哪些資料不能取用? 誰能建立 Ticket、修改程式或執行 Git 操作? 測試失敗時,系統如何保留輸出並回報阻礙? 每個階段的完成條件是什麼,由誰 Review? Agent 交接時,下一位能否知道前一位做過什麼、為什麼這樣做? 當 MCP 工具可以建立或改變外部資料時,也要設計清楚的權限與人工確認邊界。不要只因為模型「做得到」,就讓所有操作都自動執行。 這些環節加起來,才是 Agent Harness 真正提供的工作條件。若系統有持續的 Context、明確的 Ticket、可執行的測試與可靠的回報方式,就能讓模型專注在任務,而不是每一輪都重新猜專案發生了什麼事。 從一張結構化 Ticket 開始如果你也想嘗試這種 AI Coding 工作方式,可以先挑一個範圍小、容易驗收的任務,整理出背景、問題、優先順序、驗收條件和測試要求,再觀察 ChatGPT 與 Codex 分工後有哪些地方仍需要人工補充。 接著再逐步加入專案 Context、Ticket 狀態、工具權限與 Review 流程。先讓交接清楚、失敗能回報,再決定哪些步驟適合自動化。 AI Coding 正從「我跟一個 AI 一直聊天,直到網站做完」,走向「我在管理一條由多個 AI Agent 組成的軟體開發流程」。ChatGPT 不一定要負責寫程式,Codex 也不必負責想完所有事情;把規劃、執行、測試和 Review 拆開,再讓 Harness 接得住每次交接,才會真正累積成自己的 AI 開發台。 常見問答 (FAQ)Q1:在這種 AI Coding 流程裡,ChatGPT 和 Codex 怎麼分工?ChatGPT 可以負責需求討論、專案分析、Ticket 規劃與結果 Review;Codex 可以接手明確定義的實作與測試工作。實際分工仍取決於各自可讀取的 Context、可用工具和權限。 Q2:MCP 會自動替我保存 Session 或建立 Ticket 嗎?不會。MCP 提供模型應用與外部 Tools、Resources、Prompts 溝通的介面;Session 保存、Ticket 系統與 Git 操作必須由實際 MCP Server 或周邊開發台提供。 Q3:把規劃交給 ChatGPT,能保證省下 Codex 額度嗎?不能保證。不同產品方案、帳戶額度、工具呼叫方式和任務執行環境都會影響使用量。這種分工可以把分析與工程執行分開觀察,但是否省錢要依自己的實際方案和用量判斷。 Q4:想開始使用多個 AI Agent 協作,第一步該做什麼?先挑一個小型、可驗收的任務,寫清楚背景、問題、完成條件與測試要求,再讓不同 Agent 接力執行。確認工作交接和失敗回報可靠後,再逐步擴充工具權限、Ticket 狀態與自動化程度。

  • article-【GPT-6 Astra 正在把 Vibe Coding,推向 Vibe World Building】

    2026/9/14

    AI工具 AI Agent Vibe Coding
    【GPT-6 Astra 正在把 Vibe Coding,推向 Vibe World Building】

    以前我們講 Vibe Coding,常見的想像是:「一句話,AI 幫我做網站、寫 App。」 但最近看到幾個 GPT-6 Astra 搭配 Unreal Engine、Blender 與 Three.js 的案例,我開始覺得,下一階段可能不只是 Vibe Coding,而是 Vibe World Building。 你不只是叫 AI 寫程式,而是讓 Agent 進入專業工具,協助建立角色、遊戲與可以互動的世界。更有意思的是:AI 越能操作專業軟體,我反而越覺得 Domain Knowledge 會變得更重要。 以下案例依照作者公開展示整理,重點是觀察工作方法,不代表每個人使用相同模型、方案與工具設定都能得到相同結果;實際能力也會隨版本、權限與專案環境變動。 AI 開始進入專業工具,而不只生成程式碼Vibe Coding 把「描述需求、產出程式」變得更容易;而這幾個 3D 案例再往前一步:Agent 開始操作 Unreal Engine、Blender 或 Three.js 專案,建立內容、反覆修改,並把場景、規則與互動組合在一起。 這個轉變不只是「AI 會不會 3D」,而是工作環境開始從人操作的軟體,變成 Agent 也能操作與檢查的執行環境。 案例一:從一個物件,走向逐街建構曼哈頓Matt Shumer 分享 GPT-6 Astra 在 Unreal Engine 中建構曼哈頓場景的過程,並描述它花了一週逐街完成細節。這已經不是只要求 AI「放一棟房子、加幾棵樹」,而是把工作尺度拉到街道與街區。 他也展示過另一個 Unreal Engine 世界:場景裡有以 Astra 驅動的角色 Agent,並以共同生存為目標互動。這讓「建構世界」不只包含空間,也開始包含世界中的行動者與互動規則。 當場景從單一物件擴大到街區,問題自然會延伸到道路與建築的空間關係、資產管理、場景分工與驗收方式。若要進一步投入正式製作,效能、碰撞、載入策略與可維護性仍需要另外檢查;一段令人驚豔的展示,不等於所有製作環節都已完成。 來源:Matt Shumer 的曼哈頓建構展示、Astra Agent 世界展示。 案例二:拓撲不一致,就改用離散 Mesh 切換角色表情常用 Blendshape 做平滑變化,但這類頂點形變通常仰賴相容的網格拓撲與頂點對應。若不同 AI 生成的表情 Mesh 拓撲不一致,就不一定能直接做傳統的平滑 Morph。 Nano 分享的 Blender 做法不是硬把所有網格變成同一種拓撲,而是換個解題方向:先把不同表情的 Mesh 對齊;切換時顯示目標表情,並把未啟用的 Mesh 縮小、藏進角色頭部,再透過 Blender Driver 控制切換。 這不是 Blendshape 的平滑融合,而是離散表情切換。它用明確的取捨避開拓撲限制,適合某些表情展示情境,卻不能因此宣稱能取代所有臉部動畫流程或提供連續的表情過渡。 我覺得這個案例特別值得看,不是因為 Astra 知道 Blender 哪個按鈕在哪裡,而是 Nano 知道問題來自哪裡,並知道還有哪些方法可以繞過去。 來源:Nano 在 Blender 中切換角色表情的展示與提示詞。 案例三:一款跑酷遊戲背後,是一整套產品規則MSB 使用 GPT-6 Astra 搭配 Three.js 分享豎屏跑酷遊戲《THE LAST GATE》。看起來是讓角色往前跑,拆開需求後卻是一組完整的遊戲系統: 玩家通過加減乘除算術門時,隊伍人數會即時改變。 撞上障礙物會造成實際隊員損失,而且畫面人數要和遊戲中的真實人數一致。 終點遭遇會依最後存活的隊員人數決定。 需求包含三條短路線、即時重試,以及帶 Seed 的輸入回放。 這已經不是「幫我做一個 Three.js Demo」,而是把玩法規則、3D 場景、互動、狀態變化與可重現測試一起交給 Agent 處理。作品是否能投入正式產品,仍要再驗收效能、操控手感與程式維護性;但需求本身已經從一句畫面描述,長成可檢查的產品規格。 來源:MSB 的《THE LAST GATE》公開貼文。 三個案例,代表三種建構尺度 尺度 案例 真正要處理的問題 世界級 Unreal Engine 曼哈頓與 Agent 世界 空間關係、場景組織、資產與行動者 角色級 Blender 離散表情切換 拓撲限制、替代方案與表情控制 產品級 Three.js《THE LAST GATE》 遊戲規則、互動狀態、重試與回放 我看到的不是「GPT-6 Astra 很會 3D」而已,而是 AI 開始透過專業工具,把世界、角色與產品的不同層次串起來。 AI 越會操作軟體,Domain Knowledge 為什麼越重要?很多人看到 AI 越來越會用 Blender,第一個反應可能是:「那以後是不是不用學 Blender 了?」 我反而覺得,答案可能剛好相反。 真正厲害的不是 Agent 知道哪個按鈕在哪裡,而是有人知道問題為什麼發生、有哪些限制、什麼 workaround 可行,以及最後怎樣才算完成。 如果你知道 Blendshape、Topology、Mesh、Driver 是什麼,才比較可能看出表情網格不相容的原因,並想到可以改用離散切換。若連問題的語言都不熟悉,就很難把這種解法交代給 Agent,也不容易判斷結果有沒有真的做到。 所以 AI 淘汰的可能不是「懂 Blender 的人」,而是只知道 Blender 按鈕在哪裡、卻說不清楚問題與完成標準的人。 以前你懂 Blender,還得親手操作每一步;懂遊戲設計,也可能得等工程師把規則寫出來。Agent 改變的是專業知識的產能:你可以把問題、限制、不要採用的方法、可行的 workaround 與驗收標準交給 Agent,再由專業工具把它落地。 Domain Knowledge × Agent × Professional Tools 專業知識負責判斷,Agent 負責執行,專業工具負責把想法變成可以檢查與迭代的成果。 如果你想延伸看「如何把領域經驗交給 AI 軟體化」,可以讀我之前寫的把專業知識變成軟體;關於 Vibe Coding 如何改變軟體價值,也可參考專業知識與 Vibe Coding 的商業機會。 Vibe Coding 的下一階段,可能是 Vibe Anything以前學 Photoshop、Blender 或 Unreal Engine,常常代表自己要親手完成大量操作。未來你或許不必逐一操作每個按鈕,但仍需要理解這個領域有哪些物件與規則、問題通常出在哪裡、有哪些解法,以及如何驗收。 Vibe Coding 可能只是第一站。接下來還會有 Vibe 3D、Vibe Game Development、Vibe Animation,甚至 Vibe Engineering 與 Vibe World Building。關鍵不是「每套軟體的按鈕都記熟了沒」,而是當 AI 已經能操作工具時,你知不知道該交代什麼、該限制什麼,又該如何判斷它做得對不對。 常見問答 (FAQ)Q1:Vibe World Building 和 Vibe Coding 有什麼不同?Vibe Coding 通常聚焦於用自然語言描述需求、讓 AI 產生或修改程式;Vibe World Building 則把 Agent 帶進 Unreal Engine、Blender、Three.js 等專業環境,處理場景、角色、規則與互動,目標尺度從一段程式碼擴大到可探索或可玩的世界。 Q2:為什麼 AI 越會操作 Blender,專業知識反而越重要?專業知識能幫你定義問題、提供限制、選擇 workaround,並訂出驗收標準。Agent 可以執行很多操作,但仍需要有人判斷網格、表情或動畫是否符合實際用途。 Q3:不同拓撲的表情 Mesh 可以直接做平滑 Blendshape 嗎?不一定。傳統 Blendshape 的頂點形變需要相容的網格與頂點對應;若拓撲不同,可能要先整理網格,或採用像案例中的離散 Mesh 切換。離散切換不等於平滑表情融合,也不是適用所有角色動畫的通用替代方案。 Q4:AI 做出的 3D 遊戲展示,就等於可以正式上線嗎?不等於。除了畫面與主要玩法,仍要測試效能、操控、錯誤狀態、裝置相容性與後續維護。案例呈現的是 Agent 能協助建構與實作的範圍,正式產品仍需要明確的驗收與測試。 Q5:想開始用 Agent 建立 3D 或遊戲專案,最先要準備什麼?先把目標拆成可檢查的規則:有哪些物件、它們如何互動、哪些限制不能違反,以及怎樣算完成。從小範圍任務開始,讓 Agent 執行後再用專業知識檢查結果,會比只要求「做得漂亮」更容易迭代。

  • article-【AI 短劇的下一站,可能不是抖音,而是 Steam】

    2026/9/14

    AI工具 內容行銷 影音行銷
    【AI 短劇的下一站,可能不是抖音,而是 Steam】

    當內容都能生成,下一步也許是讓人走進故事前幾天我看到一個很誇張的數字:2026 年上半年,抖音端上線超過 22 萬部 AI 劇漫劇。 這裡先補充統計口徑。DataEye 的《2026 上半年 AI 劇漫劇數據報告》統計的是「AI 劇漫劇」,涵蓋 AI 真人劇、AI 漫劇等不同形式,不能直接把 22.19 萬部說成全部都是真人影像短劇。報告摘要指出,其中有 1,055 部播放量破億,約占 0.48%。DataEye 報告摘要 這些數字讓我開始想:當 AI 劇漫劇多到這個程度,下一步會發生什麼? 答案可能不是只生成更多影片,而是讓觀眾走進故事裡。 最近我在 Steam 看到《幸存者笔记(Survivor’s Notes)》,覺得它讓這個方向變得具體。遊戲的 AI 生成內容聲明寫著:「All in-game materials are generated by AI.」也就是開發者表示,遊戲內的素材都是透過 AI 生成。Steam 遊戲頁面 這背後有意思的地方,不只是「AI 做了一款遊戲」,而是生成影像、互動選擇與遊戲系統開始出現在同一個作品裡。 它像一部「可以玩的 AI 短劇」《幸存者笔记》是一款全動態影像(FMV)生存遊戲。故事設定在 2026 年,全球爆發喪屍危機;玩家會跟著角色推進劇情,並透過選擇與快速反應事件,走進不同劇情分支與結局。Steam 遊戲介紹 如果先把遊戲類型放在一旁,它呈現的組合很像: AI 影像+互動敘事+QTE+分支劇情+多重結局。 但有一點要分清楚:Steam 頁面說明了玩家選擇會推進不同分支與結局,並沒有表示遊戲會依照每位玩家的輸入,即時生成全新的劇情。因此,這款作品能讓我們看到「AI 生成素材與互動影遊放在一起」的可能性;它本身還不能證明即時生成式戲劇已經成熟。 AI 影片可能讓分支劇情的影像製作變便宜以前拍一部真人互動電影,劇情走到第三集時,如果出現兩個選項:救女主角,或是不救,後面可能就要準備兩套劇本、場景、演出與剪輯版本。 如果故事繼續分成 A1、A2、B1、B2,製作量會跟著分支增加。演員、攝影、燈光、道具、剪輯與後製,也可能需要再投入一輪。 AI 影像帶來的變化,是創作者或許能以較低的成本製作另一條影像支線。過去新增一個分支,常常意味著「再拍一次」;未來某些情境可能變成「再生成、再挑選與再剪輯一次」。 這不代表新增分支會變成零成本。故事是否連貫、角色是否一致、畫面能否接起來、選擇有沒有意義,仍要有人設計與驗收。AI 降低的可能是部分影像製作門檻,內容設計與整合工作依然存在。這是我從生成影像與互動遊戲結合所看到的趨勢,不是《幸存者笔记》已公開的成本數據。 AI 短劇的下一站,可能不是「更多」現在大家還在比較:一天能生成幾支影片、角色能不能維持一致、運鏡像不像電影、畫面有沒有 4K。 這些能力會繼續進步。當多數人都能生成漂亮影片,「漂亮」本身可能就不再稀缺。 真正值得投入的,會是世界觀、角色、衝突、選擇、後果與情緒。觀眾為什麼想知道下一個選擇會帶來什麼?他們又為什麼願意在故事裡繼續走下去? 這已經不只是 AI 影片的問題,而是互動內容怎麼設計。 如果你也在思考 AI 影片產量增加後,創作者還能靠什麼取得注意力,可以延伸閱讀我寫的生成影片普及後,真正稀缺的是什麼;若想從創作者能力來看,也可以參考AI 影片素養與工作方法。 從觀眾到參與者:生成式戲劇的想像傳統電影是看故事,短影音是滑故事,連續短劇是追故事。下一個階段或許會是進入故事、親自做選擇。 例如,一部修仙題材的短劇演到一半,問你:「加入魔宗,還是拜入正道?」你選了魔宗,後續角色關係、任務與影片就隨之改變;另一位觀眾選擇正道,走進的可能是不同版本。 再往前一步,AI 也許能依據選擇、角色關係、道具與前情,生成下一段劇情。這種作品不只提供固定的兩三條支線,而是讓每位玩家都能走進一個略有不同的故事版本。 我會把這個方向稱為 Generative Drama,生成式戲劇。它目前更像一種內容設計的想像與目標,不是《幸存者笔记》已提供的功能。要真的做到,還得解決角色一致性、劇情品質、分支管理、生成成本與觀眾體驗等問題。 Vibe Coding 與 AI 影片正在合流以前做影片的人和做遊戲的人,常是兩群不同的創作者。現在,一個人可能用 AI 寫世界觀、劇本與角色,生成圖片、影片、配音和音樂,再請 Coding Agent 串起選項、劇情樹、存檔、成就、QTE、角色數值與結局。 最後的作品可以是 Web App、手機 App,或一款上架 Steam 的互動影遊。當創作流程從視覺素材一路延伸到程式與互動邏輯,就很難再只用「導演」、「遊戲開發者」、「程式設計師」或「內容創作者」其中一個身分概括。 他們可能是在建立一個世界,讓別人進來探索。 我更在意的是:能建立什麼值得走進去的世界?「AI 影片能不能取代真人拍攝?」或許不是最有意思的問題。 當影片開始變成可以由程式生成與串接的素材,我們能不能建立一些過去成本太高、做不起來的內容? 十年前,我們把文字變成網站;後來把圖片和影片變成社群內容。現在,文字、圖片、聲音、影片、3D 與程式碼,都正在變成可以生成與組合的素材。 所以下一步,可能不是再做一支更漂亮的 AI 影片,而是把素材串起來,建立一個觀眾可以走進去、做選擇,而且每個人的故事都不一樣的世界。 看到《幸存者笔记》時,我想到的不是「AI 現在連 Steam 遊戲都能做了」,而是 AI 短劇下一個值得探索的戰場,可能根本不在短影音平台。 當生成影片越來越便宜,我們要學的也許不只是怎麼生成影片,而是怎麼建立一個值得別人走進去的世界。 常見問答 (FAQ)Q1:AI 短劇和互動影遊有什麼不同?AI 短劇通常以觀看連續影像為主;互動影遊會讓玩家透過選擇或操作影響劇情分支。兩者結合時,影像提供故事呈現,互動系統則讓玩家參與故事走向。 Q2:《幸存者笔记》會依照玩家選擇即時生成新劇情嗎?目前 Steam 頁面說明玩家選擇與 QTE 會推進不同分支和結局,但沒有說明遊戲會在遊玩當下即時生成新劇情。因此不能把它直接當成已成熟的即時生成式戲劇案例。 Q3:AI 影片會讓互動劇情變成零成本嗎?不會。AI 可能降低部分影像素材的製作成本,但劇本、角色連貫、分支設計、剪輯、測試與品質檢查仍需要投入。每增加一條分支,也會增加整合與驗收工作。 Q4:什麼是 Generative Drama(生成式戲劇)?Generative Drama 是依據觀眾或玩家的選擇生成後續劇情的內容構想。相較於固定分支,它希望讓不同玩家走進各自稍有差異的故事;目前仍須處理劇情品質、角色一致性、成本與分支管理等問題。

  • article-【AI 會寫 API 還不夠:Vibe Coding 下一個機會,是把台灣產業經驗做成 Skill】

    2026/9/14

    商業策略 AI Agent Vibe Coding
    【AI 會寫 API 還不夠:Vibe Coding 下一個機會,是把台灣產業經驗做成 Skill】

    最近看到一個很有意思的開源專案:ecommerce-cia。 它不是另一套電商系統,也不是幫你做購物車,而是一套專門給 AI Coding Agent 使用的「台灣電商 Skill」。 看到這個專案,我第一個想到的是:Vibe Coding 發展到現在,真正的瓶頸可能已經慢慢從「AI 會不會寫程式」,轉移到「AI 懂不懂這個產業」。 因為現在要 AI 幫你寫一個購物車,其實已經不難。商品頁、購物車、會員、訂單後台,甚至串 API,AI 都可以很快幫你生出來。 真正痛苦的是後面。 「我要接綠界。」「我要用藍新。」「LINE Pay 怎麼串?」「7-11 取貨付款怎麼做?」「ATM 付款超過三天沒付,訂單怎麼辦?」 然後你會發現一個很有趣的狀況:Coding Review 沒有 Error,API 文件也看了,每一段程式碼單獨看,好像都沒有問題。 但真的把整間商店跑起來,就是不順。😂 最麻煩的 Bug,可能發生在兩個正確的 Function 之間一般我們叫 AI Review 金流,很容易只檢查幾個局部問題: API 呼叫對不對? 簽章對不對? Callback Route 有沒有建立? 資料庫有沒有寫入? 庫存 Function 有沒有執行? 每一個地方都可能是對的,但問題可能發生在兩個「正確的 Function」中間。 以一筆交易為例,流程可能像這樣: 客人建立訂單。 系統保留庫存。 客人前往金流服務付款。 金流通知商店付款結果。 系統驗證通知並更新訂單狀態。 庫存、顧客通知與出貨流程依照訂單狀態接續處理。 如果 Callback 重送兩次呢?客人付款成功,但瀏覽器沒有跳回網站呢?ATM 建立虛擬帳號後幾天都沒有付款,庫存要什麼時候釋出?如果付款成功但庫存更新失敗,或訂單取消時付款通知剛好進來,系統又該怎麼辦? 這些才是真正把電商系統跑起來後,會遇到的問題。 所以 Review 金流不該只逐個看 Function,而要沿著「錢」和「貨」走過完整流程:下單、訂單、庫存、金流、Callback 驗證、狀態更新、出貨,到交易完成,逐段找可能的斷點。 ecommerce-cia 示範了另一種 AI 稽核方式ecommerce-cia 不是另一套購物車或電商平台,而是給 AI Coding Agent 使用的台灣電商 Skill。它有意思的地方,在於把注意力放到金流、庫存、訂單等環節如何互相影響。 依照專案 README 的說明,它有檢查既有交易流程的 Audit Mode,也有引導新手準備與串接金流的 Setup Mode;文件提到藍新、綠界、PAYUNi、TapPay 與 LINE Pay 等台灣常見情境。這些內容呈現了一個值得參考的方向:除了問 AI「這段程式碼有沒有寫錯」,也可以要求它沿著整條交易生命週期檢查系統行為。 這已經不只是一般的 Coding Skill,而是把產業流程和判斷方式整理成可重複使用的 Domain Engineering Skill。 AI 會看 API 文件,稀缺的是踩過坑的經驗這件事讓我想到我之前一直在談的「把專業知識軟體化」。 假設一個台灣電商工程師做了十年。他真正值錢的可能不是「我知道怎麼呼叫綠界 API」,因為這件事情 AI 看文件就能協助。 真正值錢的,是這些踩過坑才知道的事: 綠界或藍新的 Callback 曾經出過什麼狀況。 ATM 訂單逾期後,何時釋放庫存才符合商業規則。 超商取貨付款訂單的狀態該怎麼轉換。 使用者付款成功但沒有跳回網站,不能因此就判定付款失敗。 Webhook 重送不能重複扣庫存或重複通知。 退款、取消與付款通知同時發生時,訂單狀態要如何處理。 這些東西通常不會完整寫在 API 文件裡。它們存在工程師的腦袋裡,來自踩坑、Debug、客訴、事故,以及凌晨三點修 Production 的經驗。😂 API 文件能說明端點、欄位和簽章方式;把這些技術細節放進真實商業情境後,流程上的例外與判斷往往還要靠產業經驗補足。 專業知識除了軟體化,也可以 Skill 化以前我們會想:我做了十年房仲,可不可以把我的判斷方法做成一套房仲 SaaS?我做了十年行銷,可不可以把我的 SOP 做成一套行銷系統? 我之前也寫過把專業知識變成軟體,讓產業專家成為下一代產品經理。現在可能又多了一條路:不一定要先做 SaaS,也可以先把專業知識整理成 Skill。 從產業經驗到 AI 可執行 Skill 的概念示意。 一個資深電商工程師的經驗,如果要整理成 AI 能使用的 Skill,可以從常見情境開始,逐步寫清楚: 什麼情況下要啟動檢查。 要沿著哪些訂單、金流和庫存流程追蹤。 哪些例外狀況需要特別確認。 要用什麼證據判斷流程真的完成,而不是只看單一測試顯示綠燈。 如此一來,AI 就不只是「會寫程式」,還能重複參照一套做過許多台灣電商專案的人累積的判斷方式。 下一波 Vibe Coding 機會,可能是台灣產業 Domain Skills未來 Skill 最有價值的地方,不一定是 React Skill、Next.js Skill 或 Python Skill。這些通用技術知識,模型本身會越來越強。 更可能形成差異化的,是懂得台灣產業實際怎麼運作的 Domain Skills,例如: 台灣電商金流與物流。 台灣電子發票、統編與發票規則。 LINE 官方帳號與會員流程。 政府 Open Data 與台灣個資保護情境。 房仲成交流程、補教招生、餐飲訂位、美容預約與傳統產業報價。 這些領域的共同點是:模型可能知道技術,但不一定知道台灣的商業流程、例外情境與在地作法。而真正掌握這些 Know-how 的人,往往是已經在產業裡工作十年、二十年的實務工作者。 Skill 不只是提示詞,而是可以交給 Agent 使用的 SOP我現在看 Skill,已經不只把它當成「提示詞」,而是可以被 AI Agent 使用的產業 SOP。 以前經驗存在腦袋裡,後來我們把它寫成 SOP,再把 SOP 做成軟體。現在又多了一種形式:把 SOP 整理成 AI Agent 能參照與執行的 Skill。 Vibe Coding 的競爭,可能不只是誰比較會下 Prompt、誰比較會用 Claude Code 或 Codex,而是誰能把自己十年、二十年的產業經驗,整理成 AI 可以重複使用的能力。 模型會越來越強,寫程式會越來越便宜,API 串接也會越來越簡單。但有一件事情不會因此自動出現:你踩過的那些坑。 而那些坑,可能才是 AI 時代真正值得被「程式化」的專業知識。 這也是我看到 ecommerce-cia 之後,覺得最值得研究的地方。它表面上是在處理台灣電商金流、物流與流程稽核,背後示範的也許是一個更大的方向:下一波 Vibe Coding,不只是讓 AI 幫我們寫軟體,而是開始把一個產業真正的 Know-how,寫進 AI 裡。 常見問答 (FAQ)Q1:什麼是台灣產業 Domain Skill?台灣產業 Domain Skill 是把在地產業常見的情境、判斷方式、執行流程與例外處理整理成 AI Agent 可重複參照的規範。它能補足通用技術知識與實際商業流程之間的落差。 Q2:Domain Skill 和一般 Code Review 有什麼不同?一般 Code Review 多半檢查程式碼或單一 Function 的正確性;Domain Skill 可以引導 AI 沿著跨系統流程檢查狀態如何傳遞,例如金流通知、訂單更新、庫存處理與出貨。兩者處理的問題不同,實務上可以搭配使用。 Q3:如何把產業經驗整理成 AI Agent Skill?先整理常見情境與踩坑案例,再把觸發條件、判斷方式、處理步驟、例外狀況與驗證證據寫清楚,最後交由熟悉該產業的人用真實案例檢查。這樣的 Skill 才能承載可重複使用的專業判斷,而不只是一段泛用提示詞。

  • article-【36 秒就誕生一部 AI 短劇後,我反而覺得「會生成影片」開始不值錢了】

    2026/9/14

    AI工具 內容行銷 影音行銷
    【36 秒就誕生一部 AI 短劇後,我反而覺得「會生成影片」開始不值錢了】

    你花一天做一支 AI 影片,別人一週已經做完 60 集連續劇最近看到一個數字,我覺得做 AI 影片的人真的要警覺了。 平均每 36 秒,就有一部 AI 短劇上線。 不是一支 10 秒、15 秒的 AI 炫技影片。 是「一部短劇」。 根據中央社引述澎湃新聞的統計,2025 年 8 月抖音新上線的 AI 劇只有 655 部;一年後,這個數字已達 74,313 部,占當月新劇的 75.4%。報導另指出,2026 年 7 月平均每 36 秒就有一部新的 AI 劇上線。中央社報導 更誇張的是,有些團隊已經可以做到: 5 個人,一週做完 60 集。 成本甚至不到傳統真人短劇的十分之一。 這些是媒體採訪中的個別團隊案例,不代表所有 AI 短劇都能達到相同產能或成本。不同作品的類型、品質和成本計算範圍,會讓估算出現落差。5 人團隊 7 天完成 60 集的報導、BBC 中文採訪報導存檔、另一份製作成本估算 所以當大家還在研究: 「哪個 AI 影片模型比較強?」 「提示詞怎麼寫?」 「怎麼保持角色一致?」 「怎麼做運鏡?」 我反而開始想另外一個問題: 如果影片已經多到每 36 秒就生出一部,那「會生成影片」這項能力,到底還值多少錢? 而這波 AI 短劇爆發,甚至已經養出一個以前不存在的新職業: 「抽卡師」。 什麼是「抽卡師」?不是遊戲裡抽 SSR 的那種抽卡。 現在 AI 還沒有強到你丟一本劇本進去,它就直接吐出 60 集可以播的連續劇。 所以中間還需要大量人工工作。 例如把劇本拆成場景、角色、表情、動作、鏡位、光線、運鏡,再交給模型生成。 但生成出來的東西不一定能用。 可能角色變臉。 可能手指壞掉。 可能運鏡很怪。 可能情緒完全不對。 所以你要一直生成。 生成 10 個、20 個、50 個版本,再從裡面挑一個最好的。 很像抽卡。 於是「抽卡師」就出現了。 有些複雜素材的提示詞,甚至可以寫到 5,000 字。 所以現在厲害的抽卡師,其實已經有點像: 半個導演+半個攝影+半個 AI 模型操作員。 但我反而覺得,這個職業可能不會存在太久。 因為「抽卡」本身,就是 AI 還不夠成熟的產物為什麼今天需要抽卡? 因為 AI 不穩定。 同樣一句提示詞生成十次,可能得到十種結果。 所以需要人一直生成、一直挑。 但如果未來模型可以直接讀完整劇本呢? 它自己理解人物。 自己維持角色一致性。 自己拆分鏡。 自己設計鏡位。 自己控制演員表情。 自己產生不同 Take。 甚至自己判斷哪個 Take 最好。 那還需要一個人在那邊「抽卡」嗎? 可能不用。 所以我認為: 「抽卡師」不是 AI 時代的終極新職業,而是一個過渡型職業。 就像以前很多人專門幫忙切版、修圖、上字幕。 技術進步之後,這些工作不一定完全消失,但市場價值會快速下降。 真正留下來的,反而不是「會生成的人」。 而是: 知道什麼值得生成,以及知道什麼值得留下的人。 更可怕的是,AI 已經把「內容產能」打爆了DataEye 研究院的《2026 上半年 AI 劇漫劇數據報告》統計,2026 年上半年抖音端新上線 22.19 萬部 AI 劇漫劇,其中 1,055 部播放量破億,占 0.48%。DataEye 報告摘要 如果把 5,000 萬播放當作一條粗略的盈虧平衡線,能跨過去的比例大約只有 1.3%。 換句話說: 大約做 77 部,才有一部可能跨過這條線。 這裡的 5,000 萬次播放,是 DataEye 報告採用的抖音端盈虧平衡參考線;報告也提醒,這組數據不代表所有平台與全行業的情況。它不是每一部短劇通用的保本保證。DataEye 報告摘要 這個數字才是我覺得真正值得注意的地方。 因為它告訴我們: AI 解決了「做不出來」的問題。 卻製造了一個更嚴重的問題: 大家都做得出來。 以前拍一部短劇,要演員、攝影、燈光、場地、後製。 有這些門檻存在,本身就會過濾掉大量競爭者。 現在門檻突然被 AI 打掉。 結果不是每個人都成功。 而是內容開始大爆炸。 當內容生產成本趨近於零,內容本身就會開始通膨這件事情不只發生在 AI 短劇。 我覺得接下來所有自媒體都會遇到。 文章。 圖片。 短影音。 Podcast。 知識圖卡。 電子書。 甚至線上課程。 以前一個人一週做三支影片,很厲害。 AI 出現後,一個人一天做 30 支都不是問題。 但問題來了。 當每個人都能一天做 30 支影片,你一天做 30 支影片還算優勢嗎? 不算。 這就像以前會 Photoshop 是一項專業。 後來大家都有 Canva。 現在連 Canva 都不用開,跟 AI 講一句話就做好了。 當「製作能力」被普及之後,製作能力本身的價格就會下降。 所以我最近越來越確定一件事: AI 時代真正稀缺的,不會是內容。 而是: 注意力。 所以我現在看 AI 自媒體,已經不太在意「一天可以生幾支影片」很多 AI 自媒體教學還停留在: AI 寫文案。 AI 生圖片。 AI 生影片。 AI 配音。 AI 剪輯。 AI 自動發布。 最後告訴你: 「一個人也可以經營十個帳號。」 技術上當然可以。 但這可能正在回答一個錯誤的問題。 真正的問題不是: 「我怎麼一天生 100 支影片?」 而是: 「當全世界每天多出一億支 AI 影片,為什麼有人要停下來看我的?」 這兩個問題,難度完全不同。 前一個問題是 Production。 後一個問題是 Content。 甚至再往上一層,是: Taste、Story、Distribution。 你選什麼題目? 前三秒講什麼? 故事怎麼鋪? 情緒怎麼拉? 什麼地方觀眾會滑走? 什麼東西值得被分享? 觀眾為什麼記得你? 這些能力,反而會隨著 AI 變強而變得更重要。 如果你想從「做得出影片」往「知道該做什麼」前進,可以延伸閱讀我寫過的 AI 影片素養與創作者工作方法;而選題、定位與觀眾需求,也和 短影音定位策略 密切相關。 所以未來最值錢的人,可能不是最會用 AI 的人而是最知道: 「AI 應該做什麼」的人。 AI 可以幫你一次生成 100 個鏡頭。 但你要知道哪一個是好鏡頭。 AI 可以寫 100 個 Hook。 但你要知道哪一句觀眾會停下來。 AI 可以一天產出 100 支影片。 但你要知道哪一支值得做。 所以我反而覺得「抽卡師」這個職業很有象徵意義。 今天我們還在抽「畫面」。 再過一陣子,我們可能開始抽「故事」。 抽「廣告」。 抽「課程」。 抽「產品」。 AI 可以無限生成選項。 但真正的能力,會從「生成」轉移到「選擇」。 這可能才是生成式 AI 發展到下一階段後,最值得學的一件事。 以前我們害怕: AI 會不會讓我做不出東西? 現在真正該擔心的可能已經變成: 當所有人都做得出來,我憑什麼被選中? 常見問答 (FAQ)Q1:AI 影片生成能力變普及後,學會生成還有價值嗎?有價值,但它不再是唯一差異。生成能降低製作門檻;選題、故事、審美、品質判斷與發行,會更直接影響觀眾是否停留與分享。 Q2:「抽卡師」會成為長期職業嗎?目前它反映了生成結果不穩定、需要反覆產生與人工挑選的工作。模型若能更穩定地理解劇本、維持角色並評估鏡頭,這項工作的內容可能改變;它是否消失,仍取決於技術與製作流程如何演進。 Q3:AI 影片創作者要怎麼從大量內容中被看見?先從觀眾與題目開始,再設計前三秒、故事節奏、情緒轉折和分享理由。大量產出只能增加選項,不能代替對內容品質與發行方式的判斷。 Q4:5,000 萬次播放是所有 AI 短劇的固定回本門檻嗎?不是。這是 DataEye《2026 上半年 AI 劇漫劇數據報告》用來估算抖音端盈虧平衡的參考線;作品類型、成本與發行條件不同,實際回本門檻也會不同。