跳到主要內容
Frank Chiu

徐享/享哥

AI應用規劃師

具有 10 年經驗在數位行銷與電商廣告領域,專精生成式AI應用與個人資料保護,致力於以獨特商業洞察與實戰案例研討,助力品牌突破成長瓶頸。

MiniMax H3 提示詞怎麼寫?用 Codex Skill 建立 AI 影片工作流

- 從一句畫面構想到 Shot Manifest、參考圖與生成佇列,整理一套能持續改進的 H3 影片提示詞工作流。 -

做 AI 影片時,很多人會先研究「提示詞要怎麼寫」。但影片做得越多,越容易發現真正重複消耗時間的,是每次都得重新想:人物怎麼描述、鏡頭如何移動、動作要拆幾段、台詞怎麼保留、參考圖怎麼指定,以及哪些限制值得寫進提示詞。

與其每次從頭整理,不如把這些經驗交給一個可重複使用的 Skill。本文以 MiniMax H3 Prompt Standardizer 為例,介紹如何把一句畫面構想整理成較完整的影片提示詞,並說明如何在前面加上 Shot Manifest、在後面接續生成佇列與檢討紀錄,逐步建立一套自己的 AI 影片工作流。

先說清楚範圍:這個專案是 Codex Skill,負責整理提示詞與分段規劃;它本身不是 MiniMax H3,也不會直接生成或剪輯影片。提示詞是否能達到預期,仍取決於實際使用的模型、參考素材、產品版本與生成設定,不能保證一次成功。

MiniMax H3 Prompt Standardizer 在解決什麼問題?

可以把這個 Skill 想成一個「Prompt Compiler」:使用者用自然語言描述想法,它再把人物、場景、動作、運鏡、聲音和限制整理成比較清楚、可複製的提示詞。

沒有固定整理流程時,工作大致是:

1
2
3
4
5
6
7
畫面想法
↓
自己研究提示詞
↓
反覆修改
↓
交給影片模型

使用 Skill 後,提示詞整理步驟可以變得可重複:

1
2
3
4
5
6
7
8
9
畫面想法或劇本
↓
Codex
↓
MiniMax H3 Prompt Standardizer
↓
整理後的 H3 提示詞
↓
MiniMax H3 或其他影片工具

專案的 SKILL.md 說明,它可以處理一句話、既有長提示詞、故事、劇本、對白、廣告構想、分鏡清單,以及參考圖片等輸入;依需求擴寫、精簡、修補提示詞,或規劃多段生成。它也把文字生成影片、圖片參考、多張參考圖、首尾幀、對白與聲音等列為提示詞整理情境。這些是 Skill 的提示詞工作範圍,不代表每個 MiniMax H3 介面或帳號都支援相同功能;使用前仍要確認目前產品可用的輸入模式與限制。

比方說,輸入:

1
一個女生在雨夜車站等人,8 秒,16:9。

Skill 可以補出一份較清楚的描述,涵蓋人物、場景、主要事件、鏡頭流程、光線、色彩、聲音和必要的防錯條件。重點不在於把一句話變得很長,而是讓每一項資訊都有明確作用。

先決定一段影片要完成什麼,再寫提示詞

這個 Skill 的一個實用做法,是在輸出前先判斷需求形狀:要用哪種生成方式、內容是對話還是動作、適合一鏡到底還是多鏡、需要什麼時長、故事是否要拆段,以及每段在哪個畫面節點結束。

它的規則建議在沒有指定時,為單次生成挑選合理時長,並以每段最多約 15 秒作為規劃參考。這是 Skill 的工作流建議,不是 MiniMax H3 的官方時長上限;實際能輸入的秒數要看當下使用的產品與模型設定。

故事很長時,切段也不應只依字數平均分配。每段最好是一個可以完整看見的微事件或情緒節點,避免把尚未完成的動作、姿勢或情緒硬拆在兩次生成之間。可以優先在下列變化處切開:

  • 鏡頭景別或視角改變。
  • 場景、時間或主要人物改變。
  • 一個動作已經完成,下一段開始新的事件。
  • 角色完成一個情緒節點,後面進入新的反應。

例如「跑進咖啡廳、認出前任、停下來對望、哭泣、放下戒指、轉身離開」其實包含場景建立、跑步、視線互動、表情變化、道具互動和情緒轉折。把所有事件都塞進短短幾秒,模型需要同時安排太多變化。可以先找出哪些動作能構成一個完整鏡頭,再決定每段提示詞要負責的內容。

這裡的關鍵是先定義 Generation Unit(單次生成單位),再寫 Prompt。與運鏡、攝影語言有關的延伸閱讀,可參考從 Google Flow 的 /orbit 學 AI 影片運鏡提示詞;更完整的 Skill 製片流程則可看從 Prompt 到專家 Skill 的 AI 影片製片工作流。

如何安裝與第一次使用?

這個 GitHub 專案的根目錄包含 SKILL.md,因此可以從該 repo 安裝。若你的 Codex 版本提供內建 $skill-installer,可以在 Codex 輸入:

1
$skill-installer install https://github.com/sengseng123/minimax-h3-prompt-standardizer

也可以把 Skill 放進個人技能資料夾。Codex 目前文件列出的個人本機 Skill 位置是 $HOME/.agents/skills:

1
2
3
mkdir -p "$HOME/.agents/skills"
git clone https://github.com/sengseng123/minimax-h3-prompt-standardizer \
"$HOME/.agents/skills/minimax-h3-prompt-standardizer"

安裝前先檢視 repo 裡的 SKILL.md 與其他檔案,確認這份指示適合你的工作方式。這個專案的核心內容集中在 SKILL.md,另有 agents/openai.yaml 供支援該格式的介面顯示名稱或描述。Codex 會自動偵測本機 Skill;若清單沒有出現,再依目前版本文件重新啟動 Codex。安裝目錄可能隨 Codex 版本與安裝方式不同,請以官方技能文件列出的載入位置為準。

第一次使用時,可以在 Codex 輸入:

1
2
3
4
使用 $minimax-h3-prompt-standardizer:

一個女孩在雨夜車站等待某人。
8 秒,16:9,真人風格,不要字幕。

短構想提供了主角、事件、時間、比例和一項畫面限制,其他細節再由 Skill 依規則補齊。若結果偏離原意,直接指出要改的人物、鏡頭、節奏或風格,不需要先學會專業術語。

什麼情況適合直接交給 Skill?

單一情境、短時間、只有一個主要事件時,可以直接請它整理提示詞。例如:

1
2
3
4
5
使用 $minimax-h3-prompt-standardizer:

幫我做一段 10 秒影片。台灣女生坐在深夜便利商店窗邊,
窗外下著雨,她低頭讀到一則令人難過的訊息。
真人實拍,16:9,不要字幕;情緒壓抑但不要過度戲劇化。

輸入可以口語、簡短,也可以是一段既有提示詞。使用者不必先決定所有鏡頭術語;若某個缺少的資訊真的會改變結果,Skill 才應該提出簡短問題。這符合專案的方向:讓人描述想完成的畫面,而不是要求每個人先學會 Prompt 工程。

長故事先加一層 Shot Manifest

如果要做 MV、短劇、品牌影片、多場景廣告或一段較長的連續劇情,我會在提示詞整理前先建立 Shot Manifest(鏡頭規格表):

1
2
3
4
5
6
7
8
9
故事或腳本
↓
Shot Manifest
↓
H3 Prompt Standardizer
↓
單段生成提示詞
↓
影片生成與檢查

Shot Manifest 是本文建議加在工作流前段的規格,不是這個 GitHub 專案內建的功能。它的用途是把故事邏輯和模型生成條件分開:編劇先決定角色、情節和情緒;分鏡規格再交代每一鏡的人物狀態、具體事件、動作方向和結尾。

我會讓每個 Shot 至少包含:

  • Shot ID 與目的:這個鏡頭在故事裡要完成什麼?
  • 建議時長與場景:預計生成多久、在哪裡、什麼時間?
  • 人物與參考素材:畫面有哪些角色,哪些參考圖要鎖定人物或環境?
  • 核心事件:這一鏡只需要讓觀眾看懂哪件事?
  • 起始狀態與結束狀態:鏡頭開始時是什麼畫面,最後停在哪裡?
  • 動作流程與運鏡:人物朝哪裡移動,鏡頭如何配合?
  • 聲音:有哪些對白、環境聲、動作聲或配樂?
  • 連續性與銜接點:服裝、道具、人物方向與光線如何延續?下一鏡從什麼畫面接起?

例如,故事「女孩走進空蕩的月台,停下來等待」可先拆成:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
SHOT 01

目的:建立人物與月台環境
建議時長:5 秒
場景:夜晚、空蕩的室內月台
人物:女孩
核心事件:女孩走進月台中央並停下
起始狀態:鏡頭看見空月台
結束狀態:女孩站定,視線望向月台一側
運鏡:中遠景緩慢推近
參考素材:角色參考圖、月台場景參考圖
聲音:遠處列車聲與室內環境音
連續性:下一鏡延續同一服裝、站位與光線方向
銜接點:以女孩轉向月台入口作為下一鏡起點

完成後再逐鏡轉成 H3 提示詞:

1
2
3
使用 $minimax-h3-prompt-standardizer,
把 SHOT 01 整理成 MiniMax H3 提示詞。
保留人物、場景、起始狀態與結束狀態;不要新增事件。

這多一層整理,能先發現故事分段和素材規劃問題,不必等影片生成後才發現一段裡安排了太多事件。

多張參考圖要先標明各自用途

如果會上傳多張圖片,先說清楚每張圖負責什麼,並指定有衝突時以哪張為準。比如:

1
2
3
4
5
6
7
8
9
使用 $minimax-h3-prompt-standardizer。

圖片 1 是人物主要參考,鎖定臉部與髮型。
圖片 2 補充服裝與體型。
圖片 3 是場景參考,鎖定空間與光線方向。
圖片 4 是商品外觀參考。

請整理一段 10 秒廣告提示詞:人物走進咖啡廳,
坐下後拿起圖片 4 的商品。人物與商品外觀以主參考圖為準。

專案的規則建議在正式提示詞前,先以 @圖片1、@圖片2 等標記列出上傳順序、主要參考和鎖定資訊。參考圖可能彼此衝突,也可能帶著不需要的背景、姿勢、浮水印或介面文字;要說明哪些視覺資訊應保留,哪些應忽略。不要指示 Skill 描述它沒有收到的素材。

對白與 Lip Sync 要提供可執行的細節

如果畫面裡有人說話,只提供一句台詞通常不夠。可以補充說話者、說話時間、視線、呼吸、停頓、情緒與聲音質地:

1
2
3
4
5
6
7
說話者:台灣女生,約 25 歲,聲音自然,不要播音腔。
情緒:像是忍住眼淚,語速稍慢,中間停頓一次。
台詞:
「你終於來了。」

台詞必須逐字保留,不要改寫。
請讓嘴型與說話時間對齊。

這個 Skill 的規則明確要求,除非使用者要求改寫,否則保留原始台詞;也建議交代誰在何時說話、聲音情緒、停頓和嘴型同步。實際對嘴表現仍受生成工具和素材影響,提示詞只能交代目標,不能保證結果。

把抽象形容詞換成看得見的描述

「電影感」、「高級感」、「震撼」、「史詩」或「絲滑」,本身很難告訴模型畫面該如何安排。試著把這些詞拆成可以觀察的鏡位、動作、光線、色彩、節奏與材質。

例如:

1
2
3
4
5
模糊:人物以很有電影感的方式走過來。

具體:低機位中景跟拍,人物由畫面左後方走向右前方;
鏡頭穩定地緩慢後退,背景保持淺景深,
暖色街燈在遠處形成柔和散景,人物臉部保留自然陰影。

如果要描述角色動作,則交代方向、重心、原因、反應、與環境的互動,以及動作結束時的姿勢。例如「男子向左揮拳,女子側身閃避,身體重心轉到左腳;拳頭擦過肩膀,碰倒後方桌上的紙杯,男子收拳後停在她右前方。」比「兩個人激烈打架」更容易讓人看懂要生成的事件。

轉場用畫面元素銜接,而不是只喊「絲滑」

要接兩個場景,可以先找一個可見元素作為轉場錨點,也就是 Match Element。例如第一鏡推近一把紅色雨傘,直到傘面填滿畫面;下一鏡從相似的紅色開始,再拉遠揭露那是咖啡廳的紅牆。這樣交代了前後畫面如何匹配,不必只寫「使用絲滑轉場」。

長故事也可以記錄前一鏡的結尾姿勢、人物方向、道具位置和光線,並指定下一鏡從哪裡接續。每段可以獨立生成,但規格表仍保留全片的連續性資訊。

聲音分層,提示詞會更清楚

聲音可以分成三層描述:

  1. 對白:角色說話或旁白,包括內容、說話者、時機、語氣和停頓。
  2. 畫面內聲音(Diegetic Sound):角色也處在其中的雨聲、腳步聲、門鈴、杯子碰撞或遠處車聲。
  3. 畫面外配樂(Non-diegetic Sound):觀眾聽得到、但不是場景裡物件發出的背景音樂。

不要把三種聲音混成「加一點有氛圍的音效」。可以指定哪些聲音要突出、哪些只當背景,並只保留這個鏡頭真正需要的聲音設計。

防錯限制要針對場景挑選

人物一致性、服裝變化、道具重複、手指異常、口型不符、人物瞬移、軸線反轉、鏡頭跳動、光線不連續、意外文字或風格漂移,都是常見的影片生成問題。不代表每個提示詞都要把整份負面限制貼一遍。

先想清楚當前 Shot 最可能失敗的地方,再補對應限制。例如人物拿著一杯咖啡並轉身時,可能要注意杯子不要複製、人物轉向保持一致;若只有遠景空景,手指或 Lip Sync 就不是需要處理的條件。限制越貼近畫面任務,越容易看懂它要避免哪種錯誤。

把單次生成接成可管理的工作流

如果一部影片包含許多鏡頭,我會把它擴充成以下流程。這是本文整理的工作流建議;Generation Queue 與失敗知識庫不是這個 Skill repo 的內建功能:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
想法
↓
故事與劇本
↓
Shot Manifest
↓
參考素材規劃
↓
H3 Prompt Standardizer
↓
Generation Queue
↓
影片生成
↓
人工檢查與重生失敗鏡頭
↓
剪輯軟體組片

Queue 可以用 Markdown 或試算表記錄每一鏡的提示詞檔案、參考素材、狀態與失敗原因:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
SHOT 001
Status: Ready
Reference: character-a.png
Prompt: prompts/shot001.md

SHOT 002
Status: Waiting
Reference: character-a.png, room-a.png
Prompt: prompts/shot002.md

SHOT 003
Status: Regenerate
Reason: 人物臉部在鏡頭中途改變
Prompt: prompts/shot003-v2.md

狀態名稱可以依自己的流程調整,例如 Ready、Generated、Approved、Regenerate。記錄可以回答:哪些還沒生成、哪些已通過、哪些要重做,避免只靠記憶管理一長串鏡頭。

每次重生前也可以先寫一筆 Review:

1
2
3
4
5
6
7
SHOT 07 Review

問題:人物臉部一致性下降
發生時間:約 4 秒
觀察:鏡頭旋轉後臉部特徵開始改變
可能原因:鏡頭旋轉幅度過大
下一次調整:減少環繞幅度,增加正面停留時間,重新指定人物主參考圖

累積一段時間後,失敗紀錄便能整理成自己的 Failure Knowledge Base:哪些動作容易失敗、哪些運鏡會影響角色一致性、哪些參考圖組合較合適。這些紀錄是團隊自己的經驗,不應直接當成 MiniMax H3 的永久規則。

讓 Skill 符合自己的製作習慣

原版 Skill 可以作為起點。若想做個人版本,可以複製後再加入自己的偏好,例如預設使用繁體中文、預設不加字幕、人物一致性優先、長故事先產生 Shot Manifest,或對話鏡頭避免劇烈環繞運鏡。

建議把「普遍有幫助的規則」和「特定專案偏好」分開。工作流規則可以告訴 Skill 如何判斷、如何輸出;專案偏好則描述你的影片風格與製作要求。無論如何擴充,都要清楚標示必要條件與可選建議,避免把過去某次成功的設定說成每個模型都適用。

可以直接保存的短片提示詞指令

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
使用 $minimax-h3-prompt-standardizer。

請把以下內容整理成適合 MiniMax H3 的影片提示詞。
若單次生成可以完成,輸出一段提示詞;
若事件太多,拆成數段完整的 Generation Unit。

每段保留一個主要事件,不要切開尚未完成的動作;
優先在場景、視角、時間、人物或完整動作結束處分段。
維持人物、服裝、道具、移動方向與光線連續。
有參考圖時標明每張圖片用途,對白逐字保留。
只加入這一鏡真正需要的防錯限制。
不要自行加入字幕、Logo、浮水印或畫面文字。

我的構想:
{{貼上故事、劇本、既有提示詞或畫面想法}}

長故事先產生規格,再逐鏡產生提示詞

若要處理 MV、短劇或多場景廣告,可以先要求 Codex 不要立即輸出影片提示詞:

1
2
3
4
5
6
7
8
9
10
11
12
13
以下是一個完整故事,請先建立 Shot Manifest,不要直接產生影片 Prompt。

每個 Shot 都要是一個可在單次生成內完成的完整微事件,並列出:
Shot ID、故事目的、建議時長、人物、場景、核心事件、
開始狀態、動作流程、結束狀態、運鏡、光線、聲音、參考素材、
與前一鏡的連續性,以及與下一鏡的銜接方式。

完成 Shot Manifest 後,逐鏡使用 $minimax-h3-prompt-standardizer
產生提示詞,最後另建 Generation Queue,記錄 Ready、Generated、
Approved 或 Regenerate 狀態。

故事:
{{貼上完整故事}}

這個順序先把「故事如何拆鏡」和「每一鏡如何寫成模型提示詞」分成兩個任務。若想從更完整的製片視角延伸,也可以參考AI 影片製片工作流。

五分鐘快速操作

1
2
3
4
5
6
7
8
9
1. 安裝並檢視 MiniMax H3 Prompt Standardizer。
2. 單一短畫面直接使用 $minimax-h3-prompt-standardizer。
3. 長故事、MV 或短劇先建立 Shot Manifest。
4. 逐鏡整理 H3 提示詞。
5. 標示人物、場景與商品參考圖用途。
6. 用 Generation Queue 管理待生成與待重做鏡頭。
7. 生成後檢查人物、動作、聲音與連續性。
8. 只針對失敗的鏡頭修改提示詞並重生。
9. 將通過的鏡頭交給剪輯流程組成成片。

影片模型會更新,某些特定提示詞寫法也可能隨產品調整;但把故事、鏡頭、參考素材、生成與檢查拆成清楚步驟,能讓經驗留在工作流裡。與其每次從頭重寫 Prompt,不如把可重複的判斷整理成 Skill,把影片製作變成可檢視、可修正的流程。

常見問答 (FAQ)

Q1:MiniMax H3 Prompt Standardizer 會直接生成影片嗎?

不會。它是給 Codex 使用的 Skill,負責把畫面想法、故事或現有提示詞整理成影片提示詞;要生成或剪輯影片,仍需使用支援相應功能的影片工具。

Q2:只輸入一句話也能使用嗎?

可以。專案設計上接受一句話構想,會依可合理推定的資訊整理提示詞。若時長、比例或其他缺漏會明顯改變結果,再補充條件即可;不用先掌握專業提示詞術語。

Q3:每段 15 秒是 MiniMax H3 的硬性上限嗎?

不是。約 15 秒是這個 Skill 用來規劃單次生成的建議,不是 MiniMax H3 的官方產品限制。實際可用時長、參考素材模式與生成參數,請查看目前使用的 MiniMax 介面說明。

Q4:Shot Manifest 和 Generation Queue 是 Skill 內建功能嗎?

不是。MiniMax H3 Prompt Standardizer 的核心是提示詞整理與分段建議;Shot Manifest、Generation Queue 和失敗紀錄是本文建議加上的工作流層,可以用 Markdown 或試算表自行管理。

Q5:安裝後沒有看到這個 Skill 怎麼辦?

先確認 SKILL.md 位於 Codex 目前會掃描的本機 Skill 資料夾,並查看 Codex 的 Skill 清單;如果尚未載入,再依官方文件重新啟動 Codex,或更新資料夾位置。個人和專案層級的載入路徑可能不同,安裝前請先檢查目前版本的說明。


相關文章

Codex Skill 與 Plugin 到底差在哪?從個人工作流到團隊交付
Codex Skill 與 Plugin 到底差在哪?從個人工作流到團隊交付
AI工具 AI Agent Codex

2026/09/27

AI 做簡報總是大綱、PPT、講義對不起來?先建立 Slide Manifest
AI 做簡報總是大綱、PPT、講義對不起來?先建立 Slide Manifest
AI自動化 AI工具 自動化講師應用

2026/09/26

AI Coding 技術債:寫程式快 10 倍,Temporary Fix 也可能快 10 倍
AI Coding 技術債:寫程式快 10 倍,Temporary Fix 也可能快 10 倍
AI工具 Vibe Coding

2026/09/25

【AI Agent 也需要漂亮的協作介面:我開始把「看懂」當成 Vibe Coding 的一部分】
【AI Agent 也需要漂亮的協作介面:我開始把「看懂」當成 Vibe Coding 的一部分】
AI工具 AI Agent Vibe Coding

2026/09/25

Google Vids 正在降低 AI 影片門檻:新手不必先學剪輯軟體?
Google Vids 正在降低 AI 影片門檻:新手不必先學剪輯軟體?
AI工具 影音行銷 Google Vids

2026/09/25

華為「天才少年」把 AI Agent 寫成一本開源教科書,這幾章最值得先啃
華為「天才少年」把 AI Agent 寫成一本開源教科書,這幾章最值得先啃
AI Agent Codex MCP

2026/09/22

AI 影片新手最容易學錯的:把「高級感」當成影片能力
AI 影片新手最容易學錯的:把「高級感」當成影片能力
AI工具 內容行銷 影音行銷

2026/09/18

我以為 Modal 每月免費 30 美金,可以養一個 Kimi K3;結果一句話都還沒問,就先燒了 34 美金
我以為 Modal 每月免費 30 美金,可以養一個 Kimi K3;結果一句話都還沒問,就先燒了 34 美金
AI工具 AI Agent Codex

2026/09/17

我覺得 VoiceStudio 最值得注意的地方,根本不是免費
我覺得 VoiceStudio 最值得注意的地方,根本不是免費
AI自動化 AI工具 影音行銷

2026/09/15