豆包街舞 × MG 四段提示詞教學:讓舞者推開畫框,做出 40 秒雙版本合輯
- A1/A2/B1/B2 四段各 10 秒實作|動作觸發、推框互動與立體空間 -
看過一支好看的 AI 跳舞影片,最值得研究的不是「對方用了多少特效」,而是:
人物做了什麼,畫面為什麼跟著變化?
手臂向外揮,畫框隨之展開;雙掌往兩側推,黑色框邊真的被推開;最後一個重拍,立體文字碎裂,留下清楚的人物與主標。
這種「動作與圖像有因果關係」的設計,就是這次要練習的重點。
參考作品:〈YUNA|MOVE THE FRAME〉40 秒雙版本合輯
本文的畫面分析依據,是提供的 0–19 秒與 20–39 秒逐秒截圖;本次未取得可播放影片或音軌,Facebook 頁面也未能直接讀取。截圖可用來觀察構圖與元素變化,不能據此確認動作流暢、精準接觸或音畫同步。以下提示詞是根據參考畫面重新設計的教學版本,不是取得原作者的提示詞,也不能據此判定對方使用的模型或後製工具。
如果還沒做過單段練習,可以先看豆包 AI 跳舞影片與 MG 入門教學。本篇進一步拆解四段實作,重點是觸發時機、立體空間與手掌接觸。本文及下載包均為教學試作提示詞,尚未執行影片生成與成片驗收。
一、先看懂這 40 秒:我們要練習的是兩輪製作、四段影片
逐秒截圖涵蓋 0–39 秒,約 20 秒處再次出現主標與相近的舞台元素。本教學將這組畫面解讀為前後兩輪練習的參考;這是教學編排,不代表已確認原作者的生成段數或剪輯方式。因此,這次採用的安排是:先做一個 20 秒版本,再做一個加強後的 20 秒版本。
| 段落 | 對照參考片的時間 | 原片值得注意的內容 | 本次實作目標 |
|---|---|---|---|
| A1:啟動畫框 | 0–10 秒 | 畫框、腳步、大型 MOVE、逐漸增加的空間層次 | 學會讓舞步觸發圖像 |
| A2:推框收尾 | 10–20 秒 | 框架傾斜、BEAT、雙手推框、片名揭示 | 學會接觸互動與收尾 |
| B1:空間升級 | 20–30 秒 | 更突出的文字厚度、透視與框架變化 | 在 A1 基礎上加強立體感 |
| B2:互動升級 | 30–40 秒 | 框架開合、近距離推框、碎裂與最後主標 | 在 A2 基礎上加強因果關係 |
這些分段是方便教學的近似範圍,畫面依據可對照下方兩組逐秒截圖。MG 是 Motion Graphics 的縮寫,指文字、線條、框架與幾何元素等動態圖像。

前半段參考截圖:可觀察框架層次、景別與手掌位置;實際動作先後仍需回到影片驗證。

後半段參考截圖:本教學據此設計立體空間與接觸互動的加強版本。截圖來源為使用者提供的參考作品畫面,原作品連結見上方。
最後的組合是:
- A1+A2=20 秒 A 版
- B1+B2=20 秒 B 版
- A 版+B 版=40 秒比較合輯
這樣除了完成作品,還能看出「改了哪個條件,帶來什麼差異」。文末也會說明如何改成一支不重新開場的連續 40 秒影片。
二、先改變提示詞的寫法:不要列特效,要寫事件
原本的英文提示詞已經有很好的方向,例如角色一致、腳步清楚、特效跟著動作,以及逐漸增強的節奏。
這次要做的是,把抽象要求改成可以看見、可以檢查的事件。
| 原本比較抽象的寫法 | 改成具體事件 | 想得到的效果 |
|---|---|---|
| 加入炫酷的動態圖像 | 手臂向外揮時,後方畫框沿同方向展開 | 觀眾看懂動作與圖像的關係 |
| 大型動態文字 | MOVE 有厚實側面、透視與地面投影 | 文字像舞台裝置,而不是字幕 |
| 畫框跟著舞者互動 | 雙掌先碰到框邊,再向外施力,框邊才移動 | 看起來真的在推框 |
| 最後所有效果一起爆發 | 只爆發一次,接著清空中央,留下人物與主標 | 高潮之後有清楚收尾 |
| 全程禁止切鏡 | 固定同一攝影棚,允許少量有目的的景別切換 | 可以看舞步,也可以看清手部互動 |
這次最重要的提示詞公式是:
人物動作 → 圖像回應 → 結束狀態。
例如:
舞者雙掌貼住左右框邊,接著向外推開。框邊隨手掌移動,中央空間逐漸變寬;動作完成後,框架停在兩側,中央保持乾淨。
這一句同時交代了開始、過程和結果,比「加入推框特效」更容易拿來驗收。
三、豆包新手怎麼開始?先分清楚兩個工作
你會用到兩種操作,不要混在一起:
一般對話:請豆包協助分析、寫提示詞、檢查矛盾。
影片生成:上傳素材、設定規格,再把完成的提示詞送進影片模型。
Seedance 2.0 官方曾列出的豆包入口是「豆包 App 對話框 → Seedance 2.0 → 選擇模型」。實際按鈕、可選模型與素材模式,仍應以你的帳號介面為準,不必為了跟教學畫面完全相同而更換版本。字節跳動 Seed
本次建議操作順序:
| 步驟 | 你要做什麼 |
|---|---|
| 先規劃 | 在一般對話貼上下面的「導演提示詞」 |
| 準備人物 | 選好角色圖片,再建立白色棚景的全身起始圖 |
| 生成 A1 | 上傳人物素材,只貼 A1,不要一次貼四段 |
| 接著做 A2 | 使用 A1 合格的結束畫面協助接續 |
| 製作 B1、B2 | 保留角色與主要設定,測試加強版本 |
| 驗收與合併 | 比較兩版,再組成 40 秒合輯 |
Seedance 2.0 的技術報告列有 4–15 秒的直接生成範圍,因此 10 秒是合理的練習單位;這不代表所有 Seedance 版本都只能生成這個長度,也不代表每個平台開放完全相同的設定。arXiv
先讓豆包幫你規劃,而不是立即生成
把以下文字貼進一般對話,並提供人物圖、參考影片或本文的分段描述。
1 | 你是一位舞蹈MV導演與MG動態圖像設計師。 |
這段是在教 AI「如何幫我們寫」,不是要直接送進影片生成框。
四、先準備一張適合跳舞的起始圖
若手上的人物圖採用低角度、蹲姿或鞋子靠近鏡頭的構圖,可以留作造型參考;這次的目標是看清楚全身舞步,應另外準備一張正面全身起始圖。本文不附角色身分參考圖,請自行準備符合下列服裝設定的成年角色圖片,再開始生成。
角色參考圖負責「長什麼樣子」;起始圖負責「從什麼構圖與姿勢開始」。
Seedance 官方說明支援圖片、影片與音訊等參考,可以分別提供人物、構圖、動作與聲音資訊;實際能否同時指定不同素材角色,仍要看使用入口。字節跳動 Seed
生圖提示詞
1 | 以上傳圖片中的成年街舞女孩為人物與服裝參考, |
起始圖確認之後再生影片。不要帶著已經變形的手指、裁掉的鞋子,期待後面生成時一定會自行修好。
五、四段共用設定:每次都要帶上,不要假設模型記得
下面的四段提示詞,使用方式是:
共用設定+當次段落提示詞。
不要把四段一次貼進同一個 10 秒生成任務,也不要直接接在舊英文提示詞後面,否則可能同時出現「禁止切鏡」與「切到半身」等矛盾。
共用設定
1 | 生成一支10秒、16:9橫式的單人街舞MV。 |
為什麼這次把 125 BPM 改成 120 BPM?
這是為了方便練習,不是參考片的實測速度,也不是 120 BPM 比較好看。
假設使用 4/4 拍、以四分音符計拍,120 BPM 就是每拍 0.5 秒、每小節 2 秒。音樂從小節起點開始時,10 秒正好是五小節,方便對照 0、2、4、6、8 秒的分段。
但這只是時間計算。提示詞寫了 120 BPM,不代表生成音樂一定精確符合,仍要聽、看節拍或量測確認。
六、第一段 A1:先讓動作「啟動畫框」
這段在學什麼?
參考片前段有黑框、腳部特寫、大型 MOVE,以及逐步增加的框架層次。我們先取其中最容易辨認的關係:手臂展開,框架也展開;腳步落下,文字出現。
這一輪先不追求滿場碎片、複雜旋轉和大量特寫。
預期效果:舞者仍是主角,但觀眾能明確感覺她的動作正在啟動畫面。
A1 中文提示詞
請接在「共用設定」後使用。
1 | 【A1:動作啟動畫框】 |
看什麼才算有做到?
先看手臂揮出與畫框展開是否有關係,再看 MOVE 出現時有沒有遮住人物。只要這兩件事還不清楚,就先不要增加其他效果。
常見失敗:人物跳得很正常,但框架自己轉個不停。
把相關段落改成:
1 | 畫框只在手臂向外展開的那一次重拍擴張, |
這不是把效果變少而已,而是把「什麼時候才能動」寫得更清楚。
七、第二段 A2:讓人物真的「推開畫框」
這段在學什麼?
參考片約 16–17 秒的重點,是雙手貼近左右框邊,再向外展開。相比「伸手時出現一道光」,這種構圖更容易被理解為人物在操作圖像;手掌是否持續貼住框邊,仍需播放影片才能確認。
我們要練習三件事:
碰到 → 推動 → 打開。
預期效果:不是背景自動開門,而是舞者用雙手把空間推開。
A2 中文提示詞
本段在合輯中是 10–20 秒,但送進生成工具時,時間仍由 0 秒開始。
1 | 【A2:推框與第一次結尾】 |
為什麼要安排半身鏡頭?
因為本段最重要的不是腳步速度,而是手掌有沒有接觸框邊。
這是有目的的景別切換:看舞步時用全身,看接觸時拉近。
常見失敗:框架一旋轉,人物和地板也跟著歪掉。
修改成:
1 | 只有身後畫框旋轉。 |
這一輪先分清楚「誰在動」,不要讓人物、背景、攝影機同時搶著旋轉。
八、第三段 B1:不要增加舞步,先升級「立體空間」
這段在學什麼?
參考片後半段的 MOVE 更突出文字厚度與透視,框架也逐漸形成向後延伸的通道。
這次保留 A1 的主要舞步,只加強圖像的空間關係。
這裡幾個名詞,可以直接用白話寫進提示詞:
| 想描述的特徵 | 中文可以怎麼寫 |
|---|---|
| 厚度 | 看得到文字側面,不是一張薄片 |
| 倒角 | 字體邊緣有斜面,能接住反光 |
| 透視 | 遠處的框架較小,向後形成通道 |
| 前後遮擋 | 人物在前、文字在後,不要穿過身體 |
| 光影一致 | 文字與人物像處於同一個攝影棚 |
預期效果:文字與框架不像貼在影片上的裝飾,而像舞者身後的大型舞台裝置。
B1 中文提示詞
這是 B 版的開場,請使用與 A1 相同的角色起始圖,而不是接 A2 的片尾定格。
1 | 【B1:A1的空間深度升級版】 |
這段怎麼比較?
把 A1 和 B1 放在一起,先不問哪支「比較炫」,而是問:
文字的厚度有沒有更清楚?框架有沒有更明確的遠近?人物是否仍然好看、好辨認?
這不是嚴格控制所有條件的模型實驗,重新生成的舞步仍可能不同;但把主要修改集中在空間深度,至少比較容易理解修改方向。
常見失敗:字體一轉動,就變成其他字母。
修改成:
1 | MOVE全程保留正面可讀字形, |
官方也指出文字還原精度仍有改善空間,所以不要把「提示詞寫了正確拼字」當成生成結果一定正確。品牌名稱需要逐次檢查;重要字樣也可以留到後製處理。字節跳動 Seed
九、第四段 B2:升級接觸細節,讓高潮「有原因、有結果」
這段在學什麼?
參考片最後一段包含框架開合、雙手互動、碎塊與主標揭示。我們不把所有效果原封不動塞進去,而是選一個主要事件:雙手推開框架,才觸發最後的爆發。
B2 的升級,不一定是更多效果。
更重要的是留出時間,讓觀眾看見:
手靠近 → 手碰到 → 手開始推 → 框架打開 → 效果退場。
預期效果:畫面像一段完整的小表演,而不是舞蹈旁邊剛好有特效。
B2 中文提示詞
1 | 【B2:A2的接觸與收尾升級版】 |
這段最重要的取捨
推框時,手臂不能一邊高速甩動、一邊始終貼住同一個接觸面。因此,我刻意讓中段互動較慢、較清楚,前後再用舞步維持節奏。
不是整支影片每一秒都要最快,才會有力量。
常見失敗:手掌穿過框架,或框架比手先移動。
先把這一輪縮減成:
1 | 本輪只做雙掌貼住框邊後向外推開, |
等推框成功,再逐項加回震波、文字或碎裂。不要一次把所有問題綁在一起重試。
十、生成前與生成後,分別要驗證什麼?
生成前檢查的是指令;生成後檢查的才是影片。
讓 AI 給提示詞 95 分,不能證明手掌真的碰得到框架,也不能證明音樂已經精準同步。
生成前:檢查矛盾
1 | 請審查以下10秒影片提示詞,先不要生成。 |
生成後:用可見現象驗收
| 驗收項目 | 具體看什麼 |
|---|---|
| 人物一致 | 帽子、髮型、臉部、外套與鞋子有沒有改變 |
| 舞步自然 | 換腳是否合理,支撐腳有沒有不自然滑動 |
| 圖像因果 | 是手先動、框才動,還是兩者各做各的 |
| 接觸成立 | 手掌有沒有穿框、懸空或突然離開 |
| 空間成立 | 人物、文字、框架的前後位置有沒有跳來跳去 |
| 文字正確 | MOVE、BEAT 是否拼對,旋轉後是否變字 |
| 結尾乾淨 | 最後是否真的留下人物與單一主標 |
| 音畫節奏 | 主要動作、圖像與鼓點是否對得上 |
建議先正常播放看整體,再靜音看動作,最後專門檢查音樂與圖像的重拍。
交給豆包分析時,可以補上這段:
1 | 請分析我上傳的生成影片,不是只評價提示詞。 |
十一、四段怎麼接?畫面與音樂要分開處理
畫面:A1 接 A2,B1 接 B2
若使用入口支援首幀或接續模式,可以從 A1 的結尾選一張人物清楚、手腳正常、構圖合適的畫面,作為 A2 起點;B1 接 B2 也是相同做法。
但一張結束圖片只能提供某一刻的畫面,沒有完整的前後運動資訊,因此不要把「尾幀接首幀」當成保證無縫的功能。
接不上時,先檢查人物位置、鏡頭遠近與手臂姿勢。必要時在重拍上安排明確切鏡,比硬做一個看得出破綻的假連續鏡頭更適合這次練習。
Seedance 官方另有說明影片延長能力;不過,只有在你的使用入口實際提供該功能時,才把它當成可用的接續方法。字節跳動 Seed
音樂:同樣 BPM,不等於同一首歌
四次都要求「120 BPM 電子嘻哈」,仍可能得到四段不同旋律、不同鼓組與不同音色。
這次製作比較合輯,我建議:
先準備同一段 20 秒配樂,A 版使用一次,B 版再使用一次。
支援音訊參考時,可以把前後兩個 10 秒片段分別提供給對應的生成任務;不支援時,就把生成音訊當成練習參考,最後在剪輯時間軸統一使用選定的配樂,再調整可用剪點。不要直接把四段生成音樂接起來,卻期待它自然成為同一首歌。
對拍仍不理想時,優先調整片段起點、剪點與特效落點,不要大幅改變播放速度,把原本自然的舞步拉壞。
十二、要做成單一連續 40 秒,改這三個地方
前面的設計是兩個 20 秒版本。要改成從頭到尾持續推進的一支影片,不是直接把四段接起來就好。
| 要修改的位置 | 修改內容 |
|---|---|
| A2 最後一秒 | 取消片尾主標與長定格,保留人物、框架與過渡動作 |
| B1 開頭 | 取消「第二版本重新開場」,改成承接 A2 的結束狀態 |
| 全片音樂 | 使用單一 40 秒音軌,只有 B2 最後一秒是真正結尾 |
可以把這段交給豆包,請它調整現有四份稿:
1 | 請將A1、A2、B1、B2改編成一支連續40秒影片, |
這樣,四段的敘事才會變成:
啟動畫框 → 打開空間 → 加強立體舞台 → 最後爆發與收尾。
最後:先學會控制一個效果,再追求整支影片都很精彩
這次四段練習,其實是在學四種不同的控制:
A1 控制觸發時機;A2 控制人物與圖像互動;B1 控制空間層次;B2 控制接觸順序與收尾。
提示詞不必每次越寫越長。當你已經知道問題在哪,最有效的修改往往只有一句:
「框架要等手掌開始施力才打開。」
或是:
「最後一秒不要再新增效果。」
第一次實作先做 A1。人物穩定、腳步看得清楚、MOVE 與框架的出現有理由,再進到 A2。
四段已包含共用設定、可分別複製使用的完整中文提示詞,連同生圖、審查、局部修正與使用者提供的英文提示詞範例,已整理為實作包。英文範例僅供對照,不是原作者已證實使用的提示詞;不要與新版中文稿混貼。
內文示範「共用設定+單段腳本」的組合方式;下載包的 A1、A2、B1、B2 已各自包含共用設定,每次只需複製其中一段。角色圖需自行準備並實際上傳,本文參考截圖用於畫面分析,不是提示詞中黑帽、高馬尾、工裝褲角色的身分參考。
常見問答 (FAQ)
Q1:四段提示詞可以一次貼上,直接生成連續 40 秒嗎?
本篇設計為四次各 10 秒生成,A1 接 A2 組成 20 秒 A 版,B1 接 B2 組成 20 秒 B 版,再做比較合輯。要改成連續 40 秒,須修改 A2 結尾、B1 開頭並使用單一 40 秒音軌;實際可選長度以模型與介面為準。
Q2:A1、A2、B1、B2 每段都要貼共用設定嗎?
使用內文分段稿時,要先貼共用設定再貼當次腳本。下載包的四份獨立提示詞已包含共用設定,每次複製一份即可,不要一次貼四份,也不要接在規則不同的舊英文稿後面。
Q3:120 BPM 是參考影片量測出的速度嗎?
不是。120 BPM 是方便分段的練習目標:4/4 拍以四分音符計拍時,每拍 0.5 秒、每小節 2 秒。生成音訊仍需量測或核對;四次要求同樣 BPM,也不會自動得到同一首歌。
Q4:手掌穿過畫框時,應該先改哪裡?
先取消文字、碎裂與鏡頭移動,只保留穩定半身鏡頭中的貼框、施力與推開。明確要求手掌持續貼住框邊,框架在施力後才移動,接觸自然後再逐項加回效果。
Q5:這些提示詞是參考作品原作者使用的版本嗎?
不是。這是依提供的逐秒截圖重新設計的教學改編,無法據此確認原作者使用的模型、參考素材、後製方法或音樂流程。本文也未取得可播放影片或音軌,因此沒有宣稱動作流暢或逐拍同步已驗證。