零基礎 AI 跳舞影片教學:用豆包寫專業舞蹈提示詞,10 秒也能跳出節奏感
- 先讓豆包編排分鏡,再用 Seedance 生成:從動作、重心到節奏的入門做法。 -
想做一支跟著音樂擺動、甩手、轉身的 AI 跳舞短片,卻不知道要怎麼把腦中的動作說清楚?可以先把舞蹈拆成幾個簡單步驟,再交代每個動作何時發生、身體重心怎麼移動,以及鏡頭要怎麼拍。
這篇從零開始介紹如何用豆包規劃舞蹈分鏡,再把整理好的提示詞交給 Seedance 影片生成功能。即使不會跳舞,也能先用固定鏡頭、單人和簡單動作做第一版,再依生成結果逐次調整。
本文中的提示詞是練習範例,沒有逐一實測保證成功。豆包與 Seedance 的介面、模型版本、生成秒數、參考素材和額度會依帳號及平台調整,操作時請以目前可用的選項為準。
先認識豆包與 Seedance
豆包(Doubao)可以協助整理想法與編排分鏡;Seedance 則是字節跳動的影片生成模型。官方在 2026 年 2 月發布 Seedance 2.0,說明模型支援文字、圖片、音訊與影片參考,也公告已在豆包等平台提供體驗。
官方後續也介紹了 Seedance 2.5。不同版本與平台提供的功能並不一定相同,因此本文以 Seedance 2.0 的提示詞概念為例;如果帳號介面已提供其他版本,仍可沿用「動作、時間、重心、表情、鏡頭」的描述方式,並依實際介面調整。
先弄懂 12 個常見舞蹈與影片名詞
| 名詞 | 白話解釋 | 例子 |
|---|---|---|
| Prompt(提示詞) | 交代 AI 要生成什麼的文字指令 | 一位男子跳 10 秒街舞 |
| Seedance | 根據提示與參考素材生成影片的模型 | 用人物照製作舞蹈短片 |
| 文生影片 | 只用文字描述生成影片 | 描述一位穿黑西裝的男子跳舞 |
| 圖生影片 | 提供圖片作為人物或畫面參考 | 上傳取得授權的人物照 |
| 分鏡 Storyboard | 把影片拆成不同時間段,規劃每段畫面 | 0–2 秒推掌,2–4 秒甩臂 |
| BPM | 每分鐘的拍數 | 120 BPM 約每 0.5 秒一拍 |
| BGM | 背景音樂 | 電子舞曲 |
| 卡點 Beat Sync | 讓動作變化配合音樂拍點 | 鼓聲落下時甩手 |
| 重拍/弱拍 | 音樂中較強與較輕的拍點 | 重拍發力,弱拍放鬆 |
| 坐胯 | 膝蓋微彎、降低重心並把重量放到一側髖部 | 左腿承重,身體稍向左沉 |
| 頂胯 | 髖部隨動作往某個方向推出 | 右手甩出時,右胯同步推出 |
| 運鏡 | 攝影機移動或改變取景的方式 | 固定鏡頭或緩慢推近 |
「冷感鬆弛拽風」不是嚴格定義的舞種,而是表演氣質的描述:表情冷靜、動作不僵硬,同時帶有自信的態度。提示詞可以把這種抽象形容拆成模型比較容易理解的行為,例如「眼神半垂、嘴角平直、肩膀自然律動」。
重拍定神、弱拍放鬆也只是編排提示。不同歌曲的重拍位置和節奏都可能不同,不能假設每首音樂都剛好是強、弱、強、弱的固定排列。
如何用豆包做第一支 10 秒跳舞影片?
第一次練習先選擇單人、固定鏡頭與少量大動作。若要使用真人照片,請用自己的照片或已取得使用許可的素材;能否上傳及作為影片參考,仍要看當前平台規則。沒有合適照片時,可以改用文字描述虛構人物。
1. 準備人物與場景
人物照片建議包含全身或膝蓋以上,正面站立、手腳清楚。場景可以先用明亮客廳或簡單背景,避免初次生成就加入頻繁換景、複雜道具和多人互動。
2. 選擇影片生成模式與設定
在豆包 App 或目前可用的影片生成入口,確認要用文字生成影片或圖片生成影片,再查看可選模型、畫面比例、片長與參考素材欄位。本文範例以 9:16 直式、10 秒作為練習設定;若介面沒有相同選項,請改用帳號目前提供的設定。
3. 先貼上簡單提示詞
第一版先看主要動作是否清楚,不必同時要求複雜手勢、連續轉身與精準卡點。
1 | 生成一支 10 秒、9:16 直式、真人寫實風格的跳舞影片。 |
這是讓模型理解動作順序的起點,不是每次都會逐秒精確執行的保證。先看人物、動作和構圖有沒有大致符合,再決定要修改哪一項。
怎麼把普通提示詞寫得更有舞感?
普通提示詞只說「做什麼」;較清楚的提示詞還會說明「怎麼做」、「何時做」以及「身體其他部位怎麼配合」。
| 普通描述 | 更具體的描述 |
|---|---|
| 男子用力甩手 | 右手向右上方快速甩出,右胯同步向右推出 |
| 他看著鏡頭 | 重拍落下時抬眼,短暫看向鏡頭 |
| 身體跟著音樂動 | 膝蓋微彎,肩膀與胯部隨節奏交替律動 |
| 表情很酷 | 眼皮稍微下垂、嘴角放鬆,保持冷靜表情 |
| 最後帥氣結束 | 雙掌向前推出,最後半秒停在穩定站姿 |
可以用這個順序組合舞蹈提示詞:
人物與場景 → 動作與重心 → 節奏與表情 → 鏡頭與時長
先交代誰在什麼地方,再描述手、腳和身體重心怎麼配合;接著補充表情與節奏,最後限定片長、畫面比例、景別和鏡頭是否移動。
不會編舞?先讓豆包幫你拆分鏡
可以把豆包當作分鏡助理,先請它把簡單的動作分配到不同時間段,再把結果整理成影片提示詞。
第一階段:請豆包規劃舞蹈
1 | 你是一位短影音舞蹈分鏡助理,請用初學者看得懂的白話文,設計一支 10 秒、9:16 直式的單人跳舞影片。 |
如果看不懂模型產生的舞步,可以追問:「把動作改成一般人也能理解的白話文,並說明重心應該放在哪隻腳。」
第二階段:把分鏡整理成影片提示詞
以下是一份可以再依人物或場景修改的範例:
1 | 9:16 直式影片,10 秒,真人寫實風格。參考人物圖中的外貌、髮型與服裝,場景為明亮的現代客廳。 |
三種難度的練習題
每次只增加一種技巧,比較容易判斷生成結果是被哪個描述影響。
Level 1:客廳律動
目標是看懂基本肢體動作。先不用複雜表情或換景:
1 | 生成一支 10 秒、9:16 直式的真人跳舞影片。一位穿白色 T 恤與黑色長褲的成年男性,在明亮客廳隨電子舞曲跳舞。 |
Level 2:野柳冷感街舞
目標是練習舞蹈氣質、重心和眼神配合:
1 | 生成一支 10 秒、9:16 直式的真人舞蹈影片。一位穿黑色西裝的成年男性,在台灣野柳海岸的岩石步道上跳舞,背景保留自然海岸與海景。 |
Level 3:霓虹節奏舞
目標是嘗試節奏變化與簡單運鏡。動作穩定後,再加入鏡頭推近:
1 | 生成一支 10 秒、9:16 直式的真人街舞短片。成年男性舞者穿黑色時尚西裝,在紫藍色霓虹燈下的都市街頭跳舞,風格冷靜、時尚、自信。 |
用五個項目檢查生成結果
每項 0–2 分,總分 10 分。分數用來比較自己的不同版本,不代表專業舞蹈評定。
| 項目 | 0 分 | 1 分 | 2 分 |
|---|---|---|---|
| 人物一致性 | 臉、髮型或衣服大幅變化 | 大致相同但有明顯跳動 | 外觀大致穩定 |
| 動作完整性 | 多個主要動作沒有出現 | 部分完成或順序改變 | 多數主要動作可辨認 |
| 身體連動 | 手腳動作互不協調 | 有些動作自然、有些不連貫 | 手、腳與重心大致配合 |
| 節奏與表情 | 動作和表情沒有層次 | 有少數節奏變化 | 強弱與眼神安排清楚 |
| 鏡頭與構圖 | 人物常出畫或鏡頭混亂 | 大多入鏡但構圖不穩 | 全身清楚、鏡頭符合設定 |
如果結果不理想,可以先回到 Level 1:固定鏡頭、減少動作數量,一次只調整一個問題。
常見問題排查:為什麼影片動作不自然?
| 看到的問題 | 可能原因 | 可以怎麼改 |
|---|---|---|
| 手指或手掌變形 | 手勢太細、動作變化太快 | 改成推掌、握拳等較大的動作 |
| 手在動,身體卻不跟著動 | 沒有交代重心轉移 | 補上哪隻腳承重,以及腰胯如何配合 |
| 動作接不起來 | 10 秒內安排太多動作 | 先留下 4–6 組主要動作,描述動作之間如何回到下一個姿勢 |
| 舞步看起來僵硬 | 只有動作結果,沒有過渡 | 加上膝蓋微彎、肩膀自然律動或重心轉移 |
| 人物跳出畫面 | 動作幅度太大或鏡頭太近 | 改用固定中遠景並要求全身入鏡 |
| 臉或服裝改變 | 快速轉身或動作太複雜 | 簡化轉身,使用清楚且獲准的參考圖 |
| 沒有準確卡到鼓點 | 模型未必取得或理解指定音訊 | 使用平台支援的音訊參考,或在剪輯時依實際音檔對拍 |
請豆包協助修改提示詞
若第一次生成有具體問題,可以把原提示詞和觀察到的現象一起交給豆包,並要求它只優先修正一兩項:
1 | 你是一位 AI 舞蹈影片提示詞優化助理。 |
AI 寫了「跟著音樂跳」,就會真的卡點嗎?
不一定。只寫「跟著 DJ 音樂跳」,模型需要自行推測音樂節奏;如果入口支援音訊參考,提供實際音檔可能有幫助,但結果仍要檢查。要求精準對特定歌曲卡點時,應先確認實際音檔的 BPM、重拍位置與起始偏移,再於剪輯時微調。
以 120 BPM 為例,每拍約 0.5 秒;10 秒約有 20 個拍點。這不代表要安排 20 個不同動作,可以每 4 拍形成一組,大約每 2 秒換一組主要動作,比每拍都換動作更容易控制。
在提示詞中寫上歌名,不代表模型一定會取得或使用該歌曲的原始音訊。公開分享影片前,也要確認所用音樂具有相應授權,避免平台的版權限制。
開始創作前記住這五件事
- 先簡單,再增加難度: 從單人、固定鏡頭和少量動作開始。
- 交代身體連動: 不只寫手勢,也說清楚腳步、腰胯與重心。
- 安排節奏強弱: 重拍發力、弱拍放鬆可作為提示,但要依實際音樂調整。
- 把分鏡當作引導: 秒數能幫助描述順序,不保證模型逐格照做。
- 把編排與生成分開: 先請豆包整理動作,再把清楚的提示詞交給影片模型。
製作 AI 跳舞影片不只是「叫 AI 做影片」,也包含把動作、節奏和鏡頭整理成清楚的指令。先建立一支容易檢查的短片,再根據結果逐步修正,比一次塞入很多形容詞更容易看出進步。
常見問答 (FAQ)
Q1:不會跳舞,也能寫出 AI 跳舞提示詞嗎?
可以。先用推掌、甩臂、跨步等容易描述的大動作,依時間排序,再補充身體重心與鏡頭安排。看不懂專業舞蹈詞彙時,請豆包改成白話說明即可。
Q2:提示詞寫了 10 秒和每段動作時間,模型就會完全照做嗎?
不保證。時間分段是幫助模型理解動作順序的引導,生成結果仍可能改變動作或節奏。建議從少量動作開始,生成後再按實際問題調整。
Q3:可以上傳任何人的照片當作跳舞影片主角嗎?
不應假設任何照片都能使用。請使用自己的照片或已取得明確許可的素材,並確認目前平台對真人照片、身分驗證及影片生成的規則;若不支援,改用虛構人物的文字描述。
Q4:只在提示詞寫歌曲名稱,能讓影片精準卡點嗎?
不能保證。模型不一定能取得該歌曲的原始音訊或理解正確拍點。若入口支援音訊參考,可依規則提供音檔;需要精準卡點時,仍應在剪輯中對照實際音檔調整,並確認音樂授權。
Q5:舞蹈越複雜,生成影片就會越專業嗎?
不一定。短片內放入太多手勢、轉身、換景和運鏡,可能讓動作難以銜接。先完成 4–6 組清楚的主要動作,再一次增加一種技巧,通常更容易比較結果。