MiniMax H3 第三條路:先租 GPU,還是該買 RTX 5090?
- 買設備、買點數之外,先租一台用完就下班的 GPU 電腦 -
最近我一直在糾結一個問題:
如果接下來要認真玩 AI 生成影片,我到底要不要買一台地端設備?
原因很簡單。
最近開始研究 MiniMax H3、ComfyUI 這類開源影片生成模型,越研究越覺得有趣。尤其模型開放之後,除了生成影片,也可以自己控制 ComfyUI Workflow、安裝節點、替換模型、調整參數,甚至進一步交給 Codex 這種 AI Coding Agent 自動操作。
問題也跟著來了:硬體怎麼辦?
以我參考的 H3 實測來看,單張 RTX 5090 就能跑起來。聽起來很好,直到查了一下 RTX 5090 的價格……
嗯。
冷靜。
我只是想生成影片,不是準備開礦場。
後來我才發現,這不一定是「買硬體」和「買平台點數」的二選一。中間還有一條路:租一台需要時才開機的 GPU 電腦。
為什麼想玩 MiniMax H3,卻先卡在硬體?
開源影片模型最吸引人的地方,是自由度突然變高:
- 可以修改 ComfyUI Workflow。
- 可以選擇不同模型、量化版本與節點。
- 可以讀取完整 Log,自己找出錯誤原因。
- 可以把生成流程串進腳本、API 或 Agent 工作流。
但自由度通常也代表環境管理成本。CUDA、PyTorch、顯示卡記憶體、模型檔案、Custom Nodes,每一項都可能成為新的排錯題目。
所以真正要比較的,不只是「哪裡生成一支影片最便宜」,而是:
我需要的是一個幫我生成影片的服務,還是一台可以由我自己控制的 AI 工作站?
第一條路:自己買 RTX 5090,換取完整控制權
自己買一台足夠強的電腦,安裝 RTX 5090,再架起 ComfyUI,當然是最自由的方案。
模型放在自己的機器裡,Workflow 自己改,Custom Nodes 想裝多少就裝多少,也不用擔心平台哪一天把某個模型或節點移除。若未來想做:
1 | Codex → ComfyUI → MiniMax H3 → 自動生成影片 |
地端設備的控制權確實最高。
買設備真正貴的,不只有顯示卡
一張 RTX 5090 還需要足以餵飽它的 CPU、主機板、電源、散熱、記憶體與儲存空間。整套設備的前期成本,很快就不是「買張顯卡玩玩看」的等級。
而且還有一個容易被忽略的問題:你花十幾萬買設備,不代表每天都在生成影片。
可能今天研究 H3 三小時,明天忙著上課,接下來三天根本沒碰。GPU 就坐在那裡發呆,但設備的折舊、電力、維護與佔用空間仍然存在。
如果生成需求已經穩定、每天都會使用,這些固定成本可以被大量工作攤平;如果還在探索階段,買設備就未必是最合理的第一步。
第二條路:使用 LiblibAI,省下環境管理成本
我前陣子一直在看 LiblibAI(有些人也會叫它 LibTV)。這種平台最大的優點只有一句話:真的很方便。
不用處理 CUDA,不用自己安裝 PyTorch,不用管理顯示卡記憶體,也不用先下載幾十 GB 的模型。通常只要購買點數、選擇模型、上傳圖片、輸入 Prompt,就可以開始生成。
對一般使用者來說,我仍然很推薦這條路。平台把底層 GPU、模型部署與大部分環境問題包起來,學習成本低很多;如果目標只是「幫我生成一支 H3 影片」,這樣的抽象化非常舒服。
但平台服務和自己的工作站是兩件事
LiblibAI 的取捨也很明確:
- 平台提供什麼模型,基本上就從什麼模型裡選。
- Workflow、Custom Nodes 與參數能改到什麼程度,取決於平台開放的範圍。
- Log、依賴套件與底層錯誤不一定能完整取得。
- 如果想讓 Codex 自己安裝節點、修改 Workflow、讀 Log、修錯誤再重跑,會受到平台介面與 API 能力限制。
因此,LiblibAI 比較像是租用一個「AI 影片服務」;你得到的是快速產出,而不是一台完整可控的 GPU 電腦。
第三條路:租用雲端 GPU,保留 ComfyUI 的自由度
我看到一篇 MiniMax H3 的實測文章後,才意識到原來還有第三種做法:不買 RTX 5090,而是直接租一張。
作者使用 RunPod 開啟 RTX 5090 GPU 主機,掛上 ComfyUI Template,自己下載 MiniMax H3、安裝節點、查看 Log;用完後直接 Terminate。文章記錄的整個上午帳單是 US$2.07。
RunPod 公開頁面在本文整理時顯示的 RTX 5090 價格約為 US$0.99/小時、32GB VRAM。價格、庫存、區域與方案都可能變動,實際使用時仍應以當下頁面為準。
這種模式的核心概念是:
1 | 今天要研究 H3 → 開一台 GPU |
你仍然要自己處理 ComfyUI、模型、節點與 Workflow,但也因此保留了足夠的控制權。對想把 Codex 接進流程的人來說,這更接近「租一台遠端工作站」,而不是使用一個封裝好的生成按鈕。
買硬體、買點數、租 GPU:差異在哪裡?
| 比較項目 | 買 RTX 5090 | LiblibAI | RunPod/Vast.ai |
|---|---|---|---|
| 前期成本 | 高 | 低 | 低 |
| 你取得的東西 | 自己的完整工作站 | AI 生成服務 | 可自行管理的 GPU 主機 |
| ComfyUI 控制 | 完整 | 依平台提供 | 高,依主機與方案而定 |
| 自裝節點、替換模型 | 可以 | 受平台限制 | 可以,仍需自己部署 |
| Log 與錯誤排查 | 完整 | 受平台限制 | 通常較完整 |
| Codex 自動控制 | 很適合 | 取決於平台 API | 很適合 |
| 硬體維護 | 自己處理 | 不用處理 | 由供應商處理主機,環境仍由自己管理 |
| 不使用時成本 | 設備仍然持有 | 依方案與點數規則 | GPU 可不用就不開,但儲存等費用需另外確認 |
| 新手難度 | 高 | 最低 | 中高 |
這張表最重要的差異,不是誰的單價最低,而是「你租到什麼」。
LiblibAI 是租 AI 影片服務。
RunPod 或 Vast.ai 是租 GPU 電腦。
RunPod、Vast.ai、SaladCloud,應該怎麼看?
RunPod:先把環境與 Workflow 玩熟
如果是第一次從平台生成服務轉向自建 ComfyUI,我會先選 RunPod。原因不是它一定最便宜,而是比較符合「開一台機器,自己安裝、自己觀察、自己排錯」的學習方式。
適合先完成這幾件事:
- 確認 MiniMax H3 在目標 GPU 上能否穩定執行。
- 把模型、Custom Nodes 與 ComfyUI Workflow 記錄下來。
- 了解模型載入、生成、輸出與下載各階段的耗時。
- 讓 Codex 能透過腳本或遠端指令執行固定流程。
Vast.ai:更像 GPU 版的 Airbnb
Vast.ai 的特色是 GPU Marketplace,價格會受到供需、主機狀態、地區與租用方式影響。RTX 5090、4090、A100、H100 等不同規格,都可能在市場上找到可租用的主機。
它的彈性與價格可能很吸引人,但選擇主機時需要更仔細檢查 VRAM、磁碟、網路、映像檔、持久化方式與實際可用性。
SaladCloud:價格低,但更適合標準化的容器工作負載
原文整理的公開資訊中,SaladCloud 的 Batch RTX 5090 價格約為 US$0.25~0.294/小時,比 RunPod 公開價格低很多。
不過,價格不能單獨拿來比較。SaladCloud 比較偏向 Container 化的工作負載,不一定適合第一次研究 ComfyUI 時,想登入一台機器慢慢安裝節點、看 Log、修改環境的情境。
我的順序會是:
1 | 先用 RunPod 熟悉環境 |
Codex、ComfyUI 與 H3,可以組成什麼工作流?
這件事情真正讓我興奮的,不只是省下幾美元,而是 GPU 運算可以和 Agent 工作流接在一起。
例如一支 60 秒影片,可以先由 Codex 協助拆解:
1 | 60 秒影片 |
在這個流程裡,Codex 可以負責規劃與執行腳本,ComfyUI 負責節點式生成,雲端 GPU 負責短時間的大量運算,最後再把影片抓回本機完成後製。
本機的 Mac 不需要一直負責暴力運算,只要負責指揮與驗收即可。
多鏡頭 Prompt:減少人力審片,不代表可以省略驗收
原文實測提到,作者原本以為 H3 的 15 秒長影片很容易自己亂切鏡,但在 Prompt 裡加入明確的時間與鏡頭標記後,模型曾按照指定時間切換鏡頭:
1 | [Shot A] At 00:00.000 |
這個結果很值得研究,因為它代表一支 15 秒影片不一定只能服務一個鏡頭。理論上,原本的:
1 | 5 秒 × 12 次生成 |
可能改成:
1 | 15 秒 × 4 次生成,每次包含 3 顆鏡頭 |
GPU 運算量不一定比較少,甚至可能更多;但人只需要先審 4 個 Segment,而不是 12 個短片段。
這裡仍要保留一個重要前提:時間標記是值得測試的 Prompt 策略,不代表每次生成都能完全照做。正式交付前,還是要檢查鏡頭切換、角色連貫性、動作與音畫同步。
用運算時間粗估 AI 影片的邊際成本
假設一支 15 秒影片的生成時間約 5 分鐘,RunPod GPU 價格以 US$0.99/小時粗估:
1 | 5 分鐘 ÷ 60 × US$0.99 |
也就是說,在「GPU 持續運算、只計算 GPU 時間」的理論模型裡,一小時大約可以跑 12 支 15 秒影片,一支影片的 GPU 運算成本約為 US$0.08。
若用原文整理的 SaladCloud Batch 價格區間估算:
1 | 5 分鐘 ÷ 60 × US$0.25~0.294 |
但這些都不是完整製作成本,至少還要納入:
- 啟動主機與載入模型的時間。
- Prompt 測試與失敗重跑。
- 模型下載、磁碟與持久化儲存。
- 上傳、下載與網路流量。
- GPU 閒置但仍在計費的時間。
- 人工審片、剪輯、字幕、配音與配樂。
這個粗估的價值,不是宣稱每支影片只要幾美分,而是讓人看見:當 Workflow 固定下來後,真正需要優化的可能是「讓 GPU 不要等待」以及「讓人不要陪著 GPU 等待」。
三種方案,分別適合什麼人?
完全不想碰技術:選 LiblibAI
如果只想快速生成內容,不想處理 CUDA、模型、節點和環境依賴,LiblibAI 這類平台會是最省時間的選擇。你付費購買的是便利性與整合好的生成服務。
每天大量生成,而且需求已經穩定:計算是否值得買地端
如果每天都要生成、Workflow 長期固定,而且設備會持續使用,地端 RTX 5090 才有機會透過高使用率攤平前期成本。這時候還要把電力、維護、升級與設備折舊納入計算。
想玩最新開源模型,又想讓 Codex 控制流程:先租 GPU
如果和我一樣,想自己改 ComfyUI、安裝節點、替換模型、讀 Log,也不想一開始就投入十幾萬買設備,RunPod 會是一個合理的起點。
等 Workflow、Prompt、模型版本與部署方式都穩定後,再比較 Vast.ai 或 SaladCloud,甚至重新計算是否值得購買地端設備。
我的結論:先租 GPU,再決定要不要買設備
我現在對這三條路的理解很簡單:
- LiblibAI:租用 AI 影片服務,最省環境管理時間。
- RunPod/Vast.ai:租用 GPU 電腦,保留 ComfyUI 與 Workflow 的控制權。
- 地端 RTX 5090:購買長期使用的 AI 工作站,固定成本高但自由度最高。
所以,如果只是偶爾研究模型,我不會急著買 RTX 5090。我會先租 GPU,把完整工作流跑通,並記錄實際的 GPU 使用時間、模型載入時間、失敗重跑比例、儲存費與人工審片時間。
半年後如果真的每天大量生成,再用這些真實數據回頭計算買設備是否划算;如果新模型需要更大的 VRAM,也可以直接更換租用的 GPU,不需要賣二手顯卡、升級電源、換主機板或處理散熱。
我最喜歡這個模式的地方是:把昂貴的 GPU,變成需要時才叫來上班的臨時 AI 員工。
當 ComfyUI Workflow、Prompt、模型與 Codex 自動化都整理好之後,AI 影片製作就不再只是「使用一個 AI 工具」,而可能變成一條可以由 Agent 自動執行的生產線。
真正值得期待的,也許不只是生成一支影片便宜多少,而是 GPU 可以自己跑,人不用陪它跑。
延伸閱讀
- Qwen-Image-Edit 入門教學:不用安裝也能輕鬆玩轉 AI 圖像編輯:先從線上工具理解模型與 ComfyUI 的差異。
- AI 工具名詞全解析:一次搞懂 MCP、Skill 與 CLI 的差異與應用場景:理解 AI Agent 如何透過不同工具執行工作。
參考資料與價格提醒
- MiniMax H3 第三條路|原文實測
- RunPod|RTX 5090 GPU
- LiblibAI|AI 生成/ComfyUI 平台
- Vast.ai|GPU Marketplace
- SaladCloud|Container/GPU 運算
本文中的價格、GPU 規格、生成時間與成本試算,都是根據提供的原文實測與公開頁面資訊整理。雲端 GPU 價格、庫存、方案、儲存與流量費用會隨時間和使用條件變動,實際使用前請以各平台當下公告為準。
常見問答 (FAQ)
Q1:想玩 MiniMax H3,一定要先買 RTX 5090 嗎?
不一定。如果目前仍在研究模型、測試 Workflow,或每週只使用幾個小時,可以先租用雲端 GPU;只有在生成量穩定、長期高使用率時,才值得進一步計算購買地端設備的回本時間。
Q2:LiblibAI 和 RunPod 的本質差異是什麼?
LiblibAI 比較像租用整合好的 AI 影片服務;RunPod 則比較像租用一台 GPU 電腦。前者省去環境管理,後者保留 ComfyUI、模型、節點與 Log 的較高控制權。
Q3:租用雲端 GPU 後,就完全不需要處理技術設定了嗎?
不是。租用 GPU 可以省下購買與維護實體硬體,但你通常仍要處理 ComfyUI、模型下載、Custom Nodes、Workflow、依賴套件、儲存空間與錯誤排查。它的難度低於自行購買整台工作站,但高於直接使用點數平台。
Q4:一支 15 秒影片約 US$0.08,是否就是完整製作成本?
不是。US$0.08 只是以 5 分鐘生成時間和 US$0.99/小時 GPU 價格計算的純運算時間粗估,尚未包含模型載入、失敗重跑、儲存、網路流量、GPU 閒置與人工後製成本。
Q5:為什麼把 60 秒影片拆成 4 段 15 秒,而不是生成 12 段 5 秒?
在某些能理解時間與鏡頭標記的模型中,15 秒片段可以嘗試包含多個 Shot,讓人先審 4 個 Segment,而不是 12 個短片段。這可能降低人工審片數量,但不保證運算量更少,也仍需要檢查鏡頭切換與內容連貫性。