零基礎入門 · 小白三千問

AI 生成影片為什麼這麼貴?

上一頁説一張圖兩三毛。影片呢?按秒計價,一秒一塊五到五塊錢——生成一條 10 秒的短影片,夠你和 AI 聊上萬句。為什麼?

一句話回答

因為影片不是「一張圖」,是每秒二十幾張必須連貫的圖,還要配上同步的聲音、合理的物理運動。生成量是圖片的幾十倍,難度還不止翻幾十倍。

拖一拖 · 你要的影片背後是多少張「幀」
我想整一條影片,時長:5 秒
—
要生成的幀(按 24 幀/秒)
—
同樣成本能聊多少次天
—
大致費用(元)
價格按 2026 年 8 月主流影片模型 API 的量級估算(如 Google Veo 3 每秒 $0.2~0.75,帶聲音更貴;國內可靈、即夢按積分折算在同一量級)。上面每個小方塊就是一幀——而且它們不能各畫各的,必須像連環畫一樣嚴絲合縫。
貴在哪 · 不只是「圖多」
🎞️

幀和幀必須「記得住彼此」

人物的衣服顏色、背景裏的杯子、光綫的方向,每一幀都不能變卦。模型要同時「記住」幾百幀的內容互相對齊——這比獨立畫幾百張圖難得多,也是早期 AI 影片人物走着走着會「變臉」的原因。

🍎

物理要合理

蘋果要往下掉、水要往低處流、頭髮要跟着風飄。模型得從海量影片裏「悟」出物理規律,才能不穿幫——這部分能力最燒訓練成本。

🔊

聲音還要對上口型

新一代模型(Veo 3、Sora 2 等)直接生成配音和音效,嘴型、腳步聲、環境音都要和畫面同步——等於同時在做影片和音頻兩份工作,所以「帶聲音」的價格比「無聲」的貴一截。

好消息是:這個價格一直在往下走。就在兩年前,同樣質素的影片還要貴好幾倍。順序也值得記住:先用便宜的文字打磨腳本,再用兩三毛的圖片確定畫面感覺,最後才動用按秒計費的影片——專業團隊都是這麼省錢的。

✅ 這一頁想和你分享的