教學

7 個悄悄毀掉你的 AI 影片提示詞的坑

7 個悄悄毀掉你的 AI 影片提示詞的坑

大多數令人失望的 AI 影片片段,問題往往不在模型本身,而在於從影像生成中照搬過來、從一開始就不適用於影片運動的提示詞習慣。一張靜態圖可以承載一大堆形容詞,但一段五秒的影片不行,因為模型同時還要處理時間節奏、鏡頭運動、主體一致性,通常還有音訊。

本指南拆解了七個悄悄破壞 AI 影片生成效果的提示詞習慣,並配以“修改前/修改後”的對比範例,以及在 PixVerse 上的真實生成測試。你可以在 PixVerse 提供的多個模型上對比這些修正方法,包括 Seedance 2.0、HappyHorse 1.0、PixVerse V6、PixVerse C1、Kling O3 和 Kling 3.0。這些底層問題並非某一個模型獨有——它們會出現在大多數 AI 影片生成器上,因為失敗點是共通的:提示詞臃腫、情緒詞模糊、鏡頭指令相互衝突、偽造的負面提示詞、觸發抖動的速度用語、對參考影像的過度描述,以及籠統的質量標籤。

這與“為了簡潔而寫更短的提示詞”無關,而是要讓提示詞裡的每一個字都發揮實際作用。一個搭建良好的提示詞會把重要資訊放在最前面,專注於單一的運動路徑,保護需要保持視覺一致的元素,並把模糊的審美用詞換成模型真正能“看見”的語言。


我們是如何設定這些測試的

下面的每個示例都在 PixVerse 上以相同的設定生成:相同的基礎生成參數,且每個片段都開啟了音訊。我們並不是想展示某個模型的特定技巧——重點是在保持環境其餘部分不變的情況下,單獨觀察提示詞本身發揮了什麼作用。六個片段以 1280x720 的橫屏比例執行;參考影像示例以 720x1280 的豎屏比例執行,因為該案例依賴於一張豎版商品圖。每個輸出都包含聲音。

我們從工作型提示詞需要滿足的六個方面來評判每個結果:指令遵循度、運動清晰度、主體一致性、鏡頭穩定性、音訊可用性,以及這段片段是否能真正用於部落格文章、廣告草案、路演演示稿或教程。

這些都是刻意選取的跨模型通用準則。目前大多數影片生成器都有相同的痛點:隨時間推移出現的漂移、模糊不清的運動提示、不穩定的鏡頭路徑,以及相互暗中衝突的指令。

關於本文提到的具體模型的更多資訊,請參閱我們的 Seedance 2.0 評測、HappyHorse 1.0 與 Seedance 2.0 對比,以及 Kling 3.0 詳解。如果你正在把提示詞測試整合進生產流程,我們的 AI 影片生成指南 介紹瞭如何自動化文字轉影片和圖片轉影片的工作。


坑一:把提示詞長度當作“控制力”的替代品

新增更多描述感覺上應該能給模型更多可發揮的素材。但實際上,一個過載的提示詞通常會把最重要的那條指令給淹沒掉。開頭一句話承載著最重的分量;堆在它後面的一切都在爭奪模型的注意力,而不是在強化核心思路。

這種情況長這樣:

優雅工作室中的一瓶奢華香水瓶,美麗的燈光,電影感反射,高階商業質感,昂貴材質,柔和粒子,流暢運動,精緻氛圍,高品質,細膩紋理,戲劇性的鏡頭運動,情感敘事,奢侈品牌氣質,逼真玻璃,金色液體,閃耀高光,慢動作,優雅陰影,完美構圖,無失真,無閃爍,無畸形,無雜亂背景,無多餘物體,專業影片,爆款廣告風格。

這讀起來很詳盡,但幾乎每一句話要麼模糊,要麼在重複前面的意思。模型必須在運動、燈光、氛圍、反射、粒子效果和一堆質量標籤之間做選擇——而真正的主體卻在這堆噪音裡迷失了。

為什麼會失敗: 影片模型是按順序閱讀文本的,關於核心動作最清晰的訊號往往能在整個片段時長裡保持得最好。片段越長,這一點就越重要,因為時間連貫性本身對模型已經是不小的挑戰。這與 OpenAI 提到的影片模型仍然難以精確處理物理規律和因果關係的觀點相吻合——在核心思路後面堆砌薄弱的指令,並不會帶來額外的控制力,只會增加噪音。

修正方法: 追求 50-80 個詞的緊湊結構——第一句寫主體、動作和地點,第二句寫鏡頭和風格,第三句寫約束條件。

一瓶透明玻璃香水瓶立在黑色大理石上,溫暖的輪廓光穿過金色液體。瓶子做了一個展示性的小幅轉動,露出一點側邊,然後重新回到居中位置。鏡頭從標籤高度緩慢微距推近至瓶蓋,奢華的工作室燈光,柔和的金色微塵在瓶子後方飄動。最終定格在穩定的居中畫面,無文字疊加,無多餘物體。音訊:細微的玻璃移動聲,柔和的工作室環境音。

測試: PixVerse,5 秒,720p,16:9,開啟音訊以呈現玻璃移動聲和工作室環境音。我們想看看一個緊湊的提示詞,能否在不讓核心動作被淹沒的情況下,同時保住產品身份、剋制的運動、燈光和鏡頭控制。

在結果中,瓶子在整個推近過程中始終保持居中,金色液體透過玻璃清晰可見,溫暖的背光營造出高階氛圍,而這一切並非靠某個形容詞硬撐起來。簡短的提示詞並不等於模糊的提示詞——一個包含單一主體、單一克制動作、單一鏡頭運動和幾條真實約束條件的緊湊指令,始終優於一長串零散的偏好羅列。


坑二:把“電影感”當作質量開關來用

“電影感”幾乎出現在每一條 AI 影片提示詞裡,但它也是最沒用的詞語之一。它既可以指恐怖片式的燈光,也可以指浪漫的黃金時刻,還可以指粗糲的紀錄片寫實感、科幻朦朧感,或者其他十幾種彼此毫無共通之處的電影風格。

這種情況長這樣:

一名退休偵探在雨夜的小巷中行走。電影感,專業,戲劇性,電影級質感。

這隻給了模型一種情緒,而不是具體的畫面風格。輸出結果可能從陰暗粗糲到明亮光鮮,你完全無法預測最終會是哪一種。

為什麼會失敗: “電影感”這類寬泛的詞,關聯著訓練資料中龐大且互不相關的片段。除非你說出具體的視覺語言——燈光設定、鏡頭質感、構圖方式、鏡頭運動或某種特定的導演風格——否則模型無從判斷你腦海中“電影感”到底指的是哪一個分支。Runway 的 Gen-3 Alpha 研究也印證了同樣的方向:高度描述性、時序密度高的字幕,效果始終優於模糊的風格標籤。

修正方法: 把“電影感”替換成具體的東西——一種燈光設定、一種鏡頭特性、一條構圖規則,或一套色彩方案。

一名穿著深色長風衣的退休偵探走在雨水浸溼的夜間小巷中。鏡頭從遠景緩慢推近至中特寫,紅藍霓虹燈映在溼潤的鵝卵石路面上,沿小巷的單點透視構圖,來自實景霓虹招牌的變形寬銀幕鏡頭光斑,香菸煙霧掠過他的臉龐。音訊:雨落在路面上的聲音,遠處的車流聲,柔和的霓虹嗡鳴聲。

測試: PixVerse,5 秒,720p,16:9,開啟音訊以呈現雨聲和城市環境音。我們想看看,指明具體的電影元素是否比單獨使用“電影感”這個詞更能產生穩定的氛圍。

結果之所以有效,是因為提示詞說出了模型真正能夠呈現的東西:溼潤的鵝卵石、霓虹反光、沿小巷的單點透視、緩慢的推近鏡頭、黑色電影式的燈光。偵探始終是視覺錨點,而小巷的縱深和彩色招牌共同營造出氛圍。這段片段之所以有電影質感,是因為提示詞描述了畫面應該呈現的樣子——而不是因為它借用了一個流行詞。


坑三:在一個鏡頭裡堆疊多種鏡頭運動

AI 影片模型能相當好地遵循鏡頭指令,但前提是隻有一個主導的運動方式。如果堆疊多個鏡頭指令,通常會得到抖動、漂移,或片段中途出現不想要的轉場。

這種情況長這樣:

一列微型磁懸浮列車穿過一座玻璃暖房城市。鏡頭推近,向左平移,繞列車旋轉拍攝,向上傾斜穿過苔蘚塔樓,並加入手持晃動效果。

這讀起來像一個真實的電影運鏡,但對於生成而言,這是五個各自獨立、相互爭奪優先順序的空間向量。模型要麼必須給它們排序,要麼必須混合它們,而這兩條路徑通常都會產生明顯的不穩定。

為什麼會失敗: 推近、平移、環繞、傾斜和手持晃動各自描述的是不同方向的鏡頭運動。把它們堆在一起,模型就必須猜測哪一個應該佔主導,以及何時切換到下一個——而這個切換點通常正是抖動出現的地方。像 Direct-a-Video 和 MotionCtrl 這樣的鏡頭控制系統研究,正是出於這個原因刻意把鏡頭運動和物體運動分離開來:一條提示詞不應該同時承載五個鏡頭向量。

修正方法: 選定一個主要的鏡頭運動,最多再疊加一個紋理性的補充效果。

一列微型磁懸浮列車在實驗臺上的玻璃暖房城市中穿行,途經苔蘚塔樓和凝結著水珠的玻璃牆。鏡頭:一次平滑的橫向跟拍運動,與列車平行,僅加入輕微的手持質感。列車在背景滑過的同時始終保持居中。音訊:柔和的電流嗡鳴聲,細微的軌道震動聲,水珠滴落在玻璃上的聲音,低沉的環境音。

測試: PixVerse,5 秒,720p,16:9,開啟音訊。這個場景充滿了誘人的鏡頭混亂元素——玻璃反射、微縮建築、凝結水珠、移動的列車、微距尺度——這使它成為檢驗單一橫向跟拍運動能否在背景負責製造運動能量的同時,讓一個小主體保持清晰可辨的絕佳壓力測試。

這個結果是整組測試中最乾淨的之一。列車在畫面底部始終清晰可辨,而覆蓋著苔蘚的暖房在其後方營造出視差和縱深感。由於提示詞堅持單一的橫向運動,而不是堆疊推近、平移、環繞和傾斜,鏡頭從未與自身“打架”。


坑四:寫出根本不存在的負面提示詞

不少創作者把 Stable Diffusion 的習慣帶進了影片提示詞寫作中,寫出諸如“negative: 抖動、扭曲的四肢、閃爍、變形”這樣的句子。大多數 AI 影片生成器並沒有真正的負面提示詞欄位——那些文字只是又多了一段普通提示詞。

這種情況長這樣:

一名鐘錶匠在臺燈下修理一個懸浮的發條立方體。Negative: 抖動、糟糕的手部、扭曲的手指、閃爍、變形、損壞的齒輪、不穩定的燈光。

這實際上可能讓情況變得更糟。模型仍然會把“抖動”“扭曲的手指”“變形”當作文本來讀取,非但不會排除這些概念,反而可能引入你原本想要避免的那些聯想。

為什麼會失敗: 除非介面提供了專門的負面提示詞輸入框,否則你輸入的一切都會被當作正面指令處理。模型內部並沒有把“negative:“當作硬性排除條件的內建概念——如果你想要穩定的效果,就需要直接描述你想要的穩定狀態。

修正方法: 把每一條負面表述都轉換成陳述期望狀態的正面約束。

一名鐘錶匠用黃銅鑷子把一枚透明齒輪放入一個懸浮在溫暖檯燈下的微型發條立方體中。鏡頭從雙手緩慢推近至立方體。雙手動作自然,齒輪邊緣保持清晰,立方體保持居中,溫暖的燈光始終保持穩定、無閃爍。音訊:黃銅鑷子的咔嗒聲,微小齒輪的滴答聲,安靜的工作室環境音。

測試: PixVerse,5 秒,720p,16:9,開啟音訊以呈現細微的機械聲和工作室環境音。手部、微小齒輪和透明邊緣都是容易出現瑕疵的高風險區域,這讓它成為檢驗陳述式約束是否真的能減少可見錯誤、相比負面清單更有效的有用測試。

鑷子、透明立方體和齒輪細節在臺燈下都保持了清晰的視覺分離。手部離鏡頭很近,足以對模型構成壓力測試,但直接陳述目標行為——自然的手部動作、清晰的邊緣、穩定的燈光——比一份可能重複你想要避免的那些詞語的負面清單,給出了更乾淨的結果。


坑五:把“快”當作速度指令來用

當你想表達速度時,“快”感覺是最直白的詞,但它往往會把影片生成推向不穩定的方向——尤其是當提示詞裡已經包含複雜動作、鏡頭運動或多個移動元素時。

這種情況長這樣:

一名長板滑手快速衝下山路,快速鏡頭,急轉彎,快速運動模糊,動感速度,激烈動作,快速運動。

現在主體、鏡頭、特效和場景節奏都被要求同時加速,模型必須在這種壓力下同時保持解剖結構、物體形狀、鏡頭路徑和背景連貫性。

為什麼會失敗: 速度不只是一個風格詞——它是一種時間性要求。與其要求“快”,不如描述讓速度可見的物理證據:壓縮的姿態、飛濺的水花圖案、拉伸的背景軌跡、受控的鏡頭取景。

修正方法: 把“快”換成具體的運動物理細節。

一名下坡長板滑手在溼滑的山路彎道中壓低身體過彎,膝蓋壓縮,後手懸在距地面幾英寸的瀝青上方。每個輪子都向外甩出一道細薄的水花,路邊的反光標誌被拉伸成柔和的背景軌跡。鏡頭在板子旁保持低角度,以一次穩定的跟拍完成。頭盔和夾克保持穩定。音訊:車輪的嗡鳴聲,溼路面的嘶嘶聲,風壓聲,一次板子的轉向聲。

測試: PixVerse,5 秒,720p,16:9,開啟音訊。這裡要驗證的問題是:物理運動語言能否在不要求模型同時加速五個元素的情況下,傳達出速度感。

結果通過物理證據而非“快”這個詞來呈現速度:低角度鏡頭、溼路面的反光、壓縮的騎行姿態和水花飛濺共同作用,讓下坡過程感覺迅速,同時又完全保持騎手和滑板的清晰可辨。


坑六:重新描述你已經上傳的參考影像

對於圖片轉影片的工作而言,把上傳照片中已經可見的一切都再重複一遍會造成衝突。如果影像中已經展示了一個聚光燈下的結構化黑色手提包,而你的提示詞又用略有不同的措辭再次描述同一個包,模型現在對同一個主體收到了兩條指令——畫素和文字——兩者之間任何不匹配都會招致漂移。

這種情況長這樣(圖片轉影片提示詞):

一個帶弧形提手、銀色卡扣、結構化包身、縫線拼接面板的黑色皮革手提包,坐落在深色工作室背景下的戲劇性聚光燈中。

如果這一切都已經在參考影像裡了,這個提示詞其實是在邀請模型重新詮釋它本應只是簡單保留的細節——輪廓、材質、裝飾元素,甚至背景都有可能因此發生變化。

為什麼會失敗: 參考影像本身已經是一條強有力的指令。重新描述已經可見的主體,等於打開了第二條指令通道,而這條通道未必能與實際畫面逐畫素對齊。在這種情況下,提示詞的任務是覆蓋影像無法展示的部分:運動和鏡頭行為。

修正方法: 對於圖片轉影片,把提示詞限制在三項任務上——運動指令、鏡頭指令、一條一致性規則。

保持參考物體完全不變。在當前取景基礎上加入一次柔和的鏡頭推近,同時一道細窄的高光緩緩掠過可見表面。保留參考影像中確切的輪廓、材質、裝飾細節、背景、燈光方向和構圖。音訊:柔和的展示間環境音,微弱的玻璃共振聲,細微的織物摩擦聲。

測試: PixVerse,5 秒,720p,9:16 豎屏,圖片轉影片,開啟音訊以呈現細微的材質聲和環境音。這之所以有效,是因為參考影像已經定義了這個物體——提示詞刻意避免重新描述顏色、形狀或材質,也沒有要求模型去臆造隱藏的機制細節。

手提包保持了它的輪廓、卡扣位置、提手形狀和皮革質感,深色工作室背景保持完好,而鏡頭和高光則提供了全部的運動。對於以參考影像驅動的產品影片而言,提示詞中的剋制往往比野心更重要。


坑七:在提示詞裡塞滿空洞的質量詞

“驚豔”“美麗”“高品質”“史詩級”“專業”這類詞在 AI 影片提示詞中層出不窮,但它們幾乎不攜帶任何方向性資訊。它們是被貼在太多不同型別輸出上的高頻標籤,無法提供可靠的控制力。

這種情況長這樣:

一個驚豔、美麗、史詩級的節日場景,畫面高品質,運動令人驚歎,專業燈光,構圖完美。

這告訴模型輸出應該是“好”的,卻沒有告訴它在這個具體場景中,“好”到底長什麼樣。

為什麼會失敗: 單單一個“史詩級”就可能意味著壯闊的風景、一場戰鬥、發光的天空、宏大的規模、戲劇性的配樂、慢動作,或者奇幻盔甲。除非把這個形容詞替換成可見且具體的東西,否則模型無從推斷你到底指的是哪一種。

修正方法: 把每一個空洞的形容詞都換成一個具名的、可見的提示——構圖、燈光設定、鏡頭規格、色彩方案、材質表現。

一場夜間風箏節在覆蓋著一層薄薄水膜的白色鹽灘上展開。三隻形似深海生物的半透明風箏漂浮在頭頂,藍綠色的生物熒光肋骨在織物下微微搏動。低角度的緩慢推近鏡頭,從腳踝高度的倒影推至最近的風箏尾部,廣角鏡頭質感,青色與洋紅色的色彩對比,地平線上排列著燈籠。音訊:織物飄動聲,繃緊的線繩振動聲,淺水中的腳步聲,遠處人群的低語聲。

測試: PixVerse,5 秒,720p,16:9,開啟音訊以呈現織物、腳步和人群環境音。目標是看看具體的視覺提示是否比空洞的質量詞更能保持風格的一致性。

輸出保留了核心創意——半透明的生物造型風箏,帶著發光的肋骨,漂浮在鹽灘倒影之上。鏡頭角度比要求的腳踝高度取景略高一些,所以指令遵循度並非完美,但其視覺辨識度遠遠強於單純“美麗的史詩級節日”所能產生的效果。具體的名詞、燈光提示和色彩關係,始終優於審美形容詞。


兩條完整提示詞的拆解

修改前:“製作一段關於未來城市的很酷的電影感 AI 影片。要美麗、逼真、有戲劇性、高品質、能火。”——這同時堆疊了坑二和坑七,卻沒有主體、動作、鏡頭路徑或最終畫面來作為錨點。

修改後:“一段 6 秒的未來城市展示片段。鏡頭低空滑過一條雨溼的街道,藍色全息招牌倒映在路面上。一架快遞無人機貼近鏡頭飛過,隨後升向一座玻璃塔樓。平滑的前向跟拍,冷藍色調,塔樓入口處的暖色燈光,細雨,遠處的車流聲,一次無人機掠過。”

修改前:“一名長板滑手飛速衝下山路,躲避車流,躍過倒下的樹木,穿過火花四濺的場景,切到無人機鏡頭,切到車輪特寫,切到頭盔反光,最後以一個 logo 和煙花收尾,全程 5 秒,快速鏡頭,完美音效。”——這在一個過載的長句裡同時結合了坑一、坑三、坑四和坑五。

**修改後:**上面坑五中提到的同一個長板滑手修正案例——一個動作、一次鏡頭運動、正面約束、具體的音訊提示。

一個可複用的提示詞範本

把這個結構當作你的預設起點:

[主体] + [一个动作] + [地点]。[一种镜头运动] + [具体的风格、镜头、灯光或构图]。[正面约束:什么必须保持稳定,什么应该缺席,是否需要音频]。

示例:“一個陶瓷咖啡杯放在深色木桌上,蒸汽緩緩升起,形成柔和的捲曲。緩慢的微距推近鏡頭,溫暖的鎢絲側光,淺景深,安靜的晨間咖啡館背景。杯子形狀保持穩定,無文字疊加,音訊包含柔和的環境音和細微的勺子碰撞聲。”


總結

更好的 AI 影片提示詞不是更長的提示詞,而是更乾淨的提示詞。把主體、動作和地點放在最前面。用可見、具體的提示替換“電影感”和空洞的質量詞。專注於單一的鏡頭運動。用正面約束取代虛假的負面提示詞。用具體的運動物理細節替換“快”。對於圖片轉影片,讓參考影像發揮它應有的作用,而不是重新描述它。

這些修正方法之所以適用於目前大多數 AI 影片生成器,是因為它們針對的是相同的底層弱點:時間性漂移、模糊的風格取樣、鏡頭抖動、主體不一致,以及過載的運動指令。PixVerse 讓這一切易於付諸實踐,因為你可以在 Seedance 2.0、HappyHorse 1.0、PixVerse V6、PixVerse C1、Kling O3 和 Kling 3.0 之間用同一條提示詞進行測試,而無需切換工具或重建你的工作流。

常見問題

什麼才算是真正好的 AI 影片提示詞? 一個好的提示詞能給模型一個清晰的目標:主體、動作、地點、一種鏡頭運動、可見的風格提示,以及幾條正面約束。“黑色大理石上的玻璃香水瓶,緩慢的展示性轉動,溫暖的輪廓光,穩定的反射”每次都優於“一段電影感的奢華產品影片”。

AI 影片提示詞應該寫多長? 對於大多數文字轉影片提示詞來說,50-80 個詞是一個穩妥的起始範圍。先寫主體、動作和地點,再加上鏡頭運動、燈光、運動細節和音訊。一句模糊的開頭句,很少能靠後面堆更多字來挽救。

為什麼“電影感”作為提示詞效果不好? 它太寬泛,無法指向任何具體的東西。把它換成可見的電影語言——“35 毫米手持質感”“帶霓虹反光的雨夜小巷”“緩慢的推軌鏡頭”“硬朗的背光”“背景中的暖色實景燈”。

AI 影片生成器支援真正的負面提示詞嗎? 有些工具確實提供專門的負面提示詞欄位,但標準的提示詞輸入框通常會把一切都當作指令來讀取。請改為寫正面約束——“雙手保持自然”“鏡頭保持穩定”“背景保持空曠”“產品輪廓保持完整”。

如何在不改變主體的情況下為圖片轉影片寫提示詞? 不要重新描述已經在上傳影像中出現的內容。把提示詞用於影像無法展示的部分——運動、鏡頭行為、燈光變化、音訊,以及一條一致性規則(“保持參考物體完整,加入柔和的推近,保留輪廓和材質”)。

相關資源