教學

PixVerse 上的 Gemini Omni Flash:分步提示詞工作流

PixVerse 上的 Gemini Omni Flash:分步提示詞工作流

Gemini Omni Flash 是 PixVerse 上可選的影片模型之一,在點選生成之前做一些規劃會帶來明顯更好的效果。本教程將帶你走完一套可重複使用的工作流:選擇輸入型別、鎖定時長與畫幅比例、構建結構化提示詞,並像稽核製作素材一樣檢查輸出,而不是單純依賴運氣。

無論是文字轉影片、圖片轉影片,還是多圖參考生成,你都可以套用同一套流程,然後將結果與 PixVerse 工作臺中的其他模型進行對比,包括 PixVerse V6 和 PixVerse C1,再決定最終使用哪條素材。

開始之前:本教程涵蓋的範圍

PixVerse 目前接入的 Gemini Omni Flash 是一套生成工作流,而不是 Google 在其 API 文件中描述的完整對話式編輯能力。提前瞭解這些邊界,能避免你規劃出模型在 PixVerse 上暫時無法實現的分鏡。

能力 PixVerse 目前是否支援 規劃提示
文字轉影片 支援 適合原創概念和快速創意測試。
圖片轉影片 支援 適合將靜態圖(產品圖、海報、草圖)轉化為動態影片。
參考圖片轉影片 支援,最多 5 張 在提示詞中依次引用為 @image1 到 @image5。
影片時長 3-10 秒 選擇能清晰表達創意的最短時長。
輸出規格 720p,16:9 或 9:16 生成前先根據目標渠道匹配畫幅比例。
音訊 由提示詞驅動,與畫面同步 通過文字提示指定環境音、音效或靜音。
自然語言編輯、延展、轉場、影片/語音參考 PixVerse 暫未支援 當這些能力是首要需求時,請使用 PixVerse 的其他模型。

第一步:選擇 Gemini Omni Flash 作為模型

在 PixVerse 生成介面中開啟模型選擇器,如果你的帳號可用,選擇 Gemini Omni Flash。由於 PixVerse 同時提供多個模型,你可以用同一份創意需求先跑一遍 Gemini Omni Flash,再切換到其他模型,看看哪一個更貼合你的具體鏡頭需求。

如果暫時看不到 Gemini Omni Flash,請檢查你的帳號等級和應用內的上線提示——模型可用性和積分消耗可能會調整,因此應以模型選擇器中的即時狀態為準,而非本文的描述。

第二步:確定起始素材型別

你的提示詞策略完全取決於你輸入的素材型別:

  • 文字轉影片——適合沒有現成素材的場景:全新概念、社群媒體短片、快速廣告草稿、講解類畫面。
  • 圖片轉影片——適合已經有一張靜態圖作為場景錨點的情況:產品圖、主視覺、海報、包裝圖。
  • 參考圖片轉影片——適合需要多張圖共同引導結果的場景。最多可上傳 5 張 JPEG/PNG 圖片,並在提示詞中逐一標註(@image1、@image2 等),明確說明每張圖控制的內容——主體、配色、光線、姿態。

第三步:先鎖定時長和畫幅比例

在寫提示詞之前先確定這兩項設定,因為它們決定了提示詞需要承載多少敘事內容。

  • 時長:單個產品動作用 5-6 秒足夠;若要展現起承轉合(人物出場、講解類內容),建議使用 8-10 秒。
  • 畫幅比例:9:16 適用於 TikTok、Reels 和 Shorts;16:9 適用於 YouTube、落地頁和簡報。為不同比例分別單獨生成任務,而不是把一條主素材裁剪成多種比例使用。

第四步:把提示詞寫成一份迷你製作簡報

只描述氛圍(比如“做得高階一點”)給模型的資訊遠不如具體描述場景來得有效。按以下順序逐項填寫:

  1. 主體——畫面中錨定的人物、產品或物體。
  2. 動作——整個片段中實際發生的變化。
  3. 鏡頭——特寫、遠景、推近、環繞、手持、俯拍、固定機位。
  4. 光線與氛圍——日光、霓虹、柔和影棚光、戲劇化、輕鬆愉快。
  5. 環境——地點、道具、天氣、材質、質感。
  6. 音訊——環境音、音效、音樂氛圍,或明確說明“無對白”。
  7. 時間軸——超過 6-7 秒的片段,需要說明每個時間段發生的內容。
  8. 約束條件——需要避免的內容:Logo、多餘文字、場景切換、名人肖像。

可以套用以下範本填空:

製作一段 [時長] [畫幅比例] 的影片。主體是 [具體主體]。動作是 [具體動作]。鏡頭 [運鏡方式與取景]。環境是 [地點、光線、材質、道具]。音訊:[環境音、音效、音樂氛圍,或靜音]。約束條件:[需要保留的內容、需要避免的內容]。

需要單鏡頭時,務必明確說明

如果不加約束,Gemini Omni Flash 可能會在一個片段中切換多個小鏡頭。對於產品鏡頭、時尚動態,或任何切鏡會破壞連貫性的場景,請在提示詞中直接加入“single continuous shot”(單一連續鏡頭)、“no scene cuts”(不切鏡)或“one unbroken take”(一鏡到底)。

每次都要在提示詞中寫明音訊方向

由於音訊是與畫面同步生成的,不要把它交給運氣。描述你想要的環境音或音效(輕微點選聲、房間環境音、人群氛圍),如果片段需要保持無聲,就寫明“無對白”。避免要求特定歌曲、藝人或已知的嗓音風格——改為描述你想要的氛圍。

為多節奏片段新增時間碼

對於包含多個敘事節奏的 8-10 秒片段,加入時間碼指令有助於讓模型貼合你設定的結構:

[0-2 秒] 產品在桌面上定場。 [2-5 秒] 鏡頭推近,光線灑在表面。 [5-8 秒] 產品輕微旋轉,最終定格在乾淨的收尾畫面。

保持在兩到三個節奏點以內——在 10 秒的視窗內塞入過多內容,容易讓模型模糊掉最重要的動作。

說明每張參考圖分別承擔什麼作用

如果使用多張參考圖,含糊不清是最大的問題。請明確說明每一張的作用:

使用 @image1 作為精確的產品參考——保留瓶身形狀、瓶蓋顏色和標籤位置。使用 @image2 僅作為光線和背景氛圍參考。不要沿用 @image2 中的任何 Logo 或人物。

第五步:生成後,以製作人的視角而非粉絲的視角稽核

片段生成後,請對照它需要完成的任務來評判,而不是隻看第一眼的觀感。檢查以下幾點:

  • 主體/產品在全程中是否保持視覺一致?
  • 畫面中的文字是否清晰可讀,還是變形?
  • 音訊是否真正與畫面動作匹配?
  • 最後一幀是否適合作為封面圖或剪輯點使用?

如果用於商業用途,還需要審查版權風險——避免涉及真實人物肖像、品牌 Logo,或可辨識的歌曲、嗓音。想深入瞭解 Gemini Omni Flash 在安全性和水印方面的處理方式,可參考我們的Gemini Omni Flash 綜述。

五個可直接套用的提示詞範例

以下範例可作為起點範本,替換成你自己的產品、主體和約束條件。

範例一:產品圖轉豎版廣告

設定: 9:16,6-8 秒,圖片轉影片或單張產品參考圖。

製作一段 8 秒的 9:16 產品影片,使用 @image1 作為精確的產品參考。保留產品形狀、瓶蓋、顏色、標籤位置和輪廓。產品置於日出時分潮溼的深色石面上。[0-2 秒] 微距特寫表面的水珠。[2-5 秒] 鏡頭緩慢拉遠,暖色光線映照邊緣。[5-8 秒] 產品輕微旋轉並居中定格。音訊:輕柔水珠聲、微弱環境音,無對白。約束條件:無多餘 Logo,無多餘文字,不切鏡。

範例二:科普講解短片

設定: 16:9 或 9:16,8-10 秒,文字轉影片。

製作一段 10 秒的 16:9 講解短片,講述太陽能板如何將陽光轉化為電力,採用深色桌面上的紙藝風格。[0-3 秒] 一個紙質太陽發出溫暖黃色光線射向藍色面板。[3-6 秒] 發光的小點沿繪製的電路移動。[6-10 秒] 一座紙屋輕輕亮起。鏡頭:固定俯拍機位,配合輕微的定格動畫式運動。文字:僅出現“sunlight”、“panel”、“electricity”,拼寫準確。音訊:輕柔的紙張移動聲、一聲輕微鈴聲,無旁白。約束條件:無多餘文字,無人手出現,無 Logo。

範例三:基於參考圖的角色出場

設定: 16:9,8-10 秒,最多三張參考圖。

製作一段 9 秒的 16:9 原創角色出場短片。使用 @image1 作為身份參考——保留臉型、髮型、夾克顏色和整體輪廓。使用 @image2 僅作為光線和城市背景氛圍參考。角色站在黃昏時分的屋頂上,轉向鏡頭,舉起一個發光的小裝置。鏡頭:緩慢中景推近,單一連續鏡頭。光線:藍色黃昏天空,暖色輪廓光。音訊:遠處城市環境音,裝置發出的柔和電子嗡鳴聲。約束條件:僅限原創角色,不涉及任何特許經營內容,無 Logo,無對白。

範例四:應用宣傳迴圈影片

設定: 16:9,6-8 秒,文字轉影片。

製作一段 7 秒的 16:9 AI 規劃應用宣傳迴圈影片。一個半透明的浮動時間線介面懸浮在整潔的桌面上方,抽象卡片和線條排列組合成一份平靜的周計劃。鏡頭:緩慢從左到右滑動,淺景深,單一連續鏡頭。光線:自然晨光,柔和陰影,青色與暖黃色點綴。音訊:輕微的介面點選聲,柔和的環境音調。文字:不出現可讀的應用名稱或任務文字。結尾畫面應與開頭畫面呼應,使片段能夠順暢迴圈播放。

範例五:時尚造型冊動態

設定: 9:16,8-10 秒,參考圖片轉影片。

製作一段 10 秒的 9:16 時尚造型冊短片。使用 @image1 作為服裝參考——保留大衣長度、面料質感、配色和鞋款風格。使用 @image2 僅作為影棚光線參考。一位虛構模特走過混凝土影棚,停頓,一側肩膀轉向鏡頭,大衣隨步伐自然擺動。鏡頭:垂直全身取景,平滑推軌運鏡,不切鏡。光線:左側大型柔光箱。音訊:安靜的影棚環境音,輕柔腳步聲,無對白。約束條件:虛構模特,不涉及名人肖像,無品牌 Logo。

常見問題

我一定要用 Gemini Omni Flash 嗎,還是可以用 PixVerse 的其他模型?

Gemini Omni Flash 只是 PixVerse 提供的眾多選項之一。它非常適合以提示詞驅動的場景,具備同步音訊和多圖參考控制能力;如果你更需要延展、轉場或更長篇幅的編輯功能,在這些能力接入 Gemini Omni Flash 之前,PixVerse 的其他模型可能更合適。

我可以上傳多少張參考圖?

每次生成最多可上傳 5 張 JPEG 或 PNG 圖片,並在提示詞中分別引用為 @image1 到 @image5。

輸出的解析度和時長是多少?

目前 PixVerse 接入的版本輸出 720p 影片,時長 3-10 秒,畫幅比例為 16:9 或 9:16。

能獲得精確的畫面文字嗎?

在提示詞中保持螢幕文字簡短明確(準確用詞,加引號),並預留時間仔細檢查——精確的字型排版目前仍是效果可能有所波動的環節。

目前支援影片延展或轉場嗎?

PixVerse 當前的 Gemini Omni Flash 工作流暫不支援。當延展、轉場或影片/語音參考是首要需求時,請使用 PixVerse 的其他模型。

相關資源

準備好親自嘗試了嗎?在 PixVerse 上生成你的第一個 Gemini Omni Flash 影片。