HappyHorse 1.0 評測:提示、用例與免費試用
HappyHorse 1.0 是阿里巴巴的開源 AI 影片模型:在單次生成中同步輸出畫面與聲音(對白、音效與環境聲),時長約可達 15 秒、1080p。它已在 PixVerse 與 Seedance 2.0、Kling、Veo、Sora 2、PixVerse V6 同平台可用,便於同帳號下對比成片。
本文介紹提示寫法、已知侷限與六組可直接複製的提示詞。淘天未來生活實驗室已宣佈完整開源棧——基礎模型、蒸餾版、超解析度模組與推理程式碼;權重與許可以專案公開時間表為準——計劃自託管時請檢視下文倉庫連結。
提示: 限時活動期間,PixVerse 上的 HappyHorse 1.0 對 Pro、Premium 與 Ultra 會員符合條件的生成免收積分——不會從帳戶積分中扣減,可在優惠期內零積分成本體驗聯合音影片輸出。活動結束後將恢復應用內的常規積分計費。
Try HappyHorse 1.0 Free on PixVerse!

要點速覽:
- 單次生成內原生聯合音影片(含對口型等已支援語言)。
- DMD-2 蒸餾路徑目標為無分類器引導的約 8 步去噪,在強 GPU 上追求更快推理。
- 已上線 PixVerse(Pro 及以上);限時內符合條件的 HappyHorse 生成免扣積分;活動結束後與目錄內其他模型共用積分池。
HappyHorse 1.0 是什麼?
社群資料將 HappyHorse 1.0 描述為約 150 億參數的統一自注意力 Transformer:共 40 層「三明治」佈局——首末各 4 層按模態處理嵌入與解碼,中間 32 層在文本、影像、影片與音訊 token 構成的單一序列上共享權重。據稱沒有獨立音訊子模組、無專用交叉注意力分支;多頭 sigmoid 門控穩定多模態聯合訓練,且棧內不顯式使用 timestep 嵌入,而從潛變數噪聲水平推斷去噪狀態。
蒸餾: DMD-2 變體將推理壓向無分類器引導的約 8 步去噪——公開材料稱在 NVIDIA H100 上約 38 秒可出 1080p,短 256p 預覽約 2 秒。
釋出狀態: 已公佈套裝含基礎模型、8 步蒸餾版、超解析度模組與推理程式碼。專案列於 github.com/FreeyW/HappyHorse。截至撰稿,預設樹中尚未提供已釋出權重與可執行推理——在規劃本地部署前請核對最新 tag 與 README。許可條款以官方為準。
HappyHorse 1.0 一覽
| 規格 | 詳情 |
|---|---|
| 參數量 | ~15B |
| 架構 | 統一自注意力 Transformer(40 層,三明治佈局) |
| 模態 | 文本、影像、影片、音訊——單一 token 序列 |
| 原生音訊 | 聯合音影片(對白、擬音、環境聲) |
| 口型同步語言 | 6 種(英語、普通話、日語、韓語、德語、法語) |
| 蒸餾 | DMD-2——8 步,無 CFG |
| 1080p 生成耗時 | H100 上約 38s |
| 256p 預覽 | 約 2s |
| 最長時長 | 3–15 秒(預設 5s) |
| 畫幅比(T2V) | 16:9、9:16、1:1、4:3、3:4 |
| 文字轉影片 | 支援 |
| 圖片轉影片 | 支援 |
| 開源 | 已宣佈(權重尚未釋出) |
HappyHorse 1.0 如何對比:基準與定價
HappyHorse 1.0 排名如何?
Artificial Analysis Video Arena 是被引用最多的公開 AI 影片模型基準,通過盲測兩兩投票計算 ELO。注意排行榜是動態的——隨新票與模型更新而變化,請以即時榜單為準。
HappyHorse 1.0 在文字轉影片與圖片轉影片榜單上均迅速接近榜首,與 Seedance 2.0、Veo 3.1、Kling 3.0 等閉源前沿模型直接競爭;其圖片轉影片分數尤其受關注,在平台上創下歷史高位之一。對開源模型而言,相較此前 LTX-2 Pro 與 Wan 2.2 所代表的水平,這是一次顯著躍升。
HappyHorse 1.0 與其他人工智慧影片生成器相比如何?
| 功能 | HappyHorse 1.0 | Seedance 2.0 | PixVerse V6 | Kling 3.0 | Veo 3 | Wan 2.2 |
|---|---|---|---|---|---|---|
| 原生音訊 | 聯合生成 | 聯合擴散 | 支援 | 支援 | 空間音訊 | 否 |
| 參數量 | ~15B | 未披露 | 未披露 | 未披露 | 未披露 | 14B |
| 開源 | 是(已宣佈) | 否 | 否 | 否 | 否 | 是 |
| 取樣步數 | 8(無 CFG) | ~25–50 | — | — | — | ~50 |
| 最高解析度 | 1080p | 2K | 1080p | 4K | 4K | 1080p |
| 口型語言數 | 6 | 7+ | — | 多 | — | 0 |
| 圖片轉影片 | 支援(首幀) | 支援 | 支援 | 支援 | 支援 | 支援 |
| 當前是否可獲權重 | 否 | 否 | 否 | 否 | 否 | 是 |
紙面上的核心差異是「原生聯合音影片生成」與「開源可得性」的結合:Wan 2.2 開源但只出無聲影片;Seedance 2.0 與 Veo 3 有音訊但閉源;HappyHorse 1.0 試圖兩者兼得——首個宣稱具備原生聯合音影片的開源路線。
HappyHorse 1.0 的價格是多少?
作為一個開源模型,一旦權重發布,HappyHorse 1.0 將可以免費自行託管——儘管您需要有能力的硬體(NVIDIA H100 或用於全速推理的同等產品)。阿里巴巴還通過其 Dashscope 平台向國內和國際端點提供 API 存取。
在 PixVerse 上,HappyHorse 1.0 面向 Pro、Premium 與 Ultra 會員開放。標準計費為按積分共享計價,與 Seedance、Kling、Veo 及平台上其他模型共用同一積分池,無需單獨訂閱。
| 訪問方式 | 成本 | 要求 |
|---|---|---|
| 自託管(權重發布後) | 免費(僅需硬體) | NVIDIA H100 或同等算力 |
| 阿里雲 Dashscope API | 按次計費(見 Dashscope) | API 金鑰與接入 |
| PixVerse | 積分制(共享池);上線推廣期:符合條件會員可免費生成 | Pro、Premium 或 Ultra |
在上線推廣期內(截至 2026 年 5 月 7 日),符合條件的 HappyHorse 1.0 生成在 PixVerse 上不扣積分。推廣結束後,將按應用內標準積分費率計費。
HappyHorse 1.0 擅長什麼?
原生聯合音影片生成
這是定義級能力。單一統一 Transformer 在同一序列中對影片 token 與音訊 token 去噪。對白、擬音與環境聲一次生成,並與畫面天然對齊。對創作者而言,省去整條後期鏈路:無需單獨錄對白、無需口型工具、無需為生成片段手工做聲音設計。
快速推理
得益於 DMD-2 蒸餾,8 步去噪、無分類器引導。據報道 H100 上 1080p 約 38 秒,256p 預覽約 2 秒。多數競品需 25–50 步取樣,同分辨率往往要數分鐘。
多語言口型同步
原生訓練覆蓋 6 種語言:英語、普通話、日語、韓語、德語、法語。一套權重覆蓋全部——無需按語言換模型或後期配音。對跨市場投放的品牌尤為重要。
文字轉影片與圖片轉影片
HappyHorse 1.0 同時支援文字轉影片與圖片轉影片。圖片轉影片可上傳參考圖(首幀),文字轉影片則輸入文本。在 PixVerse 上通過同一介面中的 T2V / I2V 模式訪問——無需在多個平台或工具間切換。
開源承諾
阿里巴巴已宣佈釋出範圍包括基礎模型、8 步蒸餾版、超解析度模組與推理程式碼。若許可如所述允許商用,HappyHorse 1.0 將成為首個具備原生聯合音影片的開源模型——對需要自託管方案的研究社群與獨立創作者具有里程碑意義。
HappyHorse 1.0 有哪些侷限?

權重尚未釋出。 截至本文撰寫,尚無模型權重、推理程式碼或官方倉庫。本文內容基於公開報道規格與 Artificial Analysis 競技場的社群觀察。正式發版後請重新評估所有能力宣告。
單條最長 15 秒。 輸出時長 3–15 秒(預設 5 秒),適合社交短片、廣告與簡短產品演示,但限制長敘事。多鏡頭序列需在外部處理——與原生支援時間線式多鏡頭的 Seedance 2.0 不同。
無多模態參考體系。 Seedance 2.0 最多接受 12 個參考資產(9 圖、3 影片、3 音訊)並通過 @ 標籤精細控制。HappyHorse 1.0 處理文本與影像輸入,尚無影片或音訊參考條件的公開報道,依賴視覺參考的工作流控制力受限。
音訊質量尚未大規模驗證。 聯合音影片是主打宣傳能力,但尚無法進行獨立大規模測試。社群樣片有潛力但樣本有限。在複雜對白、精細擬音節奏與多源環境聲上,在廣泛可用前請預期波動。
未宣佈微調或 LoRA 支援。 若需要基礎模型未覆蓋的特定品牌視覺或風格,只能依賴提示工程。社群微調工具鏈可能在權重發布後跟進,目前暫無。
許可條款未知。 雖描述為開源且允許商用,但具體許可證未公佈。在官方許可確認前,請暫緩商用部署規劃。
HappyHorse 1.0 優缺點一覽
| 優點 | 缺點 |
|---|---|
| ✅ 原生聯合音影片一次完成——無需後期配音 | ❌ 模型重量尚未公佈 |
| ✅ 8 步推理(1080p 約為 38 秒)— 比大多數競爭對手快 3-6 倍 | ❌ 每個剪輯最長 15 秒 — 無原生多重鏡頭 |
| ✅ 一組權重的 6 種語言口型同步 | ❌沒有多模態參考系統(僅限文本+影像) |
| ✅ 宣佈開源版本(基礎+蒸餾+超解析度+程式碼) | ❌ 音訊質量未經大規模驗證 |
| ✅ 一種模型中的文本到影片和影像到影片 | ❌ 尚無微調或 LoRA 支援 |
| ✅ T2V 和 I2V 的頂級競技場排名 | ❌ 許可條款尚未確認 |
如何為 HappyHorse 1.0 寫提示詞
多數 AI 影片提示詞指南只講畫面——主體、動作、鏡頭、光線。HappyHorse 1.0 原生生成音訊,提示策略也應隨之調整。以下是如何在「能聽」的模型上榨出上限。
音訊優先
HappyHorse 1.0 最大的轉變是:聲音不是事後補丁,而是與影片在同一前向中生成。提示詞裡對音訊的描述應像對畫面一樣明確。
僅視覺提示(可用,但音訊靠運氣):
一位廚師在餐廳後廚準備意麵。暖光、中景、淺景深。
兼顧音訊的提示(發揮 HappyHorse 聯合生成):
廚師在滋滋作響的平底鍋中翻炒意麵,火焰短暫躍過鍋沿。他以利落快速的動作裝盤。先特寫鍋具,再切到中景,將盤子滑過檯面。暖色餐廳光、淺景深。音訊:油在滋滋作響、鍋在爐架上刮擦、瓷盤落在大理石臺面上的輕響、背景廚房交談聲。
第二版為模型提供了明確的音訊目標,便於與畫面對齊同步。
使用具體鏡頭語言
HappyHorse 對電影化指令有響應。具體術語結果更可預期;籠統說法會讓模型「猜」。
| 鏡頭術語 | 典型效果 |
|---|---|
| Slow push-in | 緩慢推向主體,蓄積張力 |
| Tracking shot | 鏡頭橫向或從後方跟隨主體 |
| Low-angle | 低機位仰拍,強化體量或力量感 |
| Macro close-up | 極近細節、淺景深 |
| 360-degree orbit | 環繞主體完整旋轉 |
| Aerial/drone shot | 鳥瞰視角帶前移 |
| Whip pan | 快速橫搖在兩個主體間切換 |
「從中景緩慢推軌至特寫」告訴模型確切動作;「電影感」幾乎不提供資訊。
分層描述音訊
分三層描述音訊以獲得更強控制:
- 前景:主導聲(對白、主要音效如刀劍碰撞或引擎轟鳴)
- 中景:次要聲(腳步、布料摩擦、餐具碰撞)
- 背景:環境質感(人群低語、雨聲、遠處車流、風聲)
示例:「音訊:烤架上的滋滋油聲(前景)、小販用鏟子在金屬上刮擦(中景)、夜市人群低語與遠處摩托引擎(背景)。」
模型在單一序列中同時處理音訊與影片 token。音訊描述越精確,輸出對齊越好。
風格錨點鎖定畫面一致性
明確點名美學,並堆疊描述詞以鎖定一致畫風:
- 寫實:「變形寬銀幕焦外、35mm 膠片顆粒、青橙調色、淺景深」
- 動漫/風格化:「賽璐璐陰影、粗線描、扁平高飽和色、新海誠式配色」
- 復古/懷舊:「1990 年代 VHS 顆粒、過飽和暖色、CRT 掃描線」
- 商業:「棚拍光、白色無影牆背景、產品攝影、微距鏡頭」
7 條提示詞技巧速覽
- 把主體與動作前置——前 15 個詞對模型注意力影響最大。
- 明確寫音訊——對白用引號,點名具體聲音,分前景/中景/背景。
- 用具體鏡頭指令——「從中景緩慢推軌至特寫」永遠勝過「電影感」。
- 點名視覺風格——引用具體美學、膠片型號、色盤或藝術傳統。
- 加入物理細節——「雨打在玻璃上」「絲綢隨風飄」「蒸汽穿過霓虹」給模型錨點。
- 控制在約 100 詞以內——足夠具體,又避免 token 互相搶注意力。
- 先低解析度迭代——在 480p 或 256p 驗證概念再上 1080p。
HappyHorse 1.0 用例:我們測試的 6 個提示
我們通過 PixVerse 上的 HappyHorse 1.0 執行以下每個提示來評估真實世界的輸出質量。下面嵌入的影片結果是實際的模型輸出 - 不是精心挑選或後處理的。每個提示都針對一個用例,其中本機音訊影片生成具有最大的實際差異。
1. 短影片社交內容
適合誰:需要原生聲音、不想單獨走配音流水線的 TikTok、Reels、Shorts 創作者。
可期待什麼:滋滋作響的街頭美食片段,ASMR 級音訊——能在任意社群平台截停劃屏的內容。
提示詞:
A Thai street food vendor cracks two eggs onto a sizzling flat-top griddle, tosses in chopped scallions and bean sprouts with a metal spatula. Oil pops and splatters. Steam rises through golden string lights above the cart. Close-up macro shots alternate with a medium shot showing the vendor’s confident hands. Night market crowd murmurs in the background. ASMR food photography style, shallow depth of field, warm tungsten lighting, handheld camera with subtle movement. Audio: sizzling oil and egg whites hitting the grill, sharp spatula scrape on metal, distant crowd chatter and a motorbike passing.
看什麼:音訊應在鏟動節奏上呈現令人滿足的滋滋與刮擦,人群環境聲填補空隙。這類片段在美食內容社群極易傳播——純感官滿足、無需畫外音。
2. 行銷與廣告創意
適合誰:需要高轉化產品預告片、電影化動效與精準音訊的廣告公司、品牌方與產品團隊。
可期待什麼:奢侈品級產品揭幕鏡頭,音訊卡點與畫面動作嚴絲合縫——在早期概念測試中可替代部分 3D 渲染或棚拍。
提示詞:
A luxury chronograph watch sits on a slab of dark volcanic stone. Water droplets fall in slow motion onto the sapphire crystal, each impact sending tiny ripples across the glass. The camera orbits slowly as the chronograph crown is pressed — the second hand sweeps forward with a precise mechanical click. Macro detail reveals brushed titanium and polished bevels catching a single hard key light from above. Studio product photography, dark background, slow-motion water at a 240fps feel. Audio: individual water droplet impacts on glass, a crisp mechanical click as the crown is pressed, a subtle low-frequency hum that fades to silence.
看什麼:計時秒針啟動時那聲同步的「咔嗒」是成敗關鍵。若音訊與畫面動作精準對齊,則體現了多數無聲影片模型根本無法企及的音影片同步水平——後期配音也很難一次就對。
3. 多語言行銷戰役
適合誰:在英語、中文、日語、韓語、德語、法語市場投放創意、又不想重拍的團隊與代理商。
可期待什麼:角色說出一句對白並自然口型同步——展示單次生成即可在 6 種支援語言中產出「可直接對白」的畫面。
提示詞:
A barista in a cozy specialty coffee shop slides a perfectly layered oat milk latte across a wooden counter. She looks up at the camera with a friendly half-smile and says: “Your usual. Extra foam, zero judgment.” Behind her, an espresso machine hisses softly. Morning light streams through a large window, casting warm stripes across the counter. Medium shot with a slow push-in to a close-up on her face as she speaks. Warm color grading, shallow depth of field, indie film aesthetic. Audio: espresso machine steam hiss, the soft slide of the ceramic cup on wood, her spoken line delivered casually and warmly, faint acoustic guitar from a speaker in the background.
看什麼:對白口型是首要測試。HappyHorse 1.0 宣稱 6 種語言原生口型同步——本提示以英語交付為基線。用其他語言對白重跑同一概念可測跨語言一致性。若唇形、表情與語氣在多語言下都穩定,可省去整套重拍與配音流程。
4. B-Roll 與預演(Previz)
適合誰:需要建立鏡頭、概念素材與帶匹配環境音分鏡的電影、電視與 YouTube 製作人。
可期待什麼:氛圍感十足的建立鏡頭,分層環境音——適合紀錄片、旅行片或敘事專案中的 B-roll。
提示詞:
A lone figure in a red parka walks across a vast Antarctic ice field toward a small research station at twilight. The station’s windows glow warm orange against deep blue polar light. Snow blows horizontally across the frame. The figure pauses, pulls a radio from her belt — breath visible in the freezing air. Tracking shot follows her from behind, then cuts to a wide establishing shot showing the tiny station dwarfed by an enormous glacier wall. Documentary cinematography, cool blue-teal palette with warm interior contrast, steady handheld, National Geographic style. Audio: howling polar wind as a constant bed, rhythmic crunching of boots on packed snow, radio static crackle when she reaches for it, a brief muffled voice from the radio speaker.
看什麼:此處考驗分層環境音。風應持續且佔主導,腳步碾壓雪的節奏應與行走一致,無線電雜音應在伸手拿電臺時成為獨立質感。廣角建立鏡頭考驗大場景空間一致性。此類輸出可直接用作前期概念素材或佔位 B-roll。
5. 電商產品影片
適合誰:需通過圖片轉影片把靜態產品圖變成動態演示的電商團隊與產品行銷。
可期待什麼:產品主打鏡頭將靜態角度變為動態、商業級運動——可替代首版產品內容的部分實拍。
提示詞:
A pair of fresh-out-of-the-box white running shoes sits on a clean concrete surface. The camera starts static, then slowly orbits as one shoe lifts off the ground and rotates in mid-air, revealing the tread pattern, mesh ventilation holes, and a neon green accent stripe along the sole. Soft particles of dust drift through a shaft of sunlight hitting the shoe. The shoe sets back down gently. Minimal studio setup, single directional light source from the upper left, clean white-gray background, product catalog photography with motion. Audio: a soft whoosh as the shoe lifts, the faint creak of new rubber flexing, a satisfying muted thud as it lands back on concrete.
看什麼:材質渲染是關鍵——網面是否像網面、橡膠底是否讀出橡膠感、光線與熒光綠點綴是否一致?對電商而言,該工作流可將一張產品圖變為動效資產而無需排期影片拍攝。細微音訊(呼呼聲、橡膠彎折、落地悶響)增添本需聲音設計的質感。
6. AI 研究
適合誰:研究聯合音影片擴散、多模態 Transformer 與統一生成架構對齊邊界的研究者。
可期待什麼:技術上高要求的場景,多路音訊需與不同視覺表演在節奏與空間上保持對齊——用於暴露同步極限的壓力測試。
提示詞:
A three-piece jazz ensemble performs in a dimly lit basement club. A drummer brushes a snare with wire brushes in a steady swing rhythm. An upright bass player plucks a walking bass line, fingers clearly visible on the strings. A saxophone player steps forward into a spotlight and plays a slow, bluesy solo. A single audience member at the bar taps a glass in time with the beat. Smoke drifts through a cone of amber spotlight. Medium wide shot establishing all three musicians, then a slow tracking push-in toward the saxophone solo. Warm amber and deep shadow, 16mm film grain, vintage jazz club atmosphere. Audio: wire brush on snare, plucked upright bass, saxophone melody — all three instruments rhythmically aligned, with the faint clink of the glass tap and low crowd murmur underneath.
看什麼:本提示刻意加大難度:要求生成三種需彼此節奏一致、並與各樂手錶演視覺同步的樂器聲。鋼絲刷應與鼓手手部動作匹配;低音撥絃應與指法對齊;薩克斯音色應跟隨演奏者口型與呼吸。若 HappyHorse 1.0 能較好完成,則表明在開源領域具備真正新穎的多模態對齊水平。
如何在 PixVerse 上使用 HappyHorse 1.0
在 PixVerse 上開始使用 HappyHorse 1.0 只需不到兩分鐘。無需本地 GPU,無需 API 金鑰設定,無需單獨的帳戶 - 只需您可能已用於其他模型的 PixVerse 帳戶。
- 轉到 PixVerse — 開啟 app.pixverse.ai 並登入(或建立免費帳戶)。
- 選擇您的模式 — 選擇 文本到影片 以進行基於提示的生成,或者如果您有要製作動畫的參考影像,則選擇 影像到影片。
- 選擇 HappyHorse 1.0 — 在模型選擇器中,選擇 HappyHorse 1.0。它與 Seedance 2.0、Kling、Veo、Sora 2 和 PixVerse V6 一起出現。
- 寫下您的提示 — 描述您的場景,包括視覺和音訊提示。使用上一節中的提示技巧可以獲得最佳結果。
- 設定參數並生成 — 選擇寬高比(16:9、9:16、1:1 等)和持續時間(最多 15 秒)。點選“生成”並等待大約 30-60 秒以獲得結果。
HappyHorse 1.0 在 PixVerse 上需 Pro 及以上套餐。Basic 與 Standard 不包含。在上線推廣活動期內,符合條件的 HappyHorse 生成不扣積分;結束後每次生成與其他模型一樣從共享積分池扣減。
HappyHorse 1.0 在 PixVerse:模型自由,告別訂閱疲勞
訂閱之痛
模型釋出稿裡很少提到的一個現實是:2026 年,評測 AI 影片模型的成本,幾乎與使用一樣令人頭疼。
Sora 2 的完整訪問需 ChatGPT Pro——每月 200 美元。Kling 自有套餐體系,起價約 10 美元/月。Seedance 2.0 在中國需穿越位元組即夢付費牆,或通過託管平台訪問。Luma、Runway、Hailuo——每個都是一筆月費。若創作者想在選定戰役用模型前認真評測前五名,僅平台訂閱每月就可能花掉 300–500 美元,還沒算最終成片的生成費用。
還不只是錢:五個帳號、五套 UI、五套積分、五套速率與解析度上限。在平台間切換的認知成本是隱性支出,吃掉本可用於創作的時間。
一個平台、所有模型、一筆預算
這正是 PixVerse 模型聚合要解決的問題。Seedance 2.0、Kling、Veo 3.1、Sora 2,以及 HappyHorse 1.0——同一帳戶、同一積分池、同一介面。
實際上:你可以用 HappyHorse 1.0 跑聯合音影片概念,用 PixVerse V6 控鏡頭,用 Seedance 2.0 做多參考精度,用 Kling 3.0 上 4K——然後並排對比,按鏡頭選最優。無需換平台、無需重複訂閱。
這不只是便利:它改變實驗的經濟學。你不必為「試一次某模型」再承擔一層訂閱額外成本;在你已在用的平台上,可把預算轉去更多迭代而非更多登入——在 PixVerse 的 HappyHorse 上線視窗內,符合條件的會員可對這些生成免扣積分。
PixVerse 上線推廣(限時)
限時免費生成:HappyHorse 1.0 已在 PixVerse 上線,在活動結束前,Pro、Premium 與 Ultra 會員符合條件的生成免扣積分,便於將聯合音影片成片與其他模型對比,而無需在該時段為 HappyHorse 消耗積分。
活動截止:2026 年 5 月 7 日
| 時區 | 當地時間 |
|---|---|
| 太平洋夏令時(PDT) | 2026-05-07 00:00 |
| UTC | 2026-05-07 07:00 |
| 北京時間(CST) | 2026-05-07 15:00 |
「模型自由」長什麼樣
| 方式 | 每月評測 5+ 個模型的成本 | 所需帳號數 | 介面切換 |
|---|---|---|---|
| 分散訂閱 | Sora、Kling、Luma、Runway 及新平台合計 300–500 美元+ | 5+ | 5+ 套不同 UI |
| PixVerse | 單一會員(Pro+),積分在所有模型間共享 | 1 | 無——同一介面通吃 |
HappyHorse 1.0 已在 PixVerse 上線,意味著少訂一個平台、少管一個帳號,多一個可與全家桶對標的模型。訪問 HappyHorse 1.0 需 Pro 及以上——Basic 與 Standard 不包含。在上線推廣活動期內,符合條件的 HappyHorse 生成免扣積分。
Try HappyHorse 1.0 Free on PixVerse!
常見問題
HappyHorse 1.0 是什麼?
HappyHorse 1.0 是阿里巴巴開源的 AI 影片生成模型,約 150 億參數。它使用統一自注意力 Transformer,在單次前向中生成最長 15 秒 1080p 影片及同步音訊——對白、音效與環境聲。支援文字轉影片與圖片轉影片。
HappyHorse 1.0 免費嗎?
已宣佈為開源,權重發布後自託管可免費(硬體成本另計)。在 PixVerse 上為模型選項:上線推廣期內,Pro、Premium 與 Ultra 會員符合條件的生成免扣積分;活動結束後恢復常規積分計費——費率以應用內為準。訪問需 Pro 及以上(Basic、Standard 不可用)。
與其他 AI 影片生成器有何不同?
核心差異是原生聯合音影片生成。多數 AI 影片模型只出無聲片,需另配工具做聲音與口型。HappyHorse 在同一次前向中與影片一起生成對白、擬音與環境音,口型在 6 種語言上原生訓練。
口型同步支援哪些語言?
六種:英語、普通話、日語、韓語、德語、法語。部分行銷材料提到第七種(粵語),但技術說明確認的數量為六。口型在模型內原生訓練——非後期疊加。
HappyHorse 1.0 有多快?
在 NVIDIA H100 上使用 DMD-2 蒸餾版:1080p 約 38 秒,256p 預覽約 2 秒。模型僅 8 步去噪、無 CFG;多數競品需 25–50 步且耗時數分鐘。
能用於商業專案嗎?
雖描述為開源且允許商用,但具體許可證尚未釋出。在官方許可確認前,請勿納入商用工作流。在 PixVerse 上的商用遵循平台標準服務條款。
HappyHorse 1.0 與 Seedance 2.0 該選誰?
各有所長。HappyHorse 1.0 聯合生成音影片、8 步推理快,並承諾開源權重。Seedance 2.0 提供更豐富的多參考輸入(最多 12 個資產與 @ 標籤控制)、更高解析度(2K)、片內編輯與成熟製作履歷。二者均在 PixVerse 上可並排對比。
是否有 HappyHorse 1.0 API?
可通過阿里巴巴 Dashscope 平台呼叫 API,含國內與國際端點。在 PixVerse 上可通過標準生成介面使用,無需自行管理 API 金鑰與基礎設施。
哪裡可以線上試用 HappyHorse 1.0?
已上線 PixVerse。可與 Seedance 2.0、Kling、Veo、Sora 2、PixVerse V6 同用——一帳戶、一積分池。需 Pro 及以上;在上線視窗內,符合條件的 HappyHorse 生成免扣積分。詳見 PixVerse。
HappyHorse 1.0 值得嗎?
對於需要在單條管線中同步音影片的創作場景,HappyHorse 1.0 提供了許多競品不具備或需另付費的能力。在 PixVerse 上可無額外訂閱試用——上線推廣截至 2026 年 5 月 7 日,Pro 及以上會員符合條件的生成免扣積分,試跑不消耗對應成片積分。主要限制是開源權重尚未釋出,目前無法自託管。
HappyHorse 1.0 與 Veo 3 — 哪個更好?
HappyHorse 1.0 和 Veo 3 都生成音訊和影片,但它們的優勢不同。 HappyHorse 使用一個統一的 Transformer,通過 8 步推理一次生成音訊和影片令牌,速度更快,架構更簡單。 Veo 3 提供空間音訊並支援高達 4K 解析度,但只能通過 Google 的生態系統獲得。截至 2026 年 4 月,HappyHorse 在 T2V 和 I2V 的人工分析競技場上排名較高,而 Veo 3 受益於與 Google 工具的更緊密整合。在 PixVerse 上,兩者都可用於並行測試。
HappyHorse 1.0 適合初學者嗎?
是的。在 PixVerse 上使用 HappyHorse 1.0 無需技術搭建——寫提示、選參數、生成即可;無需本地 GPU、命令列或 API 配置。文中提示指南與六組可測提示可直接複製改寫。需 PixVerse Pro 及以上;在上線視窗內,符合條件的生成免扣積分。
結語
HappyHorse 1.0 為 AI 影片領域帶來真正新穎的能力:開源路線下的原生聯合音影片生成。公開規格——8 步推理、6 語口型、最長 15 秒 T2V/I2V、約 38 秒 1080p——紙面上極具吸引力。本文提示詞旨在模型已在 PixVerse 可實測的前提下,幫助你判斷成片是否配得上這些宣稱。
HappyHorse 1.0 現已在 PixVerse,你可在我們的 AI 影片生成器 盤點中,與所有其他模型同帳戶、同介面對比——在上線優惠有效期間,符合條件的 HappyHorse 生成不產生積分成本。這才是模型自由:為每個鏡頭選對引擎,而無需在每個門口再付一筆訂閱過路費。