Hướng dẫn prompt video AI: 7 cách sửa đã được kiểm chứng để có video tốt hơn
Phần lớn prompt video AI thất bại không phải vì thiếu trí tưởng tượng. Chúng thất bại vì những thói quen từng hiệu quả khi tạo ảnh, nhưng lại đổ vỡ khi mô hình phải tạo chuyển động, nhịp thời gian, chuyển động camera, sự nhất quán của chủ thể, và đôi khi cả âm thanh trong cùng một clip.
Hướng dẫn prompt video AI này tập trung vào bảy cách sửa thực tế cho thế hệ video hiện đại. Các mẹo được thiết kế cho những mô hình mà nhà sáng tạo có thể so sánh trên PixVerse hôm nay, gồm Seedance 2.0, HappyHorse 1.0, PixVerse V6, PixVerse C1, Kling O3 và Kling 3.0. Chúng cũng áp dụng rộng rãi cho các trình tạo video AI khác, vì các điểm thất bại là chung: prompt quá tải, nhãn phong cách mơ hồ, chuyển động camera mâu thuẫn, negative prompt giả, từ chỉ tốc độ gây rung giật, lệch khỏi ảnh tham chiếu, và tính từ chất lượng chung chung.
Mục tiêu không phải là làm mọi prompt ngắn hơn hoặc kỹ thuật hơn. Mục tiêu là để mỗi chỉ dẫn xứng đáng có mặt trong prompt. Một prompt text-to-video mạnh cho mô hình biết điều gì quan trọng trước, đưa ra một đường chuyển động rõ ràng, bảo vệ sự nhất quán của chủ thể, và dùng ngôn ngữ hình ảnh cụ thể thay vì những từ chỉ gu thẩm mỹ chung chung.
Nếu bạn cần ảnh tĩnh trước khi viết prompt chuyển động, hãy bắt đầu với hướng dẫn prompt GPT Image 2, rồi đưa khung hình đã duyệt vào image-to-video của PixVerse với một prompt chuyển động riêng.
Thử prompt video AI trên PixVerse
Cách chúng tôi kiểm thử các prompt video AI này
Với bài viết này, chúng tôi tạo cả bảy trường hợp prompt trên PixVerse bằng cùng một thiết lập tạo video cơ sở, và bật âm thanh cho mọi clip. Mục tiêu không phải là quảng bá một mẹo riêng của từng mô hình, mà là tách riêng cấu trúc prompt trong khi giữ môi trường kiểm thử nhất quán. Các video nguồn được tạo khoảng 5 giây mỗi clip; sáu clip dùng đầu ra ngang 1280x720, còn trường hợp ảnh tham chiếu dùng đầu ra dọc 720x1280. Mọi tệp đều có track âm thanh.
Tiêu chuẩn của chúng tôi mang tính thực tiễn hơn là chạy theo bảng xếp hạng. Chúng tôi đánh giá từng video theo sáu tiêu chí sản xuất:
- Bám prompt: Clip có theo đúng chỉ dẫn cốt lõi không?
- Kiểm soát chuyển động: Hành động chính có đọc được mà không rung giật hay sụp đổ hình ảnh không?
- Nhất quán chủ thể: Sản phẩm, người hoặc vật có giữ nguyên hình dạng không?
- Ổn định camera: Đường camera được chỉ định có giữ được sạch không?
- Sẵn sàng âm thanh: Prompt có đưa cho mô hình các tín hiệu âm thanh dùng được không?
- Khả năng dùng trong sản xuất: Clip có thể dùng trong blog, bản nháp quảng cáo, pitch hoặc bài hướng dẫn prompt mà không làm người đọc rối không?
Các quy tắc này được viết như heuristic dùng chung giữa các mô hình, vì hầu hết trình tạo video AI hiện nay cùng chịu những điểm áp lực giống nhau: trôi theo thời gian, chuyển động mơ hồ, đường camera không ổn định, và các chỉ dẫn chủ thể tranh chấp nhau.
Để có bối cảnh mô hình rộng hơn, xem đánh giá Seedance 2.0, so sánh HappyHorse 1.0 và Seedance 2.0, cùng Kling O3 và Kling 3.0 trên PixVerse.
Mẹo 1: Prompt dài hơn cho kết quả tệ hơn, không tốt hơn
Một prompt dài hơn có thể cảm giác an toàn hơn vì dường như cho mô hình nhiều chi tiết hơn. Thực tế, prompt video AI dài thường làm loãng chỉ dẫn chính. Câu đầu mang phần lớn quyền kiểm soát, trong khi các chi tiết phía sau có thể trở thành gợi ý yếu và tranh chấp lẫn nhau.
Lỗi thường gặp: Coi prompt 200 từ là được kiểm soát chặt hơn
Prompt kém:
Lời nhắc video: Một chai nước hoa cao cấp trong studio thanh lịch, ánh sáng đẹp, phản chiếu điện ảnh, vẻ ngoài quảng cáo cao cấp, chất liệu đắt tiền, hạt bụi nhẹ, chuyển động mượt, không khí tinh tế, chất lượng cao, kết cấu tinh xảo, một chuyển động máy quay kịch tính, kể chuyện giàu cảm xúc, năng lượng thương hiệu xa xỉ, thủy tinh chân thực, chất lỏng vàng, điểm sáng lấp lánh, chuyển động chậm, bóng đổ thanh lịch, bố cục hoàn hảo, không méo hình, không nhấp nháy, không giải phẫu sai, không nền rối, không vật thừa, video chuyên nghiệp, phong cách quảng cáo viral.
Prompt này trông chi tiết, nhưng hầu hết chi tiết đều chung chung hoặc trùng lặp. Mô hình phải chọn giữa chuyển động sản phẩm, ánh sáng, phong cách, phản chiếu, hạt, nhãn chất lượng và cách diễn đạt phủ định. Chỉ dẫn cốt lõi bị chôn vùi.
Vì sao cách này thất bại
Mô hình video xử lý văn bản như một chuỗi chỉ dẫn. Hành động cốt lõi càng xuất hiện sớm và rõ, mô hình càng dễ giữ nó xuyên suốt thời gian. Điều này đặc biệt quan trọng với clip dài hơn, khi tính nhất quán theo thời gian vốn đã đòi hỏi nhiều hơn ở mô hình. Nghiên cứu Sora của OpenAI ghi nhận rằng mô hình video vẫn gặp khó với vật lý chính xác và quan hệ nhân quả, nên việc thêm chỉ dẫn yếu sau ý chính không tự động tạo thêm khả năng kiểm soát.
Cách sửa prompt
Dùng cấu trúc 50–80 từ:
Sentence 1: subject + action + location.
Sentence 2: camera + style.
Sentence 3: constraints.
Prompt tốt hơn:
Lời nhắc video: Một chai nước hoa thủy tinh trong suốt đứng trên đá cẩm thạch đen khi ánh sáng viền ấm xuyên qua chất lỏng vàng. Chai xoay trưng bày rất nhẹ, vừa đủ để lộ một cạnh bên thoáng, rồi trở lại vị trí hero ở giữa. Đẩy macro chậm từ chiều cao nhãn đến nắp, ánh sáng sản phẩm studio sang trọng, bụi vàng mềm phía sau chai. Kết thúc bằng khung sản phẩm ổn định ở giữa, không chữ phủ, không vật thừa. Âm thanh: chuyển động thủy tinh tinh tế, tiếng phòng studio nhẹ.
Bài test prompt thực tế
Thiết lập test: tạo video PixVerse với cùng thiết lập cơ sở dùng cho cả bảy trường hợp. Thiết lập tạo: 5 giây, độ phân giải 720p, tỷ lệ khung 16:9, bật âm thanh cho chuyển động kính nhẹ và tiếng phòng studio. Bài test này kiểm tra: một prompt gọn có giữ được nhận diện sản phẩm, chuyển động tiết chế, ánh sáng và kiểm soát camera mà không chôn hành động chính hay không.
Trong bài test quảng cáo sản phẩm này, prompt gọn hiệu quả vì giữ hành động chính dễ theo dõi: chai sản phẩm thực hiện một chuyển động trưng bày tiết chế trong khi camera đẩy vào qua một bố cục thương mại được kiểm soát. Chai vẫn ở giữa khung, chất lỏng vàng vẫn đọc được qua lớp kính, và ánh sáng ngược ấm tạo tâm trạng sản phẩm cao cấp rõ ràng mà không cần một danh sách tính từ dài.
Bài học chính: ngắn không có nghĩa là mơ hồ. Một prompt gọn với chủ thể rõ, một hành động tiết chế, một chuyển động camera và vài ràng buộc thường thắng một prompt dài đầy những sở thích rải rác.
Mẹo 2: “Cinematic” gần như vô dụng
“Cinematic” là một trong những từ prompt video AI phổ biến nhất, nhưng nó quá rộng để đáng tin. Nó có thể nghĩa là bóng tối kinh dị, ánh vàng lãng mạn, hiện thực tài liệu, sương mù khoa học viễn tưởng, hoặc cả một dải diện mạo phim không liên quan.
Lỗi thường gặp: Dùng “Cinematic” như một công tắc chất lượng
Prompt kém:
Lời nhắc video: Một thám tử đã nghỉ hưu đi qua một con hẻm mưa vào ban đêm. Điện ảnh, chuyên nghiệp, kịch tính, chất lượng điện ảnh.
Cách này cho mô hình một tâm trạng, nhưng không cho một diện mạo cụ thể. Kết quả có thể tối, sáng, noir, cầm tay, bóng bẩy, thô ráp, hoặc ở đâu đó giữa các kiểu đó.
Vì sao cách này thất bại
Dữ liệu huấn luyện gắn những từ rộng như “cinematic” với nhiều phân bố hình ảnh khác nhau. Mô hình không biết bạn muốn nhánh nào của “cinematic” trừ khi bạn gọi tên ngôn ngữ hình ảnh thực sự: cách đặt đèn, cảm giác ống kính, bố cục, đường camera, bảng màu, hoặc một tín hiệu phong cách đạo diễn dễ nhận ra. Nghiên cứu Gen-3 Alpha của Runway nhấn mạnh caption mô tả dày và giàu thông tin theo thời gian, một lời nhắc hữu ích rằng ngôn ngữ hình ảnh cụ thể thắng các nhãn mơ hồ.
Cách sửa prompt
Thay “cinematic” bằng một tín hiệu hình ảnh hẹp:
Director-style composition, lighting setup, lens behavior, aspect ratio, or color palette.
Prompt tốt hơn:
Lời nhắc video: Một thám tử đã nghỉ hưu trong chiếc áo khoác dài tối màu đi qua một con hẻm ngập mưa vào ban đêm. Đẩy chậm từ cảnh rộng đến cận trung, đèn neon đỏ và xanh phản chiếu trên đá cuội ướt, phối cảnh một điểm dọc theo hẻm, lóe ống kính anamorphic 2.39:1 từ biển neon thực, khói thuốc lá bay ngang mặt ông. Âm thanh: mưa trên mặt đường, xe cộ xa xa, tiếng ù neon nhẹ.
Bài test prompt thực tế
Thiết lập test: tạo video PixVerse với cùng thiết lập cơ sở dùng cho cả bảy trường hợp. Thiết lập tạo: 5 giây, độ phân giải 720p, tỷ lệ khung 16:9, bật âm thanh cho mưa và không khí thành phố. Bài test này kiểm tra: ngôn ngữ điện ảnh cụ thể có tạo bầu không khí ổn định hơn từ chung chung “cinematic” hay không.
Bài test hẻm mưa hiệu quả vì prompt gọi tên các yếu tố phim nhìn thấy được: đá cuội ướt mưa, phản chiếu neon, phối cảnh một điểm tụ, một cú đẩy vào chậm, và ánh sáng noir. Thám tử vẫn là điểm neo thị giác, trong khi chiều sâu hẻm, mặt đất ướt và biển hiệu đỏ-xanh tạo nên tâm trạng. Clip có cảm giác điện ảnh vì prompt mô tả cảnh quay phải trông như thế nào, chứ không dựa vào từ “cinematic”.
Mẹo 3: Chồng nhiều chuyển động camera gây rung giật
Mô hình video AI có thể theo chuyển động camera, nhưng dễ kiểm soát hơn khi chuyển động có một hướng chính. Chồng các tín hiệu camera thường tạo rung giật, trôi, hoặc chuyển cảnh không mong muốn.
Lỗi thường gặp: Kết hợp nhiều hướng camera
Prompt kém:
Lời nhắc video: Một đoàn tàu từ tính thu nhỏ chạy qua một thành phố trong bể kính terrarium. Máy quay đẩy vào, lia trái, quay quanh tàu, nghiêng lên qua các tháp rêu, và thêm rung cầm tay.
Cách này nghe như một động tác máy quay thật, nhưng với việc tạo sinh thì tạo quá nhiều vector không gian. Mô hình có thể cố thực hiện chúng lần lượt hoặc trộn thành chuyển động không ổn định.
Vì sao cách này thất bại
Chuyển động camera là không gian. Đẩy vào, lia, quay quanh, nghiêng và rung cầm tay mỗi thứ mô tả một vector chuyển động khác nhau. Khi nhiều vector bị chồng, mô hình phải quyết định cái nào chiếm ưu thế và khi nào đổi. Kết quả có thể là một cú lắc nhìn thấy được tại điểm chuyển. Các hệ thống nghiên cứu như Direct-a-Video và MotionCtrl cũng tách chuyển động camera khỏi chuyển động vật thể, điều này củng cố quy tắc thực tế ở đây: đừng để một prompt gánh năm vector camera cùng lúc.
Cách sửa prompt
Dùng một chuyển động camera chính cộng một tín hiệu kết cấu:
Main motion: slow push-in.
Texture: slight handheld feel.
Prompt tốt hơn:
Lời nhắc video: Một đoàn tàu từ tính thu nhỏ lướt qua một thành phố trong bể kính terrarium trên bàn thí nghiệm, đi qua các tháp rêu, cửa sổ tí hon và những giọt ngưng tụ trên tường kính. Máy quay: một cú theo ngang mượt song song với tàu, chỉ có kết cấu cầm tay rất nhẹ. Giữ tàu ở giữa khi nền trượt qua. Âm thanh: tiếng ù điện nhẹ, rung ray nhỏ, giọt nước trên kính, tiếng phòng bị bóp nhẹ.
Bài test prompt thực tế
Thiết lập test: tạo video PixVerse với cùng thiết lập cơ sở dùng cho cả bảy trường hợp. Thiết lập tạo: 5 giây, độ phân giải 720p, tỷ lệ khung 16:9, bật âm thanh. Bài test này kiểm tra: một cú tracking ngang duy nhất có giữ chủ thể nhỏ đọc được trong khi nền tạo chuyển động hay không.
Trường hợp này hữu ích vì cảnh có nhiều nguồn hỗn loạn camera đầy cám dỗ: phản chiếu kính, tòa nhà tí hon, hơi nước ngưng tụ, đoàn tàu đang chạy, và tỷ lệ macro. Prompt tốt hơn chỉ cho mô hình một vector camera, rồi dùng nền chuyển động để tạo năng lượng thị giác. Khi xem lại, kiểm tra đoàn tàu có ở giữa không, phản chiếu kính có ổn định không, và thiết kế âm thanh có hỗ trợ tỷ lệ thu nhỏ thay vì lấn át nó không.
Clip được tạo là một trong những minh chứng rõ nhất trong loạt. Đoàn tàu vẫn đọc được ở đáy khung trong khi thành phố terrarium phủ rêu tạo thị sai và chiều sâu. Vì prompt dùng một cú tracking ngang thay vì chồng đẩy, lia, quay quanh và nghiêng, cảnh có chuyển động mà camera không tự đánh nhau.
Mẹo 4: Không có negative prompt
Nhiều nhà sáng tạo mang thói quen Stable Diffusion vào prompt video và viết danh sách negative prompt kiểu “negative: jitter, bent limbs, flicker, deformation.” Ở hầu hết trình tạo video AI, đây không phải trường negative prompt thật. Nó chỉ là thêm văn bản.
Lỗi thường gặp: Viết chỉ dẫn “Negative” ngay trong prompt
Prompt kém:
Lời nhắc video: Một thợ đồng hồ sửa một khối đồng hồ cơ lơ lửng dưới đèn bàn. Tiêu cực: giật, bàn tay xấu, ngón cong, nhấp nháy, biến dạng, bánh răng gãy, ánh sáng không ổn định.
Cách này có thể làm kết quả tệ hơn vì mô hình vẫn đọc các từ “jitter,” “bent limbs,” và “deformation.” Thay vì chặn các khái niệm đó, prompt có thể đưa vào những liên tưởng nhiễu.
Vì sao cách này thất bại
Trừ khi giao diện có trường negative prompt riêng, mọi văn bản prompt thường được coi là chỉ dẫn tích cực. Mô hình không tự hiểu “negative:” là loại trừ cứng. Nếu bạn muốn sự ổn định, hãy nêu trực tiếp trạng thái ổn định mong muốn.
Cách sửa prompt
Dùng câu ràng buộc theo hướng khẳng định:
Face remains stable.
Limbs move naturally.
Lighting remains consistent with no flicker.
Body proportions stay consistent throughout.
Prompt tốt hơn:
Lời nhắc video: Một thợ đồng hồ dùng nhíp đồng để đặt một bánh răng trong suốt vào một khối đồng hồ cơ lơ lửng tí hon dưới đèn bàn ấm. Máy quay đẩy chậm từ đôi tay đến khối. Bàn tay chuyển động tự nhiên, cạnh bánh răng giữ sắc nét, khối vẫn ở giữa, và ánh đèn ấm giữ ổn định không nhấp nháy. Âm thanh: tiếng tách nhíp đồng, tiếng tích bánh răng nhỏ, tiếng phòng xưởng yên tĩnh.
Bài test prompt thực tế
Thiết lập test: tạo video PixVerse với cùng thiết lập cơ sở dùng cho cả bảy trường hợp. Thiết lập tạo: 5 giây, độ phân giải 720p, tỷ lệ khung 16:9, bật âm thanh cho tiếng cơ khí nhỏ và tiếng phòng xưởng. Bài test này kiểm tra: độ ổn định của bàn tay, độ rõ cạnh vật thể, sự nhất quán ánh sáng, và liệu ràng buộc khẳng định có giảm artifact nhìn thấy được hay không.
Trường hợp này làm vấn đề negative prompt trở nên rõ vì bàn tay, bánh răng nhỏ, cạnh trong suốt và ánh sáng ấm đều dễ artifact. Thay vì liệt kê điều không nên xảy ra, prompt tốt hơn nêu trạng thái mong muốn: bàn tay tự nhiên, cạnh bánh răng sắc, khối lập phương ở giữa, và ánh đèn ổn định. Khi xem lại, so sánh xem các ràng buộc có làm khối lập phương dễ kiểm tra từng khung hình hơn không.
Kết quả cho người xem một điểm kiểm tra sạch: nhíp, khối lập phương trong suốt và chi tiết bánh răng vẫn tách bạch dưới đèn bàn. Bàn tay đủ gần để gây áp lực cho mô hình, nhưng các ràng buộc khẳng định làm hành vi mục tiêu rõ ràng. Nhờ đó clip hữu ích hơn một danh sách phủ định vô tình lặp lại các từ như “deformation” hay “bad hands.”
Mẹo 5: Từ “Fast” làm giảm chất lượng đầu ra
“Fast” có vẻ hữu ích khi bạn muốn tốc độ, nhưng thường đẩy mô hình video về chuyển động không ổn định. Vấn đề nặng hơn khi prompt đã có hành động phức tạp, chuyển động camera, hạt, hoặc nhiều chủ thể.
Lỗi thường gặp: Bắt mọi yếu tố chuyển động nhanh
Prompt kém:
Lời nhắc video: Một người trượt longboard lao nhanh xuống đường núi, máy quay nhanh, cua gấp, nhòe chuyển động nhanh, tốc độ năng động, hành động mãnh liệt, chuyển động dồn dập.
Cách này tạo nhiều yếu tố tốc độ cao tranh chấp nhau. Mô hình phải đồng thời di chuyển chủ thể, camera, hiệu ứng và nhịp cảnh, điều có thể gây rung giật và sụp đổ hình ảnh.
Vì sao cách này thất bại
Tốc độ không chỉ là phong cách. Đó là một đòi hỏi về thời gian. Khi nhiều yếu tố tăng tốc cùng lúc, mô hình phải giữ giải phẫu, hình dạng vật thể, đường camera, sự mạch lạc của nền và nhịp hiệu ứng dưới áp lực chuyển động cao hơn. Thay vì viết “fast,” hãy mô tả các dấu hiệu vật lý khiến tốc độ nhìn thấy được.
Cách sửa prompt
Thay “fast” bằng chi tiết chuyển động vật lý:
Feet strike the ground with force.
Each stride fully extends.
Arms swing at 90 degrees.
Motion blur trails from the background, not the face.
Prompt tốt hơn:
Lời nhắc video: Một người trượt longboard xuống dốc nghiêng người vào khúc cua đường núi trơn mưa, đầu gối co, bàn tay sau lơ lửng cách mặt nhựa vài centimet. Mỗi bánh ném một làn nước mỏng ra ngoài khi các tấm phản quang ven đường kéo thành vệt nền mềm. Máy quay giữ thấp bên cạnh ván trong một cú theo ổn định. Mũ bảo hiểm và áo giữ vững. Âm thanh: bánh kêu ù, tiếng rít đường ướt, áp lực gió, một nhát lượn ván.
Bài test prompt thực tế
Thiết lập test: tạo video PixVerse với cùng thiết lập cơ sở dùng cho cả bảy trường hợp. Thiết lập tạo: 5 giây, độ phân giải 720p, tỷ lệ khung 16:9, bật âm thanh. Bài test này kiểm tra: ngôn ngữ chuyển động vật lý có tạo cảm giác tốc độ mà không làm quá tải mô hình hay không.
Trường hợp này tránh từ “fast” nhưng vẫn làm tốc độ nhìn thấy được. Ván nghiêng, đầu gối nén, bánh xe hất nước, và các tấm phản quang nền kéo thành vệt chuyển động. Khi xem lại, kiểm tra người trượt longboard có ổn định về giải phẫu không, camera có thấp và vững không, và tiếng bánh xe cùng mặt nhựa ướt có tạo tốc độ mà không làm hình ảnh sụp đổ không.
Kết quả truyền đạt tốc độ qua bằng chứng vật lý thay vì từ “fast.” Vị trí camera thấp, phản chiếu đường ướt, tư thế cưỡi nén, và tia nước đều khiến đường xuống dốc cảm giác nhanh trong khi cơ thể và ván vẫn đọc được. Đúng là trọng tâm của mẹo này: tốc độ dễ kiểm soát hơn khi được mô tả như nguyên nhân và kết quả.
Mẹo 6: Mô tả lại ảnh tham chiếu gây trôi chủ thể
Prompt image-to-video không nên lặp lại mọi thứ đã nhìn thấy trong ảnh tải lên. Nếu ảnh đã cho thấy một chiếc túi xách đen có kết cấu dưới đèn spotlight, mà prompt lại mô tả cùng chiếc túi bằng từ hơi khác, mô hình nhận hai đầu vào cho cùng một chủ thể: ảnh và chữ. Khác biệt nhỏ giữa chúng có thể gây trôi.
Lỗi thường gặp: Mô tả lại ảnh tham chiếu
Prompt kém cho image-to-video:
Lời nhắc video: Một túi xách da đen với quai cong, khóa bạc, thân có cấu trúc, các mảng khâu, và nền studio tối nằm dưới một đèn chiếu kịch tính.
Nếu những chi tiết đó đã có trong ảnh, prompt có thể mời mô hình diễn giải lại chúng. Kết quả có thể đổi đường viền vật thể, đổi chất liệu, dịch chi tiết trang trí, hoặc thay nền.
Vì sao cách này thất bại
Ảnh tham chiếu vốn đã là một chỉ dẫn hình ảnh mạnh. Mô tả lại chủ thể đang nhìn thấy tạo một kênh chỉ dẫn thứ hai có thể không khớp hoàn toàn với pixel. Để giữ nhận diện, hãy dùng prompt cho những gì ảnh không thể hiện: chuyển động và hành vi camera.
Cách sửa prompt
Với image-to-video, giữ prompt ở ba việc:
motion instruction, camera instruction, and one consistency rule.
Prompt tốt hơn:
Lời nhắc video: Giữ nguyên hoàn toàn vật thể tham chiếu. Chỉ thêm một cú đẩy máy quay nhẹ từ khung hình hiện tại trong khi một dải sáng hẹp chậm rãi chạy qua bề mặt nhìn thấy. Giữ đúng đường nét, chất liệu, chi tiết trang trí, nền, hướng ánh sáng và bố cục từ ảnh tham chiếu. Âm thanh: tiếng phòng trưng bày nhẹ, cộng hưởng kính mờ, tiếng sột soạt vải tinh tế.
Bài test prompt thực tế
Thiết lập test: tạo video PixVerse với cùng thiết lập cơ sở dùng cho cả bảy trường hợp. Thiết lập tạo: 5 giây, độ phân giải 720p, tỷ lệ khung 9:16, image-to-video với âm thanh bật cho tiếng chất liệu nhẹ và tiếng phòng. Bài test này kiểm tra: prompt dựa trên tham chiếu có giữ nhận diện sản phẩm trong khi thêm chuyển động camera và chuyển động ánh sáng hay không.
Trường hợp này chỉ hiệu quả nếu ảnh tham chiếu đã định nghĩa vật thể. Prompt cố ý tránh mô tả lại màu, hình dạng, chất liệu hoặc chi tiết trang trí, và tránh yêu cầu mô hình bịa cơ cấu ẩn hoặc phần bên trong không thấy. Khi xem lại, kiểm tra túi xách có giữ cùng đường viền, vị trí khóa, hình quai, kết cấu da và nền studio tối hay không, trong khi camera và highlight tạo chuyển động. Nếu mô hình đổi vật thể, prompt có lẽ vẫn đang tranh với ảnh tham chiếu.
Clip được tạo cố ý tiết chế. Điều đó hợp với mẹo này: sản phẩm vẫn là nhân vật chính, spotlight giữ ngôn ngữ hình ảnh gần với ảnh tham chiếu, và chuyển động giới hạn ở một cú đẩy vào kiểu trưng bày chứ không phải biến đổi. Với video sản phẩm dựa trên tham chiếu, sự ổn định nhàm chán thường giá trị hơn chuyển động tham vọng.
Mẹo 7: Từ chất lượng chung chung không làm được gì
Những từ như “amazing,” “beautiful,” “high quality,” “epic,” và “professional” rất hay gặp trong prompt video AI, nhưng hiếm khi cho khả năng kiểm soát đáng tin. Chúng là nhãn tần suất cao gắn với quá nhiều kiểu đầu ra.
Lỗi thường gặp: Nhồi prompt bằng tính từ chất lượng
Prompt kém:
Lời nhắc video: Một cảnh lễ hội tuyệt vời, đẹp, sử thi với hình ảnh chất lượng cao, chuyển động choáng ngợp, ánh sáng chuyên nghiệp và bố cục hoàn hảo.
Prompt này bảo mô hình rằng đầu ra phải tốt, nhưng không nói “tốt” nghĩa là gì trong cảnh này.
Vì sao cách này thất bại
Từ chất lượng chung chung lấy mẫu các phân bố rộng. “Epic” có thể nghĩa là phong cảnh rộng, một trận chiến, bầu trời phát sáng, quy mô khổng lồ, nhạc nặng, slow motion, hoặc giáp giả tưởng. Mô hình không suy ra đúng ý bạn trừ khi bạn thay tính từ bằng thứ nhìn thấy được và cụ thể.
Cách sửa prompt
Thay mọi tính từ chung chung bằng một tín hiệu có tên, nhìn thấy được:
Director-style composition.
Lighting setup.
Lens specification.
Color palette.
Material behavior.
Prompt tốt hơn:
Lời nhắc video: Một lễ hội diều ban đêm diễn ra trên cánh đồng muối trắng phủ một lớp gương nước mỏng. Ba con diều trong mờ hình sinh vật biển sâu bay phía trên, các xương sườn phát quang sinh học xanh lam–xanh lục nhịp theo vải. Đẩy chậm góc thấp từ phản chiếu ngang mắt cá chân đến đuôi diều gần nhất, cảm giác ống kính rộng 24mm, tương phản màu lục lam–đỏ tươi, đèn lồng dọc đường chân trời. Âm thanh: vải phấp phới, dây căng rung, bước chân trên nước nông, tiếng đám đông xa xa.
Bài test prompt thực tế
Thiết lập test: tạo video PixVerse với cùng thiết lập cơ sở dùng cho cả bảy trường hợp. Thiết lập tạo: 5 giây, độ phân giải 720p, tỷ lệ khung 16:9, bật âm thanh cho vải, bước chân và không khí đám đông. Bài test này kiểm tra: tín hiệu hình ảnh cụ thể có tạo sự nhất quán phong cách mạnh hơn các từ chất lượng chung chung hay không.
Trường hợp này thay mọi từ chất lượng chung chung bằng thứ nhìn thấy được: phản chiếu cánh đồng muối, diều trong suốt hình sinh vật, xương sườn phát quang sinh học, chiều cao camera thấp, cảm giác ống kính rộng, tương phản cyan-magenta, và đèn lồng trên đường chân trời. Khi xem lại, kiểm tra mô hình có giữ nhận diện hình ảnh khác thường thay vì trôi thành một cảnh lễ hội chung chung hay không.
Đầu ra giữ được ý quan trọng nhất: diều sinh vật biển sâu trong suốt với xương sườn xanh lục phát sáng. Góc camera đọc cao hơn khung ngang mắt cá chân trong prompt, nên đây chưa phải bám camera hoàn hảo. Dù vậy, nhận diện hình ảnh mạnh hơn nhiều so với prompt chỉ nói “beautiful epic festival,” điều chứng minh giá trị của danh từ cụ thể, tín hiệu ánh sáng và quan hệ màu.
Các bản viết lại prompt bổ sung
Hai bản viết lại bổ sung này kết hợp nhiều mẹo ở trên.
Prompt thành phố tương lai mơ hồ
Prompt kém:
Lời nhắc video: Làm một video AI điện ảnh thú vị về một thành phố tương lai. Làm cho nó đẹp, chân thực, kịch tính, chất lượng cao và viral.
Chỗ sai: Prompt này vi phạm Mẹo 2 và Mẹo 7. Nó dựa vào “cinematic,” “beautiful,” “dramatic,” và “high quality” mà không gọi tên một cảnh quay cụ thể. Không có chủ thể, không có hành động, không có đường camera, không có dòng thời gian, và không có khung hình cuối.
Prompt đã sửa:
Lời nhắc video: Một cảnh hé lộ thành phố tương lai dài 6 giây. Máy quay lướt thấp trên con phố ướt mưa với biển hologram xanh phản chiếu trên mặt đường. Một drone giao hàng duy nhất bay sát ống kính rồi bay lên về phía một tòa tháp kính. Theo tiến mượt, bảng màu xanh mát, ánh sáng ấm ở lối vào tháp, mưa nhẹ, giao thông xa, một lần drone bay ngang.
Prompt hành động quá tải
Prompt kém:
Lời nhắc video: Một người trượt longboard đua nhanh xuống đường núi, né giao thông, nhảy qua một cây đổ, trượt qua tia lửa, cắt sang cảnh drone, cắt sang cận bánh xe, cắt sang phản chiếu mũ bảo hiểm, rồi kết bằng logo và pháo hoa, tất cả trong 5 giây, máy quay nhanh, âm thanh hoàn hảo.
Chỗ sai: Prompt này vi phạm Mẹo 1, Mẹo 3, Mẹo 4 và Mẹo 5. Nó quá dài, chồng hành động, thêm loại trừ giả qua cách diễn đạt quá tải, và dùng “fast” trên quá nhiều yếu tố chuyển động. Mô hình có thể tạo năng lượng, nhưng không thể kết thúc cảnh một cách sạch.
Prompt đã sửa:
Lời nhắc video: Một người trượt longboard xuống dốc nghiêng người vào khúc cua đường núi trơn mưa, đầu gối co, bàn tay sau lơ lửng cách mặt nhựa vài centimet. Mỗi bánh ném một làn nước mỏng ra ngoài khi các tấm phản quang ven đường kéo thành vệt nền mềm. Máy quay giữ thấp bên cạnh ván trong một cú theo ổn định. Mũ bảo hiểm và áo giữ vững. Âm thanh: bánh kêu ù, tiếng rít đường ướt, áp lực gió, một nhát lượn ván.
Mẫu prompt video AI sẵn sàng sao chép
Dùng cấu trúc này khi bạn muốn một lần thử đầu tiên sạch:
Video prompt: [Chủ thể] + [một hành động] + [địa điểm]. [Một chuyển động camera] + [phong cách, ống kính, ánh sáng hoặc bố cục cụ thể]. [Ràng buộc khẳng định: cái gì phải giữ ổn định, cái gì nên vắng mặt, và có cần âm thanh hay không].
Ví dụ:
Lời nhắc video: Một tách cà phê gốm đặt trên bàn gỗ tối khi hơi nước cuộn lên chậm. Đẩy macro chậm, ánh sáng tungsten ấm từ bên, độ sâu trường ảnh nông, nền quán cà phê buổi sáng yên tĩnh. Hình tách giữ ổn định, không chữ phủ, âm thanh gồm tiếng phòng nhẹ và tiếng thìa kêu khẽ.
Kết luận cuối
Prompt video AI tốt hơn không phải là prompt dài hơn. Chúng gọn hơn. Đặt chủ thể, hành động và địa điểm lên trước. Thay “cinematic” và các từ chất lượng chung chung bằng tín hiệu hình ảnh cụ thể. Chỉ dùng một chuyển động máy quay. Tránh negative prompt giả. Thay “fast” bằng chi tiết chuyển động vật lý. Với image-to-video, đừng mô tả lại ảnh tham chiếu.
Những cách sửa này hiệu quả trên hầu hết trình tạo video AI hiện nay vì chúng nhắm vào những điểm yếu chung của quá trình tạo video: trôi theo thời gian, lấy mẫu phong cách mơ hồ, máy quay rung, chủ thể không nhất quán và chuyển động bị nhồi nhét. PixVerse hữu ích ở đây vì người sáng tạo có thể so sánh cùng một prompt trên Seedance 2.0, HappyHorse 1.0, PixVerse V6, PixVerse C1, Kling O3 và Kling 3.0 mà không phải dựng lại quy trình trong từng công cụ riêng.
FAQ
Prompt video AI tốt là gì?
Một prompt video AI tốt cho mô hình một cảnh quay rõ ràng: chủ thể, hành động, địa điểm, một chuyển động máy quay, tín hiệu phong cách nhìn thấy được và vài ràng buộc theo hướng tích cực. “Một chai nước hoa thủy tinh trên đá cẩm thạch đen, xoay trưng bày chậm, ánh viền ấm, phản chiếu ổn định” mạnh hơn “một video sản phẩm xa xỉ mang tính điện ảnh”.
Prompt video AI nên dài bao nhiêu?
Với nhiều prompt text-to-video, 50 đến 80 từ là khoảng khởi đầu hữu ích. Đặt chủ thể, hành động và địa điểm lên trước, rồi thêm chuyển động máy quay, ánh sáng, chi tiết chuyển động và âm thanh. Nếu câu đầu đã mơ hồ, thêm từ thường khiến bạn càng mất kiểm soát.
Vì sao “cinematic” không hiệu quả trong prompt video AI?
“Cinematic” quá rộng để dùng ổn định trong prompt trình tạo video AI. Hãy dùng ngôn ngữ điện ảnh cụ thể, chẳng hạn “cảm giác cầm máy 35mm”, “hẻm mưa với phản chiếu neon”, “dolly-in chậm”, “ánh ngược cứng” hoặc “đèn thực tế ấm ở hậu cảnh”.
Trình tạo video AI có hỗ trợ negative prompt không?
Một số công cụ có ô negative prompt riêng, nhưng ô prompt video thông thường thường đọc mọi chữ như một chỉ dẫn. Thay vì liệt kê những gì muốn tránh, hãy viết ràng buộc tích cực: “bàn tay vẫn tự nhiên”, “máy quay giữ ổn định”, “hậu cảnh vẫn trống” hoặc “đường nét sản phẩm giữ nguyên”.
Làm sao viết prompt image-to-video mà không đổi chủ thể?
Với prompt image-to-video, đừng mô tả lại ảnh đã tải lên. Dùng prompt cho chuyển động, hành vi máy quay, thay đổi ánh sáng, âm thanh và quy tắc ổn định: “Giữ nguyên vật thể tham chiếu. Thêm một cú đẩy vào nhẹ. Giữ nguyên đường nét, chất liệu, hậu cảnh và bố cục.”
Nên dùng trình tạo video AI nào để thử prompt?
Bài viết này giữ một thiết lập tạo video trên PixVerse nhất quán cho cả bảy bài kiểm tra. Cùng những mẹo prompt video AI này áp dụng cho hầu hết trình tạo hiện nay vì chúng nhắm vào các vấn đề chung: lấy mẫu phong cách mơ hồ, trôi theo thời gian, máy quay rung, chuyển động bị nhồi nhét và ảnh tham chiếu không nhất quán.
Ví dụ prompt video AI nào hữu ích để kiểm tra?
Các ví dụ prompt video AI hữu ích kiểm tra từng kỹ năng một: xoay sản phẩm để kiểm tra độ chính xác chuyển động, hẻm mưa để kiểm soát phong cách, một cú tracking duy nhất để kiểm tra độ ổn định máy quay, và prompt vật thể tham chiếu để kiểm tra tính nhất quán của chủ thể. Đánh giá kết quả theo mức bám prompt, kiểm soát chuyển động, mạch lạc theo thời gian, mức sẵn sàng về âm thanh và khả năng dùng trong sản xuất.