Hướng dẫn

7 lỗi prompt video AI âm thầm làm hỏng clip của bạn

7 lỗi prompt video AI âm thầm làm hỏng clip của bạn

Hầu hết clip video AI gây thất vọng không đến từ một mô hình yếu. Chúng đến từ thói quen prompt vay từ tạo ảnh, vốn chưa bao giờ phù hợp với chuyển động ngay từ đầu. Một khung hình tĩnh có thể nuốt cả đống tính từ. Một video năm giây thì không, vì mô hình còn phải theo dõi thời gian, chuyển động máy quay, tính nhất quán của chủ thể và thường cả âm thanh cùng lúc.

Hướng dẫn này phân tích bảy thói quen prompt âm thầm phá video do AI tạo, đi kèm bản viết lại trước và sau cùng các bài kiểm tra tạo thật trên PixVerse. Bạn có thể so sánh các cách sửa này trên những mô hình có sẵn trên PixVerse, gồm Seedance 2.0, HappyHorse 1.0, PixVerse V6, PixVerse C1, Kling O3 và Kling 3.0. Các vấn đề nền không riêng một mô hình nào — chúng xuất hiện trên hầu hết trình tạo video AI vì các điểm thất bại là chung: prompt phình to, từ tâm trạng mơ hồ, các hướng máy quay cạnh tranh nhau, negative prompt giả, ngôn ngữ tốc độ gây rung, ảnh tham chiếu bị mô tả quá mức và nhãn chất lượng chung chung.

Tất cả những điều này không nhằm viết prompt ngắn hơn chỉ vì ngắn. Đó là khiến mỗi từ trong prompt làm việc thật. Một prompt được xây tốt đặt thông tin quan trọng lên trước, cam kết một đường chuyển động duy nhất, bảo vệ những gì cần giữ nhất quán về mặt hình ảnh, và đổi các từ khẩu vị mơ hồ lấy ngôn ngữ mà mô hình thực sự hình dung được.


Cách chúng tôi thiết lập các bài kiểm tra

Mọi ví dụ dưới đây được tạo trên PixVerse với thiết lập khớp nhau: cùng cài đặt tạo nền và bật âm thanh cho từng clip. Chúng tôi không cố phô diễn một mẹo mô hình cụ thể — mục tiêu là tách riêng việc prompt đang làm gì trong khi giữ phần còn lại của môi trường ổn định. Sáu clip chạy ở 1280x720 ngang; ví dụ ảnh tham chiếu chạy ở 720x1280 dọc, vì trường hợp đó phụ thuộc vào một cảnh sản phẩm theo chiều dọc. Mọi kết quả đều có tiếng.

Chúng tôi đánh giá từng kết quả theo sáu điều một prompt dùng được cần mang lại: bám chỉ dẫn, độ rõ của chuyển động, tính nhất quán của chủ thể, độ ổn định máy quay, khả năng dùng âm thanh, và liệu clip có thể thực tế đưa vào bài blog, bản nháp quảng cáo, pitch deck hoặc hướng dẫn hay không.

Đây cố ý là các quy tắc kinh nghiệm xuyên mô hình. Hầu hết trình tạo video hiện nay chịu cùng các điểm áp lực: trôi theo thời gian, tín hiệu chuyển động mơ hồ, đường máy quay không ổn định và các chỉ dẫn âm thầm cạnh tranh nhau.

Để tìm hiểu thêm về các mô hình được nhắc ở đây, xem đánh giá Seedance 2.0, so sánh HappyHorse 1.0 và Seedance 2.0 và phân tích Kling 3.0 của chúng tôi. Nếu bạn đang đưa việc thử prompt vào quy trình sản xuất, hướng dẫn tạo video AI của chúng tôi trình bày cách tự động hóa công việc text-to-video và image-to-video.


Lỗi 1: Coi độ dài prompt là thước đo của quyền kiểm soát

Thêm mô tả dễ tạo cảm giác mô hình có nhiều thứ hơn để làm việc. Thực tế, một prompt quá tải thường chôn đúng chỉ dẫn quan trọng nhất. Dòng mở đầu mang sức nặng lớn nhất; mọi thứ xếp phía sau tranh giành sự chú ý của mô hình thay vì củng cố ý chính.

Trông như thế này:

Một chai nước hoa xa xỉ trong studio thanh lịch, ánh sáng đẹp, phản chiếu điện ảnh, vẻ quảng cáo cao cấp, chất liệu đắt tiền, hạt mềm, chuyển động mượt, không khí tinh tế, chất lượng cao, kết cấu tinh xảo, một cú máy kịch tính, kể chuyện cảm xúc, năng lượng thương hiệu xa xỉ, thủy tinh chân thực, chất lỏng vàng, điểm sáng lấp lánh, slow motion, bóng thanh lịch, bố cục hoàn hảo, không biến dạng, không nhấp nháy, không giải phẫu xấu, không hậu cảnh lộn xộn, không vật thừa, video chuyên nghiệp, phong cách quảng cáo viral.

Đoạn này đọc như rất kỹ, nhưng gần như mọi cụm hoặc mơ hồ hoặc lặp lại một ý trước đó. Mô hình phải chọn giữa chuyển động, ánh sáng, tâm trạng, phản chiếu, hiệu ứng hạt và một đống nhãn chất lượng — và chủ thể thật sự bị chìm trong nhiễu.

Vì sao thất bại: mô hình video đọc văn bản theo trình tự, và tín hiệu rõ nhất về hành động cốt lõi thường giữ vững tốt nhất suốt độ dài clip. Điều này càng quan trọng khi clip dài hơn, vì tính mạch lạc theo thời gian vốn đã đòi hỏi nhiều ở mô hình. Điều này khớp với nhận định của OpenAI rằng các mô hình video vẫn gặp khó với vật lý chính xác và quan hệ nhân quả — chất thêm chỉ dẫn yếu sau ý chính không tạo thêm quyền kiểm soát, mà chỉ thêm nhiễu.

Cách sửa: hướng tới cấu trúc gọn 50–80 từ — chủ thể, hành động và địa điểm ở câu một, máy quay và phong cách ở câu hai, ràng buộc ở câu ba.

Một chai nước hoa thủy tinh trong đứng trên đá cẩm thạch đen khi ánh viền ấm đi xuyên chất lỏng vàng. Chai thực hiện một vòng xoay trưng bày nhỏ, lộ nhẹ cạnh bên, rồi trở lại giữa. Push-in macro chậm từ chiều cao nhãn đến nắp, ánh sáng studio xa xỉ, bụi vàng mềm trôi phía sau chai. Kết trên khung giữa ổn định, không chữ đè, không vật thừa. Âm thanh: chuyển động thủy tinh tinh tế, tiếng phòng studio nhẹ.

Kiểm tra: PixVerse, 5 giây, 720p, 16:9, bật âm thanh cho chuyển động thủy tinh và tiếng studio. Chúng tôi muốn xem một prompt gọn có giữ được nhận diện sản phẩm, chuyển động tiết chế, ánh sáng và kiểm soát máy quay mà không làm mất hành động chính hay không.

Trong kết quả, chai giữ giữa suốt cú push-in, chất lỏng vàng đọc rõ qua thủy tinh, và ánh ngược ấm dựng tâm trạng cao cấp mà không cần một tính từ nào gánh việc nặng. Prompt ngắn không tự động là prompt mơ hồ — một chỉ dẫn gọn với một chủ thể, một hành động tiết chế, một cú máy và vài ràng buộc thật luôn thắng một danh sách dài các sở thích rải rác.


Lỗi 2: Dựa vào “cinematic” như một công tắc chất lượng

“Cinematic” xuất hiện trong gần như mọi prompt video AI, và đó là một trong những từ ít hữu ích nhất bạn có thể dùng. Nó có thể chỉ ánh sáng kinh dị, giờ vàng lãng mạn, hiện thực tài liệu thô, sương mù khoa học viễn tưởng, hoặc hàng chục vẻ phim khác chẳng liên quan gì đến nhau.

Trông như thế này:

Một thám tử đã nghỉ hưu đi qua hẻm mưa vào ban đêm. Cinematic, chuyên nghiệp, kịch tính, chất lượng điện ảnh.

Câu đó cho mô hình một tâm trạng, không phải một diện mạo. Kết quả có thể rơi bất kỳ đâu từ tối và thô đến sáng và bóng, và bạn không có cách nào đoán được phía nào.

Vì sao thất bại: các từ rộng như “cinematic” gắn với những lát dữ liệu huấn luyện khổng lồ, không liên quan nhau. Mô hình không có cách biết bạn đang hình dung nhánh “cinematic” nào trừ khi bạn gọi tên ngôn ngữ hình ảnh thật — thiết lập ánh sáng, tính cách ống kính, bố cục, chuyển động máy quay, bảng màu, hoặc một tín hiệu phong cách đạo diễn cụ thể. Nghiên cứu Gen-3 Alpha của Runway chỉ cùng hướng: caption mô tả cao, dày về thời gian luôn vượt các nhãn phong cách mơ hồ.

Cách sửa: thay “cinematic” bằng thứ cụ thể — một thiết lập ánh sáng, một hành vi ống kính, một quy tắc bố cục hoặc một bảng màu.

Một thám tử đã nghỉ hưu mặc áo khoác dài tối đi qua hẻm ngập mưa vào ban đêm. Push-in chậm từ cảnh rộng đến cận trung, neon đỏ và xanh phản trên đá cuội ướt, phối cảnh một điểm dọc hẻm, flare ống kính anamorphic từ biển neon thực, khói thuốc lá ngang qua mặt anh. Âm thanh: mưa trên mặt đường, xe cộ xa, tiếng hum neon nhẹ.

Kiểm tra: PixVerse, 5 giây, 720p, 16:9, bật âm thanh cho mưa và không khí thành phố. Chúng tôi muốn xem việc gọi tên các yếu tố điện ảnh cụ thể có tạo không khí ổn định hơn chỉ mỗi từ “cinematic” hay không.

Nó hiệu quả vì prompt gọi tên những thứ mô hình thực sự dựng được: đá cuội ướt, phản chiếu neon, phối cảnh một điểm dọc hẻm, một cú push-in chậm, ánh sáng kiểu noir. Thám tử vẫn là điểm neo thị giác trong khi chiều sâu hẻm và biển hiệu màu dựng tâm trạng. Clip đọc như điện ảnh vì prompt mô tả cảnh quay phải trông thế nào — không phải vì mượn một từ thời thượng.


Lỗi 3: Xếp nhiều chuyển động máy quay trong một cảnh

Mô hình video AI có thể theo hướng máy quay khá tốt, nhưng chỉ khi có một chuyển động chủ đạo. Xếp vài tín hiệu máy quay với nhau và bạn dễ gặp rung, trôi hoặc một chuyển cảnh không mong muốn giữa clip.

Trông như thế này:

Một đoàn tàu từ tính thu nhỏ chạy qua thành phố trong hồ thủy tinh. Máy quay đẩy vào, lia trái, quay quanh tàu, nghiêng lên qua các tháp rêu, và thêm rung cầm tay.

Đoạn này đọc như một cú máy phim thật, nhưng với mục đích tạo video thì đó là năm vector không gian riêng đang tranh ưu tiên. Mô hình phải xếp chúng theo trình tự hoặc trộn chúng, và cả hai đường đều dễ tạo sự bất ổn nhìn thấy được.

Vì sao thất bại: một cú push-in, một cú lia, một quỹ đạo quay, một cú nghiêng và rung cầm tay mỗi cái mô tả một hướng di chuyển máy quay khác nhau. Xếp chúng lại, mô hình phải đoán cái nào nên chiếm ưu thế và khi nào chuyển sang cái tiếp theo — điểm chuyển giao đó thường là nơi xuất hiện sự lắc. Nghiên cứu về các hệ thống điều khiển máy quay như Direct-a-Video và MotionCtrl cố ý tách chuyển động máy quay khỏi chuyển động vật thể đúng vì lý do này: một prompt không nên bị yêu cầu gánh năm vector máy quay cùng lúc.

Cách sửa: chọn một chuyển động máy quay chính, rồi thêm tối đa một tín hiệu kết cấu lên trên.

Một đoàn tàu từ tính thu nhỏ lướt qua thành phố trong hồ thủy tinh trên bàn thí nghiệm, đi ngang các tháp rêu và tường kính đọng hạt ngưng tụ. Máy quay: một cú tracking ngang mượt song song với tàu, chỉ một chút kết cấu cầm tay. Tàu giữ giữa khi hậu cảnh trượt qua. Âm thanh: tiếng hum điện nhẹ, rung ray nhỏ, giọt nước trên kính, tiếng phòng bị nén.

Kiểm tra: PixVerse, 5 giây, 720p, 16:9, bật âm thanh. Cảnh này đầy những cám dỗ hỗn loạn về máy quay — phản chiếu kính, tòa nhà tí hon, ngưng tụ, một đoàn tàu đang chạy, tỷ lệ macro — nên đây là bài thử áp lực tốt để xem một cú tracking ngang duy nhất có giữ chủ thể nhỏ đọc được trong khi hậu cảnh tạo năng lượng chuyển động hay không.

Kết quả là một trong những cảnh sạch nhất của cả bộ. Tàu vẫn đọc được ở đáy khung trong khi hồ rêu tạo thị sai và chiều sâu phía sau. Vì prompt cam kết một chuyển động ngang thay vì xếp push, lia, quay quanh và nghiêng, máy quay không tự đánh nhau.


Lỗi 4: Viết negative prompt vốn không tồn tại

Nhiều người sáng tạo mang thói quen Stable Diffusion vào prompt video và viết những dòng như “negative: jitter, bent limbs, flicker, deformation”. Hầu hết trình tạo video AI không có ô negative prompt thật — đoạn chữ đó chỉ là thêm prompt.

Trông như thế này:

Một thợ đồng hồ sửa một khối máy đồng hồ nổi dưới đèn bàn. Negative: jitter, bad hands, bent fingers, flicker, deformation, broken gears, unstable lighting.

Điều này có thể chủ động làm mọi thứ tệ hơn. Mô hình vẫn đọc các từ “jitter”, “bent fingers” và “deformation” như văn bản, và thay vì loại các khái niệm đó, nó có thể đưa đúng những liên tưởng bạn đang cố tránh.

Vì sao thất bại: trừ khi giao diện có ô nhập negative prompt riêng, mọi thứ bạn gõ đều bị coi là chỉ dẫn tích cực. Mô hình không có khái niệm tích hợp về “negative:” như một loại trừ cứng — nếu bạn muốn sự ổn định, hãy mô tả trực tiếp kết quả ổn định.

Cách sửa: đổi mọi phủ định thành một ràng buộc tích cực nêu trạng thái mong muốn.

Một thợ đồng hồ dùng nhíp đồng để đặt một bánh răng trong suốt vào một khối máy đồng hồ nổi nhỏ dưới đèn bàn ấm. Máy quay đẩy chậm từ bàn tay đến khối. Bàn tay chuyển động tự nhiên, cạnh bánh răng giữ sắc, khối giữ giữa, và ánh đèn ấm giữ nhất quán, không nhấp nháy. Âm thanh: tiếng tách nhíp đồng, tiếng tích bánh răng nhỏ, tiếng phòng xưởng yên.

Kiểm tra: PixVerse, 5 giây, 720p, 16:9, bật âm thanh cho tiếng cơ khí nhỏ và tiếng xưởng. Bàn tay, bánh răng nhỏ và cạnh trong suốt đều là vùng dễ lỗi, nên đây là phép kiểm hữu ích xem các ràng buộc được nêu có thực sự giảm lỗi nhìn thấy so với một danh sách phủ định hay không.

Nhíp, khối trong suốt và chi tiết bánh răng đều tách biệt về mặt hình ảnh dưới đèn. Bàn tay đủ gần máy quay để gây áp lực cho mô hình, nhưng nêu trực tiếp hành vi mục tiêu — bàn tay tự nhiên, cạnh sắc, ánh sáng ổn định — cho kết quả sạch hơn một danh sách phủ định vốn có nguy cơ lặp đúng những từ bạn đang cố tránh.


Lỗi 5: Dùng “fast” như một chỉ dẫn tốc độ

“Fast” có vẻ là từ hiển nhiên khi bạn muốn tốc độ, nhưng nó thường đẩy quá trình tạo video về phía mất ổn định — nhất là khi prompt đã có hành động phức tạp, chuyển động máy quay hoặc nhiều yếu tố đang chuyển động.

Trông như thế này:

Một người trượt longboard lao nhanh xuống đường núi, máy quay nhanh, cua gấp, motion blur nhanh, tốc độ động, hành động dữ dội, chuyển động cấp tốc.

Lúc này chủ thể, máy quay, hiệu ứng và nhịp cảnh đều bị yêu cầu tăng tốc cùng lúc, và mô hình phải giữ giải phẫu, hình dạng vật thể, đường máy quay và sự mạch lạc của hậu cảnh dưới áp lực đó.

Vì sao thất bại: tốc độ không chỉ là một từ phong cách — đó là một đòi hỏi về thời gian. Thay vì yêu cầu “fast”, hãy mô tả bằng chứng vật lý khiến tốc độ nhìn thấy được: tư thế nén, kiểu tia nước, vệt hậu cảnh kéo dài, khung máy quay được kiểm soát.

Cách sửa: đổi “fast” lấy vật lý chuyển động cụ thể.

Một người trượt longboard xuống dốc nghiêng người vào cua đường núi trơn mưa, gối nén, tay sau lơ lửng cách mặt nhựa vài centimet. Mỗi bánh ném một tia nước mỏng ra ngoài khi các tấm phản quang ven đường kéo thành vệt hậu cảnh mềm. Máy quay giữ thấp cạnh ván trong một cú tracking ổn định. Mũ và áo khoác giữ ổn định. Âm thanh: bánh xe vo ve, tiếng rít đường ướt, áp lực gió, một nhát lượn của ván.

Thử nghiệm: PixVerse, 5 giây, 720p, 16:9, bật âm thanh. Câu hỏi ở đây là liệu ngôn ngữ chuyển động vật lý có thể truyền tải tốc độ mà không yêu cầu mô hình tăng tốc năm thứ cùng lúc hay không.

Kết quả bán tốc độ bằng bằng chứng vật lý thay vì từ “nhanh”: góc máy thấp, phản chiếu trên mặt đường ướt, tư thế cưỡi nén thấp và tia nước bắn ra kết hợp với nhau khiến đoạn đổ dốc có cảm giác nhanh, trong khi người lái và ván vẫn hoàn toàn dễ đọc.


Sai lầm 6: Mô tả lại ảnh tham chiếu bạn đã tải lên

Với công việc ảnh-thành-video, việc lặp lại mọi thứ đã hiện rõ trong ảnh đã tải lên sẽ tạo ra xung đột. Nếu ảnh đã cho thấy một chiếc túi xách đen có kết cấu rõ dưới đèn spotlight, mà prompt của bạn lại mô tả đúng chiếc túi đó bằng những từ hơi khác, mô hình lúc này có hai chỉ dẫn cho một chủ thể — pixel và văn bản — và bất kỳ lệch nhau nào giữa chúng đều dễ gây trôi.

Trông như thế nào (prompt ảnh-thành-video):

Một chiếc túi xách da đen có quai cong, khóa bạc, thân có kết cấu, các mảng khâu và nền studio tối nằm dưới một đèn spotlight kịch tính.

Nếu tất cả những điều đó đã có trong ảnh tham chiếu, prompt đang mời mô hình diễn giải lại những chi tiết lẽ ra chỉ cần giữ nguyên — đường nét, chất liệu, chi tiết trang trí, thậm chí nền cũng có thể dịch chuyển vì thế.

Vì sao thất bại: ảnh tham chiếu vốn đã là một chỉ dẫn mạnh. Mô tả lại chủ thể đang thấy mở ra một kênh chỉ dẫn thứ hai, có thể không khớp từng pixel với những gì thực sự có ở đó. Trong trường hợp này, việc của prompt là bao phủ những gì ảnh không thể hiện: chuyển động và hành vi máy quay.

Cách sửa: với ảnh-thành-video, giới hạn prompt ở ba việc — chỉ dẫn chuyển động, chỉ dẫn máy quay, một quy tắc nhất quán.

Giữ nguyên hoàn toàn vật thể tham chiếu. Thêm một cú đẩy máy nhẹ vào từ khung hình hiện tại trong khi một dải sáng hẹp chậm rãi chạy ngang bề mặt đang thấy. Giữ đúng đường nét, chất liệu, chi tiết trang trí, nền, hướng sáng và bố cục từ ảnh tham chiếu. Âm thanh: tone phòng trưng bày nhẹ, cộng hưởng kính mờ, tiếng vải sột soạt tinh tế.

Thử nghiệm: PixVerse, 5 giây, 720p, 9:16 dọc, ảnh-thành-video, bật âm thanh cho tiếng chất liệu tinh tế và tone phòng. Cách này chỉ hiệu quả vì ảnh tham chiếu đã xác định vật thể — prompt cố ý tránh mô tả lại màu, hình dạng hay chất liệu, và không yêu cầu mô hình bịa ra cơ cấu ẩn.

Chiếc túi giữ đường nét, vị trí khóa, hình quai và kết cấu da, nền studio tối vẫn nguyên, trong khi máy quay và dải sáng đảm nhận toàn bộ chuyển động. Với video sản phẩm dựa trên tham chiếu, sự tiết chế trong prompt thường quan trọng hơn tham vọng.


Sai lầm 7: Nhồi prompt bằng những từ chất lượng chung chung

Những từ như “tuyệt vời”, “đẹp”, “chất lượng cao”, “hoành tráng” và “chuyên nghiệp” xuất hiện liên tục trong prompt video AI, nhưng chúng gần như không mang thông tin định hướng. Đó là những nhãn tần suất cao gắn với quá nhiều loại đầu ra khác nhau nên không thể kiểm soát một cách đáng tin.

Trông như thế này:

Một cảnh lễ hội tuyệt vời, đẹp, hoành tráng với hình ảnh chất lượng cao, chuyển động choáng ngợp, ánh sáng chuyên nghiệp và bố cục hoàn hảo.

Điều này bảo mô hình rằng đầu ra phải tốt, mà không nói “tốt” thực sự trông như thế nào trong cảnh cụ thể này.

Vì sao thất bại: riêng từ “hoành tráng” có thể nghĩa là phong cảnh bao quát, một trận chiến, bầu trời phát sáng, quy mô khổng lồ, nhạc nền kịch tính, slow motion, hoặc giáp fantasy. Mô hình không có cách nào suy ra bạn muốn cái nào nếu không thay tính từ bằng thứ nhìn thấy được và cụ thể.

Cách sửa: đổi mọi tính từ chung chung lấy một tín hiệu có tên, nhìn thấy được — bố cục, cách đặt đèn, thông số ống kính, bảng màu, hành vi chất liệu.

Một lễ hội diều đêm diễn ra trên cánh đồng muối trắng phủ một lớp gương nước mỏng. Ba con diều trong mờ hình sinh vật biển sâu bay phía trên, các xương sườn phát quang sinh học xanh lam–xanh lục nhấp nháy dưới vải. Cú đẩy vào chậm góc thấp từ phản chiếu ngang mắt cá chân lên đuôi diều gần nhất, cảm giác ống kính rộng, tương phản màu cyan–magenta, đèn lồng dọc đường chân trời. Âm thanh: vải phần phật, dây căng rung, bước chân trên nước nông, tiếng đám đông xa xăm.

Thử nghiệm: PixVerse, 5 giây, 720p, 16:9, bật âm thanh cho vải, bước chân và không khí đám đông. Mục tiêu là xem các tín hiệu hình ảnh cụ thể có giữ phong cách nhất quán tốt hơn những từ chất lượng chung chung hay không.

Đầu ra giữ ý tưởng cốt lõi — những con diều trong mờ hình sinh vật với xương sườn phát sáng trên phản chiếu cánh đồng muối. Góc máy cao hơn một chút so với khung ngang mắt cá chân đã yêu cầu, nên độ bám không hoàn hảo, nhưng bản sắc hình ảnh mạnh hơn nhiều so với chỉ “lễ hội đẹp hoành tráng”. Danh từ cụ thể, tín hiệu ánh sáng và quan hệ màu sắc luôn vượt trội hơn tính từ về gu thẩm mỹ.


Hai prompt đầy đủ, tách nhỏ

Trước: “Làm một video AI điện ảnh ngầu về một thành phố tương lai. Làm cho đẹp, chân thực, kịch tính, chất lượng cao và viral.” — câu này xếp chồng Sai lầm 2 và Sai lầm 7, không có chủ thể, hành động, đường máy hay khung cuối để neo.

Sau: “Một cảnh hé lộ thành phố tương lai dài 6 giây. Máy quay lướt thấp trên con phố ướt mưa với biển holographic xanh phản chiếu trên mặt đường. Một drone giao hàng duy nhất bay sát ống kính rồi bay lên về phía tháp kính. Tracking tiến mượt, bảng màu xanh lạnh, ánh sáng ấm ở lối vào tháp, mưa nhẹ, giao thông xa, một lần drone bay ngang.”

Trước: “Một người trượt longboard lao nhanh xuống đường núi, né giao thông, nhảy qua cây đổ, trượt xuyên tia lửa, cắt sang cảnh drone, cắt sang cận bánh xe, cắt sang phản chiếu mũ bảo hiểm, rồi kết bằng logo và pháo hoa, tất cả trong 5 giây, máy quay nhanh, âm thanh hoàn hảo.” — câu này gộp Sai lầm 1, 3, 4 và 5 trong một câu chạy dài quá tải.

Sau: cùng bản sửa longboard từ Sai lầm 5 ở trên — một hành động, một chuyển động máy, ràng buộc theo hướng khẳng định, tín hiệu âm thanh cụ thể.

Một mẫu prompt dùng lại được

Dùng hình dạng này làm điểm xuất phát mặc định:

[Subject] + [one action] + [location]. [One camera movement] + [specific style, lens, lighting, or composition]. [Positive constraints: what must stay stable, what should be absent, whether audio is needed].

Ví dụ: “Một tách cà phê gốm đặt trên bàn gỗ tối khi hơi nước bốc lên thành những vòng chậm. Cú đẩy macro chậm, đèn tungsten ấm từ bên, độ sâu trường ảnh nông, nền quán cà phê buổi sáng yên tĩnh. Hình tách giữ ổn định, không chữ đè, âm thanh gồm tone phòng nhẹ và tiếng thìa chạm khẽ.”


Điểm rút ra

Prompt video AI tốt hơn không phải prompt dài hơn — mà là prompt sạch hơn. Đưa chủ thể, hành động và địa điểm lên trước. Thay “cinematic” và những từ chất lượng chung chung bằng tín hiệu cụ thể, nhìn thấy được. Cam kết một chuyển động máy duy nhất. Bỏ negative prompt giả, ưu tiên ràng buộc theo hướng khẳng định. Đổi “nhanh” lấy chi tiết chuyển động vật lý. Với ảnh-thành-video, hãy để ảnh tham chiếu làm việc của nó thay vì mô tả lại.

Những cách sửa này đứng vững trên hầu hết trình tạo video AI hiện nay vì chúng nhắm vào cùng những điểm yếu nền: trôi theo thời gian, lấy mẫu phong cách mơ hồ, máy quay rung, chủ thể không nhất quán và chỉ dẫn chuyển động quá tải. PixVerse giúp việc này dễ đưa vào thực hành, vì bạn có thể thử cùng một prompt trên Seedance 2.0, HappyHorse 1.0, PixVerse V6, PixVerse C1, Kling O3 và Kling 3.0 mà không đổi công cụ hay dựng lại quy trình.

FAQ

Điều gì khiến một prompt video AI thực sự tốt? Một prompt tốt cho mô hình một cú rõ: chủ thể, hành động, địa điểm, một chuyển động máy, tín hiệu phong cách nhìn thấy được và vài ràng buộc theo hướng khẳng định. “Một chai nước hoa thủy tinh trên đá cẩm thạch đen, xoay trưng bày chậm, ánh viền ấm, phản chiếu ổn định” luôn vượt “một video sản phẩm xa xỉ cinematic”.

Prompt video AI nên dài bao nhiêu? Với hầu hết prompt văn bản-thành-video, 50–80 từ là khoảng khởi đầu vững. Bắt đầu bằng chủ thể, hành động và địa điểm, rồi thêm chuyển động máy, ánh sáng, chi tiết chuyển động và âm thanh. Một câu mở mơ hồ hiếm khi được cứu bởi nhiều từ hơn phía sau.

Vì sao “cinematic” không hoạt động tốt như một từ trong prompt? Nó quá rộng để chỉ vào bất cứ thứ cụ thể nào. Đổi lấy ngôn ngữ điện ảnh nhìn thấy được — “cảm giác handheld 35mm”, “hẻm mưa với phản chiếu neon”, “dolly-in chậm”, “đèn hậu cứng”, “đèn thực tế ấm ở hậu cảnh.”

Trình tạo video AI có hỗ trợ negative prompt thật không? Một số công cụ có ô negative prompt riêng, nhưng hộp prompt tiêu chuẩn thường đọc mọi thứ như chỉ dẫn. Hãy viết ràng buộc theo hướng khẳng định — “bàn tay giữ tự nhiên”, “máy quay giữ vững”, “nền vẫn trống”, “đường nét sản phẩm giữ nguyên.”

Làm sao prompt ảnh-thành-video mà không đổi chủ thể? Đừng mô tả lại những gì đã có trong ảnh đã tải lên. Dùng prompt cho những gì ảnh không thể hiện — chuyển động, hành vi máy quay, thay đổi ánh sáng, âm thanh và một quy tắc nhất quán (“giữ nguyên vật thể tham chiếu, thêm cú đẩy vào nhẹ, giữ đường nét và chất liệu”).

Tài nguyên liên quan