Prompt Engineering

Prompt tạo ảnh AI 2026: ngôn ngữ nhiếp ảnh, negative prompt, seed và CFG (hướng dẫn thực chiến)

a adminvigomedia 17 phút đọc

Prompt tạo ảnh AI tốt được viết như một đạo diễn brief cho nhiếp ảnh gia: chủ thể trước, rồi ống kính, ánh sáng, bố cục, phong cách. Bốn nút điều khiển quyết định chất lượng là *ngôn ngữ nhiếp ảnh* (làm ảnh thật hơn), *negative prompt* (loại thứ không muốn), *seed* (giữ hoặc đổi bố cục) và *CFG scale* (độ bám prompt). Không phải model nào cũng mở cả bốn: Nano Banana Pro và Midjourney thiên về mô tả ngôn ngữ, còn seed/CFG/negative là “đồ nghề” mạnh nhất trên nhóm model mở như Stable Diffusion và Flux.

TL;DR — 6 điều rút gọn

  • Viết prompt tạo ảnh theo thứ tự chủ thể → hành động → bối cảnh → ống kính/ánh sáng → phong cách → tỉ lệ khung.
  • Flux và Nano Banana Pro thích câu văn mô tả tự nhiên, không thích chuỗi tag ngăn cách bằng dấu phẩy.
  • Negative prompt là danh sách “cấm xuất hiện” (mờ, tay lỗi, watermark) — mạnh nhất ở Stable Diffusion, ít cần ở model mới.
  • Seed là hạt giống nhiễu ban đầu: cùng seed + cùng cài đặt → bố cục gần giống nhau, tiện để tinh chỉnh.
  • CFG scale điều khiển độ bám prompt: thấp thì AI sáng tạo tự do, cao thì bám sát nhưng dễ cháy màu/rạn nét. Vùng an toàn thường là 6–8.
  • Ảnh thật đến từ chi tiết cụ thể (tiêu cự, loại phim, kiểu sáng, tì vết), không phải từ tính từ chung chung như “đẹp, chất lượng cao”.

> Bài này là Spoke 2 của series Prompt Engineering thực chiến (SR-03). Nếu bạn chưa nắm khung tư duy viết prompt, đọc bài Hub trước: *Prompt Engineering 2026: framework viết prompt điều khiển được mọi AI*. Còn khung 6 lớp cho prompt chữ nằm ở bài *Cấu trúc prompt 6 lớp*. Bài này đi hẳn vào prompt cho ảnh.

Prompt tạo ảnh AI là gì và khác gì prompt chữ?

Prompt tạo ảnh là đoạn mô tả bằng lời để model dựng ra hình, khác prompt chữ ở chỗ model không “hiểu ý” mà dựng lại từ mô tả thị giác. Với prompt chữ (ChatGPT, Claude), bạn ra lệnh và giải thích. Với prompt ảnh, bạn *dàn cảnh*: model cần biết ai/cái gì trong khung, chụp ở góc nào, sáng ra sao, phong cách gì.

Nguyên tắc gốc dùng được cho mọi tool: viết như đạo diễn brief cho nhiếp ảnh gia — chủ thể trước, rồi ống kính, ánh sáng, tâm trạng. Càng cụ thể, ảnh càng sát ý bạn tưởng tượng; càng chung chung, model càng “tự chế”.

Cấu trúc một prompt ảnh nên gồm những gì?

Một prompt ảnh đầy đủ nên có 6 khối, xếp theo thứ tự quan trọng giảm dần. Đây là khung Google khuyến nghị chính thức cho Nano Banana Pro, và cũng áp dụng tốt cho các model khác:

  1. Chủ thể (Subject): ai/cái gì, càng cụ thể càng tốt. “Một nữ barista tóc búi, tạp dề da nâu” thay vì “một người phụ nữ”.
  2. Bố cục (Composition): khung hình. “Cận cảnh (close-up)”, “toàn cảnh (wide shot)”, “góc thấp (low angle)”.
  3. Hành động (Action): đang làm gì. “đang rót cà phê”, “bước đi giữa cánh đồng”.
  4. Bối cảnh (Location): ở đâu. “quán cà phê bên cửa sổ lúc hoàng hôn”.
  5. Ống kính & ánh sáng (Camera & lighting): phần nâng cấp chất lượng — nói ở mục dưới.
  6. Phong cách (Style): “ảnh chụp thực tế (photorealistic)”, “màu phim thập niên 90”, “tranh màu nước”.

Với model mới như FluxNano Banana Pro, hãy viết 6 khối này thành câu văn mạch lạc, đừng dồn thành chuỗi tag. Flux hiểu ngôn ngữ tự nhiên rất tốt, và việc “đổ tag” (comma-dumping) làm hại nhiều hơn lợi.

Ngôn ngữ nhiếp ảnh: vì sao nó làm ảnh thật hơn?

Ảnh thật đến từ các lớp cụ thể, không phải tính từ. Thêm “đẹp, chất lượng cao, 4k” gần như vô nghĩa; thêm thông số máy ảnh thật thì model có mốc để bám. Bốn lớp đáng đưa vào:

  • Tiêu cự + khẩu độ: “85mm f/1.8” cho chân dung xóa phông, “24mm” cho cảnh rộng.
  • Loại phim / cảm biến: “Kodak Portra 400”, “màu phim ấm” — cho tông màu đặc trưng.
  • Kiểu ánh sáng chuyên nghiệp: “three-point lighting”, “Rembrandt lighting”, “clamshell”, “golden hour rim light”. Các thuật ngữ này cho kết quả tốt hơn thấy rõ, đặc biệt trên Flux.
  • Tì vết thật: “lỗ chân lông nhìn thấy được (visible pores)”, “hạt phim (film grain)”, “hơi bất đối xứng” — nghịch lý là chính sự “không hoàn hảo” mới làm ảnh trông thật, thoát khỏi cảm giác “da nhựa”.

Google cũng khuyến nghị điều khiển như một quay phim: “góc thấp, độ sâu trường ảnh nông (f/1.8)”, “ánh sáng ngược giờ vàng tạo bóng dài”, “color grading tông teal trầm”. Cùng một chủ thể, chỉ đổi lớp ánh sáng là ra một bức hoàn toàn khác.

Negative prompt là gì và khi nào cần dùng?

Negative prompt là danh sách những thứ bạn cấm xuất hiện trong ảnh. Nó mạnh nhất trên Stable Diffusion, nơi model dễ sinh lỗi giải phẫu và rác hình. Các từ hay dùng: *blurry, low quality, bad anatomy, deformed hands, extra fingers, watermark, text, ugly, amateur*.

Nhưng đừng nhồi vô tội vạ — số lượng từ nên khớp với model:

  • SD 1.5: dùng nhiều được, 15–30 từ là bình thường.
  • SDXL: 5–15 từ là đủ.
  • SD 3.5 và model mới: giữ dưới 10 từ; nhồi quá làm ảnh “co lại”, mất chi tiết.

Với Nano Banana Pro (chat trong Gemini), bạn không gõ ô negative riêng — thay vào đó nói thẳng bằng lời: “bỏ chiếc xe ở hậu cảnh”, “không có chữ trên áo”. Với Midjourney, negative đi qua tham số --no (ví dụ --no text, watermark). Hiểu đúng: negative prompt là công cụ *sửa lỗi và làm sạch*, không phải nơi liệt kê mọi thứ bạn ghét.

Seed là gì và dùng để làm gì?

Seed là hạt giống nhiễu ban đầu — hình dung như tĩnh điện trên TV mà model dùng làm điểm xuất phát để dựng ảnh. Ý nghĩa thực tế:

  • Giữ nguyên seed + cùng cài đặt → bạn thường nhận lại bố cục, khung, khuôn mặt gần giống. Rất tiện khi bạn *đã ưng một bức* và chỉ muốn chỉnh nhẹ prompt (đổi màu áo, đổi ánh sáng) mà không đổi hẳn cả ảnh.
  • Đổi seed → ảnh trôi sang tư thế, bố cục, cấu trúc mặt khác — dùng khi bạn muốn thử nhiều phương án.

Seed lộ ra ở Stable Diffusion, Flux (qua ComfyUI/A1111) và Midjourney (--seed). Còn Nano Banana Pro dạng chat không cho bạn ghim seed thủ công — muốn giữ nhân vật nhất quán, bạn dùng ảnh tham chiếu (nạp tới 14 ảnh, tùy nền tảng) thay cho seed.

CFG scale là gì và nên để bao nhiêu?

CFG scale (Classifier-Free Guidance) điều khiển model bám prompt của bạn chặt tới đâu. Đây là nút chỉ có trên nhóm model mở (SD, Flux):

  • CFG thấp (3–5): model được tự do sáng tạo, ảnh mềm và tự nhiên, nhưng có thể trôi khỏi mô tả.
  • CFG vừa (6–8): vùng an toàn cho hầu hết trường hợp.
  • CFG cao (9+): bám prompt rất chặt, nhưng dễ cháy màu, rạn nét, tăng artifact.

Gợi ý khởi điểm theo thực tế cộng đồng 2026: CFG 7 cho ảnh nghệ thuật, CFG 6 cho ảnh thực tế (photorealistic), CFG 8–9 cho prompt phức tạp nhiều chi tiết. Nano Banana Pro và Midjourney *không* cho người dùng chỉnh CFG — chúng tự cân, nên với hai tool này bạn tập trung vào chất lượng mô tả thay vì thông số.

Bảng so sánh: nút nào có ở tool nào?

Đây là điểm nhiều người nhầm — không phải tool nào cũng có đủ 4 nút. Chọn tool theo mức kiểm soát bạn cần:

Điều khiển Stable Diffusion / Flux (mở) Midjourney v7 Nano Banana Pro (Gemini 3)
Ngôn ngữ nhiếp ảnh ✅ Rất mạnh (Flux thích văn xuôi) ✅ Mạnh ✅ Rất mạnh (theo brief Google)
Negative prompt ✅ Ô riêng ⚠️ Qua tham số --no ⚠️ Nói bằng lời, không có ô
Seed ✅ Ghim tự do --seed ❌ Không ghim; dùng ảnh tham chiếu
CFG scale ✅ Chỉnh tay (6–8) ❌ Tự cân ❌ Tự cân
Tham số phong cách LoRA, checkpoint --stylize (0–1000), --chaos (0–100) Mô tả bằng lời
Tỉ lệ khung Đặt kích thước --ar (mặc định 1:1) 1:1 → 21:9, xuất 1K/2K/4K
Hợp cho ai Người thích kiểm soát sâu Ảnh nghệ thuật đẹp nhanh Ảnh có chữ, infographic, giữ thương hiệu

*Nguồn: docs.midjourney.com & gradually.ai (2026); Google DeepMind blog (11/2025); imagetoprompt.dev & aiphotogenerator.net (2026).*

Ghi chú Midjourney: --stylize (viết tắt --s) mặc định 100, dải 0–1000 — càng cao càng “nghệ” nhưng giảm độ bám prompt; --chaos (--c) 0–100 — càng cao 4 ảnh trong lưới càng khác lạ nhau.

Quy trình 6 bước viết một prompt ảnh ra kết quả

Đây là quy trình mình chạy mỗi khi cần ảnh cho bài viết hoặc thumbnail:

  1. Viết 1 câu lõi: chủ thể + hành động + bối cảnh. *”Một lập trình viên trẻ người Việt ngồi làm việc ban đêm trong phòng nhỏ, màn hình hắt sáng xanh lên mặt.”*
  2. Thêm lớp máy ảnh + ánh sáng: *”chụp bằng 35mm f/1.8, ánh sáng màn hình làm nguồn chính, tông teal trầm, hạt phim nhẹ.”*
  3. Chốt phong cách + tỉ lệ: *”ảnh chụp thực tế, điện ảnh, 16:9.”*
  4. Sinh 4 bản nháp, chọn bản bố cục ưng nhất, ghi lại seed của bản đó (nếu tool có).
  5. Tinh chỉnh có kiểm soát: giữ seed, chỉ đổi 1 biến mỗi lần (ánh sáng *hoặc* màu áo), để so sánh sạch.
  6. Dọn lỗi bằng negative / lời: nếu tay lỗi, thêm negative deformed hands, extra fingers; nếu thừa vật thể, nói “bỏ … ở hậu cảnh”. Với ảnh có chữ, ưu tiên Nano Banana Pro vì render chữ tốt hơn hẳn.

Kinh nghiệm thực chiến của Thuật

Mình sản xuất ảnh AI cho blog và thumbnail YouTube mỗi ngày, và đây là những gì trả giá mới rút ra được:

Sai lầm 1 — Đổ tag cho Flux như thời Stable Diffusion. Giai đoạn đầu mình gõ kiểu *”woman, forest, sunlight, beautiful, 8k, masterpiece”*. Ảnh ra nhạt và sai bố cục. Chuyển sang viết câu văn mô tả đầy đủ, cùng chủ đề mà ảnh sắc nét và đúng ý hơn hẳn. Bài học: model mới đọc *ngữ pháp*, không đọc *đống tag*.

Sai lầm 2 — Đổi cả prompt lẫn seed cùng lúc. Mỗi lần ảnh chưa ưng mình sửa 5 thứ một lượt rồi bấm lại — thành ra không biết cái gì làm nó tốt/tệ hơn. Giờ mình giữ seed, đổi đúng 1 biến/lần. Việc chỉnh ảnh từ mò mẫm thành có phương pháp, và mình dựng lại được đúng bố cục đã ưng.

Sai lầm 3 — Nhồi negative prompt 30 dòng cho model mới. Mình từng bê nguyên list negative dài từ SD 1.5 sang SDXL, ảnh bị “co” và mất chi tiết. Rút xuống dưới 10 từ thì ảnh thở ra ngay.

Kết quả: Trước đây mình mất khoảng 25 phút và 4–5 lần sinh lại mới ra 1 thumbnail dùng được; sau khi theo quy trình 6 bước còn khoảng 8 phút và hiếm khi phải làm lại. Số này bạn tự đo trên workflow của mình rồi điền vào cho thật.

> Muốn xem tool nào hợp túi tiền và nhu cầu, đọc bài mình so sánh chi tiết: *Tool tạo ảnh AI 2026: so sánh chất lượng, giá và trường hợp dùng*.

FAQ — câu hỏi thường gặp

Prompt tạo ảnh nên dài hay ngắn?

Đủ chi tiết, không thừa. Với Flux và Nano Banana Pro, câu văn mô tả dài mà cụ thể (chủ thể, máy ảnh, ánh sáng) cho kết quả tốt hơn. Với Midjourney, prompt gọn + tham số (--ar, --stylize) thường đủ.

Negative prompt có bắt buộc không?

Không. Nó là công cụ sửa lỗi. Model càng mới càng ít cần. Chỉ thêm khi ảnh dính lỗi cụ thể (tay hỏng, watermark, chữ thừa).

Vì sao cùng prompt mà mỗi lần ra ảnh khác nhau?

Vì seed đổi mỗi lần sinh. Muốn lặp lại một bố cục, ghim seed (nếu tool cho) hoặc dùng ảnh tham chiếu.

CFG bao nhiêu là đẹp?

Bắt đầu ở 6–7. Ảnh thực tế để 6, prompt phức tạp nhiều chi tiết đẩy 8–9. Trên 9 dễ cháy màu.

Tool nào tốt nhất cho ảnh có chữ (thumbnail, poster, infographic)?

Nano Banana Pro (Gemini 3 Pro Image) — điểm mạnh lớn nhất của nó là render chữ nhiều ngôn ngữ khá chuẩn và nhận tới 14 ảnh tham chiếu để giữ thương hiệu/nhân vật. Vẫn phải kiểm lại chính tả chi tiết nhỏ.

Seed và ảnh tham chiếu khác nhau thế nào?

Seed giữ *bố cục ngẫu nhiên* giống nhau; ảnh tham chiếu giữ *nội dung/nhân vật/phong cách* bạn đưa vào. Model mới nghiêng về cách dùng ảnh tham chiếu.

Prompt tiếng Việt có dùng được không?

Được với model hiểu ngôn ngữ tự nhiên như Nano Banana Pro, nhưng thuật ngữ nhiếp ảnh (85mm f/1.8, golden hour, three-point lighting) nên để tiếng Anh vì model được huấn luyện chủ yếu trên dữ liệu Anh ngữ.

Kết: viết prompt ảnh là kỹ năng đạo diễn, không phải phép thuật

Ảnh AI đẹp không đến từ “prompt bí mật”, mà từ việc bạn dàn cảnh cụ thể như một đạo diễn: chủ thể rõ, ống kính rõ, ánh sáng rõ, rồi mới đến bốn nút kiểm soát — ngôn ngữ nhiếp ảnh, negative prompt, seed, CFG — dùng đúng chỗ trên đúng tool. Bắt đầu từ quy trình 6 bước ở trên, giữ seed và đổi 1 biến/lần, bạn sẽ đi từ “may rủi” sang “có kiểm soát”.

Đây là Spoke của series Prompt Engineering thực chiến. Đọc tiếp bài Hub *Prompt Engineering 2026* để nắm khung tổng, và *Cấu trúc prompt 6 lớp* nếu bạn cần viết prompt chữ chuẩn. Muốn nhận trọn bộ prompt mẫu + template mình đang dùng, để lại email nhận bộ tài liệu miễn phí của VIGOACADEMY.

**

a

adminvigomedia

Nhà sáng tạo nội dung về AI, YouTube Automation và Affiliate Marketing. Chia sẻ kiến thức thực chiến từ kinh nghiệm vận hành thật.