Quy trình làm video YouTube faceless bằng AI gồm 7 bước: chọn đề tài, viết kịch bản, lồng giọng AI, dựng hình, edit, làm thumbnail, và đăng kèm khai báo AI. Người mới mất khoảng 3–4,5 giờ cho 1 video 8–10 phút. Khi có hệ thống và làm theo lô (batch), thời gian rút xuống còn 1,5–2 giờ/video — đó mới là ngưỡng để ra đều 4–5 video/tuần mà không kiệt sức.
Bài này là phần thực hành của series xây kênh faceless bằng AI. Hub đã cho bạn bức tranh tổng thể; ở đây mình bấm đồng hồ từng bước, chỉ rõ tool nào cho ngân sách nào, và cách batch để nhân đôi năng suất.
TL;DR — 6 điều cần nhớ
- Quy trình chuẩn có 7 bước; nút thắt cổ chai luôn là khâu dựng & edit (chiếm ~40% thời gian).
- Người mới: 3–4,5 giờ/video. Có hệ thống + batch: 1,5–2 giờ/video.
- Bộ tool tối thiểu chỉ tốn ~22–42$/tháng (giọng AI + ảnh/video AI + editor free).
- ElevenLabs Creator 22$/tháng = 100.000 credit; với model Flash (0,5 credit/ký tự) đủ cho ~25–28 video 8 phút (ElevenLabs).
- Batch theo công đoạn (viết 5 kịch bản liền tay, rồi lồng giọng 5 bài liền tay…) tiết kiệm 30–40% thời gian so với làm tuần tự từng video.
- Bước dễ quên nhất mà lại làm mất suất kiếm tiền: khai báo AI khi đăng và tránh nội dung bị gắn “inauthentic content” (YouTube Help).
Làm 1 video faceless bằng AI mất bao lâu?
Một video faceless 8–10 phút mất 3–4,5 giờ khi bạn mới bắt đầu, và 1,5–2 giờ khi đã có template và làm theo lô. Con số này giả định bạn tự làm một mình, không thuê ngoài, và dùng bộ tool AI phổ thông. Đây là bảng phân bổ thời gian thực tế theo từng công đoạn:
| Bước | Công đoạn | Người mới | Có hệ thống |
|---|---|---|---|
| 1 | Chọn đề tài + research | 20–30 phút | 10 phút |
| 2 | Viết & biên tập kịch bản | 30–45 phút | 15–20 phút |
| 3 | Lồng giọng AI + sửa lỗi đọc | 15–20 phút | 10 phút |
| 4 | Gom b-roll + tạo ảnh/clip AI | 30–45 phút | 20 phút |
| 5 | Dựng & edit (nút thắt cổ chai) | 60–90 phút | 40–50 phút |
| 6 | Thumbnail | 20–30 phút | 10 phút |
| 7 | Metadata + đăng + khai báo AI | 15 phút | 10 phút |
| Tổng | ~3–4,5 giờ | ~1,5–2 giờ |
Điều quan trọng cần hiểu: thời gian không giảm đều ở mọi bước. Nó giảm mạnh nhất ở khâu research và edit khi bạn có template và preset. Vì vậy đầu tư làm sẵn template ngay từ video thứ 2–3 là khoản có lời nhất.
Quy trình sản xuất 1 video faceless gồm mấy bước?
Quy trình gồm 7 bước tuần tự, mỗi bước có một đầu ra rõ ràng để bước sau dùng luôn:
- Chọn đề tài & research → đầu ra: 1 tiêu đề + dàn ý 5–7 ý chính.
- Viết & biên tập kịch bản → đầu ra: file text sạch, đã bỏ dấu ngoặc và ghi chú.
- Lồng giọng AI → đầu ra: 1 file audio đã sửa chỗ đọc sai.
- Dựng hình (b-roll, ảnh, clip AI) → đầu ra: thư mục media khớp theo từng đoạn.
- Edit & lắp ráp → đầu ra: bản dựng có phụ đề, nhạc nền, cắt nhịp.
- Làm thumbnail → đầu ra: 1–2 phương án thumbnail để A/B test.
- Đăng + tối ưu + khai báo AI → đầu ra: video công khai, đúng metadata, đã bật nhãn AI nếu cần.
Nguyên tắc vàng: không nhảy bước. Mỗi lần bạn quay lại sửa kịch bản sau khi đã lồng giọng, bạn mất gấp đôi thời gian. Chốt xong bước trước rồi mới sang bước sau.
Bước 1–2: Research và viết kịch bản sao cho nhanh mà không ra “giọng AI”?
Khâu chữ nghĩa quyết định retention, nên đừng để AI viết một mạch rồi copy. Quy trình 20–45 phút của mình:
- Research (20 phút): lấy 3 nguồn thật (video top trong ngách, 1 bài gốc, 1 số liệu mới), ghi ra 5–7 ý. Đừng đọc quá 3 nguồn — bạn sẽ sa đà.
- Viết nháp (10 phút): cho AI dàn ý + giọng văn mẫu, yêu cầu viết theo cấu trúc hook 30 giây. Cách viết hook giữ chân xem chi tiết ở bài kịch bản trong series.
- Biên tập tay (10–15 phút): đây là bước không được bỏ. Đọc to, cắt câu sáo rỗng, thêm 1 ví dụ thật của bạn. Đúng như chính sách inauthentic content của YouTube, điều tách bạn khỏi kênh bị gắn cờ là insight gốc — không phải AI có viết hay không.
Đầu ra là file text sạch: bỏ hết dấu ngoặc chỉ dẫn, viết số thành chữ ở chỗ AI hay đọc sai (ví dụ “2026” → “hai không hai sáu” nếu tool đọc lỗi).
Bước 3: Lồng giọng AI — chọn tool và cấu hình thế nào?
Với thị trường Việt, giọng AI hiện đủ tự nhiên để làm faceless, miễn bạn xử lý đúng. Mình dùng ElevenLabs cho đa ngôn ngữ; gói Creator 22$/tháng cấp 100.000 credit, và vì model Flash/Turbo chỉ tốn 0,5 credit/ký tự nên một kịch bản 8 phút (~7.000 ký tự) chỉ ngốn ~3.500 credit — tức khoảng 25–28 video/tháng trong 1 gói (ElevenLabs Pricing). Cách chọn và xử lý giọng cho tự nhiên mình đã mổ xẻ riêng ở bài giọng đọc AI.
Ba chỉnh sửa bắt buộc sau khi tạo audio: (1) nghe lại nguyên bài để bắt chỗ đọc sai tên riêng; (2) chèn khoảng lặng 0,3–0,5 giây ở chỗ chuyển ý; (3) chuẩn hóa âm lượng. Bỏ 3 bước này, giọng nghe “máy” ngay.
Bước 4–5: Dựng hình và edit — khâu ngốn thời gian nhất
Đây là nút thắt cổ chai, chiếm ~40% tổng thời gian, nên tối ưu ở đây có lời nhất. Ba cách dựng hình theo ngân sách:
- Ngân sách 0đ: kho b-roll miễn phí (Pexels, Pixabay) + ảnh AI free. Chậm và dễ trùng hình với kênh khác.
- Ngân sách vừa: ảnh AI chất lượng cao (Nano Banana Pro / Whisk) cho hình tĩnh + Ken Burns zoom trong editor.
- Ngân sách cao: clip AI động. Google Veo 3 giá 19,99$/tháng (Pro), và bản Veo 3.1 (1/2026) đã hỗ trợ dọc 9:16, 4K và giữ nhân vật nhất quán — hữu ích nếu ngách của bạn cần cảnh chuyển động (Google Veo pricing 2026).
Edit thì dùng CapCut hoặc DaVinci Resolve (đều có bản free đủ dùng). Mẹo rút thời gian: làm sẵn 1 project template có intro, lower-third, preset phụ đề và nhạc nền. Video sau chỉ việc thay media — đây là khác biệt giữa 90 phút và 45 phút edit.
Bước 6–7: Thumbnail, metadata và khai báo AI
Thumbnail và metadata quyết định video có được click hay không — kịch bản hay mà thumbnail dở thì không ai vào xem. Làm 1–2 phương án thumbnail để A/B test (công thức CTR chi tiết ở bài thumbnail trong series), rồi điền title + mô tả + tag đúng từ khóa.
Bước cuối cùng dễ quên nhất nhưng liên quan trực tiếp đến kiếm tiền:
- Khai báo AI: nếu video có hình/giọng do AI tạo trông như thật, bạn phải bật nhãn “altered or synthetic content” khi đăng.
- Tránh gắn cờ “inauthentic content”: từ 15/7/2025, YouTube đổi tên chính sách “repetitious” thành “inauthentic” để nhắm vào nội dung mass-produced, template hàng loạt không có góc nhìn gốc — loại này không đủ điều kiện kiếm tiền (YouTube channel monetization policies).
- Nhớ ngưỡng YPP: cần 500 sub + 3.000 giờ xem (hoặc 3 triệu view Shorts/90 ngày) + 3 video công khai/90 ngày để mở fan funding; 1.000 sub + 4.000 giờ xem để bật doanh thu quảng cáo (Expanded YPP — YouTube Help). Chi tiết mình phân tích ở bài điều kiện bật kiếm tiền.
Bộ tool tối thiểu để bắt đầu tốn bao nhiêu?
Bạn có thể khởi động với ~22–42$/tháng, không cần đầu tư lớn. Bảng so sánh theo ngân sách:
| Công đoạn | Free (0đ) | Tiết kiệm | Chuyên nghiệp |
|---|---|---|---|
| Kịch bản | AI bản free | AI bản trả phí | AI bản trả phí |
| Giọng đọc | Free TTS giới hạn | ElevenLabs Creator 22$ | ElevenLabs Pro 99$ |
| Hình ảnh | Pexels + ảnh AI free | Nano Banana Pro / Whisk | + Veo 3 Pro ~20$ |
| Edit | CapCut / DaVinci free | CapCut / DaVinci free | DaVinci Studio |
| Ước tính/tháng | ~0đ | ~22–42$ | ~120$+ |
Lời khuyên: bắt đầu ở cột “Tiết kiệm”. Cột free đủ để test ngách nhưng chậm; cột chuyên nghiệp chỉ đáng khi kênh đã có doanh thu. Chọn ngách trước khi mua tool — cách tìm ngách CPM cao mình hướng dẫn ở bài chọn ngách.
Làm sao rút thời gian để ra 4–5 video/tuần?
Bí quyết không phải làm mỗi video nhanh hơn, mà là batch theo công đoạn thay vì làm tuần tự từng video. Thay vì hoàn thành trọn video 1 rồi mới sang video 2, bạn gom cùng một loại việc lại:
- Ngày 1: research + viết 5 kịch bản liền tay (não ở “chế độ viết”).
- Ngày 2: lồng giọng cả 5 bài một lượt (mở tool một lần, thao tác lặp).
- Ngày 3: dựng hình + edit 5 video (dùng chung 1 template).
- Ngày 4: làm 5 thumbnail + lên lịch đăng.
Batch tiết kiệm 30–40% thời gian vì bạn không phải “khởi động lại não” và mở/tắt tool liên tục cho mỗi việc nhỏ. Đây là cách một người vận hành được lịch đăng đều mà không kiệt sức.
🔥 Kinh nghiệm thực chiến của Thuật
Sai lầm mình mắc suốt 2 tháng đầu: làm tuần tự từng video — viết xong lồng giọng, lồng giọng xong edit, hết video này mới sang video khác. Kết quả: mỗi video mất 4,5 giờ và mình chỉ ra được 2–3 video/tuần trước khi đuối.
Cách sửa: chuyển sang batch theo công đoạn và làm sẵn project template trong DaVinci. Sau khi đổi cách làm, thời gian trung bình rớt từ 4,5 xuống còn 1,5–2 giờ/video, và mình giữ được nhịp 8–10 video/tuần trên 5 kênh cùng lúc.
Bài học lớn nhất: nút thắt luôn ở khâu edit, không phải khâu viết. Người mới hay tối ưu chỗ viết kịch bản (vốn đã nhanh) mà bỏ quên edit (vốn ngốn 40% thời gian). Bỏ một buổi làm template edit tử tế là khoản đầu tư lời nhất mình từng làm cho kênh.
FAQ
1. Làm video faceless bằng AI có bị YouTube phạt không?
Không, nếu video có góc nhìn gốc và bạn khai báo AI đúng. YouTube chỉ nhắm vào nội dung mass-produced, template hàng loạt không thêm giá trị (YouTube Help).
2. Người mới thực sự mất bao lâu cho video đầu tiên?
Thường 5–6 giờ cho video đầu vì phải học tool. Từ video thứ 3–4, khi có template, sẽ về mức 3–4,5 giờ rồi giảm tiếp.
3. Có bắt buộc dùng tool trả phí không?
Không bắt buộc. Bạn có thể bắt đầu 0đ để test ngách, nhưng giọng AI free thường giới hạn ký tự và nghe kém tự nhiên hơn.
4. Nên tự làm hết hay thuê ngoài khâu nào?
Khi đã ổn định, khâu đầu tiên nên thuê ngoài là edit — vì nó ngốn thời gian nhất và dễ chuẩn hóa bằng brief + template.
5. Video dài bao nhiêu phút là hợp lý cho kênh faceless?
8–12 phút là khoảng cân bằng giữa thời lượng xem (giúp đạt giờ xem YPP) và công sức sản xuất.
6. Batch bao nhiêu video một lần là vừa?
Bắt đầu với 3–5 video/lô. Nhiều hơn dễ mất kiểm soát chất lượng khi bạn còn mới.
Kết: điều duy nhất cần nhớ
Tốc độ không đến từ việc gõ nhanh hay tool đắt, mà từ hệ thống: template sẵn + batch theo công đoạn + không nhảy bước. Người mới mất 3–4,5 giờ/video là bình thường; mục tiêu của tháng đầu là dựng cho xong bộ template để tháng sau về 1,5–2 giờ.
Bắt đầu từ bài Hub xây kênh faceless từ 0 để nắm toàn cảnh, rồi quay lại đây mỗi khi cần bảng thời gian. Nếu muốn mình chia sẻ bộ template kịch bản + preset edit đang dùng, xem thêm ebook và khóa học trong phần tài nguyên của VIGOACADEMY.
*Tác giả: Hoàng Trọng Thuật — VIGOACADEMY. Cập nhật 17/08/2026.*
