Bỏ qua đến nội dung
Anh em web maxyt chuyển qua likesub79.com, nhập tài khoản cũ để sử dụng nha! Xem ngay
MAXYTB.VN

Cấp 3 – Sản xuất video: kịch bản, giọng đọc, hình ảnh, dựng

Giọng đọc: người thật hay giọng AI

7 phút đọcBài 18/42 của khóa

Nội dung đang chờ người duyệt. Nội dung có AI hỗ trợ soạn.

Chọn giữa giọng người thật và giọng AI, lo đủ giấy phép thương mại, nắm ranh giới khi clone giọng, và làm voiceover rõ ràng, tự nhiên cho video đầu tiên.

Giọng đọc là "gương mặt" của kênh faceless

Kênh không lộ mặt thì giọng đọc là thứ người xem nghe suốt 8–12 phút. Bài này giúp bạn chọn phương án, lo đủ giấy phép và làm voiceover nghe tự nhiên. Ví dụ xuyên suốt vẫn là kênh faceless tiếng Anh kể lại các vụ đắm tàu có thật.

So sánh các lựa chọn

Lựa chọnChi phí tham khảoĐiểm mạnhCần lưu ý
Tự thu giọng mìnhMicro và một phòng yên tĩnhKhác biệt, dễ xây thương hiệuCần luyện đọc; kênh Mỹ cần tiếng Anh tự nhiên
Thuê người bản ngữKhoảng 30–80 USD cho 10 phút (blog ngành, chưa kiểm chứng độc lập)Tự nhiên, đúng văn hóaTốn tiền mỗi video; cần thỏa thuận rõ quyền sử dụng
Giọng AI trả phíElevenLabs Starter 6 USD/tháng, Creator 22 USD/thángNhanh, sửa dễDễ đều đều, cần người nghe duyệt
Clone giọng chính mìnhTừ gói Starter (instant voice clone)Giữ giọng riêng, bớt thời gian thuChỉ được clone giọng của bạn

Gợi ý chọn:

  • Kênh tiếng Việt: tự thu là lợi thế lớn, vì bạn hiểu khán giả và phát âm tự nhiên.
  • Kênh "key Mỹ" mà tiếng Anh nói của bạn chưa tự nhiên: dùng giọng AI trả phí hoặc thuê người bản ngữ, và luôn có một người giỏi tiếng Anh nghe duyệt.

Bước 1: Nếu dùng giọng AI, lo giấy phép trước

Theo trang giá ElevenLabs (truy cập 27/09/2026):

GóiGiá/thángCreditDùng cho kênh kiếm tiền?
Free0 USD10.000Không (không có giấy phép thương mại)
Starter6 USD30.000Có, kèm instant voice clone
Creator22 USD (tháng đầu thường giảm 50%)121.000Có, kèm professional voice clone
Pro99 USD600.000Có, cho đội hoặc video rất dài

Quy đổi phổ biến: khoảng 1.000 ký tự ≈ 1 phút đọc, nên gói Creator ≈ 120 phút đọc mỗi tháng. Model V2 Multilingual tính 1 ký tự = 1 credit.

Tự ước tính nhu cầu (kiểm tra lại với kịch bản thật): video 10 phút cần khoảng 10.000 credit cho một lần đọc. Cộng các lần đọc lại để sửa, nên tính 15.000–20.000 credit mỗi video. Như vậy:

  • Lịch 7 ngày/1 video (4 video 10 phút/tháng) cần khoảng 60.000–80.000 credit: gói Creator hợp lý.
  • Video 20–30 phút cần khoảng 25.000–50.000 credit mỗi video; 4 video/tháng có thể vượt gói Creator, khi đó cân nhắc gói Pro, model tốn ít credit hơn, hoặc tự thu giọng.
  • Chỉ làm thử 1 video: gói Starter là đủ.

Chụp màn hình gói đang dùng và hóa đơn, lưu vào thư mục 03_voice của video và ghi vào nhật ký giấy phép đã lập ở Cấp 2.

Bước 2: Ranh giới khi clone giọng

  • Clone giọng của chính bạn để lồng tiếng: YouTube ghi rõ không cần công bố AI.
  • Tuyệt đối không clone giọng người khác, người nổi tiếng hay YouTuber khác khi chưa có sự đồng ý rõ ràng, tốt nhất bằng văn bản.
  • YouTube đã mở tính năng phát hiện giả mạo khuôn mặt (likeness detection) cho mọi người từ 18 tuổi và đang bổ sung nhận diện giọng nói (chi tiết ở Cấp 7). Giả giọng người khác ngày càng dễ bị phát hiện.

Bước 3: Nếu tự thu giọng

  1. Chọn phòng nhỏ, nhiều đồ vải (rèm, chăn, tủ quần áo) để giảm vang. Tắt quạt, điều hòa khi thu.
  2. Cố định micro, giữ khoảng cách từ miệng tới micro như nhau suốt buổi thu.
  3. Thu từng đoạn. Đọc sai thì dừng một nhịp rồi đọc lại cả câu, để khi dựng dễ cắt.
  4. Thu thử 30 giây, nghe lại bằng tai nghe rồi mới thu cả bài.
  5. Xuất WAV 48kHz cho khớp với âm thanh khi xuất video (AAC 48kHz).

Thời gian dự kiến: tự thu và xử lý 1,5–3 giờ; giọng AI 0,5–1 giờ (ước tính kinh nghiệm, không phải số của YouTube).

Bước 4: Làm giọng AI bớt đều đều

  1. Chia nhỏ: render theo từng đoạn (mỗi chương một file), không render cả bài một lần.
  2. Sửa phát âm tên riêng: tên tàu, tên người, địa danh. Nếu AI đọc sai, viết lại theo cách đọc trong bản dành cho giọng đọc, còn bản chuẩn thì giữ cho phụ đề.
  3. Thêm khoảng ngắt: xuống dòng, dấu chấm, dấu ba chấm trước các tiết lộ; dùng thẻ ngắt nếu công cụ hỗ trợ.
  4. Đổi nhịp: đoạn bối cảnh đọc chậm, đoạn cao trào câu ngắn và nhanh hơn.
  5. Render 2–3 bản cho các câu quan trọng (hook, re-hook, kết) rồi chọn bản hay nhất.
  6. Nghe duyệt: với kênh nhắm khán giả Mỹ, một người giỏi tiếng Anh nghe lại toàn bộ, đánh dấu chỗ nhấn sai, ngữ điệu sai.

Bước 5: Tránh rập khuôn

Bản thân giọng AI không bị cấm; rủi ro nằm ở sự lặp lại. Trong chính sách spam, YouTube nêu ví dụ các kênh dùng đúng một nhạc nền và hình ảnh AI lặp lại trên nhiều video, mỗi video chỉ là giọng đọc một kịch bản do AI viết. Cách tránh:

  • Kịch bản có nghiên cứu và góc nhìn riêng (hai bài đầu của Cấp 3).
  • Hình ảnh chọn theo từng câu thoại (bài hình ảnh ngay sau đây).
  • Nhạc và nhịp dựng thay đổi theo nội dung từng video (bài dựng video).

Checklist

  • Đã chọn phương án giọng phù hợp với thị trường (Việt hay Mỹ) và năng lực của mình.
  • Nếu dùng giọng AI: đang ở gói trả phí có giấy phép thương mại, không dùng gói Free.
  • Đã ước tính credit theo độ dài video và lịch đăng thật.
  • Đã lưu ảnh chụp gói, hóa đơn hoặc thỏa thuận với người đọc thuê vào thư mục 03_voice và nhật ký giấy phép.
  • Chỉ clone giọng của chính mình, hoặc có sự đồng ý bằng văn bản của chủ giọng.
  • Tên riêng được phát âm đúng trong toàn bộ bài.
  • Có khoảng ngắt trước các tiết lộ và nhịp đọc thay đổi theo từng đoạn.
  • Hook, re-hook và câu kết đã render hoặc thu 2–3 bản để chọn.
  • Kênh nhắm khán giả Mỹ: có người giỏi tiếng Anh nghe duyệt toàn bộ.
  • File voice xuất WAV 48kHz, chia theo chương.

Số liệu tham khảo

  • ElevenLabs: Free 0 USD/10.000 credit (không có giấy phép thương mại); Starter 6 USD/30.000 credit (có giấy phép thương mại, instant voice clone); Creator 22 USD/121.000 credit (professional voice clone, tháng đầu thường giảm 50%); Pro 99 USD/600.000 credit – elevenlabs.io/pricing, truy cập 27/09/2026.
  • Quy đổi phổ biến khoảng 1.000 ký tự ≈ 1 phút đọc, nên gói Creator ≈ 120 phút/tháng; model V2 Multilingual tính 1 ký tự = 1 credit – elevenlabs.io/pricing, truy cập 27/09/2026.
  • Thuê voiceover người bản ngữ khoảng 30–80 USD cho 10 phút – blog ngành fluxnote.io, 2026, chưa kiểm chứng độc lập.
  • Clone giọng của chính mình để lồng tiếng không cần công bố AI – YouTube Help 14328491, truy cập 27/09/2026.
  • Likeness detection mở cho mọi người dùng từ 18 tuổi từ 17/05/2026 (Tubefilter, 18/05/2026); nhận diện giọng nói được công bố bổ sung tại Made on YouTube 2026 (Biometric Update, 09/2026).
  • Voiceover: giọng AI 0,5–1 giờ; tự thu và xử lý 1,5–3 giờ mỗi video – ước tính kinh nghiệm, không phải số của YouTube.

Lỗi thường gặp

  • Dùng gói Free của công cụ giọng AI cho kênh kiếm tiền.
  • Chọn gói credit theo video 10 phút rồi làm video 30 phút, hết credit giữa tháng.
  • Clone giọng người nổi tiếng hoặc YouTuber khác khi chưa được đồng ý.
  • Không ai nghe duyệt, để giọng AI đọc sai tên riêng hoặc nhấn sai ngữ điệu tiếng Anh.
  • Render cả bài một lần, không chỉnh nhịp, giọng đều đều từ đầu đến cuối.
  • Dùng cùng một giọng, cùng một nhạc nền, cùng một kiểu ảnh cho mọi video, khớp đúng ví dụ spam mà YouTube nêu.

Bài tập

Lấy 60 giây đầu kịch bản và làm 2 phiên bản giọng: 2 giọng AI khác nhau, hoặc 1 giọng AI và 1 bản tự thu. Sửa ít nhất 5 chỗ (phát âm tên riêng, khoảng ngắt, nhịp đọc). Nhờ một người (với kênh Mỹ là người giỏi tiếng Anh) nghe mà không biết bản nào là bản nào, chọn bản tự nhiên hơn và ghi lý do. Tính số credit cả tháng theo độ dài video và lịch đăng của bạn, chụp màn hình gói đang dùng có giấy phép thương mại, lưu vào thư mục 03_voice, rồi hoàn thiện voiceover cho cả video.

Nguồn tham khảo

Mục lục khóa học

Zalo Mr TrườngZalo Mr Hà