Tất cả bài viết
Trên Tay TTS

Hướng dẫn dùng Trên Tay TTS: đọc văn bản và nhân bản giọng

Từng bước cài Trên Tay TTS, đăng nhập, nhân bản giọng từ file mẫu 5–15 giây, tạo giọng theo mô tả, chỉnh tốc độ, đọc hàng loạt và xử lý lỗi thường gặp.

13 phút đọc13 phầnHướng dẫnTTS
Mục lục (13 phần)
  1. 1. Máy của bạn cần gì
  2. 2. Nhận phần mềm và cài đặt
  3. 3. Đăng nhập
  4. 4. Lần đầu mở: chờ tải bộ giọng
  5. 5. Làm quen màn hình chính
  6. 6. Nhân bản giọng từ file mẫu (thẻ Clone Voice)
  7. 7. Tạo giọng theo mô tả (thẻ Voice Design)
  8. 8. Chỉnh tốc độ và các thông số
  9. 9. Xuất file và đọc hàng loạt
  10. 10. Đọc hội thoại hai người (thẻ Dialogue)
  11. 11. Mẹo để giọng đọc hay hơn
  12. 12. Khi gặp lỗi
  13. 13. Còn vướng bước nào?

Bạn cần giọng đọc cho video, bài giảng hay sách nói nhưng ngại thu âm đi thu âm lại? Trên Tay TTS là phần mềm chạy ngay trên máy tính Windows: bạn dán văn bản vào, bấm Start, vài chục giây sau có file âm thanh đọc lại đúng nội dung đó.

Điểm hay nhất là nhân bản giọng: đưa cho phần mềm một đoạn ghi âm ngắn giọng của bạn (khoảng 5–15 giây), nó sẽ đọc mọi văn bản về sau bằng chính chất giọng ấy. Không có file mẫu thì bạn mô tả giọng mình muốn (nam hay nữ, trẻ hay lớn tuổi, trầm hay cao) và phần mềm tự tạo ra một giọng như vậy.

Bài này đi từng bước, từ lúc kiểm tra máy tới lúc có file âm thanh đầu tiên. Bạn chưa quen máy tính cũng làm theo được.

Trên Tay TTS - phần mềm đọc văn bản thành giọng nói tiếng Việt chạy trên máy tính

1. Máy của bạn cần gì

Phần mềm này dùng trí tuệ nhân tạo để tạo giọng nên khá nặng. Trước khi tải, bạn soát máy theo bảng sau:

Hạng mụcCần có
Hệ điều hànhWindows 10 hoặc Windows 11, bản 64-bit
Card đồ hoạCard NVIDIA, nên có từ 6 GB bộ nhớ đồ hoạ (VRAM) trở lên thì đọc nhanh
Ổ cứng trốngKhoảng 10 GB: phần mềm chừng 5 GB, bộ giọng tải về lần đầu chừng 3 GB, phần còn lại để chứa file âm thanh
MạngCần mạng lúc đăng nhập và lần đầu tải bộ giọng

Cách xem máy có card NVIDIA không: bấm chuột phải vào thanh tác vụ, chọn Task Manager (Trình quản lý tác vụ), mở thẻ Performance (Hiệu suất). Nếu thấy dòng GPU ghi chữ "NVIDIA GeForce…" là được. Máy chỉ có card Intel hoặc AMD thì nên hỏi lại trước khi dùng, vì phần mềm được làm để chạy trên card NVIDIA.

2. Nhận phần mềm và cài đặt

Nhận phần mềm

  1. Vào trang sản phẩm Trên Tay TTS, bấm Mua ngay.
  2. Ở bước thanh toán, mã tặng giảm 100% được áp sẵn nên đơn hàng về 0đ. Mỗi tài khoản nhận được một máy, dùng vĩnh viễn.
  3. Xong đơn, vào trang Tài khoản trên web, bấm nút Tải về ở thẻ Trên Tay TTS.

Cài đặt

  1. File tải về là file nén. Bấm chuột phải vào file, chọn Extract All (Giải nén tất cả) và giải nén ra ổ cứng, ví dụ D:\TrenTayTTS. Đừng chạy thẳng trong file nén, phần mềm sẽ không chạy đúng.
  2. Mở thư mục vừa giải nén, bấm đúp vào TRENTAY TTS.exe.
  3. Giữ nguyên mọi file trong thư mục đó, nhất là ffmpeg.exe nằm cạnh file chạy. Đừng xoá hay dời riêng file nào.

Nên tạo lối tắt ra màn hình: bấm chuột phải vào TRENTAY TTS.exe → Send to → Desktop (create shortcut). Lần sau bấm đúp ở màn hình là mở.

3. Đăng nhập

Mở phần mềm lên, bạn sẽ thấy cửa sổ Đăng nhập — TRENTAY TTS. Có hai cách đăng nhập:

  • Email tài khoản bạn đã mua trên app.trentay.com, kèm mật khẩu web.
  • Tên phần mềm (dạng không có chữ @) nếu lúc mua bạn đã đặt tên đăng nhập riêng cho phần mềm, kèm mật khẩu của tên đó.

Điền Tài khoản và Mật khẩu, bấm ĐĂNG NHẬP. Phần mềm nhớ phiên đăng nhập, lần sau mở lên không phải gõ lại.

Một tài khoản chỉ dùng trên một máy. Nếu bạn đăng nhập ở máy khác, máy cũ sẽ tự thoát ra với lời báo "Tài khoản này vừa được dùng trên một máy khác…". Muốn quay lại máy cũ thì cứ đăng nhập lại, không phải báo ai.

4. Lần đầu mở: chờ tải bộ giọng

Sau khi đăng nhập, cửa sổ chính hiện ra. Bên phải là khung System Log (nhật ký), nơi phần mềm báo nó đang làm gì. Lần đầu tiên, phần mềm tải bộ giọng khoảng 3 GB về máy, nên có thể mất từ vài phút tới lâu hơn tuỳ mạng. Bạn cứ để yên, đừng tắt.

Khi nhật ký hiện dòng SUCCESS: Ready for processing! là đã sẵn sàng. Những lần mở sau không phải tải lại, chỉ cần chờ phần mềm nạp giọng vào máy vài chục giây.

Nếu bạn bấm Start sớm quá, nhật ký sẽ báo Model not loaded yet, please wait. Đó không phải lỗi, chỉ là chưa nạp xong. Chờ thêm chút rồi bấm lại.

Giao diện Trên Tay TTS thẻ Clone Voice: ô giọng mẫu, ô văn bản, thông số tốc độ và nút Start

5. Làm quen màn hình chính

Phần mềm có ba thẻ ở góc trên bên trái:

ThẻDùng để làm gì
Clone VoiceNhân bản giọng: đọc văn bản bằng giọng trong một file ghi âm mẫu
Voice DesignTạo giọng theo mô tả, không cần file mẫu
DialogueĐọc một đoạn hội thoại giữa hai người, mỗi người một giọng

Phía dưới là hai nút lớn: Start (xanh, bắt đầu đọc) và Stop (đỏ, dừng giữa chừng). Thanh chạy dưới cùng cho biết phần mềm đang làm việc.

6. Nhân bản giọng từ file mẫu (thẻ Clone Voice)

Chuẩn bị file giọng mẫu cho tốt

Chất lượng giọng đọc ra phụ thuộc gần như hoàn toàn vào file mẫu. Vài điều nên làm:

  • Dài 5–15 giây, nói liền một mạch, tự nhiên như đang trò chuyện.
  • Chỉ có tiếng người nói: không nhạc nền, không tiếng quạt, xe cộ, tiếng vọng phòng trống.
  • Một người nói duy nhất, giọng rõ, không hét, không thì thầm (trừ khi bạn muốn giọng ra như vậy).
  • Giọng mẫu nói tiếng Việt thì đọc tiếng Việt sẽ tự nhiên nhất.
  • Định dạng nhận được: .wav, .mp3, .flac, .ogg, .m4a. Ghi âm bằng điện thoại trong phòng kín, rồi chép file sang máy là được.

Các bước

  1. Ở dòng Reference Voice (.wav), bấm Browse và chọn file giọng mẫu.
  2. Dòng Reference Transcript: gõ đúng câu mà người trong file mẫu đã nói. Không nhớ thì bấm nút tím Transcribe, phần mềm tự nghe và điền giúp. Để trống cũng được, phần mềm tự nghe khi bắt đầu đọc. Gõ đúng lời thì giọng ra sát hơn.
  3. Dòng Output: bấm Browse, chọn thư mục để lưu file âm thanh (ví dụ D:\Giong doc\ra).
  4. Để trống dòng Input (dòng này dành cho đọc hàng loạt, xem mục 9).
  5. Dán văn bản cần đọc vào ô lớn Text to Synthesize.
  6. Bấm Start. Theo dõi nhật ký bên phải, khi thấy DONE. là xong.

Lần đầu dùng một file mẫu, phần mềm mất thêm chút thời gian để "học" giọng. Những lần sau dùng lại đúng file đó sẽ nhanh hơn vì phần mềm đã nhớ.

Lưu ý pháp lý: chỉ nhân bản giọng của chính bạn, hoặc giọng của người đã đồng ý rõ ràng cho bạn dùng. Lấy giọng người khác (ca sĩ, MC, người nổi tiếng, người quen) rồi đăng lên mạng khi chưa được phép có thể xâm phạm quyền nhân thân và bị coi là mạo danh. Khi đăng nội dung dùng giọng nhân bản, nên ghi rõ là giọng tạo bằng AI.

7. Tạo giọng theo mô tả (thẻ Voice Design)

Phần mềm không có sẵn một kho giọng đặt tên để chọn. Thay vào đó, ở thẻ Voice Design bạn mô tả giọng mình muốn bằng các ô chọn, rồi phần mềm tạo giọng tương ứng:

ÔChọn gì
GenderMale (nam), Female (nữ), Auto (để máy tự chọn)
AgeChild (trẻ em), Teenager (tuổi teen), Young Adult (thanh niên), Middle-aged (trung niên), Elderly (người lớn tuổi)
PitchTừ Very Low Pitch (rất trầm) tới Very High Pitch (rất cao)
StyleAuto (bình thường) hoặc Whisper (thì thầm)
English AccentGiọng Anh, Mỹ, Úc… chỉ có tác dụng khi đọc tiếng Anh
Chinese DialectPhương ngữ tiếng Trung, chỉ có tác dụng khi đọc tiếng Trung

Cách làm: chọn thư mục Output, dán văn bản vào Text to Synthesize, chọn các ô mô tả, bấm Start. Đọc tiếng Việt thì hai ô English Accent và Chinese Dialect cứ để Auto.

Giọng tạo theo mô tả có thể hơi khác nhau giữa các lần bấm. Nếu bạn làm cả một loạt video cần cùng một giọng, hãy chọn một file đọc ra ưng ý nhất, cắt lấy 10 giây làm file mẫu, rồi dùng thẻ Clone Voice cho các lần sau.

8. Chỉnh tốc độ và các thông số

Hàng ô nhỏ phía dưới ô văn bản dùng chung cho cả thẻ Clone Voice và Voice Design:

ÔMặc địnhÝ nghĩa
Speed (0.7-1.3)1.0Tốc độ đọc. Nhỏ hơn 1.0 là chậm hơn (ví dụ 0.9 hợp giọng tâm sự), lớn hơn 1.0 là nhanh hơn (ví dụ 1.1 hợp video ngắn)
Inference Steps (4-64)32Số lượt máy "gọt" giọng. Cao hơn thì giọng mượt hơn nhưng chậm hơn. Muốn nhanh để nghe thử thì hạ xuống 16–20
Guidance Scale (0.0-4.0)2.0Mức bám sát giọng mẫu. Cao quá giọng dễ gượng, thấp quá giọng dễ lệch mẫu. Nên giữ trong khoảng 1.5–2.5
Style TextTXTTXT cho văn bản thường. SRT khi bạn dán nội dung một file phụ đề .srt: phần mềm đọc hết lời thoại rồi co giãn tốc độ để file âm thanh dài đúng bằng tổng thời lượng phụ đề
LanguageAutoNgôn ngữ đọc. Bấm vào ô này, gõ Viet để tìm và chọn Vietnamese cho chắc

Phần mềm tự nhớ các thiết lập mỗi lần bạn bấm Start, lần sau mở lên vẫn còn nguyên.

9. Xuất file và đọc hàng loạt

File âm thanh nằm ở đâu

Mọi file đều lưu vào thư mục bạn chọn ở dòng Output, dạng .wav. Tên file lấy từ những chữ đầu của văn bản (bỏ dấu) kèm ngày giờ, ví dụ me_oi_dem_nay_con_ngu_ngoan_nhe_20260921_201405.wav. File .wav mở được bằng mọi phần mềm dựng video như CapCut. Nếu bạn cần file .mp3, hãy đổi định dạng bằng một công cụ chuyển đổi khác.

Đọc cả thư mục văn bản một lượt

  1. Soạn mỗi bài một file .txt, để chung trong một thư mục. Lưu file dạng UTF-8 để giữ đủ dấu tiếng Việt (trong Notepad: Save As → ô Encoding chọn UTF-8).
  2. Ở dòng Input, bấm Browse và chọn thư mục đó. Ô văn bản lớn sẽ bị khoá lại, đó là bình thường.
  3. Chọn giọng như bình thường (file mẫu ở Clone Voice, hoặc các ô mô tả ở Voice Design), chọn Output, bấm Start.
  4. Mỗi file .txt ra một file .wav mang tên của nó. Muốn quay lại gõ tay thì bấm Clear ở dòng Input.

Chọn Style Text = SRT thì phần mềm lấy các file .srt trong thư mục thay cho .txt.

10. Đọc hội thoại hai người (thẻ Dialogue)

  1. Ở ô Voice A: gõ tên nhân vật vào Character Name (ví dụ Hùng), chọn file giọng mẫu ở Reference (.wav). Ô Transcript để trống cũng được.
  2. Làm tương tự ở ô Voice B với nhân vật thứ hai (ví dụ Lan). Hai tên phải khác nhau.
  3. Viết kịch bản vào ô lớn theo dạng Tên: lời thoại, mỗi câu một dòng:
    • Hùng: Chào em, hôm nay em thế nào?
    • Lan: Em ổn anh ạ, cảm ơn anh.
  4. Ô Silence between lines (s) là khoảng nghỉ giữa hai câu, mặc định 0.5 giây.
  5. Chọn Output, bấm Start. Kết quả là một file .wav ghép đủ cả cuộc hội thoại.

Kịch bản dài thì có thể soạn sẵn trong file .txt rồi chọn ở dòng Input (.txt), file âm thanh ra sẽ mang tên file kịch bản.

11. Mẹo để giọng đọc hay hơn

  • Chấm phẩy đầy đủ. Phần mềm ngắt nghỉ theo dấu chấm, dấu phẩy. Câu dài không dấu sẽ đọc một mạch, nghe mệt.
  • Xuống dòng là một nhịp nghỉ. Mỗi lần xuống dòng được coi như một dấu chấm.
  • Ký tự đặc biệt bị bỏ qua: biểu tượng cảm xúc, dấu ngoặc, gạch đầu dòng, ký hiệu như %, &… không được đọc. Muốn đọc thì viết thành chữ, ví dụ "50 phần trăm".
  • Số và từ viết tắt: để chắc ăn, viết ra chữ ("hai nghìn không trăm hai mươi sáu", "thành phố Hồ Chí Minh" thay vì "TP.HCM"), rồi nghe lại.
  • Thử đoạn ngắn trước với 2–3 câu, ưng giọng rồi mới dán cả bài.
  • Bài rất dài nên chia thành nhiều đoạn hoặc nhiều file .txt, vừa dễ sửa vừa đỡ phải đọc lại cả bài khi có một chỗ sai.
  • Muốn dừng giữa chừng thì bấm Stop.

12. Khi gặp lỗi

Phần lớn thông báo nằm ở khung System Log bên phải, dòng lỗi tô màu đỏ.

Bạn thấyNghĩa làCách xử lý
Màn đăng nhập báo "Điền đủ tài khoản và mật khẩu."Còn thiếu một ôGõ đủ cả tài khoản và mật khẩu
"Phần mềm chưa được kích hoạt…"Tài khoản web chưa xác nhận emailBấm nút Gửi thư kích hoạt tài khoản, mở email, bấm liên kết trong thư rồi đăng nhập lại
"Tài khoản của bạn chưa có quyền dùng…"Tài khoản này chưa nhận phần mềmKiểm tra đã đăng nhập đúng email lúc mua chưa; đúng rồi mà vẫn báo thì nhắn Zalo hỗ trợ
"Tài khoản này vừa được dùng trên một máy khác…" rồi phần mềm tự tắtBạn (hoặc ai đó dùng tài khoản của bạn) vừa đăng nhập ở máy khácMở lại và đăng nhập nếu muốn dùng máy này. Nếu không phải bạn, hãy đổi mật khẩu trên web
"Phiên đăng nhập đã hết. Đăng nhập lại giúp mình."Phiên cũ không còn hiệu lựcĐăng nhập lại
Model not loaded yet, please wait.Bộ giọng chưa nạp xongChờ tới khi thấy SUCCESS: Ready for processing! rồi bấm Start
ERROR: Text to synthesize is empty.Ô văn bản đang trốngDán văn bản vào ô Text to Synthesize
ERROR: Reference voice file not found.Chưa chọn file giọng mẫu, hoặc file đã bị dời, đổi tênBấm Browse ở Reference Voice và chọn lại file
ERROR: Output folder not set.Chưa chọn chỗ lưuBấm Browse ở dòng Output
ERROR: No .txt files found in…Thư mục ở dòng Input không có file .txt (hoặc .srt khi chọn SRT)Chọn đúng thư mục, hoặc bấm Clear để quay về gõ tay
Already processing, please wait.Phần mềm đang đọc dở lượt trướcChờ xong, hoặc bấm Stop rồi bấm Start lại
Dialogue báo No dialogue lines found.Tên trong kịch bản không khớp tên ở Voice A / Voice BViết đúng dạng Tên: lời thoại với đúng tên đã gõ ở hai ô Character Name
Dialogue báo Voice A and Voice B must have different names.Hai nhân vật trùng tênĐặt hai tên khác nhau
Lần đầu mở, nhật ký báo ERROR loading modelThường do mạng chập chờn khi tải bộ giọng, hoặc ổ cứng hết chỗKiểm tra mạng và dung lượng trống (cần khoảng 10 GB), tắt phần mềm rồi mở lại

13. Còn vướng bước nào?

Đọc tới đây là bạn đã đủ để tự làm ra giọng đọc cho video, bài giảng hay sách nói của mình. Hãy bắt đầu bằng một đoạn ngắn với chính giọng của bạn, nghe lại, chỉnh tốc độ cho vừa tai rồi mới làm cả bài.

Còn vướng bước nào, nhắn Zalo 0949 094 594. Xem thêm thông tin và nhận phần mềm tại trang sản phẩm.

Phần mềm trong bài
Trên Tay TTS
Xem sản phẩm