Mục lục (13 phần)
- 1. Máy của bạn cần gì
- 2. Nhận phần mềm và cài đặt
- 3. Đăng nhập
- 4. Lần đầu mở: chờ tải bộ giọng
- 5. Làm quen màn hình chính
- 6. Nhân bản giọng từ file mẫu (thẻ Clone Voice)
- 7. Tạo giọng theo mô tả (thẻ Voice Design)
- 8. Chỉnh tốc độ và các thông số
- 9. Xuất file và đọc hàng loạt
- 10. Đọc hội thoại hai người (thẻ Dialogue)
- 11. Mẹo để giọng đọc hay hơn
- 12. Khi gặp lỗi
- 13. Còn vướng bước nào?
Bạn cần giọng đọc cho video, bài giảng hay sách nói nhưng ngại thu âm đi thu âm lại? Trên Tay TTS là phần mềm chạy ngay trên máy tính Windows: bạn dán văn bản vào, bấm Start, vài chục giây sau có file âm thanh đọc lại đúng nội dung đó.
Điểm hay nhất là nhân bản giọng: đưa cho phần mềm một đoạn ghi âm ngắn giọng của bạn (khoảng 5–15 giây), nó sẽ đọc mọi văn bản về sau bằng chính chất giọng ấy. Không có file mẫu thì bạn mô tả giọng mình muốn (nam hay nữ, trẻ hay lớn tuổi, trầm hay cao) và phần mềm tự tạo ra một giọng như vậy.
Bài này đi từng bước, từ lúc kiểm tra máy tới lúc có file âm thanh đầu tiên. Bạn chưa quen máy tính cũng làm theo được.
1. Máy của bạn cần gì
Phần mềm này dùng trí tuệ nhân tạo để tạo giọng nên khá nặng. Trước khi tải, bạn soát máy theo bảng sau:
| Hạng mục | Cần có |
|---|---|
| Hệ điều hành | Windows 10 hoặc Windows 11, bản 64-bit |
| Card đồ hoạ | Card NVIDIA, nên có từ 6 GB bộ nhớ đồ hoạ (VRAM) trở lên thì đọc nhanh |
| Ổ cứng trống | Khoảng 10 GB: phần mềm chừng 5 GB, bộ giọng tải về lần đầu chừng 3 GB, phần còn lại để chứa file âm thanh |
| Mạng | Cần mạng lúc đăng nhập và lần đầu tải bộ giọng |
Cách xem máy có card NVIDIA không: bấm chuột phải vào thanh tác vụ, chọn Task Manager (Trình quản lý tác vụ), mở thẻ Performance (Hiệu suất). Nếu thấy dòng GPU ghi chữ "NVIDIA GeForce…" là được. Máy chỉ có card Intel hoặc AMD thì nên hỏi lại trước khi dùng, vì phần mềm được làm để chạy trên card NVIDIA.
2. Nhận phần mềm và cài đặt
Nhận phần mềm
- Vào trang sản phẩm Trên Tay TTS, bấm Mua ngay.
- Ở bước thanh toán, mã tặng giảm 100% được áp sẵn nên đơn hàng về 0đ. Mỗi tài khoản nhận được một máy, dùng vĩnh viễn.
- Xong đơn, vào trang Tài khoản trên web, bấm nút Tải về ở thẻ Trên Tay TTS.
Cài đặt
- File tải về là file nén. Bấm chuột phải vào file, chọn Extract All (Giải nén tất cả) và giải nén ra ổ cứng, ví dụ
D:\TrenTayTTS. Đừng chạy thẳng trong file nén, phần mềm sẽ không chạy đúng. - Mở thư mục vừa giải nén, bấm đúp vào TRENTAY TTS.exe.
- Giữ nguyên mọi file trong thư mục đó, nhất là
ffmpeg.exenằm cạnh file chạy. Đừng xoá hay dời riêng file nào.
Nên tạo lối tắt ra màn hình: bấm chuột phải vào TRENTAY TTS.exe → Send to → Desktop (create shortcut). Lần sau bấm đúp ở màn hình là mở.
3. Đăng nhập
Mở phần mềm lên, bạn sẽ thấy cửa sổ Đăng nhập — TRENTAY TTS. Có hai cách đăng nhập:
- Email tài khoản bạn đã mua trên app.trentay.com, kèm mật khẩu web.
- Tên phần mềm (dạng không có chữ @) nếu lúc mua bạn đã đặt tên đăng nhập riêng cho phần mềm, kèm mật khẩu của tên đó.
Điền Tài khoản và Mật khẩu, bấm ĐĂNG NHẬP. Phần mềm nhớ phiên đăng nhập, lần sau mở lên không phải gõ lại.
Một tài khoản chỉ dùng trên một máy. Nếu bạn đăng nhập ở máy khác, máy cũ sẽ tự thoát ra với lời báo "Tài khoản này vừa được dùng trên một máy khác…". Muốn quay lại máy cũ thì cứ đăng nhập lại, không phải báo ai.
4. Lần đầu mở: chờ tải bộ giọng
Sau khi đăng nhập, cửa sổ chính hiện ra. Bên phải là khung System Log (nhật ký), nơi phần mềm báo nó đang làm gì. Lần đầu tiên, phần mềm tải bộ giọng khoảng 3 GB về máy, nên có thể mất từ vài phút tới lâu hơn tuỳ mạng. Bạn cứ để yên, đừng tắt.
Khi nhật ký hiện dòng SUCCESS: Ready for processing! là đã sẵn sàng. Những lần mở sau không phải tải lại, chỉ cần chờ phần mềm nạp giọng vào máy vài chục giây.
Nếu bạn bấm Start sớm quá, nhật ký sẽ báo Model not loaded yet, please wait. Đó không phải lỗi, chỉ là chưa nạp xong. Chờ thêm chút rồi bấm lại.
5. Làm quen màn hình chính
Phần mềm có ba thẻ ở góc trên bên trái:
| Thẻ | Dùng để làm gì |
|---|---|
| Clone Voice | Nhân bản giọng: đọc văn bản bằng giọng trong một file ghi âm mẫu |
| Voice Design | Tạo giọng theo mô tả, không cần file mẫu |
| Dialogue | Đọc một đoạn hội thoại giữa hai người, mỗi người một giọng |
Phía dưới là hai nút lớn: Start (xanh, bắt đầu đọc) và Stop (đỏ, dừng giữa chừng). Thanh chạy dưới cùng cho biết phần mềm đang làm việc.
6. Nhân bản giọng từ file mẫu (thẻ Clone Voice)
Chuẩn bị file giọng mẫu cho tốt
Chất lượng giọng đọc ra phụ thuộc gần như hoàn toàn vào file mẫu. Vài điều nên làm:
- Dài 5–15 giây, nói liền một mạch, tự nhiên như đang trò chuyện.
- Chỉ có tiếng người nói: không nhạc nền, không tiếng quạt, xe cộ, tiếng vọng phòng trống.
- Một người nói duy nhất, giọng rõ, không hét, không thì thầm (trừ khi bạn muốn giọng ra như vậy).
- Giọng mẫu nói tiếng Việt thì đọc tiếng Việt sẽ tự nhiên nhất.
- Định dạng nhận được:
.wav,.mp3,.flac,.ogg,.m4a. Ghi âm bằng điện thoại trong phòng kín, rồi chép file sang máy là được.
Các bước
- Ở dòng Reference Voice (.wav), bấm Browse và chọn file giọng mẫu.
- Dòng Reference Transcript: gõ đúng câu mà người trong file mẫu đã nói. Không nhớ thì bấm nút tím Transcribe, phần mềm tự nghe và điền giúp. Để trống cũng được, phần mềm tự nghe khi bắt đầu đọc. Gõ đúng lời thì giọng ra sát hơn.
- Dòng Output: bấm Browse, chọn thư mục để lưu file âm thanh (ví dụ
D:\Giong doc\ra). - Để trống dòng Input (dòng này dành cho đọc hàng loạt, xem mục 9).
- Dán văn bản cần đọc vào ô lớn Text to Synthesize.
- Bấm Start. Theo dõi nhật ký bên phải, khi thấy DONE. là xong.
Lần đầu dùng một file mẫu, phần mềm mất thêm chút thời gian để "học" giọng. Những lần sau dùng lại đúng file đó sẽ nhanh hơn vì phần mềm đã nhớ.
Lưu ý pháp lý: chỉ nhân bản giọng của chính bạn, hoặc giọng của người đã đồng ý rõ ràng cho bạn dùng. Lấy giọng người khác (ca sĩ, MC, người nổi tiếng, người quen) rồi đăng lên mạng khi chưa được phép có thể xâm phạm quyền nhân thân và bị coi là mạo danh. Khi đăng nội dung dùng giọng nhân bản, nên ghi rõ là giọng tạo bằng AI.
7. Tạo giọng theo mô tả (thẻ Voice Design)
Phần mềm không có sẵn một kho giọng đặt tên để chọn. Thay vào đó, ở thẻ Voice Design bạn mô tả giọng mình muốn bằng các ô chọn, rồi phần mềm tạo giọng tương ứng:
| Ô | Chọn gì |
|---|---|
| Gender | Male (nam), Female (nữ), Auto (để máy tự chọn) |
| Age | Child (trẻ em), Teenager (tuổi teen), Young Adult (thanh niên), Middle-aged (trung niên), Elderly (người lớn tuổi) |
| Pitch | Từ Very Low Pitch (rất trầm) tới Very High Pitch (rất cao) |
| Style | Auto (bình thường) hoặc Whisper (thì thầm) |
| English Accent | Giọng Anh, Mỹ, Úc… chỉ có tác dụng khi đọc tiếng Anh |
| Chinese Dialect | Phương ngữ tiếng Trung, chỉ có tác dụng khi đọc tiếng Trung |
Cách làm: chọn thư mục Output, dán văn bản vào Text to Synthesize, chọn các ô mô tả, bấm Start. Đọc tiếng Việt thì hai ô English Accent và Chinese Dialect cứ để Auto.
Giọng tạo theo mô tả có thể hơi khác nhau giữa các lần bấm. Nếu bạn làm cả một loạt video cần cùng một giọng, hãy chọn một file đọc ra ưng ý nhất, cắt lấy 10 giây làm file mẫu, rồi dùng thẻ Clone Voice cho các lần sau.
8. Chỉnh tốc độ và các thông số
Hàng ô nhỏ phía dưới ô văn bản dùng chung cho cả thẻ Clone Voice và Voice Design:
| Ô | Mặc định | Ý nghĩa |
|---|---|---|
| Speed (0.7-1.3) | 1.0 | Tốc độ đọc. Nhỏ hơn 1.0 là chậm hơn (ví dụ 0.9 hợp giọng tâm sự), lớn hơn 1.0 là nhanh hơn (ví dụ 1.1 hợp video ngắn) |
| Inference Steps (4-64) | 32 | Số lượt máy "gọt" giọng. Cao hơn thì giọng mượt hơn nhưng chậm hơn. Muốn nhanh để nghe thử thì hạ xuống 16–20 |
| Guidance Scale (0.0-4.0) | 2.0 | Mức bám sát giọng mẫu. Cao quá giọng dễ gượng, thấp quá giọng dễ lệch mẫu. Nên giữ trong khoảng 1.5–2.5 |
| Style Text | TXT | TXT cho văn bản thường. SRT khi bạn dán nội dung một file phụ đề .srt: phần mềm đọc hết lời thoại rồi co giãn tốc độ để file âm thanh dài đúng bằng tổng thời lượng phụ đề |
| Language | Auto | Ngôn ngữ đọc. Bấm vào ô này, gõ Viet để tìm và chọn Vietnamese cho chắc |
Phần mềm tự nhớ các thiết lập mỗi lần bạn bấm Start, lần sau mở lên vẫn còn nguyên.
9. Xuất file và đọc hàng loạt
File âm thanh nằm ở đâu
Mọi file đều lưu vào thư mục bạn chọn ở dòng Output, dạng .wav. Tên file lấy từ những chữ đầu của văn bản (bỏ dấu) kèm ngày giờ, ví dụ me_oi_dem_nay_con_ngu_ngoan_nhe_20260921_201405.wav. File .wav mở được bằng mọi phần mềm dựng video như CapCut. Nếu bạn cần file .mp3, hãy đổi định dạng bằng một công cụ chuyển đổi khác.
Đọc cả thư mục văn bản một lượt
- Soạn mỗi bài một file
.txt, để chung trong một thư mục. Lưu file dạng UTF-8 để giữ đủ dấu tiếng Việt (trong Notepad: Save As → ô Encoding chọn UTF-8). - Ở dòng Input, bấm Browse và chọn thư mục đó. Ô văn bản lớn sẽ bị khoá lại, đó là bình thường.
- Chọn giọng như bình thường (file mẫu ở Clone Voice, hoặc các ô mô tả ở Voice Design), chọn Output, bấm Start.
- Mỗi file .txt ra một file .wav mang tên của nó. Muốn quay lại gõ tay thì bấm Clear ở dòng Input.
Chọn Style Text = SRT thì phần mềm lấy các file .srt trong thư mục thay cho .txt.
10. Đọc hội thoại hai người (thẻ Dialogue)
- Ở ô Voice A: gõ tên nhân vật vào Character Name (ví dụ Hùng), chọn file giọng mẫu ở Reference (.wav). Ô Transcript để trống cũng được.
- Làm tương tự ở ô Voice B với nhân vật thứ hai (ví dụ Lan). Hai tên phải khác nhau.
- Viết kịch bản vào ô lớn theo dạng
Tên: lời thoại, mỗi câu một dòng:Hùng: Chào em, hôm nay em thế nào?Lan: Em ổn anh ạ, cảm ơn anh.
- Ô Silence between lines (s) là khoảng nghỉ giữa hai câu, mặc định 0.5 giây.
- Chọn Output, bấm Start. Kết quả là một file .wav ghép đủ cả cuộc hội thoại.
Kịch bản dài thì có thể soạn sẵn trong file .txt rồi chọn ở dòng Input (.txt), file âm thanh ra sẽ mang tên file kịch bản.
11. Mẹo để giọng đọc hay hơn
- Chấm phẩy đầy đủ. Phần mềm ngắt nghỉ theo dấu chấm, dấu phẩy. Câu dài không dấu sẽ đọc một mạch, nghe mệt.
- Xuống dòng là một nhịp nghỉ. Mỗi lần xuống dòng được coi như một dấu chấm.
- Ký tự đặc biệt bị bỏ qua: biểu tượng cảm xúc, dấu ngoặc, gạch đầu dòng, ký hiệu như %, &… không được đọc. Muốn đọc thì viết thành chữ, ví dụ "50 phần trăm".
- Số và từ viết tắt: để chắc ăn, viết ra chữ ("hai nghìn không trăm hai mươi sáu", "thành phố Hồ Chí Minh" thay vì "TP.HCM"), rồi nghe lại.
- Thử đoạn ngắn trước với 2–3 câu, ưng giọng rồi mới dán cả bài.
- Bài rất dài nên chia thành nhiều đoạn hoặc nhiều file .txt, vừa dễ sửa vừa đỡ phải đọc lại cả bài khi có một chỗ sai.
- Muốn dừng giữa chừng thì bấm Stop.
12. Khi gặp lỗi
Phần lớn thông báo nằm ở khung System Log bên phải, dòng lỗi tô màu đỏ.
| Bạn thấy | Nghĩa là | Cách xử lý |
|---|---|---|
| Màn đăng nhập báo "Điền đủ tài khoản và mật khẩu." | Còn thiếu một ô | Gõ đủ cả tài khoản và mật khẩu |
| "Phần mềm chưa được kích hoạt…" | Tài khoản web chưa xác nhận email | Bấm nút Gửi thư kích hoạt tài khoản, mở email, bấm liên kết trong thư rồi đăng nhập lại |
| "Tài khoản của bạn chưa có quyền dùng…" | Tài khoản này chưa nhận phần mềm | Kiểm tra đã đăng nhập đúng email lúc mua chưa; đúng rồi mà vẫn báo thì nhắn Zalo hỗ trợ |
| "Tài khoản này vừa được dùng trên một máy khác…" rồi phần mềm tự tắt | Bạn (hoặc ai đó dùng tài khoản của bạn) vừa đăng nhập ở máy khác | Mở lại và đăng nhập nếu muốn dùng máy này. Nếu không phải bạn, hãy đổi mật khẩu trên web |
| "Phiên đăng nhập đã hết. Đăng nhập lại giúp mình." | Phiên cũ không còn hiệu lực | Đăng nhập lại |
Model not loaded yet, please wait. | Bộ giọng chưa nạp xong | Chờ tới khi thấy SUCCESS: Ready for processing! rồi bấm Start |
ERROR: Text to synthesize is empty. | Ô văn bản đang trống | Dán văn bản vào ô Text to Synthesize |
ERROR: Reference voice file not found. | Chưa chọn file giọng mẫu, hoặc file đã bị dời, đổi tên | Bấm Browse ở Reference Voice và chọn lại file |
ERROR: Output folder not set. | Chưa chọn chỗ lưu | Bấm Browse ở dòng Output |
ERROR: No .txt files found in… | Thư mục ở dòng Input không có file .txt (hoặc .srt khi chọn SRT) | Chọn đúng thư mục, hoặc bấm Clear để quay về gõ tay |
Already processing, please wait. | Phần mềm đang đọc dở lượt trước | Chờ xong, hoặc bấm Stop rồi bấm Start lại |
Dialogue báo No dialogue lines found. | Tên trong kịch bản không khớp tên ở Voice A / Voice B | Viết đúng dạng Tên: lời thoại với đúng tên đã gõ ở hai ô Character Name |
Dialogue báo Voice A and Voice B must have different names. | Hai nhân vật trùng tên | Đặt hai tên khác nhau |
Lần đầu mở, nhật ký báo ERROR loading model | Thường do mạng chập chờn khi tải bộ giọng, hoặc ổ cứng hết chỗ | Kiểm tra mạng và dung lượng trống (cần khoảng 10 GB), tắt phần mềm rồi mở lại |
13. Còn vướng bước nào?
Đọc tới đây là bạn đã đủ để tự làm ra giọng đọc cho video, bài giảng hay sách nói của mình. Hãy bắt đầu bằng một đoạn ngắn với chính giọng của bạn, nghe lại, chỉnh tốc độ cho vừa tai rồi mới làm cả bài.
Còn vướng bước nào, nhắn Zalo 0949 094 594. Xem thêm thông tin và nhận phần mềm tại trang sản phẩm.