TOSPEECH WIKI

Hướng dẫn để bắt đầu đúng nhịp.

Từ yêu cầu hệ thống tới một vòng nghe, nói lại và nghe A/B hoàn chỉnh.

01

Yêu cầu hệ thống

ToSpeech chạy trên Mac Apple Silicon (arm64), macOS 26 trở lên. Đây là app macOS thuần — chưa có bản iOS. Public beta chưa phát hành; hiện build từ mã nguồn bằng Xcode 26+.

Lưu ýModel nhận dạng giọng nói Parakeet v3 (int8, chạy trên Neural Engine) tải một lần trong lần dùng đầu; model căn từ đi kèm sẵn trong app. Chưa có mức RAM/dung lượng tối thiểu cố định.

02

Chuẩn bị một bài học

Hai cách nạp bài: dán link YouTube, hoặc import file audio có sẵn (video chỉ qua YouTube; định dạng nhận: m4a, mp3, aac, wav, flac, opus, ogg, webm, mp4…). Với YouTube, ToSpeech dùng yt-dlp tải luồng audio tốt nhất, cân âm lượng về −16 LUFS rồi lưu AAC 192k tại Media/SourceAudio. Sau đó chép lời bằng Parakeet v3, tách câu, căn từng từ (CTC forced alignment), tra IPA Anh–Mỹ từ từ điển offline và dịch sang tiếng mẹ đẻ bằng Apple Translation — tất cả trên máy.

  1. Mở Library, dán link YouTube hoặc chọn file audio.
  2. Chờ chạy qua các bước: tải/dò → chép lời → căn từ → IPA → dịch.
  3. Mở bài đã sẵn sàng trong Shadowing.

03

Một vòng luyện

ToSpeech luôn phát trọn câu mẫu trước, rồi mới đếm ngược (1,5 hoặc 3 giây) và thu; nguồn và micro không bao giờ phát cùng lúc. Bản thu lấy ở định dạng gốc của micro qua AVAudioEngine, lưu thành .caf, có thể lọc ồn (DeepFilterNet3) và cắt lặng khi phát lại.

  1. Nghe trọn câu mẫu (phát chậm 0,5–0,75× qua RubberBand nếu cần).
  2. Theo dõi câu, IPA từng từ (Anh–Mỹ) và bản dịch.
  3. Nói lại sau countdown; tự dừng sau ~2 giây im lặng, tối đa 30 giây mỗi lượt.
  4. Nghe A/B: câu mẫu ở tai trái, bản thu ở tai phải. Mỗi vòng là một take riêng (mặc định 5 vòng).

04

Dữ liệu và riêng tư

Mọi thứ nằm trong App Sandbox: CSDL SQLite (tospeech.sqlite3), audio nguồn và bản thu đều lưu cục bộ. Công cụ đi kèm (yt-dlp, ffmpeg, QuickJS) được kiểm SHA-256 trước khi chạy. Mạng chỉ dùng cho hai việc: tải bài từ YouTube và tải model một lần (Hugging Face). Không server riêng, không API key; nhận dạng, căn từ, IPA và dịch đều chạy trên máy.

05

Trạng thái hiện tại

Đang phát triển, chưa có public beta để tải — hiện build từ mã nguồn (Xcode 26+). Nhận dạng dùng Parakeet v3 (đã bỏ Whisper và GOPT). Chưa có điểm phát âm hiệu chỉnh (tổng thể, trọng âm hay ngữ điệu): các engine đánh giá là tùy chọn, phải tải model riêng, và Phone Scorer chưa có giấy phép phát hành — phản hồi âm vị còn thử nghiệm, mặc định tắt. Mặc định phần đối chiếu là nghe A/B; đường pitch/nhịp/năng lượng trong màn review chỉ hiện sau khi bật một engine đánh giá và chạy. Đường pitch/nhịp hiện live khi thu đang phát triển, chưa có trong bản hiện tại.

Xem trạng thái tải