TopGit
Đánh giá repo GitHub

SmartSub: Phụ đề và Lồng tiếng Video bằng AI

buxuku/SmartSub
STopGit review image for buxuku/SmartSub
Review by Topgit.dev for buxuku/SmartSub, with GitHub repository stats and README context.
Nhận định nhanh

SmartSub xử lý toàn bộ quy trình từ video gốc đến đầu ra lồng tiếng và có phụ đề trong một ứng dụng desktop duy nhất, và toàn bộ quy trình làm việc có thể chạy offline miễn phí bằng các mô hình Whisper hoặc FunASR cục bộ. Phạm vi tích hợp rộng lớn — 8 công cụ chuyển giọng nói thành văn bản, 20 dịch vụ dịch thuật, nhiều công cụ TTS bao gồm nhân bản giọng nói — là rất đầy đủ đối với một công cụ miễn phí. Tuy nhiên, sự linh hoạt này đi kèm với khó khăn trong việc cài đặt: các gói tăng tốc GPU, tải mô hình và cấu hình từng dịch vụ bổ sung thêm các bước mà người dùng thông thường có thể thấy phức tạp so với một dịch vụ web đơn giản. Hãy dùng SmartSub nếu bạn cần làm phụ đề và lồng tiếng hàng loạt, có khả năng chạy offline; hãy bỏ qua nếu bạn chỉ thỉnh thoảng muốn chuyển giọng nói thành văn bản một video và không muốn quản lý các tệp mô hình.

Sao
★ 4.6k
Fork
⑂ 334
Người đóng góp
👥 14
Ngôn ngữ
TypeScript
Giấy phép
MIT
Chủ đề
AI Tools
Cập nhật
Aug 2026
Trang chủ
GitHub

SmartSub là gì?

SmartSub là một ứng dụng desktop mã nguồn mở tạo phụ đề từ video hoặc âm thanh, dịch các phụ đề đó, tổng hợp lời thoại AI (với tùy chọn nhân bản giọng nói), và gắn hoặc nhúng phụ đề cuối cùng vào đầu ra video. Toàn bộ quy trình làm việc — chuyển giọng nói thành văn bản, dịch, TTS và mã hóa — có thể chạy hoàn toàn offline trên máy của người dùng bằng các mô hình whisper.cpp, faster-whisper, FunASR, Qwen3-ASR, FireRedASR hoặc Parakeet thông qua runtime sherpa-onnx, kết hợp với các giọng nói Kokoro hoặc VITS cục bộ. Tăng tốc GPU được hỗ trợ trên NVIDIA (CUDA), AMD/Intel (Vulkan) và Apple Silicon (Core ML/Metal). Công cụ này hỗ trợ Windows, macOS và Linux, đồng thời cung cấp trình tải video trực tuyến tích hợp sử dụng yt-dlp và lux.

Các tính năng chính cho phụ đề video

  • Tạo phụ đề offline bằng 8 công cụ chuyển giọng nói thành văn bản: whisper.cpp (tích hợp), faster-whisper, FunASR (SenseVoice, Paraformer-zh), Qwen3-ASR, FireRedASR, NVIDIA Parakeet, Whisper CLI cục bộ, và 8 nhà cung cấp dịch vụ đám mây — tất cả đều có thể điều khiển theo từng tác vụ.
  • 20 dịch vụ dịch thuật bao gồm giao diện Bing/Google miễn phí, DeepLX, Ollama (LLM cục bộ), DeepSeek, Gemini, Qwen và bất kỳ endpoint tương thích OpenAI nào, với hỗ trợ tùy chỉnh tham số cho từng dịch vụ và nhập/xuất cấu hình.
  • TTS cục bộ với nhân bản giọng nói: Kokoro (103 giọng nói đa ngôn ngữ), VITS tiếng Trung (174 giọng nói), và nhân bản giọng nói zero-shot ZipVoice, cộng với các tùy chọn đám mây (Edge TTS, Azure Speech, ElevenLabs, Volcano Engine Doubao).
  • Tăng tốc GPU trên NVIDIA CUDA (11.8.0/12.2.0/12.4.0/13.0.2), AMD/Intel Vulkan và Apple Silicon Core ML/Metal, với tự động chuyển sang CPU khi gặp lỗi.
  • Trình tải video trực tuyến tích hợp sử dụng yt-dlp (cho YouTube và hơn 1800 trang web) và lux (cho Bilibili, Douyin, Xiaohongshu), với hỗ trợ nhập cookie để truy cập nội dung cao cấp.
Số sao GitHub của repo này thay đổi thế nào theo thời gian. Nguồn: star-history.com.Xem lịch sử sao

SmartSub giúp ích như thế nào với nội dung video?

  • Chuyển giọng nói thành văn bản và dịch các video tiếng nước ngoài hoặc bài giảng công khai thành phụ đề song ngữ để xem cá nhân.
  • Tải video Bilibili hoặc YouTube trực tiếp trong ứng dụng và áp dụng phụ đề tự động tạo hoặc được chuyển giọng nói thành văn bản bằng AI.
  • Tạo các phiên bản nội dung video đa ngôn ngữ cho khán giả quốc tế bằng cách dịch phụ đề và lồng tiếng bằng TTS cục bộ.
  • Nhân bản giọng nói của bạn từ một bản ghi tham chiếu ngắn và sử dụng nó để tường thuật toàn bộ video bằng bất kỳ ngôn ngữ nào được hỗ trợ.
  • Chuyển đổi hàng loạt các tập podcast, bản ghi khóa học trực tuyến hoặc bản ghi cuộc họp thành tệp phụ đề SRT để lưu trữ hoặc chỉnh sửa.
  • Xuất video cuối cùng với phụ đề gắn cứng (hiển thị trong bất kỳ trình phát nào) hoặc phụ đề mềm (các bản nhạc có thể chuyển đổi trong vùng chứa MKV).

Tại sao nên chọn SmartSub?

  • Quy trình offline hoàn chỉnh không yêu cầu khóa API: chuyển giọng nói thành văn bản bằng Whisper/FunASR cục bộ, dịch miễn phí Bing/Google, TTS Kokoro/VITS cục bộ và gắn phụ đề bằng ffmpeg cục bộ.
  • Xử lý hàng loạt với khả năng điều chỉnh đồng thời để xử lý số lượng lớn video hoặc tệp âm thanh.
  • Phạm vi tăng tốc GPU rộng: CUDA trên NVIDIA, Vulkan trên AMD/Intel, Core ML/Metal trên Apple Silicon — với tự động chuyển sang CPU khi gặp lỗi.
  • Nhân bản giọng nói qua ZipVoice (zero-shot cục bộ) và các dịch vụ đám mây (ElevenLabs, Volcano Engine), với kiểm tra chất lượng tự động trên âm thanh tham chiếu.
  • Trình tải video trực tuyến tích hợp với hỗ trợ hai công cụ (yt-dlp và lux) loại bỏ nhu cầu về một công cụ tải xuống riêng biệt.
  • Cộng đồng tích cực với nhóm hỗ trợ QQ và giấy phép MIT cho phép tự host và sửa đổi.

Các hạn chế và cân nhắc đã biết

  • Độ phức tạp cài đặt cao so với các giải pháp dựa trên web — người dùng phải tải xuống và quản lý các tệp mô hình, gói tăng tốc GPU và thông tin xác thực cho từng dịch vụ.
  • Chỉ dành cho macOS Silicon: bản dựng macOS Intel không hỗ trợ tăng tốc GPU, giới hạn tốc độ trên các máy Mac cũ hơn.
  • Các công cụ FunASR, Qwen3-ASR, FireRedASR và Parakeet đều chạy qua sherpa-onnx, nghĩa là ứng dụng gói một thư viện native dependency đôi khi gây ra vấn đề tương thích.
  • Edge TTS được đánh dấu là giao diện được thiết kế ngược (reverse-engineered) không đảm bảo tính khả dụng — README cảnh báo rõ ràng rằng dịch vụ có thể ngừng hoạt động mà không báo trước.
  • Việc tinh chỉnh phụ đề AI và các tính năng nâng cao phụ thuộc vào phần cứng cục bộ đủ mạnh hoặc phải trả phí cho các dịch vụ LLM đám mây; phần cứng cấp thấp hơn sẽ có thời gian chuyển giọng nói thành văn bản và tổng hợp chậm.
  • Không hỗ trợ di động — đây là ứng dụng chỉ dành cho desktop, điều này giới hạn các trường hợp sử dụng cho những người sáng tạo cần làm việc khi đang di chuyển.
Xem trên GitHubTrang chủ

Bắt đầu với SmartSub

SmartSub cung cấp các trình cài đặt được xây dựng sẵn cho Windows (x64), macOS (ARM64 cho Apple Silicon, x64 cho Intel) và Linux (x64). Tải xuống từ trang GitHub Releases hoặc qua Quark网盘 (một liên kết lưu trữ đám mây của Trung Quốc). Người dùng macOS có thể cài đặt qua Homebrew với `brew tap buxuku/tap` sau đó là `brew install --cask smartsub` — lệnh này tự động phát hiện kiến trúc chip. Sau khi cài đặt, ứng dụng sẽ hướng dẫn bạn tải xuống mô hình chuyển giọng nói thành văn bản đầu tiên của mình. Các gói tăng tốc GPU (chẳng hạn như các phiên bản CUDA cụ thể) có thể được tải xuống từ trang cài đặt Engine và Model của ứng dụng mà không cần cài đặt CUDA Toolkit thủ công. Để xây dựng từ mã nguồn: clone repo, chạy `yarn install`, sau đó `yarn dev` để bắt đầu chế độ phát triển.

Các công cụ làm phụ đề video khác

Whisper Desktop: một GUI desktop đơn giản hơn, chỉ có một mục đích để chạy mô hình Whisper của OpenAI cục bộ chỉ để chuyển giọng nói thành văn bản, không có dịch, TTS hoặc mã hóa video.FFmpeg + Whisper CLI: cách tiếp cận quy trình thủ công — chuyển giọng nói thành văn bản bằng Whisper, dịch bằng một dịch vụ riêng, mã hóa bằng ffmpeg — mang lại toàn quyền kiểm soát nhưng yêu cầu viết script và làm việc với dòng lệnh.Elai.io / Rask.ai: các nền tảng lồng tiếng AI dựa trên đám mây xử lý chuyển giọng nói thành văn bản, dịch và nhân bản giọng nói như một dịch vụ được quản lý, nhưng yêu cầu đăng ký và tải nội dung media lên đám mây.SubtitleEdit: một trình chỉnh sửa phụ đề desktop mã nguồn mở tập trung vào việc tạo và sửa thủ công, nhưng thiếu các khả năng chuyển giọng nói thành văn bản, dịch hoặc TTS tích hợp.Kapwing / VEED.io: các bộ chỉnh sửa video dựa trên trình duyệt với các tính năng phụ đề và dịch thuật, cung cấp khả năng bắt đầu nhanh hơn nhưng có phí hàng tháng và chỉ xử lý trên đám mây.

Các câu hỏi thường gặp

SmartSub có miễn phí sử dụng cho tất cả các tính năng không?

Có — các công cụ chuyển giọng nói thành văn bản cốt lõi (whisper.cpp, faster-whisper, FunASR, Qwen3-ASR, FireRedASR, Parakeet), dịch miễn phí tích hợp (giao diện Bing/Google), TTS Kokoro/VITS cục bộ, nhân bản giọng nói ZipVoice và mã hóa video ffmpeg đều miễn phí mà không yêu cầu khóa API.

SmartSub hỗ trợ những hệ điều hành nào?

SmartSub chạy trên Windows (x64), macOS (ARM64 cho Apple Silicon với tăng tốc Core ML/Metal, x64 cho Intel không có GPU) và Linux (x64). Các trình cài đặt được xây dựng sẵn có sẵn trên trang GitHub Releases, và người dùng macOS có thể cài đặt qua Homebrew.

SmartSub có hỗ trợ tăng tốc GPU để xử lý không?

Có — ứng dụng hỗ trợ CUDA trên GPU NVIDIA (11.8.0/12.2.0/12.4.0/13.0.2), Vulkan trên GPU AMD và Intel, và Core ML/Metal trên Apple Silicon. Các gói tăng tốc GPU được tải xuống từ trong ứng dụng, và hệ thống tự động chuyển sang CPU nếu tải GPU thất bại.

SmartSub có thể thực hiện chuyển giọng nói thành văn bản và lồng tiếng offline không?

SmartSub có thể chạy toàn bộ quy trình của nó offline: chuyển giọng nói thành văn bản qua các mô hình whisper.cpp, faster-whisper, FunASR, Qwen3-ASR, FireRedASR hoặc Parakeet cục bộ; dịch qua Ollama LLM cục bộ hoặc giao diện Bing/Google miễn phí tích hợp; TTS qua các công cụ Kokoro hoặc VITS cục bộ; và mã hóa video qua ffmpeg đi kèm. Không cần kết nối internet cho bất kỳ bước cốt lõi nào.

Làm cách nào để khắc phục lỗi 'application is damaged' trên macOS cho SmartSub?

Chạy lệnh terminal này: `sudo xattr -dr com.apple.quarantine /Applications/SmartSub.app` — sau đó khởi chạy lại ứng dụng. Lệnh này loại bỏ thuộc tính cách ly của macOS chặn các ứng dụng được tải xuống từ bên ngoài App Store.

Giấy phép của SmartSub là gì?

SmartSub được phát hành theo giấy phép MIT, cho phép sử dụng, sửa đổi và phân phối lại miễn phí cho các dự án cá nhân và thương mại.

Vấn đề mà nó giải quyết

Hầu hết các công cụ phụ đề buộc bạn phải kết nối nhiều dịch vụ riêng lẻ — một dịch vụ để chuyển giọng nói thành văn bản, một dịch vụ khác để dịch, một dịch vụ khác cho TTS, và một dịch vụ nữa để mã hóa video — mỗi dịch vụ lại có thiết lập API, cấu trúc chi phí và các vấn đề định dạng tệp riêng. Các công cụ trực tuyến miễn phí thường giới hạn kích thước hoặc chất lượng xử lý hàng loạt, trong khi các giải pháp chuyên nghiệp yêu cầu phí đăng ký và tải nội dung media của bạn lên đám mây. Hiện không có ứng dụng desktop mã nguồn mở nào duy nhất kết nối toàn bộ quy trình này với hỗ trợ mô hình cục bộ, tăng tốc GPU và chi phí cơ bản bằng không.

Ai nên dùng thử — và ai nên bỏ qua

SmartSub đáng để cài đặt nếu bạn thường xuyên xử lý nội dung video đa ngôn ngữ, cần mọi thứ nằm trên máy của mình vì lý do riêng tư hoặc chi phí, và có phần cứng (đặc biệt là GPU NVIDIA hoặc máy Mac Apple Silicon) để chạy các mô hình cục bộ với tốc độ chấp nhận được. Những người sáng tạo nội dung sản xuất video song ngữ, nhà giáo dục lưu trữ bản ghi bài giảng và dịch giả muốn kiểm soát hoàn toàn quy trình phụ đề sẽ nhận được giá trị cao nhất. Bạn nên bỏ qua nếu bạn chỉ thỉnh thoảng cần chuyển giọng nói thành văn bản một video duy nhất và muốn không cần cài đặt gì, hoặc nếu bạn đang làm việc với nội dung nhạy cảm yêu cầu hỗ trợ doanh nghiệp và đảm bảo SLA thay vì một dự án mã nguồn mở được cộng đồng duy trì. Những người đăng ký dịch vụ lồng tiếng AI thương mại hài lòng với thời gian hoàn thành và chi phí cũng có thể thấy khó biện minh cho chi phí tự host.

Repo liên quan

Nguồn & ghi công

Source data from the SmartSub GitHub repository (https://github.com/buxuku/SmartSub). Star count and metadata as listed on the repo.

Dữ liệu GitHub · đồng bộ lần cuối 12 thg 8, 2026Đánh giá bởi Henry
Về TopGit

Chưa chắc SmartSub có hợp với bạn?

Để ChatGPT, Claude hoặc Perplexity tìm hiểu giúp — bấm bên dưới và xem AI nói gì về SmartSub.

GitHub