CÔNG CỤ MIỄN PHÍ · TRÊN THIẾT BỊ CỦA BẠN
Chuyển âm thanh và video thành văn bản miễn phí
Chuyển lời nói trong tệp âm thanh hoặc video thành văn bản: tin nhắn thoại, buổi phỏng vấn, bài giảng hoặc một tập podcast. Việc chép lời chạy bằng Whisper ngay trên thiết bị của bạn; kiểm tra văn bản, sao chép hoặc tải xuống dạng TXT (theo đoạn hoặc kèm mốc thời gian) hoặc SRT.
- Miễn phí, cần tài khoản miễn phí
- TXT và SRT
- Âm thanh của bạn không bao giờ rời khỏi thiết bị
- Thêm âm thanh hoặc video của bạn
- Chuyển thành văn bản
- Kiểm tra và tải xuống
CÁCH SỬ DỤNG
Ba bước.
Thêm âm thanh hoặc video của bạn
MP3, WAV, M4A, OGG, MP4, WebM hoặc MOV có lời nói, dài tối đa 10 phút. Chọn ngôn ngữ: tiếng Tây Ban Nha, tiếng Anh hoặc tự nhận diện.
Chuyển thành văn bản
Nhấn “Chuyển giọng nói thành văn bản”. Lần đầu tiên mô hình được tải xuống; sau đó mất xấp xỉ độ dài của âm thanh trên máy tính gần đây.
Kiểm tra và tải xuống
Sửa văn bản, sao chép hoặc tải xuống TXT theo đoạn hoặc kèm mốc thời gian, và SRT theo câu.
BƯỚC TIẾP THEO
Tiếp tục với các công cụ này
Chuyển thành văn bản: câu hỏi thường gặp
Bản chuyển giọng nói thành văn bản chính xác đến đâu?
Với giọng nói rõ và ít tiếng ồn, nó thường nhận đúng hầu hết các từ. Nó có thể sai ở tên riêng, nhạc nền, giọng địa phương nặng hoặc giọng nói chồng lên nhau, và không phân biệt được người nói. Hãy kiểm tra văn bản trước khi dùng.
Có dùng được với tin nhắn thoại WhatsApp không?
Có, nếu trình duyệt của bạn phát được tệp (tin nhắn thoại thường là OGG hoặc OPUS, mà Chrome, Edge và Firefox đọc được). Hãy lưu nó vào thiết bị và thêm vào đây.
Nếu âm thanh của tôi dài hơn 10 phút thì sao?
Hãy cắt thành các phần tối đa 10 phút và phiên âm từng phần một. Tệp âm thanh tối đa 15 phút có thể được cắt ngay tại đây bằng công cụ cắt MP3 của chúng tôi; hãy cắt video hoặc tệp âm thanh dài hơn trong thư viện điện thoại hoặc trong trình chỉnh sửa của bạn (Cắt video cũng dừng ở 10 phút). Giới hạn này giúp công cụ hoạt động tốt cả trên điện thoại.
Việc chép lời làm gì?
Whisper (mô hình nhận dạng giọng nói của OpenAI, trọng số theo giấy phép MIT) chạy bằng transformers.js (giấy phép Apache 2.0) ngay trong trình duyệt của bạn, chính là mô hình mà công cụ Phụ đề tự động của chúng tôi dùng. Lần đầu mô hình được tải xuống (khoảng 77 MB ở mức “Thường” và khoảng 250 MB ở mức “Cao”) và trình duyệt của bạn sẽ lưu lại.
Âm thanh của tôi có bị tải lên máy chủ không?
Không. Âm thanh được đọc và chuyển thành văn bản bên trong trình duyệt của bạn và không gửi đến Cocuyo hay bất kỳ bên thứ ba nào. Chỉ mô hình giọng nói được tải xuống, một lần, từ máy chủ của chúng tôi.
Có thật sự miễn phí không?
Có. Bạn có thể dùng thử trước khi đăng ký; để tiếp tục sử dụng, chúng tôi yêu cầu một tài khoản miễn phí, không cần gói đăng ký. Không tốn tín dụng và không tính vào 30 lượt chào mừng của bạn: không giới hạn số lượt dùng.
Giới hạn là gì?
Một tệp âm thanh hoặc video tối đa 300 MB và 10 phút mà trình duyệt của bạn phát được. Việc chuyển giọng nói thành văn bản chạy trên thiết bị: trên điện thoại có thể lâu hơn nhiều so với máy tính.
Tìm hiểu cách…
THÊM CÔNG CỤ MIỄN PHÍ
Công cụ âm thanh khác
Tất cả công cụ miễn phí
KHI BẠN MUỐN TẠO
Tạo giọng nói và thuyết minh bằng AI.
Studio của Cocuyo tập hợp hơn 30 mô hình AI cho hình ảnh, video và giọng nói. Bạn thấy chi phí tín dụng trước khi tạo, và tín dụng không bao giờ hết hạn.





