무료 도구 · 내 기기에서
오디오·동영상 텍스트 변환 무료
오디오나 동영상 파일 속 말을 텍스트로 바꾸세요. 음성 메모, 인터뷰, 강의, 팟캐스트 에피소드 모두 가능해요. 받아쓰기는 내 기기의 Whisper로 실행돼요. 텍스트를 확인하고 복사하거나 TXT(문단별 또는 타임스탬프 포함) 또는 SRT로 다운로드하세요.
- 무료, 무료 계정 필요
- TXT와 SRT
- 내 오디오는 기기를 벗어나지 않아요
- 오디오 또는 동영상 추가
- 받아쓰기
- 확인 및 다운로드
사용 방법
세 단계.
오디오 또는 동영상 추가
음성이 담긴 MP3, WAV, M4A, OGG, MP4, WebM 또는 MOV, 최대 10분. 언어를 선택하세요: 스페인어, 영어 또는 자동 감지.
받아쓰기
“텍스트로 변환”을 누르세요. 처음에는 모델이 다운로드되며, 이후에는 최신 컴퓨터에서 오디오 길이 정도 걸려요.
확인 및 다운로드
텍스트를 수정하고, 복사하거나 문단별 또는 타임스탬프가 있는 TXT로, 문장별 SRT로 다운로드하세요.
다음 단계
이 도구들로 이어서 작업하세요
텍스트로 받아쓰기: 자주 묻는 질문
텍스트 변환은 얼마나 정확한가요?
말이 또렷하고 소음이 적으면 보통 대부분의 단어를 맞혀요. 이름, 배경 음악, 강한 억양, 겹치는 목소리는 틀릴 수 있고 화자를 구분하지는 못해요. 사용하기 전에 텍스트를 확인하세요.
WhatsApp 음성 메시지에도 쓸 수 있나요?
네, 브라우저가 파일을 재생할 수 있다면 가능해요(음성 메모는 보통 OGG나 OPUS인데 Chrome, Edge, Firefox에서 읽어요). 기기에 저장한 뒤 여기에 추가하세요.
오디오가 10분보다 길면 어떻게 하나요?
최대 10분 단위로 나누어 하나씩 받아쓰기하세요. 최대 15분의 오디오 파일은 여기서 MP3 자르기로 바로 자를 수 있어요. 동영상이나 더 긴 오디오 파일은 휴대폰 갤러리나 편집기에서 자르세요(동영상 자르기도 10분까지예요). 이 한도는 휴대폰에서도 잘 작동하도록 하기 위한 거예요.
받아쓰기는 무엇을 하나요?
Whisper(OpenAI의 음성 인식 모델, MIT 라이선스 가중치)를 transformers.js(Apache 2.0 라이선스)로 브라우저 안에서 실행해요. 자동 자막 도구와 같은 모델이에요. 처음에는 모델이 다운로드되며(“보통”은 약 77 MB, “높음”은 약 250 MB) 브라우저에 보관돼요.
내 오디오가 서버에 업로드되나요?
아니요. 오디오는 브라우저 안에서 읽고 텍스트로 변환되며 Cocuyo나 제3자에게 전송되지 않아요. 음성 모델만 우리 서버에서 한 번 다운로드돼요.
정말 무료인가요?
네. 가입하기 전에 사용해 볼 수 있으며, 계속 사용하려면 무료 계정이 필요합니다. 구독은 필요 없습니다. 크레딧을 쓰지 않고 웰컴 사용 30회에도 포함되지 않아 사용 횟수 제한이 없습니다.
제한은 어떻게 되나요?
브라우저에서 재생할 수 있는 최대 300MB, 10분의 오디오 또는 영상 파일 하나. 텍스트 변환은 기기에서 실행되며, 휴대폰에서는 컴퓨터보다 훨씬 오래 걸릴 수 있어요.
배우기…
더 많은 무료 도구
다른 오디오 도구
모든 무료 도구
만들고 싶을 때
AI로 목소리와 내레이션을 만드세요.
Cocuyo 스튜디오는 이미지, 동영상, 음성 AI 모델 30개 이상을 한곳에 모았어요. 생성하기 전에 크레딧 비용을 확인할 수 있고, 크레딧은 만료되지 않아요.





