ÚTIL GRATIS · EN TU DISPOSITIVO
Transcribir audio y video a texto gratis
Convierte en texto lo que se dice en un audio o un video: una nota de voz, una entrevista, una clase o un episodio de pódcast. La transcripción se hace con Whisper dentro de tu dispositivo; revisa el texto, cópialo o descárgalo en TXT (en párrafos o con marcas de tiempo), SRT o VTT.
- Primer uso sin cuenta
- TXT, SRT y VTT
- Tu audio no sale de tu dispositivo
- Añade tu audio o video
- Transcribe
- Revisa y descarga
CÓMO SE USA
Tres pasos.
Añade tu audio o video
MP3, WAV, M4A, OGG, MP4, WebM o MOV con voz, de hasta 10 minutos. Elige el idioma de la lista (hay 20) o deja que se detecte.
Transcribe
Pulsa «Transcribir a texto». La primera vez se descarga el modelo; después tarda más o menos lo que dura el audio en un equipo reciente.
Revisa y descarga
Corrige el texto, cópialo o descarga el TXT en párrafos o con marcas de tiempo, y el SRT o el VTT por frases.
SIGUIENTE PASO
Sigue con estos útiles
Transcribir a texto: preguntas frecuentes
¿Qué tan precisa es la transcripción?
La precisión depende de la grabación y no se asegura. Puede equivocarse con nombres propios, música de fondo, acentos muy marcados o varias personas hablando a la vez, y no distingue quién habla. Whisper acierta más en español y en inglés que en otros idiomas. Revisa y corrige el texto antes de usarlo.
¿Sirve para notas de voz de WhatsApp?
Sí, si tu navegador puede reproducir el archivo (las notas de voz suelen ser OGG u OPUS, que Chrome, Edge y Firefox leen). Guárdala en tu dispositivo y añádela aquí.
¿Y si mi audio dura más de 10 minutos?
Córtalo en partes de hasta 10 minutos y transcríbelas una a una. Un audio de hasta 15 minutos se corta aquí mismo, con nuestro útil Cortar audio y MP3; un video o un audio más largo, en la galería del móvil o en tu editor (Recortar video también llega hasta 10 minutos). El límite es para que funcione bien también en el móvil.
¿Con qué se transcribe?
Con Whisper (modelo de reconocimiento de voz de OpenAI, pesos con licencia MIT) ejecutado por transformers.js (licencia Apache 2.0) dentro de tu navegador, el mismo que usa nuestro útil de Subtítulos automáticos. La primera vez se descarga el modelo (unos 77 MB en «Normal» y unos 250 MB en «Alta») y el navegador lo guarda.
¿Se sube mi audio a algún servidor?
No. El audio se lee y se transcribe dentro de tu navegador y no se envía ni a Cocuyo ni a terceros. Solo se descarga el modelo de voz, una vez, desde nuestros servidores.
¿Necesito cuenta o créditos?
El primer uso es libre, sin cuenta; desde el segundo uso se pide una cuenta gratuita. No gasta créditos ni usos de bienvenida y no tiene límite.
¿Qué límites tiene?
Un audio o video de hasta 300 MB y 10 minutos que tu navegador pueda reproducir. La transcripción funciona en el dispositivo: en un móvil puede tardar bastante más que en un equipo de escritorio.
¿Qué idiomas puedo elegir?
El selector ofrece 20 idiomas, entre ellos español, inglés, portugués, francés, alemán, italiano, catalán, ruso, chino, japonés y coreano, además de «Detectar idioma». Whisper acierta más en español y en inglés; en otros idiomas comete más errores, así que prueba la precisión Alta y revisa el texto.
¿Qué cambia entre la precisión Normal y Alta?
Normal usa un modelo de unos 77 MB y Alta uno de unos 250 MB. Alta descarga más y tarda más en transcribir, y es la opción que recomienda la herramienta cuando el idioma no es español ni inglés. El navegador guarda el modelo tras la primera descarga.
¿Qué diferencia hay entre TXT, TXT con tiempos, SRT y VTT?
El TXT junta el texto en párrafos, que se abren tras una pausa de más de 1,5 segundos o al cerrar una frase si el párrafo ya es largo. Con marcas de tiempo, cada párrafo empieza con su hora de inicio, como [01:05] (minutos y segundos). El SRT y el VTT cortan por frases de hasta 14 palabras, con inicio y fin. Lo que corrijas en el cuadro vale para copiar y para «Descargar .txt», no para los archivos TXT, SRT y VTT de la lista.
Aprende a…
MÁS ÚTILES GRATIS
Otros útiles de audio
Todos los útiles gratis
CUANDO QUIERAS CREAR
Crea voces y narraciones con IA.
El Estudio de Cocuyo reúne más de 30 modelos de IA de imagen, video y voz. Ves el coste en créditos antes de generar, y los créditos no caducan.





