Transcripción en vivo

Pulsa grabar y tus palabras van directas a nuestra IA — el texto aparece unos segundos por detrás de tu voz, y al parar recibes una transcripción pulida.

Sin registro Sin marca de agua Exportación en TXT · SRT · VTT Los archivos se borran automáticamente en 24h
Arrastre y suelte su archivo aquí
o navegar por sus archivos
Gratis: {0} archivos al día · hasta {1} min y {2} MB cada uno
0:00
Borrador en vivo
Las palabras aparecen mientras hablas, transcritas en vivo por nuestra propia IA — presione Transcribe cuando termines para la versión pulida y editable.
El acceso al micrófono fue bloqueado — permitirlo en la configuración del sitio de su navegador, o subir un archivo en su lugar.

¿Archivos más grandes o más cargas? Cuenta gratuita: 5 archivos/día, archivos de 1 hora · Pro: archivos de 10 horas + etiquetas de hablante

0%
Cargando...
Mantenga esta pestaña abierta — usted será redirigido a su transcripción.
Talks & speechesReal-time notesIn-room speechAccessibility

En vivo de verdad: tu voz llega a nuestra propia IA mientras hablas

Mientras grabas, la página corta la señal del micrófono en segmentos cortos — de unos segundos cada uno, ajustados de forma adaptativa para que el siguiente salga en cuanto vuelve el anterior — y envía cada uno directamente a nuestros servidores GPU, donde el mismo modelo de la clase Whisper que impulsa todo el sitio lo transcribe al momento. El texto aterriza en el feed en vivo unos segundos por detrás de tu voz y sigue fluyendo mientras sigas hablando. Sin servicio de voz del navegador, sin API de dictado de terceros — el texto en vivo es salida real de Whisper desde nuestro propio hardware.

Como solo necesita grabar con el micrófono, el modo en vivo funciona en cualquier navegador moderno — Chrome, Edge, Safari y Firefox, en escritorio y móvil. Cada segmento de audio se borra de nuestros servidores en cuanto vuelve su texto.

El feed en vivo frente a la transcripción final

La transcripción por segmentos tiene un límite inherente: el modelo ve unos pocos segundos cada vez, así que una palabra que cae entre dos segmentos puede salir cortada, y la puntuación entre límites de segmento es una conjetura. Por eso el flujo termina con un paso más: la grabación completa se guarda en tu navegador mientras hablas, y al pulsar Transcribir pasa por el modelo como una sola toma — contexto completo, puntuación correcta, marcas de tiempo, el editor y exportación a TXT/SRT/VTT.

Usa el feed en vivo para confirmar que va al día y para copiar texto en cuanto se dice (hay un botón de copiar en el feed); usa la pasada final para todo lo que vayas a conservar. Si el audio ya lo tienes como archivo, el modo de subida de cualquier página de herramienta es el camino más corto.

Preguntas frecuentes

¿Es esto en realidad en vivo, o grabado y enviado después?
En vivo de verdad: la grabación y la transcripción se solapan. La página envía cada fragmento de unos segundos de audio a nuestras GPU mientras todavía estás hablando el siguiente, así que el texto se acumula durante la grabación, no después. Cuenta con que el feed vaya un puñado de segundos por detrás de tu voz — el tiempo que tarda un fragmento en terminar, subirse y transcribirse.
¿Por qué el texto en vivo está unos segundos detrás de mí?
Tres pequeños retrasos se acumulan: una rebanada tiene que terminar de grabarse (tres segundos o más), viajar al servidor y pasar por el modelo. Esto suele poner la alimentación unos 4-8 segundos detrás de su voz — y si nuestras GPUs están brevemente ocupadas, la página se adapta enviando rebanadas un poco más largas en lugar de quedarse atrás. El habla natural con pausas se siente suave.
¿En qué navegadores funciona el modo live?
Todos los modernos — Chrome, Edge, Safari, y Firefox, en el escritorio y los teléfonos. Se basa en la grabación de micrófono estándar en lugar de un servicio de voz del navegador, por lo que funciona en Firefox, así como en Chrome.
¿Dónde va mi voz mientras la transcripción en vivo se ejecuta?
Solo a nuestros servidores, y lo contamos tal cual: el modo en vivo nos envía tu audio en segmentos cortos mientras hablas — eso es lo que lo hace en vivo — y cada segmento se borra inmediatamente en cuanto vuelve su texto. Nada va a Google, Apple ni a ningún servicio de voz de terceros. La grabación completa se queda en tu navegador hasta que pulsas Transcribir, y las transcripciones anónimas se eliminan solas en un plazo de 24 horas.
¿Puedo usarlo para seguir una reunión o una conferencia en la sala?
Como ayuda personal, sí — pon el dispositivo cerca de quien habla y el feed sigue bien el habla clara, con unos diez segundos de retraso. Conoce los límites: es un solo micrófono, así que las voces lejanas y las conversaciones cruzadas lo degradan, y no es un servicio de subtitulado certificado para cumplir normas de accesibilidad. Pulsa Transcribir al final y la pasada con contexto completo suele recuperar lo que el feed en vivo falló.
¿Qué idiomas funcionan en vivo, y debería elegir uno?
Los mismos más de 90 idiomas que cualquier transcripción de este sitio — es el mismo modelo. Un consejo específico del modo en vivo: elige tu idioma en el selector en lugar de dejar la detección automática. La detección se ejecuta por segmento, y siete segundos no son mucha evidencia, así que fijar el idioma evita que el feed dude con frases cortas o con acento.