← Volver a Novedades
Los grandes: Gemini · Gemini 3.5 Transcribe · 26 de septiembre de 2026

Gemini ya transcribe audios y distingue quién habla

Google metió mano de nuevo en cómo su inteligencia artificial entiende el sonido: liberó un modelo dedicado a pasar audio a texto, Gemini 3.5 Transcribe, que además de escribir lo que se dice separa quién dijo qué y marca el segundo exacto de cada palabra. No es la primera vez que un modelo transcribe; lo que cambia acá es la precisión y el detalle que entrega de una sola pasada.

Una empleada de un comercio mirando el celular desbordado de audios de WhatsApp apilados uno tras otro

Qué hace distinto de un dictado común

Cualquiera que mande y reciba audios de WhatsApp todo el día conoce el problema: un cliente manda tres minutos contando un pedido, un reclamo o una consulta, y hay que escucharlo entero —a veces dos veces— para anotar bien un dato. Este modelo hace diarización de hablantes (distingue las voces de las distintas personas que participan de una misma grabación) y agrega timestamps por palabra (el momento exacto, en segundos, en que se dijo cada palabra), así que un audio con dos personas hablando —un cliente y quien atiende, por ejemplo— sale como un diálogo ordenado, no como un bloque de texto sin pausas ni dueño.

También acepta una lista de vocabulario personalizado: hasta 1.000 términos propios —nombres de productos, de calles, de marcas— para que no los transcriba mal. Una distribuidora que vende insumos con nombres técnicos, o un consultorio con apellidos de pacientes, gana precisión justo donde un dictado genérico suele fallar.

El mismo celular en un escritorio ordenado, mostrando los audios recibidos con cada hablante identificado por color y su horario

De dónde sale la precisión

El modelo hace reconocimiento automático de voz (lo que en inglés se conoce por la sigla ASR: el proceso que convierte sonido en texto) en más de 85 idiomas, y detecta sola cuando una misma grabación mezcla dos —lo que se llama code-switching, cuando alguien arranca una frase en español y la termina en inglés sin avisar, algo bastante común en un audio real. Google mide el acierto con la tasa de error de palabra (WER, la sigla en inglés de word error rate: el porcentaje de palabras mal transcriptas sobre el total) y reporta 2,6% en el modo que no es en vivo, un número bastante mejor que el de los dictados genéricos que se venían usando hasta ahora.

Tiene además un modo "inteligente" que limpia las muletillas —los "eh", los "este"— y ordena la puntuación, así el texto que queda ya se puede pegar en un mensaje o un informe sin corregir nada a mano.

Lo que todavía no hace

No es mágico ni sirve para cualquier cosa. La diarización distingue bien hasta ocho voces distintas, pero con tres o más todavía es experimental. Y hay una limitación puntual: no se puede pedir vocabulario personalizado junto con diarización o timestamps en el mismo pedido —hay que elegir qué necesitás más para esa grabación en particular. Para un audio corto con una sola voz, la diferencia con lo que ya había no se nota tanto; donde rinde de verdad es en grabaciones largas, con varias personas, en un negocio que necesita quedarse con un registro escrito de lo que se dijo.

Un audio que no se pierde en el medio de otros diez

Un negocio que recibe audios de clientes todo el día no necesita transcribir a mano para no perder un dato: automatizar esa atención evita que un pedido o un reclamo por audio quede tapado entre otros mensajes.

Mirá cómo se ordena la atención por WhatsApp de un negocio →