El ParteEdiciones anteriores

04 · Google

Google presenta Gemini 3.5 Transcribe, un modelo de transcripción con formato automático

Cintas metálicas caóticas atraviesan un filtro oscuro y emergen como bloques y hojas ordenados con un acento verde.

Google ha presentado Gemini 3.5 Transcribe como su modelo de speech-to-text más preciso hasta la fecha. La propuesta convierte audio bruto en texto preciso, pulido y formateado, y está pensada para interacción de voz inteligente. La empresa también afirma que admite transmisión en tiempo real y procesamiento de audio pregrabado.

Por qué importa

Para equipos que construyen productos de voz, el interés está en que la transcripción deja de ser solo una salida textual limpia y pasa a incorporar formato automático y manejo de errores habituales del habla. Eso puede simplificar asistentes, subtitulado y análisis posteriores, y reforzar la oferta de Google frente a alternativas comparables.

Los detalles

  • Según Google, el modelo está diseñado para lidiar con ruido de fondo, jerga compleja y corrección de disfluencias, además de eliminar muletillas y aplicar formato automático al texto.
  • La compañía indica que la transcripción en tiempo real se ofrece mediante Live API y que el audio pregrabado se procesa con Interactions API.
  • Google también cita mejoras de rendimiento frente a Chirp 3 en métricas de WER y latencia, respaldadas por resultados que atribuye a Artificial Analysis.