Google lleva voces personalizadas y clonación con consentimiento a Gemini 3.8 TTS
Google presentó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de síntesis de voz diseñados para crear voces originales, reproducir perfiles vocales autorizados y dirigir una interpretación con instrucciones en lenguaje natural. El lanzamiento, publicado el 23 de septiembre, ya está disponible en Google AI Studio y Gemini API, además de integraciones en Gemini Enterprise, Gemini Notebook y Google Vids.
Dos modelos para creación y escala
Flash TTS es la opción de mayor capacidad expresiva. Google lo orienta a estudios de voz, personajes para videojuegos, audiolibros, podcasts y agentes conversacionales que necesitan controlar tono, ritmo y matices. Flash-Lite TTS está dirigido a escenarios de gran volumen en los que importan más el costo y la velocidad, como doblaje, generación masiva de contenido y servicios de voz.
La demostración publicada por Google DeepMind muestra dos rutas de creación. La primera permite diseñar una voz completamente nueva mediante una descripción: edad aparente, timbre, acento, energía o estilo interpretativo. La segunda reproduce un perfil vocal consistente a partir de una muestra de 30 segundos, siempre que sea la voz del usuario o exista derecho para utilizarla.
El sistema también permite dirigir cada línea con indicaciones sobre emoción, pausas, velocidad, sonidos conversacionales y cambios de dialecto. En escenas con dos hablantes, el creador puede definir voces distintas y ajustar cómo interactúan. Esto acerca la síntesis de voz a un flujo de dirección artística, no solo a convertir texto en audio.
Controles frente al riesgo de suplantación
La clonación de voz amplía usos legítimos —por ejemplo, mantener la voz de un narrador autorizado en una serie—, pero también eleva el riesgo de fraude y suplantación. Google afirma que la función incorpora verificación de consentimiento para los perfiles reproducidos. El audio generado incluye SynthID, la marca de agua de la compañía para contenido sintético, y credenciales C2PA para conservar información verificable sobre su procedencia.
Esos controles no eliminan por sí solos el abuso. SynthID requiere herramientas capaces de detectar la marca, mientras que C2PA depende de que las plataformas mantengan los metadatos y los presenten al público. La ficha del modelo indica que Google realizó evaluaciones humanas, pruebas automatizadas y ejercicios de red teaming, pero no publica en esa página tasas específicas de falsas aceptaciones para la verificación de consentimiento ni resultados detallados sobre clonación no autorizada.
Rendimiento y disponibilidad
Google sostiene que Gemini 3.8 Flash TTS obtuvo el primer lugar general en el benchmark RW-Voice-EQ de Hume AI, con 71.4 puntos, y 60.8 en modelado de acentos. Hume describe RW-Voice-EQ como una evaluación multidimensional de sistemas de voz en condiciones reales. Aun así, una clasificación agregada no determina por sí sola la calidad para cada idioma, acento o caso de producción; los equipos deberán probar naturalidad, consistencia y latencia con sus propios datos.
El lanzamiento extiende la competencia en audio generativo hacia una combinación concreta: creación de voces por instrucciones, reproducción autorizada, dirección detallada y despliegue a escala. Para desarrolladores y productores, el avance reduce la distancia entre un prototipo y una herramienta de producción. Para plataformas y organizaciones, también aumenta la necesidad de conservar credenciales de procedencia y verificar autorización antes de publicar voces sintéticas.
La ficha técnica de Gemini 3.8 Audio agrupa Flash TTS y Flash-Lite TTS con los modelos Live de la misma familia. Google afirma que estas variantes no representan un aumento material de capacidades de frontera frente a Gemini 3.7 Flash. Esa evaluación se refiere a su marco de seguridad de frontera; no debe interpretarse como una medición completa del riesgo social de la clonación de voz.
Fuentes: Google, Google DeepMind, Hume AI