📰 Última noticia Gemini llamará a tu madre por ti
Gadgets

Gemini 3.8 Flash TTS clona tu voz con 30 segundos

Gemini 3.8 Flash TTS clona tu voz con 30 segundos

Google está desplegando Gemini 3.8 Flash TTS y su variante Lite, modelos de síntesis de voz que permiten clonar una voz real con solo 30 segundos de audio. La novedad no es la calidad del habla, que ya era aceptable, sino la velocidad de creación y la fidelidad en la replicación de timbres específicos sin necesidad de grabar horas de datos. Esto cambia la dinámica de las herramientas de accesibilidad y creación de contenido, donde el umbral de entrada para tener una voz personalizada era hasta ahora prohibitivo.

Los detalles

El salto cualitativo respecto a las versiones anteriores de Gemini TTS reside en la eficiencia del entrenamiento. Anteriormente, para obtener una voz sintética que no sonara robótica y mantuviera las muletillas o el tono específico de una persona, se requerían datasets extensos. Ahora, el modelo Flash procesa una muestra mínima para generar un clon usable.

  • Modelos disponibles: Gemini 3.8 Flash TTS (alta calidad) y Gemini 3.8 Flash-Lite TTS (baja latencia/costo).
  • Requisito de entrada: 30 segundos de audio limpio para la clonación.
  • Capacidad: Generación de voces nuevas desde cero o replicación de voces existentes.
  • Velocidad: Optimizado para respuestas casi instantáneas, ideal para interfaces en tiempo real.

Precio y disponibilidad

Google no ha publicado una tarifa específica por uso para España en este momento, ya que la herramienta se integra dentro de la infraestructura de APIs de Google Cloud y las interfaces de Gemini. Para el usuario final, el acceso suele estar ligado a las suscripciones a Google One o a las cuotas de desarrollo para creadores. No hay fecha de lanzamiento de una app de consumo masivo gratuita; por ahora, es una herramienta orientada a desarrolladores y empresas que integren voz en sus productos. Si buscas una alternativa de consumo ya disponible, las opciones actuales de clonación de voz en el mercado rondan entre 0 y 20 euros al mes dependiendo de la calidad, pero ninguna ofrece la integración nativa con el ecosistema de IA de Google.

Cómo se compara

Frente a ElevenLabs, el rival directo más conocido en clonación de voz, Gemini Flash TTS compite en velocidad de inferencia más que en matices emocionales profundos. ElevenLabs sigue siendo superior en la expresión de emociones complejas (tristeza, ira sutil), pero Gemini gana en integración nativa y coste de cómputo. La versión Lite de Google es comparable a las APIs de Microsoft Azure Speech, pero con la ventaja de que el modelo de lenguaje subyacente ya entiende el contexto de la conversación, lo que reduce la necesidad de post-procesamiento para que la voz suene natural en diálogos largos.

Qué significa para ti

Si desarrollas aplicaciones o usas herramientas de accesibilidad, esto reduce drásticamente el tiempo de configuración. Ya no necesitas grabar sesiones de estudio de 30 minutos para que tu asistente suene como tú; bastan 30 segundos. Para el usuario medio, esto implica que las voces en los asistentes de Google en móviles y smart speakers dejarán de sonar genéricas. La personalización de la voz dejará de ser un lujo de estudio para convertirse en una función estándar, aunque el control sobre cómo se usa tu voz sigue siendo un tema de privacidad que debes monitorizar.

Revisa nuestra guía de las mejores herramientas de IA para creadores de contenido para ver cómo encaja esta nueva capacidad en tu flujo de trabajo actual.

Más fotos

Gemini 3.8 Flash TTS clona tu voz con 30 segundos — foto 1Gemini 3.8 Flash TTS clona tu voz con 30 segundos — foto 2

Fotos de la ficha del fabricante. Toca cualquiera para verla completa.

Más noticias

De nuestros análisis

Fuente: El Chapuzas Informatico