Software

El nuevo modelo v4 de ElevenLabs ya habla 90 idiomas

ElevenLabs presentó los modelos de voz v4 y v4 Turbo, que admiten 90 idiomas y permiten clonar una voz con solo 10 segundos de audio.

Respuesta breve

La empresa de voz con IA ElevenLabs ha presentado su nueva generación de modelos de voz, con mayor soporte de idiomas y un control de expresión más fino. La nueva arquitectura permite clonar una voz a partir de una muestra de audio mucho más corta para asistentes de voz.

Lo más destacado

  • Los nuevos modelos ahora cubren muchos más idiomas que la versión anterior.
  • Los usuarios ya pueden clonar una voz con solo 10 segundos de audio.
  • La tasa de ingresos anualizada de ElevenLabs ha crecido notablemente desde principios de año.
Una interfaz de edición de audio digital muestra una onda de sonido en una pantalla
Foto: Egor Komarov / Pexels

2 min de lecturaDirector editorial: Uğur Deniz İlhan

ElevenLabs ha presentado dos nuevos modelos de voz llamados ElevenLabs v4 y v4 Turbo, según TechCrunch. Las nuevas versiones aportan más control de expresión, menor latencia para agentes de voz y soporte para más de 90 idiomas.

¿Qué hay de nuevo?

La empresa lanzó su modelo v3 el año pasado; para la generación v4 adoptó una arquitectura completamente nueva. Gracias a ello, los usuarios ya pueden clonar una voz con solo 10 segundos de audio. El modelo mantiene la identidad de la voz de forma más coherente en fragmentos de texto más largos y ajusta la expresión según el contexto del texto mientras lo lee en voz alta. Las etiquetas de expresión en línea introducidas con v3 se han ampliado en v4, permitiendo combinar varias etiquetas seguidas.

¿Qué idiomas mejoraron?

La versión anterior admitía 70 idiomas; ElevenLabs afirma haber elevado esa cifra a 90. La empresa dijo haber observado el mayor salto de calidad en japonés, portugués de Brasil, mandarín y cantonés. El nuevo modelo también puede empezar a generar audio en cuanto el modelo de lenguaje subyacente comienza a generar su respuesta, lo que reduce los tiempos de espera en los asistentes de voz.

¿Qué deberían hacer los equipos de producto en Turquía?

Para los equipos con sede en Turquía que desarrollan automatización de centros de llamadas y productos de asistentes de voz, una menor latencia y la clonación a partir de una muestra más corta podrían reducir costes, especialmente en escenarios de servicio al cliente multilingües. El rápido crecimiento del negocio de llamadas empresariales de ElevenLabs sugiere que los modelos de la competencia avanzarán en la misma dirección; se recomienda a los equipos que, al elegir un proveedor de voz, no solo tengan en cuenta la cobertura de idiomas, sino también criterios de calidad conversacional como la latencia y el manejo de las interrupciones.

Preguntas frecuentes

¿Cuánto audio se necesita para clonar una voz con v4?
Según ElevenLabs, la nueva arquitectura permite clonar una voz con solo 10 segundos de audio.

Fuentes

  1. TechCrunch ·

Siga a UNIT Journal

Las novedades en búsqueda, IA y tecnología, cada día en su feed.

Artículos relacionados

← Volver a UNIT Journal

Midamos hoy
su visibilidad.

Analizamos su visibilidad actual en buscadores y su posición en los motores generativos. Gratis, en una página y con datos reales.

Solicitar un análisis