TelonicDocumentación
Español

Integraciones

Reconocimiento del habla y voz

Los proveedores de reconocimiento del habla y de síntesis de voz con los que trabaja Telonic, cómo se eligen para su despliegue y por qué se ejecutan siempre en su región.

En esta página
  1. Lo que hacen los proveedores de habla y voz en su despliegue
  2. Proveedores con los que trabaja Telonic
  3. Por qué el habla permanece siempre en su región
  4. Cómo se eligen los proveedores
  5. El detalle técnico
  6. Permisos habituales en esta categoría
  7. En la práctica
  8. Lo que controla su equipo
  9. Relacionado

En una llamada, hay dos cosas que deciden si la conversación funciona: lo bien que el agente de IA oye a la persona que llama y cómo suena el agente cuando responde. El reconocimiento del habla convierte en texto lo que dice la persona que llama a medida que habla, en su idioma y su dialecto. La síntesis de voz pronuncia la respuesta del agente con la voz elegida para su marca.

Telonic trabaja con varios proveedores especializados en cada una de estas funciones, y los elige con usted para su despliegue. El reconocimiento del habla y la síntesis de voz se ejecutan siempre en la región que usted elija.

Lo que hacen los proveedores de habla y voz en su despliegue

FunciónLo que significa para ustedEjemplo
Reconocimiento del hablaLas palabras de la persona que llama se convierten en texto a medida que habla, también en árabe del Golfo, egipcio y levantino, y cuando mezcla árabe e inglés en una misma frase«أبغى أغير الحجز to Friday, please», transcrito tal como se dijo
Síntesis de vozLa respuesta se pronuncia con una voz adecuada a su marca, en cada idioma que usted utiliceUna voz árabe serena y formal, y una voz inglesa a juego, para una promotora de lujo
Notas de vozLas notas de voz de WhatsApp se transcriben antes de que el agente respondaUn asegurado describe los daños en una nota de voz

Proveedores con los que trabaja Telonic

Cada uno de los proveedores siguientes ofrece reconocimiento del habla, síntesis de voz o ambas cosas. Qué proveedor desempeña cada función en su despliegue se decide con usted, según el idioma, el dialecto, la voz y la región.

IntegraciónLo que abarca la conexión
DeepgramReconocimiento del habla, síntesis de voz o ambos, según lo que se elija para su despliegue
ElevenLabsReconocimiento del habla, síntesis de voz o ambos, según lo que se elija para su despliegue
Fish AudioReconocimiento del habla, síntesis de voz o ambos, según lo que se elija para su despliegue
RimeReconocimiento del habla, síntesis de voz o ambos, según lo que se elija para su despliegue
CartesiaReconocimiento del habla, síntesis de voz o ambos, según lo que se elija para su despliegue
SpeechmaticsReconocimiento del habla, síntesis de voz o ambos, según lo que se elija para su despliegue
AssemblyAIReconocimiento del habla, síntesis de voz o ambos, según lo que se elija para su despliegue
SonioxReconocimiento del habla, síntesis de voz o ambos, según lo que se elija para su despliegue

Durante la implementación se confirma qué proveedores y modelos están disponibles en su región, y se indican en su contrato.

Por qué el habla permanece siempre en su región

El reconocimiento del habla y la síntesis de voz se ejecutan siempre con proveedores desplegados en la región que usted elija. El audio de las llamadas contiene datos personales que no se pueden enmascarar (eliminar u ocultar) antes de transcribirse, y una respuesta hablada puede incluir el nombre de un cliente o los datos de su reserva, por lo que ambos permanecen dentro de la región. No se ofrece ningún proveedor de habla ni de voz situado fuera de la región.

El único componente que puede elegirse fuera de su región es el modelo de lenguaje, y solo por elección expresa de usted. Consulte Modelos de lenguaje.

Cómo se eligen los proveedores

Los proveedores se eligen para cada despliegue, con usted, durante la implementación. El reconocimiento del habla se elige por lo bien que maneja los idiomas y dialectos que utilizan sus clientes, incluido el cambio entre árabe e inglés. La síntesis de voz se elige por la voz que necesita su marca: su equipo escucha las voces preseleccionadas y elige una para cada idioma. Consulte Voces.

Los contratos de Telonic con todos los proveedores prohíben utilizar los datos de su empresa para entrenar o mejorar los modelos del proveedor, y siempre que el proveedor lo ofrezca se utilizan acuerdos de conservación cero de datos (en los que el proveedor no conserva ninguna copia de lo que procesa). Todos los proveedores que se utilizan en su despliegue figuran entre los subencargados del tratamiento de su despliegue. Consulte Subencargados del tratamiento.

El detalle técnico

El reconocimiento del habla funciona de forma continua mientras habla la persona que llama, de modo que la transcripción se va construyendo durante la llamada. Se accede a los proveedores a través de una capa de enrutamiento de modelos (software que envía cada solicitud al proveedor elegido para esa función), de modo que uno puede cambiarse sin reconstruir el agente. Cualquier cambio de proveedor se prueba y requiere su aprobación antes de la publicación de la versión.

Si un proveedor sufre una interrupción del servicio, la conmutación por error solo cambia a un proveedor aprobado de la región que usted elija, y los proveedores de respaldo se prueban con antelación. Los despliegues en sus propias instalaciones ejecutan modelos de voz autoalojados. El audio entre su sistema telefónico y su despliegue se cifra de forma predeterminada con SRTP (Secure Real-time Transport Protocol).

Permisos habituales en esta categoría

Cada acción en sus sistemas la realiza el software de Telonic, con los permisos que su equipo ha concedido. Los proveedores de habla y voz solo reciben el audio o el texto de cada turno de la conversación, y no tienen ninguna conexión propia con sus sistemas. Consulte Permisos.

En la práctica

Qamar Stays, un grupo hotelero de Riad y Yeda, configura las reservas por voz en la región de Arabia Saudí.

  1. Sus huéspedes llaman sobre todo en árabe del Golfo y a menudo pasan al inglés para las fechas y los tipos de habitación.
  2. Telonic prueba los proveedores de reconocimiento del habla desplegados en la región de Arabia Saudí con grabaciones de las propias llamadas del grupo, utilizadas con su permiso, y recomienda uno.
  3. El equipo de marketing escucha las voces preseleccionadas y elige una voz árabe cálida y formal, y una voz inglesa a juego.
  4. Todos los proveedores se ejecutan en la región de Arabia Saudí, y cada uno se indica en el contrato del grupo.

Lo que controla su equipo

  • La voz que escuchan sus clientes, en cada idioma.
  • La aprobación de cada cambio de proveedor antes de que entre en producción.

Los nombres y logotipos de productos son marcas comerciales de sus respectivos titulares. Su mención indica sistemas con los que Telonic se conecta y no implica asociación ni respaldo.