Telonic文档
中文

质量与分析

每次对话的质检

每一次对话如何依据您的团队编写的标准评分,以及未达标的对话如何送交工作人员审阅。

本页内容
  1. 从抽样到每一次对话
  2. 对话如何评分
  3. 技术细节
  4. 分数与您的阈值
  5. 人工校准确保评分可靠
  6. 送交审阅的对话会怎样处理
  7. 由您的团队处理的对话
  8. 实际应用
  9. 您的团队掌控的内容
  10. 相关内容

大多数质检团队每月为每位工作人员抽查少量对话,并寄希望于样本具有代表性。Telonic 依据您自己的团队编写的质量标准,为每一次对话评分。您的质检负责人看到的是整个月的情况,而不是其中的样本;未达到您标准的对话会被转给工作人员审阅。一致性不再是您的假设,而成为您可以证明的事实。

从抽样到每一次对话

抽样告诉您少数几次对话的情况。为每一次对话评分,则告诉您整体服务的情况,以及服务在哪些方面存在差异。

抽样每次对话都评分
审阅范围一小部分对话,由审阅人员挑选或随机抽取AI 智能体在每个渠道中进行的每一次对话
如何发现问题恰好落入样本时才会发现低于您所设阈值的每一次对话都会进入审阅队列
结果显示什么对质量的大致印象逐项显示有多少对话达到了您的标准,以及哪些没有达到
审阅人员把时间花在哪里收听本来没有问题的对话需要人工判断的对话

对话如何评分

对话结束时,即依据您质量标准中的每一个评分项接受评估:智能体是否核实了客户身份、是否依据您经审批的信息来源作答、是否在应当时提出可转给工作人员,等等。每个评分项都会被标记为达到或未达到,并附上理由,然后按照您的团队设定的权重,将结果合并为一个分数。分数、每个评分项的结果及其理由都与对话一起保存,因此任何审阅该对话的人都能清楚地看到它为何得到这个分数。

标准由您决定。Telonic 会在实施期间协助您编写标准,以您所在行业中一次好的对话应有的样子为起点,但评分项、其权重和阈值都由您的团队决定。参见编写您的团队可核查的质量标准。

技术细节

问题答案
评估哪些内容?完整的对话记录:转录文本、摘要、处理结果、执行的操作以及决策日志(智能体查询了什么,以及它为什么这样做)
在哪里评分?与其他所有处理一样,在您的部署中、您选择的区域内进行。如果您选择了您所在区域以外的语言模型,任何文本在到达该模型之前,其中的个人信息都会先经过脱敏处理。参见数据如何在对话中流转
标准变更如何处理?您标准的每个版本都有记录,每个分数都记录其评分所依据的版本,因此变更前后的分数绝不会在您不知情的情况下混在一起
分数保留多长时间?与对话一起保存,保留期限由您设定

分数与您的阈值

您的团队设定一个阈值:分数低于该值的对话,需要工作人员查看。您还可以将个别评分项(例如必要披露)标记为关键项,这样,任何遗漏关键项的对话,无论总分多少,都会送交审阅。

人工校准确保评分可靠

只有当您的质检团队认同自动评分时,自动评分才有其价值。在使用评分之前,您的质检审阅人员会亲自为一组真实对话评分,我们再将他们的结果与自动评分逐项比较。出现差异的地方,通常是因为评分项措辞过于宽泛,我们会与您的团队一起改写,直到两者一致。

上线后,校准仍会继续。您的审阅人员每月对一部分对话进行评分,与自动评分对照,任何偏差都会得到调查和纠正。对标准的变更与其他任何变更遵循相同的流程:在上线前经过测试。参见变更如何上线。

送交审阅的对话会怎样处理

低于阈值或遗漏关键评分项的对话,会出现在控制台质量(Quality)视图的审阅队列中。审阅人员打开对话后,可以看到转录文本、录音(如果客户同意录音)、每个评分项的分数及其理由,以及决策日志。

审阅人员记录自己的评估以及后续应采取的措施。这可能是与客户跟进、更正您的某份源文档、更改某个工作流,或修改标准本身。每次审阅都会记录在该对话下。参见控制台和审计日志与决策记录。

说明

质量分数衡量的是对话与您的标准的符合程度。它是供工作人员据以采取行动的信号,而不是审阅结论。有关客户、投诉或同事的决定,仍由您的团队作出。

由您的团队处理的对话

如果您自己的团队进行的对话被纳入客户档案(这一点在实施期间配置),这些对话也可以依据同一标准评分。这样,您的质检团队就能以统一的标准覆盖智能体和您的员工,辅导工作也可以借鉴最佳对话的共同点。参见由您的团队处理的对话和洞察与趋势。

实际应用

阿联酋的一家保险公司在其车险理赔进度热线上使用智能体。

  1. 在实施期间,其质检和合规团队编写了一项包含八个评分项的标准,其中包括“在透露理赔详情之前已核实身份”和“已说明下一步以及预计何时进行”。身份核实被标记为关键项。
  2. 两名质检审阅人员为测试阶段的六十次对话评分。在“正确解释了免赔额”这一评分项上,他们与自动评分结果出现分歧的次数多于其他评分项。该评分项随后被改写,写明以保单明细表作为依据,此后双方的评分一致。
  3. 在第一个完整月中,每一次对话都得到了评分。审阅队列中是低于阈值 70 分的对话,以及少数遗漏关键评分项的对话。
  4. 质检负责人 Reem 逐一处理队列中的对话。有几个低分的原因相同:客户询问代步车,而源文档中没有涉及这一内容。她要求补充有关代步车的措辞。
  5. 次月,Reem 将代步车问题的评分项结果与标准中其余部分进行比较,以核实新措辞是否有效。

您的团队掌控的内容

  • 您标准中的评分项、其权重,以及哪些是关键项。
  • 对话低于多少分时送交审阅的阈值。
  • 按角色设定由谁审阅,以及谁可以查看分数。
  • 标准何时变更,每个版本都有记录并在上线前经过测试。