AI 客服答得流利就算过关?ClientCoded 用虚拟顾客先找失误
ClientCoded 面向开发 AI 客服、销售助手和内部资料助手的团队。它用虚拟顾客连续追问,也用生成的测试数据核对答案,把“听起来不错”变成可以逐项检查的报告。创始人 Travis 近日公开介绍了这套做法。
顾客已经说想购买,AI 客服却礼貌地结束了聊天;同事问有多少待处理问题,AI 报出的数字又漏了一批。ClientCoded 想帮开发这些助手的团队先找到这类失误:接入自己的助手,说明业务和测试要求,再让虚拟顾客连续提问,或让助手回答一套有标准答案的测试数据。团队看到的不是一句“表现不错”,而是哪段对话、哪道问题出了错。
别只问一道友好的问题,让它连续面对难缠顾客
Travis Cronin 近日在 Hacker News 介绍 ClientCoded,称他与联合创始人一起开发这个项目。他们在开发前与工程团队交流,发现不少团队仍靠人工抽查,或让另一个 AI 判断回答好不好。团队把选题放在这道缺口上:助手已经做出来了,接下来怎么判断它能不能正常接待人?
按照产品的使用说明,团队先提供自己的助手入口、产品介绍、目标顾客和常见异议。ClientCoded 再生成不同的虚拟顾客,与助手一来一回地聊。有人准备购买,有人对价格不满,有人不断换话题。这里的 AI 既用来扮演提问的人,也参与检查对话;测试关注的不只是措辞顺不顺,还包括有没有记住前面说过的话、重复询问,或在需要时把问题交给人。
查内部资料时,答案不能只靠另一个 AI 猜
聊天质量可以按规则检查,但“还剩多少待处理问题”这类问题有明确答案。ClientCoded 的另一条测试路线,是让团队描述资料表的结构,比如有哪些客户、任务和状态字段,再生成同样结构的虚拟数据和问题。助手根据这些测试资料作答,报告把答案与计算结果逐项比较。
Travis 在公开帖中解释,标准答案最初通过查询生成的数据计算出来,不是让语言模型凭感觉写一个答案。官网的数据测试展示里,助手回答有 14 个未处理问题,计算结果却是 23 个,原因是筛选时漏掉了一类记录。这是团队给出的展示例子,说明他们想检查的是漏查、条件理解和多步处理,而不只是文字是否像真的。
改完以后还要再检查,错了也要知道错在哪
ClientCoded 的评分规则把“事情有没有办成”和“对话处理得怎么样”分开。比如约好了会面,却反复问顾客同一个信息,两项结果就不该混为一个漂亮总分。对小团队来说,这能把修改方向具体到某段对话,而不是一遍遍重写整套指令。
官网还提供上线后的对话检查:把对话接入后,用规则发现空回复、循环和重复,再让 AI 检查信息、语气或转交人工方面的问题,出现质量下降时向团队发提醒。需要追查内部步骤的开发者可以接入 Python 记录工具。PyPI 的平台发布记录显示,ClientCoded 0.4.0 于 9 月 9 日上传;Chrome Web Store 也列有同名测试扩展,开发者联系地址与官网一致。两处记录能核对产品入口,但评分能力仍需结合自己的任务判断。
小团队能借鉴的,是先说清楚怎样才算做对
这个项目的切入点不是再做一个客服,而是围绕 AI 助手做检查工具。团队在官网说明,他们也曾发布自己的助手,却缺少客观衡量其表现的办法,于是开始建设持续测试。对开发者而言,先列出几种会出问题的情况,以及正确的下一步,比只问“回答有没有礼貌”更接近业务需要。
测试前仍要划清资料范围。ClientCoded 的数据政策说明,测试对话和评分会发送到其服务器;Python 工具文档也提醒,处理密码、令牌或个人信息的函数应先清理敏感内容,再接入记录。用虚拟数据测试内部查询,是一条不同于直接上传真实客户资料的路线。接下来值得关注的是,团队能否把失败记录变成稳定、可重复的修改依据,而不只是给助手多加一个分数。
想继续了解
• ClientCoded 产品介绍
• 创始人 Travis 的公开发布帖
• 虚拟顾客测试说明
• 数据测试环境说明
• 评分规则
• 上线后检查说明
• Chrome Web Store:ClientCoded 扩展记录
• PyPI:ClientCoded 发布记录
• PyPI 平台版本及上传时间数据
• 创始人 Travis Cronin 的项目介绍
• ClientCoded 数据处理说明
一起维护这篇内容
我要更新 发现链接失效、信息过时或内容有误,可以提交更新建议。


交流讨论
最新评论
查看全部评论(2)