Echo's blog
Echo's blog
· 1 min read · AI应用

GPT-Live-1开放语音接口,电话客服可以边听边说

GPT-Live-1开放同时听说的语音接口。了解电话预约和客服的接入门槛、每分钟收费、测试限制,以及打断后后台任务仍可能继续的风险。

电话客服还没说完,客户就想改预约时间。据 9 月 10 日发布、本文于 9 月 11 日采集的材料,OpenAI 新开放的 GPT-Live-1 语音接口允许系统一边说、一边听,并处理停顿和打断。这项能力已经用于 ChatGPT,现在开发者可以把它接到自己的服务里。普通商家仍需通过软件供应商或开发接入,不能把接口当作下载即用的客服应用。

边听边说,查资料和办事交给后台#

GPT-Live-1 负责维持现场对话,遇到需要深入思考或执行的任务,再交给后台模型、工具或已有的智能助手。企业可以按速度、推理需求和费用选择搭配。说话与办事分开处理,让对话能够继续进行。

开发者社区的 sps 帖子介绍,产品新增 12 种实时声音,覆盖更多口音、方言和语言;开发者可调整语气、语速和说话风格。系统提供语音转文字记录及回复文本,还能优先识别指定关键词,判断谁该接着说话,并改善对静音和背景噪声的处理。

接入方式包括浏览器使用的 WebRTC、服务器传输音频的 WebSocket,以及电话系统使用的 SIP。对于店主,这意味着供应商需要把语音能力和现有电话、预约系统接起来。报道援引 Yelp 首席技术官 Alex Levy 的说法称,Yelp 正将其用于电话预约,通话处理有所改善;材料没有给出可验证的经营收益。

社区帖子还介绍了与 Codex SDK 连接的方式:应用把对话上下文交给代码助手处理任务,再将结果送回当前语音会话。客户打断说话,不会自动取消后台正在执行的工作。

电话客服业务场景1 语音交谈与后台处理分开,取消动作需要应用另行管理。

等待缩短了,测试成绩仍有适用条件#

社区帖子列出的 Tau3 测试涵盖航空、零售和电信客服。搭配 GPT-6 Astra、采用中等推理强度时,GPT-Live-1 首次完成任务的比例为 83.6%,GPT-Realtime-2.1 为 45.7%。这是指定组合的测试结果,不能直接当作所有企业客服的成功率。

帖子给出的 Full Duplex Bench v1.5 交互成绩为 80.1%,轮次衔接延迟为 0.798 秒,旧模型为 1.41 秒;另在 v3 版的不同评估中,工具调用成功率为 87%,回复质量得分为 90%。Artificial Analysis 的 Conversational Dynamics 测试成绩为 97.3%。这些指标测量的对象不同,不能拼成一个综合正确率。

银行任务数据则存在冲突:报道写 32%,社区帖子写 38.1%。两份材料的口径尚未核实一致,本文不据此判断银行业务能力。

语音会话价格为每分钟 0.05 美元,按秒计费;后台模型和工具另收费。这只覆盖语音层,不能当作完整电话客服的最终报价。已核验材料未说明国内可用地区和具体商家产品入口,也未给出部署后的中文客服效果。

电话客服业务场景2 不同评估各有测试条件,门店仍需验证自己的来电场景。

先试预约登记,别急着让它确认订单#

对预约电话多、反复询问营业时间的门店,这类接口值得关注。可以先让供应商演示一个窄场景:登记客户想约的时间、复述确认,再把记录交给店员。若来电很少、人工本就能接住,接入和维护费用未必划算。

试用时,店主可以故意在系统说话中途改时间,或加一点店内背景声,看看它是否记住最后的要求。这是采用建议,现有报道没有证明它在这些具体门店条件下已经可靠。比起声音是否像真人,更应记录漏接、误记、转人工以及预约是否真正完成。

“别订了”尤其需要测试。语音停止后,后台可能仍在提交预约;供应商应明确取消按钮如何生效、店员能否查到操作记录、出错后怎样撤回。涉及付款、正式报价和订单确认,应保留人工确认,系统只获得必要权限。客户电话和谈话记录也要问清保存位置、保存期限及删除办法。

如果店里常有方言、多人同时说话或嘈杂的收银声,应拿自己的常见来电做小范围测试,并事先征得参与者同意。材料列出更多声音和语言,并不保证能听懂每一家门店的表达。先保留人工接听作为后备,也能避免客户反复解释后直接挂断。

询价时,把电话线路、语音用量、后台服务和维护分别列清。没有技术团队的企业,应要求供应商给出完整试点报价和转人工方案,再决定是否上线。预约是否被正确处理,比单项测试分数更接近这笔采购的实际价值。

电话客服业务场景3 预约登记可先试用,正式确认与取消操作应有人接手。

消息参考来源

Comments

Copied
Copied to clipboard