摘要
arXiv 论文提出 APEX-Voice 基准,用 120 个交互式专业工作流测试五款实时语音智能体,结果显示无一在 Pass@1 上超过 25%。
内容总结
- 论文称,APEX-Voice 覆盖表单填写、企业谈判、协调、咨询、面试等十类工作原型,共 120 个交互式专业工作流。
- 每个工作流在有状态的 Voice Workbench 环境中执行,包含任务专属知识、类型化工具、人工标注的最终工作产物、授权约束,以及基于预编译语音实现的用户模拟策略。
- 评测同时考察产物字段准确率和端到端工作流成功率,后者要求正确的终止状态、有效流程、已完成动作和有效的最终产物。
- 对 GPT-Live-1、Gemini-3.8-Live、Grok-Voice-Think-2.0、Step-Audio3 和 GPT-realtime-2.1 五款前沿实时语音智能体的测试中,无一在 Pass@1 上超过 25%,最佳 Reliable@3 仅为 10.8%。
- 论文称,有状态协调是所有系统的主要失败点,需要更多知识检索和语音中途纠正的工作流成功率进一步下降。
来源:arXiv · 09-28 19:53(北京时间)