查看: 1|回复: 0

澳鹏在 WAIC 推出 Agent 难题集:高分之外,还要看它能不能把长任务做完

[复制链接]

1006

主题

0

回帖

13

积分

内容编辑

积分
13
发表于 2 小时前 | 显示全部楼层 |阅读模式

澳鹏 Appen 在 WAIC 2026 官方企业目录使用的品牌标识,经等比例置入本站新闻画布。 来源:WAIC 2026 官方企业目录


Agent 在几道标准题上拿高分,不代表它能把一项跨越多个步骤的工作做完。任务一长,工具选错、上下文丢失和中途偏航都会逐渐累积。

澳鹏 Appen 在 WAIC 2026 发布的新一组评测数据,正把注意力从单次回答拉到工具调用、长程规划和专业难题,想检验 Agent 在更接近真实工作的链路里会在哪里失手。

三组难题分别盯住工具、长任务和专业错误
Elite-Toolathlon面向工具链调用和多步执行,Elite-LongHorizon关注长程规划与复杂任务,Elite-DE则收集数学、医疗等专业领域的困难样本。它们分别把 Agent 容易出错的环节单独拉出来观察。

这类数据的意义不是再做一张总榜,而是帮助开发团队找到失败发生在哪一步:是没有选对工具、没有保存前一步结果,还是在专业判断上出现了看似合理的错误。

评测数据也需要一套生产流程
澳鹏同时升级了数据生产平台,公开方向包括由项目管理 Agent 生成标注模板、专家难题构建,以及让视频、传感器和动作对齐的具身智能标注。RoboGo平台则面向机器人数据采集与处理。

自动生成模板可以减少前期重复配置,但专业难题仍需要专家确认标准、边界和答案依据。否则评测集本身出现歧义,模型分数再精确也难以指导产品改进。

团队可以先建立自己的失败样本库
正在做 Agent 的小团队不一定先追求大规模评测,可以把线上失败按工具选择、参数填写、上下文遗漏、超时和人工接管分类,持续补进一套小而稳定的回归测试。

引入外部难题集时,还要检查领域覆盖、数据许可、答案更新时间和是否贴近自己的任务。公开基准适合横向观察,能不能上线则仍要由真实业务中的失败成本决定。

想继续了解
澳鹏 Appen:WAIC 2026 发布内容
RoboGo 产品页
新浪财经:澳鹏在 WAIC 发布多领域评测与难题数据
WAIC 2026 官方企业目录
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表