更新时间:2026-07-17 gmt 08:00
预置评估器概览-j9九游会登录
agentarts智能体平台提供了丰富的预置评估器,用于智能体和工作流的质量评估。这些评估器根据不同的使用场景和评估需求进行了分类,支持离线评估、在线评估或同时支持两者。用户可根据具体的评估目标和数据来源选择合适的评估器,确保评估结果的准确性和有效性。
离线评估:在应用上线前,使用预设的评测集对智能体进行效果测试。
在线评估:应用上线后,系统基于真实的运行数据(调用链、工具等)自动化对智能体产生的数据进行采样和评估。
评估器判定原理
| 判定类型 | 说明 | 适用场景 |
|---|---|---|
| 模型判定 | 依托大模型作为裁判,根据预设的prompt对智能体的输出进行主观或半主观评分。 | 适用于非确定性、语义理解类、开放性输出的评估任务,如自然语言生成质量、对话逻辑合理性、创意内容生成等。 |
| 代码判定 | 通过确定性代码逻辑(如正则匹配、json校验、数学计算)对输出进行二元判断。 | 适用于输出结果具有明确格式、可执行逻辑或数学计算的确定性任务,如数据处理结果比对、数值计算准确性等。 |
评估器支持任务详情
预置评估器根据判定原理分为模型判定和代码判定两大类。根据评估任务的运行模式(在线评估/离线评估),各评估器的支持情况如下表所示:
常见业务场景
- rag知识问答场景:推荐使用“知识问答-真实准确、知识问答-精炼性、引用相关性”等评估器。
- 内容安全合规场景:“推荐使用恶意性、犯罪性、性别歧视、安全风险漏放”等评估器。
- 工具调用场景:推荐使用“轨迹质量、工具参数正确性、工具选择质量”等评估器。
- 通用对话质量场景:推荐使用“正确性、对话完整性、指令遵从度”等评估器。
相关文档
意见反馈
文档内容是否对您有帮助?
提交成功!非常感谢您的反馈,我们会继续努力做到更好! 您可在查看反馈及问题处理状态。
系统繁忙,请稍后重试
如您有其它疑问,您也可以通过华为云社区问答频道来与我们联系探讨