j9九游会登录/ 智果(agentarts)智能体平台/ api参考/ api/ / / 评估器调试 - debugopsevaluator
更新时间:2026-07-17 gmt 08:00

评估器调试 -j9九游会登录

功能介绍

该接口用于对评估器的判分逻辑进行实时调试,通过输入样例数据验证评估器的解析能力、prompt 效果及评分准确性。

调用方法

请参见如何调用api

授权信息

账号根用户具备所有api的调用权限,如果使用账号下的iam用户调用当前api,该iam用户需具备如下身份策略权限,更多的权限说明请参见。

授权项

访问级别

资源类型(*为必须)

条件键

别名

依赖的授权项

agentarts:evaluator:debugopsevaluator

write

evaluator *

g:resourcetag/

-

-

uri

post /v1/ops/evaluators/debug

请求参数

表1 请求body参数

参数

是否必选

参数类型

描述

type

string

参数解释:

评估器的调试类型。

约束限制:

长度为0到100个字符。

取值范围:

  • llm: 基于大语言模型的调试

  • code: 基于代码脚本的调试

默认取值:

不涉及。

turn_type

string

参数解释:

评估器的轮次类型。

约束限制:

长度为0到100个字符。

取值范围:

  • single: 单轮评估器

  • multi: 多轮评估器

默认取值:

不涉及。

llm_config

opsevaluationllmconfig object

参数解释:

大语言模型(llm)的评估配置对象。

约束限制:

不涉及。

取值范围:

不涉及。

默认取值:

不涉及。

表2 opsevaluationllmconfig

参数

是否必选

参数类型

描述

system_prompt

string

参数解释:

系统提示词(system prompt),定义模型的角色与规则。

约束限制:

0到10000字符。

取值范围:

不涉及。

默认取值:

不涉及。

model_config

opsevaluationmodelconfig object

参数解释:

具体的模型参数配置对象。

约束限制:

不涉及。

取值范围:

参考opsevaluationmodelconfig定义。

默认取值:

不涉及。

表3 opsevaluationmodelconfig

参数

是否必选

参数类型

描述

model_id

string

参数解释:

指定调用的大模型唯一标识符,通过模型列表接口获取。

model_name

string

参数解释:

模型的显示名称。

取值范围:

任意字符串。

temperature

float

参数解释:

采样温度参数,用于控制输出的随机性。数值低更聚焦,数值高更具创造性。

取值范围:

0.0到2.0。

max_tokens

integer

参数解释:

单次推理生成的最大token数量限制。

取值范围:

1-32000。

top_p

float

参数解释:

核采样参数。

取值范围:

0.0到1.0。

frequency_penalty

float

参数解释:

频率惩罚系数,降低内容重复倾向。

取值范围:

-2.0到2.0。

响应参数

状态码:200

表4 响应body参数

参数

参数类型

描述

status_code

integer

参数解释:

调试执行的状态码。

取值范围:

遵循 http 状态码或自定义业务状态码。

error

string

参数解释:

调试过程中产生的错误详细信息。

取值范围:

描述性错误字符串。

score

integer

参数解释:

评估器根据当前输入调试出的评分结果。

取值范围:

按评估逻辑定义的评分区间返回。

reason

string

参数解释:

评估结果的详细理由或推导过程。

取值范围:

详细的描述性文本。

input_token_usage

integer

参数解释:

调试请求中输入内容消耗的token数量。

取值范围:

0到2,147,483,647之间的整数。

output_token_usage

integer

参数解释:

调试请求中输出内容消耗的token数量。

取值范围:

0到2,147,483,647之间的整数。

latency

integer

参数解释:

本次调试操作的耗时。

取值范围:

0 - 2,147,483,647 之间的整数。

请求示例

通过输入样例数据实时调试评估器的判分逻辑和 prompt 效果。

post https://api.example.com/v1/ops/evaluators/debug
{
  "type" : "llm",
  "llm_config" : {
    "system_prompt" : "system_prompt",
    "model_config" : {
      "model_id" : "1749615103",
      "model_name" : "豆包·1.6·自动深度思考",
      "temperature" : 0.1,
      "max_tokens" : 4096,
      "top_p" : 0.7,
      "frequency_penalty" : 0
    }
  }
}

响应示例

状态码:200

成功响应

{
  "status_code" : 200,
  "error" : "invalid prompt template",
  "score" : 85,
  "reason" : "回复内容过于笼统。",
  "input_token_usage" : 386,
  "output_token_usage" : 703,
  "latency" : 2200
}

状态码

状态码

描述

200

成功响应

错误码

请参见错误码

相关文档

网站地图