智能体评估
智能体评估用于对智能体在一组测试问题上的实际表现进行批量检查。Nexent 会运行选定版本的智能体,使用一个或多个评估器对每条用例打分,并提供汇总指标、逐条结果和可选的智能分析报告。
评估适合用于:
- 发布前验证提示词、模型、知识库或工具配置的效果;
- 使用同一组测试问题进行回归检查,发现版本升级后的表现变化;
- 从准确性、完整性、安全性、相关性和运行成功率等维度观察智能体质量;
- 对失败用例进行人工标注,为问题定位提供依据。
进入评估页面
登录后,在左侧导航栏选择 智能体开发 > 智能体评估。也可以在 智能体空间 或 智能体仓库 > 我的 Agent 中,在智能体卡片的操作菜单选择 评估 进入评估页面。

评估页面包含以下页签:
| 页签 | 用途 |
|---|---|
| 评估任务 | 创建评估任务、查看运行状态和历史记录 |
| 评估器 | 查看内置评估器,创建、发布和管理自定义评估器 |
| 评测集 | 上传、生成和维护测试用例 |
| 标注标签 | 创建人工标注字段,并在评估详情中使用 |
如果左侧导航栏没有显示该入口,请联系租户管理员检查当前账号的页面权限。
开始前准备
创建评估任务前,建议完成以下准备:
- 在模型管理中配置至少一个可用的大语言模型,用作评估任务的 Judge 模型,也可用于 AI 生成评估器或评测集。
- 创建智能体并发布至少一个版本。评估任务运行已发布版本,不直接评估未保存的草稿配置。
- 准备评测集,或在创建任务时选择 无评测集评测,由 AI 根据智能体配置生成测试问题。
- 准备至少一个已发布评估器。创建评估任务时必须至少选择一个评估器。
评估模式
创建评估任务时,可以选择以下两种模式:
| 对比项 | 有评测集评测 | 无评测集评测 |
|---|---|---|
| 测试问题来源 | 已创建的评测集 | AI 根据智能体配置生成 |
| 是否运行智能体 | 是 | 是 |
| 是否有参考答案 | 取决于评测集 | 没有 |
| 适用场景 | 回归测试、发布前验证、可重复对比 | 快速探索、刚创建智能体时的冒烟检查 |
| 用例数量 | 由评测集中的用例数决定 | 1~50 条 |
有评测集评测
系统会将评测集中的问题逐条发送给选定的智能体版本,再把智能体的实际回答和运行信息交给评估器评分。需要判断答案正确性、完整性或事实准确性时,建议在评测集中维护参考答案。
无评测集评测
系统会读取智能体的名称、描述、职责、约束和工具等配置,由 AI 生成测试问题,随后自动运行智能体并评估结果。生成的问题没有参考答案,更适合选择内容安全性、答案相关性、运行成功率、工具调用健康度、响应完整性等评估器。
无评测集模式适合快速了解智能体的基本表现。正式回归测试建议先将问题和参考答案整理为评测集,再使用有评测集模式。
评估执行流程
一次评估通常经过以下步骤:
- 选择智能体及已发布版本;
- 选择评测模式、评测集和 Judge 模型;
- 选择已发布评估器;
- 运行智能体并收集实际回答和运行信息;
- 由评估器逐条评分,生成评估结果和报告。
下级页面分别介绍任务创建、评测集、评估器以及结果与标注的操作方法。
使用限制
| 项目 | 当前限制 |
|---|---|
| 评估对象 | 当前评估流程运行 Nexent 内已发布的智能体版本 |
| 评估器数量 | 每个任务最多 5 个,只有已发布评估器可选 |
| 评测集数量 | 每个租户最多 50 个评测集 |
| 评测集规模 | 每个评测集最多 2,000 条用例 |
| 无评测集问题数 | 每个任务 1~50 条,由 AI 根据智能体配置生成 |
| AI 生成评测集数量 | 每次 1~200 条 |
| 并发任务 | 每个租户同时最多运行 5 个评估任务;每个租户累计最多保留 500 个评估任务 |
| 历史数据 | 评估历史数据默认保留约 30 天,系统维护任务可能自动清理过期记录 |
| 多轮评估 | 评测集可记录多轮会话,但一次运行每个会话最多处理 10 轮 |
| 自定义代码 | 仅允许受限的纯 Python 逻辑,不支持文件、网络、系统命令和任意模块导入 |
