测试集

覆盖真实用户、语言和失败方式

同时包含常见、困难和对抗案例。服务需要时,覆盖英文、中文以及新加坡本地术语。

评分表

把质量和风险分开评估

分别评估有用性、事实准确,以及隐私泄露、危险操作、偏差和拒答质量。

查看负责机构来源 ↗

证据

保存问题、输出和审核决定

只有总分、没有可追溯案例,证据很弱。保留评估版本以及每个关键判断的理由。

生命周期

模型变化就是系统变化

提示词、检索、模型、工具、政策或数据变化后都应复测,并监控测试集遗漏的线上失败。

常见问题

需要先讲清楚的两件事

多少个测试问题才够?+

没有通用数量。覆盖关键任务和失败方式,比堆积大量随机问题更重要。

公开跑分能决定供应商吗?+

只能作为背景,不能代替采购判断。你的数据、流程、控制和支持要求会改变结果。

下一步

把框架带入你的实际任务

Desk AI 可以帮你整理评估问题与控制清单,但不会替你做采购决定,也不会保存对话资料。