测试集
覆盖真实用户、语言和失败方式
同时包含常见、困难和对抗案例。服务需要时,覆盖英文、中文以及新加坡本地术语。
评分表
把质量和风险分开评估
分别评估有用性、事实准确,以及隐私泄露、危险操作、偏差和拒答质量。
查看负责机构来源 ↗证据
保存问题、输出和审核决定
只有总分、没有可追溯案例,证据很弱。保留评估版本以及每个关键判断的理由。
生命周期
模型变化就是系统变化
提示词、检索、模型、工具、政策或数据变化后都应复测,并监控测试集遗漏的线上失败。
常见问题
需要先讲清楚的两件事
多少个测试问题才够?+
没有通用数量。覆盖关键任务和失败方式,比堆积大量随机问题更重要。
公开跑分能决定供应商吗?+
只能作为背景,不能代替采购判断。你的数据、流程、控制和支持要求会改变结果。