1
任务适配
测试真实工作:研究、写作、分析、多语言服务、文档处理、编程或工具调用。不要用通用排行榜代替。
2
数据边界
比较训练用途、保留期限、处理地点、访问、删除,以及机构可用的控制设置。
3
运行控制
检查身份、权限、日志、连接器、审批、监控和事故支持。
4
证据与投入
记录测试证据、人工审核、集成负担、失败恢复,以及维持安全使用的成本。
常见问题
需要先讲清楚的两件事
为什么这里没有固定分数?+
模型功能、价格和表现变化很快。注明日期的任务评估,比看似永久的总分更有用。
一家机构可以同时用多个 AI 助手吗?+
可以。许多团队会把不同数据和任务分配给不同的获批系统,前提是边界清楚。