AI PRODUCT / PRACTICE
七步模型评测:从选型到可复用 Skill
把剧本完成度、人物逻辑和预算变成可检查的条件,让评测结果可以解释。
1. 用具体任务定义选型
我在剧本研究中遇到过三类失败:规定集数没有生成完、人物行为突破设定、交付成本超预算。因此选型不能只看文字好不好看,还要判断任务是否完成、逻辑是否守住、成本是否可接受。
“指定预算生成指定集数”是业务约束,但还应补充每集长度、结构和质量要求。不同模型生成不同篇幅时,直接比较费用没有意义。
2. 按七步执行评测
- 定目标:写明场景、交付物、通过条件和预算,形成评测目标卡。
- 定维度:选两到三个核心指标,明确一票否决条件。剧本可看集数完成度、人物逻辑和交付成本。
- 设计评测集:覆盖常规、复杂、边界和对抗输入,避免只测模型容易做对的题。
- 定评分标准:能用是 / 否判断的先用二值;需要档位时,提供对应的样例锚点。
- 评分校准:不同评测者先独立评同一批输出,再讨论分歧,修订规则后重新检查一致性。
- 批量评测:固定输入、运行设置和评分口径,记录输出、费用、失败与重试。
- 输出报告:解释选型、限制和 Bad case,每个失败都对应可验证的改进建议。
3. 把比例落成可执行题数
我的工作流建议用 50% 常规、25% 复杂、15% 边界、10% 对抗题。若只做 30 题,25% 和 15% 会产生半道题,可用 15 / 8 / 4 / 3 题并注明实际分配;需要精确比例时可使用 40 题,即 20 / 10 / 6 / 4。
这是评测集设计方法,不代表每次历史测试都完整跑过这一配置。小样本结果主要用于发现差异,不能代表模型所有任务的表现。
4. 校准评分,而不是追求一致答案
例如同一个剧本,一位评测者认为主角临时妥协合理,另一位认为违反人物设定。先回到已写明的角色约束,给出“可接受妥协”和“明显降智”的锚点,再重新评分。
一致率可按两人判定相同的样本数 / 共同评过的样本数计算。工作流中的 80% 是一个初步校准门槛,不是通用行业标准;关键否决项仍需逐条对齐。一致率高也不代表评分规则一定正确。
5. 保留 CSV 和失败证据
CSV 是逗号分隔的文本表格,Excel 可以打开。它适合逐条保存题目和结果,不保存复杂格式、多工作表或图片。包含逗号和换行的字段要正确加引号,中文文件注意 UTF-8 编码。
case_id,类别,输入,通过条件,否决条件 S01,常规,生成校园支线故事,结构完整且角色行为合理,违背明确角色设定 S02,边界,在预算约束下生成规定集数,集数与篇幅均达标,未完成交付 结果表另记:model_id、日期、运行参数、原始输出路径、评分、 输入与输出 Token、费用口径、失败原因、改进动作、复验结论
模型版本和费用不确定时先查运行记录,不靠记忆补数。App 订阅费与 API 费用分开;首次运行成本与包含重试的总成本分开。
6. 将稳定步骤沉淀为 Skill
先把流程人工走通,再把重复的目标卡、评分表与报告结构放进 Skill。Skill 是可复用的工作指引,不会自动提供模型调用、记账或验证能力;这些能力需要工具或脚本实现。
--- name: script-evaluation description: 用于对比剧本生成结果的任务完成度、人物逻辑和成本。 --- # 输入 目标卡、待评测输出、角色约束、费用记录。 # 执行 1. 缺关键输入时先指出缺口,不编造测试结果。 2. 按目标卡检查完成度与一票否决项。 3. 引用原始输出中的具体片段说明判定。 4. 汇总费用,区分首次运行与含重试总成本。 # 交付 评分表、Bad case 表、选型理由与复验建议。 # 验收 每条结论能对应样本;每项建议有下一轮验证动作。
用适用任务、无关任务和缺输入任务试跑,检查是否误触发、是否擅自补数据,再决定复用。