← 返回个人网站郭一恒 · 实战教程

AI PRODUCT / PRACTICE

七步模型评测:从选型到可复用 Skill

把剧本完成度、人物逻辑和预算变成可检查的条件,让评测结果可以解释。

1. 用具体任务定义选型

我在剧本研究中遇到过三类失败:规定集数没有生成完、人物行为突破设定、交付成本超预算。因此选型不能只看文字好不好看,还要判断任务是否完成、逻辑是否守住、成本是否可接受。

“指定预算生成指定集数”是业务约束,但还应补充每集长度、结构和质量要求。不同模型生成不同篇幅时,直接比较费用没有意义。

2. 按七步执行评测

  1. 定目标:写明场景、交付物、通过条件和预算,形成评测目标卡。
  2. 定维度:选两到三个核心指标,明确一票否决条件。剧本可看集数完成度、人物逻辑和交付成本。
  3. 设计评测集:覆盖常规、复杂、边界和对抗输入,避免只测模型容易做对的题。
  4. 定评分标准:能用是 / 否判断的先用二值;需要档位时,提供对应的样例锚点。
  5. 评分校准:不同评测者先独立评同一批输出,再讨论分歧,修订规则后重新检查一致性。
  6. 批量评测:固定输入、运行设置和评分口径,记录输出、费用、失败与重试。
  7. 输出报告:解释选型、限制和 Bad case,每个失败都对应可验证的改进建议。

3. 把比例落成可执行题数

我的工作流建议用 50% 常规、25% 复杂、15% 边界、10% 对抗题。若只做 30 题,25% 和 15% 会产生半道题,可用 15 / 8 / 4 / 3 题并注明实际分配;需要精确比例时可使用 40 题,即 20 / 10 / 6 / 4。

这是评测集设计方法,不代表每次历史测试都完整跑过这一配置。小样本结果主要用于发现差异,不能代表模型所有任务的表现。

4. 校准评分,而不是追求一致答案

例如同一个剧本,一位评测者认为主角临时妥协合理,另一位认为违反人物设定。先回到已写明的角色约束,给出“可接受妥协”和“明显降智”的锚点,再重新评分。

一致率可按两人判定相同的样本数 / 共同评过的样本数计算。工作流中的 80% 是一个初步校准门槛,不是通用行业标准;关键否决项仍需逐条对齐。一致率高也不代表评分规则一定正确。

5. 保留 CSV 和失败证据

CSV 是逗号分隔的文本表格,Excel 可以打开。它适合逐条保存题目和结果,不保存复杂格式、多工作表或图片。包含逗号和换行的字段要正确加引号,中文文件注意 UTF-8 编码。

case_id,类别,输入,通过条件,否决条件
S01,常规,生成校园支线故事,结构完整且角色行为合理,违背明确角色设定
S02,边界,在预算约束下生成规定集数,集数与篇幅均达标,未完成交付

结果表另记:model_id、日期、运行参数、原始输出路径、评分、
输入与输出 Token、费用口径、失败原因、改进动作、复验结论

模型版本和费用不确定时先查运行记录,不靠记忆补数。App 订阅费与 API 费用分开;首次运行成本与包含重试的总成本分开。

6. 将稳定步骤沉淀为 Skill

先把流程人工走通,再把重复的目标卡、评分表与报告结构放进 Skill。Skill 是可复用的工作指引,不会自动提供模型调用、记账或验证能力;这些能力需要工具或脚本实现。

---
name: script-evaluation
description: 用于对比剧本生成结果的任务完成度、人物逻辑和成本。
---
# 输入
目标卡、待评测输出、角色约束、费用记录。
# 执行
1. 缺关键输入时先指出缺口,不编造测试结果。
2. 按目标卡检查完成度与一票否决项。
3. 引用原始输出中的具体片段说明判定。
4. 汇总费用,区分首次运行与含重试总成本。
# 交付
评分表、Bad case 表、选型理由与复验建议。
# 验收
每条结论能对应样本;每项建议有下一轮验证动作。

用适用任务、无关任务和缺输入任务试跑,检查是否误触发、是否擅自补数据,再决定复用。

查看我开源的七步评测工作流 ↗

继续阅读

企业 Agent:从业务访谈到上线验收 →

AI 短剧制作:从镜头卡到局部返工 →