第一步:先建样本,别拿一篇稿定输赢
至少准备三类文本:有明确伏笔的故事、带事实约束的知识稿、需要保持语气的口播稿。每类选一段完整上下文,并提前写好验收点。例如故事要求回收钥匙和未接电话两个线索;知识稿不得新增来源不明的数字;口播稿句子要短,不能突然变成书面论文。坑在于只测自己最熟悉的一类内容,最后得到的只是局部印象,却包装成通用结论。
续写测评最常见的坑,是贴一段开头、生成一次,然后凭“读着挺顺”就下结论。这样的结果既不可复现,也测不出长文本真正麻烦的设定漂移。下面按建立样本、统一条件、盲评打分和压力测试的顺序走一遍,并把常见作弊变量逐个排除。
至少准备三类文本:有明确伏笔的故事、带事实约束的知识稿、需要保持语气的口播稿。每类选一段完整上下文,并提前写好验收点。例如故事要求回收钥匙和未接电话两个线索;知识稿不得新增来源不明的数字;口播稿句子要短,不能突然变成书面论文。坑在于只测自己最熟悉的一类内容,最后得到的只是局部印象,却包装成通用结论。
同一轮续写测评要固定原文、目标字数、输出语言、必须信息和禁用项。如果一个选项给详细提纲,另一个只收到“继续写”,结果当然不公平。还应保留原始输出,不要一边人工改过,一边拿未修改版本比较。工具存在随机性时,可在相同条件下多跑几次,报告稳定表现和明显失误,不要只挑最好的一次当展示样本。
评分表建议拆成五项:衔接、事实一致、人物或语气稳定、有效推进、修改成本。每项可按1至5分记录,并在分数后写证据,如“把周二误写成周三”“新增了原文没有的妹妹”。只打总分很容易受文风影响。最好让评阅者不知道文本来自哪个选项,避免品牌印象先入为主。流畅只能算一项,不能覆盖事实错误。
最后增加长上下文、相似人名、跨段伏笔和明确禁令,看结果是否遗忘前文。还要记录从输入到可发布版本的总时间,而不是只比生成速度。常见大坑是把免费额度、响应快慢和内容质量揉成一个分数;更靠谱的做法是分别报告质量、效率、操作与隐私设置。续写测评的结论也应写清场景:适合短段落起草,不代表适合小说整章,更不代表可以免核查发布。
没有绝对次数,但单次结果不足以下判断。实用做法是每种文本在相同条件下重复生成,并同时保留最好、典型和失败样本,观察稳定性。
至少分开评衔接、事实一致、风格稳定、内容推进和修改成本。若涉及公开发布,还要增加来源可靠性、敏感信息和版权风险检查。
自然只说明句子顺。它可能改了人物关系、漏掉伏笔、重复原结论或编造数字;这些问题不细看上下文,很容易被流畅表达遮住。