中文多轮对话评测完整指南:如何判断模型是否忘记了前文
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
围绕 Awesome-Chinese-LLM 项目,我们整理可私有化部署的中文大语言模型及其垂直应用与评测资源。本文从一次真实的对话翻车讲起,把多轮对话评测拆成可上手的三步:上下文一致性与连贯性怎么看、怎么打分,再用一份小数据集完成模型横评。
💬 客服每轮都在答,整段对话却失败了
想象一次退换货咨询。用户第一句说"上周买的订单我要退货",客服机器人按标准流程回复。第二轮用户补充"6 月 1 号下单,商品到手就是坏的"。第三轮用户问"运费谁出?",机器人却回:"请提供您的商品型号与订单编号。"
单看每句回答都很通顺,但前文信息全丢了,用户只能重复,体验直接崩掉。这就是典型的上下文断裂:模型不缺知识,缺的是记忆。
单轮基准测不出这类问题。多轮对话评测专门把它暴露出来——让模型进入一段携带关键信息的长对话,看它能否持续用上前面说过的内容。客服、问诊、辅导这类场景尤其需要这种测试。
📊 两个核心指标:看什么、怎么判、失败长什么样
上下文一致性:前文还记不记得
- 看什么:指代消解("它""这台"指谁)、话题延续、历史事实复用。
- 怎么判:前几轮埋入关键实体,后几轮直接提问,看模型是否复述或反问。
- 失败表现:指代答错、重复回答旧问题、与前文确认过的事实矛盾。
连贯性:整段读下来自不自然
- 看什么:语言是否流畅、前后是否打架、语气与情感是否稳定。
- 怎么判:通读整段对话,不逐轮对照,"机器感"越重分越低。
- 失败表现:模板话反复出现、语气突变、逻辑接不上。
| 指标 | 考察点 | 快速验证 | 典型失败 |
|---|---|---|---|
| 上下文一致性 | 记忆与指代 | 第 1 轮埋信息,第 3 轮提问 | 让用户重复一遍 |
| 连贯性 | 自然与矛盾 | 整段通读一遍 | 复读模板、语气跳变 |
上图源码见 doc/LLM.md。评测前先用它确认候选底座与垂直模型,再决定测谁。
🛠 评测落地:数据集、打分与三条提升建议
搭一份小评测集
- 每段对话 3~5 轮,埋 1~2 条关键信息(商品、数字、用户情况)。
- 覆盖客服、问诊、辅导等场景,医疗类可参考 doc/Medical.md。
- 30~50 段对话足以做首轮横评,不必贪多。
自动与人工怎么配合
- 自动部分:关键实体是否在后续轮次被复用到、有无重复句,规则即可判分,对应上下文一致性。
- 人工部分:连贯性偏主观,两人独立打自然度分,分歧大的对话再讨论。
三条可验证的提升建议
- 先确认模型上下文窗口,长对话别塞进小窗口模型。
- 微调时加入多轮样本,让前轮信息成为后轮的必答题。
- 改完复跑同一份对话集,用分数确认收益,别凭感觉。
把开头的退货咨询再跑一遍:合格的模型应在第三轮直接记得"6 月 1 号下单",并给出运费结论。多轮对话评测把"单轮演示好用"变成可量化的数字,是模型选型与迭代时最硬的依据。
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考