该文章提出了用于评估大型语言模型(LLMs)临床推理能力的多轮基准测试VivaBench,通过模拟口试场景暴露了当前LLMs在诊断不确定性处理上的缺陷,为医疗AI的临床应用提供了标准化评估工具。
一、文章主要内容总结
- 研究背景:现有医疗LLM基准多为单轮问答,仅评估知识回忆能力,无法模拟临床中医生通过多轮信息收集(病史询问、体格检查、诊断检查)逐步完善诊断的动态过程,存在评估缺口。
- 核心方案:VivaBench基准
- 数据集设计:包含1152个由医生整理的临床案例,每个案例以交互式场景呈现,要求模型主动探查关键信息、选择合适检查项目,逐步推导诊断结果。
- 评估框架:分为“回顾阶段”(病史询问+体格检查)和“检查阶段”(实验室/影像学检查),模型需先提交初步诊断,再结合检查结果给出最终诊断,通过准确率、信息获取效率等指标评估性能。
- 实验结果
- 性能表现:6个主流LLM(如Gemini 2.5 Pro、o4-mini)在“全信息直接诊断”场景中表现较好,但在“多轮交互式诊断”中性能显著下降,其中Gemini 2.5 Pro表现最优(最终诊断Top-1准确率35%)。
- 核心缺陷:模型存在4类典型故障模式,与临床常见认知错误一致:一是锚定初始假设,二是过度开具检查单,三是过早确定诊断,四是遗漏关键