news 2026/8/31 14:38:18

Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models

该文章提出了用于评估大型语言模型(LLMs)临床推理能力的多轮基准测试VivaBench,通过模拟口试场景暴露了当前LLMs在诊断不确定性处理上的缺陷,为医疗AI的临床应用提供了标准化评估工具。

一、文章主要内容总结

  1. 研究背景:现有医疗LLM基准多为单轮问答,仅评估知识回忆能力,无法模拟临床中医生通过多轮信息收集(病史询问、体格检查、诊断检查)逐步完善诊断的动态过程,存在评估缺口。
  2. 核心方案:VivaBench基准
    • 数据集设计:包含1152个由医生整理的临床案例,每个案例以交互式场景呈现,要求模型主动探查关键信息、选择合适检查项目,逐步推导诊断结果。
    • 评估框架:分为“回顾阶段”(病史询问+体格检查)和“检查阶段”(实验室/影像学检查),模型需先提交初步诊断,再结合检查结果给出最终诊断,通过准确率、信息获取效率等指标评估性能。
  3. 实验结果
    • 性能表现:6个主流LLM(如Gemini 2.5 Pro、o4-mini)在“全信息直接诊断”场景中表现较好,但在“多轮交互式诊断”中性能显著下降,其中Gemini 2.5 Pro表现最优(最终诊断Top-1准确率35%)。
    • 核心缺陷:模型存在4类典型故障模式,与临床常见认知错误一致:一是锚定初始假设,二是过度开具检查单,三是过早确定诊断,四是遗漏关键
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 14:35:29

毕业论文格式排版像做目录?书霸AI帮你把章节列得井井有条

写毕业论文,最让人头疼的不是写内容,而是写完之后发现格式乱得像一本没目录的书。标题层级不对、段落顺序混乱、图表编号乱跑、参考文献格式五花八门,就像一本随手写的书,东一章西一章,怎么看都不整齐。在书霸AI官网ww…

作者头像 李华
网站建设 2026/8/31 14:33:26

Delaunay三角剖分在图像提取中的应用与MATLAB实现

简介:本资源是一个面向图像处理初学者与进阶研究者的Matlab实践项目,聚焦于Delaunay三角剖分在图像同名点提取与配准预处理中的应用。项目提供轻量级、可直接运行的算法实现,适用于点云可视化、特征点空间关系建模及图像配准控制点优化等典型…

作者头像 李华
网站建设 2026/8/31 14:33:20

允许孩子适当犯错,成长远比完美的结果重要

在陪伴孩子成长的过程中,许多父母下意识地希望孩子少走弯路,最好每一步都走得稳妥、正确。于是,我们忍不住提前指出错误、纠正偏差,甚至直接替孩子做出选择。然而,成长并非一道有标准答案的数学题,那些看似…

作者头像 李华
网站建设 2026/8/31 14:32:38

LLM不读寄存器:用语义工具层让Modbus解码交给确定性代码

你让 LLM 直接读一个 Modbus 寄存器:地址 40001 对应的是电压还是温度?如果它是 32 位浮点数,那高字在前还是低字在前?要不要乘系数?如果设备手册写的是数据地址,而实际工具用的是协议地址,又差…

作者头像 李华
网站建设 2026/8/31 14:31:38

YOLOv9小样本行为识别实战:吃饭检测从数据标注到部署全流程

简介:本资源是一个面向计算机视觉初学者与行为识别研究者的轻量级吃饭行为检测数据集,聚焦于“人是否正在吃饭”这一细粒度场景判断,适用于YOLOv9等目标检测模型的训练与验证。数据集包含1710张真实场景下的原始图像(JPG格式&…

作者头像 李华
网站建设 2026/8/31 14:31:03

RV1126-----RKMedia

一、RKMedia框架介绍上图中的MPP组件就是瑞芯微根据自家芯片中的硬件编解码器开发的一个应用程序,也就是一个视频编解码以及视频处理库,在SDK目录下,可以找到MPP目录。上图RKMedia对MPP进行封装,功能集是MPP的子集。MPP支持&#…

作者头像 李华