news 2026/8/2 7:40:54

agent各指标定义

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
agent各指标定义

先更新一下今天的记录:
先明确一点:定稿版项目介绍里出现的 XX% 一共 4 处,对应 4 个指标。逐个拆解:

指标总览

介绍原文位置指标名称本质评估方
“问答相关性与处置方案可执行性达到 XX%”① 答案相关性 ② 方案可执行性RAG 问答质量LLM 打分 + 人工抽检
“高危病害识别准确率 XX%”③ 高危病害识别准确率风险分级能力人工复核(工务专家)为基准
“问答准确率环比提升 XX%”④ 问答准确率环比知识回流优化效果固定评测集回归
(功能表里)“病害检出率”⑤ 病害检出率检测模型能力标注测试集

指标 ① 答案相关性(Answer Relevance)

含义:Agent 的回复是否答在了点子上,有没有答非所问。

定义:

答案相关性 = 判定为"相关"的问答对数 / 抽检问答对总数

测算方法:

  1. 从线上日志随机抽样问答对(如每周抽 100 条真实对话)
  2. 用强模型(如 GPT-4)做 Judge,按 0-5 分打分:≥4 分算"相关"
  3. 关键点:抽取 20% 样本由人工复核校准——防止 LLM 自评偏置(它可能"自己答的题自己给高分")

面试话术:

“相关性指标我采用 LLM-as-judge + 人工抽检校准:线上抽样 100 条,GPT-4 按 0-5 打分,阈值 4 分以上算相关,再抽 20% 人工复核防止自评偏置。”


指标 ② 方案可执行性(Plan Executability)

含义:生成的处置方案是不是真能落地——处置等级是否符合规范、是否匹配对应检修工艺、有没有幻觉性建议(比如编造一个不存在的操作规程)。

定义:三档人工评级:

可执行性 = 评"完全可执行"的方案数 / 抽检方案总数

测算方法:

  1. 抽检生成的处置方案(如 50 条)
  2. 由工务工程师人工评估(这是专业判断,LLM 不能当裁判)
  3. 三档:完全可执行 / 部分可执行(缺工艺细节)/ 不可执行(违反规范或幻觉)
  4. 重点记录"不可执行"的原因,用于定位问题(检索没召回规范?还是模型编造?)

面试话术:

“方案可执行性必须人工评估——LLM 无法判断’这工艺对不对’。我按三档人工评级,同时记录不可执行原因,反推是检索缺失还是模型幻觉。”


指标 ③ 高危病害识别准确率

含义:风险研判 Agent 把"真正需要立即处理的高危病害"正确标出来的能力。

注意坑:项目介绍里写"识别准确率"是笼统说法,面试时建议主动拆成精确率(Precision)和召回率(Recall)——尤其在这个场景,召回率比精确率重要(漏报高危 = 安全事故,宁可多报转人工)。

定义:

精确率 Precision = 正确标记的高危数 / 标记为高危的总数 (报得准不准) 召回率 Recall = 正确标记的高危数 / 实际高危总数 (漏没漏) F1 = 2×P×R / (P+R)

测算方法:

  1. 人工复核结果为 ground truth(专家确认"这处病害是否高危")
  2. 统计混淆矩阵:TP / FP / FN / TN
  3. 用一段历史巡检数据跑全量回放

面试话术:

“高危识别我重点看召回率——漏报会出安全事故,宁可误报转人工。具体用人工复核做基准,算 Precision/Recall/F1,上线时把召回率阈值定在 95% 以上。”


指标 ④ 问答准确率环比提升(知识回流的效果)

含义:专家复核意见回流成知识后,问答质量比上一周期好了多少。

定义:

环比提升 = (本期准确率 − 上期准确率) / 上期准确率

测算方法:

  1. 建一个固定评测集(golden set):100 条标准问答对 + 参考答案(不随版本变)
  2. 每次知识库更新后,用同一套题跑一遍,得到准确率
  3. 对比两个版本周期的准确率

为什么必须固定评测集:只有同一套题对比才有意义,否则每次抽的题不一样,数字波动没法说明是优化带来的。

面试话术:

“回流效果我用固定 golden set 做回归——100 条标准题,每次知识更新后全量重跑,环比差值就是回流收益,避免抽样波动干扰判断。”


指标 ⑤ 病害检出率(检测模型侧)

含义:YOLOv11 有没有把真实病害找出来(漏检率反着看)。

定义:

检出率(Recall)= TP / (TP + FN) # 找出来的真实病害 / 全部真实病害 误报率 = FP / (FP + TN) # 报错的 / 全部负样本

测算方法:

  1. 标注测试集(工务人员标注"图里哪里有病害、是什么病害")
  2. 模型跑一遍,与标注对比算 TP/FP/FN
  3. 和你原有项目的"漏检与误报反馈"模块直接衔接——人工确认结果回流为标注数据

面试话术:

“检出率就是检测模型的召回,我用标注测试集算 TP/FN,人工复核的漏检反馈会回流成新标注,持续迭代 YOLOv11。”


共同底座:评测基础设施(必须主动讲,这是加分项)

所有 RAG 指标都依赖同一套评测设施,面试时主动说出这三件套,直接拉开和只会背概念的人的差距:

组件作用
Golden Set(固定评测集)标准题 + 参考答案,不随版本变,保证可复现对比
LLM-as-Judge强模型自动打分,覆盖大样本量(几百上千条)
人工抽检校准20% 样本人工复核,防 LLM 自评偏置、补专业判断

一句话总结:“大样本走 LLM 打分,专业判断和结果校准走人工,所有版本对比用固定评测集。


版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/2 7:39:40

CH343 USB转串口桥接板:硬件拆解、驱动安装与高级应用指南

1. 从USB到串口:为什么我们还需要一块“桥接板”?如果你玩过单片机、树莓派或者任何嵌入式开发板,对“串口”这个词一定不陌生。它就像设备与电脑之间最古老、最可靠的那条“电话线”,负责传输最基础的调试信息、程序代码或者控制…

作者头像 李华
网站建设 2026/8/2 7:39:26

手动SQL注入实战:从漏洞探测到数据提取的完整演练

1. 项目概述:从靶场到实战的SQL注入演练 最近在整理安全测试的笔记,翻到了一个挺有意思的练习项目——手动对一个模拟的CMS文件管理系统进行SQL注入。这玩意儿听起来有点老派,毕竟现在各种自动化工具和框架满天飞,但说实话&#x…

作者头像 李华
网站建设 2026/8/2 7:39:12

连山区口腔机构排名,专业的竟然是这些!

引言在连山区,口腔健康备受关注,众多口腔机构林立。究竟哪些机构专业度较高呢?让我们一同探寻。专业口腔机构剖析连山区兴工路周雷口腔诊所:这是一家备受赞誉的口腔机构。诊所环境整洁舒适,诊疗设备定期消毒&#xff0…

作者头像 李华
网站建设 2026/8/2 7:33:23

折弯机激光保护装置保障生产安全和效率的关键技术探讨

折弯机激光保护装置是一种核心技术,为了提升生产安全和效率。通过激光传感器监测工作环境,实时检测潜在危险,确保操作者的安全。当设备运行时,该装置会自动形成保护区域,一旦有物体侵入,系统会立即发出警报…

作者头像 李华
网站建设 2026/8/2 7:29:22

室内太阳能充电电路设计:为超低功耗物联网设备实现永久续航

1. 项目缘起:为什么室内太阳能充电是个“伪命题”?几年前,当我第一次尝试用一块小型太阳能电池板给一个温湿度传感器节点供电时,我遭遇了彻底的失败。那是一个典型的物联网应用场景:设备放在窗台,理论上能晒…

作者头像 李华