news 2026/8/17 22:13:00

Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Syn...

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Syn...

一、文章主要内容总结

该研究聚焦于大型语言模型(LLMs)在编程任务难度评估中的可信度问题,通过对比GPT-4o与可解释的LightGBM集成模型在LeetCode题目难度分类(Easy/Medium/Hard)上的表现,揭示LLM作为难度评估器的核心缺陷,并通过合成问题生成实验进一步探究其内部难度判断逻辑。

  1. 研究背景:LLMs在代码生成、辅导与评估中应用日益广泛,但在结构化的编程题目难度预测等任务中的表现尚未被充分探索。现有自动难度评估方法多依赖数值特征(如输入规模、通过率)和文本特征,且可解释性模型表现稳定。
  2. 实验设计
    • 数据集:1825道带官方难度标签的LeetCode题目,包含文本描述(TF-IDF特征)和数值元数据(输入规模、通过率等)。
    • 模型对比:GPT-4o(仅输入文本描述,移除数值元数据)与LightGBM集成模型(同时输入文本和数值特征)。
    • 补充实验:让GPT-4o生成“Hard”级别合成题目,再由其自身重新分类,验证其难度判断的一致性。
  3. 核心结果
    • 性能差距:LightGBM准确率达86%,而GPT-4o仅37.75%,且GPT-4o存在强烈的“低估难度”偏差(83.38%的真实Hard题目被标为Easy)。
    • 特征影响:SHAP分析显示,数值约束(输入规模、通过率)是LightGBM区分Hard题目的关键,而GPT-4o忽视此类信息。
    • 一致性问题:G
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/17 22:09:50

AGORA:基于适配器的推理免费提示词压缩,优化LLM智能体长期记忆

1. 项目概述:当LLM智能体遇上“提示词膨胀”最近在折腾大语言模型智能体时,我遇到了一个非常具体且恼人的问题:提示词越来越长,推理成本越来越高。这几乎是所有LLM Agent开发者都会踩的坑。你精心设计的智能体,需要记住…

作者头像 李华
网站建设 2026/8/17 22:08:06

构建自我进化智能体记忆系统:从向量检索到知识提炼的工程实践

1. 项目概述:为什么我们需要一个“自我进化”的智能体记忆基准测试? 最近在AI智能体(Agent)的圈子里,大家讨论的热点已经从“能不能动起来”转向了“能不能记住事儿,并且越记越聪明”。无论是开发一个能帮你…

作者头像 李华
网站建设 2026/8/17 22:06:32

DeepSeek(深度求索)研究报告

一、纵向分析:DeepSeek的发展全貌起源:一位量化基金掌门人的"岔路选择"DeepSeek的故事,和其他所有AI研究公司都不一样。绝大多数AI实验室的创始人,来自谷歌、Meta或顶级大学实验室。DeepSeek的创始人梁文锋,…

作者头像 李华