news 2026/10/3 8:42:29

Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and

今天分享的论文是《Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges》

原文链接:[2502.12378] Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges

这篇论文很有意思,作者从语用学的角度出发去衡量评估LLM,算是一个创新的思路。

理解语用学——在上下文中使用语言—— 对于开发能够解释细微语言使用的 NLP 系 统至关重要。尽管包括大型语言模型在内 的语言技术有了新的发展,但评估它们处 理语用现象(如隐含和指称)的能力仍然具 有挑战性。为了提高模型的实用能力,有 必要了解当前的评估趋势并确定现有的限 制。在这个调查中,本文提供了一个综合 的资源评估自然语言处理中的语用能力, 根据他们处理的语用现象对数据集进行分 类。本文分析任务设计、数据收集方法、 评估方法以及它们与现实世界应用的相关 性。通过在现代语言模型的背景下检查这 些资源,本文强调了现有基准中出现的趋 势、挑战和差距。本文的调查旨在阐明实 用评估的前景,并指导更全面和更有针对 性的基准的开发,最终促成更细致入微和 上下文感知的 NLP 模型。

传统的自然语言处理(NLP)模型虽然 能够胜任句法分析和语义分析,却难以处理超 出单词字面定义的含义。这种差距就是语用学 变得至关重要的地方。早期的方法,如基于规 则的系统,使用显式编码的规则来表示知识, 并将输入与知识库匹配以生成响应(Bajwa and Choudhary,2006 ; Grosan et al.,2011). 后 来,统计模型应用概率论来预测语言行为 (Johnson,2009),而深度学习,用基于变压器 的 模 型 像 BERT(Devlin et al.,2019) 和 GPT(Brown et al.,2020),通过支持上下文相 关文本的生成来转换 NLP。然而他们在理解语 用学方面的表现仍然有限(Hu et al.,2023; Sileoet al.,2022;Park et al.,2024b). 最近,大型语言模型(LLM)的出现增强了评 估其类人交流能力的需要,特别是对于需要复 杂 的 语 用 推 理 (Hu et al.,2023 ; Ruis et al.,2023;Yerukola et al.,2024).随着 LLM 越来越多地应用于现实世界,验证其理解和生 成上下文适当且语用准确的响应的能力对于确 保有效且值得信任的人机交互至关重要。尽管 LLM 的最新进展显示了其在生成连贯且符合语 境的语篇方面的能力,但其语用能力仍未得到 充 分 的 评 估 (Hu et al.,2023 ; Kwon et al.,2023;Chang et al.,2024).

重要的问题出现了:已经开发了什么资源来 评估 NLP 模型的实用能力,更重要的是,本文如何利用语用学来指导LLM的发 展,形成一个全面的语用学评估框架,并进一 步推进语言学中的语用学研究?为了回答这些 问题,本文对 NLP 中用于评估语用学的资源进 行了全面的调查 2 本文介绍了语用学和 3 本文 回顾了这些语用现象是如何在各种 NLP 任务中 被评估的。在4 本文总结了以前的工作如 何建立一个实用的数据集。 在5 本文提出了 当前研究中使用的度量和评估技术。在6 强调差距,并为未来的研究提供建议。

图 1:语用现象的分类

图 2:任务类型的分类

局限性:

本文在调查中发现了以下局限性。调查来源。 本文的调查主要包括自然语言处理领域的文 献,因为调查的范围是回顾自然语言处理模型 中评估语用学的资源。因此,本文没有过多地 寻找语言学研究的资源。这可能会导致潜在资 源或启发性评价方法的遗漏,而这些资源或方 法可能会给当前的数据收集过程和评价带来深 刻见解。本文主张在未来的调查中审查语用语 言的资源 语言学中的理解。 NLP 任务。本文的调查是为 NLP 中的适用性 任务量身定制的。因此,诸如语篇建模等内在 的语用任务没有被讨论。然而,它们仍然值得 研究,特别是在获得对当前评估的见解方面。 多语制。本文调查的范围仅限于只用英语出 版的文学作品。尽管本文努力包括解决多种语 言的作品(虽然是用英语写的),但可以想象的 是,用其他语言创建的语用数据集没有被包括 在内。这种语言约束可能会限制一种特定语言 所特有的各种语用现象和方法的包容性。 多模态。虽然本文的论文涵盖了一些超出基 于文本的特征的数据点,例如图像字幕任务 (例如,Tsvilodub and Franke,2023),大部 分数据都是基于文本的。这一差距也在本文的 6.1。由于本文主要关注 NLP 场馆,一些资源 可能不包括在内。因此,本文鼓励今后的工作 探索跨不同模式的务实评估。

做个总结:

这项调查提供了一个全面的现有资源的评估自 然语言处理中的语用理解概述。通过根据数据 集的目标语用现象对数据集进行分类,用数据 收集方法分析其任务设计,以及如何用模型对 其进行评估,本文强调了该领域的当前趋势和 挑战。本文的发现强调了对更细致和更丰富的 评估基准的需求,特别是随着 LLM 的不断发 展。本文希望为研究人员和实践者提供一个有 价值的指导,促进自然语言处理中的语用推 理,促进系统更像人类的交流和跨学科的合 作。

附录:

为了编写这份调查,本文对最近关于评估自然 语言处理中语用学的文献进行了全面的回顾, 特别关注数据集。本文通过主要查看 2024 年 12 月 31 日在 ACL 选集上发表的论文,使用关 键词“实用主义”和“数据集”,专注于确定 解决这些方面的作品 1。 这被选为主要来源,因为它是*CL 社区的主 要出版平台,包含了 NLP 模型中最相关的语用 学评估工作。在初步搜索之后,本文应用了额 外的过滤标准来优化选择。具体来说,本文关 注的是

- 引入了专门为评估自然语言处理中的语 用现象而设计的数据集,

- 讨论了评估语言模型的语用能力的方法, 或者

- 在与语用学相关的任务中提供 NLP 模型的 经验评估。

此外,本文进行了手动定性检查,以确保包含由于术语变化而可能未被捕获的相关作品; 本文还根据本文在该领域的专业知识,从 ACL 选集的其他来源收录了一些最近的文章。这导致了当前版本的 58 篇论文的最后部分。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 8:42:29

超长时间录音APP有哪些?主流工具盘点

超长时间录音场景下,多数普通录音工具会出现后台进程被系统清理、大体积音频文件闪退、录制数小时后内容片段缺失等问题,这类问题在全天专场会议、长线专访、全日研学讲座场景中出现频率最高。本次选取8款主流工具,围绕超长时间录音核心能力展…

作者头像 李华
网站建设 2026/10/3 8:40:12

一条命令释放几十 GB:Mole Mac 清理工具与磁盘空间分析

一条命令释放几十 GB:Mole Mac 清理工具与磁盘空间分析 【免费下载链接】Mole 🐹 Clean, uninstall, analyze, optimize, and monitor your Mac. Free open-source CLI, plus a native Mac app. 项目地址: https://gitcode.com/GitHub_Trending/mole15…

作者头像 李华
网站建设 2026/10/3 8:39:30

从免费到专业版:Wand-Enhancer 四步本地解锁

从免费到专业版:Wand-Enhancer 四步本地解锁 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer Wand-Enhancer 是一款针对 Wand&#xff0…

作者头像 李华
网站建设 2026/10/3 8:39:30

第12课:Nacos 配置加密、版本回溯、配置监听 生产风控方案

文章目录一、开篇:配置中心不是“能读就行”二、配置加密实战2.1 Nacos原生加密插件2.2 数据库表结构准备2.3 编译加密插件2.4 服务端集成插件2.5 客户端配置2.6 创建加密配置2.7 验证加密效果2.8 Nacos连接信息的加密方案三、配置版本管理与一键回溯3.1 历史版本机…

作者头像 李华