news 2026/10/10 2:25:34

Stable Preference Optimization for LLMs: A Bilevel Approach Beyond Direct Preference Optimization

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Stable Preference Optimization for LLMs: A Bilevel Approach Beyond Direct Preference Optimization

文章主要内容和创新点

主要内容

本文聚焦于大型语言模型(LLMs)的偏好对齐问题,针对直接偏好优化(Direct Preference Optimization, DPO)方法的局限性展开研究。

  1. DPO的局限性分析:从概率演化角度对DPO进行了全面理论分析,发现DPO存在三大问题:对初始化高度敏感;可能导致优选和非优选响应的概率同时下降(即“似然偏移”);概率质量可能不当分配给无关或不期望的输出,加剧模型偏见。
  2. 稳定偏好优化(Stable Preference Optimization, SPO)的提出:为解决上述问题,提出一种基于双层优化的框架,将监督微调(SFT)与增强的DPO目标紧密结合。该框架引入正则化机制,明确鼓励优选输出的绝对概率提升,同时维持优化过程的稳定性。
  3. 实验验证:在推理(GSM8K数据集)和摘要(UltraFeedback数据集)任务上的实验表明,SPO相比标准DPO能持续提升推理准确性,且输出分布更符合预期偏好。
创新点
  1. 理论分析创新:无需强假设(如单token输出),从概率演化动态(优选与非优选响应的概率变化)角度,系统揭示了DPO的核心局限性(初始化敏感性、概率质量分配不当等)。
  2. 方法创新:提出双层优化框架SPO,将SFT作为下层优化提供稳健初始化,上层优化结合增强DPO目标与正则化,确保优选输
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/10 2:24:49

逆向过程技巧分享

1、ua修改当遇到请求需要需要ua时,但是数据又存在加密,需要快速获取数据的情况下可以先点击wifi那个图标,然后Network conditions,下面的user agent 去掉勾选的默认 Use browser default,就可以在下方填入…

作者头像 李华
网站建设 2026/10/10 2:23:51

网约车租车实力机构靠谱商家测评排名

网约车租车实力机构靠谱商家测评排名:合规车队、充电配套、押金透明一个都不能少开篇导语在上海跑网约车,选对一家合规、透明、配套齐全的租车机构,是新手入行与全职司机稳定运营的第一步。上海滴美汽车租赁有限公司(简称滴美汽车租赁)是一家…

作者头像 李华
网站建设 2026/10/10 2:19:23

Git代码提交与分支合并实战:冲突处理与协作规范

说实话,每次看到团队里有人问“代码提交合并怎么又冲突了”,我就知道大概率是提交习惯和分支管理出了问题。这不是什么高深理论,就是日常开发里最基础也最容易踩坑的环节。今天把我在实际项目里积累的代码提交、分支合并和冲突处理经验完整梳…

作者头像 李华
网站建设 2026/10/10 2:18:24

PCA9422+R7FA4E2B93CFM构建硬件闭环电源管理系统

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华