文章主要内容和创新点
主要内容
本文聚焦于大型语言模型(LLMs)的偏好对齐问题,针对直接偏好优化(Direct Preference Optimization, DPO)方法的局限性展开研究。
- DPO的局限性分析:从概率演化角度对DPO进行了全面理论分析,发现DPO存在三大问题:对初始化高度敏感;可能导致优选和非优选响应的概率同时下降(即“似然偏移”);概率质量可能不当分配给无关或不期望的输出,加剧模型偏见。
- 稳定偏好优化(Stable Preference Optimization, SPO)的提出:为解决上述问题,提出一种基于双层优化的框架,将监督微调(SFT)与增强的DPO目标紧密结合。该框架引入正则化机制,明确鼓励优选输出的绝对概率提升,同时维持优化过程的稳定性。
- 实验验证:在推理(GSM8K数据集)和摘要(UltraFeedback数据集)任务上的实验表明,SPO相比标准DPO能持续提升推理准确性,且输出分布更符合预期偏好。
创新点
- 理论分析创新:无需强假设(如单token输出),从概率演化动态(优选与非优选响应的概率变化)角度,系统揭示了DPO的核心局限性(初始化敏感性、概率质量分配不当等)。
- 方法创新:提出双层优化框架SPO,将SFT作为下层优化提供稳健初始化,上层优化结合增强DPO目标与正则化,确保优选输