AI 编程 › AI 资讯 › 正文

BA-DPO: Bias-Adjusted Direct Preference Optimization for Language Model Alignment

arxiv · arXiv · 2026-09-28 20:41 · 评分 79

提出BA-DPO,针对DPO偏好对齐中标注者对性别、种族、语言风格、格式或长度等属性的系统性偏见进行调整,防止这些偏见在对齐过程中被语言模型吸收并放大。

原文:arXiv | 返回 AI 资讯列表