ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Group Causal Policy Optimization for Post-Training Large Language Models

Group Causal Policy Optimization for Post-Training Large Language Models 文章主要内容和创新点主要内容本文聚焦于大型语言模型(LLMs)的后训练优化,针对现有方法(如GRPO)忽略候选响应间语义交互(互补或矛盾)的问题,提出了Group Causal Policy Optimization(GCPO)方法。现有GRPO方法通过组内相对奖励提升效率,但假设候选响应独立,忽略了它们在实际推理任务中的语义关联;作者引入结构因果模型(SCM),揭示候选响应在“最终整合输出”的条件下形成“碰撞结构(collider structure)”,存在隐藏依赖关系;基于因果分析,GCPO通过两个关键组件整合因果结构:(1)因果调整的奖励机制,将响应投影到因果子空间;(2)KL正则化项,使策略与因果投影的参考分布对齐;实验表明,GCPO在数学推理(如AIME、AMC)和代码推理(如HumanEval)等多个基准上持续优于GRPO等现有方法。创新点因果视角下的候选响应依赖建模:发现候选响应在最终输出的条件下形成碰撞结构,证明将预测投影到因果子空间可降低测试误差,比仅基于查询的基准更可靠;因果感知的策略优化方法:提出GCPO,通过因果调整的奖励和KL正则化项,使模型学习组内响应的结构一致性,提升语义鲁棒性;跨基准的一致性能提升:在数学和代码推理任务中,GCP
返回列表