简体中文
首页 > 新闻动态 > 公司动态

摩尔线程大模型对齐研究获国际顶级学术会议认可:URPO 框架入选 AAAI 2026

2025-11-14 09:30:20

【导语】11 月 13 日消息,摩尔线程提出的新一代大语言模型对齐框架 URPO 统一奖励与策略优化,相关论文被 AAAI 2026 收录。该框架融合两大角色并同步优化,从三方面攻克技术难题,实验显示多项指标超越传统基线,且已在自研计算卡上稳定运行,还完成主流强化学习框架适配 。

摩尔线程大模型对齐研究获国际顶级学术会议认可:URPO 框架入选 AAAI 2026

  11 月 13 日消息,摩尔线程提出的新一代大语言模型对齐框架 —— URPO 统一奖励与策略优化,相关研究论文近日被人工智能领域的国际顶级学术会议 AAAI 2026 收录,为简化大模型训练流程、突破模型性能上限提供了全新的技术路径

  据介绍,在题为《URPO:A Unified Reward & Policy Optimization Framework for Large Language Models》的论文中,摩尔线程 AI 研究团队提出了 URPO 统一奖励与策略优化框架,将“指令遵循”(选手)和“奖励评判”(裁判)两大角色融合于单一模型中,并在统一训练阶段实现同步优化。URPO 从以(yǐ)下(xià)三(sān)方(fāng)面(miàn)攻(gōng)克技术挑战:

  数据格式统一:将异构的偏好数据、可验证(zhèng)推(tuī)理(lǐ)数(shù)据(jù)和开放式指令数据,统一重构为适用于 GRPO 训练的信号格式。

  自我奖励循环:针对开放式指令,模型生成多个候选回答后,自主调用其“裁判”角色进行评分,并将结果作为 GRPO 训练的奖励信号,形成一(yī)个(gè)高(gāo)效的自我改进循环。

  协(xié)同(tóng)进(jìn)化(huà)机(jī)制(zhì):通(tōng)过(guò)在(zài)同(tóng)一(yī)批(pī)次(cì)中混合处理三类数据,模(mó)型(xíng)的(de)生(shēng)成(chéng)能(néng)力(lì)与(yǔ)评(píng)判(pàn)能(néng)力得以协同进化。生成能力提升带动评判更精准,而精准评判进一步引导生成质量跃升,从而突破静态奖励模型的性能瓶颈。

  实验结果显示,基于 Qwen2.5-7B 模型,URPO 框架超越依赖独立奖(jiǎng)励(lì)模(mó)型(xíng)的传统基线:在 AlpacaEval 指令跟随(suí)榜(bǎng)单(dān)上(shàng),得分从 42.24 提升至 44.84;在综合推理能力测试中,平均分从 32.66 提升至 35.66。作为训练的“副产品”,该模型内部自然涌现出的评判能力在 RewardBench 奖励模型评测中取得 85.15 的高分,表现优于其替代的专(zhuān)用(yòng)奖(jiǎng)励(lì)模(mó)型(xíng)(83.55 分)。

  从摩尔线程官方获悉,目前(qián),URPO 已(yǐ)在(zài)摩尔线程自研计算卡上实现稳定高效运行。同时,摩尔线程已完成 VERL 等主流强化学习框架的深度适配。



热门新闻

即刻开启您的物联网之旅

联系解决方案专家
平台
2.0
解决方案
智慧家庭
智慧车联网
智慧农业
公司动态
行业资讯
永续发展
经营者的话
社会参与
环境永续
公司治理

400-8552-389

7×24小时服务热线

法律声明 隐私权条款

关注“”

服务尽在掌握

© 2022-2025 物联智慧科技(深圳)有限公司版权所有 粤ICP备14023641号
在线咨询
扫一扫

服务尽在掌握

全国免费服务热线
400-8552-389

返回顶部