摩尔线程大模型对齐研究获国际顶级学术会议认可:URPO 框架入选 AAAI 2026
【导语】11 月 13 日消息,摩尔线程提出的新一代大语言模型对齐框架 URPO 统一奖励与策略优化,相关论文被 AAAI 2026 收录。该框架融合两大角色并同步优化,从三方面攻克技术难题,实验显示多项指标超越传统基线,且已在自研计算卡上稳定运行,还完成主流强化学习框架适配 。

11 月 13 日消息,摩尔线程提出的新一代大语言模型对齐框架 —— URPO 统一奖励与策略优化,相关研究论文近日被人工智能领域的国际顶级学术会议 AAAI 2026 收录,为简化大模型训练流程、突破模型性能上限提供了全新的技术路径。
据介绍,在题为《URPO:A Unified Reward & Policy Optimization Framework for Large Language Models》的论文中,摩尔线程 AI 研究团队提出了 URPO 统一奖励与策略优化框架,将“指令遵循”(选手)和“奖励评判”(裁判)两大角色融合于单一模型中,并在统一训练阶段实现同步优化。URPO 从以(yǐ)下(xià)三(sān)方(fāng)面(miàn)攻(gōng)克技术挑战:
数据格式统一:将异构的偏好数据、可验证(zhèng)推(tuī)理(lǐ)数(shù)据(jù)和开放式指令数据,统一重构为适用于 GRPO 训练的信号格式。
自我奖励循环:针对开放式指令,模型生成多个候选回答后,自主调用其“裁判”角色进行评分,并将结果作为 GRPO 训练的奖励信号,形成一(yī)个(gè)高(gāo)效的自我改进循环。
协(xié)同(tóng)进(jìn)化(huà)机(jī)制(zhì):通(tōng)过(guò)在(zài)同(tóng)一(yī)批(pī)次(cì)中混合处理三类数据,模(mó)型(xíng)的(de)生(shēng)成(chéng)能(néng)力(lì)与(yǔ)评(píng)判(pàn)能(néng)力得以协同进化。生成能力提升带动评判更精准,而精准评判进一步引导生成质量跃升,从而突破静态奖励模型的性能瓶颈。
实验结果显示,基于 Qwen2.5-7B 模型,URPO 框架超越依赖独立奖(jiǎng)励(lì)模(mó)型(xíng)的传统基线:在 AlpacaEval 指令跟随(suí)榜(bǎng)单(dān)上(shàng),得分从 42.24 提升至 44.84;在综合推理能力测试中,平均分从 32.66 提升至 35.66。作为训练的“副产品”,该模型内部自然涌现出的评判能力在 RewardBench 奖励模型评测中取得 85.15 的高分,表现优于其替代的专(zhuān)用(yòng)奖(jiǎng)励(lì)模(mó)型(xíng)(83.55 分)。
从摩尔线程官方获悉,目前(qián),URPO 已(yǐ)在(zài)摩尔线程自研计算卡上实现稳定高效运行。同时,摩尔线程已完成 VERL 等主流强化学习框架的深度适配。
热门新闻
- 1接力守护华东物种基因库
- 2在乡土记忆中书写小人物不屈的精神
- 3擎科生物闯关科创板背后
- 4“香薰鸭”变“岁岁鸭”的潮流转译(文物里的潮生活)
- 5一住户将杂物堆满消防通道
- 6把森林“ 种”进博物馆
- 7黄浦 黄浦区互联网优质内容创作集聚区迈入2.0新阶段
- 8华夏物联网ETF联接C净值上涨6.24%
- 9天弘中证沪港深物联网主题ETF发起联接A净值上涨5.00%
- 10物联网ETF工银净值上涨6.45%
- 11南方中证物联网主题ETF净值上涨6.63%
- 12天弘中证沪港深物联网主题ETF净值上涨5.35%
- 13物联网的本质:从感知到决策的分布式智能网络
- 14生物经纬:“不散场”的产业聚会
- 15诺和诺德指控礼来GLP‑1药物广告存在误导性
