主要职责
中国科学院贯彻落实党中央关于科技创新的方针政策和决策部署,在履行职责过程中坚持党中央对科技工作的集中统一领导。主要职责是:
一、开展使命导向的自然科学领域基础研究,承担国家重大基础研究、应用基础研究、前沿交叉共性技术研究和引领性颠覆性技术研究任务,打造原始创新策源地。 更多+
办院方针
面向世界科技前沿,面向经济主战场,面向国家重大需求,面向人民生命健康,率先实现科学技术跨越发展,率先建成国家创新人才高地,率先建成国家高水平科技智库,率先建设国际一流科研机构,加快打造原始创新策源地,加快突破关键核心技术,努力抢占科技制高点。
院况简介
中国科学院是国家科学技术界最高学术机构、国家科学技术思想库,自然科学基础研究与高技术综合研究的国家战略科技力量。
1949年,伴随着新中国的诞生,中国科学院成立。建院70余年来,中国科学院时刻牢记使命,与科学共进,与祖国同行,以国家富强、人民幸福为己任,人才辈出,硕果累累,为我国科技进步、经济社会发展和国家安全作出了不可替代的重要贡献。 更多+
科技奖励
科技期刊
科技专项
科研进展/ 更多
工作动态/ 更多
工作动态/ 更多
中国科学院学部
中国科学院院部
语音播报
近日,中国科学院合肥物质科学研究院等在大语言模型强化学习与推理可靠性方面取得两项成果,从因果信息论角度严格证明过程奖励模型(PRM)相比于结果奖励模型(ORM)的优势,并提出大模型强化评测基准体系——棱镜基准OPG-D3。两项成果从类脑信息处理与认知控制的角度,为理解模型推理行为的可靠性提供了新的理论框架和评测范式。
在基于结果奖励的强化学习下,模型会天然地偏好学习训练数据中的表面统计相关性,而非真正的因果推理链。这一现象与人类认知中的“启发式捷径”相似——大脑在面对复杂问题时,也倾向于调用低能耗的联想记忆而非费力的逻辑推演。受此启发,团队将过程奖励模型类比为前额叶皮层对推理步骤的在线监控机制。通过逐步骤的稀疏奖励信号,过程奖励模型能够像认知控制一样,对每一步推理施加约束,抑制“走捷径”倾向,引导模型逐步构建更稳健的因果链条。研究证实,单纯扩大同质数据规模无法从根本上消除这一脆弱性,唯有对推理过程施加结构化监督,才能实现从“答案匹配”到“因果掌握”的质变。
团队剖析了当前强化学习评测基准的固有局限,提出了OPG指标——衡量模型在训练集上训练与直接在测试集上训练的性能差异。实验显示,在主流基准上,强化学习模型的OPG近乎为零,表明当前训练—测试划分可能低估了模型的泛化失败风险。以难度测试、泛化测试和反事实扰动测试为核心的基准框架OPG-D3,能够针对性衡量当前模型在跨分布、规则突变等场景下性能表现、陌生情境下的泛化能力。该成果为构建面向真实世界“认知压力”的下一代世界模型评测基准,提供了可操作的设计原则和诊断工具。
两项研究共同构成了大模型训练推理和评测创新体系——模型推理的可靠性不仅取决于数据量和参数规模,更依赖于学习目标与认知控制结构的匹配程度。团队将强化学习中的结果—过程矛盾上升为计算理论层面的一般性问题,并提出因果信息论边界的棱镜基准OPG-D3,为后续世界模型评测提供了可验证、可比较的理论参照系。
相关成果被国际自然语言处理领域顶级会议ACL 2026接收发表。

结果奖励诱导捷径与过程监督纠正机制示意图

当前大语言模型强化学习评测基准局限性示意图
扫一扫在手机打开当前页
© 1996 - 中国科学院 版权所有 京ICP备05002857号-1
京公网安备110402500047号 网站标识码bm48000002
地址:北京市西城区三里河路52号 邮编:100864
电话: 86 10 68597114(总机) 86 10 68597289(总值班室)








