生成式奖励模型(GRM)是当前LLM推理增强的重要方向——通过Chain-of-Thought(CoT)让模型在输出答案之前先走一遍推理链,从而提升复杂问题的准确率。
这个方法在数学推理、代码生成等领域效果显著,但有个明显的问题:无论问题简单还是复杂,GRM一律要求模型走完整条CoT推理链。
比如问“1+1=?”也要先“Let’s think step by step”,这在计算上是巨大的浪费。
腾讯混元团队敏锐地抓住了这个痛点:既然模型在推理时会表现出不确定性波动,为什么不反过来用这种不确定性来判断“这个问题值不值得深想”?
E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。

发表:ACL 2026(Pages 23302–23319)
GRM的基本流程是:给模型喂一个prompt(比如“Evaluate the response:…”),让模型先输出一段推理链,然后再给出评分判断。CoT推理链越长、质量越高,最终判断越准——这已经是RewardBench榜单上的共识。
但两个核心问题一直没有解决:
现有GRM把CoT当“标配”,对每个输入都走一遍推理链。RM-Bench中约一半的prompt其实不需要复杂推理,直接判断就够。强制CoT反而引入不必要的token开销和延迟。
当前主流GRM对CoT输出的评估依赖“多采样后投票”——采样N条推理路径,选出现次数最多的答案。这种机制的问题在于:它只看最终答案,不评价推理路径本身的质量。一条答对的推理路径可能逻辑全是错的(蒙对的),但投票机制无法区分。
E-GRM的答案:不确定性决定是否需要CoT,混合损失判别评分器替代投票。


这是E-GRM最核心的创新:用模型自身的输出一致性来判断输入复杂度。
具体流程:
输入Prompt→M次并行解码(不同温度)→统计答案分布→计算Consensus
↓
Consensus≥0.8?
→YES:直接输出答案(跳过CoT,省时间)
→NO:触发CoT+判别评分(深想一下)
M次并行解码(M=5):
对同一个prompt,用不同温度参数(T∈{0,0.3,0.7,1.0})解码5次:
如果这5次解码的答案高度一致(比如5次都选了同一选项),说明模型对这个输入“很有把握”——这是一个简单问题,不需要深度推理。反之,如果5次答案五花八门,说明模型自己也拿不准——这是一个复杂问题,值得触发CoT。
一致性计算公式:
Consensus(x)=max(y)Count(y)/M
即:出现最多的答案的次数÷总采样次数。取值范围[0.2,1.0]。
阈值τ的作用:

这种不确定性估计不需要任何外部模型或手工特征——完全依赖模型自身的输出分布。
当Consensus<τ时,触发CoT推理。但CoT生成了多条推理路径,怎么选最好的?
传统方法:投票。E-GRM用的是轻量级判别评分器+混合损失函数来给每条推理路径打分。
混合损失(Hybrid Loss):
L_hybrid=(1−α)×Huber_loss(y_pred,y_true)+α×Hinge_loss(pairs)
两个分量各有分工:

α=0.3:回归占70%、排序占30%。
类比理解:Huber负责“打分准不准”,Hinge负责“排名对不对”。两者合在一起,确保评分器不仅能给每个推理路径一个准确的分数,还能保证分数之间的相对大小是正确的。
打分流程:
N条CoT路径→特征提取(长度/步数/关键性词汇等)→轻量FFN→[0,1]分数→取最高分
评分器结构极其简单(一个2层MLP),推理开销可以忽略不计。
阶段一:SFT混合训练
E-GRM不是一个“推理时就切模式”的方法——它在训练阶段就教会模型两种回答风格:

这样模型在推理时可以根据输入复杂度灵活切换:低不确定性→短答模式;高不确定性→CoT模式。
阶段二:GRPO偏好优化
在SFT基础之上,用成对偏好数据进一步微调评分器:
GRPO的加入让模型不仅会“快答”和“深想”,还能在深度推理场景中选出最高质量的推理链。



输入Prompt
↓
M=5次并行解码(变温/变Top-p)
↓
计算Consensus
↓
┌───Consensus≥τ(0.8)──→直接输出答案(~58%样本)
│
└───Consensus<τ(0.8)──→CoT生成→判别评分→取最优→输出
整个过程的关键词是无外部依赖——不需要传统分类器判断复杂度、不需要额外的reward model、不需要手工规则。一切信号来自模型自身。
以RM-Bench上全CoT基线为100%:

延迟降到原来的1/3以下,同时准确率还上升了——说明很多简单输入不仅不需要CoT,走了CoT反而可能引入推理噪声。

约42%的样本被路由到CoT,58%的样本直接输出。这58%的“直答”样本平均延迟只有CoT模式的约1/5。

τ=0.8是效率和精度的最佳平衡点。值得注意:τ=0.9时精度反而低于τ=0.8,说明有些输入走CoT反而效果更差(验证了“过推理”或“推理噪声”的存在)。
腾讯混元大模型团队(Tencent Hunyuan Team)&新南威尔士大学(UNSW),14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。
该工作入选ACL 2026。
同期另一篇工作:同一团队在ACL 2026主会发表了Why Supervised Fine-Tuning Fails to Learn,系统性揭示了SFT训练中15.3%样本“假学会”的问题及其五大根因。详见GitHub。
论文(arXiv):https://arxiv.org/abs/2604.10072
论文(ACL Anthology):https://aclanthology.org/2026.findings-acl.1167/
代码(GitHub):https://github.com/xccc-8071/reason-only-when-needed
文章来自于微信公众号 “量子位”,作者 “量子位”
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0