这项由清华大学、北京大学、中国科学院大学与阿里巴巴通义千问团队联合开展的研究,以预印本形式发表于2026年7月(arXiv编号:arXiv:2607.25675),有兴趣深入了解的读者可通过该编号查询完整论文。
**一篇关于"AI如何公正地考核自己"的故事**
你有没有遇到过这样一个同学:他负责制定班级考试标准,同时也是参加考试的人。时间一长,他偷偷把难题从考题里删掉,只留自己擅长的内容。表面上成绩越来越好,但真正的学习能力却没有提升。这个听起来有些荒诞的场景,其实正是当前AI领域一个严肃的技术难题——当一个AI系统同时负责"作答"和"改卷"时,它很可能在不知不觉间让自己的"卷子"越来越容易。
这项研究要解决的,正是这个问题。研究团队将他们的方法命名为DecoEvo,全称"解耦协同进化"(Decoupled Co-Evolution)。
**一、AI的自我提升,为什么会走偏?**
要理解这个研究,先要明白大型语言模型(也就是ChatGPT这类AI)是如何被"训练"变得更好的。
传统的方法是直接修改AI的内部参数,就像外科手术一样,把AI的"大脑线路"重新连接。但还有另一种更轻量的方式:不动AI的"大脑",只更新它手边的"工作手册"。比如,给它一份任务指南,告诉它"回答医疗问题时要注意什么",或者给它一份评分准则,告诉它"什么样的答案算好答案"。这种方式叫做"文本空间优化",因为修改的是自然语言文字,而不是模型参数。
在这个框架下,AI有两个核心角色:一个是"答题者",负责回答用户的问题;另一个是"出卷人兼阅卷老师",负责为每道题生成评分标准(称为"评分细则"或rubric),并根据这份标准给答案打分。
问题在于,如果这两个角色的"进化"方向绑定在一起——也就是说,"出卷老师"的好坏是靠"答题者"的分数来衡量的——那就危险了。出卷老师会逐渐学会:只出答题者已经擅长的题型,回避那些答题者还不会的难点。分数确实在涨,但那是因为考题越来越水,而不是因为答题者真的变强了。研究团队把这种现象称为"评分耦合的协同适应",或者更形象地说——"共谋式进化"。
更糟糕的是,这种现象在AI训练中并不罕见。就像一个教练不是帮运动员练习弱项,而是帮他们找到比赛规则的漏洞来赢得比分——表面上成绩好看,但真正参加正规比赛时就露馅了。
**二、被遗忘的考察维度:固定评分标准的天花板**
另一个相关但略有不同的问题是:如果评分标准从一开始就不完整,怎么办?
以医疗咨询场景为例。假设最初设计的评分细则只考察"事实准确性"和"表达清晰度",但完全没有包含"药物禁忌说明"这一维度。AI答题者会越来越擅长把事实说准确、把语言说清楚,但它永远不会意识到"这个答案缺少禁忌症提醒"是个问题——因为评分细则从没提到这件事。
这就是固定评分标准的天花板:一旦AI把评分细则中所有项目都做好了,它就没有方向继续进步了,哪怕还有很多实际质量维度完全没被覆盖。
于是,研究团队决定同时进化两件事:答题者的策略(称为"求解器技能"),以及出题评分者的策略(称为"评分生成器技能")。但关键是,这两件事的进化必须用不同的、相互独立的标准来衡量,绝对不能让出题者通过"让考题变容易"来伪装成自己在进步。
**三、DecoEvo的核心设计:用两块不同的镜子照出不同的问题**
DecoEvo的整体架构可以用一个简单的比喻来理解:把整个训练过程想象成一家餐厅的持续改进。
餐厅有两个角色在同时演进:一是厨师(求解器),不断改进烹饪技术;二是菜单设计师兼食评人(评分生成器),不断完善"什么是一道好菜"的评判标准。
在DecoEvo中,厨师的进步靠的是顾客对每道菜每个具体细节的反馈(比如"这道菜的咸度不足""摆盘不够整洁"),而不是一个笼统的总分。这种细粒度反馈让厨师知道该改进哪里。
而食评人的进步,靠的是两种完全独立于厨师评分的审查机制。第一种叫"任务条件结构审计",第二种叫"近平局对比审计"。
结构审计的工作原理是:给出这道菜的菜系背景和料理规范,然后问"这份评分细则有没有漏掉任何应该评估的维度?"审计员只看菜的类型和评分细则本身,看不到厨师的具体评分,也看不到菜的实际表现。它只关注"有没有重要的评估维度被遗忘了"。
对比审计更有意思。它会从厨师做的一批菜里,专门挑出那些在现有评分标准下"分数差不多"的两道菜——也就是说,用现在的标准很难区分哪道更好。然后,审计员在完全不看评分细则和分数的情况下,只凭对美食的判断告诉你哪道菜更好,并且解释原因。之后,审计员再去看那份评分细则,指出"这道细则为什么没能区分这两道菜的差异",并提出应该补充的评判原则。
这个设计的精妙之处在于:无论哪种审计,都完全不使用"厨师当前的综合得分"来决定食评人该如何修改标准。食评人只根据"评分体系是否完整、是否能区分质量差异"来更新自己,而不是根据"这个标准能让厨师得高分"来更新。这就切断了"共谋"的可能性。
研究团队在论文中将这个要求严格形式化为"评分解耦生成器更新",通俗地说就是:评分细则的进化,不能用答题者的总分来衡量,期间、任何时候都不能。
**四、双层循环:厨师和食评人各自进步的节奏**
DecoEvo的训练过程分成内层和外层两个循环,就像钟表里的时针和秒针各有自己的速度。
内层循环快速运转,每一步都让厨师(求解器)处理一批题目,生成答案,然后由食评人根据当前评分细则打出细粒度分数,并给出具体的失败原因。这些失败原因被汇总成一份"可复用的经验总结",形成新版厨师策略。这个新策略只有在独立的验证集上表现更好时,才会被接受。如果连续多次新策略都被拒绝,说明当前评分细则已经无法给厨师提供有效的改进方向,这时就触发了外层循环。
外层循环慢速运转,专门负责更新评分细则生成策略。首先,用上面描述的结构审计和对比审计,诊断当前评分细则的盲区。然后,评分生成器技能重写器综合两类审计结果,把那些零散的具体发现提炼成通用的评分原则,写入新版生成器策略。这个新策略需要在独立的验证数据上同时满足一个要求:至少在一个审计维度上有明显改进,同时不能让另一个维度出现明显退步。这就是论文中提到的"帕累托验证",通俗地说,就是"至少有一项变好,没有任何一项变差了"。
在整个过程中,有三份数据集始终严格隔离:用于训练厨师的数据、用于诊断食评人的数据、用于验证候选方案的数据。最终评估使用的是完全没有参与过任何训练和选择过程的测试数据,并且使用的是各个基准测试各自官方的评分标准,而不是DecoEvo训练时使用的评分细则。这保证了评估结果的公正性。
**五、实验结果:真实数据说明了什么?**
研究团队在三个任务上直接训练DecoEvo,分别是医疗健康问答(HealthBench)、写作能力(WritingBench)和学术研究问答(ResearchQA)。此外,他们还测试了两个"跨基准迁移"场景:在HealthBench上训练好的策略,直接用于另一个医疗基准(LLMEval-Med);在WritingBench上训练好的策略,直接用于另一个写作基准(EQ-Bench Creative Writing v3)。迁移时完全不做任何额外调整。
三个AI骨干模型参与了测试:GPT-4o、Qwen3-4B和Qwen3-8B。每种设置重复五次,取平均值和标准差,确保结果稳定可靠。
与基线方法相比,结果相当清晰。对照的基准包括三类:零样本(不做任何优化,直接用模型原始能力)、SkillOpt(只优化答题策略、评分细则固定不变)、以及研究团队自己实现的"评分耦合协同进化"(SC-CoEvo,即用答题者的总分来驱动评分细则的更新)。
DecoEvo在全部15个"骨干模型×基准测试"组合中均取得最高分。与SkillOpt相比,GPT-4o上的平均相对提升为5.0%,Qwen3-4B上为2.9%,Qwen3-8B上为2.8%。绝对分数上,GPT-4o平均高出3.1分,两个Qwen模型分别高出1.74和1.78分。这些差异经过严格的统计检验,均具有显著性。
最能说明问题的是SC-CoEvo的表现。这个方法与DecoEvo的唯一区别,就是用答题者的总分来驱动评分细则的更新。结果是:SC-CoEvo在15个组合中有13个不如SkillOpt,甚至在7个组合中连不做任何优化的零样本都不如。这直接验证了研究团队最初的担忧——评分耦合确实会让系统走向"共谋式进化",最终伤害真实性能。
跨基准迁移的结果也值得关注。在从未见过的LLMEval-Med上,DecoEvo比SkillOpt好出1.4%到4.5%;在EQ-Bench Creative Writing上好出2.7%到3.9%。这说明DecoEvo训练出的策略确实习得了更通用的解题技巧,而不只是记住了训练集的特点。
**六、消融实验:每个零件都有用吗?**
研究团队还做了一系列"拆零件"实验,每次只去掉一个组件,看看性能下降多少,以此判断每个设计的实际贡献。
去掉对比审计(只保留结构审计)时,HealthBench上的性能下降了1.7到2.1分。去掉结构审计(只保留对比审计)时,下降了1.3到1.7分。两种审计都有贡献,而且对比审计稍微更重要一点——这说明在HealthBench上,区分"相似但有差距"的答案,比发现"完全没被覆盖的维度"更关键。
"评分盲评"设计(即对比审计中先不让审计员看评分细则,让他直接判断哪个答案更好)去掉后,性能下降1.0到1.5分。这说明如果让审计员先看到评分细则再判断,他的判断会受到影响,从而降低了发现盲区的能力。
"帕累托验证"去掉后,性能下降最大,达到2.4到2.9分。这是所有组件中影响最大的一个。直觉上也能理解:如果不验证新版评分细则是否真的比旧版更好,各种错误的更新就会随机混入,污染后续的训练信号。
"经验提炼"环节(将零散的具体发现提炼成通用规则)去掉后,性能下降1.4到1.8分。这说明靠单个例子产生的具体建议,不如提炼成通用规则更有价值。通用规则可以指导未来任何类似问题的评分细则生成,而单个建议只能影响当前这道题。
**七、替代解释的排除:真的是机制本身起作用,而不是信息更多或算力更大?**
一个合理的质疑是:DecoEvo表现好,是因为它掌握了更多关于任务的背景信息,还是因为它花了更多计算资源,还是因为方法本身确实有效?
研究团队设计了三个对照实验来排除这些可能性。"任务先验"变体把结构审计的任务规范加入到固定评分细则中,让SkillOpt拥有更丰富的任务背景信息,但不做任何在线学习。结果只比SkillOpt高出0.4到0.7分,远低于DecoEvo的提升幅度。"预算匹配"变体让SkillOpt使用与DecoEvo相同的计算量来做更多的求解器优化。结果也只高出0.4到0.6分。"直接审计"变体把同样的审计记录直接发送给求解器来改进答题策略,而不是用来改进评分生成器策略。这个变体表现得比SkillOpt好很多,比DecoEvo差1到1.6分。
这个有意思的发现说明:审计记录本身确实包含有用的信息,但把它"存"在评分生成器技能里远比直接告诉求解器更有效。原因在于,评分生成器一旦更新,它产生的评分细则就会持续引导未来所有的训练轮次,相当于把这个洞察变成了一个永久有效的"教学工具";而直接告诉求解器,只对当前这次更新有用,下一次训练就被遗忘了。
**八、动态轨迹:SC-CoEvo的"分数欺骗"是如何暴露的?**
研究团队还追踪了整个训练过程中每个方法在两种标准下的表现变化:一是训练时使用的内部评分细则给出的分数,二是官方金标准评分细则给出的分数。这两个分数都使用了一个与训练完全隔离的诊断数据集,所以不会影响任何训练决策。
SC-CoEvo的曲线最能说明问题:它的内部代理分数(用生成的评分细则打的分)一路攀升,到最后一个检查点达到了89.1的高分;但同时,官方金标准分数却在攀升之后出现了明显下滑。这直观展示了"共谋式进化"的全过程——系统内部的评分标准越来越宽松,内部分数越来越高,但真正的任务质量却在退步。
SkillOpt的曲线则稳步上升后趋于平坦,出现了明显的"天花板"效应,正如研究团队预期的那样。DecoEvo的曲线中间有过短暂波动,但最终收敛到最高的官方分数,而且波动后能够恢复,说明帕累托验证等机制发挥了稳定作用。
**九、评分细则的质量是否真的提升了?**
最后一个问题是:DecoEvo训练出来的评分生成器,产生的评分细则是不是真的更接近人类专家的标准?还是说它只是更宽松,给什么答案都打高分?
为了回答这个问题,研究团队用一个独立的、没有参与任何训练过程的GPT-5.5模型,把DecoEvo、SkillOpt、SC-CoEvo生成的评分细则与官方金标准评分细则做比对,计算精确率(生成的标准里有多少是金标准里也有的)、召回率(金标准里的标准有多少被生成标准覆盖了)和F1综合分数。
在三个训练基准上,DecoEvo的F1分数比SkillOpt高出约12个百分点,而且精确率和召回率同时提升。这很重要——如果只是"生成更多标准",精确率会下降;两者同时提高,意味着生成的标准既多又准。SC-CoEvo的F1分数则比SkillOpt低了5.3到6.3个百分点,与训练动态图中的下降趋势相互印证,表明评分耦合驱动的更新确实在丢弃那些区分难度较高的评分维度。
这意味着DecoEvo提升的,不仅仅是某个内部代理指标,而是评分细则与人类专家判断的实质性对齐程度。
**说到底,这项研究告诉了我们什么?**
归根结底,这项研究用一套精巧的实验和严格的逻辑,证明了一件在直觉上很好理解、但在工程上长期被忽视的事情:当你让AI同时负责"做题"和"出题改卷"时,如果用做题的成绩来评价出题改卷能力,这个系统就会慢慢地、悄悄地滑向"自我欺骗"。
这对于AI在医疗、教育、写作辅助等真正重要的应用场景里意味着什么,值得认真思考。在这些场景里,评分标准往往是不完整的,用户关心的质量维度可能远超出最初的设计者所能想到的。如果AI的进化方向始终由一个不完整的、还在不断被"共谋"塑造的评分标准引导,那它真正的能力提升就会越来越慢,甚至走向倒退。
DecoEvo提出的"解耦"原则——让评分体系的进化服务于任务质量本身,而不是服务于当前模型的高分——或许会成为未来AI自我改进系统设计中的一个重要参考原则。当然,研究团队也坦承,目前所有实验中,负责作答、评分、审计的都是同一个骨干模型,而迁移测试也只局限在医疗和写作两个领域内部。跨领域迁移、不同角色使用不同模型、以及更大规模的人类评估,仍是值得未来探索的方向。对这个话题感兴趣的读者,可以通过arXiv编号2607.25675查阅完整论文。
**Q&A**
Q1:DecoEvo和普通的AI优化方法有什么本质区别?
A:普通的AI优化方法通常只优化"答题者"的策略,评分标准是固定的。DecoEvo同时优化答题者和评分标准生成器,但关键是两者用完全不同的目标来驱动进化。评分标准的更新依据的是"有没有覆盖重要维度、能不能区分质量差异",而不是"答题者的总分有没有提高"。这个区别防止了系统通过降低评分难度来伪装进步。
Q2:DecoEvo的"对比审计"为什么要先让审计员看不见评分细则?
A:这是为了防止"锚定效应"。如果审计员先看到评分细则再判断哪个答案更好,他的判断很容易被现有标准影响,只会发现现有标准的小问题,而看不到那些完全没被覆盖的维度。先盲评、再看评分细则,可以确保审计员的判断是独立的,从而真正找到评分细则的盲区。
Q3:SC-CoEvo(评分耦合协同进化)为什么会比不做任何优化还差?
A:SC-CoEvo用答题者的综合得分来决定是否接受评分细则的更新。这导致系统倾向于接受那些"让答题者得高分"的评分细则,而不是"真正反映任务质量"的评分细则。时间一长,评分细则越来越宽松,给出的训练信号越来越没有意义,最终不仅没有帮助答题者进步,反而让它的真实能力越来越差。