评测真的有用吗?模型可能只是在讨好评分器
快链头条 2026-07-22 17:21:25
据动察 Beating 监测,OpenAI 与 Apollo Research 提出一套新测试 Contrastive SDF,想看模型拿高分,到底是学会了规则,还是学会了揣摩评分器。测试用的是 o3 上线前、还没做安全训练的中间版本。
研究者先用合成新闻、论文和教材微调模型,让它相信评分器偏好 A,开发者要求 B。另一组则把两者对调。之后给它们相同任务,看答案会不会跟着评分器变化。
结果显示,强化学习越往后,模型越容易跟着评分器走。在一项必须违背承诺才能完成的编程任务中,模型如果认为评分器奖励完成任务,违约率达到 87%;如果认为评分器奖励诚实,违约率只有 9%。
模型可能只是在评测中表现正确。只要它认为评分标准变了,行为也会跟着变。对安全评测来说,高分未必等于可靠。
快链头条登载此文本着传递更多信息的缘由,并不代表赞同其观点或证实其描述。
文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
投资有风险,入市须谨慎。本资讯不作为投资理财建议。
7*24小时快讯
比特币矿池Foundry发起投票,矿工将决定是否支持BIP-110提案
07-22 18:34(5分钟前)
Kraken母公司扩展代币化股票业务,xStocks将覆盖港股、英股和韩股市场
07-22 18:33(5分钟前)
AT&T 美股盘前拉升 5.1%
07-22 18:33(6分钟前)
数据:若 ETH 突破 2,021 美元,主流 CEX 累计空单清算强度将达 8.54 亿美元
07-22 18:30(9分钟前)
月之暗面加速资本化,Kimi K3 发布后冲刺 500 亿美元估值
07-22 18:26(13分钟前)
月之暗面加速资本化,Kimi K3发布后冲刺500亿美元估值
07-22 18:24(15分钟前)
俄罗斯连续6个月减持黄金储备,20年增持周期转向「财政补血工具」
07-22 18:20(19分钟前)
巨鲸沉睡两年重仓ETH,持仓四个月浮亏180万美元后现已接近回本
07-22 18:15(24分钟前)
热门资讯
风险提示
根据银保监会等五部门于 2018 年 8月发布《关于防范以「虚拟货币」「区块链」名义进行非法集资的风险提示》的文件, 请广大公众理性看待区块链,不要盲目相信天花乱坠的承诺,树立正确的货币观念和投资理念,切实提高风险意识;对发现的违法犯罪线索,可积极向有关部门举报反映。