OpenAI被指悄然调整GPT-6Astra评测数据,部分指标让竞争对手「变差」

快链头条 2026-09-05 11:33:28
阅读 8,728
二维码
微信扫一扫,分享此文章

动察 Beating AI 快讯,OpenAI 自 9 月 3 日发布 GPT-6 Astra 后,多项模型评测基准数据被持续调整,部分修改使 Astra 表现更优,同时部分竞争对手模型的成绩出现下滑,引发外界对 AI「刷榜」和评测透明度的质疑。

其中,Astra 的幻觉率曾从 4.2% 下调至 2%,GPT-5.6 Sol 则从 12.2% 降至 9.4%,随后两者又恢复至 4.2% 和 12.2%。在数学评测中,Anthropic 的 Fable 5.1 得分也曾从 87.8% 降至 78%,目前已回升至 83%;GPT-5.6 Sol 则从 83% 降至 80.5%,后恢复至 83%。

此外,Astra 在 ARC-AGI-3 评测中的成绩从发布前草稿的 98.6% 提升至最终页面的 99.99%,其编程评测成绩也从 57.7% 小幅上调至 57.9%。OpenAI 表示,评测结果会受到模型版本、工具配置、推理级别及测试运行等因素影响,此次调整是为了确保数据更准确地反映模型的最佳性能。

不过,斯坦福大学研究人员认为,频繁重新运行评测可能涉及所谓「Benchmaxxing」,即通过调整测试条件最大化基准成绩。业内人士指出,随着 AI 模型竞争加剧,评测数据已成为衡量模型能力及争夺市场的重要工具,如何提高基准测试的透明度和可复现性正受到越来越多关注。

快链头条登载此文本着传递更多信息的缘由,并不代表赞同其观点或证实其描述。
文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
投资有风险,入市须谨慎。本资讯不作为投资理财建议。

风险提示
根据银保监会等五部门于 2018 年 8月发布《关于防范以「虚拟货币」「区块链」名义进行非法集资的风险提示》的文件, 请广大公众理性看待区块链,不要盲目相信天花乱坠的承诺,树立正确的货币观念和投资理念,切实提高风险意识;对发现的违法犯罪线索,可积极向有关部门举报反映。