OpenAI被指悄然调整GPT-6 Astra评测数据,部分指标让竞争对手「变差」
发布时间:2026-09-05
动察 Beating AI 快讯,OpenAI 自 9 月 3 日发布 GPT-6 Astra 后,多项模型评测基准数据被持续调整,部分修改使 Astra 表现更优,同时部分竞争对手模型的成绩出现下滑,引发外界对 AI「刷榜」和评测透明度的质疑。其中,Astra 的幻觉率曾从 4.2% 下调至 2%,GPT-5.6 Sol 则从 12.2% 降至 9.4%,随后两者又恢复至 4.2% 和 12.2%。在数学评测中,Anthropic 的 Fable 5.1 得分也曾从 87.8% 降至 78%,目前已回升至 83%;GPT-5.6 Sol 则从 83% 降至 80.5%,后恢复至 83%。此外,Astra 在 ARC-AGI-3 评测中的成绩从发布前草稿的 98.6% 提升至最终页面的 99.99%,其编程评测成绩也从 57.7% 小幅上调至 57.9%。OpenAI 表示,评测结果会受到模型版本、工具配置、推理级别及测试运行等因素影响,此次调整是为了确保数据更准确地反映模型的最佳性能。不过,斯坦福大学研究人员认为,频繁重新运行评测可能涉及所谓「Benchmaxxing」,即通过调整测试条件最大化基准成绩。业内人士指出,随着 AI 模型竞争加剧,评测数据已成为衡量模型能力及争夺市场的重要工具,如何提高基准测试的透明度和可复现性正受到越来越多关注。----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考----------交流群:https://t.me/dunwangyuanhuiwang

动察 Beating AI 快讯,OpenAI 自 9 月 3 日发布 GPT-6 Astra 后,多项模型评测基准数据被持续调整,部分修改使 Astra 表现更优,同时部分竞争对手模型的成绩出现下滑,引发外界对 AI「刷榜」和评测透明度的质疑。


其中,Astra 的幻觉率曾从 4.2% 下调至 2%,GPT-5.6 Sol 则从 12.2% 降至 9.4%,随后两者又恢复至 4.2% 和 12.2%。在数学评测中,Anthropic 的 Fable 5.1 得分也曾从 87.8% 降至 78%,目前已回升至 83%;GPT-5.6 Sol 则从 83% 降至 80.5%,后恢复至 83%。


此外,Astra 在 ARC-AGI-3 评测中的成绩从发布前草稿的 98.6% 提升至最终页面的 99.99%,其编程评测成绩也从 57.7% 小幅上调至 57.9%。OpenAI 表示,评测结果会受到模型版本、工具配置、推理级别及测试运行等因素影响,此次调整是为了确保数据更准确地反映模型的最佳性能。


不过,斯坦福大学研究人员认为,频繁重新运行评测可能涉及所谓「Benchmaxxing」,即通过调整测试条件最大化基准成绩。业内人士指出,随着 AI 模型竞争加剧,评测数据已成为衡量模型能力及争夺市场的重要工具,如何提高基准测试的透明度和可复现性正受到越来越多关注。

----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang