动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。
新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。
GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。
重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。
----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang