资讯详情

资讯详情

GPT-6 Astra跑分反复被改,大模型评测还能信吗

上周四9月3日OpenAI 发布了新旗舰模型 GPT-6 Astra。发布还没到三天据 Fortune 报道它官方公告里的多项评测数据被修改过不止一次Astra 的幻觉率一度从 4.2% 降到 2%后来又改回 4.2%。这事对普通开发者最大的意义不是看 OpenAI 的热闹而是提醒所有人拿跑分数字选模型得多留个心眼。发布过程本身很折腾原定美东时间 9 月 3 日下午 2 点发的公告先撤下又重发官方先说是内容管理系统故障后改口称网络中断并强调与评测成绩无关。但网页存档显示重新上线后里面的数字确实变了之后还在变。据网页快照逐项对照主要变化有幻觉率Astra 从 4.2% 一度降到 2%接近砍半后又回到 4.2%前代 GPT-5.6 Sol 也从 12.2% 降到 9.4%再改回 12.2%FrontierMath Tier 4Astra 一直是 97.6%竞品 Fable 5.1 却一度从 87.8% 被调到 78% 再回到 83%Sol 也在 83% 与 80.5% 之间来回ARC-AGI-3预发布草稿里 Astra 是 98.6%公开版变成 99.99%据评测方 Arc Prize Foundation 独立复测配很强的工具框架能到 99.9%用标准框架则是 63%也有反向改动医疗评测 HealthBench 上Anthropic 模型的分数反而被调高了OpenAI 发言人解释模型检查点、评测框架、运行方式不同多数评测本就有几个百分点的正常波动改数字是为了代表对可用性能的最佳估计对草稿和最终版的出入官方称发布前验证评测属正常流程。公告还声明这些分数是在任何计算资源投入下能够达到的最高成绩——并不是普通用户默认配置下能拿到的体验。技术本质是跑分不是模型有多聪明的直接度量而是一组测量设置的输出。同一道题给不给工具、用哪个检查点、采几次样、跑在什么推理等级上结果都不同。几个百分点的出入确实算正常波动但4.2 砍到 2这种量级已经不是误差能解释的了。斯坦福的研究者把这类操作称为 Benchmaxxing即反复调整测试条件刷高分还指出 Astra 的系统卡几乎没写幻觉率评测的方法细节也有工程师认为发布前几小时调数字不罕见但行业应形成规范——改分时说明评测条件变了什么。往前看2025 年 Meta 的 Llama 4 也闹过类似成绩对不上实物的争议官方先否认后来 LeCun 承认做过修饰。变了的是模型发布节奏快到评测成了营销素材和厂商间的记分牌有报道提到 OpenAI 可能在 2027 年 IPO宣传数字的分量更重了。没变的是跑分从来不能直接等于你业务里的真实表现。那普通开发者怎么选、怎么用我的建议是三条官网数字只当线索别当结论。重点看第三方独立评测和社区真实用例的反馈拿自己的业务数据压测比看任何榜单都实在。挑 5~10 个高频场景固定参数多跑几次importosfromopenaiimportOpenAI clientOpenAI(api_keyos.getenv(OPENAI_API_KEY))defprobe(model:str,prompt:str,times:int10)-None:同问题同参数跑多次看稳定性胜过单个跑分。foriinrange(times):respclient.chat.completions.create(modelmodel,# 替换成要对比的实际模型名messages[{role:user,content:prompt}],temperature0,)print(f[{i1}],resp.choices[0].message.content[:80])3.**留意评测条件脚注**给没给工具、什么推理等级、哪个日期快照。采购或立项汇报时别把厂商最好成绩写成承诺注明某评测、某条件下取得坑也有几个把某榜单第一名直接当业务最优解不读评测方法就引用分数只测它能答对什么不测它在你的脏数据上会怎么错。跑分是体检报告不是疗效保证书——指标再好也得拿自己的病历说话。 发布会上的跑分你会直接采信吗你怎么看评论区聊聊。
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →