传闻原文
网传说法:一张标注"内部评测"的表格显示某大模型在多项基准测试中大幅领先,并附有提交时间。
求证结论
截图中的测试集名称与实际公开版本不一致,条目数量也存在差异;我们用公开测试集复现,得分落在行业常规区间。判断为不可采信,标注"证据存疑"。
结论基于截至 2026-08-21 可获取的公开材料。若出现新的关键证据,我们会在此页更新并标注修订时间。
事件时间线
08-19 22:30
截图在开发者社群出现,配文"内部渠道"
08-20 11:00
多位开发者指出测试集名称拼写与公开版本不符
08-20 21:40
求证组按截图描述复现测试,记录实际得分区间
08-21 16:00
综合比对后标注为"证据存疑"
证据清单
我们把每条材料按可信度分层列出,其中"反证"指与网传结论相冲突的信息。
- 01公开测试集文档高可信
截图中的测试集条目为 8600 条,公开版本为 10240 条,数量对不上
- 02复现测试记录高可信
在相同提示词下,得分处于该类产品的常见波动区间内
- 03截图本身可参考
表格存在两处数字右对齐不一致,疑似后期编辑
- 04所谓"提交时间"可参考
对应时间点该平台并无相关公开提交记录
深度分析
跑分截图的可信度取决于什么
评测结论要能成立,至少需要三件事:测试集可查、提示词可复现、结果可重复。只给一张最终表格,却不给输入和运行环境,这在方法上就已经不完整了。
为什么复现是有效的破局方式
与其争论截图真假,不如按它描述的条件跑一遍。跑分与实际差异过大,说明要么测试条件被改动过,要么数据本身是拼的。复现得到的数字,比任何口头辩论都更有说服力。
面对技术爆料的心态
技术圈的信息更新很快,但对"跑分遥遥领先"这类说法保持一点延迟满足是好事。等到正式发布、有第三方复现之后再下判断,往往能省掉一次被打脸的尴尬。