证据存疑科技爆料#科技#评测#跑分

网传某大模型"内部评测截图"流出,跑分远超同级别产品

一张带着测试表格的截图在开发者圈疯传。我们试着复现同一套测试集,结果与截图给出的分数差距明显。

求证组 · 阿澈求证时间 2026-08-21讨论热度 8,110
暖色数据图表插画

传闻原文

网传说法:一张标注"内部评测"的表格显示某大模型在多项基准测试中大幅领先,并附有提交时间。

求证结论

证据存疑现有材料无法支撑结论,存在明显拼接或断章取义

截图中的测试集名称与实际公开版本不一致,条目数量也存在差异;我们用公开测试集复现,得分落在行业常规区间。判断为不可采信,标注"证据存疑"。

结论基于截至 2026-08-21 可获取的公开材料。若出现新的关键证据,我们会在此页更新并标注修订时间。

事件时间线

  1. 08-19 22:30

    截图在开发者社群出现,配文"内部渠道"

  2. 08-20 11:00

    多位开发者指出测试集名称拼写与公开版本不符

  3. 08-20 21:40

    求证组按截图描述复现测试,记录实际得分区间

  4. 08-21 16:00

    综合比对后标注为"证据存疑"

证据清单

我们把每条材料按可信度分层列出,其中"反证"指与网传结论相冲突的信息。

  • 01公开测试集文档
    高可信

    截图中的测试集条目为 8600 条,公开版本为 10240 条,数量对不上

  • 02复现测试记录
    高可信

    在相同提示词下,得分处于该类产品的常见波动区间内

  • 03截图本身
    可参考

    表格存在两处数字右对齐不一致,疑似后期编辑

  • 04所谓"提交时间"
    可参考

    对应时间点该平台并无相关公开提交记录

深度分析

跑分截图的可信度取决于什么

评测结论要能成立,至少需要三件事:测试集可查、提示词可复现、结果可重复。只给一张最终表格,却不给输入和运行环境,这在方法上就已经不完整了。

为什么复现是有效的破局方式

与其争论截图真假,不如按它描述的条件跑一遍。跑分与实际差异过大,说明要么测试条件被改动过,要么数据本身是拼的。复现得到的数字,比任何口头辩论都更有说服力。

面对技术爆料的心态

技术圈的信息更新很快,但对"跑分遥遥领先"这类说法保持一点延迟满足是好事。等到正式发布、有第三方复现之后再下判断,往往能省掉一次被打脸的尴尬。