正文内容 评论(0

谷歌、Meta被揭露AI跑分作弊 华裔高管回应:OpenAI也一样
2026-09-08 20:55:53  出处:快科技 作者:宪瑞 编辑:宪瑞     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

快科技9月8日消息,谷歌、Meta这两年在AI大模型竞争中一度落伍,跟Anthropic及OpenAI差距拉大,但最新的Gemini 3.8 Flash及Muse Spark 1.3杀回来了,在AA榜单上一度超越OA两家旗舰大模型。

Flash模型的性能也不是说完全不可能超越别人家5万亿甚至10万亿参数量的旗舰大模型,但Gemini及Spark的表现还是让人意外,知名分析机构SemiAnalysis日前发文分析了这两家的大模型性能,认为他们存在过拟合,直白点来说就是针对榜单评测做了刷分。

了解过AI圈的网友应该很清楚,AI榜单刷分其实都不算是啥新闻了,只不过以前国产大模型被指责的多,现在矛头指向了谷歌和Meta罢了。

谷歌、Meta被揭露AI跑分作弊 华裔高管回应:OpenAI也一样

对于跑分作弊的指责,没看到谷歌Gemini那边的回应,但Meta这边的AI业务主管Alexandr Wang先坐不住了,他是Scale AI数据标注业务的创始人,被Meta重金收购之后成为Meta AI业务的实际当家人,Spark等大模型就是他领导下做出来的,当然不会接受被人说是刷分作弊才能拿到高分的。

谷歌、Meta被揭露AI跑分作弊 华裔高管回应:OpenAI也一样

他的回应也很有意思,说SemiAnalysis指控他们刷分作弊的论点是愚蠢的,因为OpenAI也是这样,GPT-5.6 Sol大模型在难度较低的TerminalBench 2.1跑分是88.8%,但在难度更高的TerminalBench 4.0中也也只有37.3%。

他的这个反击还是很巧妙的,因为SemiAnalysis指控谷歌及Meta靠作弊刷高分的证据就是TB 2.1这样的评测中得了高分,新出的TB 4.0评测基准中跑分就不行,而Wang的反击就是OpenAI的旗舰大模型也是一样的结果,TB 4.0中跑分也同样会大幅降低。

Wang表示这是因为TB 4.0是一个难度更高的评测,而且没有饱和,TB 2.1的评测已经是饱和了。

简单来说,Wang很巧妙地反击了SemiAnalysis对刷分的质疑,强调不同难度下的基准测试分数都不一样,不光是他们这样,OpenAI也一样,这是测试项目的问题,因为之前的测试难度低了,就像是考试一样,学霸、学渣都可以从简单的考试获得高分数,不能因此就认为学渣是靠作弊实现的高分。

最后Wang还不忘给自家的大模型做广告,强调Spark 1.3当然不可能像Astra或者Fable5.1那么强大,但性价比高得多,而且他们未来的大模型会更直接地与Astra或者Fabel5.1竞争。

谷歌、Meta被揭露AI跑分作弊 华裔高管回应:OpenAI也一样

【本文结束】如需转载请务必注明出处:快科技

责任编辑:宪瑞

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |
本文收录在
#大模型#AI#跑分

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...