「神仙打架」还是「数字游戏」?为什么说 ChatGPT 和 Claude 的基准测试越来越不靠谱了

「神仙打架」还是「数字游戏」?为什么说 ChatGPT 和 Claude 的基准测试越来越不靠谱了

AIRouter 1 分钟阅读 4 次浏览

糖果姐姐API服务 的 AI API 使用建议

糖果姐姐API服务 面向需要 OpenAI 兼容接口、Claude/Gemini/GPT 多模型切换、包月额度管理和图像模型调用的用户。阅读本文后,可以结合本站的模型清单、独立使用文档和个人面板,把教程内容直接落到实际调用流程中。

在大语言模型(LLM)的战国时代,OpenAI 的 ChatGPT(GPT-4o/o1/o3)和 Anthropic 的 Claude(3/3.5 Sonnet/Opus)无疑是两大霸主。每次这两家公司发布新模型,社交媒体和技术论坛上都会被各种密密麻麻的柱状图、折线图刷屏。

然而,正如 Reddit 热门帖子「Every ChatGPT and Claude benchmarks be like」所吐槽的那样,现在的 AI 基准测试(Benchmarks)似乎已经沦为了一场荒诞的营销游戏。无论哪家发布新模型,他们总能在某些精心挑选的维度上「碾压」对手。

为什么 AI 跑分越来越不可信?我们作为普通用户,又该如何看穿这些「数字游戏」?


1. 跑分猛如虎,体验原地杵?基准测试的四大套路

在官方的宣传 PPT 里,新模型在 MMLU(多任务语言理解)、GPQA(研究生级别谷歌级问答)或 GSM8K(小学数学)等测试集上的表现总是逼近 100%。但一到实际使用中,用户却经常发现它连简单的逻辑题都会翻车。这背后的猫腻主要有以下几点:

套路一:选择性对比(Cherry-picking)

这是最常见的手段。两家公司在制作对比图表时,往往会选择性地展示自己占优的指标,而对落后的指标闭口不提。或者,他们会用自己最新的模型去对比竞争对手几个月前、甚至半年前的旧版本模型。

套路二:数据污染(Data Contamination)

许多基准测试集(如 MMLU)是公开的。在模型的预训练阶段,这些测试集里的题目很可能已经被无意(或有意)地包含在了训练数据中。这就像是在考试前,学生已经背过了整套期末试卷的答案,最终考出高分自然也就不足为奇了。

Data and Analysis

套路三:玩弄图表视觉(Y轴魔法)

为了让差距看起来更震撼,官方图表的 Y 轴往往不是从 0 开始,而是从 80% 或 90% 开始。比如,模型 A 的得分是 95%,模型 B 是 93%,在精心设计的柱状图上,模型 A 的柱子可能比 B 高出三倍,给读者造成「降维打击」的视觉错觉。

套路四:针对测试集微调(Overfitting to Benchmarks)

为了在排行榜上取得好名次,部分厂商会针对特定测试集进行高强度的 Prompt 优化或微调。这种“应试教育”培养出来的模型,在考试时是个学霸,但在面对现实生活中千奇百怪、非标准格式的真实任务时,往往会显得手足无措。


2. Claude vs. ChatGPT:无休止的“拉锯战”

如果你关注 AI 行业,你会发现这样一个有趣的循环:

  1. Anthropic 发布 Claude 3.5 Sonnet,制作了一张表格,宣称在研究生级推理(GPQA)和代码能力上全面超越 GPT-4o。
  2. OpenAI 感到压力,紧接着发布 GPT-o1,展示了一张新的图表,证明在引入「思考链(Chain of Thought)」后,其数学和理科推理能力把 Claude 远远甩在身后。
  3. Anthropic 随后更新 Claude 3.5 Sonnet 的新版本,或者暗示 Claude 3.5 Opus 即将到来,并配上新的领先数据。

这种“你方唱罢我登场”的戏码,让社区里的人们逐渐产生了审美疲劳。正因如此,网友们才会用各种梗图来调侃:“只要定语加得足够多,谁都可以是世界第一。”

Competitive Tech Environment


3. 告别跑分,我们该如何真实评估 AI?

既然官方的 Benchmark 水分这么大,我们应该参考什么来决定使用哪款工具呢?

1. 关注「盲测」社区:LMSYS Chatbot Arena

相比于静态的测试集,**LMSYS Chatbot Arena(盲测竞技场)**是目前行业内公认最具参考价值的平台之一。它采用类似 Elo 积分的机制,让真实用户在不知道模型名称的情况下,对两个模型的回答进行盲测投票。这种基于数十万真实人类偏好(Human Preference)排出来的榜单,比任何官方 PPT 都更具含金量。

2. 建立自己的「测试集」(My Benchmark)

每个人的使用场景都是独特的。如果你是用 AI 辅助写前端代码,那么学术性的物理题跑分对你毫无意义。最聪明的做法是准备 5-10 个你日常工作中最常遇到的真实难题(比如一段复杂的 Bug 代码、一篇需要总结的行业报告),每次有新模型发布时,直接把这些问题投喂给它,亲自对比结果。

3. 关注工作流的顺畅度,而非单一回答

现代 AI 的强弱不再仅仅取决于单次回答的准确率,更取决于它的生态和辅助功能。例如:

  • Claude 的 Artifacts 功能:让代码和网页预览变得极其直观,极大地提升了开发体验。
  • ChatGPT 的 Advanced Voice Mode 和 Canvas:在多模态交互和长文本协同编辑上有着独特的优势。

这些交互设计和生产力工具的加持,往往比跑分表上那 1% 或 2% 的差距更能决定你的工作效率。


结语:让子弹飞一会儿

AI 领域的竞争是一场马拉松,而不是百米冲刺。当下一次你再看到“震惊!XX 模型跑分超越 GPT-4”的新闻时,不妨会心一笑,调侃一句:“every benchmark be like...”。

把评判的权力留给自己,毕竟,最适合你工作流的那款 AI,才是真正的“最强模型”。