指南

当 AI 考试得 90 分变得毫无意义:我们需要多难的 Benchmark 才能测出真实的智能?

2026-07-19阅读约 6 分钟高级

如果你现在去看任何一个新大语言模型(LLM)的发布会,你一定会被各种柱状图淹没:模型 X 在 MMLU 上比 模型 Y 高了 2.4%;模型 Z 在 HumanEval 代码测试中达到了史无前例的 92%。

然而,如果你去问任何一个真正在生产环境中开发 AI 应用的工程师,他们会告诉你一个完全不同的残酷现实:那些在纸面上考了 90 分的模型,在真实的业务场景中依然会摔得粉碎。

本周,AI 研究界被狠狠地泼了一盆冷水。美团 LongCat 团队发布了一个全新的搜索智能体(Search Agent)基准测试,名为 LoHoSearch。测试结果令人震惊:在接受测试的 11 个最顶尖的前沿模型中,绝对最高分仅仅是惨烈的 34.74%

为什么这个低得离谱的分数如此重要?因为它无情地揭露了当前 AI 评测体系的核心危机:我们已经没有好用的“考卷”了。

Benchmark(基准测试)的饱和危机

要理解为什么 LoHoSearch 的低分反而是一件好事,我们得先看看过去的基准测试都经历了什么。

BrowseComp 为例,这是一个非常流行的用于评估网页浏览 Agent 的基准测试。根据 LongCat 团队的数据,在短短 10 个月内,头部模型在 BrowseComp 上的平均成绩就从 30% 飙升到了 90% 以上。

难道 AI Agent 在不到一年的时间里,浏览网页的能力真的提升了三倍吗?绝对不是。任何尝试过用 AI Agent 去稳定地订一张机票,或者抓取一个动态 React 网页的人都知道,目前的 Agent 依然极其脆弱,动辄崩溃。

分数飙升的真正原因,是评测污染(Contamination)和过拟合(Overfitting)

  1. 评测污染: 公开基准测试的数据,不可避免地会泄露到新模型的训练集中。模型并没有变得更聪明,它们只是提前背下了考卷的答案。
  2. 过拟合: 研究人员会本能地针对行业看重的指标去优化模型。这在教育界叫“应试教育”,在 AI 界叫“刷榜”。

当一个 Benchmark 达到 90% 时,它就不再衡量“智能”了,而是在衡量模型对特定数据集的“记忆力”。这个基准测试宣告饱和,并彻底失去参考价值。

LoHoSearch:一剂刺骨的清醒剂

美团 LongCat 设计 LoHoSearch 的初衷,就是为了对抗这种刷榜式的饱和。它没有使用静态的题库,而是基于包含 762 万个实体的维基百科知识图谱,自动化地生成复杂的多跳(multi-hop)搜索问题。

它跨越 11 个不同领域测试搜索 Agent,要求 AI 在信息的树状和图状结构中导航,进行数据综合,并严防 AI 产生“幻觉”去强行关联不相关的信息。

因为问题是从庞大的、结构化的知识图谱中动态生成的,而不是一个静态的 CSV 文件,模型几乎不可能在预训练阶段通过“背答案”来作弊。

结果呢?那层“90分全能学霸”的幻象瞬间破灭,34.74% 的骨感现实浮出水面。

为什么我们需要更难的考卷?

34% 不是失败,它是真实的底线。

如果 AI 行业想要从“做酷炫的 Demo”真正过渡到“交付企业级软件”,我们需要的是那些与现实世界有用性高度相关的评估指标。

当一位 CEO 看到 AI 在编程基准测试中得了 95 分时,他会误以为 AI 已经可以取代初级程序员了。而当这个 AI 在面对公司那堆历史包袱沉重、结构混乱的真实代码库时,反复犯下低级错误,企业对 AI 的信任就会瞬间崩塌。

LoHoSearch 的发布是一次极其必要的路线纠偏。它提醒整个行业:在构建真正有能力的自主智能体这条路上,我们才刚刚起步。我们不需要能在标准化考试中拿满分的“做题家模型”;我们需要的是能应对互联网真实、混乱、非结构化环境的系统。

而就目前来看,在面对真实的期中考试时,绝大多数模型依然是不及格的。

想把方法直接跑一遍吗?

NavoKit 提供轻量的 AI 生成、内容转换和文案辅助工具,并清晰说明当前限制。

浏览工具箱