硅谷幻梦碎裂:ARC-AGI-3 智商测验惨案,全球顶尖模型得分不足 1%

[要求:Mondo-Noir(黑红高反差风格)。画面:一颗由发光几何拼图构成的红色大脑,在沉重的黑色巨石压迫下崩塌成粉末。极简企业科幻风,电影级光影。比例 2.35:1]

今日封面生成指令 (De-AI Style)

[要求:Mondo-Noir(黑红高反差风格)。画面:一颗由发光几何拼图构成的红色大脑,在沉重的黑色巨石压迫下崩塌成粉末。极简企业科幻风,电影级光影。比例 2.35:1]

■ 荒诞的一周:黄仁勋的狂欢与 Francois 的大嘴巴子

这是 2026 年人工智能历史上最充满黑色幽默的一周。 前脚,英伟达老黄(Jensen Huang)在聚光灯下高调宣布“AGI(通用人工智能)已经到来”;后脚,Keras 之父 François Chollet 就抛出了全新一代的 AI 智商测试题:ARC-AGI-3

结果?一场惨绝人寰的大屠杀。

那些被硅谷风投资本吹上天的“类人推理”神话,在没有背过题库的纯粹逻辑推理面前,底裤掉了个精光。

  • 人类平均得分:100%
  • Google 旗舰 Gemini:0.37%
  • OpenAI 旗舰 GPT-5.4:0.26%
  • 马斯克的 Grok 等所有顶级模型:全军覆没,无一超过 1%。

■ 伪神的黄昏:插值不是推理

为什么平时能写几万行代码、能写十四行诗的 AI,在面对连 5 岁小孩都能看出规律的简单几何色块拼图时,表现得像个智障?

因为 LLM(大语言模型)从来就不会“推理”,它只会“插值”。 在海量训练数据覆盖的范围内,它们能表现出神迹般的博学;但一旦遇到 ARC-AGI 这种纯原创、无法靠背诵和模式匹配解决的新型抽象逻辑题时,统计学的魔术就彻底失效了。

当所有的参数量、所有的算力堆叠,在 0.26% 这个刺眼的分数面前轰然倒塌时,那些叫嚣着“Scaling Law(缩放定律)能解决一切”的布道者们,集体陷入了死寂。

■ 降临派生存法则:别等 AGI 了,做 Harness 工程吧

这场“惨案”给所有沉迷于 AI 叙事的普通人敲响了警钟: 不要再痴迷于等待一个“全知全能的超级大脑”来替你解决所有问题了。那不过是科技巨头用来卖算力的春药。

在《Agent 降临派》的字典里,我们早就抛弃了对“单体大模型推理能力”的迷信。 未来的红利,不在于模型有多聪明,而在于你如何驾驭它——这就是 Harness Engineering(挂载工程学)

我们用本地的 OpenClaw 给它接上双手(API),给它接上双眼(视觉识别),用坚固的流程控制(Workflow)和循环验证机制,去强行规范它的行为。 模型是个偶尔会抽风的打字员,但只要你设计的自动化车间(Agent Pipeline)足够坚固,它依然能为你带来指数级的生产力爆发。

停止幻想,回到堆栈。大模型或许永远也考不及格,但你可以用工程的锁链,逼着它为你干活。


想要深入了解 OpenClaw 架构或获取《大模型接口适配工具包》,后台回复关键词:1

何占伟 / Alex

成都。11 年 Java 后端架构,专注企业级 RAG 与大模型应用工程化落地。

返回博客首页