top of page

Anthropic 与 Google 模型迎来 pelicanmaxxing 测试,基准测试理论随之瓦解

Anthropic 和 Google 的模型刚刚接受了一项涵盖 1,008 张图像的测试,旨在检测 AI 实验室是否暗中针对某个著名提示词进行优化。这项 Anthropic 与 Google 的对比没有发现令人信服的证据表明,Claude、Gemini 或另外五个竞争模型接受过专门的鹈鹕训练。但这一结果带来了一个更重要的问题:如果无法区分定向优化与通用能力提升,热门 AI 基准测试依然难以令人信赖。

研究员 Dylan Castillo 使用了 Simon Willison 的一项非正式挑战的变体来测试七个模型:“生成一只骑自行车的鹈鹕的 SVG。”实验将八种动物与六种交通工具交叉组合,形成 48 个提示词。每个模型对每个提示词作答三次。

这项研究否定了对于输出质量提升最有趣的解释。AI 实验室很可能并没有在训练中塞满骑自行车的鹈鹕。不过,它也表明,评估 Anthropic、Google、OpenAI 及其竞争对手,不能只靠反复使用一个耳熟能详的测试。

一个玩笑基准变成了受控实验

Castillo 将网络上的长期玩笑转化为一项针对基准特定优化的结构化测试。

多年来,Willison 一直在评估大型语言模型的重要发布时使用这条鹈鹕提示词。SVG,即可缩放矢量图形,通过基于文本的形状和坐标来描述图像。生成 SVG 需要在一次回答中同时完成编程、空间推理、物体识别和视觉构图。

这种组合让该提示词出人意料地实用。较弱的模型往往会生成无效标记、损坏的车轮、错位的肢体,或是一只根本不像鹈鹕的鸟。更强的模型则能够返回可正确渲染、且保留所要求关系的图像。

该提示词也变得格外引人注目。Willison 在其 pelican benchmark 标签下已积累了 100 多篇文章。他的结果经常出现在关于新模型的公开讨论中。

可见度带来了激励问题。一旦开发者知道每次发布都会面对一个可识别的提示词,他们就可能专门为它优化。Benchmaxxing 指的是将系统调校为在公开基准上表现优异,却没有在其他领域带来同等广泛的改进。

Pelicanmaxxing 则是这种担忧的喜剧化版本。实验室可能会在训练数据中加入鹈鹕和自行车的示例,在后训练阶段加入类似任务,或奖励符合熟悉构图的输出。生成的图像看起来会很惊艳,却几乎不能说明模型的通用能力。

Castillo 设计了一项能够揭示这种模式的实验。他的 受控研究 包括鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸和猫。交通工具则包括自行车、独轮车、滑板、踏板车、飞机和船。

他测试了 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 和 DeepSeek V4 Pro。研究以 1.0 的温度参数,为每种模型—提示词组合生成三次。

计算下来共有 1,008 张图像:48 个提示词,乘以三个样本,再乘以七个模型。只有 11 次生成需要重试,因为原始回答缺少可用的 SVG。

评估流程分为三个阶段。首先,系统将每个 SVG 渲染为 PNG 图像。其次,GPT-5.6 Luna 从一到五分评估动物、交通工具和动作之间的连贯性。

第三,Gemini 3.1 Flash-Lite 提取可见特征,包括识别出的动物、交通工具、朝向和重复出现的场景元素。随后,Castillo 使用 Claude Fable 5 协助进行统计分析。

这一设置很重要,因为单张好看的鹈鹕图并不能证明基准投机。实验真正要问的是,每个模型是否在鹈鹕、自行车,或两者的确切组合上表现得异常出色。

这种区分将一则轶事转化为可检验的假设。如果确实发生了定向训练,在考虑不同难度后,这个著名提示词的表现应当优于相近的提示词。

Anthropic 与 Google 的结果未显示鹈鹕优势

Claude 和 Gemini 都没有呈现出蓄意 pelicanmaxxing 所应有的整体模式。

最简单的结果立刻不利于这一理论。汇总各模型评分后,鹈鹕在八种动物中排名第六。猫、鲸、浣熊、苍鹭和羚羊获得了更高的动物评分。

自行车的表现更差。在六种交通工具中,它排名第五,仅略高于飞机。评判模型发现,约三分之二的自行车图像缺少部件,或部件之间没有连接。

仅凭这些排名无法解决问题。鹈鹕比猫更难描绘,而自行车需要两个车轮、相连的车架、车把、脚踏和座椅。专门训练或许能改善一个高难度对象,却不一定让它升至第一名。

因此,Castillo 拟合了固定效应回归模型,这是一种将稳定的组间差异与研究中的特定效应分离开来的统计模型。该模型考虑了每种动物—交通工具组合的固有难度。

随后,它为每个实验室估计三种效应。其中一项衡量所有鹈鹕提示词上的表现,另一项衡量所有自行车提示词上的表现,最后一项则隔离出鹈鹕—自行车这一确切组合。

每个实验室的鹈鹕估计值都介于负 0.11 至正 0.14 个评判分之间。没有一个接近统计显著性,报告中最小的 p 值为 0.25。

没有任何实验室在这一确切组合上产生统计显著的提升。GLM-5.2 记录了最大的正向估计值,为 0.35 分,但其 p 值为 0.12。这一结果仍可能只是随机因素所致。

在难度调整前,这个著名组合在全部 48 个组合中排名第 42。一个经过大量专门准备的提示词,通常不应落在比较网格的底部附近。

自行车结果出现了一个看似的例外。Gemini 3.5 Flash 的自行车效应为 0.27 分,p 值为 0.022。单独来看,这一数值通过了传统的 0.05 阈值。

然而,该研究进行了 21 项相关统计检验。在 0.05 的阈值下,随机波动平均会产生约一个看似为正的结果。Gemini 的效应恰好就是那唯一的结果。

它也未能通过 Bonferroni 校正;当研究人员检验多个假设时,这种校正会降低显著性阈值。校正后的阈值约为 0.002,远低于 Gemini 的 0.022 结果。

这使 Anthropic 与 Google 的对比不如其便于关键词传播的表述那般戏剧化。Claude 没有显示出鹈鹕特有的优势。Gemini 孤立的自行车结果,也无法通过标准的多重比较校正。

OpenAI、xAI、Qwen、Z.ai 和 DeepSeek 同样没有呈现预期特征。一些模型整体画得更好,但通用质量并不能证明存在狭窄的定向优化。

这一发现应当抑制基于视觉检查得出的断言。精致的输出可能反映出更好的编程、构图或指令遵循能力,并不自动意味着模型记忆了基准材料。

Castillo 还公开了 实验仓库,让读者能够检查流程和底层结果。这种透明度使该研究比精心挑选的成功生成图集更有价值。

结论仍然保持适当的谨慎。实验发现,在这些条件下,这些模型几乎没有明显 pelicanmaxxing 的证据。它并未证明没有任何实验室曾用相关示例进行训练。

熟悉的图像并不能证明记忆

重复出现的视觉模式看起来可疑,但比较网格表明,其中许多源于普通的绘图惯例。

全部 21 张鹈鹕骑自行车图像都面向右方。没有其他组合实现完全一致的朝向。单独看,这一结果像是记忆化构图的强烈信号。

更广泛的数据集改变了它的含义。1,008 张图像中有 60% 面向右方。自行车样本中有 81% 面向右方,踏板车则达到 83%。

鹈鹕图像中也有 78% 面向右方。羚羊达到同样的比例,苍鹭则为 77%。这些对象自然更适合侧视图,因为正面姿势会遮挡其标志性特征。

当两个车轮都保持可见时,自行车更容易被识别。鹈鹕的侧面轮廓则能展现其长喙和喉囊。两种偏好叠加后,朝向的一致性并不令人意外。

其他几个组合也几乎达到一致。骑踏板车的羚羊和骑踏板车的鹈鹕在 21 个样本中有 20 个面向同一方向。骑自行车的苍鹭则有 21 个样本中的 19 个如此。

重复出现的道具也讲述了相似的故事。每张火烈鸟乘船图像都有太阳。38% 的水獭乘飞机图像中出现围巾,38% 的猫骑自行车图像中出现篮子。

鹈鹕—自行车场景中也有重复元素,但其程度并不格外突出。模型似乎会从许多提示词共有的视觉联想中作画,而非只依赖那个著名提示词。

这种区别是 Anthropic 与 Google 基准争论的核心。生成模型可以在不检索某个特定训练样本的情况下,收敛到相似的构图。它们学习到的分布偏好熟悉的布局、颜色、姿势和装饰元素。

训练数据仍然重要。无数插画会以侧面描绘移动中的角色,通常从左向右或从右向左行进。模型可以吸收这些规律,而无需记忆某一张可识别的图像。

反过来也同样成立。模型可以复现受训练影响的模式,而不返回精确副本。输出相似性存在于一个连续谱上,小型图像网格无法确定每项结果在其中的位置。

这种不确定性解释了为何视觉相似性本身是薄弱证据。太阳、围巾、篮子或面向右方的鸟,可能表明模型学到了某种惯例,也可能说明存在更狭窄的一组重复示例。

更强的论断需要额外测试。研究人员可以改变措辞、构图、朝向、艺术风格和输出格式。他们还可以比较模型内部概率,或在已知训练语料中搜索相近示例。

封闭模型让大多数外部研究人员无法检查这些更深层的信号。公众可以测试行为,却无法审查 Anthropic 或 Google 完整的训练数据组合和后训练配方。

这种信息缺口使非正式基准获得了不同寻常的影响力。用户可以立即运行同一提示词,并比较可见输出;但他们很难确定某个系统为何表现更好。

鹈鹕实验通过扩展比较集改善了这一状况。它展示了受控替代方案如何在一个吸引人的叙事成为既定事实之前,对其提出挑战。

真正的可能性是 SVGmaxxing

该研究削弱了狭义的鹈鹕理论,同时仍认为广泛的 SVG 优化完全可能存在。

SVGmaxxing 指的是提升模型在众多主题上的矢量图形生成能力,而不是专门针对某个知名提示词进行优化。以这种方式训练的模型,理应在 Castillo 的网格测试中整体表现更好。这种提升才会体现出真正的通用能力。

这正是该实验最重要的盲点。它的统计设计能够检测出每个实验室内部异常突出的鹈鹕、自行车或组合效应,但无法识别同时提升全部 48 种组合表现的训练。

Castillo 指出,Google DeepMind 曾公开讨论过提升 SVG 生成能力的相关工作。这使得“整体优化”的解释,比存在装满鹈鹕示例的秘密数据仓库更可信。

通用 SVG 训练并不天然等于刷榜。矢量图形可实际用于图标、图表、图示、界面素材、教学材料和可编辑插画。更好的表现能够服务于许多真实任务。

边界取决于泛化能力。训练模型根据多样化请求生成有效、可编辑的图形,是在培养实用能力;若将其训练在一小类可预期的评测提示词上,则是在制造误导性的分数。

外部观察者很少知道一家实验室位于这两种做法之间的哪个位置。公开模型文档通常会描述广泛的评测结果,但详细的数据混合方式和强化信号仍属私密。

Anthropic 与 Google 的对比清楚说明了这种模糊性。Claude 和 Gemini 的整体 SVG 质量可能不同,却不意味着任何一方接受过专门针对鹈鹕的训练。这些差异可能反映出编程能力、空间推理能力或有针对性的图形工作。

即使是通用提升,也可以为演示效果而优化。实验室知道哪些能力容易生成吸睛的社交媒体内容。清晰的 SVG 能带来立刻可见的前后对比,比细微的推理改进更容易传播。

这种激励并不会否定能力本身。但这意味着读者应区分产品实用性与发布日的展示效果。模型或许能画出令人印象深刻的自行车,却会在不那么上镜的任务上失手。

因此,开发者应根据实际工作流测试图形模型。产品团队可能需要尺寸一致、可复用的图标;研究人员可能需要带有关系标签的准确图示。

这些要求不同于绘制奇趣动物。有效标记、可编辑性、无障碍性、坐标准确度和风格一致性的重要性,可能都高于视觉上的讨喜程度。

同样的原则也适用于 SVG 生成以外的领域。编程智能体可能擅长公开的软件任务,却难以应对企业的私有代码库。推理模型可能在学术问题上得分很高,却会错误处理不完整的职场证据。

团队需要围绕具有代表性的工作和隐藏测试用例构建评测体系。他们还需要保存记录,说明哪些提示词、来源和输出支撑了某项决策。

可搜索的 AI 知识库 能将这些评测产物与人工观察一并保留。当模型更新改变行为时,这份记录就会变得很有价值。

更广泛的教训并不是公开基准毫无用处。它们提供了共同的参照点,并使性能回退更容易被发现。然而,随着实验室和用户围绕它们进行优化,其价值会下降。

一个知名基准会逐渐成为其所衡量环境的一部分。研究人员讨论它,开发者看到它,生成的示例在线上传播。未来的训练数据集便可能吸收这些讨论和输出。

这种反馈循环使污染难以避免。即便没有刻意操纵,一个广为人知的测试也可能在统计上与被测系统不再独立。

Pelicanmaxxing 之所以好笑,是因为其利害关系看似微不足道。但其背后的机制并非如此。类似的污染可能影响编程、数学、安全性、事实准确性,以及用于严肃采购决策的智能体评测。

单个 LLM 评委无法盖棺定论

这些发现颇具参考价值,但样本量和评测方法仍为较小效应与测量误差留下空间。

所有分数均来自 GPT-5.6 Luna,它一次评判一张图像。Castillo 没有测量评委面对同一图像的重复呈现时,评分是否一致。

不可靠的评委会为每项估计带来噪声。某种风格偏好也可能偏向一个模型家族。Luna 与 GPT-5.6 Terra 同属更广泛的模型家族,而 Terra 是被测试系统之一。

研究中的模型内部比较减轻了这一担忧。若 Luna 单纯偏爱 Terra 的风格,它应当抬高 Terra 整个网格的得分。分析关注的是特定单元格是否高于该模型的一般表现。

但评委行为仍可能与内容交互。Luna 对某些动物的识别可能比对其他动物更可靠。它可能奖励干净、简洁的视觉效果,却忽略解剖结构错误。

人工评测能够提供另一重验证。多名独立评分者可评估动物身份、车辆结构、动作连贯性和整体质量。一致性评分将揭示哪些判断仍然主观。

引入第二个独立模型评委也会有所帮助。不同评委家族可依据相同量表,为同一批渲染图像评分。重大分歧将揭示结论的脆弱之处。

预算限制使实验每个单元格只能采样三次,并仅进行一轮评判。Castillo 报告称,整个实验大约消耗了 80 美元的 API 额度。由此得到的置信区间平均约为正负 0.6 个评委评分点。

这些区间足够宽,可能掩盖幅度不大的基准特定提升。某家实验室可能获得微小优势,但该实验缺乏检测它所需的统计功效。

研究还会重新生成无效输出,直到每个提示词都产生可用的 SVG。仅发生了 11 次重试,因此这一选择的影响可能有限。不过,重试行为从最终图像分数中移除了部分可靠性差异。

生产环境评测可能会计入首次响应。用户在意模型能否无需修正便遵循所要求的格式。在自动化工作流中,渲染失败的重要性可能不亚于视觉质量。

使用“plane”一词还造成了另一个已知问题。一些模型将其理解为平面的几何表面,而非飞机。特征提取器在 168 张 plane 图像中的 25 张里没有发现车辆。

20% 的 plane 图像获得了 1 分或 2 分的车辆分数。自行车的比例为 5%,而船、滑板车和滑板没有任何如此低的分数。

这一措辞错误并未抹去核心结果。所有模型接收到的提示词相同,回归分析也控制了组合难度。但它确实表明,一个含义模糊的术语就能扭曲基准。

通过 OpenRouter 获取模型还带来另一项考量。该实验反映的是运行期间可用的模型版本和路由行为。提供商可以更新系统,却不必让外部研究人员完整了解每一项变化。

因此,这项研究应被视为强有力的初步测试,而非永久性裁决。其严谨设计使“大效应不存在”这一结论具有意义,但无法排除所有更小规模或更早期的优化努力。

这种谨慎表述同样适用于让该结果广为人知的源文章。Willison 在其 7 月评论 中称,Castillo 的工作比他先前的抽查更为细致。他并未将其视为“基准刷榜从未发生”的证明。

读者应避免把“这里没有明确证据”转换成“实验室已被洗清”。未能检测到某种现象,取决于提示词、样本、评委、统计模型及可用统计功效。

更好的结论是方法论层面的。关于基准刷榜的主张需要受控比较、开放数据、多位评估者和明确的不确定性说明。仅凭截图无法承担这一证明责任。

Anthropic、Google 和模型买家接下来应关注什么

下一批有价值的证据将来自复现、更广泛的 SVG 测试,以及版本发布之间的行为变化。

首先,研究人员应以更多样本和独立评委复现这项研究。更大规模的运行将收窄置信区间,并揭示微小效应是否会在重复评测中持续存在。

人工评分者应根据书面量表审阅具有代表性的子集。至少应由另一模型家族中的一位评委为完整数据集评分。跨方法的一致性将强化研究发现。

如果鹈鹕、自行车和组合效应仍接近零,狭义的 pelicanmaxxing 理论就会变弱。如果某一家实验室的效应反复出现,调查者便会拥有更明确的调查目标。

其次,未来测试应将任务扩展到动物骑交通工具的卡通画之外。模型可以生成技术图示、界面图标、地图、带标签的流程、几何图形以及风格一致的资产系列。

这些提示词将检验更好的 SVG 输出能否迁移到实用工作中。它们也能将通用图形训练与围绕视觉上熟悉的提示词家族进行的优化区分开来。

研究人员不应只衡量外观。首次尝试的有效性、可编辑性、无障碍标签、所要求的尺寸、对象数量和空间准确性,都值得获得独立评分。

这将促使 Anthropic 和 Google 说明其模型在版本迭代之间究竟提升了什么。若某个模型能在许多隐藏 SVG 任务中表现更好,就更能证明其具备通用能力。

第三,观察者应追踪重大发布前后的不连续变化。某个知名提示词上的突然进步,值得与在相同条件下运行的相邻隐藏任务进行比较。

Simon Willison archive 提供了一段有用的公开历史,但未来评测也需要未公开的提示词集合。隐藏测试能减少直接优化和意外污染。

模型买家无需构建一项千图研究,也可以采用同样的方法。先从一个看起来令人印象深刻的公开演示开始,然后设计若干受控变体,保留其底层技能。

改变实体、格式、约束条件和措辞。运行足够多的样本,以观察表现能否经受普通变化。保存首次尝试,也保存修正后的输出。

对于 Anthropic 和 Google 的采购决策,胜出的模型应能完成有代表性的私有任务,而非只通过一个知名公开挑战。买家还应在模型更新后重新测试。

鹈鹕研究提供了一个实用模板:定义可疑的捷径,构建相邻替代方案,控制难度,并同时公布失败与成功案例。然后说明该设计无法检测什么。

这一标准很重要,因为 AI 评测正日益影响工程规划、供应商选择和工作场所自动化。一个基准分数可以将复杂行为压缩为一个便于营销的数字。

没有任何单一数字能够完整描述一个模型。受控实验仍能揭示:何时一个引人注目的叙事跑在了证据前面。

眼下的答案令人安心,却并不完整。Castillo 没有发现强有力迹象表明,七个领先模型在“骑自行车的鹈鹕”上获得了特殊优势。Google 单独出现的自行车结果,在多重检验校正后消失了。

更大的挑战仍未解决。广泛优化、受污染的测试、隐藏的训练选择和主观评委,依然可能模糊真正进步与评测策略之间的界限。

在相信下一个爆红模型演示之前,不妨先围绕它建立一个小型对比矩阵。问一问:当主体、格式和约束条件发生变化时,所宣称的能力是否依然成立。Anthropic Google pelican test 表明,只要有人去检验这个故事,而不是一味复述它,一个看似荒唐的提示词也能暴露严肃的评估问题。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page