Design Arena 融资 790 万美元,将人类品味转化为 AI 评估
- Ethan Carter

- 8月12日
- 讀畢需時 14 分鐘
Design Arena 在吸引 530 万用户后融资 790 万美元,为 AI 实验室至今仍难以定义的东西——品味——赋予了可量化的价值。这篇 techcrunch 设计报道并不只是又一则种子轮融资公告,而是押注数百万个主观的人类选择能够成为评估和改进前沿模型的有用基础设施。
该平台向用户展示 AI 模型相互竞争的输出,并要求他们选择更偏好的结果。这些投票会在网站、图像、视频、音频、界面及其他创意任务中产生排名。Design Arena 背后的公司 Arcada Labs 表示,模型开发者会利用这些反馈来理解传统测试无法捕捉的表现。
这一主张让 Design Arena 面临一种熟悉的评估模式:包含固定问题和客观评分答案的静态基准测试。OpenAI、Anthropic、Google 及其他实验室都可以针对这些测试优化模型。品味则更难衡量,因为一个输出即使符合提示词、渲染正确,仍可能显得粗糙或千篇一律。
融资将人类偏好变成一项风险投资赌注
Design Arena 的融资将主观判断视为模型智能的宝贵来源,而非消费者使用过程中无结构的副作用。
TechCrunch 于 2026 年 8 月 3 日报道,Design Arena 的创始团队已融资 790 万美元。早期报道显示,Conviction 和 Y Combinator 是 Arcada Labs 的投资者。该公司参与了 Y Combinator 2025 年夏季批次,并在旧金山运营。
Grace Li 和 Kamryn Ohly 在 Harvard 一场黑客松中开发 AI 游戏引擎后创办了 Design Arena。这些生成的游戏能够运行,但视觉质量依然明显不足。与其手动争论哪个模型更好,她们创建了一个一对一比较工具。
这项实验后来成为产品。Li 写道,Design Arena 在上线头四个月内增长至覆盖 165 个国家的 395,000 名用户。Ohly 后来表示,该平台在六个月内达到 100 万用户。与本轮融资一同披露的最新数字是全球 530 万用户。
这一增长很重要,因为人类偏好系统依赖参与。基于少数专家评审的排行榜反映的是一个狭窄的小组。服务数百万人的平台则可以收集更多提示词、视觉风格、语言、设备和实际目标下的判断。
不过,用户数量并不等同于评估质量。有用的单位是由真实用户在能够降低偏见的条件下作出的、结构良好的比较。Arcada 必须证明流量会产生干净的信号,而不只是令人印象深刻的覆盖范围。
这一差异也解释了为何 techcrunch 的设计视角值得关注,而不仅仅是融资金额。Design Arena 正在构建两项相互关联的产品。面向公众的体验帮助人们比较模型,而由此产生的偏好数据则可为 AI 实验室提供评估服务支持。
这种结构类似于其他竞技场业务。免费的消费者产品吸引提示词和投票,商业客户则为更深入的分析、私有测试或评估基础设施访问付费。公众活动同时成为分发渠道和可持续更新的数据来源。
Design Arena 的创始人并未将这一理念局限于视觉输出。Arcada Labs 还围绕预测及其他现实能力开展实验。其更广泛的论点是,AI 评估应将模型置于成功取决于人类判断或可观察结果的环境中。
例如,Prediction Arena 通过实时预测市场而非固定题库测试模型。Design Arena 则将同一理念应用于创意工作:让模型在质量来自实际使用、而非标准答案的场景中竞争。
这使得 790 万美元融资成为对测量能力的投资。更好的图像和界面生成需要更多算力及更强模型,但实验室同样需要能告诉它们这些改进是否真正对人们有意义的反馈。
TechCrunch 设计报道如何衡量品味
其核心机制将“这个看起来更好”这一模糊反应,转化为可进行统计排名的重复两两选择。
一次 Design Arena 会话从用户提示词和类别开始。平台将请求发送给多个模型,在评估期间隐藏其身份,并以锦标赛形式展示生成的设计。用户比较输出并选出胜者。
该平台的评估方法论称,其排行榜通过 Bradley-Terry 模型近似 Elo 分数。这一统计方法根据累积的两两结果,估计一名竞争者击败另一名竞争者的概率。
两两投票降低了评估者的负担。人们无需从一到十给出可辩护的分数,也不必解释完整的设计理论。他们只需判断两个输出中哪一个更符合提示词。
这种简单性对于品味尤为重要。一个人可能难以分别量化字体设计、层级、对比度、平衡、新颖性和可用性,但往往能在数秒内识别出更强的设计。
Design Arena 使用主动采样,这意味着系统优先选择预计能提供相对表现有效信息的对局。其公开的锦标赛格式会抽样四个模型,通过胜者组和败者组进行比较,并使用最终的决胜阶段。
该方法论也揭示了局限性。每次比较的权重相同,投票数较低的模型可能大幅波动。平台会标注票数少于 50 的新条目,而其排名会排除未达到最低比较门槛的参与者。
因此,实时排行榜代表的是当前的偏好证据,而非对质量作出的永久宣告。当新模型加入、用户提示词发生变化,或更多投票缩小接近竞争者之间的不确定性时,排名可能改变。
该系统填补了一个真实的评估空白。传统基准测试在正确性可验证时效果最佳。数学答案、代码执行、事实检索和结构化分类都可以支持相对清晰的评分规则。
设计很少具备这种确定性。两个落地页都可能功能正常,却营造出截然不同的印象。一个或许能有效引导注意力,另一个则可能使用流行细节,反而掩盖产品本身。
自动评判者也无法完全解决问题。视觉语言模型可以检查界面并评论布局,但它也带有自身的训练偏见。它可能奖励熟悉的构图、冗长的解释,或由相关模型生成的视觉模式。
关于基于模型的评估者的研究已经记录了位置偏差、自我偏好及其他失真。CoBBLer 研究评估了作为评委的语言模型中的多种认知偏差,并质疑自动标注是否能可靠地匹配人类偏好。
人类投票会带来不同的弱点,但它提供了创意系统最终需要满足的目标行为。如果 AI 工具生成演示文稿、广告、网站或产品界面,最终仍将由人来决定它是否有效。
techcrunch design 这个关键词听起来可能像是出版分类,但其背后的故事关乎一个正在出现的数据层。Design Arena 并非直接向模型教授美学原则,而是在收集可指导评估、产品决策,以及潜在后训练的选择结果。
这些选择可以成为偏好模型的标签,后者用于估计人们会偏好哪些输出。它们还能揭示某个模型的优势所在。一个系统可能在数据可视化上表现良好,却在字体设计、移动端布局或演示文稿上落后。
对于比较 AI 工具的团队而言,这类证据比单一总分更有用。产品经理需要知道某个模型是否适合其工作负载,模型实验室则需要了解哪些能力在版本迭代之间出现了退步。
结果是一个反馈循环:用户带来真实提示词,模型生成相互竞争的作品,人们投票,平台更新排名。实验室随后可以审视其系统在哪些方面落败,并针对未来改进确定方向。
AI 实验室正在争夺人类信号
Design Arena 迫使前沿实验室不仅为自动基准测试能够验证的内容优化,也为人们实际会选择的内容优化。
模型开发在评估层面变得愈发竞争激烈。实验室会在每次发布时宣布基准测试提升,而企业买家则利用这些数字缩小采购决策范围。随着分数趋同,测试本身的设计变得更具影响力。
静态基准测试带来一个熟悉的问题:一旦其问题和评分方法广为人知,开发者便可以针对它们调整模型。性能会上升,但测试可能逐渐失去区分真正泛化能力与定向优化的能力。
实时竞技场通过从用户获取提示词并持续增加比较来应对这一问题。随着人们尝试新任务,问题分布也会变化。模型无法完全依靠记忆一套公开题目。
LMArena 展示了这种方法在文本、编程、视觉及其他能力方面的商业潜力。其最初的竞技场研究发现,众包投票能够与专家偏好保持一致,同时捕捉多样化的问题。
截至 2026 年 6 月,Arena 表示其更广泛的平台已收集超过 1,000 万次用户评估。它还为模型实验室和企业建立了商业评估服务。这一增长为 Design Arena 的战略提供了清晰的先例。
因此,主要竞争并非 Design Arena 对阵某一家特定创业公司,而是实时人类偏好与固定自动化测量之间的竞争。LMArena 是重要的背景案例,因为它展示了这种替代方案如何获得影响力和收入。
Design Arena 围绕创意质量进一步聚焦竞技场模式。其用户比较网站、图像、界面、幻灯片、视频、音频及其他感知体验重要的作品。该公司将自己描述为面向 AI 生成设计的众包基准测试。
这种专业化带来了优势。广泛的聊天机器人投票可能将正确性、风格、速度和帮助性混合为一个决定。聚焦设计的锦标赛则能围绕更清晰的创意领域组织提示词和结果。
它也为模型开发者提供了公开发布的舞台。当新模型进入平台时,其表现会与既有系统并列展示。强势排名可创造营销价值,而糟糕的结果则可能暴露发布宣称与用户偏好之间的差距。
这种可见性改变了激励机制。实验室历来围绕推理、编程、安全和对话行为优化文本系统。如今,多模态模型能够生成界面、图像、演示文稿、广告和可编辑的创意资产。
当这些输出进入真实工作流时,视觉质量就成为产品性能的一部分。一个对比度难以辨认的生成式仪表盘,并不会因为代码正确而变得可用。信息层级薄弱的演示文稿,依然会浪费读者的时间。
市场压力同样延伸至 AI 应用公司。设计工具常会将请求路由至来自 OpenAI、Google、Anthropic、Black Forest Labs 及其他提供商的基础模型。它们的产品质量,部分取决于能否为每项任务选择合适的模型。
实时偏好数据集可以为这种路由提供依据。一个模型或许适合界面生成,另一个适合图像编辑,第三个则适合创建幻灯片。评估可以成为生产决策,而不只是偶尔开展的研究工作。
创意专业人士仍应谨慎解读这些排名。通用排行榜无法了解某个具体品牌系统、无障碍政策、受众或营销目标。它衡量的是平台条件下的总体偏好。
团队需要在公开信号之外建立自己的评估体系。他们可以收集有代表性的提示词,定义失败标准,并与真实用户比较结果。可搜索的用户研究工作流有助于保留这些判断背后的语境。
这种语境至关重要,因为审美并不具有普适性。克制的金融界面与富有表现力的音乐海报,追求的是不同目标。把它们的投票汇总为单一的“更好”概念,会抹去从业者所需的信息。
Design Arena 的价值将取决于它能否保留这些差异。类别级结果、提示词分布、置信区间和版本历史,比一个简单的胜者徽章更重要。
530 万用户无法证明什么
规模增强了 Design Arena 信号的力量,但并不会自动使该信号具有代表性、独立性,或适合用于模型训练。
第一个不确定性在于谁在投票。该平台称用户来自 190 多个国家,这表明其覆盖范围广泛。但地理信息本身无法揭示年龄、职业、设计经验、语言、设备、无障碍需求或文化背景。
自我选择的受众,可能不同于未来会使用这些 AI 系统的人群。早期采用者可能偏好新奇性、视觉密度或易于辨认的 AI 风格。专业设计师则可能更重视层级、克制、品牌一致性和可维护性。
投票也可能奖励即时吸引力,而非持续可用性。一个戏剧化的界面可能在快速比较中胜出,却在较长任务中表现不佳。漂亮的输出可能存在无障碍对比度不足、导航混乱,或代码难以维护等问题。
竞技场形式通过隐藏模型身份来减少品牌偏见,但匿名并不完美。有经验的用户有时能识别出模型的典型措辞、组件选择、图像风格或反复出现的错误。
研究人员也发现了成对视觉评估中的效率和噪声问题。经同行评审的 K-Sort Arena 论文指出,传统竞技场比较需要大量投票,且仍容易受到噪声偏好的影响。
主动采样能提高效率,但它也带来了另一项要求:配对机制必须透明。如果平台有策略地选择比较对象,研究人员就需要获得足够信息,以理解这些选择如何影响曝光度和排名。
模型访问权限带来另一种风险。评估平台可能获得预发布系统、特殊端点,或普通开发者无法使用的配置。这些安排可以改善测试,但也可能导致结果难以复现。
更广泛的竞技场市场已经面临有关优先访问权和基准优化的质疑。这些争议并不能证明 Design Arena 存在不当行为,但它们说明,随着排行榜名次获得商业价值,治理机制必须成熟起来。
Arcada 的条款提出了另一个重要问题。该公司的服务条款授予其广泛权利,可使用、修改、商业化和再许可用户内容,包括将其用于训练或改进机器学习系统。
这些条款赋予公司建立数据业务的灵活性。但对于输入原创提示词、专有创意或工作相关材料的用户而言,也引发了实际问题。人们或许并不明白,一次有趣的比较可能会为商业数据集作出贡献。
企业客户将需要更强的边界。私有模型评估可能包含尚未发布的产品设计、内部品牌资产或机密提示词。Arcada 必须证明公共与私有数据如何保持隔离。
该公司还需要防范协同投票。一旦排名影响模型发布,供应商和粉丝社群就有动机操纵它们。身份验证、异常检测、速率控制、审计轨迹和透明的排除规则,都会成为产品的一部分。
这些限制并不会使人类偏好失去价值。它们界定了结果的含义。一个 Design Arena 分数估计的是:在特定时期内,其参与用户通过其界面,针对其抽样提示词所作出的选择。
这比“客观设计质量”更狭窄,但仍然很有价值。许多传统基准同样只衡量一个有限样本。负责任的做法是公开这些边界,避免将一个有用信号包装成普遍结论。
这正是 TechCrunch 设计报道与更深层矛盾交汇之处。投资者希望获得可辩护的数据资产。研究人员和用户则受益于开放的方法、明确的同意机制和可复现的结果。Arcada 必须在不让其基准变得不透明的前提下创造商业价值。
如果客户认为名次取决于私下安排,排行榜可能迅速失去信任。如果参与过程让人感觉被榨取,它也可能失去用户。Design Arena 需要这两类群体,因为实验室提供模型,而用户提供判断。
下一阶段将需要证据证明,该平台能够维持这种平衡。规模吸引了融资。治理将决定这种规模能否成为值得信赖的基础设施。
只有变得具体,审美才有用
当 Design Arena 能解释模型为何获胜,以及其看似出色的审美会在何处失效时,它才最具价值。
总体偏好分数很容易传播,但要把该分数转化为工程决策却困难得多。实验室需要有关字体排印、层级、布局、提示词忠实度、无障碍性、原创性和交互设计的诊断信息。
近期研究说明了这一差距。TASTE 数据集要求专业设计师从九项标准评估 AI 生成的平面设计,而不只是选出一个总体胜者。
其作者报告称,没有任何经过测试的预训练评判模型与五位设计师多数意见的宏观一致性超过 0.55。一个专门基于该数据集训练的小型模型达到 0.611,而报告的单评审者上限为 0.741。
这些结果不应被视为对 Design Arena 的直接审计。它们支持了一个更广泛的观点:审美评估包含多个维度,而通用自动评判模型仍难以复现专家共识。
Design Arena 可以收集远多于小型专业研究的自然使用数据。研究则可以提供更丰富的标签和受控的方法论。最强的评估系统会结合这些优势,而不是把大众与专家视为彼此替代的选择。
以 AI 生成的落地页为例。普通投票者可能更偏好色彩更鲜明的设计。设计师则可能注意到间距不一致、焦点状态薄弱、移动端表现不佳,以及行动号召与装饰元素相互争夺注意力。
两种判断都包含信息。普通用户的选择可以预测即时的消费者吸引力。专业评审则识别影响部署的问题。成熟的基准应保留这两类信号,并揭示它们何时存在分歧。
同样的原则适用于不同创意类别。演示幻灯片需要叙事结构和易读性。数据可视化要求准确编码。产品界面必须支持任务完成。图像可能需要提示词忠实度、解剖结构一致性和品牌适配性。
因此,“模型审美”只是一种简写。模型并不像人类一样体验偏好。它们学习统计模式,从而能够生成在特定条件下更可能被人类选择的输出。
这种区别对后训练十分重要。如果开发者围绕单一、宽泛的流行度信号进行优化,模型可能会趋向安全、熟悉的美学。输出或许变得精致,却也更加重复,最终生成评论者所谓 AI slop 的又一种通用素材。
多元评估应当抵制这种趋同。实验室需要来自不同文化、职业、无障碍语境和审美传统的反馈。它们也需要对原创性的奖励,同时不能以此为糟糕的可用性开脱。
TechCrunch 的设计叙事最终取决于 Arcada 能否让其数据具有诊断价值。排行榜能够带来关注,但详细的评估产品才能为实验室创造持久价值。
Arcada 可以通过公开类别定义、不确定性指标、采样变化和版本历史来巩固其地位。它还可以分别呈现专家小组与更广泛公众偏好的视图。
它也可以测试排行榜的提升是否能够预测其他场景下更好的结果。在网站设计中排名上升的模型,应当在受控可用性测试、生产接受率或专家评审中表现更好。
缺乏这种验证,竞技场就有沦为人气竞赛的风险。有了验证,该平台便能将一次快速投票与可衡量的产品改进联系起来。
融资给了 Arcada 时间来搭建这座桥梁。它面临的挑战不是证明人们拥有审美,而是展示如何负责任地收集人们的选择,并将其转化为改善模型的指导。
三个信号将决定下一步走向
下一阶段将由数据质量、实验室采用情况,以及排行榜提升能否迁移到真实创意工作中的证据来评判。
第一个信号是披露更多方法论细节。应关注人口统计报告、反操纵政策、置信区间、提示词分布分析,以及关于私有评估与公开投票差异的说明。
公布这些细节将加强“530 万用户能够产生可靠证据”的主张。有限披露则会削弱这一主张,尤其是在排行榜位置开始带来财务和营销影响之际。
第二个信号是前沿实验室的重复使用。一次性的基准提交可以支持产品发布。持续的私有评估、版本比较,以及对后训练变更的记录,将表明实验室认为这一信号在运营上具有实用价值。
最有说服力的证据,是将反馈与模型修订联系起来。如果某个提供商发现字体排印或界面层级较弱,调整训练流程,并在公开测试和受控测试中均获得改进,Arcada 的机制就会更具可信度。
第三个信号是竞技场之外的迁移效果。Design Arena 需要证明,排名更高的系统在真实项目中能为设计师、开发者和终端用户带来更好的表现。受控可用性研究和专家评审将使这种联系变得可见。
如果无法实现迁移,这将表明该排行榜主要衡量的是单一界面内的即时偏好。成功迁移则将支持 Arcada 的论点:众包品味能够指导模型开发。
竞争将促使每项测试更加严谨。Arena 已表明,人类评估可以发展为一项规模可观的 AI 业务。研究项目和专业数据集正在开发衡量创意质量的替代方法。
模型提供商也将构建内部偏好系统。Design Arena 必须提供独立性、覆盖范围、类别深度或速度等优势,而这些是实验室依靠自身评估者难以轻易复制的。
这笔 790 万美元融资买来的是机会,而非权威。Design Arena 已经证明,数百万人愿意参与模型比较。它现在必须证明,这种参与能够产生值得信赖的决策。
对开发者和企业买家而言,务实的做法是将该排行榜视为多个信号之一。应在具有代表性的工作中比较模型,保留提示词和决策记录,并记下用户偏好每个结果的原因。
对知识工作者而言,更大的启示是,AI 质量日益取决于评估设计。获得最佳反馈的模型,并不总是静态评分最高的模型。
如果 Arcada 能让人类判断在模型发布间隔期内变得具体、可审计且有用,这则 techcrunch 设计报道将变得更加重要。关注其方法论、实验室的行为以及现实世界中的迁移表现。这三个信号将揭示 Design Arena 衡量的是品味,还是仅仅在给注意力排序。


