Geekbench 7 以真实工作负载和 CUDA 全面革新 CPU 与 GPU 测试
- Olivia Johnson

- 3小时前
- 讀畢需時 13 分鐘
Geekbench 7 于 7 月 23 日发布,带来了首个 CUDA 后端、重新设计的多核评分机制,以及围绕现代媒体与 AI 任务构建的工作负载。对于关注 nvidia tom 基准测试话题的读者而言,关键变化并不是又一轮更高分数,而是 Primate Labs 改变了这些分数所代表的含义。
此次更新测试了 AV1 屏幕共享、Opus 音频压缩、由 Whisper 驱动的字幕生成、游戏物理、图像超分辨率和背景虚化。其 GPU 测试套件现可通过 CUDA、OpenCL、Vulkan 或 Metal 运行。这让 Nvidia 硬件首次在 Geekbench 中拥有原生 CUDA 路径。
更大的争议在于真实性。合成基准测试需要一致的工作负载来支持横向比较,但真实软件很少会同等地利用每一个处理器核心。Geekbench 7 通过仅在所模拟的应用程序确实如此运行时采用多线程,来解决这一问题。结果应当更具代表性,但也打破了与熟悉的 Geekbench 6 排名之间的连续性。
Geekbench 7 重构了每个分数背后的工作负载
Geekbench 7 通过以当代电脑和手机上可识别的实际活动替换若干抽象工作负载,改变了基准测试本身。
Primate Labs 面向 Android、iOS、Linux、macOS 和 Windows 发布了该基准测试。该公司的 Geekbench 7 changes 涵盖 CPU 测试套件、GPU 测试套件、多核方法论和输入数据集。
三项新的媒体工作负载构成了 CPU 更新的核心。其中一项使用 AV1 编码屏幕共享视频,AV1 是一种专为高效压缩而设计的现代视频编解码器。另一项使用 Opus 压缩音乐和语音,这种编解码器常用于交互式互联网音频。
第三项工作负载在生成 Whisper 字幕的同时播放音频和视频,Whisper 是一种语音识别模型。这种组合之所以重要,是因为实时字幕会同时产生解码、音频处理和推理负载。它模拟的是完整的用户活动,而非孤立的数学循环。
Geekbench 7 还新增了一项基于 Jolt Physics 引擎的游戏物理测试。Jolt 负责商业游戏中的碰撞检测和物理模拟。这项工作负载为 CPU 测试套件带来了一个当代交互式计算场景,同时并未把 Geekbench 变成帧率测试。
与照片相关的测试也获得了更广泛的调整。Photo Editor 工作负载采用了更丰富的编辑操作组合,而 Photo Library 现在会导入 JPEG XL 和 DNG 文件。JPEG XL 是一种现代图像格式,而 DNG 保存的相机数据比处理后的图像拥有更大的编辑空间。
Primate Labs 还扩展了现有测试所处理的材料。File Compression 现在会处理源代码、目标代码和文本文档。PDF Viewer 则接收从公园地图到学术论文和技术文档的各种内容。
这些更大、更多样的输入很重要,因为小型数据集可能始终保留在处理器最快的缓存中。一旦数据超出这些缓存,内存带宽和延迟的影响就会更大。这通常能更好地反映持续应用性能。
因此,此次发布改变的不只是基准测试的任务清单。它还改变了对缓存、内存、媒体引擎、执行核心和软件框架施加的压力。当工作集扩大时,为狭窄测试优化的处理器可能会呈现不同表现。
直接结果是可比性。Geekbench 7 分数不应被视为 Geekbench 6 分数的直接延续。工作负载、数据集、基线和多核规则都已发生了过于重大的变化。
这种重置会给历史图表带来不便。但这正是其意义所在。一个保持完美连续性的基准测试,可能会逐渐不再代表人们实际运行的软件。
Nvidia Tom 搜索现在会指向原生 CUDA 测试
CUDA 支持为 Nvidia GPU 提供了更具相关性的 Geekbench 路径,但这并不意味着不同计算 API 之间的结果可以直接互换。
Geekbench 此前通过 OpenCL、Vulkan 和 Metal 提供 GPU 测试。Geekbench 7 新增了 CUDA,即 Nvidia 面向通用 GPU 计算的编程平台。CUDA 是许多专业可视化、科学计算和机器学习应用的基础。
这一变化让用户可以通过与 Nvidia 计算市场联系最紧密的软件环境测试其 GPU。相关的 CUDA coverage 也让 Geekbench 更贴近用于 AI 和内容创作的工作站。
对于通过 nvidia tom 关键词找到这篇报道的读者来说,这是最明确的关联。Nvidia 长期受益于庞大的 CUDA 软件生态。如今,Geekbench 可以通过这一路原生途径衡量其硬件,而不再仅依赖更具可移植性的接口。
不过,API 并不只是覆盖在相同执行过程之上的标签。CUDA、OpenCL、Vulkan 和 Metal 使用不同的驱动程序、编译器、内存模型和优化路径。这些层面都会影响工作负载记录到的性能。
Geekbench 在处理这个问题上已有经验。其此前的 GPU 框架采用名为 Thorium 的抽象层,让通用工作负载能够面向不同计算 API。文档化的 Geekbench 6 internals 描述了针对不同 API 的实现,旨在避免让某个框架处于不利地位。
Geekbench 7 仍无法消除所有软件差异。CUDA 结果显示的是工作负载通过 CUDA 运行时的表现,OpenCL 结果则显示其通过 OpenCL 运行时的表现。分数依然有价值,但所选后端成为了结果含义的一部分。
在比较不同厂商时,这一区别尤为重要。Apple 的 Metal 路径、Nvidia 的 CUDA 路径,以及另一块 GPU 上的 Vulkan 路径,并不共享完全相同的软件栈。基准测试控制高层工作负载,而各软件栈决定这些工作如何抵达硬件。
因此,CUDA 支持会从两个方向施加压力。Nvidia 获得了一条反映其最强软件优势的一流路径。竞争 GPU 厂商则要面对与一个工具成熟、优化广泛的生态系统进行比较的局面。
Nvidia 也将面临更严格的审视。原生 CUDA 选项消除了跨平台结果不佳或不稳定的一种常见解释。评测者可以在同一张显卡上比较 CUDA、OpenCL 或 Vulkan,并观察后端会在多大程度上改变结果。
这些比较仍应保持边界。一项强劲的综合结果,并不能自动预测其在 Blender、本地语言模型或科学求解器中的性能。每种应用使用的内核、数据类型、内存模式和库都不同。
新后端最好的早期用途是诊断。在一张 Nvidia GPU 上通过多个 API 运行相同的受支持工作负载。较大差距可能反映驱动成熟度、编译器行为或后端特定优化,而非根本性的硬件差异。
多核分数不再假装每个应用都能线性扩展
Geekbench 7 做出了一项站得住脚的取舍:它牺牲了简单的核心扩展叙事,以模拟应用程序实际分配工作的方式。
传统多核基准测试通常会让每项工作负载跨所有可用线程运行。这种方法容易理解,但也会奖励所模拟应用可能永远不会使用的并行能力。
Geekbench 7 改变了这种行为。只有当相应的真实应用使用了有意义的并行化时,工作负载才会以多线程形式进入多核测试套件。HTML5 Browser 测试被排除在外,因为浏览器工作通常是单线程或轻度多线程。
这一重新设计改变了多核分数的解读方式。它不再只问所有核心完成一组均匀并行任务的速度有多快,而是考察整个处理器如何处理一系列具有现实扩展限制的混合任务。
这种差异对核心数量众多的处理器影响最为明显。一颗芯片可能在渲染或压缩中占据优势,但在网页执行中几乎无法从额外核心获益。将这些行为结合起来,会得到一个不那么亮眼的数字,却能更平衡地模拟通用使用场景。
混合架构处理器又增加了一层复杂性。现代台式机和笔记本芯片经常将更快的性能核心与更小的能效核心结合。它们的调度器决定线程在哪些核心上运行,而功耗限制决定峰值频率能够持续多久。
一套更贴近现实的多核测试可能会暴露这些协调成本。它也可能对操作系统调度、后台活动和固件更为敏感。当电源设置或散热条件不同时,两台物理配置完全相同的机器也可能出现差异。
Primate Labs 表示,新方法能够更准确地衡量真实工作。这是一个合理的设计目标,而非已经独立确立的结论。在评测者能够量化这种改进之前,该方法仍需要在不同处理器家族上进行公开测试。
现实的多核行为也不存在单一定义。编译大型项目的软件开发者,对处理器施加的压力不同于参加视频会议的人。创作者导出视频时会呈现另一种模式,而游戏玩家除了吞吐量之外也关心延迟。
综合基准测试必须在这些活动之间选择权重。即便每一项单独的工作负载都来自真实软件,这些权重依然包含编辑判断。分数仍然是一种模型,而不是对计算机速度的普适衡量。
不过,旧有替代方案存在一个明显弱点。将每项任务分布到每个线程上,可能描述的是理论扩展能力,而非观察到的应用行为。它可能偏向核心数量,却无法展示这些核心何时处于闲置状态。
新方法给围绕单一大规模多核数字的芯片营销带来了压力。AMD、Apple、Intel、Qualcomm 和设备制造商现在都需要新的 Geekbench 7 结果。他们无法安全地沿用 Geekbench 6 所建立的叙事。
评测者也需要发布工作负载层面的背景信息。综合分数可以概括一台设备,但无法解释优势究竟来自 AV1 编码、编译、物理计算、图像处理,还是其他任务。
这正是此次革新的核心机制。Geekbench 正在让软件模型更加严格,即使这会令标题中的分数更难解释。
AI 和媒体工作负载超越了通用 GPU 分数
更新后的 GPU 测试套件检验可见的产品功能,将机器学习与图像处理、视频工作和物理模拟并列。
Geekbench 7 的 GPU 基准测试新增了实时滤镜的人脸跟踪、机器学习图像超分辨率和视频背景虚化。这些任务对应着用户已经熟悉的社交媒体、会议和内容创作功能。
图像超分辨率会在提高分辨率的同时估算缺失细节。背景虚化会在应用效果前将人物与周围场景分离。人脸跟踪会追踪面部位置,使滤镜能够在移动过程中保持对齐。
该测试套件还引入了 RAW 图像处理、查找表调色、路径追踪和流体模拟。查找表,即 LUT,会将输入颜色映射为输出颜色。路径追踪通过模拟光线路径来生成具有物理依据的图像。
这种组合将 GPU 的叙事拓展到了游戏之外。现代 GPU 可加速媒体处理流程、本地推理、可视化和交互式特效。这些活动对同一硬件的使用方式,与光栅化游戏并不相同。
此次更新不应被视为 Geekbench AI 的全面替代。后者是另一套独立基准测试,通过多种推理框架评估 CPU、GPU、神经处理单元和数字信号处理器。
其已发布的AI 工作负载设计涵盖计算机视觉和语言任务。它报告单精度、半精度和量化得分,随后再根据准确度测量结果调整工作负载成绩。
Geekbench 7 的主 GPU 测试套件提出的是另一个问题:它将机器学习作为更广泛计算工作负载的一部分进行评估。这种方式反映了推理嵌入大型媒体处理流程的应用场景。
Whisper 字幕生成测试也从 CPU 角度说明了同样的思路。用户不会将语音识别体验为一次孤立的模型调用,而是会同时经历视频解码、音频处理、转录和字幕显示。
这种以应用为中心的框架对购买者很有价值。为视频通话选择笔记本电脑,需要的不只是原始矩阵吞吐量;它还需要在有限的散热空间内,在解码媒体并应用 AI 特效时保持稳定性能。
开发者仍应将结果视为起点。所包含的模型和输入尺寸无法代表所有生产系统。生成式图像模型、大语言模型、推荐系统和科学计算网络对硬件提出的要求截然不同。
精度同样重要。一些加速器擅长使用紧凑数值格式的量化运算,另一些则在更高精度下表现更佳。除非评测者公布子测试结果,否则单一 GPU 综合分数可能掩盖这种差异。
nvidia tom 搜索语境使这一点尤其相关。Nvidia 将 GPU 推向游戏、创作、AI 和专业计算等多个领域。Geekbench 7 涉及了每个类别,但并未复现其中任何一个类别的完整生产工作流程。
这条边界保护了该基准测试的跨平台定位。若测试过度依赖某一家厂商的库,其可移植性便会降低;若与真实应用抽象得过于遥远,又会失去相关性。
Geekbench 7 试图处于两者之间。它采用易于识别的任务、常见算法和多种 API。这种方法能否成功,将取决于独立测试结果是否保持一致,以及能否解释真实应用中的性能差异。
新分数仍无法证明什么
更贴近现实的基准测试依然是一种受控近似,早期 Geekbench 7 排名需要的背景信息远不止一张图表。
第一个不确定性是代际不连续性。新的工作负载和计分规则意味着,单凭 Geekbench 7 分数无法显示相较 Geekbench 6 的提升。任何混合两个版本的图表,都可能呈现虚假的性能趋势。
第二个不确定性是平台等效性。跨平台基准测试涉及不同的编译器、驱动程序、操作系统和 API。Geekbench 标准化了目标任务,但无法让这些软件层完全一致。
CUDA 并非消除了这一问题,反而使其更加突出。原生 Nvidia 路径可以更好地代表 CUDA 应用,但也可能产生受 Nvidia 编译器和驱动投入影响的分数,而这本身就是该平台价值的一部分。
因此,比较需要精确标注。评测者应说明 Geekbench 版本、操作系统、后端、性能模式、内存配置和散热状态。笔记本结果尤其需要谨慎,因为厂商设定的功耗和散热策略各不相同。
第三个不确定性涉及工作负载权重。综合分数通过数学聚合将不同测试压缩成一个数字。这让排名易于阅读,却掩盖了究竟哪些活动推动了结果。
第四个问题是持续时间。短工作负载可能突出爆发性能,而持续运行的应用会遭遇温度和功耗限制。早期 Geekbench 文档描述了工作负载之间的暂停,以减少散热状态对排序的影响。
这一技术有助于可重复性,但无法复现长达一小时的渲染或编译过程。关注持续输出的购买者仍需要应用测试和更长时间的压力测量。
第五个问题是优化。针对基准测试的优化并不必然不正当,因为应用程序同样会获得针对性调优。问题出现在硬件检测到某项基准测试后,改变了普通软件无法调用的行为。
独立评测者应关注 Geekbench 7 与同类应用之间异常巨大的差距,也应比较不同驱动版本下的公开提交结果。突变可能揭示有价值的优化、已修正的错误,或基准测试特定的行为。
一旦拥有足够多的提交结果,公开结果数据库将有所帮助。用户生成的结果比受控评测实验室展示了更广泛的系统范围,但也包含不一致的设置和未识别的后台进程。
早期排名会存在选择偏差。发烧友往往会率先提交新硬件、超频硬件或经过精细调校的硬件结果。随着数据库增长,常见零售配置的中位数结果将更具参考价值。
最大的风险是解读过度。Geekbench 7 无法证明某一台笔记本电脑在所有场景下都更快、某一块 GPU 最适合 AI,或某种架构拥有更高能效。
它能够为一组明确界定的任务提供可重复的证据。当这些证据与电池测试、应用基准测试、散热表现和工作负载级结果结合时,才会变得有用。
跨设备整理测试笔记的读者同样需要持久的上下文。可搜索的技术知识库可将驱动程序、固件、功耗设置和基准测试版本与每项结果一并保存。缺少这些细节,分数会失去大部分诊断价值。
修订后的方法论值得关注,因为它直面了合成测试的真实弱点。但它并未摆脱所有通用基准测试共有的局限。
三个信号将检验 Geekbench 7 是否有效
下一阶段在于验证:公开结果的稳定性、与应用的相关性以及跨 API 行为,将决定此次重新设计能否赢得信任。
第一个信号是公开数据库的形态。Geekbench 已通过其浏览器收集用户提交的 7 版结果。当常见处理器拥有足够多的提交,能够展现稳定的中位数和正常波动范围时,最有价值的证据才会出现。
观察相同硬件的结果聚集得有多紧密。狭窄的分布将支持该基准测试的可重复性;宽泛的分布则意味着它对散热、调度、内存、固件或后台软件高度敏感。
这一信号同样适用于移动设备。手机和平板电脑受到严格的散热限制,随着温度升高,重复运行可能产生不同结果。多次测试中稳定的排名将增强新分数的实际价值。
第二个信号是与应用的相关性。评测者应将 AV1、Opus、编译、照片编辑、游戏物理和 AI 相关子测试与具有代表性的软件进行比较。排名不必与每一个程序完全一致。
但它至少应解释观察到的性能中具有意义的一部分。如果 Geekbench 7 一再偏向那些在对应应用中落后的硬件,其“真实性”主张将被削弱。
子测试分析将比总体数字更重要。一款处理器可能在编译中领先、在字幕生成中落后,却仍能取得有竞争力的综合分数。只公布这一综合分数,会抹去结果背后的原因。
第三个信号是跨 API 一致性,尤其是在 Nvidia GPU 上。评测者可以在支持的情况下运行 CUDA、OpenCL 和 Vulkan,再比较工作负载层面的模式。
适度差异将表明,各后端施加了不同成本,同时大致保留了相似的硬件排名。极端或不稳定的差距则需要调查驱动程序、编译器路径和 API 特定调优。
跨越多个 Nvidia 世代的 CUDA 结果将尤其具有参考意义。成熟架构和当前架构对更新后的内核可能反应不同。驱动程序修订也可能在发布后改变局面。
与 Metal 和 Vulkan 的比较需要谨慎措辞,因为这些 API 并不相同。有价值的问题是:每个后端能否在其自身平台上产生稳定且与应用相关的结果。
这三个信号将检验本文的核心判断。稳定的公开分布将支持新方法论;与应用的强相关性将支持其真实性主张;连贯的 API 行为将支持更公平的 GPU 比较。
任何一项指标失效,都不会让整个测试套件失去效力。它只会指出综合分数需要限定说明的地方。这正是基准测试在重大版本发布后不断改进的方式。
对于关注 nvidia tom 报道的人而言,下一步最好忽略孤立的创纪录分数。应关注重复测试、明确命名的 API 后端、工作负载拆分,以及相应的应用结果。
Geekbench 7 已让其计算模型更贴近当下。现在,独立测试必须确定这一模型是否能预测人们实际执行的工作。在用其排名指导升级、采购决策或性能主张之前,请先追踪这三个信号。


