top of page

Qdrant FineWeb 10B 基准测试直面 AI 搜索的小数据难题

3小时前
讀畢需時 12 分鐘

Qdrant 发布了一个包含 100 亿文档的搜索数据集,直面 AI 基础设施中的一个根本矛盾:生产系统规模庞大,而许多被广泛采用的测试仍相对较小。Qdrant FineWeb 10B 基准测试为研究人员提供了一个公开语料库,其中包含稠密向量、稀疏向量、过滤查询以及精确的最近邻结果。其规模让那些惯常的取巧手段更难掩藏。

此次发布并未宣称 Qdrant 是最快的向量数据库。它为在严苛条件下测试 Qdrant、Milvus、Elasticsearch 及其他检索系统建立了共享基础设施。这一区别至关重要,因为厂商性能图表往往基于不同的数据集、硬件、召回率目标、过滤条件和客户端设置。

因此,核心较量并非 Qdrant 与某个特定竞争对手之间的竞争,而是开放、可复现的测量与方便但片面的基准测试说法之间的竞争。Qdrant 让这场较量变得更严肃,但尚未解答生产搜索质量的所有问题。

Qdrant FineWeb 10B 基准测试改变了起点

Qdrant 将公开基准测试的讨论从数百万向量推进到了逾 100 亿份真实网页文档。

Qdrant-FineWeb-10B 于 2026 年 9 月 1 日发布,数据来自 FineWeb——一个基于 Common Crawl 整理而成的语料库。公开的数据集卡片列出了 10,074,324,060 条记录。

每条记录均包含原始文档载荷和元数据,还包括由 Alibaba 的 gte-multilingual-base 模型生成的一个稠密嵌入和一个稀疏嵌入。稠密嵌入将文档表示为固定长度的数值向量,而稀疏嵌入则在更大的词汇表中记录带权重的词项。

稠密表示具有 768 个维度,其向量已针对余弦相似度进行归一化;余弦相似度用于衡量向量方向上的接近程度。稀疏表示使用带权重的 token 标识符和点积评分。

这一统一语料库支持对稠密、稀疏、过滤和混合检索进行比较。混合检索将语义匹配与基于词项的信号结合,帮助系统同时处理宽泛语义以及精确名称或短语。

此次发布还提供了分为四组的 119,953 条查询,其中包括 100,000 条稠密查询、10,000 条稀疏查询、4,953 条文本过滤稠密查询和 5,000 条结构化过滤稠密查询。这些查询来自 Microsoft 的 MS MARCO 数据集。

对于每条查询,Qdrant 都提供精确的前 1,000 个最近结果。精确结果构成真值,即用于衡量更快的近似索引是否遗漏相关近邻的参考答案。

生成这一参考集合需要对整个语料库进行穷举搜索。Qdrant 表示,这项工作在基于 GPU 的基础设施上涉及超过一千万亿次距离计算。这一点很重要,因为近似最近邻系统会刻意避免将每个查询与每个已存储向量逐一比较。

近似方法让搜索变得可行,但也会引入遗漏。没有精确真值,开发者便无法可靠地计算召回率。召回率衡量近似系统检索到多少真实的最近结果。

因此,Qdrant FineWeb 10B 基准测试改变的不只是可用测试材料的规模。团队可以针对同一套公开参考结果,考察写入速度、索引构建、内存使用、延迟、吞吐量、过滤和召回率。

Qdrant 还发布了两个相关数据集。PubMed-Multi-Vector 在一个医学语料库上提供稠密、稀疏和 ColBERT 风格的表示。Coyo-Vector-Embeddings 则借助文本和图像说明配对,面向多模态检索。

这些补充承认,现代搜索已不再局限于每份文档一个向量。一些系统会在同一请求中结合多种表示、元数据条件、重排序和图像。

在此次发布之前,Qdrant 自己的公开比较页面使用的数据集规模约为 100 万至 1,000 万个向量。该公司如今认为,这些规模无法暴露分布式生产系统面临的所有问题。

这一观点也有历史研究支持。Billion-Scale ANN study指出,早期许多实证研究集中于约 100 万个数据点的数据集。其作者建立了更广泛的评估框架,因为搜索、推荐和排序系统当时已在十亿级规模运行。

Qdrant 正借助源自网页的数据、更深的结果集、多种检索模式和可复用基础设施延续这一方向。这一变化提高了所有大规模 AI 搜索主张所面临的预期标准。

为什么小型基准测试会造成重大误解

基准测试可以给出精确数字,却回答了错误的生产问题。

向量搜索基准测试对测试设计异常敏感。若不知道实际达到的召回率,查询速率意义有限。若不知道结果深度、过滤选择性、并发度、索引配置和可用内存,也无法解读延迟。

一个召回率为 90% 的系统,可能比召回率为 99% 的系统处理更多查询。但这并不自动说明前者更好。缺失的结果可能包含回答棘手客户问题所需的证据。

当应用为重排序器检索数百或数千个候选项时,这种差异会更加重要。重排序器是一种第二阶段模型,会利用更细致的相关性信号对更大的候选集重新排序。它无法找回初始检索阶段从未返回的文档。

小型数据集还可能轻松装入单台机器的内存中。到了 100 亿条记录的规模,团队必须面对分区、路由、复制、磁盘访问、网络流量和不均衡的查询负载。这些是系统问题,而不是孤立的算法问题。

索引构建是另一处压力点。一个在载入 100 万个向量后看似颇具吸引力的索引,在更大规模下可能需要不切实际的构建时间或临时存储空间。更新和恢复也可能进一步改变其运营价值。

过滤同样会带来复杂性。许多企业搜索会将语义相似性与租户身份、日期、语言、访问权限或产品类别等条件相结合。快速的未过滤结果并不能说明引擎在过滤器排除大部分候选项时的表现。

Qdrant-FineWeb-10B 同时包含基于文本和结构化的过滤器。其结构化查询可应用数值、日期和集合条件。这让研究人员能够测试:当符合条件的子集不断缩小时,索引能否保持准确性和延迟表现。

该数据集还保留了网页元数据。真实网页文本包含重复段落、异常分布、长尾主题和近重复内容。随机生成的向量很少能复现这些特征。

这种真实性对检索增强生成,即 RAG,尤为重要。RAG 系统会在语言模型生成答案前检索文档。失败可能源于检索能力不足、分块不佳、权限错误、内容过时或生成错误。

数据库基准测试只隔离了这条链路的一部分。不过,它仍能揭示检索层是否能在受控条件下提供正确的候选项。构建可搜索知识库的团队,既需要基础设施测量,也需要基于其实际文档的评估。

Qdrant 的发布促使向量数据库厂商在性能主张中披露更多背景信息。买方应期待看到匹配的召回率、明确的硬件定义、完整配置、尾部延迟、索引时间和资源消耗。

尾部延迟衡量延迟分布末端较慢的请求。通常称为 p99 的第 99 百分位数,表示 99% 的请求都能在该阈值内完成。当用户期待稳定响应时,它往往比平均值更重要。

该基准测试也对内部工程团队提出挑战。许多组织使用小样本评估数据库,因为在完整规模下生成嵌入和精确答案成本高昂。这些测试可能会漏掉由分片或内存压力造成的非线性变化。

公开的大规模数据降低了部分门槛。它并未让 100 亿向量实验变得廉价,却免除了独立创建完整语料库和参考集合的需要。

Vultr 表示,其提供了用于生成嵌入的计算和对象存储。根据其infrastructure account,Qdrant 处理了约 500,000 个文件,并在约五天内生成约 25 TB 的嵌入数据。

这些数字描述的是数据集创建过程,而非让每个数据库在该数据集上运行的成本或速度。这一区分避免此次发布沦为又一项缺乏支撑的性能主张。

Supernova 将数据集转化为可复现性测试

更具影响力的发布或许是 Supernova,因为静态数据集无法标准化数据库的加载、查询和测量方式。

Qdrant 将 Supernova 作为开源框架发布,涵盖向量搜索基准测试的四个阶段:生成嵌入、计算精确真值、加载目标数据库以及运行搜索负载。

该框架将这些工作拆分为专门模块。nova-embed 负责跨不同模型和存储系统生成嵌入,并在不依赖中央协调数据库的情况下,将工作划分给独立工作节点。

nova-bf 执行暴力式真值计算。暴力法会将查询与每一个符合条件的向量进行比较,从而生成精确参考集合,而非近似结果。Qdrant 表示,该模块会从远程存储流式读取分区,避免将完整语料库放入 GPU 内存。

该工具能够处理稠密、稀疏和多向量表示。它还可以先在 CPU 上评估过滤器,再将符合条件的数据传输至 GPU。当过滤器排除语料库的大部分内容时,这一设计旨在减少不必要的数据移动。

nova-load 负责并行写入数据库。这一阶段衡量系统接收数据集的速度,并暴露纯查询基准测试忽略的运营限制。

nova-storm 生成并发搜索流量。根据 Qdrant 的发布详情,它记录查询吞吐量、多项延迟百分位数、构建时间以及相对于精确结果的召回率。

独立控制器 nova-dist 使用 SkyPilot 进行集群配置和作业调度。Qdrant 表示,同一份基于 YAML 的配置可以面向主要云平台、Kubernetes 以及基于 Slurm 的高性能计算集群。

这一设计针对的是此次发布的主要对手:不透明的基准测试主张。如果外部人士无法检查工作负载或重新运行实验,公开图表的价值便十分有限。公开数据和配置驱动的工具让更多假设得以暴露。

这种方法也允许竞争厂商质疑 Qdrant 的选择。Milvus 或 Elasticsearch 的工程师可以为自己的系统提出更优配置。研究人员也可以更改硬件、并发度、查询组合和召回率目标,而无需重新构建真值数据。

这种开放性并不能消除调优偏见。Qdrant 自然比竞争对手更了解自家数据库。其现有基准测试文档明确承认,公司能够更有效地配置 Qdrant,也可能忽略其他系统的重要优化手段。

可复现性为这种利益冲突提供了应对机制,而非中立性的证明。当代码、数据和设置公开后,其他维护者可以发现薄弱配置并提交修改。

独立评估仍然不可或缺。TechTarget 在 9 月的一项分析中援引多位外部数据专家的观点,他们认为该数据集是一项可信的贡献。分析师 William McKnight 表示,它将真实的网页文本分布与精确结果结合起来,看起来很适合用于密集、稀疏和带过滤条件的测试。

BARC 的另一位分析师 Kevin Petrie 警告称,组织仍需基于自身工作负载进行基准测试。这一限定界定了该发布的实际价值:共享基准支持横向比较,而针对特定工作负载的测试则为采购决策提供依据。

Supernova 可以帮助衔接这两种用途,因为团队能够将该框架应用于其他语料库。他们可以保留测量管线,同时替换为私有文档、查询、过滤条件和嵌入模型。

因此,Qdrant 向量基准测试最好被理解为测试基础设施。它提供了一个公开起点和可重复的流程,但并不宣布某个系统是普适的赢家。

千亿级规模仍无法证明什么

规模修正了向量搜索基准测试中的一个弱点,但它无法代表 AI 搜索产品中所有的失效来源。

首先,FineWeb 是覆盖广泛的网页文本。企业语料库则可能包含代码、合同、医疗记录、支持工单、产品目录、会议转录稿或简短的内部消息。这些文档具有不同的长度、词汇、重复模式和访问规则。

其次,该基准测试的核心数据集只使用了一种嵌入模型。嵌入模型将文本映射为向量,其行为决定了被搜索的邻域。更换模型可能改变向量维度、稀疏性、聚类特征和检索难度。

Qdrant FineWeb 10B 基准测试对密集和稀疏表示均使用 gte-multilingual-base。这提供了一致性,但在该模型下的性能并不保证在另一模型下拥有相同排名。

第三,精确最近邻并不自动等同于最有用的文档。真值数据只能回答近似系统是否复现了嵌入模型最接近的匹配项,不能判定这些匹配是否满足用户的信息需求。

这种区别将 ANN 召回率与检索相关性区分开来。ANN 召回率关注索引是否找到了精确计算会找到的向量;相关性则关注这些文档是否确实有助于回答查询。

一个系统可能实现接近完美的 ANN 召回率,却采用了无法理解专业领域的嵌入模型。它也可能返回技术上相似、但已过期、未经授权或内容冗余的文档。

Qdrant 自己的相关性指南建议使用将查询与预期文档配对的标注集。对于部署 RAG 或语义搜索的团队而言,这一评估层仍然至关重要。

第四,数据集卡片指出了一个数值可复现性问题。已发布的真值数据使用 bfloat16 GPU 算术计算,而再生成脚本会生成 float32 嵌入。微小的数值差异可能改变并列结果的排序,或影响接近前 1,000 名边界的项目。

Qdrant 披露了这一差异,并表示正在修复。该问题并未抹去数据集的价值,但它表明公开工件需要接受独立检查。

第五,访问门槛构成了实际障碍。Hugging Face 页面列出的文件总量达到数十 TB。许多团队可以快速下载较小的数据集,但很少有团队能够轻松地准备、建立索引并测试这一发布版本。

最有能力运行完整基准测试的将是数据库厂商、云服务提供商、大型企业和研究机构。较小团队可能需要依赖已发布结果或抽样子集,这会重现部分信任问题。

共享的托管排行榜可以改善可访问性,但也会引入治理问题。必须有人定义硬件配置、批准参数设置、验证提交结果、更新数据库版本,并防止选择性报告。

第六,该发布并不衡量完整的应用质量。生产环境中的 AI 搜索通常包括文档解析、分块、查询改写、混合融合、重排序、缓存、授权和答案生成。任何一个环节的失效都可能主导用户体验。

这些局限性并不意味着应采用更小的基准测试,而是反对将单一的大型基准测试视为完整的采购框架。

采购方应结合三层证据。公开测试可以揭示广泛的扩展行为;私有工作负载测试可以复现本地的数据分布和过滤条件;端到端评估则可以衡量用户是否获得正确且可追溯的答案。

这一标准要求很高,但 AI 搜索越来越多地支撑着那些漏掉一份文档就可能产生重大影响的决策。基准测试应让这些权衡显性化,而不是将其压缩成单一的吞吐量分数。

三个信号将显示 Qdrant 的押注是否奏效

只有当独立团队使用该发布来产出可比较的证据、发现问题并改进测试流程时,它才算成功。

第一个信号是可复现的第三方结果。研究人员和数据库厂商需要使用 Qdrant-FineWeb-10B 或可审计的子集发布完整测试结果。这些报告应包括硬件、软件版本、索引参数、导入时间、内存、召回率和 p99 延迟。

匹配的召回率将尤为重要。在不同准确率水平下比较吞吐量,可能让更快的系统显得更优,却不揭示它遗漏了什么。结果应展示多个召回率目标下的性能。

如果独立团队能够在 Qdrant、Milvus、Elasticsearch、pgvector 及其他系统上复现结果,该发布将强化开放测量的价值。若配置始终不完整或成本高得令人难以承受,其影响力将受到限制。

第二个信号是围绕数据和工具的修正活动。数据集卡片中披露的数值差异提供了一个即时测试。及时的修复、带版本的工件、校验和以及变更记录,将增强外界信心。

研究人员还应检查查询构成、重复内容、语言覆盖范围、过滤条件分布,以及最近邻任务的难度。庞大的记录数量并不保证评估足够均衡。

Supernova 的贡献历史在此也很重要。外部漏洞报告、拉取请求、后端集成和替代配置,都将表明它作为社区基础设施发挥作用。有限的外部活动则会使它更接近由厂商维护的演示项目。

第三个信号是采购方是否改变了他们向供应商提出的要求。最持久的结果不会是单一排行榜名次,而是 AI 搜索更严格的采购标准。

企业团队应要求供应商在报告延迟的同时提供精确召回率。他们应要求提供导入和索引构建指标,而不仅仅是稳态查询速度。他们还应测试选择性过滤条件和故障恢复能力。

公开基准测试结果可以缩小候选名单,但组织仍需要本地证据。例如,搜索产品目录的零售商可能关注库存过滤和高检索深度;法律团队则可能优先考虑租户隔离、引用和精确术语。

Qdrant FineWeb 10B 基准测试为这两类团队提供了更好的参考点。它展示了当有人承担在互联网规模上创建精确答案的高昂成本时,哪些内容可以被衡量。

Qdrant 也获得了战略收益。该公司能够影响采购方认为重要的指标,同时将其偏好的召回率、开放性和可复现性语言置于讨论中心。

这并不使这项工作失去价值。标准往往始于某个有利益关联的参与者投入其他人不会投入的资源。保障在于透明的治理和可信的外部复现。

竞争对手如今面临一个有益的选择:运行该工作负载并发布结果,用证据质疑其假设,或贡献替代数据集和测试。沉默会使不透明的性能声明更难辩护。

对于开发者而言,眼下的行动并不是在没有计划的情况下下载数十 TB 数据。应先确定需要回答的问题:算法召回率、数据库扩展能力、检索相关性,还是端到端应用质量。

随后,选择能够保留相关难度的最小测试。适用时使用公开真值数据,但在最终评估中保留私有查询和文档。记录复现结果所需的每一项配置。

AI 搜索基准测试不会仅凭规模得到解决。然而,规模消除了一个日益方便的借口。Qdrant FineWeb 10B 基准测试如今为行业提供了一种公开方式,用于检验过去依赖私有数据和私有基础设施的主张。

未来几个月将揭示,社区会将其视为共享实验室,还是另一件厂商工件。开发者和采购方应关注复现、修正和竞争性提交结果,然后要求他们评估的每一家 AI 搜索提供商都达到同样的透明度。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page