top of page

El benchmark Qdrant FineWeb 10B afronta el problema de los datos pequeños en la búsqueda con IA

hace 3 horas
14 min de lectura

Qdrant lanzó un conjunto de datos de búsqueda de 10.000 millones de documentos, enfrentando un conflicto básico de la infraestructura de IA: los sistemas de producción son enormes, mientras muchas pruebas aceptadas siguen siendo comparativamente pequeñas. El benchmark Qdrant FineWeb 10B ofrece a los investigadores un corpus público con vectores densos y dispersos, consultas filtradas y resultados exactos de vecinos más cercanos. Su escala hace más difícil ocultar los atajos habituales.

El lanzamiento no proclama a Qdrant como la base de datos vectorial más rápida. Crea infraestructura compartida para probar Qdrant, Milvus, Elasticsearch y otros sistemas de recuperación en condiciones exigentes. Esta distinción importa porque los gráficos de rendimiento de los proveedores suelen reflejar distintos conjuntos de datos, hardware, objetivos de recall, filtros y configuraciones de cliente.

Por tanto, la competencia central no es Qdrant contra un rival concreto. Es la medición abierta y reproducible frente a afirmaciones convenientes sobre benchmarks. Qdrant ha hecho esa competencia más seria, pero no ha resuelto todas las preguntas sobre la calidad de la búsqueda en producción.

El benchmark Qdrant FineWeb 10B cambia el punto de partida

Qdrant ha trasladado la conversación pública sobre benchmarks de millones de vectores a más de 10.000 millones de documentos web reales.

Lanzado el 1 de septiembre de 2026, Qdrant-FineWeb-10B se basa en FineWeb, un corpus depurado derivado de Common Crawl. La ficha pública del conjunto de datos enumera 10.074.324.060 registros.

Cada registro incluye la carga útil y los metadatos del documento original. También contiene una incrustación densa y una incrustación dispersa producidas con el modelo gte-multilingual-base de Alibaba. Una incrustación densa representa un documento como un vector numérico de longitud fija, mientras que una incrustación dispersa registra términos ponderados en un vocabulario mucho más amplio.

La representación densa tiene 768 dimensiones. Sus vectores están normalizados para la similitud del coseno, una medida de proximidad direccional entre vectores. La representación dispersa utiliza identificadores de tokens ponderados y puntuación por producto escalar.

Ese corpus común permite comparaciones entre recuperación densa, dispersa, filtrada e híbrida. La recuperación híbrida combina la coincidencia semántica con señales basadas en términos, lo que ayuda a los sistemas a manejar tanto significados amplios como nombres o frases exactos.

El lanzamiento también proporciona 119.953 consultas en cuatro grupos. Incluyen 100.000 consultas densas, 10.000 consultas dispersas, 4.953 consultas densas filtradas por texto y 5.000 consultas densas filtradas de forma estructurada. Las consultas proceden de los conjuntos de datos MS MARCO de Microsoft.

Para cada consulta, Qdrant proporciona los 1.000 resultados exactos más cercanos. Los resultados exactos conforman la verdad fundamental, es decir, la respuesta de referencia empleada para medir si un índice aproximado más rápido omitió vecinos relevantes.

Producir ese conjunto de referencia requirió una búsqueda exhaustiva en todo el corpus. Qdrant afirma que el trabajo implicó más de un cuatrillón de cálculos de distancia en infraestructura basada en GPU. Esto es importante porque los sistemas de vecinos más cercanos aproximados evitan deliberadamente comparar cada consulta con cada vector almacenado.

La aproximación hace viable la búsqueda, pero introduce omisiones. Sin una verdad fundamental exacta, los desarrolladores no pueden calcular el recall de forma fiable. El recall mide cuántos de los resultados realmente más cercanos recupera un sistema aproximado.

Por tanto, el benchmark Qdrant FineWeb 10B cambia el material de prueba disponible, no solo su tamaño. Los equipos pueden analizar la velocidad de ingestión, la construcción de índices, el uso de memoria, la latencia, el rendimiento, los filtros y el recall frente al mismo conjunto público de referencia.

Qdrant también publicó dos conjuntos de datos relacionados. PubMed-Multi-Vector incluye representaciones densas, dispersas y de estilo ColBERT sobre un corpus médico. Coyo-Vector-Embeddings se dirige a la recuperación multimodal mediante pares de texto y descripciones de imágenes.

Estas incorporaciones reconocen que la búsqueda moderna ya no se limita a un vector por documento. Algunos sistemas combinan múltiples representaciones, condiciones de metadatos, reranking e imágenes dentro de la misma solicitud.

Antes de este lanzamiento, la propia página pública de comparación de Qdrant utilizaba conjuntos de datos que iban de aproximadamente un millón a 10 millones de vectores. La empresa sostiene ahora que esas escalas no pueden revelar todos los problemas que afrontan los sistemas de producción distribuidos.

Ese argumento cuenta con respaldo histórico. El estudio Billion-Scale ANN señaló que gran parte del trabajo empírico anterior se concentraba en conjuntos de datos de aproximadamente un millón de puntos. Sus autores crearon un marco de evaluación más amplio porque los sistemas de búsqueda, recomendación y clasificación ya operaban a escala de miles de millones.

Qdrant amplía esa dirección con datos derivados de la web, conjuntos de resultados más profundos, varios modos de recuperación e infraestructura reutilizable. El cambio eleva las expectativas para cualquiera que haga afirmaciones sobre búsqueda con IA a gran escala.

Por qué los benchmarks pequeños pueden producir grandes malentendidos

Un benchmark puede informar cifras precisas mientras responde a la pregunta equivocada sobre producción.

Los benchmarks de búsqueda vectorial son especialmente sensibles al diseño de las pruebas. La tasa de consultas dice poco sin el recall alcanzado. La latencia no puede interpretarse sin conocer la profundidad de resultados, la selectividad de los filtros, la concurrencia, la configuración del índice y la memoria disponible.

Un sistema que devuelve un 90 por ciento de recall puede procesar más consultas que otro que devuelve un 99 por ciento. Eso no lo hace automáticamente mejor. Los resultados omitidos podrían contener la evidencia necesaria para responder a una pregunta difícil de un cliente.

La diferencia cobra mayor importancia cuando las aplicaciones recuperan cientos o miles de candidatos para un reranker. Un reranker es un modelo de segunda etapa que reordena un conjunto más amplio de candidatos usando señales de relevancia más detalladas. No puede recuperar un documento que la etapa inicial de recuperación nunca devolvió.

Los conjuntos de datos pequeños también pueden caber cómodamente en la memoria de una sola máquina. Con 10.000 millones de registros, los equipos deben afrontar particionamiento, enrutamiento, replicación, acceso a disco, tráfico de red y cargas de consultas desiguales. Son problemas de sistemas, no problemas aislados de algoritmos.

La construcción del índice presenta otro punto de presión. Un índice que parece atractivo tras cargar un millón de vectores puede requerir un tiempo de construcción o almacenamiento temporal impracticables a una escala mucho mayor. Las actualizaciones y la recuperación pueden cambiar aún más su valor operativo.

El filtrado introduce complicaciones similares. Muchas búsquedas empresariales combinan similitud semántica con condiciones como identidad del inquilino, fecha, idioma, derechos de acceso o categoría de producto. Un resultado rápido sin filtrar no muestra cómo se comporta el motor cuando un filtro elimina a la mayoría de los candidatos.

Qdrant-FineWeb-10B incluye filtros tanto basados en texto como estructurados. Sus consultas estructuradas pueden aplicar condiciones numéricas, de fecha y de conjuntos. Esto permite a los investigadores probar si un índice mantiene la precisión y la latencia a medida que los subconjuntos elegibles se vuelven más reducidos.

El conjunto de datos también conserva metadatos web. El texto web real contiene pasajes repetidos, distribuciones inusuales, temas de cola larga y casi duplicados. Los vectores generados aleatoriamente rara vez reproducen esas características.

Ese realismo es importante para la generación aumentada por recuperación, o RAG. Un sistema RAG recupera documentos antes de que un modelo de lenguaje construya una respuesta. Los fallos pueden provenir de una recuperación deficiente, una mala segmentación, permisos incorrectos, contenido desactualizado o errores de generación.

Un benchmark de bases de datos aísla solo una parte de esa cadena. Aun así, puede revelar si la capa de recuperación proporciona los candidatos adecuados en condiciones controladas. Los equipos que crean una base de conocimiento con búsqueda necesitan tanto mediciones de infraestructura como evaluaciones basadas en sus documentos reales.

El lanzamiento de Qdrant presiona a los proveedores de bases de datos vectoriales para que publiquen más contexto junto con sus afirmaciones de rendimiento. Los compradores deberían exigir recall comparable, hardware claramente definido, configuraciones completas, latencia de cola, tiempo de indexación y consumo de recursos.

La latencia de cola mide las solicitudes más lentas cerca del extremo de la distribución de latencia. El percentil 99, comúnmente denominado p99, indica el umbral por debajo del cual se completan el 99 por ciento de las solicitudes. A menudo importa más que un promedio cuando los usuarios esperan respuestas consistentes.

El benchmark también desafía a los equipos internos de ingeniería. Muchas organizaciones evalúan bases de datos con una muestra pequeña porque generar incrustaciones y respuestas exactas a escala completa es costoso. Esas pruebas pueden pasar por alto cambios no lineales causados por el sharding o la presión de memoria.

Los datos públicos a gran escala reducen parte de esa barrera. No hacen que un experimento de 10.000 millones de vectores sea barato, pero eliminan la necesidad de crear de forma independiente todo el corpus y el conjunto de referencia.

Vultr afirma que proporcionó la capacidad de cómputo y el almacenamiento de objetos utilizados para la generación de incrustaciones. Según su informe de infraestructura, Qdrant procesó aproximadamente 500.000 archivos y produjo cerca de 25 terabytes de datos de incrustaciones en unos cinco días.

Estas cifras describen la creación del conjunto de datos, no el coste ni la velocidad de ejecutar cada base de datos contra él. Esa distinción evita que el lanzamiento se convierta en otra afirmación de rendimiento sin respaldo.

Supernova convierte el conjunto de datos en una prueba de reproducibilidad

El lanzamiento más relevante podría ser Supernova, porque un conjunto de datos estático no puede estandarizar cómo se cargan, consultan y miden las bases de datos.

Qdrant lanzó Supernova como un marco de código abierto que cubre cuatro etapas de los benchmarks de búsqueda vectorial. Genera incrustaciones, calcula la verdad fundamental exacta, carga las bases de datos objetivo y ejecuta cargas de trabajo de búsqueda.

El marco separa estas tareas en módulos especializados. nova-embed gestiona la generación de incrustaciones entre distintos modelos y sistemas de almacenamiento. Divide el trabajo entre trabajadores independientes sin depender de una base de datos central de coordinación.

nova-bf realiza el cálculo de la verdad fundamental mediante fuerza bruta. La fuerza bruta compara las consultas con cada vector elegible y produce un conjunto de referencia exacto en lugar de una aproximación. Qdrant afirma que el módulo transmite particiones desde almacenamiento remoto para evitar colocar el corpus completo en la memoria GPU.

La herramienta puede procesar representaciones densas, dispersas y multivectoriales. También puede evaluar filtros en CPU antes de transferir los datos que cumplen los requisitos a las GPU. Este diseño intenta reducir movimientos innecesarios cuando los filtros eliminan grandes partes del corpus.

nova-load impulsa la ingestión paralela en una base de datos. Esta fase mide la rapidez con la que un sistema puede aceptar el conjunto de datos y expone restricciones operativas que los benchmarks de consultas puras ignoran.

nova-storm genera tráfico de búsqueda concurrente. Según los detalles del lanzamiento de Qdrant, registra el rendimiento de consultas, varios percentiles de latencia, los tiempos de construcción y el recall frente a los resultados exactos.

Un controlador independiente, nova-dist, utiliza SkyPilot para el aprovisionamiento de clústeres y la planificación de trabajos. Qdrant afirma que las mismas configuraciones basadas en YAML pueden dirigirse a las principales plataformas en la nube, Kubernetes y clústeres de computación de alto rendimiento basados en Slurm.

Este diseño sirve al principal adversario del lanzamiento: las afirmaciones opacas sobre benchmarks. Un gráfico publicado tiene un valor limitado si terceros no pueden inspeccionar la carga de trabajo ni repetir el experimento. Los datos públicos y las herramientas orientadas por configuración exponen más supuestos.

El enfoque también permite que los proveedores competidores cuestionen las decisiones de Qdrant. Los ingenieros de Milvus o Elasticsearch pueden proponer mejores configuraciones para sus sistemas. Los investigadores pueden modificar el hardware, la concurrencia, las combinaciones de consultas y los objetivos de recall sin reconstruir la verdad fundamental.

Esa apertura no elimina el sesgo de ajuste. Naturalmente, Qdrant conoce mejor su propia base de datos que las de sus competidores. La documentación existente de sus benchmarks reconoce explícitamente que la empresa puede configurar Qdrant de forma más eficaz y podría pasar por alto optimizaciones importantes en otros sistemas.

La reproducibilidad ofrece una respuesta a ese conflicto, más que una prueba de neutralidad. Cuando el código, los datos y la configuración son visibles, otros mantenedores pueden detectar configuraciones débiles y enviar cambios.

La evaluación independiente sigue siendo necesaria. Un análisis de TechTarget de septiembre citó a varios especialistas externos en datos que consideraron el conjunto de datos una contribución creíble. El analista William McKnight afirmó que su combinación de distribuciones realistas de texto web y resultados exactos parecía adecuada para pruebas densas, dispersas y con filtros.

Otro analista, Kevin Petrie de BARC, advirtió que las organizaciones aún necesitan benchmarks basados en sus propias cargas de trabajo. Esa salvedad define el valor real del lanzamiento. Un benchmark compartido permite hacer comparaciones, mientras que una prueba específica de una carga de trabajo respalda una decisión de compra.

Supernova puede ayudar a conectar esos usos porque los equipos pueden aplicar el marco a otro corpus. Pueden conservar el proceso de medición y sustituir documentos, consultas, filtros y modelos de embeddings privados.

Por tanto, el benchmark vectorial de Qdrant se entiende mejor como infraestructura de pruebas. Crea un punto de partida público y un proceso repetible. No designa un ganador universal.

Lo que la escala de 10.000 millones aún no demuestra

La escala corrige una debilidad de los benchmarks de búsqueda vectorial, pero no puede representar todas las fuentes de fallo de un producto de búsqueda con IA.

En primer lugar, FineWeb contiene texto web amplio. Un corpus empresarial puede incluir código, contratos, historiales médicos, tickets de soporte, catálogos de productos, transcripciones de reuniones o mensajes internos breves. Esos documentos tienen longitudes, vocabularios, patrones de duplicación y reglas de acceso diferentes.

En segundo lugar, el benchmark utiliza un modelo de embeddings para su conjunto de datos central. Los modelos de embeddings convierten texto en vectores, y su comportamiento determina el vecindario que se busca. Cambiar el modelo puede modificar las dimensiones de los vectores, la dispersión, la agrupación y la dificultad de recuperación.

El benchmark Qdrant FineWeb 10B utiliza gte-multilingual-base tanto para representaciones densas como dispersas. Esto aporta consistencia, pero el rendimiento con este modelo no garantiza la misma clasificación con otro modelo.

En tercer lugar, los vecinos más cercanos exactos no son automáticamente los documentos más útiles. La verdad fundamental responde si un sistema aproximado reprodujo las coincidencias más cercanas del modelo de embeddings. No determina si esas coincidencias satisfacen la necesidad de información de un usuario.

Esta distinción separa el recall de ANN de la relevancia de recuperación. El recall de ANN pregunta si el índice encontró los vectores que encontraría un cálculo exacto. La relevancia pregunta si esos documentos realmente ayudan a responder la consulta.

Un sistema puede lograr un recall de ANN casi perfecto mientras utiliza un modelo de embeddings que malinterpreta un dominio especializado. También puede devolver documentos técnicamente similares que estén desactualizados, no autorizados o sean redundantes.

La propia guía de relevancia de Qdrant recomienda un conjunto etiquetado que vincule consultas con documentos esperados. Esa capa de evaluación sigue siendo esencial para los equipos que implementan RAG o búsqueda semántica.

En cuarto lugar, la ficha del conjunto de datos identifica un problema de reproducibilidad numérica. La verdad fundamental publicada utilizó aritmética GPU bfloat16, mientras que los scripts de regeneración producen embeddings float32. Pequeñas diferencias numéricas pueden reordenar resultados empatados o afectar elementos próximos al límite de los 1.000 primeros.

Qdrant reveló la discrepancia y afirmó que estaba trabajando en una corrección. El problema no elimina el valor del conjunto de datos, pero demuestra por qué los artefactos públicos necesitan una inspección independiente.

En quinto lugar, el acceso crea una barrera práctica. La página de Hugging Face indica un tamaño total de archivos de decenas de terabytes. Muchos equipos pueden descargar rápidamente un conjunto de datos más pequeño, pero pocos pueden preparar, indexar y probar este lanzamiento de manera informal.

Las empresas con mayor capacidad para ejecutar el benchmark completo serán proveedores de bases de datos, proveedores cloud, grandes empresas e instituciones de investigación. Los equipos más pequeños pueden depender de resultados publicados o subconjuntos muestreados, recreando parte del problema de confianza.

Una clasificación compartida y alojada podría mejorar el acceso, pero introduciría cuestiones de gobernanza. Alguien debe definir perfiles de hardware, aprobar configuraciones, verificar envíos, actualizar versiones de bases de datos y evitar informes selectivos.

En sexto lugar, el lanzamiento no mide la calidad completa de una aplicación. La búsqueda de IA en producción suele incluir análisis de documentos, fragmentación, reescritura de consultas, fusión híbrida, reranking, caché, autorización y generación de respuestas. Un fallo en cualquiera de estas etapas puede dominar la experiencia del usuario.

Estas limitaciones no defienden benchmarks más pequeños. Defienden no tratar un gran benchmark como un marco completo de compra.

Los compradores deberían combinar tres capas de evidencia. Una prueba pública puede revelar un comportamiento amplio de escalado. Una prueba de carga de trabajo privada puede reproducir distribuciones y filtros locales. Una evaluación de extremo a extremo puede medir si los usuarios reciben respuestas correctas y atribuibles.

Ese estándar es exigente, pero la búsqueda con IA respalda cada vez más decisiones en las que importa perder un solo documento. Un benchmark debería hacer visibles esas compensaciones en lugar de comprimirlas en una única puntuación de rendimiento.

Tres señales mostrarán si la apuesta de Qdrant funciona

El lanzamiento solo tendrá éxito si equipos independientes lo utilizan para producir evidencia comparable, detectar problemas y mejorar el proceso de pruebas.

La primera señal son resultados reproducibles de terceros. Investigadores y proveedores de bases de datos deben publicar ejecuciones completas utilizando Qdrant-FineWeb-10B o un subconjunto auditable. Esos informes deberían incluir hardware, versiones de software, parámetros del índice, tiempo de ingestión, memoria, recall y latencia p99.

El recall equivalente será especialmente importante. Comparar el rendimiento con distintos niveles de precisión puede hacer que un sistema más rápido parezca mejor sin revelar qué omitió. Los resultados deberían mostrar el rendimiento en varios objetivos de recall.

Si equipos independientes reproducen resultados con Qdrant, Milvus, Elasticsearch, pgvector y otros sistemas, el lanzamiento reforzará el argumento a favor de la medición abierta. Si las configuraciones siguen siendo incompletas o prohibitivamente caras, su influencia será limitada.

La segunda señal es la actividad de corrección en torno a los datos y las herramientas. La diferencia numérica revelada en la ficha del conjunto de datos ofrece una prueba inmediata. Una corrección oportuna, artefactos versionados, sumas de verificación y cambios documentados reforzarían la confianza.

Los investigadores también deberían examinar la composición de las consultas, los duplicados, la cobertura lingüística, las distribuciones de filtros y la dificultad de las tareas de vecinos más cercanos. Un gran número de filas no garantiza una evaluación equilibrada.

El historial de contribuciones de Supernova importa aquí. Informes externos de errores, pull requests, integraciones de backends y configuraciones alternativas demostrarían que funciona como infraestructura comunitaria. Una actividad externa limitada lo mantendría más cerca de una demostración gestionada por un proveedor.

La tercera señal es si los compradores cambian lo que solicitan a los proveedores. El resultado más duradero no sería una posición única en una clasificación. Sería un estándar de adquisición más sólido para la búsqueda con IA.

Los equipos empresariales deberían pedir a los proveedores que informen del recall exacto junto con la latencia. Deberían solicitar mediciones de ingestión y construcción de índices, no solo la velocidad de consultas en estado estable. También deberían probar filtros selectivos y recuperación ante fallos.

Los resultados de benchmarks públicos pueden acotar una lista corta, pero las organizaciones aún necesitan evidencia local. Un minorista que busca en catálogos de productos, por ejemplo, puede preocuparse por los filtros de inventario y una alta profundidad de recuperación. Un equipo jurídico puede priorizar el aislamiento entre inquilinos, las citas y la terminología exacta.

El benchmark Qdrant FineWeb 10B ofrece a ambos grupos un mejor punto de referencia. Muestra qué se vuelve medible cuando alguien asume el considerable coste de crear respuestas exactas a escala de internet.

Qdrant también obtiene beneficios estratégicos. La empresa puede influir en qué mediciones consideran importantes los compradores, mientras sitúa su lenguaje preferido de recall, apertura y reproducibilidad en el centro de la discusión.

Eso no invalida el trabajo. Los estándares suelen comenzar cuando un participante interesado invierte recursos que otros no aportarían. La salvaguarda es una gobernanza transparente y una replicación externa creíble.

Los competidores ahora tienen una opción útil. Pueden ejecutar la carga de trabajo y publicar resultados, cuestionar sus supuestos con evidencia o contribuir conjuntos de datos y pruebas alternativos. El silencio hará más difíciles de defender las afirmaciones opacas sobre rendimiento.

Para los desarrolladores, la acción inmediata no es descargar decenas de terabytes sin un plan. Empiecen por identificar qué pregunta necesita una respuesta: recall algorítmico, escalado de bases de datos, relevancia de recuperación o calidad de aplicación de extremo a extremo.

Después, elijan la prueba más pequeña que conserve la dificultad relevante. Utilicen la verdad fundamental pública cuando sea adecuada, pero mantengan las consultas y documentos privados en la evaluación final. Registren toda la configuración necesaria para reproducir el resultado.

Los benchmarks de búsqueda con IA no se resolverán solo con escala. Sin embargo, la escala elimina una excusa cada vez más conveniente. El benchmark Qdrant FineWeb 10B ofrece ahora a la industria una forma pública de poner a prueba afirmaciones que antes dependían de datos e infraestructura privados.

Los próximos meses deberían revelar si la comunidad lo trata como un laboratorio compartido o como otro artefacto de proveedor. Los desarrolladores y compradores deberían seguir las replicaciones, las correcciones y los envíos de competidores, y luego exigir la misma transparencia a todos los proveedores de búsqueda con IA que evalúen.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page