SALT recupera más memoria, pero los modelos más pequeños pierden precisión
- Sophie Larsen

- hace 1 hora
- 15 min de lectura
Una publicación de horizon machinelearning ha expuesto un fuerte conflicto de recuperación: SALT busca eficientemente en un trie de memoria completo, pero los modelos más pequeños alucinan cuando devuelve demasiado contenido.
El desarrollador afirma que SALT almacena cada entrada en un trie, una estructura con forma de árbol que comparte prefijos comunes para reducir el almacenamiento repetido. Después utiliza dominancia temática y selección CELF con un presupuesto de recuperación del 20 por ciento. Estas afirmaciones de implementación proceden de la discusión sobre recuperación del desarrollador, no de una evaluación revisada de forma independiente.
Según se informa, el sistema funciona con un chatbot, pero ahora los agentes se incorporan a la arquitectura. Ese cambio eleva lo que está en juego. Varios módulos pueden recuperar memorias superpuestas, repetir hechos marginalmente relevantes y consumir la atención limitada del generador antes de que realice cualquier acción.
El problema central no es si SALT puede encontrar oraciones relacionadas. Al parecer, encuentra demasiadas. La pregunta más difícil es si una política de recuperación puede preservar cada dependencia necesaria y, al mismo tiempo, excluir material verosímil pero distractor.
Esto sitúa dos objetivos en conflicto directo. La cobertura temática premia a un conjunto por representar una mayor parte del tema activo. La precisión de la evidencia premia únicamente el material que cambia la respuesta o la acción correcta. Para los modelos más pequeños, el segundo objetivo puede importar más que el primero.
La propuesta de SALT convierte la recuperación de memoria en un problema de selección
El cuello de botella reportado de SALT comienza después de que el almacenamiento tiene éxito, porque un acceso eficiente no garantiza un contexto útil.
Según la publicación, todas las entradas se incorporan a un trie en DRAM. La DRAM es la memoria de trabajo rápida del sistema, mientras que un trie organiza secuencias mediante prefijos compartidos. Este diseño puede hacer que los patrones de texto repetidos sean compactos y rápidamente accesibles.
Luego, el desarrollador recupera oraciones mediante un sistema de palabras clave y dominancia temática. Un procedimiento CELF selecciona material dentro de un presupuesto fijado en el 20 por ciento. CELF, o selección diferida hacia adelante rentable, acelera la optimización voraz al evitar el recálculo innecesario del valor marginal de cada candidato.
La propiedad atractiva es el rendimiento decreciente. Una oración que cubre un tema nuevo puede ofrecer inicialmente un valor considerable. Otra oración que cubre el mismo tema debería aportar menos una vez que la primera haya entrado en el conjunto seleccionado.
Esa lógica encaja con la recuperación cuando importan la diversidad y la cobertura. Desincentiva un conjunto de resultados lleno de casi duplicados, a la vez que permite que aparezcan varias partes de un tema. También hace que una gran colección de memoria sea manejable sin puntuar todos los subconjuntos posibles.
Sin embargo, un porcentaje fijo no representa una necesidad de información fija. El veinte por ciento de una conversación breve puede producir un prompt compacto. El veinte por ciento de una memoria de agente grande y persistente puede producir mucho más material del que un modelo pequeño puede usar de forma fiable.
El presupuesto también crece con el conjunto de candidatos, salvo que intervenga otro límite. A medida que más módulos escriben memorias, los candidatos coherentes con el tema pueden multiplicarse. El selector puede seguir siendo computacionalmente eficiente mientras su salida se vuelve cognitivamente costosa para el modelo de lenguaje.
Esta distinción importa porque la recuperación tiene al menos tres etapas separadas. El sistema debe generar candidatos, clasificarlos o seleccionarlos, y luego empaquetarlos para un modelo. La velocidad en las dos primeras etapas no puede demostrar precisión en la tercera.
El material público aún no documenta la representación temática de SALT, los límites de las oraciones, las reglas de deduplicación ni el conjunto de evaluación. Tampoco establece si el presupuesto del 20 por ciento mide oraciones, tokens, nodos almacenados u otra unidad.
Estos detalles cambian el diagnóstico. Un presupuesto de oraciones puede ocultar grandes diferencias en la longitud de los tokens. Un presupuesto de tokens aún puede admitir proposiciones repetidas. Un presupuesto de nodos en un trie puede no corresponderse claramente con evidencia legible.
La ubicación reportada del repositorio, código fuente de SALT, no fue accesible de forma consistente durante la investigación. Por lo tanto, los detalles arquitectónicos más allá de la publicación deben tratarse como provisionales hasta que haya código y pruebas reproducibles disponibles.
Lo que ha cambiado sigue estando claro. SALT está pasando de un entorno de chatbot hacia un entorno de agentes, donde la recuperación de memoria influye en acciones de múltiples módulos. Esa transición convierte el exceso de recuperación de una molestia conversacional en un problema de fiabilidad a nivel de sistema.
Por qué la atención de Horizon MachineLearning se centró en demasiado contexto
La discusión de horizon machinelearning importa porque añadir contexto que parece relevante puede reducir la precisión, incluso cuando cada oración recuperada comparte el tema de la consulta.
Los modelos de lenguaje no tratan toda la información proporcionada como igualmente útil. Una ventana de contexto establece el tamaño máximo de entrada, pero la capacidad no garantiza un uso fiable. La posición, la repetición, la ambigüedad y la complejidad de la tarea afectan a lo que el modelo realmente sigue.
El clásico estudio sobre contexto largo probó la respuesta a preguntas con múltiples documentos y la recuperación de pares clave-valor. Los investigadores cambiaron dónde aparecía la evidencia relevante mientras mantenían inalterada la respuesta deseada. El rendimiento solía seguir una curva en U, favoreciendo la información cercana al principio o al final.
En una configuración reportada, GPT-3.5-Turbo rindió peor que su línea base sin consulta externa del 56,1 por ciento cuando el documento relevante estaba mal situado dentro de contextos más largos. Los investigadores también observaron rendimientos decrecientes al recuperar documentos adicionales.
Pasar de 20 documentos a 50 mejoró los resultados solo marginalmente en su estudio de caso de respuesta a preguntas de dominio abierto. El mayor recuerdo de recuperación no se tradujo en ganancias comparables en las respuestas. El generador no pudo aprovechar eficazmente todo el material adicional.
La evidencia más reciente refuerza esa advertencia. Un estudio de 2025 sobre longitud de contexto descubrió que entradas más largas pueden perjudicar el rendimiento incluso cuando la recuperación en sí es perfecta. Ese resultado separa dos fuentes de fallo que los equipos suelen combinar.
La primera es el error de recuperación, en el que el sistema elige evidencia faltante, engañosa o incompleta. La segunda es el error de utilización, en el que el modelo recibe evidencia adecuada pero no logra razonar sobre ella de forma fiable. Reducir el primero no resuelve automáticamente el segundo.
Esta distinción explica por qué la cobertura temática puede parecer buena en un panel de recuperación mientras las respuestas empeoran. Una oración puede pertenecer al tema correcto sin ayudar a resolver la solicitud actual. También puede introducir un valor desactualizado, una excepción o un concepto cercano.
Consideremos un agente que prepara un despliegue de software. Las memorias sobre política de despliegue, incidentes anteriores, pruebas, permisos e impacto en clientes coinciden todas con el tema amplio. Sin embargo, solo el entorno actual, la versión aprobada, el estado del incidente activo y las comprobaciones requeridas podrían regir la acción de hoy.
Un objetivo de cobertura puede premiar el incidente histórico porque añade amplitud temática. El generador podría entonces mezclar restricciones antiguas con las actuales. Un modelo más pequeño tiene menos capacidad disponible para distinguir cronología, autoridad y aplicabilidad condicional.
Por lo tanto, la pertenencia temática es un indicador débil de utilidad causal. La mejor evidencia recuperada no está meramente relacionada con la pregunta. Debe respaldar, limitar, contradecir o desambiguar materialmente la respuesta.
Esta presión crece en sistemas de múltiples turnos. Investigadores de Microsoft informaron de una caída media del rendimiento del 39 por ciento en seis tareas de generación cuando los modelos evaluados manejaban conversaciones de varios turnos. Su benchmark de conversación descubrió que los principales modelos abiertos y cerrados rendían peor que en configuraciones equivalentes de un solo turno.
Los agentes añaden otra capa. Cada módulo puede crear resúmenes, planes, resultados de herramientas, observaciones y mensajes de estado. Un sistema de memoria compartida se enfrenta entonces a varias versiones del mismo hecho, cada una escrita para un propósito local diferente.
La compresión ayuda al almacenamiento, pero no garantiza la relevancia para la decisión. Un distractor comprimido sigue siendo un distractor. Varios resúmenes comprimidos también pueden oscurecer cuál fuente original era autoritativa.
Para los creadores de una base de conocimiento consultable, esta es la lección práctica. La calidad de la recuperación debe evaluarse en la respuesta o acción final, no solo en la capa de índice o clasificación.
La cobertura y la precisión llevan la recuperación de oraciones en direcciones opuestas
El principal conflicto de diseño de SALT es cobertura frente a precisión, no tries frente a bases de datos vectoriales ni CELF frente a otro optimizador.
La cobertura pregunta si el conjunto seleccionado representa suficientes aspectos distintos de un tema. La precisión pregunta si cada elemento seleccionado merece un espacio escaso en el prompt para esta decisión específica. Ambas son útiles, pero premian comportamientos diferentes.
Un clasificador de relevancia puro suele devolver oraciones redundantes. Los elementos con mayor puntuación pueden reformular el mismo concepto destacado con pequeños cambios de redacción. La selección submodular puede mejorar la diversidad descontando los candidatos que añaden poco más allá de los elementos ya seleccionados.
El uso reportado de CELF por parte de SALT parece orientado a ese problema. Si el objetivo subyacente es submodular, la selección voraz diferida puede aproximar eficazmente un conjunto de alto valor. Sin embargo, un optimizador solo puede perseguir los valores codificados en su objetivo.
Si la cobertura temática asigna valor a cada nuevo subtema, el sistema buscará amplitud. No sabe que un subtema es mero contexto mientras otro contiene la restricción decisiva. Tampoco puede inferirlo únicamente a partir de la eficiencia computacional.
La unidad de recuperación agrava el problema. Las oraciones son fáciles de puntuar y reorganizar, pero los hechos no siempre respetan los límites de las oraciones. Una oración que califica una afirmación puede depender de una definición, una marca temporal, un interlocutor o una excepción situados cerca.
Recuperar solo la aparente oración de respuesta puede eliminar la procedencia necesaria. Recuperar todo su vecindario temático puede restaurar la procedencia, pero añadir ruido. El sistema necesita una unidad de evidencia que preserve dependencias sin importar un clúster temático completo.
Una opción es la recuperación centrada en afirmaciones. El sistema representaría cada memoria como una afirmación más metadatos, incluidos la fuente, el momento, el alcance, la confianza y los enlaces a los calificadores requeridos. La selección operaría sobre estos paquetes de evidencia en lugar de oraciones aisladas.
Otra opción es la ganancia marginal condicionada por la pregunta. El valor de un candidato dependería de si mejora una respuesta, resuelve una ambigüedad, proporciona un paso faltante o contradice el borrador actual. La novedad temática general pasaría a ser una señal de apoyo en lugar del objetivo principal.
Ninguno de los dos enfoques elimina las concesiones. La extracción de afirmaciones puede introducir errores durante la ingesta. La puntuación condicionada por la pregunta puede añadir latencia y depender de otro modelo con sus propios sesgos.
Aun así, ambos enfoques exponen el objetivo real de optimización. La capa de recuperación debería maximizar la utilidad esperada de la tarea bajo un presupuesto de tokens y latencia. No debería maximizar la cobertura de memoria y asumir que el generador descartará el exceso.
La política fija del 20 por ciento merece un escrutinio particular. Los porcentajes son convenientes para el muestreo de almacenamiento, pero la capacidad del prompt depende de tokens absolutos. La fiabilidad del modelo también cambia según la complejidad de la consulta, la estructura de la evidencia y el generador utilizado.
Un presupuesto mejor se adaptaría a la necesidad de evidencia. Una consulta directa podría requerir una afirmación respaldada. Una comparación podría requerir varias alternativas. Un plan de agente de varios pasos podría requerir una cadena de dependencias más contradicciones explícitas.
Eso sugiere un proceso de recuperación por etapas. La primera pasada debería recuperar un núcleo pequeño y de alta precisión. Una segunda pasada debería ampliarse solo cuando la respuesta carezca de respaldo, contenga incertidumbre o requiera otro salto de razonamiento.
La decisión de ampliación necesita criterios medibles. Un modelo puede identificar afirmaciones sin respaldo, pero la confianza autodeclarada por sí sola no es fiable. Las señales más confiables incluyen citas ausentes, entidades sin resolver, marcas de tiempo contradictorias y comprobaciones de capacidad de respuesta fallidas.
El sistema también debería separar la memoria estable de la memoria episódica. La memoria estable contiene preferencias, políticas y hechos verificados duraderos. La memoria episódica registra eventos, observaciones transitorias y pasos previos cuya relevancia disminuye.
Sin esa separación, un selector de temas puede mezclar reglas permanentes con estado temporal. Un agente podría seguir una solución provisional antigua después de que termine el incidente subyacente. Por lo tanto, los metadatos temporales deberían influir en la selección antes de que el texto llegue al modelo.
La autoridad importa tanto como la actualidad. Una instrucción del usuario debería prevalecer sobre un resumen generado por un agente de esa instrucción. Un resultado verificado de una herramienta debería prevalecer sobre un plan especulativo. La similitud temática por sí sola no puede expresar esas prioridades.
Es probable que el mejor método de recuperación de oraciones combine varias señales. Estas incluyen coincidencia léxica, similitud semántica, cobertura de dependencias, tiempo, autoridad, contradicción y utilidad estimada para la tarea. CELF aún puede realizar la selección final del conjunto si el objetivo incorpora estas distinciones.
Esto no vuelve irrelevante al trie. La estructura de almacenamiento determina la velocidad de búsqueda, la sobrecarga de memoria, el comportamiento de actualización y las relaciones disponibles. Simplemente significa que la eficiencia de almacenamiento y la fiabilidad de las respuestas pertenecen a capas de evaluación diferentes.
Los modelos más pequeños exponen primero el fallo de recuperación
Los modelos más pequeños no son meramente generadores más débiles en este contexto; actúan como pruebas de estrés para determinar si la capa de recuperación ha separado la evidencia del ruido temático.
Un modelo grande a veces puede recuperarse de un prompt saturado gracias a un seguimiento de instrucciones más sólido y una mejor discriminación contextual. Esa tolerancia puede ocultar debilidades en el recuperador. El mismo contexto puede abrumar de inmediato a un modelo más pequeño.
Por lo tanto, la observación del desarrollador sobre las alucinaciones merece una interpretación cuidadosa. La recuperación excesiva puede correlacionarse con respuestas sin respaldo, pero la publicación no establece causalidad. Otras fuentes incluyen prompts débiles, evidencia ausente, memorias contradictorias, ajustes de decodificación o limitaciones específicas del modelo.
El término alucinación también puede englobar varios fallos. Un modelo podría inventar un hecho, fusionar dos memorias, seguir instrucciones desactualizadas o elegir la alternativa recuperada equivocada. Cada fallo requiere una medición diferente y, potencialmente, una solución distinta.
SALT necesita una taxonomía de errores antes de modificar su selector. Cada respuesta fallida debería identificar si la evidencia requerida estaba ausente, presente pero ignorada, contradicha, incompleta o abrumada por elementos distractores.
La evaluación debería comparar al menos cuatro condiciones de recuperación. Una no debería proporcionar memoria externa. Otra debería proporcionar solo un conjunto de evidencia ideal seleccionado por una persona. Una tercera debería usar la salida actual de SALT y una cuarta debería usar una salida sometida a una poda agresiva.
Esta comparación separa la recuperación de la generación. Si el modelo pequeño falla con el conjunto ideal, cambiar los pesos de CELF no resolverá el problema central. Si tiene éxito con evidencia ideal pero falla con la salida de SALT, la precisión se convierte en el objetivo principal.
El benchmark debería preservar categorías de tareas realistas. Las preguntas factuales directas ponen a prueba el recuerdo exacto. Las preguntas de varios saltos ponen a prueba la completitud de las dependencias. Las tareas de agentes ponen a prueba si la memoria recuperada conduce a la elección correcta de herramienta, parámetros y condición de detención.
Cada categoría necesita casos negativos. El corpus debería contener oraciones plausibles pero irrelevantes del mismo tema, versiones desactualizadas de hechos verdaderos, contradicciones explícitas y paráfrasis duplicadas. Los distractores aleatorios fáciles sobrestimarán la calidad del sistema.
La evaluación también debe variar la posición de la evidencia. Los resultados sobre el límite de contexto para Gemini 2.5 Flash muestran que los modelos más recientes pueden manejar la recuperación simple de una aguja en contextos extensos mucho mejor que los sistemas anteriores. Ese hallazgo es un contrapeso importante frente a afirmaciones amplias sobre un fallo universal del contexto.
Sin embargo, la recuperación de hechos simples no es lo mismo que razonar entre memorias en competencia. Un modelo puede localizar un hecho introducido deliberadamente y aun así tener dificultades con varias afirmaciones relacionadas, excepciones y cambios temporales. El caso de uso de agentes de SALT pertenece más a la segunda categoría.
Por ello, las pruebas deberían cruzar el tamaño del modelo con la composición del contexto. El mismo conjunto recuperado debería enviarse a un modelo local más pequeño, a un modelo más potente y a un evaluador de estilo oracle. Las diferencias mostrarán si las mejoras provienen de una memoria más limpia o de una mayor capacidad generativa.
La precisión debería informarse en varios niveles. La precisión de oraciones cuenta cuántas oraciones recuperadas resultan útiles. La precisión de afirmaciones cuenta las proposiciones respaldadas. La precisión de acciones mide si un agente elige la operación y los parámetros correctos.
La recuperación debe seguir siendo visible. Podar todo excepto una oración obvia puede elevar la precisión mientras destruye la completitud de varios saltos. Un selector seguro debería identificar el conjunto de evidencia suficiente más pequeño, no simplemente el conjunto más pequeño.
“Suficiente” significa que el conjunto respalda el resultado correcto y conserva los matices necesarios. También debería incluir contradicciones decisivas cuando la memoria contenga afirmaciones conflictivas. De lo contrario, un prompt compacto puede resultar erróneo con mucha confianza.
Las pruebas de ablación pueden revelar qué componentes de SALT ayudan. Los investigadores deberían desactivar por separado la cobertura temática, cambiar el presupuesto porcentual, limitar los tokens absolutos, eliminar duplicados, añadir actualidad y añadir ponderación por autoridad.
Estos experimentos deberían usar memorias almacenadas y consultas idénticas. Cambiar el corpus entre ejecuciones dificultaría las comparaciones. Repetir los ensayos también importa cuando la generación utiliza muestreo.
La latencia y el uso de memoria deberían mantenerse como métricas secundarias, no desaparecer. Un reranker que mejora la precisión pero añade una demora inaceptable puede perjudicar a un agente interactivo. El objetivo es una frontera operativa medida entre precisión, tokens, latencia y DRAM.
El desarrollador también debería registrar qué aportó cada oración recuperada. Un código de motivo conciso puede identificar coincidencia léxica, nueva afirmación, contradicción, dependencia temporal o autoridad de la fuente. Esos registros hacen diagnosticable la recuperación excesiva sin pedirle al generador que se explique.
Un riesgo importante sigue sin verificarse. No existe un benchmark público que establezca la precisión actual de chatbot de SALT, la compresión de memoria o el rendimiento de agentes. La arquitectura debería analizarse como un informe de proyecto temprano, no como un avance validado.
Tres señales mostrarán si SALT puede escalar a agentes
El próximo hito de SALT debería ser un resultado de precisión reproducible, no un almacén de memoria más grande ni un presupuesto de contexto más generoso.
La primera señal es un benchmark de brecha frente al oracle. El desarrollador debería comparar la recuperación actual con un conjunto mínimo de evidencia seleccionado por personas en tareas directas, de varios saltos y de acciones de agente. Los resultados deberían desglosarse por tamaño de modelo.
Si SALT se acerca al rendimiento oracle usando menos tokens, la evidencia respaldará su estrategia de selección temática. Si la brecha se amplía en los modelos más pequeños, el objetivo actual está seleccionando una amplitud que el generador no puede aprovechar.
La segunda señal es el presupuesto adaptativo. Una política fija del 20 por ciento debería competir contra límites absolutos de tokens y recuperación por etapas. La comparación debería medir la precisión de las respuestas, el éxito de las acciones, las afirmaciones recuperadas, la latencia y las afirmaciones sin respaldo.
Una política adaptativa gana solo si preserva cadenas de evidencia completas. Por sí solos, menores recuentos de tokens debilitarían el sistema si eliminan excepciones o dependencias. El resultado más sólido mejoraría la precisión sin reducir la recuperación a nivel de tarea.
La tercera señal es la procedencia consciente de los módulos durante las pruebas con agentes. Cada memoria debería identificar su módulo de origen, marca de tiempo, autoridad y material fuente. Las pruebas deberían incluir memorias conflictivas y desactualizadas de distintos agentes.
Si la selección consciente de la procedencia reduce las acciones erróneas, la memoria multiagente necesita más que dominancia temática. Necesita reglas explícitas de autoridad, actualidad y contradicción. Si la procedencia tiene poco efecto, el problema principal probablemente se encuentre en otra parte de la clasificación o la generación.
Estas señales deberían aparecer en un paquete de evaluación abierto. El paquete necesita consultas fijas, evidencia etiquetada, registros de recuperación, salidas generadas, configuraciones de modelos y reglas de puntuación. Sin esos artefactos, los colaboradores externos no pueden aislar por qué funciona un cambio propuesto.
Las sugerencias de la comunidad aún pueden ser útiles antes de que exista un benchmark completo. El proyecto podría probar la relevancia marginal máxima, el reranking con cross-encoder, la agrupación de afirmaciones y la compresión centrada en la consulta. Sin embargo, ningún método debería reemplazar el selector actual basándose únicamente en anécdotas.
El diseño más sólido a corto plazo probablemente sea conservador. Recuperar un núcleo compacto de evidencia, preservar los matices asociados y ampliar solo después de detectar una brecha de información específica. Enrutar la evidencia seleccionada según la tarea de cada módulo en lugar de difundir un contexto amplio único.
Los sistemas de agentes también necesitan higiene de memoria. Deberían fusionar duplicados, expirar el estado temporal, preservar las fuentes originales y distinguir las observaciones de las conclusiones. De lo contrario, la calidad de recuperación se degradará a medida que los agentes almacenen repetidamente derivados de salidas anteriores.
Ese patrón se parece a una copia con pérdida. Una herramienta produce un hecho, un agente lo resume, otro agente resume ese resumen y el sistema de memoria almacena cada versión. La cobertura temática puede recompensar estos elementos como evidencia consistente pese a su origen común.
La deduplicación consciente de la procedencia puede impedir un consenso aparente surgido de copias repetidas. El selector debería agrupar las memorias derivadas bajo su evidencia original. Entonces puede evitar gastar tokens del prompt en varias paráfrasis de un mismo hecho.
Los equipos que construyen un sistema personal de conocimiento afrontan un desafío relacionado. Capturar todo solo es útil cuando el recuerdo preserva la relevancia, los límites entre fuentes y el tiempo. La memoria de agentes amplifica el coste de equivocarse en esas distinciones.
Para el debate de horizon machinelearning, ese es el punto decisivo. SALT no necesita demostrar que un trie puede almacenar una amplia memoria conversacional. Necesita demostrar que su selector puede recuperar el conjunto de evidencia suficiente más pequeño a medida que crecen la memoria y el número de módulos.
Por lo tanto, la siguiente contribución útil es medible: publicar un conjunto de fallos, etiquetar la evidencia requerida y comparar políticas de recuperación bajo condiciones de modelo idénticas. ¿Qué política mantiene precisos a los modelos pequeños sin ocultar hechos necesarios?


