SALT는 더 많은 메모리를 검색하지만, 소형 모델의 정확도는 떨어진다
- Ethan Carter

- 1일 전
- 11분 분량
horizon machinelearning 게시글은 뚜렷한 검색 충돌을 드러냈다. SALT는 전체 메모리 트라이를 효율적으로 검색하지만, 너무 많은 내용을 반환하면 소형 모델은 환각을 일으킨다.
개발자에 따르면 SALT는 모든 입력을 트라이에 저장한다. 트라이는 공통 접두사를 공유해 중복 저장을 줄이는 트리 형태의 구조다. 이후 테마 우세도와 CELF 선택 방식을 사용하며, 검색 예산은 20%로 설정된다. 이러한 구현 관련 주장은 독립적인 검토를 거친 평가가 아니라 개발자의 검색 논의에 근거한다.
이 시스템은 챗봇과 함께 작동하는 것으로 알려졌지만, 이제 에이전트도 아키텍처에 합류하고 있다. 이 변화는 중요성을 높인다. 여러 모듈이 서로 겹치는 메모리를 검색하고, 주변적 관련성만 있는 사실을 반복하며, 어떤 행동을 취하기도 전에 생성 모델의 제한된 주의를 소진할 수 있다.
핵심 문제는 SALT가 관련 문장을 찾을 수 있는지 여부가 아니다. SALT는 지나치게 많은 문장을 찾는 것으로 보인다. 더 어려운 질문은 검색 정책이 필요한 모든 의존성을 보존하면서도 그럴듯하지만 주의를 분산시키는 자료를 제외할 수 있는지다.
이로 인해 두 목표가 정면으로 충돌한다. 테마 커버리지는 활성 주제의 더 많은 부분을 대표하는 집합에 보상을 준다. 증거 정밀도는 정답이나 행동을 바꾸는 자료에만 보상을 준다. 소형 모델에서는 두 번째 목표가 첫 번째보다 더 중요할 수 있다.
SALT 제안은 메모리 회상을 선택 문제로 바꾼다
SALT의 보고된 병목은 저장이 성공한 뒤에 시작된다. 효율적인 접근이 유용한 컨텍스트를 보장하지는 않기 때문이다.
게시글에 따르면 모든 입력은 DRAM의 트라이에 저장된다. DRAM은 시스템의 빠른 작업 메모리이며, 트라이는 공통 접두사를 통해 시퀀스를 구성한다. 이 설계는 반복되는 텍스트 패턴을 압축하고 빠르게 주소 지정할 수 있게 한다.
개발자는 이후 키워드 및 테마 우세도 시스템을 통해 문장을 검색한다. CELF 절차는 20%로 설정된 예산 안에서 자료를 선택한다. Cost-Effective Lazy Forward selection의 약자인 CELF는 모든 후보의 한계 가치를 불필요하게 재계산하지 않아 탐욕적 최적화를 가속한다.
매력적인 특성은 수확 체감이다. 새로운 테마를 다루는 문장은 처음에는 상당한 가치를 제공할 수 있다. 같은 테마를 다루는 또 다른 문장은 첫 번째 문장이 선택 집합에 들어간 뒤에는 기여도가 낮아져야 한다.
이 논리는 다양성과 커버리지가 중요한 검색에 적합하다. 거의 중복된 결과로 가득한 집합을 억제하면서도 주제의 여러 부분이 나타나도록 한다. 또한 가능한 모든 부분 집합을 점수화하지 않고도 대규모 메모리 컬렉션을 관리할 수 있게 한다.
하지만 고정 비율이 고정된 정보 필요량을 의미하지는 않는다. 짧은 대화의 20%는 간결한 프롬프트를 만들 수 있다. 크고 지속적인 에이전트 메모리의 20%는 소형 모델이 안정적으로 활용할 수 있는 양보다 훨씬 많은 자료를 만들 수 있다.
다른 상한이 개입하지 않는 한 예산은 후보 풀과 함께 증가한다. 더 많은 모듈이 메모리를 기록하면 테마와 일치하는 후보가 늘어날 수 있다. 선택기는 계산적으로 효율적인 상태를 유지할 수 있지만, 그 출력은 언어 모델에 인지적으로 큰 비용을 초래할 수 있다.
이 구분이 중요한 이유는 검색에 최소 세 개의 별도 단계가 있기 때문이다. 시스템은 후보를 생성하고, 순위를 매기거나 선택한 다음, 모델에 맞게 패키징해야 한다. 처음 두 단계의 속도는 세 번째 단계의 정확성을 입증할 수 없다.
공개된 자료는 아직 SALT의 테마 표현, 문장 경계, 중복 제거 규칙 또는 평가 세트를 문서화하지 않았다. 또한 20% 예산이 문장, 토큰, 저장 노드 또는 다른 단위를 측정하는지도 명확히 하지 않는다.
이 세부 사항은 진단을 바꾼다. 문장 예산은 토큰 길이의 큰 차이를 가릴 수 있다. 토큰 예산도 반복된 명제를 허용할 수 있다. 트라이의 노드 예산은 읽을 수 있는 증거와 깔끔하게 대응하지 않을 수 있다.
보고된 저장소 위치인 SALT source code는 조사 중 일관되게 접근할 수 없었다. 따라서 게시글을 넘어선 아키텍처 세부 사항은 코드와 재현 가능한 테스트가 उपलब्ध해질 때까지 잠정적으로 다뤄야 한다.
그럼에도 변화 자체는 분명하다. SALT는 챗봇 환경에서 여러 모듈에 걸친 행동에 메모리 검색이 영향을 미치는 에이전트 환경으로 이동하고 있다. 이 전환은 과도한 회상을 대화상의 불편함에서 시스템 수준의 신뢰성 문제로 바꾼다.
horizon machinelearning의 관심이 지나치게 많은 컨텍스트에 쏠린 이유
horizon machinelearning 논의가 중요한 이유는 검색된 모든 문장이 질의의 테마를 공유하더라도, 관련 있어 보이는 컨텍스트를 추가하면 정확도가 낮아질 수 있기 때문이다.
언어 모델은 제공된 모든 정보를 똑같이 유용하게 취급하지 않는다. 컨텍스트 윈도우는 최대 입력 크기를 정하지만, 용량이 안정적인 활용을 보장하지는 않는다. 위치, 반복, 모호성, 작업 복잡성은 모두 모델이 실제로 무엇을 따르는지에 영향을 준다.
고전적인 장문 컨텍스트 연구는 다중 문서 질의응답과 키-값 검색을 시험했다. 연구진은 원하는 답을 유지한 채 관련 증거가 나타나는 위치를 바꿨다. 성능은 종종 U자형 곡선을 보였으며, 정보가 처음이나 끝부분에 있을 때 유리했다.
한 보고된 설정에서 GPT-3.5-Turbo는 관련 문서가 더 긴 컨텍스트 내의 좋지 않은 위치에 놓였을 때 56.1%의 비공개 지식 기준선보다 낮은 성능을 보였다. 연구진은 추가 문서를 검색할 때 수확 체감도 확인했다.
오픈 도메인 질의응답 사례 연구에서 문서를 20개에서 50개로 늘리자 결과는 미미하게만 개선됐다. 추가된 검색 회상률은 그에 상응하는 답변 향상으로 이어지지 않았다. 생성 모델은 모든 추가 자료를 효과적으로 활용하지 못했다.
더 새로운 증거는 이 경고를 강화한다. 2025년 컨텍스트 길이 연구는 검색 자체가 완벽하더라도 더 긴 입력이 성능을 해칠 수 있음을 발견했다. 이 결과는 팀들이 흔히 함께 묶어 보는 두 가지 실패 원인을 분리한다.
첫 번째는 시스템이 누락되었거나 오도하거나 불완전한 증거를 선택하는 검색 오류다. 두 번째는 모델이 충분한 증거를 받았지만 이를 안정적으로 추론하지 못하는 활용 오류다. 첫 번째를 줄인다고 두 번째가 자동으로 해결되지는 않는다.
이 구분은 검색 대시보드에서 테마 커버리지가 좋아 보이는 동안 답변이 악화될 수 있는 이유를 설명한다. 문장은 올바른 테마에 속할 수 있지만 현재 요청을 해결하는 데 도움이 되지 않을 수 있다. 또한 오래된 값, 예외 또는 인접한 개념을 끌어들일 수도 있다.
소프트웨어 배포를 준비하는 에이전트를 생각해 보자. 배포 정책, 과거 사고, 테스트, 권한, 고객 영향에 관한 메모리는 모두 넓은 테마와 일치한다. 그러나 오늘의 행동을 좌우하는 것은 현재 환경, 승인된 버전, 진행 중인 사고 상태, 필수 점검 사항뿐일 수 있다.
커버리지 목표는 주제적 폭을 더한다는 이유로 과거 사고에 보상을 줄 수 있다. 그러면 생성 모델은 오래된 제약과 현재 제약을 섞을 수 있다. 소형 모델은 시간 순서, 권한, 조건부 적용 가능성을 구분할 여유 용량이 더 적다.
따라서 테마 소속은 인과적 유용성의 약한 대리 지표다. 최선의 검색 증거는 단지 질문과 관련된 것이 아니다. 답변을 실질적으로 뒷받침하거나, 제한하거나, 반박하거나, 명확히 해야 한다.
이 압력은 다중 턴 시스템에서 커진다. Microsoft 연구진은 테스트 모델이 여러 턴에 걸친 대화를 처리할 때 6개 생성 작업 전반에서 평균 39%의 성능 하락을 보고했다. 이들의 대화 벤치마크는 주요 오픈 및 클로즈드 모델이 동등한 단일 턴 환경보다 낮은 성능을 보인다는 사실을 발견했다.
에이전트는 한 층을 더 추가한다. 각 모듈은 요약, 계획, 도구 결과, 관찰, 상태 메시지를 만들 수 있다. 그러면 공유 메모리 시스템은 서로 다른 지역적 목적을 위해 작성된 동일한 사실의 여러 버전을 마주하게 된다.
압축은 저장에는 도움이 되지만 의사결정 관련성을 보장하지는 않는다. 압축된 방해 정보도 여전히 방해 정보다. 여러 압축 요약은 어느 원본 소스가 권위 있는지 흐리게 만들 수도 있다.
검색 가능한 지식 베이스를 구축하는 이들에게 이것이 실질적인 교훈이다. 검색 품질은 인덱스나 순위 계층뿐 아니라 최종 답변 또는 행동 단계에서 평가해야 한다.
커버리지와 정밀도는 문장 검색을 반대 방향으로 이끈다
SALT의 핵심 설계 충돌은 트라이와 벡터 데이터베이스, 또는 CELF와 다른 최적화 기법의 대립이 아니라 커버리지와 정밀도의 대립이다.
커버리지는 선택된 집합이 주제의 충분히 다양한 측면을 대표하는지 묻는다. 정밀도는 선택된 각 항목이 이 특정 의사결정을 위해 귀중한 프롬프트 공간을 차지할 가치가 있는지 묻는다. 둘 다 유용하지만 서로 다른 행동에 보상을 준다.
순수 관련성 순위 모델은 종종 중복된 문장을 반환한다. 최고 점수 항목은 사소한 표현 차이만 있을 뿐 같은 두드러진 개념을 반복할 수 있다. 부분모듈러 선택은 이미 선택된 항목에 비해 거의 추가하지 않는 후보를 할인해 다양성을 개선할 수 있다.
SALT의 보고된 CELF 사용은 이 문제를 겨냥한 것으로 보인다. 기본 목표가 부분모듈러라면, 지연 탐욕 선택은 높은 가치의 집합을 효율적으로 근사할 수 있다. 하지만 최적화기는 목표 함수에 인코딩된 가치만 추구할 수 있다.
테마 커버리지가 새로운 모든 하위 테마에 가치를 부여한다면, 시스템은 폭넓은 범위를 추구하게 된다. 한 하위 테마는 단지 배경일 뿐이고 다른 하위 테마에는 결정적 제약이 담겨 있다는 사실을 알지 못한다. 계산 효율성만으로 이를 추론할 수도 없다.
검색 단위는 문제를 더 복잡하게 만든다. 문장은 점수화하고 재배열하기 쉽지만, 사실은 항상 문장 경계를 따르지 않는다. 단서가 되는 문장은 근처에 있는 정의, 타임스탬프, 발화자 또는 예외에 의존할 수 있다.
겉보기 답변 문장만 검색하면 필요한 출처 정보를 제거할 수 있다. 해당 문장의 전체 테마적 주변부를 검색하면 출처 정보는 복원되지만 잡음이 추가될 수 있다. 시스템에는 전체 주제 클러스터를 끌어들이지 않으면서 의존성을 보존하는 증거 단위가 필요하다.
한 가지 선택지는 주장 중심 검색이다. 시스템은 각 메모리를 주장과 메타데이터로 표현하며, 여기에는 소스, 시간, 범위, 신뢰도, 필수 한정 조건에 대한 링크가 포함된다. 선택은 고립된 문장이 아니라 이러한 증거 묶음을 대상으로 이뤄진다.
또 다른 선택지는 질문 조건부 한계 이득이다. 후보의 가치는 답변을 개선하는지, 모호성을 해소하는지, 누락된 단계를 제공하는지, 또는 현재 초안과 모순되는지에 따라 달라진다. 일반적인 테마 신규성은 주된 목표가 아니라 보조 신호가 된다.
어느 접근법도 상충 관계를 없애지는 않는다. 주장 추출은 수집 과정에서 오류를 도입할 수 있다. 질문 조건부 점수화는 지연 시간을 늘리고 자체 편향을 지닌 또 다른 모델에 의존할 수 있다.
그럼에도 두 접근법은 실제 최적화 대상을 드러낸다. 검색 계층은 토큰 및 지연 시간 예산 아래에서 예상 작업 효용을 극대화해야 한다. 메모리 커버리지를 극대화한 뒤 생성 모델이 과잉 정보를 버릴 것이라고 가정해서는 안 된다.
고정된 20% 정책은 특히 면밀한 검토가 필요하다. 비율은 저장 샘플링에는 편리하지만 프롬프트 용량은 절대 토큰 수에 따라 달라진다. 모델 신뢰성도 질의 복잡성, 증거 구조, 사용되는 생성 모델에 따라 변한다.
더 나은 예산은 필요한 증거에 맞춰 조정되어야 한다. 직접 조회에는 근거가 뒷받침하는 주장 하나면 충분할 수 있다. 비교에는 여러 대안이 필요할 수 있다. 여러 단계로 이뤄진 에이전트 계획에는 의존성 사슬과 명시적인 모순이 필요할 수 있다.
이는 단계적 검색 프로세스를 시사한다. 첫 번째 단계에서는 작지만 정밀도가 높은 핵심 자료를 가져와야 한다. 두 번째 단계는 답변에 근거가 부족하거나, 불확실성이 있거나, 추가 추론 단계가 필요할 때만 확장해야 한다.
확장 여부를 결정하려면 측정 가능한 기준이 필요하다. 모델은 근거가 없는 주장을 식별할 수 있지만, 자기 보고식 신뢰도만으로는 신뢰하기 어렵다. 더 믿을 만한 신호로는 누락된 인용, 해결되지 않은 개체, 상충하는 타임스탬프, 답변 가능성 검사 실패 등이 있다.
시스템은 안정적 메모리와 일화적 메모리도 분리해야 한다. 안정적 메모리에는 지속되는 선호, 정책, 검증된 사실이 담긴다. 일화적 메모리는 사건, 일시적 관찰, 그리고 시간이 지나며 관련성이 약해지는 이전 단계를 기록한다.
이런 분리가 없으면 테마 선택기는 영구 규칙과 임시 상태를 섞을 수 있다. 에이전트는 근본 원인이 해결된 뒤에도 오래된 우회책을 따를 수 있다. 따라서 시간 메타데이터는 텍스트가 모델에 전달되기 전에 선택 과정에 영향을 미쳐야 한다.
권위는 최신성만큼 중요하다. 사용자 지시는 그 지시에 대해 에이전트가 생성한 요약보다 우선해야 한다. 검증된 도구 결과는 추측성 계획보다 우선해야 한다. 테마 유사성만으로는 이런 우선순위를 표현할 수 없다.
최고의 문장 검색 방식은 여러 신호를 결합할 가능성이 크다. 여기에는 어휘 일치, 의미적 유사성, 의존성 범위, 시간, 권위, 모순, 추정된 작업 효용이 포함된다. 목적 함수가 이러한 차이를 반영한다면 CELF는 여전히 최종 세트 선택을 수행할 수 있다.
그렇다고 트라이가 무의미해지는 것은 아니다. 저장 구조는 조회 속도, 메모리 오버헤드, 업데이트 동작, 이용 가능한 관계를 결정한다. 이는 단지 저장 효율성과 답변 신뢰성이 서로 다른 평가 계층에 속한다는 뜻이다.
더 작은 모델이 검색 실패를 먼저 드러낸다
더 작은 모델은 단지 생성 능력이 약한 것이 아니라, 검색 계층이 증거와 주제적 잡음을 제대로 분리했는지 검증하는 스트레스 테스트 역할을 한다.
대형 모델은 더 강한 지시 이행과 더 나은 문맥 구분 능력으로 인해, 때로는 복잡한 프롬프트에서도 회복할 수 있다. 이런 관용성은 검색기의 약점을 가릴 수 있다. 동일한 문맥도 더 작은 모델에는 즉시 과부하를 일으킬 수 있다.
따라서 개발자의 환각 관련 관찰은 신중하게 해석할 필요가 있다. 과도한 검색은 근거 없는 답변과 상관관계를 보일 수 있지만, 이 글은 인과관계를 입증하지 않는다. 다른 원인으로는 약한 프롬프트, 누락된 증거, 상충하는 메모리, 디코딩 설정, 모델별 한계 등이 있다.
환각이라는 용어는 여러 실패를 하나로 뭉뚱그릴 수도 있다. 모델은 사실을 지어내거나, 두 메모리를 합치거나, 오래된 지시를 따르거나, 검색된 대안 중 잘못된 것을 선택할 수 있다. 각 실패에는 서로 다른 측정 방식과, 경우에 따라 서로 다른 해결책이 필요하다.
SALT는 선택기를 변경하기 전에 오류 분류 체계가 필요하다. 실패한 모든 답변은 필요한 증거가 부재했는지, 존재했지만 무시됐는지, 반박됐는지, 불완전했는지, 또는 방해 요소에 압도됐는지를 식별해야 한다.
평가는 최소 네 가지 검색 조건을 비교해야 한다. 하나는 외부 메모리를 전혀 제공하지 않아야 한다. 다른 하나는 사람이 선택한 오라클 증거 세트만 제공해야 한다. 세 번째는 SALT의 현재 출력을 사용하고, 네 번째는 공격적으로 가지치기한 출력을 사용해야 한다.
이 비교는 검색과 생성을 분리한다. 작은 모델이 오라클 세트에서도 실패한다면 CELF 가중치를 바꿔도 핵심 문제는 해결되지 않는다. 오라클 증거에서는 성공하지만 SALT 출력에서는 실패한다면 정밀도가 최우선 목표가 된다.
벤치마크는 현실적인 작업 범주를 유지해야 한다. 직접 사실 질문은 정확한 회상을 검증한다. 멀티홉 질문은 의존성 완전성을 검증한다. 에이전트 작업은 검색된 메모리가 올바른 도구 선택, 매개변수, 중단 조건으로 이어지는지를 검증한다.
각 범주에는 부정 사례가 필요하다. 코퍼스에는 같은 테마의 그럴듯하지만 무관한 문장, 사실의 오래된 버전, 명시적 모순, 중복된 바꿔쓰기 표현이 포함되어야 한다. 쉬운 무작위 방해 요소는 시스템 품질을 과대평가하게 만든다.
평가는 증거의 위치도 달리해야 한다. Gemini 2.5 Flash의 컨텍스트 한계 결과는 최신 모델이 긴 문맥 전반에서 단순한 바늘 찾기 검색을 이전 시스템보다 훨씬 잘 처리할 수 있음을 보여준다. 이 발견은 보편적인 컨텍스트 실패에 대한 광범위한 주장에 중요한 반론이 된다.
하지만 단순 사실 검색은 경쟁하는 여러 메모리 전반에서의 추론과는 다르다. 모델은 심어 둔 사실 하나를 찾을 수 있어도, 서로 관련된 여러 주장, 예외, 시간적 변화를 처리하는 데는 여전히 어려움을 겪을 수 있다. SALT의 에이전트 활용 사례는 두 번째 범주에 더 가깝다.
따라서 테스트는 모델 크기와 컨텍스트 구성을 교차해 수행해야 한다. 같은 검색 세트를 작은 로컬 모델, 더 강력한 모델, 오라클 방식 평가기에 제공해야 한다. 차이는 개선이 더 깨끗한 메모리에서 비롯되는지, 아니면 더 큰 생성기 역량에서 비롯되는지를 보여줄 것이다.
정밀도는 여러 수준에서 보고되어야 한다. 문장 정밀도는 검색된 문장 중 실제로 유용한 문장이 몇 개인지를 센다. 주장 정밀도는 근거가 뒷받침하는 명제를 센다. 행동 정밀도는 에이전트가 올바른 작업과 매개변수를 선택하는지를 측정한다.
재현율도 계속 드러나야 한다. 명백한 문장 하나만 남기고 모두 제거하면 정밀도는 높일 수 있지만 멀티홉 완전성은 무너질 수 있다. 안전한 선택기는 단순히 가장 작은 세트가 아니라, 가장 작은 충분 증거 세트를 식별해야 한다.
“충분하다”는 것은 그 세트가 올바른 결과를 뒷받침하고 필요한 한정 조건을 유지한다는 뜻이다. 메모리에 상충하는 주장이 있을 때는 결정적인 모순도 포함해야 한다. 그렇지 않으면 압축된 프롬프트가 자신감 있게 틀릴 수 있다.
절제 실험은 어떤 SALT 구성 요소가 도움이 되는지 밝힐 수 있다. 연구자들은 테마 범위를 비활성화하고, 백분율 예산을 변경하고, 절대 토큰 상한을 두고, 중복을 제거하며, 최신성과 권위 가중치를 각각 별도로 추가해야 한다.
이 실험들은 동일하게 저장된 메모리와 쿼리를 사용해야 한다. 실행마다 코퍼스를 바꾸면 비교가 어려워진다. 생성에 샘플링을 사용할 때는 반복 시행도 중요하다.
지연 시간과 메모리 사용량은 사라져서는 안 되지만 부차적 지표로 남아야 한다. 정확도를 개선하지만 허용할 수 없는 지연을 추가하는 재순위화기는 대화형 에이전트를 약화시킬 수 있다. 목표는 정확도, 토큰, 지연 시간, DRAM 전반에서 측정된 운영 경계를 찾는 것이다.
개발자는 각 검색 문장이 어떤 기여를 했는지도 기록해야 한다. 간결한 이유 코드는 어휘 일치, 새로운 주장, 모순, 시간적 의존성, 출처 권위를 식별할 수 있다. 이런 로그는 생성기에게 스스로를 설명하라고 요구하지 않고도 과도한 검색을 진단할 수 있게 한다.
한 가지 중요한 위험은 여전히 검증되지 않았다. SALT의 현재 챗봇 정확도, 메모리 압축, 에이전트 성능을 확립한 공개 벤치마크는 없다. 이 아키텍처는 검증된 발전이 아니라 초기 프로젝트 보고서로 논의되어야 한다.
SALT가 에이전트로 확장 가능한지 보여줄 세 가지 신호
SALT의 다음 이정표는 더 큰 메모리 저장소나 더 관대한 컨텍스트 예산이 아니라 재현 가능한 정밀도 결과여야 한다.
첫 번째 신호는 오라클 격차 벤치마크다. 개발자는 직접 질문, 멀티홉, 에이전트 행동 작업 전반에서 현재 검색을 사람이 선택한 최소 증거 세트와 비교해야 한다. 결과는 모델 크기별로 세분화해 제시해야 한다.
SALT가 더 적은 토큰을 사용하면서 오라클 성능에 근접한다면, 그 증거는 테마 선택 전략을 뒷받침할 것이다. 작은 모델에서 격차가 커진다면, 현재 목적 함수는 생성기가 활용할 수 없는 폭을 선택하고 있는 것이다.
두 번째 신호는 적응형 예산 책정이다. 고정된 20퍼센트 정책은 절대 토큰 상한 및 단계적 검색과 경쟁해야 한다. 비교는 답변 정확도, 행동 성공률, 검색된 주장, 지연 시간, 근거 없는 단언을 측정해야 한다.
적응형 정책은 완전한 증거 사슬을 보존할 때만 승리한다. 예외나 의존성을 제거한다면 토큰 수 감소만으로는 시스템을 약화시킬 것이다. 가장 강력한 결과는 작업 수준 재현율을 낮추지 않으면서 정밀도를 높이는 것이다.
세 번째 신호는 에이전트 시험 중 모듈 인지형 출처 추적이다. 각 메모리는 원래 모듈, 타임스탬프, 권위, 출처 자료를 식별해야 한다. 테스트에는 서로 다른 에이전트에서 나온 상충하고 오래된 메모리가 포함되어야 한다.
출처 인지형 선택이 잘못된 행동을 줄인다면, 다중 에이전트 메모리에는 테마 우위 이상의 것이 필요하다. 권위, 최신성, 모순에 관한 명시적 규칙이 필요하다. 출처 정보의 효과가 미미하다면 핵심 문제는 순위화나 생성의 다른 지점에 있을 가능성이 크다.
이러한 신호는 공개 평가 패키지 안에 포함되어야 한다. 패키지에는 고정 쿼리, 라벨이 지정된 증거, 검색 로그, 생성된 출력, 모델 설정, 채점 규칙이 필요하다. 이러한 산출물이 없으면 외부 기여자는 제안된 변경이 왜 작동하는지 분리해낼 수 없다.
완전한 벤치마크가 나오기 전에도 커뮤니티 제안은 유용할 수 있다. 프로젝트는 최대 한계 관련성, 크로스 인코더 재순위화, 주장 클러스터링, 쿼리 중심 압축을 시험할 수 있다. 하지만 일화만을 근거로 어떤 방법도 현재 선택기를 대체해서는 안 된다.
가장 강력한 단기 설계는 보수적일 가능성이 크다. 압축된 증거 핵심을 검색하고, 연결된 한정 조건을 보존하며, 특정 정보 격차를 감지한 뒤에만 확장해야 한다. 하나의 광범위한 컨텍스트를 모든 곳에 전달하는 대신, 선택된 증거를 각 모듈의 작업에 맞게 라우팅해야 한다.
에이전트 시스템에는 메모리 위생도 필요하다. 중복을 병합하고, 일시적 상태를 만료시키고, 원본 출처를 보존하며, 관찰과 결론을 구분해야 한다. 그렇지 않으면 에이전트가 이전 출력의 파생물을 반복적으로 저장하면서 검색 품질이 저하될 것이다.
이 패턴은 손실 복사와 닮았다. 도구가 사실을 생성하고, 한 에이전트가 이를 요약하고, 다른 에이전트가 그 요약을 다시 요약하며, 메모리 시스템은 모든 버전을 저장한다. 테마 범위는 공통된 출처에도 불구하고 이러한 항목을 일관된 증거로 보상할 수 있다.
출처 인지형 중복 제거는 반복 복사본이 만든 겉보기 합의를 방지할 수 있다. 선택기는 파생된 메모리를 원본 증거 아래에 그룹화해야 한다. 그러면 하나의 사실을 여러 방식으로 바꿔 쓴 표현에 프롬프트 토큰을 여러 개 소비하지 않아도 된다.
개인 지식 시스템을 구축하는 팀도 비슷한 과제에 직면한다. 모든 것을 수집하는 일은 회상이 관련성, 출처 경계, 시간을 보존할 때만 유용하다. 에이전트 메모리는 이러한 구분을 잘못했을 때의 비용을 증폭시킨다.
horizon machinelearning 논의에서 이것이 결정적인 지점이다. SALT는 트라이가 방대한 대화형 메모리를 저장할 수 있음을 증명할 필요가 없다. 메모리와 모듈 수가 늘어날수록 선택기가 가장 작은 충분 증거 세트를 복원할 수 있음을 보여줘야 한다.
따라서 다음으로 유용한 기여는 측정 가능해야 한다. 실패 세트를 공개하고, 필요한 증거에 라벨을 지정하며, 동일한 모델 조건에서 검색 정책을 비교해야 한다. 어떤 정책이 필요한 사실을 숨기지 않으면서 작은 모델의 정확도를 유지하는가?


