AllSpark Iris Search Agent, 해당 규모의 모델군 선도… 하네스에 따른 단서도
Xiaohongshu의 AllSpark 팀이 총 파라미터 35B와 397B의 두 가지 오픈 가중치 버전으로 AllSpark Iris search agent를 공개했다. 팀은 두 모델 모두 여러 까다로운 검색 벤치마크에서 동급 규모의 오픈 시스템을 앞선다고 밝혔다. 이 주장은 중요하지만, 가장 시사적인 결과는 리더보드 순위가 아니다. 주변의 컨텍스트 관리 시스템이 제공하는 성능 향상의 규모다.
Iris-mini와 Iris-pro는 다운로드 가능한 가중치와 공개 평가 하네스를 함께 제공한다. AllSpark는 상세한 기술 논문을 통해 데이터 파이프라인과 학습 과정도 설명했다. 팀은 추가 학습 자산도 공개할 예정이라고 밝혔으며, 이에 따라 연구자들은 다듬어진 데모 이상의 결과를 재현할 수 있는 경로를 갖게 된다.
이번 출시는 다른 오픈 검색 에이전트 프로젝트에 두 가지 측면에서 압박을 가한다. Iris는 동급 규모에서 강력한 점수를 제시하는 동시에, 추론 래퍼가 그 점수에 얼마나 큰 영향을 미칠 수 있는지도 보여 준다. 이 때문에 이 프로젝트는 모델 공개이자 업계가 무엇을 측정해야 하는지에 대한 주장으로도 볼 수 있다.
AllSpark Iris Search Agent는 두 개의 체크포인트 이상이다
AllSpark는 학습된 가중치, 도구, 명시적인 컨텍스트 제어에 따라 동작하는 한 쌍의 검색 시스템을 공개했다.
Iris-mini는 Qwen3.6-35B-A3B를 사후 학습한 모델이다. 총 350억 개의 파라미터를 포함하지만, 토큰마다 활성화되는 파라미터는 약 30억 개다. Iris-pro는 Qwen3.5-397B-A17B를 기반으로 하며, 총 3,970억 개의 파라미터와 약 170억 개의 활성 파라미터를 갖는다.
두 모델 모두 mixture-of-experts 아키텍처를 사용한다. 이 설계는 전체 모델을 활성화하는 대신 각 토큰을 선택된 전문 파라미터 그룹의 하위 집합으로 라우팅한다. 따라서 총 파라미터 수는 모델 용량을 설명하고, 활성 파라미터 수는 각 생성 단계에 필요한 연산량을 더 잘 보여 준다.
각 버전은 256,000토큰의 컨텍스트 윈도우를 지원한다. 검색 에이전트는 긴 조사 과정에서 질의, 반환된 페이지, 추출된 구절, 중간 추론, 도구 메시지를 축적하기 때문에 이 용량은 중요하다. 대규모 컨텍스트 윈도우도 에이전트가 어려운 다단계 질문을 해결하기 전에 채워질 수 있다.
Iris-mini weights와 Iris-pro weights는 Apache 2.0 라이선스로 제공된다. 이 라이선스는 조건에 따라 폭넓은 사용, 수정, 재배포를 허용한다. 따라서 이번 공개는 Iris를 호스팅된 인터페이스에만 제한하지 않고 개발자에게 두 모델 규모 모두에 대한 직접적인 접근 권한을 제공한다.
AllSpark는 모델 서빙과 지원 벤치마크 실행을 위한 구성을 포함한 evaluation code도 공개했다. 이 하네스는 OpenAI 호환 도구 호출 인터페이스를 사용하므로, 에이전트를 검색 및 페이지 읽기 기능에 연결할 수 있다.
검색 에이전트는 반복적인 증거 순환을 제어한다는 점에서 일반 챗봇과 다르다. 무엇을 검색할지 결정하고, 반환된 자료를 해석하며, 증거가 불완전하면 질의를 바꾸고, 답변할 수 있는 시점을 판단한다. 최종 응답은 이 순환 안의 모든 결정에 좌우된다.
AllSpark는 단일 ReAct 에이전트의 결과를 보고한다. ReAct는 추론과 도구 행동을 번갈아 수행하는 패턴으로, 모델이 각 관찰 후 접근 방식을 수정할 수 있게 한다. 보고된 구성은 서브 에이전트나 별도의 테스트 시점 검증 팀을 사용하지 않는다.
이 세부 사항은 벤치마크 결과가 무엇을 나타내는지 범위를 좁힌다. Iris는 대규모 병렬 에이전트 조직을 가동하고 그 결과를 병합해 주요 점수를 얻는 것이 아니다. 다만 도구, 컨텍스트, 재시도, 답변 형식을 관리하는 추론 하네스에는 여전히 의존한다.
따라서 이번 공개는 단순한 모델 파일 모음보다 더 유용하다. 연구자들은 체크포인트를 둘러싼 운영 가정을 살펴볼 수 있다. 또한 Iris가 다른 검색 제공업체, 컨텍스트 정책, 배포 예산 아래에서 실행될 때 어떤 성과가 유지되는지도 시험할 수 있다.
개발자에게는 더 작은 모델이 더 접근하기 쉬운 실험 대상이다. 35B mixture-of-experts 체크포인트도 상당한 규모지만, 3B 활성 파라미터 수는 그 동작을 특히 흥미롭게 만든다. 이는 토큰마다 수천억 개의 파라미터를 활성화하지 않고도 목표형 사후 학습으로 경쟁력 있는 검색 동작을 만들 수 있는지 묻는다.
397B 버전은 훨씬 더 큰 용량에서 같은 방식을 시험한다. 두 모델을 비교하면 규모 확장에 반응하는 실패 유형과 추론 메커니즘에 더 크게 의존하는 실패 유형에 대한 근거를 제공한다.
이 구분은 Iris를 둘러싼 핵심 긴장을 만든다. 가중치는 공개돼 있지만, 홍보된 에이전트를 재현하려면 가중치를 불러오는 것만으로는 부족하다. 보고된 동작이 나타난 검색 환경 역시 재구성해야 한다.
동급 규모 Search Agents가 이제 압박받는 이유
Iris는 선도적 벤치마크 주장을 내세우는 오픈 가중치 모델이 함께 공개해야 할 정보에 대한 기대치를 높인다.
AllSpark는 Iris-mini를 대략 30B~35B 범위의 오픈 가중치 시스템과 비교한다. 공개된 비교에는 MiroThinker-1.7-mini, FORT-Searcher, Apodex-1.0-mini, Nex-N2-mini, Agents-A1, XYZ-Aquila-mini가 포함된다.
Iris의 대표 컨텍스트 설정에서 Iris-mini는 BrowseComp 82.2점, BrowseComp-ZH 84.8점을 기록한다. DeepSearchQA에서는 86.9점, Humanity’s Last Exam의 텍스트 전용 하위 집합에서는 52.3점을 얻었다.
Iris-pro는 BrowseComp 88.6점, BrowseComp-ZH 85.1점, DeepSearchQA 92.9점, Humanity’s Last Exam 56.4점을 기록했다. AllSpark는 이를 각 파라미터 범위에서 가장 강력한 전반적 오픈소스 search-agent 결과라고 설명한다.
이 벤치마크들은 연구 과정의 서로 다른 부분을 평가한다. BrowseComp는 분산된 증거를 가로지르는 어려운 웹 브라우징을 강조한다. BrowseComp-ZH는 중국어 웹 검색에 유사한 과제를 적용한다. DeepSearchQA는 포괄적인 조사 답변을 측정하며, Humanity’s Last Exam은 전문가 수준의 지식과 추론을 강조한다.
채점 방식은 동일하지 않다. DeepSearchQA는 F1 측정값을 사용하고, 다른 보고 과제는 정확도를 사용한다. AllSpark는 Humanity’s Last Exam의 2,158개 문항 텍스트 전용 하위 집합에서 평가했으므로, 이 결과를 벤치마크의 모든 버전에 대한 점수로 해석해서는 안 된다.
비교가 완벽하게 통제된 모델 토너먼트를 구성하는 것도 아니다. AllSpark는 기준선 수치가 프로젝트별 자체 컨텍스트 전략을 사용할 수 있는 공개 보고서에서 가져온 것이라고 언급한다. 일부 경쟁 모델 점수는 Iris 연구자가 아닌 다른 팀이 재현했다.
이 한계가 결과를 무효화하지는 않는다. 다만 그 의미를 바꾼다. Iris는 강력한 동급 규모 패키지를 제시하지만, 표는 모델 품질과 에이전트 아키텍처 및 평가 절차의 차이를 함께 결합한다.
바로 이 때문에 다른 오픈 프로젝트가 압박을 받는다. 관리형 결과와 비관리형 결과를 함께 공개하는 대안적 릴리스가 등장한 상황에서, 최상위 점수만 보고하는 모델 카드는 이제 불완전해 보인다. 개발자는 성능 향상이 사후 학습, 더 많은 도구 호출, 컨텍스트 압축, 재시도, 더 강력한 판정 구성 중 어디에서 비롯됐는지 점점 더 알아야 한다.
따라서 경쟁의 기준은 체크포인트에서 재현 가능한 전체 에이전트로 이동하고 있다. 유용한 릴리스에는 가중치, 프롬프트, 도구 계약, 검색 동작, 컨텍스트 정책, 평가 설정이 필요하다. 이 요소 중 하나라도 빠지면 외부 팀이 주장된 결과를 재현하지 못할 수 있다.
상용 연구 제품도 유사한 과제에 직면한다. 폐쇄형 시스템은 독점 모델, 검색 인덱스, 오케스트레이션 계층, 검증 루프를 결합할 수 있다. 이들은 더 나은 엔드투엔드 신뢰성을 제공할 수 있지만, 외부인은 어느 구성 요소가 이점을 만들었는지 쉽게 분리할 수 없다.
Iris는 오픈 개발자에게 검토할 수 있는 구체적인 시스템을 제공한다. 개발자는 검색 백엔드를 바꾸고, 컨텍스트 재설정을 제거하고, 턴 예산을 제한하거나, 비공개 문서에서 시험할 수 있다. 이러한 실험은 배포 결정을 위해 단일 공개 점수보다 더 중요하다.
이번 공개는 에이전트 경제성을 평가해야 한다는 근거도 강화한다. 한 번의 제한된 검색으로 정확히 답하는 시스템은 여러 번 재시작하는 시스템과 운영 특성이 다르다. 도구 호출 수, 토큰 사용량, 지연 시간, 실패율 없이 정확도만 제시하면 구매자는 불완전한 비교를 받게 된다.
연구 보조 도구를 구축하는 팀에게 단기적인 압박은 실용적이다. 에이전트가 답을 찾는지뿐 아니라, 방어 가능한 증거를 얼마나 일관되게 수집하는지도 설명해야 한다. 또한 페이지가 사라지거나 검색 결과가 바뀌거나 과제가 명목상 컨텍스트 예산을 초과할 때 어떤 일이 일어나는지도 보여줄 필요가 있다.
Iris가 이 질문들을 해결하지는 않는다. 하지만 경쟁 프로젝트가 이를 피하기는 더 어렵게 만든다.
SFT-RL Climbing은 답변만이 아니라 검색 루프를 학습시킨다
핵심 기술 기여는 어려운 증거 사슬과 실제 검색과의 반복적 상호작용을 중심으로 설계된 학습 파이프라인이다.
Iris research paper는 웹 코퍼스의 하이퍼링크 구조에서 시작하는 데이터 파이프라인을 설명한다. 페이지를 노드, 링크를 에지로 취급한 뒤 선택된 시드 페이지 주변에 로컬 그래프를 구축한다.
이 시스템은 이 그래프를 사용해 다단계 질문을 만든다. 다단계 질문은 답이 담긴 한 문장을 검색하는 것이 아니라 여러 위치의 증거를 결합해야 한다. 이 구성은 웹 조사를 어렵게 만드는 일련의 결정을 겨냥한다.
AllSpark는 답변이 아닌 엔터티를 설명적 참조로 다시 작성한다. 이 단계는 모델이 검색창에 직접 입력할 수 있는 명백한 이름을 제거한다. 목표는 조사를 측정하도록 설계된 과제를 얕은 문자열 매칭만으로 해결하지 못하게 하는 것이다.
후보 질문은 이어서 두 가지 검사를 거친다. 기준 모델은 저장된 지식만으로 답할 때 실패해야 한다. 같은 모델은 뒷받침 증거를 받은 뒤에는 성공해야 한다. 이 필터는 식별된 출처로 답할 수 있으면서도 실제로 검색이 필요한 질문을 남기려 한다.
강력한 교사 모델은 채택된 질문을 검색 궤적으로 전환한다. 궤적은 과제 수행 중 생성된 추론 단계, 질의, 관찰, 결론의 순서를 기록한다. AllSpark는 지도 미세 조정 전에 완전한 궤적 수준과 개별 턴 수준 모두에서 이 사례를 필터링한다.
지도 미세 조정, 즉 SFT는 원하는 동작의 선별된 예시로 모델을 학습시킨다. Iris에서 이 예시들은 최종 응답보다 더 많은 것을 다룬다. 에이전트가 질의를 선택하고, 페이지를 처리하며, 추가 증거가 필요한지 판단하는 방식을 보여 준다.
이후 모델은 실제 검색을 상대로 강화학습을 수행한다. 강화학습은 고정된 목표 응답을 복사하는 대신 보상 신호를 사용해 동작을 조정한다. AllSpark는 학습 클러스터 내에서 보상 판정기와 관찰 요약기를 제공한다.
팀은 SFT-RL climbing이라 부르는 과정에서 SFT와 강화학습 라운드를 번갈아 수행한다. 강화학습 중 발견된 성공적이지만 어려운 궤적은 다음 지도 학습 단계로 돌아간다. 효율적인 해결책도 우대해, 다음 탐색 라운드 전에 유용한 동작을 보존하도록 모델을 유도한다.
이 순환은 에이전트 학습에서 흔한 문제를 해결한다. 정적인 시연은 알아볼 수 있는 패턴을 가르칠 수 있지만, 변화하는 웹에서 발생하는 모든 실패를 포괄할 수는 없다. 순수 강화학습은 새로운 전략을 탐색할 수 있지만, 잡음이 많거나 비효율적인 동작을 만들어낼 수 있다. 단계를 번갈아 수행하면 각 단계가 다른 단계의 약점을 보완할 수 있다.
긴 롤아웃은 또 다른 인프라 문제를 낳는다. 검색 요청 하나가 실질적인 학습 한도를 넘을 만큼 많은 도구 트래픽과 토큰을 생성할 수 있다. AllSpark은 지나치게 긴 롤아웃을 요청 단위에서 중단하고, 이후 커밋된 접두사부터 재개한다고 설명한다.
보고된 학습 설정은 지도 학습 2에포크, 전역 배치 크기 64, 최대 시퀀스 길이 262,144토큰을 사용했다. 두 모델 모두 이 검색 특화 사후 학습에 앞서 Qwen mixture-of-experts 체크포인트로 초기화됐다.
AllSpark은 평가 중 벤치마크 호스팅 페이지에 대한 접근도 차단했다고 밝혔다. 관련 Hugging Face 데이터셋 및 Space 경로의 페이지는 검색 결과에서 제거되고, 스크래핑 단계에서 거부되며, 도구 사용 후에도 점검됐다. 이 방어책은 벤치마크 정답의 직접적인 유출을 줄이기 위한 것이다.
이러한 방법 중 어느 것도 오염 없는 평가를 보장하지는 않는다. 학습 코퍼스, 베이스 모델 사전학습, 미러링된 벤치마크 논의는 여전히 데이터 유출 분석을 복잡하게 만들 수 있다. 다만 이러한 보호 조치를 공개함으로써 독립 평가자가 검증할 수 있는 구체적인 절차를 제시한다.
검색 성능은 암기된 사실 지식으로 환원할 수 없기 때문에 데이터 레시피는 특히 중요하다. 에이전트는 누락된 증거를 인지하고, 유용한 질의를 구성하며, 성과 없는 결과 뒤에도 회복해야 한다. 이러한 행동은 사후 학습에 사용된 궤적의 품질과 다양성에서 비롯된다.
이 메커니즘은 Iris가 공개 웹 검색 밖에서도 중요할 수 있는 이유를 설명한다. 유사한 증거 순환은 기술 지원, 법률 검토, 시장 조사, 내부 지식 탐색에서 나타난다. 팀은 공개 인터넷 대신 승인된 리포지터리를 탐색하도록 에이전트를 조정할 수 있다.
예를 들어 엔지니어링 조직은 에이전트에게 장애 보고서, 설계 문서, 코드 변경 사항을 연결하도록 요청할 수 있다. 모델은 여전히 어디를 검색할지, 그리고 증거가 결론을 뒷받침하는지를 판단해야 한다. 잘 정리된 searchable knowledge base는 에이전트의 실질적인 환경 일부가 된다.
이러한 전이는 자동으로 이뤄지지 않는다. 웹에서 학습된 질의 습관은 비공개 명명 규칙이나 불완전한 내부 문서에서 성능이 낮을 수 있다. 기업은 중요한 조사 업무에 시스템을 신뢰하기 전에 도메인 특화 테스트, 접근 제어, 출처 수준 인용을 마련해야 한다.
그럼에도 Iris는 구체적인 가설을 제시한다. 더 나은 검색 에이전트는 전체 증거 수집 루프를 학습함으로써 만들어진다는 것이다. 더 큰 베이스 모델은 도움이 되지만, 그 루프에 들어가는 하나의 요소일 뿐이다.
벤치마크 선두는 의도적인 망각에 달려 있다
Iris의 가장 중요한 결과는 문맥을 버리는 것이 경쟁 모델 간에 보고된 많은 차이보다 검색 에이전트를 더 크게 개선할 수 있다는 점이다.
AllSpark은 Iris를 문맥 관리 적용 여부에 따라 모두 평가한다. 대표 구성은 discard-all이라는 방법을 사용한다. 프롬프트가 정의된 임계값을 넘으면 하니스는 대화를 원래 질문으로 재설정한다.
에이전트가 누적된 도구 기록을 잃기 때문에 이 이름은 파괴적으로 들린다. 그러나 긴 검색 기록에는 중복된 페이지 텍스트, 실패한 질의, 더 이상 도움이 되지 않는 추론이 포함된다. 이런 자료를 제거하면 추가 조사를 위한 공간이 다시 확보된다.
하니스는 전체 대화 밖에서 유용한 진행 상황을 보존할 수 있다. 관련 재시도 설정은 파싱 가능한 답변을 만들지 못한 에피소드를 다시 시작하고, 배제된 가능성에 대한 짧은 요약을 이어받는다. 이는 망각을 우발적인 손실이 아니라 능동적인 검색 정책으로 바꾼다.
더 작은 모델에서 효과가 가장 뚜렷하게 나타난다. 문맥 관리 없이 Iris-mini는 BrowseComp에서 64.7점을 기록한다. discard-all을 적용하면 82.2점에 도달하며, 17.5점 상승한다.
동일한 비교에서 BrowseComp-ZH는 72.3에서 84.8로 상승한다. DeepSearchQA는 81.0에서 86.9로, Humanity’s Last Exam은 43.2에서 52.3으로 오른다.
discard-all과 재시도를 결합한 구성은 Iris-mini를 BrowseComp 85.9, BrowseComp-ZH 85.1, DeepSearchQA 89.9, Humanity’s Last Exam 52.4까지 끌어올린다. AllSpark은 대표 비교에 이처럼 더 공격적인 구성을 사용하지 않는다.
더 큰 Iris-pro 역시 이점을 얻지만, 일반적으로 효과는 더 작다. 논문은 Iris-mini가 동일한 제약을 해결하는 데 더 많은 단계를 필요로 하므로 문맥을 더 자주 소진한다고 주장한다. Iris-pro는 문맥이 결정적인 한계가 되기 전 더 많은 추론을 완료할 수 있다.
이는 모델 규모를 해석하는 데 유용한 관점을 제공한다. 더 큰 모델은 단지 더 많은 것을 알거나 더 잘 추론하는 데 그치지 않을 수 있다. 더 적은 비용이 드는 상호작용으로 답에 도달해 회복 메커니즘에 대한 의존도를 낮출 수 있다.
결과는 벤치마크별로도 다르다. 문맥 관리는 Humanity’s Last Exam보다 BrowseComp에 더 큰 도움을 준다. AllSpark은 그 패턴을 세션이 실제로 문맥을 소진하는 빈도에 기인한다고 설명한다.
BrowseComp 과제는 반복적인 검색, 필터링, 증거 통합을 요구한다. Humanity’s Last Exam은 전문가 지식과 추론에 더 큰 비중을 두며, 이 경우 웹 검색은 모든 단계를 지배하지 않고 답변을 보완할 수 있다.
한 결과는 용량이 항상 주된 병목은 아니라는 점을 시사한다. discard-all과 재시도를 적용한 Iris-mini, 그리고 두 가지 관리 설정의 Iris-pro는 모두 BrowseComp-ZH에서 85.1에 도달한다. 논문은 이것이 289개 질문 중 246개 정답과 같다고 언급한다.
이러한 수렴에는 여러 설명이 가능하다. 남은 질문에는 모호성, 접근 불가능한 증거, 평가자 한계 또는 추가 모델 용량으로 해결되지 않는 검색 실패가 포함될 수 있다. 한 벤치마크에서 관측된 상한선이 일반적인 한계를 입증하지는 않지만, 규모가 모든 검색 오류를 해결한다고 가정해서는 안 된다는 경고가 된다.
이것이 AllSpark Iris 검색 에이전트 출시의 핵심적인 반전이다. 256K 문맥 창은 거대해 보이지만, 단순한 재설정이 결과를 실질적으로 개선할 수 있다. 더 많이 축적된 문맥이 항상 더 유용한 문맥은 아니다.
이 발견은 제품 설계에 영향을 준다. 에이전트 인터페이스는 흔히 단일 대화를 연속성이 본질적으로 가치 있는 것처럼 제시한다. 그러나 인터페이스 뒤에서 신뢰할 수 있는 시스템은 그 대화를 여러 차례 요약하고, 정리하고, 분기하거나, 다시 시작해야 할 수 있다.
이는 오픈 에이전트와 클로즈드 에이전트 간 비교도 복잡하게 만든다. 두 제품이 같은 기반 모델을 사용하더라도, 한쪽이 문맥을 더 효과적으로 관리한다면 서로 다른 결과를 낼 수 있다. 반대로 더 약한 모델도 더 비싼 검색 전략과 결합되면 더 강해 보일 수 있다.
따라서 Iris를 평가하는 개발자는 문맥 정책을 구성 가능한 구성 요소로 다뤄야 한다. 성공률과 함께 지연 시간, 토큰 소비량, 검색 요청 수, 재시작 빈도를 측정해야 한다. 더 높은 점수는 드문 조사 업무에서는 추가 비용을 감수할 가치가 있을 수 있지만, 대량 워크플로에는 부적합할 수 있다.
의도적인 망각은 문맥 창의 중요성이 사라졌다는 증거가 아니다. 더 큰 창은 기록이 제약으로 작용하는 시점을 늦춘다. Iris 결과는 대신 에이전트가 그 창 안에 무엇을 남길 가치가 있는지 결정하는 정책을 여전히 필요로 한다는 점을 보여준다.
Iris 점수가 아직 입증하지 못하는 것
보고된 선두 성과는 시험해 볼 만큼 신뢰할 수 있지만, 우수한 실제 연구 능력의 독립적 증거는 아니다.
핵심 수치는 AllSpark 자체 평가에서 나온다. 팀은 관리되지 않은 결과와 하니스 구성을 포함해 이례적으로 유용한 세부 정보를 제공한다. 독립 그룹은 여전히 공개된 가중치와 코드를 사용해 점수를 재현할 필요가 있다.
기준선의 비교 가능성도 또 다른 한계다. 경쟁 프로젝트는 서로 다른 검색 엔진, 페이지 파서, 턴 제한, 문맥 제어, 평가자를 사용할 수 있다. 별도의 공개 보고서에서 구성한 표는 공유 평가 환경만큼 체크포인트 품질을 명확하게 분리해내지 못한다.
작은 인프라 변화도 검색 결과를 바꿀 수 있다. 검색 순위는 시간이 지나며 변하고, 웹사이트는 자동화된 리더를 차단하며, 추출된 페이지는 중요한 내용을 누락할 수 있다. 다음 달에 평가되는 모델은 같은 질의에 대해 다른 증거를 받을 수 있다.
판정 계층은 추가적인 불확실성을 야기한다. Iris는 해당되는 경우 LLM 기반 평가자와 함께 각 벤치마크의 공식 평가 프롬프트를 사용한다. 이런 평가자는 형식, 장황함, 답변 동등성에 민감할 수 있다. 파싱 가능한 짧은 답변은 같은 근본 결론을 담은 방어 가능한 보고서와 다르게 점수화될 수 있다.
검색 벤치마크는 연구 품질의 일부만 포착한다. 정확한 최종 답변이 모든 인용 출처가 신뢰할 만했음을 반드시 보여주지는 않는다. 또한 조작된 페이지, 프롬프트 인젝션, 조직적인 허위정보, 오래된 증거에 대한 저항력을 입증하지도 않는다.
AllSpark은 주 평가에서 질문당 단일 롤아웃을 보고한다. Pass@1은 여러 시도 중 최고 답변을 선택하는 일을 피하기 때문에 유용하다. 그러나 검색 결과가 바뀌는 반복 실행 전반에서 시스템의 변동성이 얼마나 큰지는 여전히 열려 있다.
재시도 실험은 비용 문제를 더 시급하게 만든다. 완전한 재시작은 또 다른 검색 및 생성 시퀀스를 소모할 수 있다. AllSpark은 재시도가 상당한 추론 비용을 부과하기 때문에, 재설정과 재시도를 결합한 결과를 주된 성능 설정이 아니라 상한 탐색으로 명시적으로 다룬다.
프로젝트의 공개성도 출시 시점에는 불완전하다. 모델 가중치와 평가 코드는 공개되어 있지만, 더 폭넓은 데이터와 학습 레시피는 단계적으로 제공될 예정이다. 논문은 과정을 설명하지만, 완전한 재현성은 구체적인 데이터셋, 필터, 프롬프트, 학습 구성 요소의 최종 공개에 달려 있다.
Apache 2.0으로 체크포인트를 라이선스하는 것은 실험의 법적 장벽을 낮춘다. 그렇다고 모든 업스트림 코퍼스나 생성된 궤적을 재배포할 수 있다는 보장은 아니다. 사용자는 상업적 파생물을 구축하기 전에 향후 데이터 공개의 출처와 조건을 검토해야 한다.
Iris-pro는 별도의 배포 장벽을 만든다. 17B 파라미터를 활성화하는 것은 397B 전체를 활성화하는 것보다 효율적이지만, 전체 체크포인트는 여전히 상당한 메모리와 인프라를 요구한다. 허용 가능한 지연 시간과 운영 한도 내에서 이를 서비스할 수 없는 팀에는 벤치마크 우위가 무의미할 수 있다.
Iris-mini는 더 많은 것을 보여주는 제품 후보일 수 있다. 더 작은 활성 규모는 통제된 배포로 가는 그럴듯한 경로를 제공하는 반면, 문맥 관리에 대한 의존성은 주변 비용을 드러낸다. 팀은 활성 파라미터만으로 효율성을 추론하기보다 전체 작업 경제성을 테스트해야 한다.
실제 환경 평가는 보류 판단도 포함해야 한다. 유용한 연구 에이전트는 증거가 모순되거나, 접근할 수 없거나, 불충분한 경우를 인식해야 한다. 공개 벤치마크는 종종 최종 답변에 보상하지만, 비즈니스 워크플로는 때때로 에이전트가 멈추고 불확실성을 보고하도록 요구한다.
보안 테스트 역시 중요하다. 검색 에이전트는 모델을 겨냥한 지시를 포함할 수 있는 페이지의 신뢰할 수 없는 텍스트를 소비한다. 강력한 검색 점수나 벤치마크 유출 통제만으로는 간접 프롬프트 인젝션에 대한 저항력을 입증할 수 없다.
이러한 단서가 Iris를 단순한 마케팅 활동으로 축소하지는 않는다. 이 프로젝트는 엄밀한 검토를 위한 충분한 산출물을 제공하며, 자체 논문에서 여러 한계도 밝힌다. სწორედ 이 때문에 이제 독립적인 재현이 중요하다.
올바른 단기 결론은 제한적이다. AllSpark은 문서화된 설정에서 동급 규모 모델 중 선도적인 결과를 보고하며, 관리되지 않은 점수도 경쟁력을 유지한다. Iris가 신뢰할 수 있는 연구 엔진이 될지는 벤치마크 정답 정확도를 넘어서는 테스트에 달려 있다.
Iris가 선두를 유지할지 결정할 세 가지 신호
다음 단계는 재현성, 운영 비용, 그리고 보고된 네 가지 벤치마크를 넘어선 성능에 관한 것이다.
첫 번째 신호는 핵심 결과의 독립적 재현이다. 연구자들은 공개 하네스를 통해 배포된 체크포인트를 실행하면서 도구 호출, 컨텍스트 재설정, 토큰 사용량, 실패 사례를 기록해야 한다. 근접한 재현 결과가 나온다면, 이번 배포가 비공개 평가 환경이 아니라 이전 가능한 시스템이라는 AllSpark의 주장을 뒷받침할 수 있다.
큰 차이가 난다고 해서 곧바로 연구의 타당성이 무효화되는 것은 아니다. 검색 결과와 페이지 접근 가능 여부는 변하며, 하드웨어와 서빙 소프트웨어도 긴 생성 과정에 영향을 줄 수 있다. 재현 연구자들은 이러한 차이를 문서화하고 관리형 및 비관리형 설정을 모두 시험해야 한다.
특히 비관리형 수치에 주목할 필요가 있다. 하네스가 제공하는 복구 지원이 적기 때문에, 이는 후학습 과정에서 습득한 행동을 더 명확하게 보여준다. 외부 평가자들이 이 우위를 재현한다면 Iris의 학습 파이프라인은 더욱 강력한 경쟁 기준점이 될 것이다.
두 번째 신호는 약속된 학습 데이터와 구현 세부 사항의 공개다. 모델 가중치는 최종 정책을 보여주지만, 작업 생성이나 궤적 필터링에 활용된 모든 결정을 드러내지는 못한다. 구체적인 아티팩트가 공개되면 연구자들은 난이도, 다양성, 정보 유출 위험, 출처 범위를 점검할 수 있다.
이 공개는 제거 연구도 가능하게 한다. 제거 연구는 한 구성 요소를 제외해 그 기여도를 측정하는 방식이다. 연구자들은 엔터티 재작성, 폐쇄형 지식 필터링, 턴 단위 필터링, 실시간 검색 강화학습, SFT-RL 순환 가운데 무엇이 가장 큰 성능 향상을 제공하는지 시험할 수 있다.
이러한 구성 요소가 다른 베이스 모델에도 이전된다면, Iris 레시피는 어느 체크포인트보다 더 중요해질 수 있다. 경쟁 팀들은 동일한 파이프라인을 채택해 리더보드 격차를 좁힐 수 있다. 반대로 이전에 실패한다면, 결과가 특정 Qwen 베이스나 내부 학습 조건에 더 크게 의존한다는 뜻일 수 있다.
세 번째 신호는 현실적인 예산과 적대적 조건에서의 평가다. 유용한 테스트는 검색 요청 수, 실제 경과 시간, 생성 토큰 수에 상한을 둬야 한다. 또한 인용, 출처 품질, 응답 보류, 악의적인 페이지 콘텐츠에 대한 저항성도 측정해야 한다.
이러한 제한 아래의 결과는 Iris-mini와 Iris-pro 간 실용적 절충 관계를 분명히 할 것이다. 더 큰 모델은 더 적은 턴으로 작업을 해결할 수 있는 반면, 더 작은 모델은 재설정과 추가 검색으로 이를 보완할 수 있다. 구매자가 필요한 것은 매개변수 수만이 아니라 전체 시스템 비용과 신뢰성이다.
경쟁사의 대응도 이 신호의 또 다른 부분을 제공할 것이다. 오픈 에이전트 프로젝트는 관리형 및 비관리형 결과를 공개해 자체 보고를 강화할 수 있다. 폐쇄형 제공업체는 인용 정확도, 지연 시간, 반복 실행 일관성에 관한 더 명확한 근거를 제시할 수 있다.
개발자에게 가장 좋은 즉각적 조치는 Iris를 검증 가능한 연구 스택으로 다루는 것이다. 먼저 자체 도메인에서 가져온 범위가 제한된 작업 세트로 시작하라. 에이전트가 올바른 출처를 검색하는지, 불완전한 페이지를 견디는지, 근거가 부족할 때 불확실성을 인정하는지를 기록해야 한다.
그런 다음 시스템 구성 요소를 한 번에 하나씩 변경하라. 컨텍스트 재설정을 비활성화하고, 검색 호출을 제한하며, 검색 제공업체를 교체하거나, 컨텍스트 창을 줄여볼 수 있다. 이러한 테스트는 AllSpark Iris 검색 에이전트가 실제 워크로드에 진정으로 유용한지, 그리고 벤치마크 우위가 어디에서 비롯되는지를 보여준다.
이번 배포는 이미 하나의 지속적인 교훈을 남겼다. 검색 에이전트의 성능은 모델과 그 운영 체제 간 상호작용에 달려 있다. 다음 질문은 독립적인 테스트가 Iris가 두 부분 모두를 개선했음을 확인할지, 아니면 컨텍스트가 가득 찬 뒤에도 더 효과적으로 계속 검색하는 방법을 주로 찾아낸 것인지를 가리는 일이다.



