Microsoft, Orchard를 공개했지만 재사용 가능한 에이전트 학습에는 여전히 규모 문제가 있다
- Ethan Carter

- 8월 12일
- 10분 분량
Microsoft Research가 세 가지 에이전트 학습 레시피를 갖춘 Orchard를 공개하며, 모든 에이전트 프로젝트에 전용 인프라가 필요하다는 통념에 도전했다. 이 프레임워크는 소프트웨어 엔지니어링, 브라우저 상호작용, 개인 비서 작업을 포괄한다. 핵심 약속은 재사용성이다. 하나의 환경 계층으로 데이터 수집, 지도 학습, 강화학습, 평가를 지원할 수 있다.
이는 오픈 에이전트 연구가 인프라 문제를 안고 있기 때문에 중요하다. 연구자들은 여러 오케스트레이션 라이브러리를 살펴볼 수 있지만, 유능한 에이전트 뒤에 있는 학습 시스템을 재현하는 일은 여전히 어렵다. 샌드박스, 도구 인터페이스, 보상 함수, 장기 궤적은 종종 하나의 작업과 긴밀히 결합된다.
Microsoft Orchard는 이러한 요소를 분리하려고 한다. 또 하나의 애플리케이션 프레임워크를 제시하는 대신, 에이전트가 행동하고 학습하는 환경에 초점을 맞춘다. 이러한 차이로 Orchard는 주로 개발자가 에이전트 애플리케이션을 구축하고 운영하도록 돕는 Microsoft Agent Framework나 AutoGen보다 실험용 학습 플랫폼에 더 가깝다.
보고된 결과는 상당하다. 다만 이는 성능이나 접근성에 대한 독립적 검증이 아니라 프로젝트 팀이 제시한 연구 결과다. 이번 공개에는 실질적인 긴장 관계도 있다. 재사용 가능한 소프트웨어는 엔지니어링 중복을 줄일 수 있지만, 대규모 에이전트 학습에는 여전히 모델, 컴퓨팅 자원, 작업 환경, 운영 전문성이 필요하다.
Orchard는 에이전트 환경을 공용 인프라로 전환한다
중요한 변화는 또 하나의 에이전트 인터페이스가 아니다. 에이전트의 전체 학습 주기를 따라가는 재사용 가능한 환경 계층이다.
이 프로젝트의 중심에는 격리된 환경을 관리하기 위한 Kubernetes 네이티브 서비스인 Orchard Env가 있다. 샌드박스는 에이전트가 호스트 시스템에 무제한으로 접근하지 않고도 명령을 실행하고, 파일을 수정하며, 애플리케이션을 탐색하고, 관측 정보를 받을 수 있도록 하는 통제된 작업 공간이다.
프로젝트의 agentic modeling framework에 따르면, 이 서비스는 REST 인터페이스를 통해 공통 작업을 제공한다. 여기에는 샌드박스 생성 및 삭제, 명령 실행, 파일 읽기 또는 쓰기, 네트워크 정책 적용이 포함된다.
환경은 모델 출력을 도구 동작으로 변환하는 소프트웨어인 에이전트 하네스와 분리된 상태로 유지된다. 추론 시스템 및 학습 알고리즘과도 분리된다. 따라서 연구자들은 모든 환경 관리 구성 요소를 다시 구축하지 않고도 모델이나 하네스를 바꿀 수 있다.
이러한 분리는 반복적으로 발생하는 마찰 요인을 해결한다. 코딩 에이전트에는 리포지터리 스냅샷, 빌드 도구, 비공개 테스트가 필요할 수 있다. 브라우저 에이전트에는 시각적 인터페이스와 웹사이트 상태가 필요하다. 개인 비서에는 도구 API와 작업별 검증이 필요하다.
이들 환경은 애플리케이션 계층에서 서로 달라 보인다. 하지만 그 아래에서는 각각 격리된 환경, 수명 주기 관리자, 관측 채널, 결과 채점 방법이 필요하다. 이 프레임워크는 이러한 공통 요구사항을 명시적으로 만들려 한다.
Microsoft는 테스트에서 이 서비스의 명령 실행 평균 시간이 0.28초였다고 밝혔다. 함께 공개된 논문은 1,000개의 샌드박스를 포함한 부하 테스트에서 100% 성공률을 보고한다. 이 수치는 연구자들의 구성 환경을 설명하는 것이며, 보편적인 프로덕션 보장으로 받아들여서는 안 된다.
아키텍처는 런타임 에이전트 주입을 사용해 작업별 컨테이너 이미지를 제어 서비스와 분리해 유지한다. 또한 실행 및 파일 작업을 샌드박스 포드 주소로 직접 라우팅한다. 논문은 이것이 Kubernetes 실행 채널과 관련된 일부 오버헤드를 피한다고 주장한다.
다른 운영 세부 사항은 에이전트 학습에 얼마나 많은 인프라가 필요한지를 보여준다. 시스템에는 비동기 샌드박스 생성, 준비 상태 모니터링, 하트비트 기반 정리, 네트워크 격리, 재시도, 리소스 확장이 포함된다. 화려한 기능은 아니지만, 이들 중 하나라도 실패하면 학습 실행이 무효화되거나 중단될 수 있다.
이러한 폭넓은 범위가 프로젝트의 연구 가치를 설명한다. 서로 다른 에이전트 작업을 연구하는 팀은 자체 모델, 도구, 보상 시스템을 유지하면서 동일한 제어 계층을 재사용할 수 있다. 원칙적으로는 실험 간에 달라지는 인프라 변수가 줄어들기 때문에 실험 비교도 쉬워진다.
이 프레임워크가 특화된 작업 설계를 없애는 것은 아니다. 연구자들은 여전히 유효한 환경을 만들고, 허용된 동작을 정의하며, 샌드박스를 보호하고, 의미 있는 평가기를 개발해야 한다. 이는 그러한 결정 자체를 없애기보다 그 결정을 둘러싼 반복적 엔지니어링을 줄인다.
실제 부담은 작업별 학습 스택에 쏠린다
Orchard는 코딩, 브라우저, 어시스턴트 에이전트에 각각 별도의 엔드투엔드 학습 시스템이 필요하다는 가정에 압박을 가한다.
대부분의 공개 에이전트 프레임워크는 오케스트레이션에 집중한다. 모델이 도구를 호출하고, 메시지를 교환하며, 워크플로를 따르거나, 여러 에이전트를 조율하도록 돕는다. 이러한 기능은 애플리케이션에 중요하지만, 모델을 개선하는 데 필요한 데이터와 피드백을 자동으로 만들어 주지는 않는다.
학습에는 또 다른 계층이 추가된다. 에이전트는 통제된 환경에서 작업을 시도하고, 여러 단계의 궤적을 생성하며, 신뢰할 수 있는 보상을 받고, 그 상호작용을 모델 업데이트로 전환해야 한다. 각 단계는 서로 다른 소프트웨어와 인프라에 의존할 수 있다.
궤적은 작업 수행 중 생성되는 추론, 행동, 도구 응답, 환경 상태의 완전한 순서를 뜻한다. 이 기록은 학습 예제가 될 수 있지만, 시스템이 그 구조를 보존하고 어떤 행동이 도움이 되었는지를 판단할 때만 가능하다.
이 문제는 장기 작업에서 더 두드러진다. 코딩 에이전트는 여러 파일을 검사하고, 패치를 시도하며, 테스트를 실행하고, 접근 방식을 수정한 뒤에도 마지막에 실패할 수 있다. 단순한 성공 또는 실패 라벨만으로는 어떤 중간 결정이 유용했는지 설명할 수 없다.
프로젝트의 해법은 파이프라인 단계 전반에서 환경과 궤적을 모두 재사용하는 것이다. 동일한 환경 서비스가 교사 모델 데이터 수집, 지도 미세 조정, 강화학습 롤아웃, 최종 평가를 지원한다. 연구자들은 각 단계마다 별도의 샌드박스 시스템을 구축할 필요가 없다.
이 설계는 프로덕션 지향 오케스트레이션과 대조적이다. Microsoft의 별도 agent application framework는 Python 및 .NET에서 에이전트를 구축하고 배포하는 데 초점을 맞춘다. AutoGen 역시 다중 에이전트 대화와 도구 사용을 위한 공통 패턴을 정립했다.
새 연구 스택은 다른 질문을 다룬다. 팀은 에이전트가 다음에 무엇을 해야 할지 결정하는 기본 정책을 어떻게 학습시킬 수 있을까? 이러한 차이 때문에 직접적인 제품 비교는 성립하지 않는다. 애플리케이션 프레임워크와 학습 환경은 서로를 보완할 수 있다.
대신 압박은 폐쇄형 수직 통합 연구 파이프라인에 가해진다. 동일한 공개 환경 계층이 여러 도메인에서 작동한다면, 팀이 모델, 하네스, 샌드박스, 평가기가 분리될 수 없는 묶음을 받아들여야 할 이유는 줄어든다.
이론적으로는 소규모 연구 그룹이 가장 큰 혜택을 받는다. 이들은 전체 분산 샌드박스 서비스를 엔지니어링하는 대신 공용 환경 프리미티브와 공개된 레시피로 시작할 수 있다. 또한 이전에는 훨씬 더 큰 시스템과 연관됐던 작업에서 더 작은 모델을 시험할 수 있다.
그러나 “소규모”는 여전히 상대적인 개념이다. Kubernetes 샌드박스, 추론 서버, 교사 모델, 강화학습 작업을 실행하려면 여전히 상당한 기술적 깊이가 필요하다. 이번 공개는 복잡성의 한 범주를 낮추지만, 에이전트 학습을 일반적인 노트북 워크플로로 바꾸지는 않는다.
조직은 이러한 실험을 둘러싼 지식 관리도 체계적으로 해야 한다. 궤적, 평가 실패, 구성 변경, 작업 정의는 빠르게 검색하기 어려운 정보가 된다. technical knowledge base는 최종 벤치마크 점수뿐 아니라 결과에 이른 추론도 보존할 수 있다.
따라서 전략적 전환의 핵심은 모듈성이다. 연구자들은 선호하는 모델과 에이전트 인터페이스를 유지하면서 맞춤형 환경 백엔드를 교체할 수 있다. 이 패턴이 채택된다면 인프라 재사용은 공개 에이전트 연구의 기본 기대치가 될 수 있다.
Microsoft Orchard는 실패에서 유용한 요소를 학습한다
이 프레임워크의 가장 강력한 아이디어는 성공하지 못한 에이전트 실행에도 가치 있는 학습 증거가 담길 수 있다는 점이다.
Orchard-SWE라는 소프트웨어 엔지니어링 레시피는 MiniMax-M2.5와 Qwen3.5-397B에서 증류한 약 107,000개의 궤적으로 시작한다. Microsoft는 이 코퍼스가 2,788개의 GitHub 리포지터리를 아우른다고 보고한다.
프로젝트의 trajectory dataset은 107,185개의 소프트웨어 엔지니어링 기록을 설명한다. 여기에는 해결된 궤적 74,649개와 해결되지 않은 궤적 32,536개가 포함된다. 해결된 기록은 최종 패치가 작업의 비공개 테스트 모음을 통과했다는 의미다.
전통적인 지도 미세 조정은 성공한 예시를 선호한다. 모델이 올바른 결과에 도달한 행동을 재현하도록 학습하기 때문에 직관적으로 타당하다. 그러나 실패한 모든 궤적을 버리면 유용한 중간 작업까지 낭비할 수 있다.
실패한 코딩 실행도 관련 모듈을 정확히 찾고, 잘못된 조건을 식별하며, 유효한 패치의 대부분을 작성했을 수 있다. 이후 한 번의 수정이 해법을 망가뜨릴 수 있다. 전체 궤적을 무가치한 것으로 취급하면 그 이전의 진전을 잃게 된다.
이 레시피는 그 신호를 복원하기 위해 크레딧 할당 지도 미세 조정을 도입한다. 크레딧 할당은 하나의 결과를 모든 단계에 부여하는 대신, 어떤 행동이 진전에 기여했는지를 식별하는 것을 뜻한다.
해결되지 않은 실행의 경우, 교사 모델이 최종 테스트 결과와 함께 전체 궤적을 검토한다. 각 단계 이후 작업 해결 확률이 어떻게 변했는지 추정한다. 이후 파이프라인은 이 추정 확률이 상승한 연속 구간을 선택한다.
이러한 상승 구간은 지도 학습 목표가 된다. 이전 관측은 문맥으로 계속 사용할 수 있으며, 학습 손실은 진전을 나타낸다고 판단된 어시스턴트 생성 추론과 행동에 집중한다. 도구 응답은 예측 손실에서 제외된다.
이 기법이 실패를 성공으로 바꾸는 것은 아니다. 주장은 더 제한적이다. 실패한 시도의 일부는 생산적인 탐색이 어떤 모습인지 모델에 가르칠 수 있다. 이 학습의 신뢰성은 사후적으로 평가하는 교사 모델의 추정에 달려 있다.
그다음 레시피는 모델이 새로운 시도를 생성하고 작업 수준의 보상을 받는 강화학습을 추가한다. 어려운 부분은 대부분의 예산을 획일적인 결과에 쓰지 않으면서 정보량이 많은 시도 그룹을 확보하는 일이다.
모든 시도가 성공하면 어떤 정책 선택이 더 나았는지에 대한 정보가 거의 없다. 모든 시도가 실패할 때도 같은 문제가 발생한다. 표준적인 고정 크기 샘플링은 분산이 낮은 그룹을 생성하는 데 상당한 컴퓨팅 자원을 쓸 수 있다.
Microsoft는 대안으로 Balanced Adaptive Rollout을 제시한다. 이 방법은 시도를 점진적으로 생성하고, 양성과 음성 보상이 유용하게 균형을 이루는 학습 그룹을 구성하려 한다. 정보량이 있는 그룹을 찾으면 중단할 수 있으며, 고정된 최대 예산 내에서 계속할 수도 있다.
이 접근법은 단순한 정확도보다 효율성을 겨냥한다. 의미 있는 비교를 만들기 위해 추가 시도가 필요한 프롬프트에 더 많은 샘플링을 배정한다. 계속 부적합한 그룹은 필터링하고 다른 작업의 그룹으로 보충할 수 있다.
이 프로젝트는 Qwen3-30B-A3B-Thinking으로 초기화한 모델이 지도 미세 조정 후 SWE-bench Verified에서 64.3%를 기록했다고 보고했다. 강화학습 후에는 67.5%에 도달했다.
SWE-bench Verified는 에이전트가 재현 가능한 리포지토리 환경에서 실제 GitHub 이슈를 해결할 수 있는지 평가한다. 점수는 벤치마크 버전, 하니스, 추론 설정, 평가 절차에 따라 달라지므로, 비교하려면 방법론을 면밀히 일치시켜야 한다.
Microsoft는 이 결과를 비슷한 규모의 오픈 모델 가운데 새로운 최고점이라고 설명한다. 이 단서는 중요하다. 이 결과가 서로 다른 컴퓨팅 예산이나 공개되지 않은 스캐폴딩을 사용하는 폐쇄형 모델을 포함한 모든 에이전트 시스템보다 우수함을 입증하는 것은 아니다.
그럼에도 리더보드 순위보다 메커니즘이 더 흥미롭다. 부분적 진전에서 학습하고, 유의미한 보상 변동을 위해 샘플링하는 기법은 다른 팀도 독립적으로 검증할 수 있다. 그 가치는 보고된 하나의 점수에만 전적으로 의존하지 않는다.
하나의 환경이 매우 다른 세 가지 에이전트를 지원한다
세 가지 레시피는 모델 규모, 인터페이스, 작업 구조, 보상 설계가 달라져도 인프라 재사용이 유지되는지 시험한다.
코딩은 가장 큰 시연 사례이지만, 유일한 사례는 아니다. Orchard-GUI는 브라우저 인터페이스와 상호작용하는 40억 파라미터 비전 언어 모델에 동일한 환경 추상화를 적용한다.
이 레시피는 약 400개의 증류된 궤적과 2,200개의 개방형 작업을 사용한 것으로 전해진다. Microsoft는 그 결과 모델이 WebVoyager에서 74.1%, Online-Mind2Web에서 67.0%, DeepShop에서 64.0%의 성공률을 달성했다고 밝혔다.
이 벤치마크들은 서로 다른 형태의 웹 상호작용을 다룬다. 브라우저 에이전트는 시각적 상태를 해석하고, 행동을 선택하며, 웹사이트의 반응에 맞춰 적응해야 한다. 코딩 작업과 달리 성공은 테스트 가능한 패치를 만드는 대신 동적인 인터페이스를 탐색하는 데 달려 있을 수 있다.
보고된 데이터 규모는 소프트웨어 엔지니어링 코퍼스보다 훨씬 작다는 점에서 주목할 만하다. 이는 집중된 레시피와 안정적인 환경이 작은 모델도 파라미터 수에서 최대 규모의 독점 시스템과 맞먹지 않고 경쟁하도록 도울 수 있다는 Microsoft의 주장을 뒷받침한다.
다만 벤치마크 성공이 테스트 분포 밖에서도 신뢰할 수 있는 브라우징을 보장하지는 않는다. 웹사이트는 바뀌고, 인터페이스는 모호한 상태를 드러내며, 작은 시각적 차이도 에이전트의 경로를 바꿀 수 있다. 평가자에게도 작업 완료에 대한 정확한 정의가 필요하다.
세 번째 레시피인 Orchard-Claw는 개인 비서 에이전트를 겨냥한다. 논문에 따르면 Qwen3-30B-A3B-Thinking 백본과 약 200개의 합성 작업을 사용한다.
Microsoft는 Claw-Eval에서 pass@3 59.6%를 보고했다. Pass@3는 에이전트에 최대 세 번의 시도를 허용하고, 그중 최소 한 번이 통과하면 작업을 성공으로 계산한다. 모델이 더 강력한 ZeroClaw 하니스와 함께 작동할 때 결과는 73.9%로 상승한다.
이 격차는 에이전트 벤치마크에 관한 핵심 교훈을 보여 준다. 모델은 에이전트 시스템의 한 부분일 뿐이다. 하니스 설계, 도구 형식화, 재시도 동작, 컨텍스트 관리, 평가 규칙은 최종 결과에 큰 영향을 미칠 수 있다.
이는 소형 모델에 관한 주장도 복잡하게 만든다. 효과적인 인프라로 둘러싸이면 소형 정책도 좋은 성능을 낼 수 있지만, 전체 시스템은 여전히 운영 측면에서 까다로울 수 있다. 파라미터 수만으로는 배포 비용이나 복잡성을 측정할 수 없다.
세 가지 레시피를 함께 보면, 하나의 코딩 벤치마크를 세 가지 변형으로 시험하는 것보다 이식성에 대한 더 신뢰할 만한 검증이 된다. 텍스트와 비전, 결정론적 테스트와 개방형 인터페이스, 서로 다른 모델 규모를 아우른다.
공통 계층이 모든 도메인을 동일하게 만들지는 않는다. 각 레시피에는 여전히 고유한 데이터 수집, 보상 계산, 모델 백본, 에이전트 하니스가 있다. 재사용은 그러한 작업별 선택 아래에서 이뤄진다.
이 경계는 합리적이다. 범용 환경 서비스는 브라우저 작업과 리포지토리 복구가 같은 성공 기준을 가진 척하지 않으면서, 수명 주기와 통신 기본 요소를 표준화해야 한다.
더 넓은 질문은 외부 팀이 이 분리를 재현할 수 있는지다. 내부 연구 시스템은 다이어그램상 모듈형으로 보이지만, 문서화되지 않은 관례, 클라우드 구성, 데이터 준비 단계에 의존하는 경우가 많다. 커뮤니티 사용은 인터페이스가 진정으로 이식 가능한지 드러낼 것이다.
오픈소스 주장은 여전히 재현성 시험을 거쳐야 한다
공개된 아키텍처와 강력한 벤치마크 결과는 오픈 연구 릴리스의 시작일 뿐이다.
논문은 광범위한 구현 세부 사항, 알고리즘 설명, 실험 설정을 제공한다. Microsoft의 프로젝트 자료도 연구자, 모델, 작업 출처, 주요 평가 결과를 명시한다.
하지만 실질적인 개방성에는 여러 층위가 있다. 연구자에게는 접근 가능한 코드, 설치 안내, 호환 데이터셋, 모델 체크포인트, 환경 이미지, 라이선스, 실험을 재현할 충분한 구성 세부 사항이 필요하다.
현재 데이터셋 페이지에는 릴리스가 보류됐으며 데이터를 다시 업로드할 예정이라는 공지가 표시된다. 문서화된 스키마는 정확하지만 최종 형태를 반영하지 않을 수 있다고 밝힌다. 팀은 이를 중심으로 파이프라인을 설계하기 전에 페이지 상태를 확인해야 한다.
이 중단이 연구 자체를 무효화하지는 않는다. 그러나 특히 가치가 궤적 수집에 크게 의존하는 소프트웨어 엔지니어링 레시피의 즉각적인 재현성은 제한한다.
라이선스에도 세심한 주의가 필요하다. 데이터셋 문서는 궤적이 각각 자체 라이선스를 가진 업스트림 리포지토리를 참조한다고 경고한다. 패치, 테스트 자료, 파생 산출물을 재배포하는 연구자는 개별적으로 해당 조건을 검토해야 한다.
보안도 또 하나의 제약이다. 에이전트 학습은 의도적으로 모델이 생성한 행동을 실행한다. 격리된 환경이라도 네트워크 정책, 리소스 제한, 자격 증명 통제, 이미지 스캐닝, 정리 절차가 필요하다.
논문은 네트워크 격리와 장애 처리 메커니즘을 설명하지만, 각 배포 환경은 자체 위협 경계를 통제한다. 공개 리포지토리를 다루는 연구 클러스터의 위험은 비공개 코드나 내부 도구를 포함한 기업 환경의 위험과 다르다.
벤치마크 오염을 결정적으로 배제하기는 여전히 어렵다. 교사 모델은 사전 학습 중 공개 이슈, 패치 또는 관련 코드를 접했을 수 있다. 비공개 평가 테스트는 일부 위험을 줄이지만, 암기에 관한 모든 의문을 해소하지는 않는다.
회고적 크레딧 할당 방식도 또 다른 불확실성을 더한다. 교사 모델은 중간 단계가 성공 가능성을 높였는지 추정한다. 이 추정치는 교사 모델이 궤적과 테스트 결과를 신뢰성 있게 해석할 수 있을 때만 유용한 레이블이 된다.
잘못된 추정은 그럴듯하지만 무관한 행동에 보상을 줄 수 있다. 반대로 그 가치가 나중에야 분명해지는 단계를 놓칠 수도 있다. 독립적인 어블레이션은 부분 실패 데이터가 모델 규모, 교사 품질, 데이터셋 구성과 비교해 성능에 얼마나 기여하는지 검증해야 한다.
Balanced Adaptive Rollout도 비슷한 검증이 필요하다. 유용한 보상 변동을 가진 그룹을 선택하면 학습 효율을 높일 수 있지만, 실제 환경 장애가 정책 실패처럼 보일 수 있다. 타임아웃, 컨테이너 오류, 깨진 테스트가 오해를 부르는 보상이 되어서는 안 된다.
Microsoft는 재시도 로직, 타임아웃 제어, 사용할 수 없는 그룹에 대한 필터를 보고했다. 외부 팀은 서로 다른 클러스터, 워크로드, 작업 분포에서도 이러한 안전장치가 효과적인지 확인해야 한다.
따라서 보고된 수치는 일반성의 최종 증명이 아니라 설계를 뒷받침하는 증거로 읽어야 한다. 독립적인 인프라 전반에서 재현된다면 그 근거는 더 강해질 것이다. 새로운 도메인에서의 결과는 환경 추상화가 준비된 세 가지 레시피를 넘어 확장되는지 검증할 수 있다.
가장 중요한 결과는 또 하나의 벤치마크 기록이 아닐 수도 있다. 연구자들이 각 실험의 기반 장비를 다시 구축하지 않고도 학습 방법을 비교할 수 있게 하는 공유 실험 기반이 될 수 있다.
연구자들이 다음으로 주목해야 할 점
Orchard가 널리 쓰이는 연구 인프라가 될지, 아니면 인상적인 Microsoft 레퍼런스 구현으로 남을지를 결정할 세 가지 신호가 있다.
첫 번째 신호는 릴리스의 완성도다. 연구자들은 복구된 데이터셋 접근성, 안정적인 코드 리포지토리, 재현 가능한 설치 안내, 모델 아티팩트, 버전 관리된 환경 정의를 지켜봐야 한다.
완전한 릴리스는 작은 팀도 시스템을 재사용할 수 있다는 Microsoft의 주장을 강화할 것이다. 반대로 공백이 계속된다면 이를 약화할 것이다. 에이전트 학습에서 가장 어려운 부분은 종종 데이터 준비와 운영 구성에 있기 때문이다.
두 번째 신호는 독립적 재현이다. 신뢰할 만한 검증은 별도로 관리되는 인프라에서 공개된 레시피를 사용하고, 벤치마크 결과와 총 리소스 요구량을 모두 보고하는 방식이 될 것이다.
정확히 같은 헤드라인 점수를 맞추는 것만이 유용한 결과는 아니다. 연구자들은 설정 시간, 샌드박스 실패율, 궤적 처리량, 컴퓨팅 소비량, 하니스 선택에 대한 민감도를 문서화해야 한다. 이런 측정은 재사용이 의미 있는 절감 효과를 만드는지 보여 준다.
독립 실험은 크레딧 할당 미세 조정의 기여도도 분리해야 한다. 비교 실험에서는 성공한 궤적만, 해결되지 않은 전체 궤적, 선택된 진전 구간을 각각 사용해 동등한 모델을 학습할 수 있다.
동일한 접근법은 적응형 롤아웃에도 적용된다. 연구자들은 모델, 작업, 보상 함수, 예산을 고정한 상태에서 고정 샘플링과 균형 샘플링을 비교할 수 있다. 그러면 이 방법이 생성된 궤적당 더 많은 학습 신호를 만드는지 알 수 있다.
세 번째 신호는 Microsoft가 준비한 도메인 밖에서의 채택이다. 특히 서로 다른 도구와 보상 구조를 갖춘 새 환경은 가장 강력한 검증을 제공할 것이다.
보안 분석, 데이터 작업, 과학 워크플로, 오피스 애플리케이션이 그럴듯한 후보들이다. 각각은 리포지토리 복구나 브라우저 탐색과 다른 환경 요구 사항을 제시한다. 성공적인 재사용은 이 추상화가 진정으로 하니스에 독립적이라는 주장을 뒷받침할 것이다.
경쟁사의 대응도 중요하지만, 주된 이야기가 아니라 보조 증거로 남아야 한다. 다른 에이전트 학습 프로젝트는 호환 가능한 환경 인터페이스를 채택하거나, 대체 백엔드를 공개하거나, 궤적 형식을 표준화할 수 있다.
프레임워크의 확산보다 상호운용성이 더 큰 가치를 만들 것이다. 연구자들은 모든 행동 및 관측 형식을 번역하지 않고도 시스템 간에 데이터셋, 정책, 평가기를 옮길 수 있다.
한편 개발자는 이 릴리스를 바로 사용할 수 있는 프로덕션 에이전트로 받아들이지 않아야 한다. 이 프로젝트는 정책을 만들고 평가하기 위한 연구 인프라다. 프로덕션 시스템에는 여전히 애플리케이션 로직, 사용자 권한, 모니터링, 대체 동작, 보안 검토가 필요하다.
기업 구매자에게 중요한 질문은 이 프레임워크가 하나의 벤치마크에서 이기는지가 아니다. 모듈형 학습 인프라가 단일 독점 모델이나 벤더가 통제하는 평가 스택에 대한 의존도를 낮추는지다.
연구자에게 다음의 실질적 단계는 더 좁다. 연구 논문을 검토하고, 어떤 아티팩트를 사용할 수 있는지 확인한 뒤 기존 평가 환경과 맞는 레시피 하나를 선택하라. 작업 성능과 함께 운영 비용을 측정하라.
Microsoft는 분명한 제안을 내놓았다. 환경이 숨겨진 프로젝트 인프라가 아니라 재사용 가능한 인프라가 될 때 오픈 에이전트 연구는 더 발전한다는 것이다. 이제 커뮤니티는 이 제안의 더 어려운 절반을 검증해야 한다. 독립 팀들이 결과를 재현하고, 이 체계를 새로운 작업으로 옮기며, Microsoft 자체 환경 밖에서도 약속한 효율성을 유지할 수 있을까?


