OpenAI, 두 가지 API 설정으로 GPT-5.6 Sol의 ARC-AGI-3 점수가 세 배로 올랐다고 밝혀
- Ethan Carter

- 2일 전
- 12분 분량
OpenAI는 두 가지 API 설정을 변경해 GPT-5.6 Sol의 ARC-AGI-3 공개 점수를 13.3%에서 38.3%로 거의 세 배 높였다고 밝혔다. OpenAI의 설명은 Responses API를 통해 사용할 수 있는 두 가지 컨텍스트 관리 방식인 유지된 추론과 컴팩션을 중심으로 한다. OpenAI에 따르면 이 조합은 출력 토큰 사용량도 6분의 1로 줄였다.
이 결과는 AI 벤치마크를 통상적으로 해석하는 방식에 의문을 제기한다. 테스트된 모델은 새 학습, 더 큰 추론 예산, 게임 특화 도구를 제공받지 않았다. 대신 OpenAI는 모델과 벤치마크 사이에서 관찰, 행동, 대화 이력을 전달하는 소프트웨어 계층인 하니스를 변경했다.
따라서 핵심 대립은 GPT-5.6 Sol과 다른 모델 사이의 경쟁이 아니다. 일반적이고 표준화된 하니스와 모델 특성을 고려한 프로덕션 하니스의 대립이다. 전자는 비교 가능성을 우선하며 에이전트에 동일한 기본 인터페이스를 제공한다. 후자는 OpenAI가 자사의 추론 모델이 길고 상호작용적인 작업에 필요하다고 말하는 상태를 보존한다.
이 구분은 ARC-AGI-3가 최종 답변 하나를 요구하지 않기 때문에 중요하다. 이 벤치마크는 자연어 지침 없이 낯선 게임을 제시한다. 에이전트는 각 게임의 규칙을 추론하고, 목표를 발견하며, 가설을 검증하고, 실패를 기억한 뒤, 여러 행동에 걸쳐 적응해야 한다.
매번 움직인 뒤 추론을 잊어버리는 시스템은 진화하는 계획을 보존할 수 있는 시스템과 다른 과제를 마주한다. 마찬가지로 컨텍스트가 가득 찼을 때 가장 오래된 관찰을 잃는 에이전트는 압축된 요약을 받는 에이전트와 같은 게임을 경험하지 않는다.
OpenAI의 결과가 어느 하니스가 가장 공정한 리더보드를 만드는지 결론짓지는 않는다. 그러나 하니스 설계가 많은 모델 업그레이드보다 측정된 능력을 더 크게 바꿀 수 있음을 보여준다. 이는 벤치마크 운영자, 모델 개발자, 기업 평가팀이 테스트한 전체 시스템을 문서화해야 한다는 압박으로 이어진다.
OpenAI가 점수 급등이 일어난 방식을 설명하다
모델은 그대로였지만, 메모리 경로가 바뀌었다.
OpenAI는 예상보다 저조했던 GPT-5.6 Sol 결과를 조사한 뒤 2026년 7월 29일 분석을 공개했다. 초기 우려는 단순했다. 어려운 수학 문제와 긴 게임 세션을 처리했던 모델이 단순해 보이는 2차원 환경에서는 효과를 내지 못하는 듯했기 때문이다.
초기 격차에는 여러 점수 수치가 포함됐다. OpenAI는 GPT-5.6 Sol의 전체 ARC-AGI-3 점수가 7.8%였고 GPT-5.5는 0.4%를 기록했다고 언급했다. 통제 비교에 사용한 공개 과제 세트에서 GPT-5.6 Sol은 공식 하니스로 13.3%를 기록했다.
OpenAI는 이후 Responses API를 통해 평가를 재구성했다. 수정된 하니스는 행동 사이에 추론을 유지하고, 롤링 트렁케이션을 컴팩션으로 대체했다. 회사의 벤치마크 분석에 따르면 이 구성은 공개 세트 점수를 38.3%로 높였다.
이 점수는 Relative Human Action Efficiency, 즉 RHAE를 사용한다. 이 지표는 성공적인 진행을 인간이 필요로 하는 행동 수와 비교한다. 에이전트는 비효율적으로 과제를 해결할수록 더 적은 점수를 받기 때문에, 무작위 탐색과 반복된 실수에는 측정 가능한 비용이 따른다.
OpenAI는 같은 기준에서 평균 인간 테스터가 48%를 기록한 것으로 추정했다. 이 추정은 모든 인간이 48%를 받는다는 주장이 아니라 공식 게임플레이 로그에서 나온 것이다. ARC Prize는 별도로 인간 기준선만큼 효율적으로 모든 게임을 이기는 점수를 100%로 설명한다.
따라서 38.3%라는 결과가 인간과의 격차를 해소한 것은 아니다. 다만 GPT-5.6 Sol을 OpenAI가 추정한 평균 테스터에 훨씬 가깝게 이동시켰다. 더 중요한 점은 모델 업데이트 없이 이를 달성했다는 것이다.
출력 토큰 관련 결과는 또 다른 반전을 더한다. 에이전트가 더 많은 컨텍스트를 보유하므로 긴 메모리는 더 비쌀 것처럼 들릴 수 있다. 그러나 OpenAI는 수정된 구성이 출력 토큰을 6분의 1만 사용했다고 보고한다. 모델이 이미 수립한 규칙과 계획을 반복적으로 재구성하는 데 쓰는 출력이 줄었기 때문이다.
게임 재현은 구체적인 예를 제시한다. OpenAI는 관련 리더보드의 어떤 프런티어 모델도 첫 번째 레벨을 넘어서 완료하지 못했던 환경 하나를 공개했다. 수정된 Responses API 하니스는 GPT-5.6 Sol이 6개 레벨을 모두 마치도록 했다고 전해진다.
ARC Prize의 검증된 결과는 유용한 맥락을 제공한다. GPT-5.6 스코어카드는 최대 추론 설정의 Sol이 반비공개 ARC-AGI-3에서 7.78%를 기록했다고 적고 있다. 또한 모델이 처음으로 이긴 공개 ARC-AGI-3 게임인 공개 게임 FT09에서 87%라는 결과도 기록한다.
이 수치들은 서로 다른 세트와 평가 관점을 설명하므로 독자는 이를 하나의 성능 수치로 합쳐서는 안 된다. OpenAI의 두 가지 설정 관련 주장을 뒷받침하는 적절한 증거는 통제된 13.3%에서 38.3%로의 비교다.
이 차이는 벤치마크 보도에서 놓치기 쉽다. 공개 세트 실험, 반비공개 검증 점수, 단일 게임 결과는 서로 다른 질문에 답한다. OpenAI의 실험은 특히 하니스가 더 많은 작업 상태를 보존할 때 한 모델이 어떻게 동작하는지를 묻는다.
답은 인상적이지만 범위가 제한적이다. 유지된 추론과 컴팩션은 OpenAI 구현에서 이 공개 과제 세트의 이 모델 성능을 개선했다. 이 결과가 모든 모델, 에이전트, 컨텍스트 길이, 프로덕션 워크로드에서 동일한 향상을 보장하는 것은 아니다.
공식 하니스는 망각도 함께 테스트하고 있었다
ARC-AGI-3는 에이전트와 이를 둘러싼 정보 아키텍처를 함께 측정했다.
ARC-AGI-3는 모델이 질문을 받고 답 하나를 반환하는 정적 벤치마크와 다르다. 반복적인 인식, 계획, 행동, 수정이 필요한 상호작용 환경으로 구성된다. 벤치마크 개요는 목표 획득, 적응 가능한 세계 모델, 장기 계획, 경험 기반 학습을 강조한다.
이 벤치마크에는 각 게임을 설명하는 자연어 지침이 없다. 에이전트는 현재 프레임의 표현과 가능한 행동 집합을 받는다. 무엇이 중요한 객체인지, 행동이 환경을 어떻게 바꾸는지, 무엇이 진전으로 간주되는지를 판단해야 한다.
이 구조는 메모리를 평가 대상 능력의 일부로 만든다. 유용한 가설은 여러 차례 실패한 행동 뒤에 나타날 수 있다. 이후의 관찰은 그 가설을 확인하거나 기각할 수 있다. 하니스가 이 사건들을 연결하는 추론을 삭제한다면, 에이전트는 더 빈약한 기록으로 해석을 다시 구축해야 한다.
OpenAI는 공식 하니스가 매 게임 행동 뒤에 비공개 추론을 폐기한다는 사실을 발견했다. 모델은 이전 움직임과 짧은 메모를 계속 볼 수 있었다. 하지만 그 움직임을 만들어 낸 계획, 발견, 가정에는 접근할 수 없었다.
하니스는 롤링 트렁케이션도 사용했다. 대화가 175,000자를 넘으면 가장 오래된 메시지를 제거했다. 따라서 긴 실행에서는 초기 관찰과 행동이 현재 레벨과 여전히 관련 있더라도 사라질 수 있었다.
이러한 동작은 결함 있는 벤치마크의 증거가 아니라 일반적 설계에서 의도된 결과였다. ARC Prize는 모델의 한계를 드러내고 제공업체 간 비교를 지원하기 위해 비교적 단순한 하니스를 선호한다. 상용 배포는 흔히 API 간에 깔끔하게 대응되지 않는 제공업체별 기능을 사용한다.
이로써 이 글의 주된 대립이 형성된다. 표준화된 평가와 프로덕션 환경에 맞춘 평가의 대립이다.
표준화된 하니스는 공통 인터페이스를 통해 어떤 모델이 가장 잘 수행하는지를 묻는다. 이 접근법은 특별 대우를 제한하고 한 제공업체의 비공개 최적화가 비교를 지배할 가능성을 낮춘다.
프로덕션 환경에 맞춘 하니스는 제작자가 권장하는 방식으로 배포됐을 때 모델이 얼마나 잘 수행하는지를 묻는다. 이 접근법은 실제 애플리케이션과 유사하지만, 모델 능력과 시스템 엔지니어링의 경계를 흐릴 수 있다.
어느 질문도 무의미하지 않다. 단지 서로 다른 측정값을 만들어 낼 뿐이다.
우려는 리더보드 점수가 모델 자체의 속성으로만 제시될 때 발생한다. 한 하니스가 다른 모델이 유지하리라 기대하는 상태를 반복적으로 삭제한다면, 테스트는 모델 학습과 평가 인프라 간의 호환성도 측정하게 된다.
ARC Prize는 환경이 얼마나 어려운지 인정해 왔다. 기술 보고서는 2026년 3월 기준 인간은 테스트된 환경의 100%를 해결한 반면 프런티어 시스템의 점수는 1% 미만이었다고 밝힌다. 이 벤치마크는 적응 효율성의 큰 격차를 드러내도록 설계됐다.
GPT-5.6 Sol의 이후 점수는 특히 개별 공개 게임에서 진전을 보여준다. 그러나 38.3%의 공개 세트 결과도 인간 수준 효율성에 도달하기까지는 상당한 여지를 남긴다. 또한 이는 모델 개발자 자체 하니스와 분석에서 나온 결과다.
교훈은 ARC-AGI-3가 쉬워졌다는 것이 아니다. 상호작용형 벤치마크가 계획과 탐색뿐 아니라 인위적 기억상실까지 우연히 테스트할 수 있다는 점이다.
이 문제는 게임을 넘어선다. 코딩 에이전트는 도구 호출을 거치며 아키텍처 결정을 기억해야 한다. 리서치 에이전트는 어떤 출처가 주장을 뒷받침하거나 반박하는지 유지해야 한다. 고객 서비스 시스템은 대화 초기에 도입된 제약을 보존해야 한다.
이러한 시스템을 내부 상태를 반복적으로 삭제하는 방식으로 평가하는 기업 팀은 유용한 성능을 과소평가할 수 있다. 제한 없는 제공업체별 최적화를 허용하는 팀은 비교하거나 재현하기 어려운 결과를 낼 수 있다.
더 나은 대응은 더 충실한 공개다. 벤치마크 보고서는 모델 버전, 추론 노력, 컨텍스트 정책, 유지된 응답 항목, 컴팩션 동작, 프롬프트, 도구, 행동 예산, 채점 방식을 식별해야 한다. 이 정보가 없으면 점수에는 필수적인 운영 맥락이 빠진다.
유지된 추론은 에이전트가 매번 처음부터 시작하는 일을 막는다
추론을 보존하면 GPT-5.6 Sol은 행동 전반에서 연속성을 확보해 반복적인 해석 작업을 줄일 수 있었다.
추론 모델은 눈에 보이는 텍스트나 도구 호출을 생성하기 전에 내부 추론 항목을 생성한다. 이 항목들은 사용자에게 표시되는 설명과는 다르다. 여러 단계로 이루어진 상호작용 동안 모델의 작업 상태 일부를 형성한다.
OpenAI가 검토한 공식 하니스에서는 각 게임 행동이 사실상 그 상태를 종료했다. 다음 요청에는 이전 움직임과 짧은 메모가 포함됐지만, 이를 연결하던 추론은 폐기됐다. GPT-5.6 Sol은 같은 해석 부담을 반복적으로 마주했다.
색깔 있는 객체가 배치된 격자를 탐색하는 에이전트를 상상해 보자. 에이전트는 한 색이 장애물을 표시하는지 시험한 뒤, 성공적인 이동 후 같은 색이 바뀐다는 사실을 발견한다. 이 관찰은 첫 번째 이론을 뒤집고 새 규칙을 수립할 수 있다.
움직임 로그는 에이전트가 무엇을 클릭했는지는 기록한다. 그러나 왜 클릭했는지, 어떤 대안을 배제했는지, 결과 프레임이 무엇을 의미했는지는 반드시 보존하지 않는다. 이런 세부 사항은 다음 행동이 전략을 진전시키는지, 앞선 실수를 반복하는지를 결정할 수 있다.
OpenAI는 Responses API를 사용하고 턴 사이에 이전 응답 식별자를 전달했다. 현재 모델 가이드는 GPT-5.6이 턴 전반에서 사용 가능한 추론 항목을 재사용할 수 있다고 설명한다. 개발자는 추론 컨텍스트 설정을 통해 이전 추론 중 어느 정도를 관련 상태로 유지할지도 제어할 수 있다.
OpenAI에 따르면 유지된 추론은 GPT-5.6 Sol의 동작을 두 가지 방식으로 바꿨다. 모델은 각 행동 전에 생각하는 시간을 덜 썼고, 긴 실행에서 더 일관된 전략을 사용했다. 더는 매 움직임 뒤 게임을 처음부터 다시 해석할 필요가 없었다.
이는 유지된 상태가 늘어났는데도 토큰 사용량이 줄어들 수 있었던 이유를 설명한다. 출력 토큰에는 모델이 새로 생성한 추론과 응답이 포함된다. 이전의 통찰을 계속 활용할 수 있다면, 모델은 또 다른 긴 재구성을 생성하지 않아도 된다.
이 구분은 프로젝트 팀이 의사결정 기록을 보관하는 경우와 완료된 작업 목록만 전달받는 경우의 차이와 닮아 있다. 작업 목록은 무슨 일이 있었는지는 보여 준다. 하지만 현재 계획을 형성한 기각된 선택지, 제약 조건, 근거까지 보존하지는 않는다.
지식 노동자에게도 AI 어시스턴트가 장기 조사를 처리할 때 같은 문제가 발생한다. 검색된 문서 하나하나가 작업 가설을 바꾼다. 시스템이 링크와 짧은 답변만 보존하면, 이후의 결론은 그 출처들이 왜 관련 있었는지를 뒷받침한 추론을 잃을 수 있다.
이때 외부 검색 가능한 지식 기반이 모델 컨텍스트를 보완할 수 있다. 에이전트가 임시 작업 상태를 압축하더라도, 지속 가능한 원본 기록은 계속 검토할 수 있어야 한다.
추론을 유지하는 방식에도 여전히 절충점이 있다. 작업이 바뀐 뒤에는 오래된 추론이 낡은 정보가 될 수 있다. 시스템이 이를 기각된 것으로 표시하지 않으면, 초기에 세운 잘못된 가설이 이후 단계를 좌우할 수 있다. 더 많은 메모리가 자동으로 더 나은 메모리를 뜻하지는 않는다.
OpenAI의 API 가이드도 이 문제를 반영한다. 목표가 안정적으로 유지될 때는 모든 턴에 걸쳐 추론을 보존하고, 이전 추론의 관련성이 사라졌을 때는 현재 턴에 집중하도록 개발자에게 허용한다. 이 선택은 일률적인 규칙이 아니라 워크플로에 따라야 한다.
ARC-AGI-3 게임은 연속성에 유리한 환경을 제공한다. 목표와 환경이 행동 전반에 걸쳐 연결되어 있으므로, 이전 가설은 대체로 중요하다. 갑자기 주제가 바뀌는 지원 대화는 다른 컨텍스트 관리 문제를 제시한다.
보안 및 개인정보 보호 정책도 구현에 영향을 미친다. 일부 조직은 응답 기록을 무기한 저장할 수 없다. 다른 조직은 상태 비저장 또는 제로 보존 구성을 사용한다. 이런 팀은 연속성을 위해 필요한 암호화된 추론 항목과 기타 응답 객체를 신중하게 관리해야 한다.
따라서 추론 유지란 시스템 동작을 설명하는 것이지, 비공개 체인 오브 소트 콘텐츠를 공개해도 된다는 허가를 뜻하지는 않는다. 애플리케이션은 API를 통해 지원되는 응답 항목을 보존하는 한편, 사용자에게는 간결하고 적절한 설명을 제시해야 한다.
OpenAI의 실험은 실무적인 평가 질문도 제기한다. 에이전트가 30단계 뒤 실패한다면, 검토자는 계획 자체가 잘못됐는지 아니면 하네스가 해당 계획을 이어 가는 데 필요한 상태를 제거했는지 살펴봐야 한다.
이 실패 양상에는 서로 다른 해결책이 필요하다. 추론 실패에는 더 나은 모델, 프롬프트 또는 전략이 필요하다. 상태 관리 실패에는 다른 인프라가 필요하다. 둘 다 모델 지능의 문제로 취급하면, 엔지니어링 노력이 어디에 투입돼야 하는지가 흐려진다.
압축은 모든 것을 들고 가지 않고도 과거를 보존한다
압축은 무딘 삭제를, 여전히 중요한 이력을 담은 더 짧은 표현으로 대체했다.
장기 실행 에이전트는 결국 컨텍스트 한계 또는 경제적 한계에 부딪힌다. 모든 관찰, 도구 결과, 중간 생각을 보관하면 이후 요청은 더 느리고 덜 집중될 수 있다. 단순히 추론을 유지하는 것만으로는 무한한 컨텍스트 증가 문제를 해결할 수 없다.
공식 ARC-AGI-3 하네스는 롤링 절단으로 증가하는 분량을 처리했다. 이력은 임계값을 넘으면 가장 오래된 콘텐츠부터 제거했다. 이 정책은 예측 가능하고 제공업체에 중립적이지만, 오래된 정보일수록 중요성이 낮다고 가정한다.
인터랙티브 게임은 이 가정을 깨뜨린다. 초기 행동이 목표를 드러낼 수 있다. 초반에 본 단서가 훨씬 나중에 마주치는 기호를 설명할 수도 있다. 시간순 삭제는 최근의 반복적인 프레임은 남기면서도 기반 지식을 지워 버릴 수 있다.
압축은 다른 정책을 사용한다. 이전 컨텍스트를 관련 상태를 보존하는 더 작은 표현으로 응축한다. 에이전트는 모든 원래 토큰을 들고 가지 않고도 관리 가능한 컨텍스트로 계속 작업할 수 있다.
OpenAI는 ARC 구현에서 압축에 175,000토큰 한도를 사용했다고 밝혔다. 공식 하네스는 절단에 175,000자를 사용했다. OpenAI는 행동 그리드가 문자당 대략 하나의 토큰으로 토큰화됐기 때문에 이 임계값들이 대체로 비교 가능했다고 주장한다.
이 구현 세부사항은 중요하다. 한도가 크게 달랐다면 점수 향상은 더 나은 메모리 전략이 아니라 더 큰 실효 컨텍스트를 반영했을 수 있다. OpenAI의 비교는 임계값을 가깝게 유지하면서 오래된 정보가 살아남는 방식을 바꾸려는 시도다.
회사의 압축 문서는 압축을 장기 Responses API 워크플로에서 컨텍스트 크기를 줄이는 방법으로 설명한다. 그 결과 생성된 압축 상태는 애플리케이션이 무제한 분량의 기록을 다시 전송하지 않고도 연속 작업을 지원할 수 있다.
압축은 무손실 저장이 아니다. 요약은 세부사항을 빠뜨리거나 불확실성을 평면화하거나 잘못된 해석을 보존할 수 있다. 그 가치는 향후 행동에 필요한 정보를 선별하는 데 달려 있다.
ARC-AGI-3는 이 선별에 까다로운 시험 환경을 제공한다. 에이전트는 발견한 규칙, 목표, 객체 의미, 실패한 가설, 레벨 진행도, 계획된 행동을 보존해야 한다. 반복되는 그리드와 중복된 추론에는 더 적은 비중을 둘 수 있다.
OpenAI는 압축된 하네스가 더 긴 실행 전반에서 학습을 보존했고 출력 토큰도 더 적게 생성했다고 보고했다. 비교 애니메이션은 개정된 에이전트가 행동당 추론을 덜 하고 게임을 더 빠르게 진행하는 모습을 보여 줬다.
화폐 가격을 논하지 않더라도 출력 토큰이 6분의 1로 감소한 점은 운영상 중요하다. 출력량이 줄면 지연 시간을 낮추고 더 많은 평가를 위한 용량을 확보할 수 있다. 또한 압축된 상태가 충분한 정보를 유지한다면 에이전트 추적 기록을 더 쉽게 검토할 수 있다.
다만 독자는 이 수치를 워크로드 특화적인 결과로 봐야 한다. ARC-AGI-3는 반복적인 텍스트 그리드와 많은 순차적 행동을 생성한다. 법률 검토, 의료 워크플로 또는 금융 분석에는 공격적인 요약에 저항하는 세부사항이 포함될 수 있다.
평가 팀은 최종 작업 성공과 별개로 압축 품질을 시험해야 한다. 유지된 제약 조건, 사실 일관성, 중단 후 복구, 그리고 어떤 근거가 의사결정에 영향을 줬는지 설명하는 에이전트의 능력을 비교할 수 있다.
유용한 시험은 중요한 사실을 초기에 제시하고, 이후 활동으로 컨텍스트를 채운 뒤 에이전트가 그 사실을 올바르게 적용하는지 확인한다. 또 다른 시험은 중간에 요구사항을 바꾸고, 압축이 원래 지시 대신 수정 사항을 보존하는지 검증한다.
이런 시험은 핵심 절충점을 드러낸다. 롤링 절단은 검토자가 정확히 어떤 메시지가 사라졌는지 알 수 있어 손실이 투명하다. 압축은 선택적 연속성을 제공하지만, 무엇이 빠졌는지는 더 알아차리기 어려울 수 있다.
프로덕션 에이전트에는 선택적 연속성이 작업에 더 잘 맞는 경우가 많다. 인간은 모든 시각 프레임이나 문장을 기억하지 않는다. 대신 목표, 제약 조건, 발견 사항, 미해결 질문을 우선시하는 작업 모델을 유지한다.
이 비유가 숨겨진 실패를 정당화해서는 안 된다. 개발자에게는 압축이 올바른 상태를 보존했는지 확인할 수 있는 추적 기록, 재생 도구, 통제된 평가가 필요하다. 그렇지 않으면 자신감 있는 최종 답변이 빠진 초기 제약 조건을 숨길 수 있다.
따라서 OpenAI의 결과는 컨텍스트 윈도우를 더 크게 만드는 일에 관한 것이 아니다. 윈도우가 모든 것을 담을 수 없을 때 무엇이 살아남는지를 바꾸는 일에 관한 것이다.
3배가 된 점수가 입증하지 않는 것
개발자가 공개 세트에서 수행한 실험만으로는 가장 공정한 보편적 벤치마크 구성을 판단할 수 없다.
OpenAI의 근거는 좁지만 가치 있는 결론을 뒷받침한다. GPT-5.6 Sol은 추론을 유지하고 롤링 절단을 압축으로 대체한 OpenAI의 ARC-AGI-3 구현에서 더 나은 성능을 보였다.
이는 공식 하네스가 무효임을 입증하지는 않는다. 공식 구성은 벤치마크 참가자가 여러 제공업체에 걸쳐 재현할 수 있는 범용 인터페이스를 통해 모델 행동을 드러내는 다른 목적을 가진다.
제공업체별 기능은 동등한 비교를 복잡하게 만든다. OpenAI는 Responses API를 통해 자체 네이티브 추론 항목을 유지할 수 있다. 다른 제공업체는 내부 상태를 다르게 표현하거나, 다른 연속 제어 기능을 노출하거나, 또 다른 메모리 아키텍처에 의존할 수 있다.
모든 기업이 비공개 하네스를 최적화하도록 허용하면 모델 벤치마크는 시스템 경쟁으로 바뀔 수 있다. 이 형식도 특히 완전한 에이전트 시스템을 선택하는 구매자에게 유용한 무언가를 측정할 수 있다. 그러나 모델 행동을 그만큼 깔끔하게 분리하지는 못한다.
이 결과는 OpenAI의 공개 작업 세트 실험에서도 나왔다. 공개 게임은 검토와 개발에 사용할 수 있어 하네스 조정의 여지가 더 크다. 반비공개 결과는 직접적인 작업별 조정에 대한 더 강력한 검증을 제공한다.
ARC Prize의 검증된 리더보드는 최대 추론 설정의 반비공개 세트에서 GPT-5.6 Sol을 여전히 7.78%에 위치시킨다. 이 점수는 그곳에 등재된 다른 GPT-5.6 계열 변형보다 앞서지만, 인간의 완료율과 효율성에는 여전히 크게 못 미친다.
OpenAI의 공개 비교에서 38.3%를 기록한 결과와 검증된 반비공개 평가에서 7.78%를 기록한 결과의 차이는 신중한 해석이 필요하다. 작업 세트가 다르므로 하네스 결과와 자동으로 모순되는 것은 아니다. 다만 하나의 공개 세트 개선을 인간과 유사한 게임 학습이라는 일반적 주장으로 확대해서는 안 되는 이유를 보여 준다.
평균적인 인간 테스터에 대한 OpenAI의 48% 추정치는 맥락을 더하지만 동등성을 의미하지는 않는다. 인간과 모델은 서로 다르게 실패하고, 다른 행동 패턴을 사용하며, 낯선 인터페이스에 다르게 반응할 수 있다. RHAE는 이러한 행동을 하나의 점수로 압축한다.
이 실험은 두 가지 변경 사항도 결합한다. 헤드라인 비교에서는 추론 유지와 압축이 모두 활성화됐다. OpenAI는 각각의 행동 효과를 설명하지만, 공개된 헤드라인 수치는 각 설정의 기여도를 완전히 분리하지 않는다.
더 완전한 절제 연구는 네 가지 구성을 보고할 것이다. 두 설정 모두 미사용, 추론 유지 단독, 압축 단독, 그리고 두 기능을 함께 사용한 구성이다. 에이전트 탐색은 서로 다른 경로를 따를 수 있으므로, 반복 실행은 특히 분산을 정량화하는 데 도움이 된다.
출력 토큰 비교도 같은 수준의 검토가 필요하다. 토큰이 적다는 것은 이 하네스에서 효율이 개선됐다는 뜻이다. 총 지연 시간, 입력 토큰 처리, 압축 오버헤드, 또는 상태 유지에 필요한 엔지니어링 작업량을 보여 주지는 않는다.
벤치마크 운영자는 이제 양쪽 방향의 압박을 받는다. 범용 하네스를 유지한다면, 리더보드 결과가 프로덕션 구성을 과소평가할 수 있음을 설명해야 한다. 최적화된 하네스를 받아들인다면, 어떤 역량이 모델에서 왔고 어떤 역량이 주변 코드에서 왔는지 공개해야 한다.
모델 제공업체도 이에 상응하는 책임이 있다. 재현 가능한 구성, 프롬프트, 컨텍스트 임계값, 행동 예산, 스코어카드를 공개해야 한다. 독립 팀이 반복할 수 있을 때 설정에 관한 주장은 더 유용해진다.
엔터프라이즈 구매자는 범용 시험과 최적화된 시험 중 하나만 선택해서는 안 된다. 둘 다 필요하다.
범용 시험은 일반적인 제약 조건에서 후보 모델이 어떻게 행동하는지 보여 준다. 프로덕션을 대표하는 시험은 완전한 시스템이 구매자의 실제 워크플로에서 성공하는지 보여 준다. 두 결과의 차이는 통합 민감도를 측정한다.
이 민감성 자체가 비즈니스 위험이다. 하나의 특수한 상태 관리 스택을 통해서만 좋은 성능을 내는 모델은 이전하기가 더 어려울 수 있다. 필수 기능을 제거하는 범용 하네스는 팀이 잘못된 이유로 더 약한 모델을 선택하게 만들 수 있다.
중요한 질문은 벤치마크와 OpenAI 중 어느 쪽이 맞느냐가 아니다. 각 점수가 어떤 시스템 경계를 설명하는지가 질문이다.
OpenAI의 ARC-AGI-3 결과 이후 주목할 세 가지 신호
독립 재현, 반비공개 시험, 더 나은 하네스 보고가 이 결과가 평가 관행을 바꿀지 결정할 것이다.
첫 번째 신호는 13.3%에서 38.3%에 이르는 향상을 독립적으로 재현하는 것이다. 신뢰할 만한 재현은 동일한 공개 게임, 추론 노력 수준, 행동 제한, 컨텍스트 임계값, 채점 방식을 사용해야 한다. 실행 간 변동도 함께 보고해야 한다.
재현에 성공한다면 상태 관리가 관측된 성능 격차의 상당 부분을 설명한다는 OpenAI의 주장이 강화될 것이다. 반대로 향상 폭이 크게 작다면, 문서화되지 않은 구현 세부사항이나 프롬프팅, 평가자 선택이 언급된 두 설정보다 더 크게 기여했음을 시사할 수 있다.
두 번째 신호는 추론 유지와 압축을 활용하는 반비공개 평가다. 공개 과제는 개발자가 동작을 진단하는 데 도움이 되지만, 보이지 않거나 제한된 환경은 일반화 능력을 더 강하게 시험한다. 이러한 환경에서도 비슷한 향상이 나타난다면, 하니스 개선이 익숙한 공개 게임을 넘어 이전된다는 점을 보여줄 것이다.
반비공개 환경에서의 향상이 작다면 광범위한 해석은 약화된다. 더 나은 메모리가 모델이 새로운 목표와 규칙을 습득하는 더 깊은 과제를 해결하지 못한 채, 이미 알려진 전략을 실행하도록 돕는 데 그칠 수 있음을 의미할 수 있다.
세 번째 신호는 벤치마크 공개 기준의 변화다. 앞으로의 리더보드는 점수와 함께 컨텍스트 관리 정책을 공개해야 한다. 보고서에는 행동 사이에 추론 항목이 유지되었는지, 오래된 이력이 어떻게 제거되거나 압축되었는지, 어떤 공급자별 기능이 활성화되었는지를 명시해야 한다.
이러한 보고는 독자가 두 가지 유용한 관점을 비교할 수 있게 한다. 하나는 표준화된 인터페이스를 통해 모델을 측정하는 관점이다. 다른 하나는 공급자 지침에 따라 구성된 완전한 시스템을 측정하는 관점이다.
개발자도 자체 평가에 같은 원칙을 적용해야 한다. 설정을 변경하기 전에 기준선을 보존해야 한다. 그다음 대표적인 워크로드에서 유지된 추론, 압축, 그리고 두 방식의 조합을 각각 시험해야 한다.
최종 성공률만 측정해서는 안 된다. 출력 토큰, 입력 증가량, 지연 시간, 반복 행동, 제약 조건 유지, 실패한 가설로부터의 회복, 오래된 메모리로 인한 오류를 추적해야 한다. 평가가 결과 지점만 본다면, 더 높은 점수는 새로운 실패 양상을 가릴 수 있다.
팀은 연속성이 도움이 되는 지점도 살펴봐야 한다. 장시간 코딩 작업, 대화형 리서치, 브라우저 에이전트, 다단계 분석은 흔히 축적된 발견에 의존한다. 짧은 분류나 추출 요청은 지속적인 추론으로부터 얻는 이점이 작을 수 있다.
OpenAI의 이번 발견은 분명한 경고를 제시한다. 에이전트 평가는 평가자가 부과한 메모리 정책 때문에 모델에 불이익을 줄 수 있다. 또한 경쟁사가 재현할 수 없는 인프라를 통해 모델을 실제보다 돋보이게 만들 수도 있다.
다음으로 유용한 단계는 어느 한쪽 하니스가 옳다고 선언하는 것이 아니다. 두 방식 모두를 실행하고, 정확하게 라벨링하며, 다른 이들이 차이를 이해할 수 있도록 충분한 세부사항을 공개하는 것이다.
장시간 실행되는 에이전트를 구축하는 사람이라면 당장의 질문은 실용적이다. 시스템이 다음 행동에 필요한 목표, 증거, 그리고 기각된 가설을 보존하고 있는가? 모델을 탓하기 전에 그 연속성을 시험하고, 압축이나 컨텍스트 정책을 변경할 때마다 다시 시험해야 한다.


