Anthropic GPT 경쟁이 벤치마크를 갈라놓고 Astra가 AGI의 시계를 다시 맞추다
- Ethan Carter

- 4일 전
- 13분 분량
OpenAI의 GPT-6 Astra는 한 모델 지수에서 169점을 기록했지만 다른 지수에서는 61점에 그쳤고, 벤치마크 선두를 둘러싼 Anthropic GPT 경쟁을 한층 격화시켰다. Epoch AI는 평가한 267개 모델 가운데 Astra를 1위에 올렸다. 반면 Artificial Analysis는 이를 Anthropic의 Claude Fable 5.1보다 낮게 평가했다.
이러한 불일치는 보통 또 하나의 결론 없는 모델 출시로 이어질 수 있다. 그러나 Astra의 ARC-AGI-3 결과는 이 사례를 쉽게 넘기기 어렵게 만든다. 이 모델은 ARC Prize의 표준 하니스를 통해 62.7%를 기록했으며, 이는 GPT-5.6 Sol의 보고된 7.8%에서 크게 오른 수치다.
ARC Prize의 평가에 따르면 Astra는 평균 인간보다 더 높은 행동 효율성으로 인터랙티브 과제를 완료했다. François Chollet은 이 진전이 자신이 예상한 것보다 약 두 배 빠르다고 평가했다. 다만 그는 AGI를 선언하는 데까지 나아가지는 않았다.
따라서 핵심 쟁점은 어느 리더보드가 잘못된 승자를 골랐느냐가 아니다. 현재의 벤치마크가 과연 같은 종류의 지능을 측정하고 있느냐는 문제다. 이제 Anthropic GPT 경쟁은 광범위한 시험 성능과 낯선 환경에서의 적응 효율성을 맞붙게 한다.
GPT-6 Astra는 상충하는 두 가지 판정을 낳았다
Astra의 출시는 평가자가 무엇을 측정하기로 선택하느냐를 둘러싼 논쟁으로 모델 순위를 바꿔 놓았다.
OpenAI는 2026년 9월 3일 GPT-6 Astra를 공개했다. 회사는 이를 컴퓨터 사용, 브라우징, 소프트웨어 엔지니어링, 과학, 사이버보안, 전문 업무를 위한 모델로 내세웠다.
Astra 발표에서는 회사가 선택한 여러 평가에서 최첨단 성과를 냈다고 설명했다. OpenAI는 제공업체별 평가 설정을 통해 ARC-AGI-3에서 99.9%를 기록했다고도 밝혔다.
독립적인 종합 점수는 덜 일관된 그림을 제시했다. Epoch AI의 역량 지수는 Astra에 169점을 부여해 163점의 Claude Fable 5.1을 앞섰다. GPT-5.6 Sol과 Claude Opus 5는 각각 162점을 받았다.
Epoch의 지수는 다수의 역량 영역에 걸친 결과를 결합한다. 여기에는 수학, 과학, 지식, 코딩 및 기타 고난도 과제가 포함된다. 이 점수는 하나의 좁은 기술을 분리하기보다 광범위한 진전을 요약하려는 시도다.
이 종합 지수에서 Astra는 선두다. 이 결과는 해당 모델이 의미 있는 세대 변화를 나타낸다는 OpenAI의 주장을 뒷받침한다. 또한 Astra의 가장 강한 개선이 Epoch의 평가 구성에서 비중 있게 다뤄지는 영역에 있음을 시사한다.
Artificial Analysis는 다른 결론에 도달했다. 해당 기관의 Intelligence Index에서 Astra는 GPT-5.6 Sol과 같은 61점을 받았다. Claude Fable 5.1은 66점으로 비교 대상 중 선두였고, Claude Opus 5는 63점을 기록했다.
모델 비교는 지식, 코딩, 수학, 텍스트 이해를 다룬다. 구성과 테스트 절차는 Epoch의 지수와 다르다. 따라서 나온 수치를 동일한 대상을 두 번 측정한 결과로 간주할 수는 없다.
Astra의 개별 결과도 고르지 않았다. 여러 에이전트형 및 과학 과제에서 큰 폭으로 개선됐지만, Artificial Analysis는 장문맥 추론과 일부 전문 평가를 포함한 영역에서 더 약한 성능을 기록했다.
코딩 성과도 마찬가지로 엇갈렸다. 보도에 따르면 Astra는 Coding Agent Index에서 67점을 기록했고, Claude Fable 5.1은 70점에 도달했다. Astra는 비교 가능한 테스트에서 여러 경쟁 모델보다 훨씬 적은 추론 단계를 사용했다.
이 효율성은 모델의 실질적 부담이 공개된 토큰 단가를 넘어선다는 점에서 중요하다. 더 적은 토큰, 더 적은 행동, 더 짧은 경과 시간을 쓰는 모델은 헤드라인 점수가 낮더라도 더 나을 수 있다.
따라서 이번 출시는 타당하지만 불완전한 두 가지 이야기를 만들었다. Epoch는 Astra가 가장 강력한 광범위 역량 프로필을 갖췄다고 말한다. Artificial Analysis는 고정된 일반 추론 과제 모음 전반에서는 선두가 아니라고 말한다.
어느 쪽 판정도 개발자나 기업에 가장 적합한 모델이 무엇인지 단독으로 결정하지는 못한다. 소프트웨어 팀은 재현 가능한 코딩 성능을 중시한다. 연구 그룹은 수학적 추론, 도구 사용, 혹은 새로운 문제 해결을 우선시할 수 있다.
시점 역시 단정적인 결론을 제한한다. 초기 비교가 나왔을 때 Epoch에는 일부 기존 모델과 비교해 Astra의 기록된 코딩 평가가 더 적었다. 이용 가능한 Astra 코딩 실행 중 적어도 하나는 중간 수준의 추론 설정을 사용했다.
초기 리더보드는 종종 성숙한 결과와 불완전한 범위를 혼합한다. 새 모델은 출시 후 추가 테스트, 하니스 업데이트, 구성 변경을 거친다. 기반 모델이 바뀌지 않아도 순위는 움직일 수 있다.
이 때문에 169 대 61이라는 대조는 황당한 것이 아니라 유익한 정보다. 이 수치는 서로 다른 평가 우선순위를 드러낸다. 또한 구매자에게 어떤 종합 점수도 보편적인 지능 척도로 받아들이지 말라고 경고한다.
Anthropic GPT 경쟁의 모습은 어떤 작업 부하를 중심에 두느냐에 따라 달라진다. Claude는 Artificial Analysis의 더 폭넓은 텍스트 중심 지수에서 선두다. Astra는 Epoch의 현재 종합 지수에서 앞서며 인터랙티브 추론에서 이례적인 향상을 보인다.
더 중요한 질문은 두 종합 지수가 설명력을 잃기 시작하는 지점에서 출발한다. ARC-AGI-3는 모델에게 답을 찾아내거나 익숙한 코딩 연습을 완성하라고 요구하지 않는다. 대신 알지 못하는 세계가 어떻게 작동하는지 발견하도록 요구한다.
ARC-AGI-3는 비교의 의미를 바꿨다
Astra의 가장 강력한 결과는 일반적인 질의응답이 아니라 불확실성 속 적응에 관한 것이다.
ARC-AGI-3는 낯선 인터랙티브 환경 안의 에이전트를 평가한다. 시스템은 일반적인 과제 지시를 받지 않은 상태에서 탐색하고, 규칙을 추론하며, 관찰을 기억하고, 행동을 계획하고, 목표를 인식해야 한다.
이 벤치마크는 암기된 사실과 언어 지식에 대한 의존을 제한한다. 그 환경은 기존 시험보다 작은 미지의 게임에 가깝게 작동한다. 성공하려면 익숙한 프롬프트 패턴을 인식하는 대신 상호작용을 통해 학습해야 한다.
이 차이는 대규모 언어 모델이 광범위한 사전 노출을 통해 높은 점수를 얻을 수 있기 때문에 중요하다. 미지의 환경을 중심으로 설계된 벤치마크는 그 이점을 줄이려 한다. 평가 중에 시스템이 유용한 행동을 습득할 수 있는지를 시험한다.
ARC-AGI-3 보고서는 탐색, 계획, 기억, 목표 획득, 정렬을 핵심 요구 사항으로 설명했다. 이 벤치마크가 2026년 3월 등장했을 당시, 테스트된 프런티어 시스템의 점수는 1% 미만이었다.
인간은 과제별 훈련 없이 평가된 모든 환경을 해결할 수 있었다. 인간 해결자들의 속도와 효율성이 동일하지는 않았지만, 이 벤치마크는 각 환경이 상호작용을 통해 이해될 수 있음을 보여줬다.
6개월 후 Astra는 ARC Prize의 표준 하니스를 사용해 세미프라이빗 세트에서 62.7%에 도달했다. 검증된 결과는 이 실행이 최대 추론 노력으로 이뤄졌다고 명시한다.
이 점수는 GPT-5.6 Sol의 보고된 7.8%보다 여덟 배 이상 높았다. 또한 Claude Opus 5의 기재된 30.2%를 두 배 이상 웃돌았다. Claude Fable 5.1의 비교 가능한 데이터는 처음에는 उपलब्ध하지 않았다.
이 결과가 중요한 이유는 모델이 단지 더 많은 환경을 해결한 데 그치지 않았기 때문이다. ARC Prize의 분석에 따르면 Astra는 성공적으로 완료한 과제에서 평균 인간보다 더 적은 행동을 사용했다.
행동 효율성은 에이전트가 얼마나 직접적으로 해법에 도달하는지를 측정한다. 비효율적인 시스템은 광범위한 무작위 탐색 뒤에야 성공할 수 있다. 더 효율적인 시스템은 더 적은 움직임으로 정확한 내부 모델을 구축한다.
보도에 따르면 Astra는 이 측정에서 평균 인간 효율성 수준을 넘어섰다. 이것이 일반 지능 전반에서 인간을 능가했다는 뜻은 아니다. 성공한 ARC-AGI-3 경로에 필요한 행동 수가 인간 평균보다 적었다는 의미다.
이 구분은 결과가 과장되는 것을 막는다. 인간은 여전히 환경 전체를 해결하는 능력을 보였다. Astra의 표준 하니스 성공률은 여전히 100%에 크게 못 미쳤다.
OpenAI는 제공업체 어댑터 하니스를 통해 99.9% 결과도 보고했다. 이 설정은 요청 간에 모델의 불투명한 추론 상태를 보존하고 더 긴 대화를 압축한다. 표준 하니스는 모델이 선택한 메모만 다음 단계로 전달한다.
따라서 더 높은 점수는 모든 제공업체가 이용할 수 없는 인프라와 함께 Astra를 측정한 결과다. ARC Prize는 이를 직접적인 공급업체 간 순위 비교에 사용하지 말라고 경고한다. 이는 중립적인 Claude 비교가 아니라 하나의 시스템 구성에 관한 증거다.
62.7%와 99.9%의 격차 자체도 시사하는 바가 크다. 모델의 겉보기 지능은 기억, 맥락, 도구, 숨겨진 추론 상태가 어떻게 이를 둘러싸는지에 부분적으로 좌우된다.
이는 새로운 평가 문제를 만든다. 구매자는 점점 고립된 언어 모델이 아니라 완성된 에이전트 시스템을 배포한다. 하지만 제공업체별 인프라는 공정한 비교를 어렵게 하거나 불가능하게 만들 수 있다.
그럼에도 Astra의 결과는 표준 설정에서 뚜렷한 변화를 보여준다. Sol의 7.8%에서의 도약은 제공업체 어댑터로 설명할 수 없다. 두 수치 모두 더 비교 가능한 평가 경로에서 나왔다.
ARC-AGI-3는 이전 ARC 버전과도 다르다. ARC-AGI-1은 점점 포화된 정적 시각 변환을 사용했다. ARC-AGI-2는 추상적 퍼즐 형식을 유지하면서 난도를 높였다.
Astra는 ARC-AGI-2에서 95%를 기록했고, Sol은 92.5%였다. 이보다 작은 차이만으로는 극적인 지능 주장을 뒷받침하기 어렵다. 인터랙티브한 3세대가 더 강한 격차를 만든다.
이 역사는 Chollet이 Astra의 ARC-AGI-3 성능에 주목한 이유를 설명한다. 이 모델은 낯섦을 중심으로 설계된 과제에서 새로운 수준의 역량을 보였다. 이는 반복 연습 가능한 기술에서의 탁월함보다 그의 지능 정의에 더 가깝다.
이 벤치마크 결과가 AGI 논쟁을 끝내지는 않는다. 다만 가장 강력한 증거의 성격을 바꾼다. 평가자는 모델이 충분히 많은 것을 아느냐 대신, 기존 지식이 부족할 때 얼마나 효율적으로 학습하는지를 물을 수 있다.
Anthropic GPT 경쟁은 이제 효율성에 달려 있다
경쟁 압력은 모델이 맞힌 답의 수뿐 아니라, 그 답에 이르기 위해 얼마나 많은 추론이 필요한지에서 나온다.
Anthropic의 Claude 모델은 코딩과 전문 업무에서 여전히 강력한 경쟁자다. Claude Fable 5.1은 Artificial Analysis Intelligence Index와 Coding Agent Index에서 Astra를 앞섰다.
Astra의 강점은 다른 차원에 있는 것으로 보인다. 보도에 따르면 Astra는 더 적은 계산 단계로 비교 가능한 코딩 결과에서 Claude Fable 5와 동등한 성과를 냈다. 또한 GPT-5.6 Sol과 Claude Opus 5보다 더 적은 단계를 필요로 했다.
더 적은 추론 단계는 과제가 소비하는 총자원을 줄일 수 있다. 이 이점은 더 높은 토큰당 요금을 상쇄할 수 있다. 또한 대기 시간을 줄이고 에이전트가 헤맬 기회를 줄일 수 있다.
이 차이는 연료 효율성과 닮았다. 차량의 연료 가격만으로는 완료된 여정의 비용을 알 수 없다. 거리, 소비량, 신뢰성이 실제 결과를 결정한다.
AI 구매자도 같은 계산 문제에 직면한다. 공개된 입력 및 출력 요금은 소비 단위를 설명한다. 모델이 유용한 작업을 끝내는 데 얼마나 많은 단위가 필요한지는 보여주지 않는다.
보도에 따르면 Astra는 여러 에이전트형 과제에서 Sol보다 더 적은 추론 토큰을 소비한다. The Decoder의 비교는 Astra의 더 높은 단위 요금에도 불구하고, 이 효율성이 완료 과제 비용의 차이를 줄였다고 추정했다.
전략적 압박을 이해하는 데 가격 수치는 필요하지 않다. Anthropic은 광범위한 지능 지수에서 이기는 것만으로 Astra에 답할 수 없다. Claude가 중요한 코딩 테스트에서 우위를 유지하는 동안 OpenAI도 승리를 주장할 수 없다.
양사는 일관된 조건에서 완료된 작업을 입증해야 한다. 여기에는 성공률, 총 컴퓨팅 사용량, 지연 시간, 인간의 수정, 실패한 작업으로부터의 복구가 포함된다.
이로써 anthropic GPT 경쟁의 초점은 챗봇 인상에서 벗어나게 된다. 에이전트 시스템은 파일, 브라우저, 터미널, 비즈니스 소프트웨어 전반에서 작동한다. 사용자가 알아차리기 전에 실패가 워크플로 전체로 전파될 수 있다.
효율적이지만 신뢰할 수 없는 에이전트는 거의 가치를 만들지 못한다. 반대로 정확도가 매우 높은 에이전트도 과도한 시간과 컴퓨팅을 요구한다면 비현실적이 될 수 있다. 선도 시스템은 이 두 제약을 모두 관리해야 한다.
Astra의 인터랙티브 효율성은 Anthropic에 대한 압박을 높인다. Claude가 코딩과 통제된 도구 사용을 중심으로 상당한 명성을 쌓았기 때문이다. 적응형 컴퓨터 작업에서 Astra가 뚜렷한 우위를 보인다면 그 핵심 시장에 영향을 미칠 것이다.
Claude Fable 5.1의 지수 선두는 OpenAI에도 같은 수준의 압박을 가한다. 이는 Astra의 최고 점수가 전반적 리더십에 대한 이의 없는 주장으로 굳어지는 것을 막는다. 고객은 이전 세대 수준의 결과가 여전히 확인되는 독립 평가를 근거로 제시할 수 있다.
엔터프라이즈 팀은 이러한 결과를 워크로드 가설로 다뤄야 한다. 수학 중심의 연구 워크플로에서는 한 모델이 더 적합할 수 있다. 리포지터리 마이그레이션이나 지원 프로세스에서는 다른 순위가 나올 수 있다.
팀은 자체 평가 기록도 필요하다. 프롬프트, 출력, 수정 및 결정을 검색 가능한 AI knowledge base에 저장하면 모델 비교를 더 쉽게 감사할 수 있다.
이 기록이 없으면 구매자는 기억에 남는 성공 사례를 통해 모델을 평가할 위험이 있다. 인상적인 시연은 관심을 끌지만, 조용한 실패는 일상 업무 속으로 사라진다.
같은 문제는 벤치마크 해석에도 영향을 미친다. 종합 점수는 과제 분포를 감춘다. 지수에서 5점 앞선다고 해서 모델이 모든 평가에서 이기거나 모든 워크플로에서 더 나은 경제성을 제공한다는 뜻은 아니다.
Astra의 Coding Agent Index 결과가 이를 잘 보여준다. 점수에서는 Claude Fable 5.1이 앞섰지만, Astra는 더 적은 단계가 필요했던 것으로 전해진다. 조직이 비용보다 순수한 완료율을 중시하거나, 작은 점수 차이보다 효율성을 중시하면 순위는 달라진다.
ARC-AGI-3 결과는 효율성을 적응과 연결하기 때문에 이 논쟁을 심화한다. Astra는 익숙한 프로그래밍 과제에서 단계만 절약한 것이 아니다. 알려지지 않은 규칙을 발견하는 과정에서도 단계를 효과적으로 사용했다.
이 조합은 실제 에이전트 배포와 관련이 있다. 비즈니스 소프트웨어는 바뀌고, 웹사이트는 예상치 못한 상태를 제시하며, 리포지터리에는 문서화되지 않은 관례가 담겨 있다. 유용한 에이전트는 완벽한 지침서를 받지 않아도 적응해야 한다.
그러나 ARC의 작은 게임 세계는 여전히 추상화다. 모호한 목표, 접근 제어, 사회적 판단, 잘못된 행동의 결과 등 조직에서 발견되는 많은 복잡성을 제거한다.
책임 있는 결론은 더 제한적이다. Astra는 적응형 추론과 행동 효율성이 크게 개선됐다는 증거를 제공한다. 이러한 향상이 지속적인 전문 업무로 이전되는지는 여전히 독립적인 테스트가 필요하다.
따라서 anthropic GPT 경쟁의 승자는 배포 증거에 따라 결정될 것이다. 벤치마크 선도는 시험 사용의 계기가 될 수 있다. 신뢰성 있고 효율적인 과제 완료가 해당 모델의 지속 사용 여부를 결정한다.
Chollet은 AGI를 선언하지 않은 채 전망을 앞당겼다
Chollet의 반응은 더 빠른 진전을 인정하면서도 일반 지능에 대한 엄격한 정의를 유지한다.
François Chollet은 2019년에 최초의 Abstraction and Reasoning Corpus를 만들었다. 그는 축적된 지식만이 아니라 기술 습득을 시험하도록 이를 설계했다.
그의 주장은 오랫동안 표준적인 스케일링 서사에 이의를 제기해 왔다. 시스템은 폭넓은 적응형 지능을 획득하지 않고도 많은 익숙한 과제에서 더 나아질 수 있다. 훈련 범위와 벤치마크 준비는 일반화를 모방할 수 있다.
ARC 과제는 그 차이를 드러내려 한다. 언어, 저장된 사실, 인지 가능한 전문 형식에 대한 의존을 최소화한다. 모델은 평가 중 이용 가능한 증거를 바탕으로 과제를 추론해야 한다.
ARC-AGI-3가 출시됐을 때 Chollet은 프런티어 모델이 약 1년 내 이를 포화 상태에 가깝게 만들 것으로 예상한 것으로 전해진다. Astra는 약 6개월 뒤 OpenAI의 특화 하니스에서 이를 거의 포화시켰다.
Chollet은 이 진전이 예상보다 약 두 배 빠르다고 평가했다. 그는 Astra를 인터랙티브 추론 문제에서의 단계적 변곡점으로도 묘사했다.
이 발언들은 그의 AGI 전망을 앞당겼지만, 날짜를 확정하지는 않았다. 또한 하나의 벤치마크 결과를 충분한 증거로 보지도 않았다.
Chollet의 추론은 헤드라인 예측보다 더 중요하다. ARC-AGI-3는 소규모 환경에서 일반 지능과 연관된 질적 속성을 시험한다. 여기에는 불확실성 아래에서의 탐색, 인과 모델링, 명시적 지시 없이 이루어지는 적응이 포함된다.
제약된 환경에서 그러한 속성을 보이는 모델은 의미 있는 임계점을 넘었다. 그렇다고 개방형 세계 전반에서 같은 역량을 보였다는 의미는 아니다.
이 구분은 역량 증거와 AGI라는 라벨을 분리한다. AGI에는 보편적으로 합의된 운영적 정의가 없다. 기업, 연구자, 계약은 서로 다른 기준을 적용할 수 있다.
OpenAI President Greg Brockman은 출시 당시 더 폭넓은 해석을 제시했다. 그는 개인적으로 회사가 AGI에 도달했다고 믿는다고 말하면서도, Astra가 각자의 정의를 충족하는지는 사용자가 판단하도록 남겼다.
그러한 수사는 모든 벤치마크의 중요도를 높인다. 모델을 AGI라고 부르면 모델 순위를 넘어선 검증을 불러온다. 이는 신뢰성, 자율성, 전이성, 낯선 영역 전반의 성능에 대한 기대를 만든다.
ARC-AGI-3는 그 서사의 일부를 뒷받침한다. Astra는 직접적인 암기를 어렵게 설계된 환경에서 효과적으로 적응했다. 표준 하니스 점수는 완전한 인간 커버리지보다도 상당히 낮은 격차를 남겼다.
다른 결과들은 이 복합적인 모습을 강화한다. Astra는 Epoch의 표준화된 FrontierMath Erdős 평가에서 기계 검증된 증명으로 68개의 미해결 문제 중 2개를 푼 유일한 모델이 된 것으로 전해진다.
Lean 검증은 형식 소프트웨어가 그 증명의 논리적 타당성을 확인했다는 뜻이다. 따라서 설득력은 있지만 틀린 문장을 통해 결과를 부풀리기 더 어렵다.
훨씬 더 많은 컴퓨팅을 사용한 비표준 실행에서 추가로 세 개의 해법이 나온 것으로 전해진다. Epoch는 같은 평가 예산을 따르지 않았기 때문에 해당 시도를 점수 비교에서 제외했다.
이 경계는 중요하다. 모델의 관측된 최고 결과는 가능성을 보여줄 수 있다. 표준화된 실행은 비교를 위한 더 나은 근거를 제공한다.
Astra의 형식 수학 성능은 더 강한 탐색 및 검증 능력을 시사한다. 일부 전문 과제와 긴 컨텍스트 과제에서의 더 약한 결과는 그러한 능력이 균일하게 전이되지 않는다는 점을 보여준다.
AGI 선언은 이러한 불균일성을 다뤄야 한다. 일반 지능은 기록적인 점수들의 집합과 동일하지 않다. 이는 환경, 목표, 증거가 함께 바뀔 때 신뢰성 있게 적응하는 능력을 의미한다.
이전 ARC 사례는 경고를 제공한다. OpenAI의 o3는 ARC-AGI-1에서 주요 결과를 내며 임계점을 넘었는지에 관한 비슷한 논쟁을 일으켰다.
이후 연구자들은 비용, 과제 노출, 벤치마크 숙련과 일반 지능의 차이를 강조했다. ARC-AGI-2와 ARC-AGI-3는 평가 여유를 되살리기 위해 부분적으로 만들어졌다.
Astra의 성능은 Chollet이 예상한 것보다 더 빠르게 그 여유를 압축했다. 이것이 실제 전망 변화다. 이제 벤치마크 설계자들은 최전선에서 계속 유의미한 테스트를 구축할 시간이 더 적다.
교훈은 평가가 실패했다는 것이 아니다. 유용한 벤치마크에는 지속적인 갱신이 필요하다는 것이다. 과제가 포화되거나 직접적으로 목표가 되면, 일반 적응과 특화 최적화를 구분하는 능력을 일부 잃는다.
벤치마크 격차는 신중해야 할 가장 강력한 이유다
Astra의 결과는 하니스, 범위, 종합 방식을 함께 검토하면 덜 결정적으로 보인다.
첫 번째 불확실성은 평가 범위에 관한 것이다. Epoch의 169점은 폭넓지만 계속 변화하는 모음을 요약한다. Artificial Analysis의 61점은 서로 다른 고정된 구성과 가중치를 반영한다.
종합 지수는 모델이 한 영역에서 결과를 내지 못할 때 바뀔 수 있다. 또한 새 모델이 출시 시점에 광범위한 테스트를 받은 분야를 강조할 수도 있다.
Epoch의 초기 Astra 기록에는 코딩 범위가 제한적이었던 것으로 전해진다. Claude Fable 5.1은 여러 코딩 평가에서 최고 결과를 유지했다. 따라서 헤드라인 총점만 비교하면 불균등한 증거를 감출 위험이 있다.
두 번째 불확실성은 하니스 설계에 관한 것이다. 하니스는 모델이 컨텍스트를 받는 방식, 상태를 보존하는 방식, 도구를 사용하는 방식, 답변을 제출하는 방식을 통제한다.
ARC Prize의 표준 하니스는 선택된 노트가 유지되도록 허용한다. OpenAI의 제공업체 어댑터는 불투명한 추론 상태를 보존하고 긴 상호작용을 압축한다. 이는 실질적으로 다른 운영 조건이다.
99.9% 점수는 Astra가 자체 인프라로 무엇을 할 수 있는지 보여준다. 표준 인터페이스를 통해 테스트된 모델들에 대한 직접적인 승리로 제시해서는 안 된다.
이 문제는 모델 제공업체가 완전한 시스템을 최적화할수록 커질 것이다. 숨겨진 추론, 독점 메모리, 라우팅, 도구 정책은 결과를 개선할 수 있지만 독립적 재현성은 낮출 수 있다.
세 번째 불확실성은 과제 전이에 관한 것이다. ARC-AGI-3는 작은 인터랙티브 세계 안에서 적응을 분리한다. 이는 테스트를 과학적으로 유용하게 만들지만 운영 측면에서는 불완전하다.
비즈니스 에이전트는 권한, 상충하는 지시, 불분명한 목표, 변화하는 외부 시스템을 처리해야 한다. 또한 언제 멈추고 인간의 판단을 요청해야 하는지도 알아야 한다.
Astra의 이동 효율성은 그러한 행동을 검증하지 않는다. 더 적은 행동으로 퍼즐을 푸는 일은 피해를 일으키지 않고 프로덕션 데이터를 편집하는 일과 다르다.
OpenAI의 안전성 자료는 신중한 테스트가 필요한 또 다른 이유를 더한다. 회사는 Astra가 Sol보다 더 강력한 견고성과 정렬 훈련을 받았다고 말한다. 또한 고급 추론을 모니터링하는 일이 더 어렵다는 점도 인정한다.
그 safety overview는 사이버보안과 도구 사용 배포를 위한 통제를 논의한다. 회사의 안전성 주장은 더 폭넓은 독립 평가가 가능해질 때까지는 제공업체 보고에 기반한 내용으로 남는다.
더 뛰어난 컴퓨터 사용 능력은 가치와 노출을 모두 높인다. 소프트웨어를 효율적으로 탐색하는 에이전트는 긴 워크플로를 자동화할 수 있다. 같은 자율성은 오해된 지시나 취약한 접근 제어가 초래하는 결과도 키운다.
별도의 우려는 벤치마크 타기팅과 관련된다. Chollet의 원래 전망에는 연구소가 ARC-AGI-3를 얼마나 직접적으로 추구하는지에 대한 조건이 포함돼 있었다.
인터랙티브 추론을 중심으로 훈련되거나 조정된 모델은 다른 영역에서 동등한 능력을 얻지 않고도 빠르게 개선될 수 있다. 이것이 결과를 무효화하지는 않는다. 다만 개선을 얼마나 넓게 일반화해야 하는지를 제한한다.
인터랙티브 세계에서는 정적 질문보다 데이터 오염이 덜 단순한 문제다. 그럼에도 제공업체는 벤치마크 원리, 인터페이스, 개발 피드백을 중심으로 최적화할 수 있다.
반복 평가 역시 선택 효과를 만든다. 여러 시도 중 최선의 구성은 일반적인 배포에서 기대되는 결과보다 훨씬 강해 보일 수 있다.
ARC Prize 페이지는 여러 Astra 하니스 구성을 나열한다. 구매자는 관측된 최고 실행과 고정 설정에서 재현 가능한 성능을 구분해야 한다.
비용 예산은 비교를 더욱 복잡하게 만든다. Astra의 62.7% 표준 하니스 실행에는 상당한 평가 예산이 사용됐다. 제공업체 어댑터 결과는 전체 비용이 더 낮았지만 특화된 설정에 의존했다.
관련 질문은 그 지출이 정당했는지가 아니다. 다른 모델이 동등한 기회, 설정, 인프라를 받았는지다.
인간 효율성 비교에도 비슷한 주의가 필요하다. Astra는 성공한 과제에서 평균 인간보다 더 적은 이동을 사용했다. 인간은 벤치마크 환경의 더 넓은 비중을 해결했다.
성공을 조건으로 한 효율성은 전반적인 우위와는 다르다. 시스템은 과업을 이해할 때는 곧바로 수행할 수 있지만, 다른 과업에서는 완전히 실패할 수 있다.
보도는 두 사실을 모두 보존해야 한다. Astra는 평균 인간의 행동 효율성 기준선을 넘었다. 그러나 표준 하니스 전반에서 인간 수준의 완전한 커버리지를 달성하지는 못했다.
따라서 벤치마크 간 불일치는 어느 한 순위만으로는 얻을 수 없는 가치를 지닌다. 이는 ‘최고’라는 단어에 가려진 차원을 드러낸다.
Astra는 적응형 추론, 선별된 과학 과업, 효율적인 에이전트 작업에서 더 강한 것으로 보인다. Claude Fable 5.1은 중요한 독립 지능 지수와 여러 코딩 지표에서 여전히 우위를 유지한다.
이러한 불확실성은 배포 방식을 결정해야 한다. 조직은 대표적인 과업, 고정된 예산, 반복 시험, 기록된 인간 개입이 필요하다. 첫 시도 성공만큼이나 실패 복구도 면밀히 검증해야 한다.
팀은 문서화된 AI 워크플로를 통해 이러한 결과를 보존할 수 있다. 지속 가능한 평가 기록은 이후 모델 변경 사항을 더 쉽게 비교할 수 있게 한다.
어떤 공개 벤치마크도 모든 조직의 제약을 재현할 수는 없다. 벤치마크 간 격차는 평균으로 없애야 할 잡음이 아니다. 그것은 각 모델의 역량이 어디에 집중되는지에 관한 정보다.
Astra가 경쟁 구도를 바꿨는지 판단할 세 가지 신호
다음 시험대는 Astra의 적응형 효율성이 중립적 평가와 일반적인 전문 업무 환경에서도 유지되는지 여부다.
첫 번째 신호는 더 폭넓은 공급자 중립적 ARC-AGI-3 테스트다. Claude Fable 5.1, 최신 Gemini 모델 및 기타 프런티어 시스템은 표준 하니스를 통해 비교 가능한 실행 결과를 내놓아야 한다.
경쟁 모델들이 Claude Opus 5의 보고된 범위에 머문다면 Astra의 우위는 더 강해진다. 반대로 동일한 조건에서 평가했을 때 다른 모델들이 62.7%에 근접한다면 그 우위는 약화된다.
Astra의 반복 실행도 중요하다. 안정적인 분포는 이 결과가 신뢰할 수 있는 역량을 반영한다는 점을 보여줄 것이다. 변동 폭이 크다면 관측된 최고 점수가 일반적인 성능을 과장했음을 시사할 수 있다.
두 번째 신호는 독립적인 코딩 및 컴퓨터 사용 평가 범위의 확대다. Epoch의 지수에는 일관된 추론 설정 전반에 걸친 더 많은 Astra 결과가 필요하다.
추가 코딩 테스트에서도 모델의 선두가 유지된다면 169점은 신뢰도를 얻는다. 더 폭넓은 커버리지가 Astra를 Sol 수준 또는 Claude Fable 5.1 아래로 끌어내린다면 설득력은 떨어진다.
실제 컴퓨터 사용 연구는 과업 완료율, 경과 시간, 개입, 실수로 인한 피해를 보고해야 한다. 토큰 총량만으로는 실패한 에이전트가 초래하는 운영상 부담을 포착할 수 없다.
독립 평가자들은 네이티브 공급자 시스템과 공통 하니스를 분리해서도 평가해야 한다. 둘 다 유용하지만, 서로 다른 질문에 답한다.
네이티브 평가는 고객이 접근할 수 있는 최상의 제품을 보여준다. 표준화된 평가는 기저 모델 자체를 더 많이 분리해 내고 더 공정한 경쟁을 가능하게 한다.
세 번째 신호는 지속적인 배포에서 나오는 증거다. OpenAI는 더 폭넓게 제공하기 전에 Astra를 제한된 조직 집단에 우선 배포했다.
이들 사용자는 대화형 추론이 리포지터리, 브라우저, 연구 프로세스, 엔터프라이즈 시스템으로 이전되는지 시험할 수 있다. 가장 강력한 보고서는 선별된 시연이 아니라 반복되는 과업을 문서화할 것이다.
Astra가 적은 예시와 제한적인 인간 교정만으로 낯선 워크플로를 학습한다면 AGI 해석은 강화된다. 사용자가 그 주변 환경을 광범위하게 준비해야 한다면 이러한 해석은 약화된다.
특히 실패 복구를 지켜봐야 한다. 일반적 적응에는 성공 경로를 찾는 것 이상이 필요하다. 시스템은 실수를 감지하고, 가정을 수정하며, 해로운 행동을 반복하지 않아야 한다.
Anthropic과 GPT의 경쟁은 양측 공급자가 에이전트 중심 결과를 발표하면서 더욱 치열해질 것이다. Claude의 대응은 모든 Astra 점수를 넘어설 필요가 없다. 신뢰성이나 효율성이 어디에서 더 나은 완료 작업으로 이어지는지를 보여주면 된다.
OpenAI도 같은 부담을 안고 있다. ARC-AGI-3의 도약은 적응형 추론에 관한 신뢰할 만한 주장을 만든다. 그렇다고 Artificial Analysis에서의 Claude 우위나 Astra의 더 약한 개별 결과가 사라지는 것은 아니다.
따라서 Chollet의 수정된 일정은 기대치를 업데이트하라는 경고로 이해하는 것이 가장 적절하다. 프런티어 시스템은 한 저명한 벤치마크 설계자가 예상한 것보다 더 빠르게 대화형 추론을 획득하고 있다.
그렇다고 확정된 AGI 날짜가 나오는 것은 아니다. 기존 테스트가 프런티어 시스템과 적응형 인간 행동을 구분할 수 있는 기간이 짧아진다는 뜻이다.
개발자는 정제된 프롬프트만이 아니라 미지의 상태를 기준으로 모델을 평가해야 한다. 엔터프라이즈 구매자는 정확성과 함께 수정 및 감독을 측정해야 한다. 지식 노동자는 에이전트가 첫 해석에 실패했을 때 복구할 수 있는지 물어야 한다.
중요한 질문은 더 이상 어느 리더보드가 절대적인 신뢰를 받을 자격이 있는지가 아니다. 어떤 평가가 위임하려는 업무와 닮아 있으며, 그 조건이 의도된 배포 환경과 일치하는지가 핵심이다.
현재 Astra는 낯선 대화형 과업에서 가장 눈에 띄는 결과를 보유하고 있다. Claude Fable 5.1은 또 다른 주요 독립 지수에서 더 강한 점수를 보유하고 있다. Epoch는 전반적으로 Astra를 앞에 둔다.
이러한 결과는 모두 사실일 수 있다. 함께 보면, 프런티어 모델 경쟁이 하나의 숫자로 판단할 수 있는 단계를 넘어섰음을 보여준다.
대표적인 워크플로를 선택하고, 증거를 보존하며, 중립적인 ARC 결과와 더 폭넓은 코딩 평가가 나오면 다시 테스트하라. 이러한 접근은 Astra가 이미 AGI라는 명칭을 받을 자격이 있는지를 둘러싼 또 하나의 논쟁보다 더 많은 것을 드러낼 것이다.


