top of page

Artificial Analysis Coding Agent Index, Claude를 1위에 올렸지만 비용은 선두 구도를 다시 정렬한다

6일 전
11분 분량

Artificial Analysis는 Claude Sonnet 5.5에 68점을 부여해 1위에 올렸지만, 새 코딩 에이전트 결과는 비용 측면에서 훨씬 덜 편안한 이야기를 보여준다.

Artificial Analysis Coding Agent Index에서는 최대 노력 설정의 Sonnet 5.5를 탑재한 Claude Code가 Gemini 4 Argon과 GPT-6.1 Sol을 앞섰다. 하지만 이 우승 구성은 가장 가까운 신규 경쟁자들보다 작업당 훨씬 더 많은 시간, 토큰, API 비용을 소비한다.

이 차이는 개발팀의 실질적인 선택을 바꾼다. Claude는 종합 벤치마크에서 앞서지만, GPT-6.1 Sol 기반 Codex는 측정된 자원의 일부만으로 거의 비슷한 결과를 제공한다. Gemini 4 Argon은 그 사이에 위치하며, 강력한 종합 점수와 장기 소프트웨어 작업에서의 뚜렷한 우위를 결합한다.

원본 벤치마크 게시물은 세 출시를 새로운 선두 주자로 제시한다. 기초 결과는 이들의 중요성을 뒷받침하지만, 단순한 3위권 시상대로 보기는 어렵다. Claude Opus 5.5를 포함한 다른 구성도 상위권에 자리한다.

더 중요한 점은 각각의 결과가 모델, 추론 설정, 에이전트 하니스에 속한다는 것이다. 리더보드는 추상적인 모델 지능만을 테스트하지 않는다. Claude Code, Codex, Antigravity CLI와 같은 완전한 코딩 시스템을 테스트한다.

이 구분이 이 이야기의 핵심이다. 팀은 더 이상 가장 높은 점수를 낸 모델만 선택하지 않는다. 벤치마크 점수 1점을 더 얻기 위해 얼마만큼의 추가 시간과 컴퓨팅 비용을 지불할 가치가 있는지를 선택하고 있다.

Artificial Analysis Coding Agent Index에서 달라진 점

최신 결과는 이전 모델 비교보다 벤치마크 선도와 운영 효율성을 더욱 명확히 분리한다.

Artificial Analysis는 개별 코드 완성 질문이 아니라 엔드투엔드 작업을 기준으로 코딩 에이전트를 평가한다. 이 인덱스는 저장소 수정, 터미널 작업, 코드베이스 이해를 하나의 점수로 결합한다.

최대 노력 설정에서 Sonnet 5.5를 실행한 Claude Code는 68점으로 선두다. 구성 요소별 결과는 DeepSWE v1.1에서 72%, Terminal-Bench 4.0에서 66%, SWE-Atlas-QnA에서 67%다.

Gemini 4 Argon을 실행한 Antigravity CLI는 64점을 받았다. DeepSWE에서 79%, Terminal-Bench에서 56%, 저장소 질문에서 56%를 기록했다.

xhigh 노력 설정의 GPT-6.1 Sol 기반 Codex는 63점을 받았다. 이 구성은 DeepSWE에서 73%, Terminal-Bench에서 55%, SWE-Atlas-QnA에서 61%를 기록했다.

이 총점은 Claude와 Sol의 차이가 단 5점임을 보여준다. 그러나 Artificial Analysis는 Claude 구성이 작업당 약 8.7배 많은 토큰을 사용했다고 측정했다. 실행 시간도 거의 6배 더 길었다.

측정된 API 비용에서는 격차가 더욱 넓다. 최대 노력 설정의 Claude 구성은 Codex의 xhigh Sol보다 작업당 약 13.6배 더 많은 비용이 든다.

Gemini 4 Argon은 이 두 극단 사이에 자리한다. 측정 비용은 Sol의 약 5.6배지만, 인덱스 우위는 1점이다. 약 4.3배 많은 토큰을 소비하고 두 배 이상 더 오래 걸린다.

따라서 벤치마크 비교는 두 가지 이야기를 전한다. Claude는 가장 높은 종합 점수를 기록했지만, Sol은 이 세 구성 중 측정된 점수 대비 비용 관계가 가장 뛰어나다.

Artificial Analysis는 Sonnet 5.5에 대해서도 여러 노력 설정을 보고한다. 최대 노력은 Claude Code의 기본 설정이 아니기 때문에 이 세부 사항은 중요하다.

xhigh 노력 설정의 Sonnet 5.5는 63점으로 Sol의 대표 점수와 같다. Sol보다 두 배 넘는 토큰을 사용하며, 측정 비용은 세 배 이상 높다.

높은 노력 설정에서 Sonnet은 55점을 기록한다. Claude Code의 기본 설정인 중간 노력에서는 46점이다. 이 결과는 추론 예산이 평가 대상 제품을 얼마나 크게 바꾸는지 보여준다.

같은 패턴은 Sol 결과 내부에서도 나타난다. 중간 노력 설정의 GPT-6.1 Sol은 61점으로 xhigh 구성보다 단 2점 낮다. 측정 비용과 실행 시간도 크게 감소한다.

최대 추론이 자동으로 최선의 결과를 만들지는 않는다. 공개된 평가에서 Sol의 xhigh 결과는 최대 노력 결과보다 3점 높다.

이 직관에 반하는 결과는 에이전트 벤치마크에 변동성이 존재한다는 점을 상기시킨다. 추론 시간이 더 길면 도움이 될 수 있지만, 더 긴 작업 경로, 불필요한 도구 호출, 비생산적인 재고를 만들 수도 있다.

헤드라인의 승자는 최대 노력 Sonnet 5.5를 탑재한 Claude Code로 남는다. 더 중요한 변화는 구매자가 이제 마지막 5점에 얼마나 가파른 가격이 붙는지 확인할 수 있다는 점이다.

이 벤치마크는 모델만이 아니라 시스템을 측정한다

코딩 에이전트 점수는 모델, 하니스, 도구, 추론 예산 간 상호작용을 반영한다.

Coding Agent Index v1.5는 동일한 가중치의 세 가지 구성 요소를 사용한다. 공개된 인덱스 방법론에 따르면, 각 구성 요소는 소프트웨어 작업의 서로 다른 부분을 테스트한다.

DeepSWE v1.1에는 113개의 장기 작업이 포함된다. 에이전트는 기존 저장소를 수정해야 하며, 별도의 검증 환경이 커밋된 패치의 통과 여부를 판단한다.

Terminal-Bench 4.0에는 소프트웨어 엔지니어링, 머신러닝, 보안, 시스템 관리 등의 영역을 포괄하는 66개 작업이 포함된다. 에이전트는 명령줄 환경에서 작업하고, 이후 테스트 스위트가 결과를 채점한다.

SWE-Atlas-QnA에는 124개의 저장소 질문이 포함된다. 이 작업들은 에이전트가 낯선 코드를 추적하고 그 동작을 정확히 설명할 수 있는지 측정한다.

각 작업에는 세 번의 시도가 주어진다. Artificial Analysis는 각 구성 요소의 pass-at-one 결과를 계산한 뒤, 세 구성 요소에 동일한 가중치를 부여해 종합 인덱스를 만든다.

이 구조는 일반적인 코드 생성 테스트보다 범위가 넓다. 저장소를 살피고, 도구를 선택하며, 터미널을 조작하고, 맥락을 유지하며, 실수에서 회복할 수 있는 에이전트에 보상을 준다.

이 때문에 하니스도 중요하다. 하니스는 모델을 파일, 터미널, 지침, 컨텍스트 관리, 도구 실행과 연결하는 소프트웨어 계층이다.

Claude Code, Codex, Antigravity CLI는 동일한 워크플로를 제공하지 않는다. 이들은 컨텍스트를 서로 다르게 구성하거나, 서로 다른 도구 사용 패턴을 유도하거나, 서로 다른 제한을 둘 수 있다.

따라서 이 벤치마크는 Sonnet 5.5가 언제나 GPT-6.1 Sol보다 우수한 코딩 모델이라는 점을 입증할 수는 없다. 이는 테스트된 한 Claude Code 구성이 테스트된 한 Codex 구성보다 높은 점수를 기록했다는 점을 보여준다.

이 구분은 구성 요소 점수에서 드러난다. Gemini 4 Argon은 전체 순위에서는 Claude 아래지만, DeepSWE에서는 79%로 세 모델을 이끈다.

Sol은 DeepSWE에서 최대 노력 Sonnet을 근소하게 앞선다. Claude는 더 큰 격차를 확보한 Terminal-Bench와 SWE-Atlas-QnA를 통해 전체 선두를 구축한다.

따라서 결과는 서로 다른 역량 프로필을 묘사한다. Gemini는 벤치마크의 장기 저장소 변경 작업에서 가장 강력해 보인다. Claude는 터미널 작업과 저장소 이해 전반에서 더 균형 잡힌 모습을 보인다.

Sol은 더 적은 측정 자원을 사용하면서도 세 항목 모두에서 경쟁력을 유지한다. 두 경쟁자 모두를 상대로 포함된 구성 요소에서 승리하지는 못하지만, 심각한 약점도 피한다.

이 균형은 프로덕션 사용에서 중요하다. 대규모 저장소를 유지하는 팀은 저장소 질문 응답보다 패치 완료를 더 중시할 수 있다. 다른 팀은 다양한 환경에서 신뢰할 수 있는 터미널 작업이 필요할 수 있다.

인덱스의 단일 숫자는 독자가 전체 구도를 빠르게 파악하는 데 도움이 된다. 그러나 정의된 워크로드에 맞는 도구를 선택할 때 구성 요소 결과를 대체해서는 안 된다.

Artificial Analysis는 동일한 벤치마크 스위트 전반의 토큰, 비용, 시간 데이터도 통합한다. 누락된 텔레메트리는 0으로 처리하지 않고 관련 평균에서 제외한다.

비용 계산은 제공업체가 해당 항목을 별도로 가격 책정할 경우 일반 입력, 캐시된 입력, 캐시 쓰기, 추론, 출력 토큰을 고려한다. 이는 구독 가격이 아니라 토큰당 API 비용을 나타낸다.

보고된 비용에는 여러 운영 비용도 제외되어 있다. 엔지니어링 통합, 인간 검토, 환경 설정, 보안 통제, 결함 있는 패치의 결과는 포함하지 않는다.

이러한 제외는 비교를 약화시키지 않는다. 이는 이 비교가 답할 수 있는 질문, 즉 평가된 에이전트가 이 테스트에서 얼마나 많은 모델 사용량을 소비했는지를 정의한다.

또한 가장 저렴한 벤치마크 실행이 언제나 가장 저렴한 승인된 풀 리퀘스트를 만들지는 않는 이유를 설명한다. 더 약한 결과는 추가 검토, 수정, 재실행 비용을 발생시킬 수 있다.

따라서 팀은 직접적인 추론 비용과 성공적인 결과당 비용을 모두 평가해야 한다. 공개된 인덱스는 유용한 재료를 제공하지만, 이 완전한 비즈니스 지표를 계산하지는 않는다.

Claude Sonnet 5.5는 가파른 효율성 프리미엄을 치르고 성능에서 승리한다

이 벤치마크 안에서 Claude의 선두는 실재하지만, 최대 노력은 작은 점수 우위를 큰 자원 투입으로 바꾼다.

Anthropic은 2026년 9월 28일 Sonnet 5.5를 출시했다. 회사는 이를 범위가 정해진 일상 작업, 디버깅, 문서 작성에 적합한 Opus 5.5의 더 빠르고 저렴한 보완재로 포지셔닝한다.

Anthropic의 모델 출시 세부 사항은 조정 가능한 노력을 강조한다. 낮은 설정은 속도와 경제성을 우선하며, 높은 설정은 모델에 추론하고 작업을 점검할 더 많은 시간을 제공한다.

Artificial Analysis 결과는 이 설계의 양면을 보여준다. Sonnet을 중간 노력에서 최대 노력으로 옮기면 인덱스는 46점에서 68점으로 상승한다.

이 22점 향상은 상당하다. 그러나 약 21배 많은 토큰, 10배 이상의 실행 시간, 거의 23배의 측정 API 비용이 수반된다.

최대 노력은 매우 긴 에이전트 작업 경로도 만든다. Artificial Analysis는 선두 구성에서 작업당 약 266턴과 총 2,770만 토큰을 기록했다.

이 수치가 모든 실제 작업에서 동일한 자원이 소비된다는 뜻은 아니다. 수백 차례의 작업 시도가 포함된 까다로운 벤치마크 스위트 전반의 평균 동작을 보여준다.

이는 모델이 어떻게 승리하는지도 밝힌다. 가장 높은 성능의 구성은 같은 예산으로 더 똑똑한 답을 단순히 생성하는 것이 아니다. 환경과 상호작용하는 데 훨씬 더 많은 시간을 쓰고 있다.

이 전략은 종합 점수에서 성과를 낸다. Claude는 Gemini를 4점, Sol을 5점 앞선다. 세 가지 구성 요소 벤치마크 중 두 곳에서도 세 모델 가운데 최고 결과를 기록했다.

Claude의 낮은 노력 설정까지 비교에 포함하면 이 프리미엄은 정당화하기가 더 어려워진다. xhigh 설정의 Sonnet은 Sol의 63점과 같지만, 더 많은 토큰, 시간, 측정 비용을 소비한다.

높은 노력 설정에서는 Claude가 Sol xhigh보다 8점 뒤처진다. 자원 사용량은 Sol에 더 가까워지지만, 성능 격차는 의미 있게 커진다.

중간 노력 설정에서 Claude는 최대 구성보다 훨씬 저렴하고 빨라진다. 그러나 점수는 Sol xhigh보다 17점, Gemini보다 18점 낮다.

이 결과들 사이에는 모순이 없다. Anthropic은 사용자가 더 많은 테스트 시점 추론을 구매할 수 있게 하며, 벤치마크는 추가 추론이 작업 완료율을 높일 수 있음을 보여준다.

상충 관계는 규모에 관한 것이다. 개인 개발자는 어려운 마이그레이션을 위해 길고 비싼 실행을 받아들일 수 있다. 수천 건의 일상적인 변경을 처리하는 회사는 다른 계산에 직면한다.

최적의 설정은 하나의 워크플로 안에서도 달라질 수 있다. 팀은 탐색에는 중간 노력, 구현에는 높은 노력, 고질적인 실패에만 최대 노력을 사용할 수 있다.

그 라우팅 전략은 모든 티켓에 최고 수준의 리소스 예산을 적용하지 않으면서 Claude의 최고 성능에 대한 접근성을 보존할 수 있다. 이를 위해서는 측정과 명확한 에스컬레이션 규칙이 필요하다.

따라서 Claude의 벤치마크 승리는 완료 품질이 다른 모든 제약 조건을 압도하는 작업에서 가장 의미가 크다. 예로는 어려운 크로스 리포지토리 수정, 취약한 마이그레이션, 실패 비용이 높은 인시던트가 있다.

반면 대량 유지보수 작업에서는 결정력이 낮다. 의존성 업데이트, 소규모 리팩터링, 테스트 생성, 일상적인 버그 수정은 예측 가능한 비용으로 충분한 품질을 제공하는 방식을 선호하는 경우가 많다.

이 때문에 Artificial Analysis Coding Agent Index를 구매 결정을 위한 지름길로 삼아서는 안 된다. 68점 결과는 자동으로 적용해야 하는 기본값이 아니라 최고 성능 구성이다.

GPT-6.1 Sol과 Gemini 4 Argon, 서로 다른 방향에서 Claude를 압박하다

Sol은 효율성 측면에서 Claude에 도전하고, Argon은 장기 리포지토리 작업 측면에서 도전한다.

OpenAI는 Anthropic이 Sonnet 5.5를 출시한 다음 날인 9월 29일 GPT-6.1 Sol을 공개했다. Google은 9월 30일 Gemini 4 Argon을 뒤이어 출시했다.

이 시점 덕분에 Artificial Analysis는 며칠 안에 세 가지 새로운 최전선 구성을 비교할 수 있었다. 이들의 벤치마크 순위는 출시 설명이 시사하는 것보다 더 큰 차별화를 보여준다.

OpenAI는 Sol을 더 낮은 비용으로 코딩, 컴퓨터 사용, 전문 업무를 수행할 수 있는 준 플래그십 모델로 설명한다. Sol 모델 카드는 low부터 maximum까지 다섯 가지 추론 설정을 지원한다.

Coding Agent Index에서 xhigh는 Sol의 최고 테스트 설정이다. xhigh는 63점을 기록한 반면, maximum effort는 60점이다.

이 결과는 가장 큰 추론 예산이 언제나 가장 안전하다는 가정을 흔든다. 팀은 기본적으로 가장 높은 레이블을 선택하기보다 effort 설정을 직접 벤치마킹해야 한다는 의미다.

Sol의 주된 장점은 리소스 단위당 일관성이다. xhigh 구성은 평균 작업을 약 15.5분 만에 완료하며 320만 토큰을 소비한다.

maximum-effort Claude는 약 90분과 2,770만 토큰이 필요하다. Gemini는 약 34.5분과 1,370만 토큰이 필요하다.

Sol은 각 구성 요소에서도 경쟁력 있는 성능을 보인다. DeepSWE에서 73%를 기록해 Claude의 72%를 넘지만 Gemini의 79%에는 못 미친다.

Terminal-Bench 및 리포지토리 질문 점수는 Claude보다 낮다. 이 격차가 종합 점수에서 5점 차이를 만든다.

많은 조직에는 이 격차가 수용 가능할 것이다. Sol의 낮은 리소스 사용량은 같은 예산 내에서 더 많은 시도, 더 넓은 배포 또는 추가 검증을 가능하게 한다.

이 비교가 Sol이 보편적으로 더 경제적이라는 점을 입증하는 것은 아니다. 제공업체 가격은 변할 수 있고, 캐싱 패턴도 다르며, 내부 워크로드는 다른 토큰 분포를 만들 수 있다.

다만 검증할 가치가 있는 강력한 가설은 제시한다. 팀의 작업이 벤치마크와 유사하다면, Sol을 사용하는 Codex는 maximum-effort Claude보다 더 나은 비용 대비 성능 균형을 제공할 수 있다.

Gemini 4 Argon은 다른 종류의 압박을 만든다. Google은 Argon을 복잡한 전문 워크플로 전반에서 지속적인 추론을 수행하는 모델로 소개했다.

Google의 Argon 발표는 코드 마이그레이션, 메모리 최적화, 연구, 사이버보안과 관련된 내부 활용 사례를 설명한다. 이러한 사례는 독립적으로 재현되기 전까지는 기업의 주장에 해당한다.

Coding Agent Index는 이 이야기의 한 부분에 대해 제3자 근거를 추가한다. Argon의 DeepSWE 79% 결과는 세 가지 주요 시스템 가운데 가장 강력하다.

이 결과는 장기 작업에 대한 Google의 초점과 부합한다. 전체 지수에서는 Claude가 선두지만, Argon은 장시간에 걸친 리포지토리 변경 작업에서 주목할 가치가 있음을 시사한다.

Argon의 더 약한 리포지토리 질문 점수는 종합 결과를 끌어내린다. 56% 결과는 Sol보다 5점, Claude보다 11점 낮다.

이 모델은 Sol과 같은 측정된 효율성도 갖추지 못했다. Argon은 Sol보다 종합 점수가 1점 높지만 작업당 토큰은 네 배 이상 필요하다.

그렇다고 이 구성이 비합리적인 것은 아니다. 어려운 구현 작업에 직면한 조직이라면 더 높은 DeepSWE 완료율이 리소스 사용량보다 중요할 수 있다.

중요한 질문은 워크로드 매칭이다. Sol은 효율적인 범용 모델로 매력적으로 보이는 반면, Argon은 장기간 리포지토리 수정에서 더 강한 신호를 제공한다.

Claude는 가장 공격적인 설정에서 균형 잡힌 성능의 선두를 유지한다. 시장의 압박은 경쟁 모델들이 이 선두의 서로 다른 부분을 덜 가치 있게 만드는 데서 온다.

이는 하나의 보편적 순위보다 더 건강한 경쟁 구도다. 엔지니어링 팀에 거의 상호 교체 가능한 세 가지 모델 브랜드가 아니라 서로 다른 선택지를 제공한다.

또한 이 상황은 이식 가능한 워크플로를 유지하는 중요성을 높인다. 이점이 측정 가능하지 않다면 팀은 프롬프트, 검토 관행, 컨텍스트 준비 방식을 하나의 모델에 묶어서는 안 된다.

요구 사항, 의사결정, 이전 변경 사항을 검색 가능한 형태로 기록하면 이러한 비교의 일관성을 높일 수 있다. 팀은 엔지니어링 지식 베이스를 활용해 에이전트 시험 전반에 걸쳐 이러한 컨텍스트를 보존할 수 있다.

목표는 매주 모델을 바꾸는 것이 아니다. 성능 최전선이 이동할 때 전환과 평가가 가능하도록 만드는 것이다.

수치가 입증하지 못하는 것

벤치마크에서 5점 앞선다고 해서 실제 조직 내에서 더 나은 코드, 더 안전한 배포, 더 낮은 총 엔지니어링 비용이 보장되는 것은 아니다.

Artificial Analysis는 많은 리더보드 운영자보다 더 많은 방법론 세부 정보를 공개한다. 구성 요소 작업, 시도 횟수, 채점 방식, 효율성 정의가 문서화되어 있다.

그럼에도 벤치마크는 표본에 불과하다. 모든 언어, 리포지토리 구조, 의존성 환경, 보안 정책, 검토 기준을 대표할 수는 없다.

이 지수는 세 가지 구성 요소에 동일한 가중치를 부여한다. 실제 기업이 리포지토리 질문, 터미널 작업, 패치 완료를 정확히 같은 비율로 중시하는 경우는 드물다.

어떤 조직은 광범위한 테스트를 갖춘 TypeScript 서비스에 대부분의 시간을 쓸 수 있다. 다른 조직은 임베디드 C 코드, 데이터 파이프라인 또는 규제를 받는 금융 시스템을 유지보수할 수 있다.

이들의 내부 순위는 공개 리더보드와 다를 수 있다. DeepSWE에 뛰어난 모델도 독점 프레임워크나 문서화가 부실한 레거시 코드에서는 여전히 어려움을 겪을 수 있다.

Pass-at-one 채점은 중요한 품질 차이도 압축한다. 두 패치가 모두 자동 검증기를 통과하더라도 유지보수성, 보안성, 가독성 또는 아키텍처 적합성은 다를 수 있다.

반대의 경우도 가능하다. 유용한 부분 해결책이 하나의 검증 조건을 통과하지 못해 사용할 수 없는 시도와 동일한 이진 결과를 받을 수 있다.

SWE-Atlas-QnA는 또 다른 의존성을 도입한다. Artificial Analysis는 자동 심사기를 사용해 리포지토리 답변이 모든 필수 기준을 충족하는지 판단한다.

자동 심사는 대규모 평가를 지원한다. 하지만 특히 여러 가지 유효한 표현이 가능한 설명에서 모호성, 모델 편향, 채점 오류를 그대로 물려받을 수 있다.

벤치마크의 통합 평균은 분산도 숨긴다. 평균 비용은 대부분의 작업이 예측 가능한지, 아니면 소수의 작업이 매우 긴 궤적을 만드는지 드러내지 않는다.

이러한 분산은 예산 책정에 중요하다. 서비스는 적정한 평균을 감당할 수 있어도, 개별 실행이 과도한 토큰을 소비하거나 환경을 수 시간 점유할 수 있다.

제품 업데이트 이후 에이전트 행동도 바뀔 수 있다. 새로운 공개 모델 이름이 없어도 도구 선택, 컨텍스트 압축, 재시도 로직, 숨겨진 시스템 지침이 달라질 수 있다.

이러한 이유로 벤치마크는 특정 시점의 측정값으로 취급해야 한다. 이는 Claude Code, Codex, Antigravity CLI 또는 그 기반 모델의 영구적인 특성이 아니다.

maximum-effort Claude는 최고점 결과를 기본 경험으로 해석할 때의 위험을 보여준다. 벤치마킹된 구성은 Claude Code의 medium 기본값보다 리소스 집약도가 훨씬 높다.

이 지수는 토큰당 API 지출도 비교한다. 구독 한도, 협상된 엔터프라이즈 요금, 지역별 처리, 내부 인프라는 팀의 실제 경제성을 바꿀 수 있다.

인적 비용도 빠져 있다. 비동기적으로 작업한다면 더 느린 에이전트도 수용 가능할 수 있다. 개발자가 피드백을 기다리고 있다면 더 빠른 에이전트가 더 가치 있을 수 있다.

검토 부담도 아직 해결되지 않은 변수다. 광범위한 검사가 필요한 저렴한 패치는 짧은 검토 후 승인되는 비싼 패치보다 전체 비용이 더 클 수 있다.

보안 역시 비슷한 주의가 필요하다. 주요 점수만으로는 에이전트가 최소 권한 접근을 따르는지, 악의적인 리포지토리 지침에 저항하는지, 민감한 컨텍스트 유출을 피하는지를 입증할 수 없다.

Google은 단계적 안전성 작업을 수행하는 동안 Argon의 초기 가용성을 제한했다. 이 출시 방식은 공개 사용 근거가 벤치마크 관심도가 시사하는 것보다 부족하게 유지될 수 있음을 의미한다.

벤더의 주장도 신중한 출처 표기가 필요하다. Anthropic, OpenAI, Google은 각각 서로 다른 제품군과 설정에서 유리한 평가 결과를 강조한다.

이 결과들은 정확할 수 있지만 직접 비교 가능한 것은 아니다. 서로 다른 하니스, 작업 세트, 예산, 채점 규칙은 종종 서로 다른 선두 모델을 만들어 낸다.

Artificial Analysis 벤치마크는 하나의 프레임워크에서 구성을 실행함으로써 비교 가능성을 높인다. 하지만 독점 에이전트와 모델 인터페이스가 만드는 모든 차이를 제거할 수는 없다.

엔지니어링 리더는 표준화하기 전에 소규모 내부 시험을 재현해야 한다. 유용한 테스트 세트에는 완료된 티켓, 알려진 실패 사례, 대표적인 리포지토리 제약 조건이 포함된다.

검토자는 정확성, 불필요한 변경, 보안, 테스트 커버리지, 설명 품질, 승인까지 걸린 시간을 평가해야 한다. 토큰 지출은 이러한 결과와 함께 기록해야 한다.

그 결과 지표는 달러당 승인된 작업량 또는 엔지니어 시간당 승인된 작업량이어야 한다. 공개 종합 점수는 후보 선정에 도움을 줄 수 있지만, 이 측정을 대체할 수는 없다.

Claude의 우위가 중요한지 결정할 세 가지 신호

다음 단계는 기본 설정 성능, 승인된 변경의 경제성, 업데이트 전반에 걸친 벤치마크 안정성이 좌우할 것이다.

첫 번째 신호는 실용적인 effort 설정에서의 성능이다. maximum 구성은 헤드라인을 끌지만, 대부분의 일상 사용은 기본 설정이 좌우한다.

medium effort의 Sonnet 5.5는 maximum 결과보다 훨씬 낮은 점수를 기록한다. 공개 데이터에서 Sol은 xhigh에서 medium으로 이동해도 단 2점만 잃는다.

Anthropic이 기본 설정의 격차를 줄인다면 Claude의 68점 최고치는 일반 팀에도 더 중요해질 것이다. 격차가 지속된다면 Sol의 효율성 논거는 더 강해질 것이다.

두 번째 신호는 승인된 변경당 비용이다. 공개 벤치마크는 현재 요청부터 병합된 코드까지의 전체 경로가 아니라 작업당 API 지출을 측정한다.

팀은 벤더나 독립 평가자가 검토 조정 결과를 공개하는지 지켜봐야 한다. 여기에는 재실행, 사람의 수정 시간, 검증 후 발견된 회귀가 포함되어야 한다.

Claude의 프리미엄은 패치가 더 적은 검토를 필요로 한다면 방어하기 쉬워진다. Sol의 낮은 추론 사용량이 추가 수정 작업을 만들지 않는다면 그 장점은 더 강해진다.

Argon은 DeepSWE 강점이 프로덕션으로 이어진다면 복잡한 리포지토리 변경에서 이 지표를 선도할 수 있다. 종합 점수만으로는 이 질문에 답할 수 없다.

세 번째 신호는 순위 안정성이다. 코딩 에이전트는 모델 업데이트, 하니스 개정, 도구 정책, 컨텍스트 관리 개선을 통해 변화한다.

안정적인 선두 모델은 반복 실행과 벤치마크 버전 전반에서 자리를 유지해야 한다. 작은 시스템 업데이트 후 큰 변화가 나타난다면 근소한 점수 차이에 대한 신뢰는 낮아질 것이다.

Artificial Analysis는 이미 구성 요소 결과, 효율성 지표, 방법론 개정을 공개하고 있다. 향후 재실행은 5점 차이가 지속 가능한 격차인지, 일시적인 구성 효과인지 보여줄 것이다.

개발팀은 완벽한 벤치마크를 기다릴 필요가 없습니다. 지금도 범위가 정해진 결정을 내릴 수 있습니다.

대표성 있는 내부 작업 세트부터 시작하세요. 접근이 허용되는 범위에서 Claude를 두 가지 이상의 노력 수준으로 설정해 Sol 및 Argon과 비교하세요.

에이전트 권한, 리포지토리 스냅샷, 성공 기준은 일관되게 유지하세요. 실제 경과 시간, 토큰, 실패, 검토 시간, 최종 변경 사항의 승인 여부를 기록하세요.

작업이 상향 조정을 정당화할 때에만 고노력 구성을 사용하세요. 일상적인 작업은 팀의 승인 기준을 충족하는 가장 저렴한 설정으로 시작해야 합니다.

주요 모델 또는 하니스 업데이트 이후에는 비교를 다시 확인하세요. Artificial Analysis Coding Agent Index가 유용한 이유는 바로 최전선이 계속 움직이고 있기 때문입니다.

현재로서는 메시지가 분명합니다. Claude Sonnet 5.5는 세 가지 신규 구성 가운데 공개된 최고 점수를 보유하고 있지만, 실무에서의 모든 ‘1위’ 정의를 차지하는 것은 아닙니다.

GPT-6.1 Sol은 매력적인 효율성 프로필을 제공하며, Gemini 4 Argon은 장기적인 리포지토리 작업에서 이 세 모델을 앞섭니다. 올바른 선택은 팀이 어떤 결과를 더 중시하는지에 달려 있습니다.

귀 조직은 인덱스 점수 5점을 더 얻기 위해 큰 리소스 프리미엄을 지불할까요, 아니면 Sol로 더 많은 시도와 검증에 투자할까요? 기본값을 선택하기 전에, 이 질문을 조직이 실제로 병합한 작업을 기준으로 검증해 보세요.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page