top of page

Anthropic a16z 데이터는 에이전트가 인간을 앞섰다고 말하지만, 벤치마크는 더 어려운 현실을 숨긴다

8월 11일
10분 분량

Anthropic a16z 데이터는 이제 Claude Fable 5가 OSWorld-Verified에서 85%를 기록해, 널리 인용되는 인간 점수 72.36%를 넘어섰다고 제시한다. 1년 전만 해도 최고 에이전트 점수는 약 42% 수준이었다. 이 상승은 컴퓨터 사용 에이전트가 최근까지만 해도 멀게 보였던 문턱을 넘었음을 시사한다.

다만 이 비교에는 중요한 각주가 붙는다. 인간 점수는 원래 OSWorld 연구에서 나온 반면, 85% 결과는 개정된 OSWorld-Verified 평가를 사용한다. 두 수치는 관련된 테스트를 설명하지만, Claude Fable 5와 사람 사이의 통제된 대결을 구성하지는 않는다.

이 구분은 컴퓨터 에이전트가 시연 단계를 넘어 실수가 결과를 초래하는 워크플로로 이동하고 있기 때문에 중요하다. OpenAI, Google, Anthropic, 그리고 전문 개발사들은 모두 에이전트가 브라우저, 데스크톱 애플리케이션, 비즈니스 시스템을 조작하기를 원한다. 높은 점수는 이러한 시스템이 평범한 업무일을 관리할 수 있는지 여부를 확정하지 못하더라도 구매자의 기대를 바꾼다.

Anthropic a16z 데이터가 보여주는 놀라운 1년간의 도약

가장 중요한 변화는 한 모델이 85%에 도달했다는 사실이 아니다. 어려운 컴퓨터 사용 벤치마크가 약 1년 만에 약 42%에서 85%로 향상됐다는 점이다.

a16z가 강조한 컴퓨터 에이전트 점수표는 OSWorld-Verified에서의 가파른 상승세를 추적한다. Claude Fable 5는 보고된 결과에서 85%로 선두를 달린다. 이 차트는 컴퓨터 상호작용을 응용 AI에서 가장 빠르게 개선되는 분야 중 하나로 제시한다.

OSWorld는 에이전트가 실제 소프트웨어 환경 안에서 작업을 완료할 수 있는지 시험한다. 에이전트는 질문에 답하는 대신 화면을 살피고 무엇을 해야 할지 결정해야 한다. 이어 마우스와 키보드 조작을 닮은 인터페이스를 통해 행동을 수행한다.

작업에는 문서 편집, 애플리케이션 설정 변경, 파일 처리, 또는 프로그램 간 정보 이동이 포함될 수 있다. 성공은 단순한 언어 생성 이상의 능력에 달려 있다. 에이전트는 인터페이스 요소를 식별하고, 상태를 유지하며, 여러 단계를 계획하고, 자신의 행동이 효과를 냈는지 인식해야 한다.

원래 OSWorld 벤치마크에는 Chromium, LibreOffice, Thunderbird, GIMP, VLC, Visual Studio Code 같은 애플리케이션과 관련된 369개 작업이 포함됐다. 수동 설정이 필요했던 Google Drive 작업 8개는 제외할 수 있었고, 이에 따라 361개 작업 평가가 구성됐다.

연구진은 2024년 이 벤치마크를 소개하면서 최고 모델 성공률이 12.24%였다고 보고했다. 해당 소프트웨어에 익숙하지 않은 인간 참가자들은 작업의 72.36%를 완료했다. 이 거대한 격차는 대화형 벤치마크에 가려진 약점을 드러냈기 때문에 OSWorld를 유용한 시험으로 만들었다.

에이전트는 그래픽 사용자 인터페이스 그라운딩에 어려움을 겪었다. 이는 시각적 목표를 올바른 화면 위치와 연결하는 능력을 뜻한다. 또한 애플리케이션의 동작 방식에 관한 운영 지식도 부족했다. 모델은 지시를 이해하더라도 잘못된 제어 항목을 클릭하거나 대화 상자의 상태를 놓칠 수 있었다.

이후의 OSWorld-Verified 작업은 원래 컬렉션에 있던 결함 있거나 불안정한 작업을 다뤘다. 웹사이트가 바뀌고, 애플리케이션이 업데이트되며, 평가 스크립트가 유효한 결과를 잘못 읽을 수 있기 때문에 벤치마크 유지보수는 중요하다. 더 정제된 테스트는 에이전트를 더 일관되게 측정할 수 있다.

하지만 벤치마크를 바꾸면 점수가 의미하는 바도 달라진다. 고장 난 작업을 제거하면 타당성은 높아지지만, 이전의 모든 시스템을 동일한 조건에서 다시 실행하지 않는 한 단순한 역사적 비교는 불가능하다. 에이전트 설정, 행동 제한, 화면 해상도, 평가 하네스도 일치해야 한다.

이 때문에 42%에서 85%로 이어지는 추세선은 빠른 진전의 신호로 이해하는 편이 가장 적절하다. 에이전트의 역량이 정확히 두 배가 됐다는 통제된 추정치는 아니다. 추세는 강하지만, 그 정확한 규모는 여전히 불확실하다.

그럼에도 85%라는 수치는 중요하다. 컴퓨터 사용 시스템은 시각적 관찰을 반복적으로 행동으로 번역해야 하므로, 오류는 하나의 궤적 전체에 걸쳐 누적된다. 완료율을 높이려면 지각, 추론, 기억, 복구 능력이 개선돼야 한다.

이는 단순한 모델 품질 업데이트보다 더 넓은 의미를 지닌다. 개발자들이 전체 실행 루프를 구성하는 능력이 향상되고 있음을 보여준다. 더 나은 모델이 도움이 되지만, 프롬프트, 화면 표현, 성찰 단계, 특화된 그라운딩 구성 요소 역시 결과에 영향을 미친다.

따라서 Anthropic a16z 비교는 실제 변화를 포착한다. 컴퓨터 사용 에이전트는 더 이상 일반적인 데스크톱 작업에서 거의 자동적으로 실패하지 않는다. 더 어려운 질문은 이제 벤치마크 통과가 통제된 환경 밖에서도 신뢰할 수 있는 업무 수행을 예측하는지 여부다.

인간 수준이라는 헤드라인은 서로 다른 두 테스트를 결합한다

Claude Fable 5는 유명한 인간 기준선을 넘어선 것으로 보이지만, 현재 공개된 증거는 인간과 에이전트를 동등하게 비교했다는 사실을 입증하지 않는다.

72.36% 수치는 원래 OSWorld 논문을 위해 수행된 인간 테스트에서 나왔다. 85% 수치는 개정된 작업 세트와 평가 과정을 사용하는 OSWorld-Verified와 연관돼 있다. 두 수치를 서로 바꿔 쓸 수 있는 것처럼 취급하면, 두 수치 뒤에 있는 방법론적 맥락이 사라진다.

‘인간’이라는 단어에도 설명이 필요하다. 원래 연구는 해당 소프트웨어에 익숙하지 않은 사람들을 시험했다. 이들의 점수는 인간 성능의 이론적 한계가 아니었다. 숙련된 사용자, 추가 시간, 또는 더 명확한 온보딩은 다른 결과를 낼 수 있다.

에이전트 점수 역시 운영 조건에 따라 달라진다. 컴퓨터 사용 평가는 화면 해상도, 제공되는 행동 이력, 최대 단계 수, 재시도 정책, 추론 예산에 따라 달라질 수 있다. 더 많은 추론이나 성찰이 허용된 에이전트는 더 많은 시간과 컴퓨팅 자원을 소비하면서 더 많은 작업을 마칠 수 있다.

통과율은 한 번의 시도 또는 여러 번의 시도 결과로 보고될 수도 있다. 여러 실행 중 한 번 성공하는 시스템은 첫 시도에서 안정적으로 성공하는 시스템과 다른 제품 경험을 제공한다. 비즈니스 자동화에는 일반적으로 후자의 행동이 필요하다.

또 다른 문제는 궤적 데이터다. 벤치마크 작업과 성공적인 상호작용 궤적은 이후 모델 학습이나 에이전트 설계에 영향을 줄 수 있다. 노출이 결과를 자동으로 무효화하지는 않지만, 점수가 일반적인 컴퓨터 활용 능력을 측정한다는 주장은 약해진다.

원래 OSWorld 팀은 더 긴 텍스트 기반 궤적 이력이 성능을 향상시킨다는 사실을 발견했다. 이 이력은 에이전트에게 이전 결정에 관한 더 많은 정보를 제공했다. 그러나 추론 컨텍스트가 커짐에 따라 효율성 문제도 발생했다.

화면 해상도도 영향을 미쳤다. 고해상도 스크린샷은 모델이 작은 제어 항목을 더 정확하게 찾을 수 있었기 때문에 일반적으로 결과를 개선했다. 이 발견은 환경이 정렬되지 않았을 때 명목상 유사한 두 평가가 서로 다른 점수를 낼 수 있는 이유를 보여준다.

85% 점수에도 상당한 실패율은 남는다. 361개 작업에서 모든 작업의 가중치가 같다고 가정하면, 15% 실패율은 약 54개의 미완료 작업에 해당한다. 다만 보고된 벤치마크 프로토콜은 실행 결과를 다르게 집계할 수 있으므로, 이는 운영상 격차를 보여주는 추정치다.

소비자 실험에서는 가끔의 실패가 용인될 수 있다. 하지만 급여, 규정 준수, 계정 관리, 고객 기록에서는 7개 작업 중 하나에서 실패하는 것이 배포 제약이 된다. 비용은 시스템이 안전하게 멈추는지, 아니면 잘못된 상태를 남기는지에 따라 달라진다.

그렇다고 이 벤치마크가 무의미한 것은 아니다. OSWorld-Verified는 에이전트가 구성된 컴퓨터 환경에서 경계가 정해진 지시를 실행할 수 있는지라는 중요한 능력을 측정한다. 이는 정적인 질의응답보다 더 현실적인 도전 과제를 제공한다.

문제는 그 테스트에서의 성공이 일반적인 직장 자율성에 관한 주장으로 확장될 때 시작된다. 실제 업무에는 불명확한 요청, 중단된 세션, 바뀌는 권한, 누락된 정보, 그리고 새 가상 머신으로 초기화할 수 없는 결과가 포함된다.

사람들은 지시가 맥락과 충돌하는 때도 안다. 그들은 설명을 요청하고, 의심스러운 변화를 알아차리며, 작업에 외부 지식을 끌어온다. 컴퓨터 에이전트는 올바른 행동이 멈추는 것인 경우에도, 겉으로 드러난 지시를 완료하는 데 최적화되는 경우가 많다.

따라서 Anthropic a16z 헤드라인은 방향성 면에서는 유용하지만 수치적으로는 취약하다. 이는 Claude Fable 5와 그 주변 에이전트 시스템이 많은 표준화된 데스크톱 작업을 완료할 수 있음을 말해 준다. 실제 워크플로 전반에서 이 시스템이 숙련된 직원보다 더 뛰어나다는 사실을 보여주지는 않는다.

더 깔끔한 인간 수준 주장을 하려면 인간과 에이전트가 비교 가능한 제한 조건 아래에서 동일한 검증 작업을 시도해야 한다. 연구진은 완료율, 시간, 재시도, 개입, 유해한 오류를 보고해야 한다. 이러한 통제가 없다면 85% 대 72.36%는 관련된 측정치 사이의 눈길을 끄는 비교에 머문다.

컴퓨터 에이전트는 이제 모든 자동화 전략에 압박을 가한다

이 점수는 인터페이스 수준의 에이전트가 API, 스크립트, 고정된 워크플로가 닿지 못하는 소프트웨어에 접근할 수 있기 때문에, 이를 중심으로 자동화를 구축한 기업들에 압박을 가한다.

전통적인 자동화는 시스템이 구조화된 인터페이스를 제공할 때 가장 잘 작동한다. 개발자는 애플리케이션 프로그래밍 인터페이스, 즉 API를 다른 서비스에 연결한다. 반면 로보틱 프로세스 자동화 도구는 미리 정의된 인터페이스 단계와 규칙을 따른다.

두 접근 방식 모두 효과적일 수 있지만, 통합 작업은 마찰을 일으킨다. 일부 내부 도구에는 API가 없다. 오래된 소프트웨어는 불완전한 인터페이스만 제공할 수 있으며, 작은 워크플로 변경에도 개발자나 컨설턴트가 자동화를 다시 구축해야 할 수 있다.

컴퓨터 사용 에이전트는 또 다른 경로를 제공한다. 사람과 같은 화면을 해석한 뒤 기존 인터페이스를 통해 행동한다. 이론적으로 이는 조직이 모든 공급업체가 전용 통합 기능을 제공하기를 기다리지 않고도 소프트웨어를 자동화할 수 있게 한다.

Anthropic은 이러한 발상을 중심으로 컴퓨터 사용 기능을 도입했다. Anthropic의 computer-use 문서는 애플리케이션이 스크린샷을 제공하고 요청된 마우스 또는 키보드 동작을 실행하는 루프를 설명한다. 모델은 다음 행동을 선택하기 전에 각각의 새 상태를 관찰한다.

이 구조는 추론과 실행을 분리하기 때문에 매력적이다. 기업은 모델을 통제된 환경에 배치하고 허용할 행동을 결정할 수 있다. 에이전트는 직원의 물리적 컴퓨터에 무제한 접근할 필요가 없다.

더 강력한 OSWorld-Verified 점수는 그러한 인프라 구축의 기대 수익을 높인다. 작업의 절반도 완료하지 못하는 시스템은 지속적인 감독이 필요하다. 85% 수준에서는 특히 실패를 쉽게 감지할 수 있을 때, 표적화된 배포가 더 그럴듯해지기 시작한다.

이 변화는 여러 집단에 압박을 가한다.

엔터프라이즈 소프트웨어 공급업체는 에이전트가 그래픽 인터페이스를 조작해야 할지, 지원되는 API를 사용해야 할지를 결정해야 한다. 인터페이스 접근은 적용 범위를 넓히지만, 예측하기 어려운 부하를 만들고 인간 검토를 위해 설계된 제품 워크플로를 우회할 수 있다.

자동화 공급업체는 결정론적 워크플로가 여전히 왜 가치 있는지 보여줘야 한다. 이들의 장점은 반복 가능성, 감사 가능성, 명시적인 규칙에 있다. 컴퓨터 에이전트는 변동성과 비정형 지시를 처리하는 방식으로 경쟁한다.

모델 제공업체는 벤치마크 정확도 이상의 개선을 요구받는다. 고객에게는 신원 제어, 행동 로그, 권한 경계, 실행을 안정적으로 중단하는 방법이 필요하다. 올바른 버튼을 보는 모델은 배포 가능한 에이전트의 한 구성 요소일 뿐이다.

OpenAI와 Google 역시 이 분야에서 경쟁하고 있다. 이들 시스템은 시각 모델, 브라우저, 도구, 실행 환경을 서로 다르게 조합해 사용한다. 벤치마크 순위도 중요하지만, 제품의 확장성은 이러한 구성 요소들이 얼마나 안전하게 함께 작동하는지에 달려 있다.

전문 에이전트 개발업체는 환경을 좁게 제한함으로써 여전히 범용 모델을 능가할 수 있다. 하나의 애플리케이션을 위해 설계된 시스템에는 맞춤형 파서, 복구 규칙, 검증 검사를 포함할 수 있다. 범용 컴퓨터 사용은 더 많은 작업을 포괄하지만, 전문 자동화는 더 높은 예측 가능성을 제공할 수 있다.

이러한 상충 관계는 도입 양상을 좌우할 것이다. 범용 에이전트는 한 세션에서 이메일 초안을 작성하고, 스프레드시트를 업데이트하며, 파일을 업로드할 수 있다. 전문 시스템은 더 엄격한 검사와 더 명확한 책임 체계 아래 하나의 보험금 청구 프로세스를 처리할 수 있다.

기업은 하이브리드 설계를 예상해야 한다. 에이전트가 요청을 해석하고 낯선 상태를 탐색하는 한편, API가 민감한 거래를 실행할 수 있다. 결정론적 검증기는 되돌릴 수 없는 작업이 발생하기 전에 결과를 검사할 수 있다.

이러한 설계는 단일 리더보드의 중요성을 제한한다. 상업적으로 유용한 질문은 Anthropic의 컴퓨터 사용이 85%에 도달했는지가 아니다. 구성된 시스템이 기업의 위험 허용 범위 내에서 해당 기업의 작업 분포를 완료할 수 있는지다.

조직에는 관련 맥락에 대한 접근도 필요하다. 소프트웨어를 조작하는 에이전트는 어떤 파일, 고객 기록, 정책 또는 메시지가 해당되는지 알아야 한다. 검색 가능한 AI 지식 베이스는 사람들이 이러한 맥락을 정리하는 데 도움이 될 수 있지만, 실행 통제의 필요성을 없애지는 않는다.

새로운 벤치마크 결과는 출발 가정을 바꾼다. 구매자는 더 이상 인터페이스 수준 자동화가 전혀 작동하는지 물을 필요가 없다. 대신 어디에서 일관되게 작동하는지, 어디에서 승인이 필요한지, 어디에서 API가 더 안전한지를 파악해야 한다.

85% 점수가 측정하지 않는 것

광범위한 자율성에 반하는 가장 강력한 근거는 더 긴 작업에서 나온다. 이 경우 에이전트는 여전히 맥락을 잃고, 변화를 놓치며, 자신의 작업을 검증하지 못한다.

OSWorld의 원래 작업은 대체로 약 30개의 작업 단계로 이루어졌다. 이는 근거 정립 실패를 드러내기에는 충분하지만, 많은 전문 워크플로에 비하면 훨씬 짧다. 실제 업무는 여러 애플리케이션, 문서, 계정, 의사결정 지점에 걸쳐 진행될 수 있다.

OSWorld 2.0은 이처럼 더 어려운 환경을 시험하기 위해 설계됐다. 이 장기 범위 벤치마크에는 전문 및 일상 영역 전반의 108개 워크플로가 포함돼 있다. 숙련된 사람은 작업 하나를 완료하는 데 중앙값 기준 약 1.6시간이 필요하다.

워크플로는 연구, 엔지니어링, 창작 제작, 금융, 운영, 행정, 컴플라이언스, 의료를 포함한다. 약 69.6%는 숙련된 사용자가 완료하는 데 1시간 이상 걸린다. 여기에는 동적으로 변하는 정보, 숨겨진 상태, 여러 출처에 분산된 사실이 포함된다.

한 사례는 비용 상환 청구 제출과 관련된다. 에이전트는 튜토리얼을 읽고, 영수증을 검토하며, 은행 및 이메일 기록을 확인하고, 새 메시지를 처리하고, 직원 정보를 복구하고, 불일치를 해결해야 한다. 정확한 클릭은 시작에 불과하다.

OSWorld 2.0에서 가장 높은 성과가 보고된 시스템은 주요 이진 지표 기준으로 작업의 20.6%를 완료했다. 부분 점수는 54.8%에 도달했는데, 이는 전체 워크플로를 정확히 완료하지는 못해도 종종 진전을 이뤘다는 뜻이다.

이 결과는 핵심적인 역전을 만들어낸다. 컴퓨터 에이전트는 짧고 검증된 작업에서는 초인적 성능을 보이는 듯할 수 있지만, 긴 전문 업무에서는 여전히 신뢰할 만한 성능에 크게 못 미친다. 두 결과는 서로 다른 시간 범위를 측정하기 때문에 모두 사실일 수 있다.

작업이 길어질수록 성능은 급격히 하락했다. 사람이 수행할 경우 137분에서 163분이 걸리는 워크플로에서는 어떤 테스트 모델도 이진 완료율 10%를 넘지 못했다. 163분을 넘어서면, 유지된 모델들은 어떤 작업도 완료하지 못했다.

실패 양상도 달라졌다. 에이전트는 주로 기본 제어 기능을 다루지 못해서 실패한 것이 아니었다. 제약 조건을 놓치고, 새로운 정보를 간과하고, 질문하는 대신 추측하며, 최종 검증을 건너뛰었다.

이는 심각한 업무상 실패다. 직원은 잘못된 클릭을 대개 즉시 수정할 수 있다. 그러나 정책 조건을 잊거나 업데이트된 이메일을 무시하는 시스템은 겉으로는 완료된 것처럼 보이지만 실질적으로는 잘못된 결과를 낼 수 있다.

효율성은 또 다른 격차를 드러낸다. OSWorld-Human 연구는 인간이 설계한 경로와 비교해 에이전트가 얼마나 많은 단계를 필요로 하는지 조사했다. 그 결과 선도 시스템은 필요한 것보다 훨씬 더 많은 작업을 사용했다.

연구진은 계획, 성찰, 판단을 위한 모델 호출 역시 지연 시간의 주요 원인으로 파악했다. 경로가 길어질수록 연속된 단계는 초기 단계보다 세 배 더 오래 걸릴 수 있었다. 더 많은 추론은 일부 의사결정을 개선했지만 워크플로를 더 느리게 만들었다.

한 사례에서 두 문단의 줄 간격을 두 배로 바꾸는 데 에이전트는 12분이 걸렸다. 기초적인 컴퓨터 사용 경험이 있는 사람이라면 같은 작업을 30초 이내에 완료할 수 있다. 완료 여부만으로는 실질적인 차이를 포착하지 못했다.

이 연구는 분석된 오류의 23%가 부실한 시각적 근거 정립에서 비롯됐다고 보고했다. 이러한 오류는 작업에 최대 30개의 불필요한 단계를 추가할 수 있었다. 복구 행동은 올바른 결과를 보장하지 못한 채 자원을 소모하는 경우가 많았다.

이는 Anthropic a16z의 서사를 생산적인 방식으로 복잡하게 만든다. 85% 점수는 짧은 범위의 실행에서 실제 진전을 반영한다. 더 새로운 증거는 그 진전이 더 이상 전이되지 않는 경계를 보여준다.

비용도 여전히 빠진 차원이다. 에이전트는 더 많은 출력 토큰, 더 많은 시도 또는 더 깊은 성찰을 사용해 완료율을 높일 수 있다. OSWorld 2.0은 토큰 효율성과 최대 완료율 사이에 뚜렷한 상충 관계가 있음을 발견했다.

가장 높은 점수를 기록한 Claude 구성은 더 효율적인 GPT 시스템보다 훨씬 큰 출력 예산을 사용했다. 구매자에게는 두 측정값이 모두 필요하다. 가장 높은 벤치마크 점수가 대규모 환경에서 가장 좋은 경제적 결과를 제공하지 않을 수 있기 때문이다.

안전성 역시 단순한 완료 비율로는 포착되지 않는다. 에이전트는 작업을 기술적으로 완료하면서도 그 과정에서 용납할 수 없는 행동을 할 수 있다. 민감한 정보를 노출하거나, 예상치 못한 프롬프트를 수락하거나, 승인 없이 되돌릴 수 없는 변경을 수행할 수 있다.

벤치마크 환경은 통제된 상태에서 시작한다. 실제 운영 환경의 컴퓨터에는 알림, 확장 프로그램, 캐시된 세션, 권한 요청, 인터페이스 변형이 누적된다. 작은 차이만으로도 표준 가상 머신에서 작동하던 실행 전략이 무너질 수 있다.

웹 콘텐츠는 적대적 위험을 초래한다. 웹페이지에는 에이전트를 다른 방향으로 유도하거나 자격 증명을 요구하려는 텍스트가 포함될 수 있다. 시스템은 사용자의 지시와 작업 중 표시되는 신뢰할 수 없는 콘텐츠를 확실히 구분해야 한다.

따라서 컴퓨터 사용 에이전트에는 다층 방어가 필요하다. 조직은 세션을 격리하고, 도메인을 제한하고, 권한을 한정하고, 확인을 요구하며, 별도 시스템을 통해 출력을 검증할 수 있다. 이러한 통제는 위험을 줄이지만, 자율 운영의 의미도 좁힌다.

벤치마크 점수는 배포 경계를 없애는 것이 아니라 이를 설정하는 데 활용돼야 한다. 단기적으로 가장 강력한 활용 사례는 범위가 제한되고, 되돌릴 수 있으며, 검사하기 쉬운 작업이다. 영향력이 큰 작업은 여전히 결정론적 검사나 사람의 승인을 거쳐야 한다.

결과의 전이 여부를 보여줄 세 가지 신호

다음 단계는 또 하나의 고립된 리더보드 기록이 아니라 장기 작업 완료율, 첫 시도 신뢰성, 측정 가능한 운영 환경 도입으로 결정될 것이다.

첫 번째 신호는 OSWorld 2.0 또는 이와 비교 가능한 다른 장기 범위 벤치마크에서의 성능이다. Claude Fable 5의 85% OSWorld-Verified 결과는 같은 모델이 확장된 워크플로에서 20.6% 완료율의 경계를 개선할 경우 훨씬 더 설득력을 갖게 된다.

부분적인 진전만으로는 충분하지 않다. 전문 업무는 대개 모든 필수 단계가 완료되고 검증됐을 때에만 가치를 만든다. 연구자들은 이진 완료율, 부분 점수, 토큰 사용량, 작업 수, 개입 빈도를 함께 보고해야 한다.

장기 작업에서 큰 폭의 향상이 나타난다면, 모델이 변화하는 환경 전반에서 목표와 제약 조건을 유지할 수 있다는 주장이 강화될 것이다. 작은 향상에 그친다면, 85% 결과가 주로 더 짧고 제한된 상호작용에 의존한다는 점을 시사할 것이다.

두 번째 신호는 표준화된 조건에서의 첫 시도 신뢰성이다. 제공업체는 점수의 근거가 된 실행 횟수, 작업 제한, 추론 설정, 평가 하니스를 공개해야 한다. 독립적인 재실행은 모델 비교의 신뢰도를 높일 것이다.

분산은 중요하다. 사용자는 평균적인 벤치마크 성능을 경험하지 않는다. 한 번에 하나의 실행을 경험한다. 성공과 실패를 오가는 시스템은 평균 결과가 강해 보이더라도 감독 비용을 발생시킨다.

보고서는 직접적인 모델 성능과 에이전트 프레임워크 개선도 구분해야 한다. 플래너, 시각적 근거 정립기, 재시도 메커니즘, 검증기는 최종 점수를 높일 수 있다. 구매자는 어떤 구성 요소가 성과 향상을 만들었는지, 그리고 이를 재현할 수 있는지 알아야 한다.

일관된 단일 시도 통과 결과는 인간 수준이라는 주장을 강화할 것이다. 반복 시도나 비정상적으로 큰 추론 예산이 필요한 점수는 일반적인 배포 환경에서는 그 주장을 약화시킬 것이다.

세 번째 신호는 범위가 제한된 비즈니스 워크플로에서 나오는 운영 증거다. 유용한 보고에는 완료율, 평균 실행 시간, 에스컬레이션 빈도, 사람이 수정한 출력의 비중이 포함될 것이다.

가장 유익한 배포 사례는 편리한 API가 없는 소프트웨어와 관련될 것이다. 이 영역에서 인터페이스 수준 에이전트는 기존 통합 방식보다 가장 분명한 이점을 제공한다. 동시에 인터페이스 변경이 취약성을 드러낼 수 있는 곳이기도 하다.

조직이 에이전트를 관찰 단계에서 실행 단계로 확장하는지 지켜봐야 한다. 정보를 수집하고 초안을 준비하는 시스템은 결제를 제출하거나, 권한을 수정하거나, 고객에게 연락하는 시스템보다 위험이 낮다.

더 높은 영향력의 작업으로 확장되는 것은 기술과 그 통제 수단에 대한 신뢰가 커지고 있음을 의미할 것이다. 초안 및 읽기 전용 작업으로 계속 제한된다면, 벤치마크 진전이 운영상의 우려를 해소하지 못했음을 보여줄 것이다.

컴퓨터 사용 에이전트가 초기 OSWorld 결과가 시사한 것보다 훨씬 빠르게 개선됐기 때문에 Anthropic a16z 데이터는 주목할 가치가 있다. Claude Fable 5의 보고된 85% 점수는 짧은 범위의 역량에서 신뢰할 만한 변화를 나타낸다.

이는 에이전트가 이제 일반적인 컴퓨터 사용에서 사람을 능가한다는 점을 입증하지는 않는다. 그러한 결론을 내리려면 동등한 테스트, 효율적인 실행, 안정적인 첫 시도, 긴 워크플로 전반에서의 성공이 필요하다.

개발자와 구매자에게 실질적인 대응은 무시도 즉각적인 자율화도 아니다. 대표적인 작업에서 에이전트를 테스트하고, 모든 개입을 측정하며, 되돌릴 수 있는 작업과 중대한 결과를 초래하는 작업을 분리해야 한다. 그리고 중요한 질문을 던져야 한다. Anthropic a16z 결과는 실제 업무와 맞닥뜨려도 유지되는가?

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page