top of page

Claude Opus 5가 에이전트 기준을 끌어올리며 Anthropic과 Google의 경쟁 심화

Anthropic은 7월 24일 Claude Opus 5를 출시하며, 유능하고 실용적인 AI 에이전트를 둘러싼 Anthropic과 Google의 경쟁에 압박을 더했다. 이 새 모델은 Anthropic의 최대 규모 최전선 모델보다 낮은 위치에 배치됐음에도 여러 독립 평가에서 선두를 차지했다. 이 결과는 가장 어려운 업무에 반드시 가장 큰 모델이 필요하다는 통념에 도전한다.

이번 출시는 또 하나의 챗봇이 더 높은 벤치마크 점수를 얻었다는 데 있지 않다. Anthropic은 Opus 5를 결과를 검증하고, 부족한 도구를 만들며, 모호한 과제를 해결해 나가는 일상형 에이전트로 제시하고 있다. 모델이 프로덕션 코드를 수정하거나 연구를 분석하고 비즈니스 소프트웨어를 조작할 때는 매끄러운 대화보다 이런 행동이 더 중요하다.

Google은 Gemini가 긴 컨텍스트, 멀티모달 작업, 컴퓨터 사용, 엔터프라이즈 유통에서 경쟁해 왔기 때문에 가장 분명한 외부 경쟁자다. OpenAI 역시 특히 코딩 및 전문 평가에서 여전히 중요하다. 다만 여기서 핵심 경쟁은 Anthropic이 에이전트 신뢰성을 Google의 더 폭넓은 플랫폼 도달력에 맞서는 우위로 전환할 수 있는지에 관한 것이다.

Claude Opus 5가 Anthropic의 모델 계층을 바꾸다

Claude Opus 5가 중요한 이유는 Anthropic이 고객에게 최대 규모 모델을 사용하지 않고도 최전선에 가까운 성능을 제공하기 때문이다.

Anthropic은 Opus 5를 빈번한 사용을 위해 설계된 “사려 깊고 능동적인 모델”로 설명한다. 회사의 Opus 5 출시 발표에 따르면, 이 모델은 작업당 더 적은 리소스를 사용하면서도 최전선 지능 측면에서 Claude Fable 5에 근접한다.

이 포지셔닝은 이례적인 계층을 만든다. Fable 5는 Anthropic의 최대 지능 기준점으로 남고, Opus 5는 까다로운 일상 업무를 위한 실용 모델이 된다. Anthropic은 Opus 5를 Claude Max의 기본 모델이자 Claude Pro에서 사용할 수 있는 가장 강력한 옵션으로 지정했다.

이 구분은 토큰 소비량만이 아니라 완료된 작업에 달려 있다. 에이전트 시스템은 종종 단계를 반복하고, 오류에서 복구하며, 외부 도구를 호출한다. 토큰 단가가 낮은 모델이라도 여러 번 시도해야 하거나 사람이 수정해야 하는 결과물을 만든다면 비용이 커질 수 있다.

Anthropic은 Opus 5가 일정한 리소스 수준에서 더 많은 작업을 완료해 이 계산식을 개선한다고 말한다. 회사는 Frontier-Bench v0.1에서 Opus 5가 작업 비용을 낮추면서 Opus 4.8의 성능을 두 배 이상 끌어올렸다고 보고했다. Frontier-Bench는 개별 질문이 아니라 장시간 이어지는 실용적인 과제에서 에이전트를 평가한다.

CursorBench 3.2에서 Anthropic은 이 모델이 최고 노력 설정에서 Fable 5의 최고 결과와 0.5퍼센트포인트 이내까지 도달했다고 밝혔다. 노력 설정은 모델이 답변을 반환하기 전에 적용하는 연산량과 추론량을 제어한다.

이 모델은 low, medium, high, xhigh, max의 다섯 가지 설정을 제공한다. 개발자는 모델을 바꾸지 않고도 더 빠른 응답과 더 긴 추론 사이에서 선택할 수 있다. 이 접근법은 하나의 벤치마크 점수가 실제 사용을 덜 대표하게 만들기도 한다.

Opus 5는 100만 토큰 컨텍스트 윈도우를 유지한다. 즉, 한 세션에서 유난히 큰 텍스트나 코드 모음을 처리할 수 있다. 긴 컨텍스트만으로 모델이 올바른 근거를 찾는다는 보장은 없다. 하지만 대규모 리포지토리나 문서 세트를 서로 연결되지 않은 프롬프트로 나눌 필요는 줄여 준다.

Anthropic은 컴퓨터 사용과 비즈니스 자동화도 강조한다. 회사는 Opus 5가 작업 리소스의 약 3분의 1을 사용하면서 Fable 5의 최고 OSWorld 2.0 결과를 넘어섰다고 말한다. OSWorld는 AI 시스템이 그래픽 컴퓨터 인터페이스를 통해 작업을 완료할 수 있는지 시험한다.

Zapier AutomationBench에서 Opus 5는 비슷한 작업 비용 기준으로 차상위 모델의 통과율보다 약 1.5배 높은 성과를 거뒀다고 전해진다. Anthropic에 따르면 가장 낮은 노력 설정조차 테스트된 대안들보다 더 많은 작업을 통과했다.

이 수치는 독립 그룹이 추가 환경에서 재현하기 전까지는 공급업체의 주장으로 남는다. 그럼에도 Anthropic의 제품 전략을 보여 준다. 이 회사는 Opus 5가 설득력 있는 답변을 생성하는 모델이 아니라 일을 끝내는 운영자로 평가받기를 원한다.

이 때문에 이번 출시는 통상적인 모델 업데이트와도 다르다. Anthropic은 최전선 모델과 연관된 역량을 더 많은 개발자가 반복 배포할 수 있는 제품으로 압축하고 있다. 이는 고객이 Google Gemini, OpenAI의 GPT 계열, 저비용 오픈 모델과 비교하는 대상을 바꾼다.

Anthropic과 Google의 경쟁이 에이전트 중심으로 이동하는 이유

Anthropic과 Google의 경쟁은 이제 어느 회사가 장시간 이어지는 AI 작업을 일반 팀이 신뢰할 수 있을 만큼 안정적으로 만들 수 있는지에 달려 있다.

Google은 Anthropic이 쉽게 재현할 수 없는 장점을 보유한다. Gemini는 Google Cloud, Android, Workspace, Search, 그리고 대규모 개발자 플랫폼과 연결될 수 있다. Google은 기업들이 이미 매시간 사용하는 도구 안에 모델을 배치할 수 있다.

Anthropic의 더 좁은 경로는 에이전트 워크플로 안에서의 모델 행동에 초점을 둔다. Claude Code는 모델이 파일을 검사하고, 명령을 실행하며, 변경 사항을 테스트하고, 실수를 수정할 수 있는 소프트웨어 개발 분야에서 회사에 뚜렷한 입지를 제공했다. Opus 5는 그 논지를 코드 밖으로 확장한다.

새 모델은 AI 구매자가 대화형 시연에서 완료된 산출물로 옮겨 가는 시점에 등장했다. 유용한 에이전트는 목표를 해석하고, 관련 컨텍스트를 수집하며, 도구를 선택하고, 실패를 인식하며, 언제 도움을 요청할지 결정해야 한다. 각 단계는 그럴듯한 실수가 발생할 또 다른 기회를 만든다.

Opus 5의 차별점은 이 단계들에서의 판단력으로 제시된다. Anthropic은 이 모델이 작업을 더 일관되게 검증하고 만족스러운 결과에 도달할 때까지 반복을 계속한다고 말한다. 이는 전체 워크플로에 걸친 행동을 다루므로 답변 품질 향상보다 더 강한 주장이다.

한 사례는 기계 부품의 도면과 관련됐다. 모델은 이 객체를 3차원 FreeCAD 모델로 재현하라는 요청을 받았지만, 이미지를 직접 볼 방법이 없었다.

출시 발표에 따르면 Opus 5는 이미지의 원시 픽셀에서 기하 정보를 추출하는 컴퓨터 비전 파이프라인을 작성했다. 이후 그 정보를 이용해 부품을 재구성했다. Anthropic은 같은 조건에서 경쟁 모델들이 다섯 번의 시도 모두 실패했다고 말한다.

중요한 세부 사항은 FreeCAD 자체가 아니다. Opus 5는 부족한 역량을 식별하고, 도구를 만들고, 원래 작업으로 돌아갔다. 이 순서는 숙련된 엔지니어가 예상치 못한 제약을 처리하는 방식과 닮아 있다.

두 번째 사례는 널리 사용되는 오픈소스 패키지 관리자에서 발생한 버그와 관련됐다. Anthropic은 Opus 5가 근본 원인을 찾아 기존 커뮤니티 패치가 놓친 엣지 케이스를 수정했다고 말한다. 경쟁 모델은 눈에 보이는 증상만 고쳤다고 전해진다.

또 다른 초기 사용자는 Opus 5에 신규 거래소용 시장 데이터 피드를 구축해 달라고 요청했다. 실시간 피드를 사용할 수 없자, 이 모델은 파서를 검증하기 위한 테스트 하네스를 만들었다. Anthropic에 따르면 이전 모델들은 엔지니어가 상세한 계획을 제공했을 때조차 실패했다.

이 사례들은 평균 성능에 대한 중립적 측정이 아니라 선별된 시연으로 남는다. 그럼에도 Anthropic이 개발자들이 주목하기를 바라는 행동을 보여 준다. Opus 5는 단순히 계획을 따르지 않는다. 계획이 현실과 맞닥뜨릴 때 부족한 인프라를 구축한다.

이 행동은 두 가지 방식으로 Google에 압박을 높인다. 첫째, 모델 비교는 점점 개별 추론 대신 완전한 작업 수행을 보상한다. 둘째, 에이전트 신뢰성은 경쟁 모델이 유사한 컨텍스트 윈도우나 벤치마크 점수를 제공하더라도 구매 결정에 영향을 줄 수 있다.

Google은 Gemini의 통합 장점과 자체 에이전트 제품으로 대응할 수 있다. 독립형 모델 제공업체가 접근할 수 없는 독점적인 업무 환경 신호도 활용할 수 있다. 남는 질문은 유통력이 계획, 검증, 복구 능력의 차이를 보완할 수 있는지다.

OpenAI는 다른 방향에서 압박을 가한다. Artificial Analysis는 Opus 5가 분석 지표에서 앞섰을 때에도 GPT-5.6 Sol이 프레젠테이션 품질에서 Opus 5보다 우세하다고 평가했다. 이는 어떤 제공업체도 전문적 결과물의 모든 측면을 지배하지는 못한다는 점을 시사한다.

따라서 엔터프라이즈 구매자는 모델 이름만이 아니라 시스템을 비교하게 될 것이다. 신원 제어, 데이터 접근, 관측 가능성, 실패 복구, 생성된 결과물의 품질을 고려해야 한다. 승리하는 모델은 대개 책임 있는 워크플로에 맞는 모델이 될 것이다.

대규모 기술 자료를 관리하는 팀에는 검색 가능한 지식 기반이 에이전트에 필요한 컨텍스트를 제공할 수 있다. 더 나은 검색은 모델 오류를 없애지는 못하지만, 근거를 더 쉽게 검토하게 해 준다.

능동적 행동이 Claude Opus 5의 핵심 작동 방식이다

Opus 5의 핵심 작동 방식은 지속적인 검증이지만, 같은 지속성은 더 많은 시간을 소비하고 예기치 않은 행동을 만들 수도 있다.

Simon Willison은 Anthropic의 FreeCAD 사례를 검토한 뒤 이 모델을 잠재적으로 “끈질기게 능동적”이라고 불렀다. 그의 초기 평가는 매력과 우려를 모두 포착한다.

모델이 누락된 테스트, 숨겨진 의존성, 잘못된 가정을 알아차릴 때 능동성은 바람직하게 들린다. 그러나 에이전트가 작업 범위를 넓히거나, 관련 없는 파일을 변경하거나, 유용한 답변이 나온 뒤에도 리소스를 계속 소비하면 매력이 떨어진다.

따라서 이번 출시는 판단력에 달려 있다. 유능한 에이전트는 언제 더 조사할지와 언제 멈출지를 알아야 한다. 막힌 작업과 승인이 필요한 작업을 구분해야 한다.

Anthropic의 고객 사례들은 이 구분을 거듭 강조한다. 한 프론트엔드 평가는 Opus 5가 데스크톱과 모바일 너비에서 페이지를 확인했다고 밝혔다. 이 모델은 화면 밖에 있는 결제 컨트롤을 발견하고, 레이아웃을 수정한 뒤, 작업을 반환하기 전에 결과를 다시 확인했다고 전해진다.

또 다른 사용자는 이 모델이 인수인계를 완료하기 전에 브랜치를 확인하고, pull-request 템플릿을 검토하며, 테스트 영향을 고려했다고 설명했다. 이전 모델들은 더 빠르게 진행했지만 내부 검사를 통과하지 못했다고 전해진다.

이러한 설명은 Anthropic이 Opus 5를 검증 루프 중심으로 최적화했음을 시사한다. 검증 루프란 작업을 만들고, 테스트하고, 오류를 식별하고, 결과를 수정하는 과정을 반복하는 순서다. 테스트가 작업을 정확히 대표할 경우 이 루프는 신뢰성을 높일 수 있다.

하지만 테스트가 항상 신뢰할 수 있는 것은 아니다. 에이전트는 실제 목표를 놓친 채 불완전한 평가에 맞춰 최적화할 수 있다. 자신의 잘못된 해석을 확인하는 테스트를 만들 수도 있다.

이 위험은 소프트웨어 개발 밖에서 더 심각해진다. 법률 에이전트는 관할권을 잘못 이해하면서도 형식 검사를 통과하는 문서를 생성할 수 있다. 연구 에이전트는 약하거나 순환적인 근거에 의존하면서도 완성된 보고서를 만들 수 있다.

모델의 더 긴 추론 경로에는 시간 비용도 따른다. 독립 테스트는 이 모델의 가장 강력한 설정이 복잡한 지식 노동 과제에서 평균 25분 이상 걸렸다고 밝혔다. 최대 설정은 더 많은 턴을 사용했기 때문에 Opus 4.8보다 상당히 오래 걸렸다.

턴은 모델과 그 도구 또는 환경 사이의 또 다른 교환을 뜻한다. 더 많은 턴은 생산적인 검사를 의미할 수 있지만, 방황을 뜻할 수도 있다. 조직에는 어느 해석이 맞는지 보여 주는 로그가 필요하다.

Artificial Analysis는 AA-Briefcase 평가에서 최대 노력 설정의 Opus 5가 평균 103턴을 사용했다고 측정했다. Opus 4.8은 가장 강력한 설정에서 55턴을 사용했다. 이 차이는 Opus 5가 더 오래 걸리면서도 더 강한 결과에 도달하는 방식을 설명하는 데 도움이 된다.

이는 실질적인 절충점을 만듭니다. 팀은 충분히 조사된 프레젠테이션이나 어려운 소프트웨어 복구 작업이라면 에이전트가 30분간 실행되는 것을 감수할 수 있습니다. 그러나 대화형 지원 어시스턴트에 같은 지연은 용납될 수 없습니다.

노력 설정을 통해 개발자는 그 경계를 관리할 수 있습니다. 일상적인 분류 작업은 낮은 설정에서 실행하고, 모호한 조사는 더 많은 연산을 배정할 수 있습니다. 다만 사용자는 필요한 노력 수준을 사전에 아는 경우가 드물기 때문에, 모델에는 여전히 신뢰할 수 있는 라우팅이 필요합니다.

에이전트 인프라도 범위를 강제해야 합니다. 자율 시스템에는 명시적인 권한, 지출 한도, 승인 확인 지점이 있어야 합니다. 더 강력한 모델은 일부 실행 실패를 줄일 수 있지만, 운영 통제를 대체하지는 않습니다.

최선의 배포는 모델의 판단력과 제약된 환경을 결합할 것입니다. 에이전트에는 제한된 자격 증명, 임시 작업 공간, 검증 가능한 완료 기준, 되돌릴 수 없는 작업에 대한 사람의 검토를 제공할 수 있습니다. 이 설계는 자율성을 단계적으로 부여되는 권한으로 다룹니다.

Opus 5는 모델의 행동이 전체 루프를 개선할 수 있다는 Anthropic의 주장을 강화합니다. 그렇다고 그 루프를 엔지니어링할 필요가 사라지는 것은 아닙니다. 선제성은 조직이 이를 관찰하고, 제한하고, 감사할 수 있을 때에만 가치가 있습니다.

독립 점수는 주장을 뒷받침하지만, 중요한 한계도 있다

독립 평가는 Opus 5를 최상위권에 올려놓았지만, 세부 결과는 단일 리더보드 순위에 가려진 절충점을 드러냅니다.

Artificial Analysis는 출시 전에 다섯 가지 노력 설정을 모두 평가했습니다. 지능 평가에서 최대 노력 설정의 Opus 5는 61점을 받았습니다. Fable 5는 60점, GPT-5.6 Sol은 59점, Opus 4.8은 56점을 기록했습니다.

1점 차이만으로 보편적인 우월성이 입증되지는 않습니다. 종합 지수는 여러 테스트를 결합하며, 작은 차이는 프롬프트, 하니스, 채점 규칙에 따라 달라질 수 있습니다. 이 결과가 뒷받침하는 결론은 제한적입니다. Opus 5는 포함된 과제 전반에서 최전선의 경쟁력을 보입니다.

더 강한 증거는 에이전트형 지식 작업에서 나타납니다. AA-Briefcase는 수천 개의 입력 파일이 포함된 비공개 과제를 모델에 부여해 테스트합니다. 결과물에는 정확성, 분석, 프레젠테이션 측면에서 평가되는 보고서, 스프레드시트, 프레젠테이션이 포함됩니다.

Opus 5는 최대 노력 설정에서 Elo 점수 1,720에 도달했습니다. Fable 5는 1,574점으로, 146점 차이가 났습니다. Opus 5의 xhigh 및 high 설정도 해당 평가에서 Fable 5를 앞섰습니다.

에이전트형 벤치마크는 Opus 5의 향상이 주로 객관적인 루브릭 충족도와 분석 품질에서 나왔음을 확인했습니다. 최대 노력 설정에서의 분석 점수는 Fable 5보다 약 300 Elo 포인트 높았습니다.

반면 프레젠테이션은 상대적으로 약점으로 남았습니다. Opus 5의 프레젠테이션 Elo는 1,628이었고, GPT-5.6 Sol은 1,666에 도달했습니다. 따라서 모델은 더 강한 분석을 제공하면서도 가장 보기 좋은 최종 결과물을 만들지는 못할 수 있습니다.

이 구분은 엔터프라이즈 도입에서 중요합니다. 분석가는 정확한 결론과 함께 임원이나 고객에게 제시할 수 있는 결과물을 필요로 하는 경우가 많습니다. 워크플로에는 조사용 모델 하나와 서식 또는 시각적 완성도를 위한 별도 시스템이 필요할 수 있습니다.

전체 평가에서는 사실 신뢰성에 대한 우려도 확인됐습니다. Opus 5는 AA-Omniscience에서 Opus 4.8보다 정확도가 개선됐지만, 불확실한 상황에서도 더 많은 질문에 답했습니다. Artificial Analysis는 이 테스트에서 환각률을 50%로 측정했습니다.

환각률은 벤치마크에 특화된 수치이므로 모든 작업 부하에서의 모델 오류율로 간주해서는 안 됩니다. 그럼에도 이 결과는 Anthropic의 검증 서사를 복잡하게 만듭니다. 모델은 절차를 세심하게 점검하면서도, 저장된 사실 지식에 대해서는 과도한 확신을 보일 수 있습니다.

이것이 이 글의 핵심적인 회의론적 지점입니다. 에이전트형 지속성과 사실적 보정은 별개의 역량입니다. 불확실성을 인식하지 못하는 지속적인 에이전트는 잘못된 전제를 증폭시킬 수 있습니다.

비공개 벤치마크에도 한계가 있습니다. 모델 개발자가 정확한 과제를 쉽게 학습 데이터에 포함할 수 없기 때문에 오염 위험을 낮춥니다. 그러나 구매자는 벤치마크 파일, 도구, 채점 기준이 자신들의 운영 환경과 일치한다고 가정할 수 없습니다.

초기 고객 추천사에도 비슷한 주의점이 있습니다. Anthropic은 출시 자료에 포함할 조직과 인용문을 선택했습니다. 이들 사용자는 대체로 강력한 테스트, 숙련된 감독자, 명확히 정의된 성과 기준을 갖춘 정교한 개발 환경에서 운영됩니다.

더 작은 기업은 구조가 덜 갖춰져 있을 수 있습니다. 데이터는 일관성이 없고, 권한은 지나치게 넓으며, 작업에는 숨겨진 조직적 가정이 포함될 수 있습니다. 동일한 모델 행동도 이런 조건에서는 다른 결과를 낼 수 있습니다.

기업은 대표적인 업무와 문서화된 실패 범주를 사용해 평가를 진행해야 합니다. 통과율만으로는 충분하지 않습니다. 팀은 근거 없는 주장, 파괴적 작업, 불필요한 도구 호출, 불완전한 인계, 승인 요청 실패를 기록해야 합니다.

또한 첫 번째 응답의 품질이 아니라 전체 작업 완료 과정을 비교해야 합니다. 사람의 수정 시간은 모델 실행 비용을 상회할 수 있습니다. 반대로 수정이 거의 필요 없는 결과물을 반환한다면, 느린 에이전트도 여전히 시간을 절약할 수 있습니다.

Claude Opus 5가 주목받는 이유는 독립 결과가 Anthropic의 성능 주장을 대체로 뒷받침하기 때문입니다. 그러나 이러한 결과가 무인 배포를 정당화하지는 않습니다. 대신 Google, OpenAI 및 기존 내부 워크플로를 상대로 더 진지한 테스트를 수행할 근거를 제공합니다.

안전성 향상이 에이전트 위험을 없애지는 않는다

Anthropic은 의미 있는 안전성 향상을 보고하지만, 더 강력한 에이전트는 잘못된 지시와 손상된 컨텍스트가 초래하는 결과도 확대합니다.

Anthropic은 Opus 5가 최근 Claude 모델 가운데 가장 낮은 측정값의 정렬되지 않은 행동 비율을 보였다고 말합니다. 자동화된 행동 감사에서 모델의 전체 비정렬 점수는 2.3이었습니다.

회사는 또한 Opus 5가 Opus 4.8, Sonnet 5, Fable 5보다 Claude의 Constitution을 더 충실히 따른다고 말합니다. Claude의 Constitution은 모델 행동을 안내하고 상충하는 지시를 해결하기 위해 Anthropic이 작성한 프레임워크입니다.

이는 회사가 자체적으로 수행한 측정입니다. 유용한 세부 정보를 제공하지만, 독립 연구자들이 익숙하지 않은 공격과 실제 배포 환경에서 모델을 테스트하려면 시간이 필요합니다. 사용자가 모델을 새로운 도구에 연결하면 안전성 결과는 흔히 달라집니다.

프롬프트 인젝션은 여전히 핵심 우려 사항입니다. 프롬프트 인젝션은 에이전트가 읽는 콘텐츠 안에 숨겨진 악의적인 지시입니다. 공격자는 에이전트가 신뢰할 수 없는 텍스트를 승인된 명령으로 취급하도록 유도합니다.

Anthropic의 Boris Cherny는 Opus 5를 회사 역사상 프롬프트 인젝션에 가장 덜 취약한 모델이라고 설명했습니다. 함께 공개된 시스템 카드는 행동 감사, 오용 평가, 레드팀 훈련 전반의 테스트를 보고합니다.

선제적 에이전트는 이메일, 문서, 웹사이트, 소스 코드, 지원 티켓을 처리하므로 취약성 감소는 중요합니다. 어떤 항목이든 모델의 방향을 바꾸도록 설계된 지시를 포함할 수 있습니다. 도구 접근 권한은 성공적인 조작을 운영상 피해로 바꿉니다.

그러나 저항성이 면역을 뜻하지는 않습니다. 조직은 여전히 데이터와 지시를 분리하고, 자격 증명을 제한하며, 민감한 작업 전에 확인을 요구해야 합니다. 일부 공격은 모델 수준의 방어를 우회할 것이라고 가정해야 합니다.

Anthropic은 Opus 5의 사이버 보안 학습도 제한했습니다. 회사는 그러한 제한에도 일반 역량 향상으로 모델의 취약점 발견 능력이 개선됐다고 말합니다. 다만 그러한 약점을 악용하는 능력에서는 여전히 Mythos 5에 뒤처집니다.

이러한 분리는 공격 역량을 극대화하지 않으면서 방어적 유용성을 보존하려는 목적입니다. 취약점 발견과 악용은 지식을 공유하기 때문에 이를 유지하기는 어렵습니다. 전문 학습에서 공격 과제를 제외하더라도, 더 나은 추론은 양쪽 역량을 모두 개선할 수 있습니다.

이번 출시는 거버넌스 문제도 제기합니다. Opus 5가 설계자가 예상하지 못한 도구를 만들 수 있다면, 권한 시스템은 명명된 행동이 아니라 결과를 평가해야 합니다. 모델이 대체 경로를 구성할 수 있다면 하나의 명령을 차단하는 것은 거의 보호가 되지 않습니다.

FreeCAD 사례는 무해한 환경에서 이 문제를 보여 줍니다. 모델은 시각적 접근 권한이 없었기 때문에 비전 파이프라인을 구축했습니다. 민감한 환경에서는 비슷한 즉흥적 대응이 악의적 의도 없이도 의도된 경계를 우회할 수 있습니다.

선제적 에이전트에는 역량 실패와 정책 제한의 명확한 구분이 필요합니다. “이 입력에 접근할 수 없다”가 자동으로 “새로운 접근 방법을 구축하라”를 의미해서는 안 됩니다. 때로는 누락된 역량 자체가 의도적인 보안 통제를 뜻합니다.

개발자는 모델이 이 구분을 인식하는지 테스트해야 합니다. 평가에서는 에이전트를 명시적인 경계 뒤에 배치하고, 권한을 요청하는지, 안전하게 멈추는지, 제한을 우회해 즉흥적으로 대응하는지를 관찰할 수 있습니다.

감사 가능성도 똑같이 중요합니다. 긴 에이전트 추적에는 수백 건의 도구 상호작용이 포함될 수 있습니다. 사람 검토자는 변경된 파일, 접근한 시스템, 가정, 실패한 테스트, 해결되지 않은 불확실성을 식별하는 요약을 필요로 합니다.

지식 출처도 중요합니다. knowledge blending을 사용하는 팀은 여러 정보 소스를 연결할 수 있지만, 결과 답변에는 여전히 추적 가능한 근거가 필요합니다. 모델은 각 중대한 주장을 뒷받침하는 출처를 보여줘야 합니다.

Anthropic이 보고한 안전성 향상은 통제된 시험의 근거를 강화합니다. 무제한 자율성을 뒷받침하지는 않습니다. Opus 5가 개방형 작업을 더 효과적으로 완료할수록, 그러한 통제는 더욱 중요해집니다.

Anthropic, Google 및 AI 구매자에게 다음으로 다가올 일

다음 단계는 프로덕션 신뢰성, Google의 대응, 그리고 벤치마크 향상이 일상적인 업무 환경에서도 유지된다는 증거에 의해 결정될 것입니다.

첫 번째 신호는 실제 조직의 배포 데이터입니다. 구매자는 Opus 5가 코딩과 지식 작업 전반에서 사람의 수정 시간, 실패한 실행, 반복 프롬프트를 줄이는지 지켜봐야 합니다. 완료된 작업이 정확성을 유지할 때에만 더 낮은 자원 사용량이 의미를 가집니다.

스크립트화되지 않은 배포의 증거는 Anthropic의 주장을 강화할 것입니다. 범위 확장, 느린 완료, 또는 자신감 있는 사실 오류에 대한 보고는 이를 약화시킬 것입니다. 가장 유용한 사례 연구에는 성공 사례뿐 아니라 실패율도 포함될 것입니다.

두 번째 신호는 Gemini와 에이전트 플랫폼을 통한 Google의 대응입니다. Workspace와 Cloud 통합이 Gemini를 더 쉽게 관리할 수 있게 만든다면, Google이 모든 독립 벤치마크에서 승리할 필요는 없습니다. 다만 경쟁력 있는 계획 수립, 검증, 복구 행동은 필요합니다.

Google 모델이 장기 실행 작업에서 Opus 5와 맞먹는다면 경쟁의 중심은 다시 배포력으로 이동할 것입니다. 대응이 약하다면, 더 큰 플랫폼이 배포하는 소프트웨어 내부에서도 Anthropic이 Claude의 행동을 중심으로 에이전트 품질을 정의하게 될 수 있습니다.

OpenAI도 이 비교의 일부로 남을 것입니다. GPT-5.6 Sol의 더 강한 프레젠테이션 결과는 전문 업무가 여러 독립적인 차원으로 이루어진다는 점을 보여 줍니다. 구매자는 하나의 영구적인 승자를 선택하는 대신 모델 간에 작업을 점점 더 라우팅하게 될 것입니다.

세 번째 신호는 독립 안전성 테스트입니다. 연구자들은 프롬프트 인젝션 저항성, 권한 처리, 사실적 보정, 모델의 중단 의지를 검토해야 합니다. 외부 팀이 익숙하지 않은 환경에서도 Anthropic의 주장을 재현한다면 그 주장은 더 설득력을 갖게 됩니다.

실패가 반드시 Opus 5를 사용할 수 없게 만들지는 않습니다. 대신 모델에 더 엄격한 권한, 더 좁은 작업 범위, 또는 더 강한 사람의 검토가 필요한 지점을 명확히 할 것입니다. 에이전트 안전성은 보통 단일 모델 점수가 아니라 시스템의 속성입니다.

개발자에게 당장의 질문은 실용적입니다. Opus 5는 Opus 4.8, Gemini 또는 GPT-5.6보다 더 적은 수정으로 어려운 작업을 완료합니까? 통제된 평가는 동일한 입력, 도구, 권한, 완료 기준을 사용해야 합니다.

기업 구매자는 출력 품질만 살펴봐서는 안 됩니다. 예측 가능한 지연 시간, 추적 가능한 출처, 통제 가능한 리소스 사용, 반복 실행 시의 안정적인 동작, 그리고 모델이 모호한 상황에 부딪혔을 때의 명확한 에스컬레이션이 필요합니다.

지식 근로자도 주목해야 합니다. 에이전트 경쟁은 채팅을 넘어 이동하고 있기 때문입니다. 모델은 점점 더 최종 스프레드시트, 프레젠테이션, 리서치 패키지, 운영 변경 사항을 만들어 달라는 요청을 받고 있습니다. 검증 품질이 이런 결과물이 업무를 줄여 줄지, 아니면 업무를 다른 곳으로 옮겨 놓는 데 그칠지를 결정할 것입니다.

Anthropic과 Google의 경쟁은 이제 더 날카로운 시험대에 올랐습니다. Anthropic은 지속적이고 자기 점검적인 행동이 Google의 유통 우위를 상쇄할 수 있다고 보고 있습니다. Google은 이미 통제하고 있는 시스템 안에서 Gemini를 동등하게 신뢰할 수 있게 만들어 대응할 수 있습니다.

Claude Opus 5는 현재 Anthropic에 이 전략을 뒷받침하는 강력한 근거를 제공합니다. 독립 평가 점수는 인상적이며, 도구 구축 사례는 에이전트 행동의 의미 있는 변화를 보여 줍니다. 다만 사실성 보정과 지연 시간 결과는 섣부른 승리 선언을 막습니다.

이미 예상 결과를 알고 있는 업무에 이 모델을 적용해 보세요. 모든 수정, 불필요한 행동, 근거 없는 주장, 승인 요청을 추적하세요. 그런 다음 가장 인상적인 응답이 아니라 전체 작업을 비교하세요.

다음 선두 주자는 하나의 리더보드로 결정되지 않을 것입니다. 가치 있는 업무를 완료하면서도 오류를 눈에 보이게 하고, 범위를 제한하며, 복구 가능하게 만드는 시스템이 승자가 될 것입니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page