Claude가 ChatGPT를 앞서고 Gemini가 로펌을 겨냥하면서 신뢰를 중심으로 전환되는 Anthropic과 Google의 경쟁
8월 Anthropic과 Google의 경쟁은 뚜렷한 양상을 보였다. Claude는 영국 만족도 순위에서 선두에 오른 반면, Gemini는 규제를 받는 법률 업무에 직접 진출했다. Anthropic의 어시스턴트는 순만족도 56.2점을 기록해 Gemini의 46.5점과 ChatGPT의 46.0점을 앞섰다. 그러나 로펌용 전문 에이전트를 패키지로 제공한 기업은 Google이었다.
이 대조는 단순한 챗봇 순위보다 더 중요하다. Anthropic은 Claude를 사용해 본 사람들 사이에서 더 높은 만족도를 구축한 것으로 보인다. 한편 Google은 유통, 권한, 커넥터, 산업별 워크플로가 기업이 실제로 채택할 AI 시스템을 결정할 것이라는 데 베팅하고 있다.
이번 주의 다른 소기업 기술 뉴스도 같은 교훈을 뒷받침했다. Xero는 AI 지원 회계 워크플로를 확장했고, LinkedIn은 저품질 AI 게시물에 대한 대응을 강화했으며, 금융 업계 리더들은 약화되는 인간의 판단력을 경고했다. 이 이야기들을 함께 보면 AI 경쟁이 모델 지능을 넘어 이동하고 있음을 시사한다.
새롭게 떠오르는 질문은 단지 어떤 어시스턴트가 가장 좋은 답변을 작성하느냐가 아니다. 기업은 오류, 일반적인 콘텐츠, 또는 숨겨진 위험으로 사용자를 압도하지 않으면서 실제 워크플로 안에서 안전하게 행동할 수 있는 시스템이 무엇인지 결정해야 한다.
다섯 가지 이야기가 가리키는 비즈니스 AI의 새 국면
이번 주 기술 뉴스에는 한 가지 공통된 주제가 있었다. AI 제품은 끌어들이는 관심이 아니라 완수하는 업무로 평가받고 있다.
Forbes가 발행한 소기업 동향은 다섯 가지 변화를 연결했다. 각각은 서로 다른 제품이나 전문 환경에 관한 내용이었지만, 모두 같은 구현 문제를 드러냈다.
첫째, Xero는 소기업과 회계 전문가를 위한 추가 AI 워크플로를 발표했다. 회사는 AI 금융 어시스턴트인 JAX를 재무 정보를 설명하는 단계에서 통제된 회계 업무를 완료하는 단계로 나아가기 위한 수단으로 제시했다.
둘째, Google은 Gemini Enterprise for Legal을 선보였다. 이 제품은 로펌과 기업 법무 부서를 위해 Gemini 에이전트, 커넥터, 검색 기능, 액세스 제어를 패키지로 제공한다.
셋째, Goldman Sachs의 한 파트너는 AI에 과도하게 의존하면 “인지적 위축”이 발생할 수 있다고 경고했다. 우려는 명확하다. 소프트웨어가 일관되게 초안, 분석, 또는 권고안을 생성하면 전문가는 추론을 연습할 기회를 잃을 수 있다.
넷째, LinkedIn은 사용자가 “AI Slop” 피드백 옵션을 100만 회 이상 눌렀다고 밝혔다. 회사는 이 신호를 받은 게시물이 조회수의 최대 40%를 잃을 수 있다고 보고했다. 이 기능은 저가치 자동화 콘텐츠에 대한 시청자 불만을 배포상의 결과로 전환한다.
마지막으로, YouGov 데이터는 영국의 현재 및 이전 사용자 사이에서 Claude가 Gemini와 ChatGPT를 순만족도에서 앞섰다고 나타냈다. 이 결과는 이번 주 가장 눈길을 끄는 헤드라인을 제공했지만, 신중한 해석이 필요하다.
이 결과가 Claude가 ChatGPT나 Gemini보다 보편적으로 더 똑똑하다는 사실을 입증하는 것은 아니다. 이는 각 브랜드를 사용한 경험이 있는 사람들의 만족도를 측정한다. 시장 점유율, 업무 정확도, 매출, 또는 모든 전문적 사용 사례에서의 성과를 측정하지는 않는다.
이 이야기들은 시장 신호로 읽을 때 더 유용하다. Xero는 회계 기록 안에 AI를 내장하고 있다. Google은 이를 법률 권한 체계에 맞추고 있다. LinkedIn은 원치 않는 결과물을 불이익 대상으로 삼고 있다. Anthropic은 긍정적인 사용자 정서의 수혜를 보고 있다.
이러한 변화는 접근성에서 책임성으로 관심을 옮긴다. 소기업은 이미 텍스트를 생성할 수 있는 여러 방법을 보유하고 있다. 더 어려운 문제는 생성된 작업물이 문서, 재무 기록, 고객 사건, 공개 배포에 접근할 자격이 있는 시점을 결정하는 것이다.
Xero는 AI가 회계 시스템 안에서 행동하기를 원한다
Xero의 강점은 범용 챗봇이 아니다. 이미 기업의 회계 시스템에 저장된 재무 맥락이다.
덴버에서 열린 2026 고객 행사에서 Xero는 JAX를 중심으로 구축된 새로운 워크플로를 소개했다. 회사는 JAX를 AI 금융 파트너라고 부르지만, 기업은 이 설명을 독립적인 검증이 아닌 제품 주장으로 받아들여야 한다.
Xero의 워크플로 발표에 따르면, 이 어시스턴트는 은행 조정과 문서 캡처를 포함한 업무를 지원할 수 있다. Xero는 자동화된 조정 워크플로가 계정 조정에 드는 시간을 50% 줄일 수 있다고 말한다.
은행 조정은 회계 기록의 거래 내역과 은행 활동을 대조하는 과정이다. 반복적인 업무이지만, 오류는 현금 보유 현황, 세무 준비, 경영 보고를 왜곡할 수 있다.
따라서 조정은 비즈니스 AI를 시험하는 데 유용한 사례다. 세련된 문단은 오류를 포함해도 즉시 원장에 영향을 주지 않을 수 있다. 잘못 분류된 거래는 아무도 알아차리기 전에 보고서와 의사결정에 반영될 수 있다.
Xero의 접근 방식은 AI를 구조화된 재무 데이터와 기존 회계 통제 장치 가까이에 둔다. JAX는 거래, 청구서, 연락처, 과거 분류가 이미 존재하는 시스템 안에서 조치를 제안하거나 수행할 수 있다.
이 모델은 재무 정보를 소비자용 챗봇에 복사하는 방식과 다르다. 시스템에 더 많은 맥락을 제공하지만, 동시에 위험도 높인다. 이 어시스턴트에는 명확한 승인 경계, 추적 가능한 변경 사항, 그리고 작업을 신뢰성 있게 수정하는 방법이 필요하다.
Xero는 재무 데이터를 Claude와도 연결했다. Claude 통합을 통해 적격 사용자는 Anthropic의 어시스턴트를 통해 자신의 비즈니스 정보에 관한 질문을 할 수 있다. 이는 전문화된 비즈니스 데이터와 범용 대화형 인터페이스 사이의 구체적인 연결고리를 제공한다.
소기업 소유자에게 그 매력은 분명하다. 미지급 청구서나 현금 흐름에 관한 질문은 일상적인 언어로 시작될 수 있다. 이후 기본 시스템은 최신 회계 기록에 근거해 응답할 수 있다.
위험 역시 명확하다. 유창한 설명은 불완전한 기록, 이례적인 거래, 또는 잘못된 가정에 기반하더라도 권위 있게 들릴 수 있다. 따라서 금융 AI에는 좋은 모델만으로는 충분하지 않다. 권한 제어, 원본 기록에 대한 인용, 승인 단계, 감사 추적이 필요하다.
이 지점에서 개인 및 조직 정보 관리는 AI 도입의 일부가 된다. 팀은 의사결정의 근거가 된 원본 자료를 보존할 신뢰할 수 있는 방법이 필요하다. 기록이 회계 플랫폼을 넘어설 때 검색 가능한 AI 지식 기반은 이 과정을 지원할 수 있다.
Xero의 발표는 신뢰받는 비즈니스 데이터를 보유한 소프트웨어 공급업체가 왜 영향력을 갖는지 보여 준다. 이들은 모든 벤치마크에서 모든 범용 어시스턴트를 이길 필요가 없다. 사용자가 통제권을 유지하면서 특정 반복 업무를 더 빠르게 수행하도록 만들면 된다.
이는 자율 금융보다 더 좁은 약속이다. 동시에 더 검증하기 쉽다. 기업은 조정 시간이 줄었는지, 수정이 늘었는지, 직원이 결과로 나온 계정을 여전히 이해하는지 측정할 수 있다.
Google은 법률 AI의 권한 문제를 겨냥한다
Google은 액세스 제어와 워크플로 통합을 구현 세부 사항이 아닌 제품 기능으로 다루며 법률 AI에 진입하고 있다.
Google Cloud는 2026년 8월 25일 Gemini Enterprise for Legal을 공개했다. 이 제품은 아직 프리뷰 단계이며 로펌, 기업 법무팀, 법률 운영 그룹을 대상으로 한다.
회사의 법률 AI 플랫폼은 목적에 맞게 설계된 에이전트와 문서 및 사건 관리 시스템용 커넥터를 결합한다. 이 에이전트들은 하나의 응답만 생성하는 대신 여러 단계를 거쳐 업무를 수행하도록 설계된 소프트웨어 구성 요소다.
Google은 계약 검토, 법률 리서치, 문서 분석, 초안 작성을 의도된 워크플로로 제시한다. 또한 로펌이 맞춤형 에이전트를 구축하고 기존 데이터 소스에 연결할 수 있다고 말한다.
핵심 기능은 상속된 액세스 제어다. Google은 이 플랫폼이 로펌의 파일과 시스템에 이미 적용된 권한을 준수한다고 말한다. 변호사가 기본 저장소에서 특정 사건에 접근할 수 없다면, 별도의 구성으로 인해 AI가 접근 권한을 얻어서도 안 된다.
로펌은 이러한 제한을 흔히 윤리적 차단벽이라고 부른다. 전문적 의무, 고객 간 이해충돌, 또는 기밀 유지 요건상 필요할 때 팀이나 개인을 분리한다.
이 권한 모델은 법률 AI 도입의 실질적인 장벽을 해결한다. 유용한 어시스턴트는 계약서, 서신, 리서치 자료, 사건 이력에 접근해야 한다. 그러나 광범위한 접근 권한을 부여하면 고객 경계를 넘어 정보가 노출될 수 있다.
Google은 고객 콘텐츠, 전략, 결과물을 기본 모델 학습에 사용하지 않을 것이라고 말한다. 구매자는 이 진술에 의존하기 전에 보존 설정, 커넥터 동작, 지역별 제어, 로깅, 계약상 약정을 여전히 검토해야 한다.
초기 도입 사례는 Google이 대규모 복잡 조직을 겨냥하고 있음을 보여 준다. Weil은 이 시스템을 배포하고 Google Cloud와 개발 협력을 진행하는 최초의 로펌 중 하나가 될 것이라고 발표했다.
Google은 기존 법률 서비스 분야의 기반도 갖추고 있다. Freshfields는 4월에 5,000명 이상의 전문가가 Gemini 모델 기반 도구를 사용하고 있다고 보고했다. 직원들은 이를 회의 녹취, 문서 요약, 맞춤형 업무용 어시스턴트에 활용했다.
그럼에도 Google이 진입하는 시장은 비어 있지 않다. Anthropic은 2026년 초 Claude for Legal을 도입했고, Harvey와 같은 법률 기술 기업은 이미 리서치, 초안 작성, 문서 검토를 위한 도구를 개발해 왔다.
따라서 중요한 Anthropic과 Google의 충돌은 두 개의 채팅창 간 단순한 경쟁이 아니다. 이는 플랫폼, 통합, 모델 동작, 신뢰 체계 간의 경쟁이다.
Anthropic은 자체 제품과 클라우드 파트너를 통해 Claude를 판매할 수 있다. Google은 Gemini를 Google Cloud 인프라, Workspace, 검색 기술, ID 서비스, 엔터프라이즈 관리 기능과 결합할 수 있다.
전문화는 Google에 더 명확한 비즈니스 사례를 제공하지만, 더 높은 기대도 만든다. 법률 사용자는 그럴듯한 텍스트만 필요로 하지 않는다. 출처 근거, 기밀성, 일관된 액세스 규칙, 결과물이 어떻게 생성됐는지에 대한 기록이 필요하다.
환각으로 생성된 식당 추천은 불편할 뿐이다. 조작된 인용이나 놓친 조항은 고객, 거래, 또는 법원 제출 서류에 영향을 미칠 수 있다. 플랫폼이 결과물을 자신 있게 제시하더라도 사람의 검토는 여전히 필요하다.
Anthropic과 Google의 경쟁은 만족도와 도달 범위를 분리하고 있다
Claude의 만족도 우위는 주목할 만하지만, ChatGPT와 Gemini는 이 순위가 측정하지 않는 장점을 유지하고 있다.
YouGov는 2026년 3월 1일부터 7월 31일까지 영국 BrandIndex 데이터를 수집했다. 분석에는 각 AI 어시스턴트의 현재 및 이전 사용자가 포함됐으며, 각 브랜드 차트의 표본 수는 380개 응답을 넘었다.
그 결과 만족도 순위에서 Claude는 56.2점의 순점수를 받았다. Gemini는 46.5점으로 뒤를 이었고, ChatGPT는 46.0점을 기록했다.
이 수치는 백분율이 아니라 점수다. YouGov는 도구를 사용한 경험이 있는 사람들의 만족 및 불만족 응답을 바탕으로 순점수를 계산한다.
Claude는 이전 사용자 중에서도 21.8점으로 가장 높은 점수를 기록했다. Perplexity가 18.7점으로 뒤를 이었고, ChatGPT의 이전 사용자 대상 점수는 2.9점이었다. Grok은 마이너스 4.7점을 기록했다.
현재 사용자 결과는 달랐다. DeepSeek이 77.2점으로 해당 부문을 이끌었고, Claude가 74.5점으로 뒤를 이었다. Perplexity는 70.5점, ChatGPT는 66.6점, Gemini는 64.2점을 기록했다.
이러한 차이는 “Claude가 ChatGPT를 이긴다”는 표현이 지나치게 포괄적임을 보여준다. Claude는 전체 만족도 지표 하나에서 선두를 차지했다. 현재 사용자 사이에서는 DeepSeek이 앞섰으며, ChatGPT는 전체 선호도에서 여전히 훨씬 강세를 보였다.
YouGov의 별도 브랜드 선호도 분석에서는 영국 AI 사용자 가운데 ChatGPT가 30.0%로 1위를 차지했다. Alexa가 12.7%, Copilot이 11.6%, Gemini가 11.3%로 뒤를 이었다. Claude는 4.3%로 5위에 올랐다.
즉, 전체적으로 Claude를 선호한 응답자는 더 적었지만, 직접 사용한 사람들은 이를 더 긍정적으로 평가했다. 이는 도달 범위와 만족도 사이의 의미 있는 차이다.
선택 효과도 중요하다. Claude 사용자는 더 광범위한 ChatGPT 사용자층과 다를 수 있다. 일부 어시스턴트는 사용자가 적극적으로 찾아야 하지만, 다른 서비스는 이미 널리 쓰이는 기기, 검색 제품, 업무용 구독 또는 잘 알려진 브랜드를 통해 접하게 된다.
이 조사는 특정 국가와 5개월의 기간을 대상으로 했다. 제품 업데이트, 장애, 인터페이스 변경, 모델 출시로 사용자 의견은 빠르게 달라질 수 있다. 이 데이터를 영구적인 글로벌 순위로 일반화해서는 안 된다.
또한 이 조사는 어떤 어시스턴트가 특정 소기업의 업무에서 가장 뛰어난 성과를 낼지 알려주지 못한다. 만족도 점수에는 글쓰기 스타일, 속도, 신뢰성, 인터페이스 디자인, 기대치 등 다양한 경험이 함께 반영된다.
기업은 대표성 있는 업무로 어시스턴트를 평가해야 한다. 유용한 테스트 세트에는 고객 이메일 초안, 문서 요약, 정책 관련 질문, 스프레드시트 분석, 인용이 필요한 리서치가 포함될 수 있다.
결과는 정확성, 수정에 걸리는 시간, 출처 추적 가능성, 일관성을 기준으로 판단해야 한다. 직원들이 싫어하는 시스템은 사용을 피하기 때문에 사용자 선호도 역시 중요하다. 그러나 그것이 업무 수준의 검증을 대체해서는 안 된다.
이것이 Anthropic과 Google의 경쟁이 지니는 더 깊은 의미다. Anthropic은 긍정적인 만족도 신호를 확보했다. Google은 유통력과 확대되는 특화형 엔터프라이즈 패키지군을 보유하고 있다. OpenAI는 강한 선호도와 브랜드 인지도를 유지하고 있다.
어느 하나의 지표도 이 경쟁을 결론짓지는 못한다. 소기업에서 승자가 될 제품은 기존 파일, 직원들의 업무 습관, 보안 통제, 반복 업무에 가장 잘 맞는 제품일 수 있다.
반전은 더 나은 AI가 더 많은 인간의 업무를 만든다는 점이다
AI가 더 많은 업무를 완료할수록, 기업에는 더 강력한 검토 체계와 더 신중한 인간의 판단이 필요해진다.
일반적인 자동화의 약속은 소프트웨어가 반복 업무를 없앤다는 것이다. 이는 여전히 가능하지만, 다섯 가지 사례는 덜 편안한 패턴을 드러낸다. 새로운 AI 작업 하나하나는 새로운 감독 요건을 만든다.
Xero는 수동 조정을 줄일 수 있지만, 누군가는 예외 사항을 조사하고 분류가 정확한지 확인해야 한다. Gemini는 계약서를 검토할 수 있지만, 자격을 갖춘 전문가는 인용, 맥락, 고객별 영향까지 점검해야 한다.
Claude는 훌륭한 초안을 만들 수 있지만, 사용자는 그 초안이 최신 사실을 반영하는지 여전히 판단해야 한다. LinkedIn은 사용자가 더 많은 게시물을 만들도록 도울 수 있지만, 그 결과로 쏟아지는 콘텐츠는 이용자와 플랫폼이 걸러내야 한다.
이는 인지적 위축에 대한 경고의 배경이 되는 우려다. 사람들은 업무를 수행하고, 예외를 발견하고, 교정을 받고, 경쟁하는 해석을 비교하면서 전문적 판단력을 기른다.
AI가 일관되게 첫 번째 분석을 제공한다면, 주니어 직원들은 그러한 반복 경험의 일부를 잃을 수 있다. 미묘한 오류를 알아볼 만큼의 경험을 쌓지 못한 채 결과물을 감독하는 책임을 맡게 될 수도 있다.
법률 업무는 이 문제를 잘 보여준다. 주니어 변호사들은 전통적으로 리서치, 문서 검토, 초안 작성, 반복적인 피드백을 통해 배운다. 이러한 업무는 지루할 수 있지만, 나중에 고차원적 판단을 뒷받침할 패턴을 변호사에게 익히게 한다.
AI는 이 업무와 관련된 청구 가능 시간을 줄일 수 있다. 그러면 로펌은 교육 과제에 직면한다. 소프트웨어가 수용 가능한 첫 초안을 만들 수 있는 상황에서도, 주니어 전문가들이 추론을 연습할 새로운 방법을 마련해야 한다.
자원이 더 적은 소기업도 유사한 문제에 직면한다. 사업주는 어시스턴트에게 계약 요약 초안 작성, 재무 보고서 해석, 인사 정책 준비를 요청할 수 있다. 사업주가 어떤 부분에 전문적 검토가 필요한지 식별할 수 있을 때에만 결과물은 시간을 절약한다.
이는 모든 업무가 수작업으로 남아야 한다는 뜻은 아니다. 기업이 지원, 권고, 실행을 구분해야 한다는 의미다.
지원은 선택지나 요약을 생성한다. 권고는 하나의 선택을 제안한다. 실행은 기록을 변경하고, 메시지를 발송하고, 문서를 제출하거나, 기업을 특정 행동에 구속한다.
각 단계에는 서로 다른 승인 규칙이 필요하다. 요약은 출처를 연결한다면 제한된 불확실성을 허용할 수 있다. 지급, 제출, 고객 커뮤니케이션에는 더 높은 기준이 필요하다.
기업은 중요한 결정의 근거도 보존해야 한다. 메모, 원본 문서, 회의 맥락은 검토자가 AI 생성 제안이 왜 수용됐는지 재구성하는 데 도움이 된다. 검색 가능한 워크플로는 여러 애플리케이션에 걸쳐 중요한 맥락이 사라질 가능성을 줄일 수 있다.
목표는 모든 프롬프트를 기록하는 것이 아니다. 특히 여러 사람이나 시스템이 참여할 때, 중대한 결정을 뒷받침하는 정보를 보존하는 것이다.
따라서 가장 효과적인 AI 워크플로에는 의도적인 마찰이 포함될 수 있다. 원장을 변경하기 전 승인을 요구하고, 어떤 문서가 답변을 뒷받침했는지 공개하거나, 신뢰도가 정의된 기준 아래로 떨어질 때 중단할 수 있다.
이러한 통제는 실수가 비싸지는 지점에서 자동화를 늦춘다. 그것은 실패가 아니라 기능이다.
LinkedIn의 AI Slop 버튼은 유통 위험을 보여준다
AI는 콘텐츠 제작 비용을 낮출 수 있지만, 주목을 얻는 비용은 높일 수 있다.
LinkedIn의 “AI Slop” 피드백 옵션은 주관적인 불만을 플랫폼 신호로 바꾼다. Forbes의 정리에 따르면, 사용자들은 이 버튼을 100만 회 이상 눌렀다.
LinkedIn은 신고된 게시물이 최대 40% 적은 조회수를 받을 수 있다고도 밝혔다. 정확한 영향은 플랫폼 시스템과 각 게시물을 둘러싼 맥락에 따라 달라지지만, 방향성은 분명하다.
이제 기업은 잠재고객이 합리적으로 소비할 수 있는 양보다 더 많은 기사, 업데이트, 이메일, 제품 설명을 생성할 수 있다. 산출량 증가가 그 산출물에 대한 수요 증가를 만들지는 않는다.
일반적인 게시물은 흔히 알아보기 쉬운 특성을 공유한다. 익숙한 조언을 반복하고, 반복적인 구조를 사용하며, 구체적인 경험을 피하고, 근거 없이 주장을 펼친다. 문법적으로는 매끄러울 수 있지만, 읽어야 할 이유는 거의 제공하지 못한다.
이는 소기업 마케팅의 경제성을 바꾼다. 초안 작성은 저렴해지지만, 편집, 검증, 독자적 취재, 유통은 더 가치 있어진다.
일반적인 게시물 다섯 개를 발행하는 기업은 유용한 분석 하나를 발행하는 기업보다 성과가 나쁠 수 있다. 플랫폼은 유통을 줄일 수 있고, 독자는 브랜드를 무시할 수 있으며, 검색 시스템은 차별화된 전문성을 식별하기 어려울 수 있다.
위험은 소셜 미디어를 넘어선다. AI가 생성한 고객 지원 답변은 실제 문제를 해결하지 않고 문서만 반복할 때 고객을 좌절시킬 수 있다. 자동화된 영업 메시지는 개인적인 척할 때 신뢰를 해칠 수 있다.
해결책은 AI 사용을 숨기는 것이 아니다. 기업은 결과물을 더 구체적이고 책임 있게 만들어야 한다.
가치 있는 게시물에는 관찰된 고객 문제, 문서화된 프로세스 변경, 또는 평가할 수 있을 만큼 충분한 맥락을 갖춘 결과가 포함될 수 있다. 유용한 지원 답변은 고객의 정확한 계정 상태를 참조하고 명확한 다음 단계를 제시할 수 있다.
인간 검토는 표면적인 완성도가 아니라 가치에 집중해야 한다. 편집자는 콘텐츠에 새로운 사실, 방어 가능한 관점, 또는 의도한 독자가 다른 곳에서는 얻을 수 없는 직접 경험이 담겼는지 물어야 한다.
이 교훈은 Claude, Gemini, ChatGPT에도 적용된다. 기본 모델의 역량이 유지되더라도 어시스턴트가 장황하거나 일반적인 답변을 내놓으면 만족도는 떨어질 수 있다.
Anthropic에게는 간결하고 협조적인 행동이 Claude의 평판을 강화할 수 있다. Google에게는 Gemini를 전문 시스템에 통합하는 일이 응답의 관련성을 높일 수 있다. 두 전략 모두 생성된 언어와 유용한 업무 사이의 거리를 줄이려 한다.
그러나 어느 기업도 자동화를 더 추가하는 것만으로 유용성을 보장할 수는 없다. 관련성은 맥락에 달려 있고, 신뢰는 일관된 결과에 달려 있다.
Anthropic과 Google의 경쟁을 시험할 세 가지 신호
다음 단계는 발표 규모가 아니라 도입, 지속되는 만족도, 측정 가능한 오류율에 의해 결정될 것이다.
첫 번째 신호는 Gemini Enterprise for Legal의 실제 운영 사용이다. 프리뷰 파트너십은 관심을 보여주지만, 일상적인 도입을 입증하지는 않는다.
매주 이 시스템을 사용하는 법률 전문가가 몇 명인지, 어떤 워크플로가 실제 운영에 도달하는지, 사용자가 그 결과물을 얼마나 자주 수용하거나 수정하는지 보고하는 로펌을 주시해야 한다. 더 폭넓은 배포의 증거는 Google의 특화 전략을 강화할 것이다.
보안 및 거버넌스 사고도 중요하다. 권한 오류나 근거 없는 법률 결과물은 범용 클라우드 제공업체가 민감한 전문 업무를 위해 AI를 안전하게 패키징할 수 있다는 주장을 약화시킬 것이다.
두 번째 신호는 Claude가 만족도 우위를 유지하는지 여부다. YouGov의 측정 기간은 7월 31일에 끝났으므로, 향후 순위에는 더 새로운 제품, 변화한 인터페이스, 달라진 사용자 기대가 반영될 것이다.
지속적인 선두는 제품 행동이 더 낮은 전체 선호도를 보완할 수 있다는 Anthropic의 입장을 뒷받침할 것이다. 급격한 하락은 해당 결과가 일시적인 사용자 또는 제품 버전의 조합을 포착했을 가능성을 시사할 것이다.
세 번째 신호는 워크플로 공급업체가 수정 업무를 늘리지 않으면서 효율성 주장을 검증할 수 있는지 여부다. Xero는 새로운 조정 경험이 해당 업무에 드는 시간을 50% 줄일 수 있다고 말한다. 기업은 이 절감 효과를 예외 발생률, 검토 시간, 후속 수정과 비교해야 한다.
같은 검증은 법률 리서치, 콘텐츠 생성, 고객 지원에도 적용된다. 총 절감 시간만으로는 충분하지 않다. 관련 지표는 검증과 보수 이후의 순 절감 시간이다.
따라서 소기업 구매자는 단일 벤치마크나 설문조사만으로 승자를 선택하지 않아야 한다. 거버넌스가 정리될 때까지 민감한 정보는 제외한 채, 실제 문서와 반복 가능한 업무를 활용해 통제된 시험을 실행할 수 있다.
각 업무에 걸리는 시간, 오류가 발생하는 지점, 직원들이 최종 결과물을 이해하는지를 기록해야 한다. AI 작업 검토 비용도 포함해야 하며, 결과물을 생성하는 속도만 보아서는 안 된다.
기업들이 서로 다른 강점을 추구하고 있기 때문에 Anthropic과 Google의 경쟁은 오히려 더 유용해지고 있다. Claude의 만족도 결과는 Anthropic에 신뢰할 만한 제품 신호를 제공한다. Google의 법률 패키지는 엔터프라이즈 인프라가 Gemini를 신뢰할 수 있는 워크플로 계층으로 바꿀 수 있는지를 시험한다.
어느 결과도 시장을 결론짓지는 못한다. Claude의 점수가 이를 보편적으로 더 나은 제품으로 만들지는 않으며, Gemini의 통합 기능이 신뢰할 수 있는 법률 업무를 보장하지도 않는다.
사업주에게 실질적인 질문은 더 좁다. 어떤 시스템이 통제, 근거, 인간의 판단을 유지하면서 특정 워크플로를 개선하는가? 가장 중요한 업무에 어떤 어시스턴트든 접근 권한을 부여하기 전에 그 질문을 검증해야 한다.



