Claude Opus 4.6, 12시간짜리 작업 처리 가능 - 하지만 신뢰도는 50%에 그쳐
- Ethan Carter

- 8월 2일
- 10분 분량
Google News는 눈길을 끄는 주장을 내놓았다. Claude Opus 4.6가 인간의 작업 시간으로 거의 12시간에 해당하는 AI 작업을 처리할 수 있다는 것이다. 하지만 이 모델이 해당 수준에 도달할 때의 예상 성공률은 50%에 불과하다.
성공률 80% 기준에서 측정된 작업 범위는 약 70분으로 떨어진다. 이 차이는 낙관적인 헤드라인을 AI 에이전트 신뢰도에 관한 훨씬 더 중요한 이야기로 바꾼다. 맡은 일의 절반만 완료하는 에이전트는 자율적인 동료가 아니다. 실패를 여전히 사람이 찾아내야 하는, 불확실한 초안 생성기에 가깝다.
이 수치는 서로 다른 길이의 소프트웨어 작업을 AI 에이전트가 완료할 수 있는지 평가하는 독립 연구기관 METR에서 나왔다. Anthropic은 2026년 2월 Claude Opus 4.6를 공개하며 지속적인 에이전트 작업에서 성능이 개선됐다고 설명했다. METR의 결과는 그 방향성을 뒷받침하는 한편, 가장 긴 헤드라인 수치에 가려진 한계도 드러낸다.
따라서 쟁점은 Claude와 다른 모델 간의 대결이 아니다. 마케팅되는 자율성과 팀이 안전하게 활용할 수 있는 자율성의 차이다. 개발자와 기업 구매자에게는 추정에 불과한 12시간보다 신뢰할 수 있는 70분이 더 중요하다.
12시간 Claude 결과가 실제로 측정하는 것
헤드라인의 수치는 12시간 동안 끊김 없이 자율 운영된다는 뜻이 아니라, 작업의 난도를 나타낸다.
METR은 작업 완료 시간 범위를, AI 에이전트가 정해진 성공률로 끝낼 수 있는 작업을 인간 전문가가 수행하는 데 걸리는 시간으로 정의한다. 12시간 범위는 Claude가 12시간 동안 계속 작동한다는 의미가 아니다. 시험된 작업을 숙련된 사람이 완료하는 데 그 정도 시간이 걸린다는 뜻이다.
이 구분은 중요하다. AI 에이전트는 성공하는 작업을 인간 기준선보다 더 빠르게 수행하는 경우가 많기 때문이다. 한 번에 여러 코드 블록을 작성하고, 문서를 빠르게 검색하며, 일부 수동 탐색 과정을 건너뛸 수 있다. 인간의 소요 시간은 모델의 스톱워치가 아니라 난도 척도로 작동한다.
METR의 time horizon dashboard는 에이전트 결과 전반에 통계 곡선을 맞춰 성공률을 추정한다. 이 작업 모음에는 100개가 넘는 소프트웨어 중심 과제가 포함돼 있다. 연구진은 각 작업을 여러 번 실행하고, 결과를 추정된 인간 완료 시간과 비교한다.
평가 대상 작업은 주로 소프트웨어 엔지니어링, 머신러닝, 사이버 보안을 다룬다. 과제는 자체 완결적이고 명확하게 정의되며 자동 채점이 가능하도록 설계됐다. 이런 조건 덕분에 체계적 테스트가 가능하지만, 회사 내부의 일상 업무와는 다르다.
보도에 따르면 Claude Opus 4.6는 약 719분, 즉 거의 12시간의 50% 시간 범위에 도달했다. 80% 시간 범위는 약 70분이었다. 첫 번째 수치는 강렬한 헤드라인을 만들지만, 두 번째 수치가 실제 배포 관점에서는 더 유용한 신호를 제공한다.
50% 시간 범위는 비슷한 작업의 절반에서만 성공을 예측한다. 검증이 빠르고 실수 비용이 낮다면 이런 실패율도 쓸모가 있을 수 있다. 개발자는 에이전트에게 어려운 리팩터링을 시도하게 한 뒤 결과를 검토하고, 테스트에 실패하면 폐기할 수 있다.
하지만 모니터링 없이 진행되는 프로덕션 마이그레이션에는 같은 수준의 신뢰도를 받아들일 수 없다. 오류가 사고가 발생하기 전까지 드러나지 않는 보안 변경에도 적합하지 않다. 팀이 실패를 효율적으로 알아차릴 수 없다면, 더 긴 작업 처리 능력은 운영상 가치가 거의 없다.
80% 기준도 완벽하지는 않다. 적합된 모델에서 비슷한 시도 다섯 번 중 한 번은 여전히 실패한다는 의미다. 그래도 지속적인 감독 대신 주기적 검토가 가능한 작업에 가까워지게 한다.
이 때문에 Google News의 프레이밍에는 맥락이 필요하다. 12시간은 동전 던지기 수준의 신뢰도에서 Claude가 도달한 외곽 역량을 포착한다. 70분은 사용자가 제한적인 위임을 고려하기 시작할 수 있는 작업 시간을 더 잘 설명한다.
그 해석에도 주의가 필요하다. 이 결과가 Claude가 모든 70분짜리 작업의 80%를 완료할 수 있음을 보여주는 것은 아니다. METR은 일부 작업은 모델에게 꾸준히 쉽지만, 다른 작업은 꾸준히 실패를 안긴다고 설명한다. 이 비율은 평가 세트 전반에 걸친 적합된 기대치를 나타낸다.
실질적인 질문은 모델이 인상적인 하나의 시간 기준을 넘어섰느냐가 아니다. 사용자가 작업을 위임하기 전에 어떤 과제가 신뢰할 수 있는 범위 안에 속하는지 식별할 수 있느냐이다.
Google News 독자가 신뢰도에 주목해야 하는 이유
AI 에이전트의 신뢰도는 더 긴 작업 범위가 인간의 시간을 절약하는지, 아니면 검토와 복구 업무로 옮겨놓을 뿐인지를 결정한다.
실패한 채팅 응답의 비용은 몇 초에 그친다. 실패한 에이전트 실행은 파일을 변경하고, 잘못된 의존성을 선택하고, 요구사항을 오독하며, 초기 실수를 바탕으로 추가 작업을 쌓아 올릴 수 있다. 에이전트에 더 많은 도구와 자유가 주어질수록 오류 비용은 커진다.
이는 비대칭적인 문제를 만든다. 성공적인 장시간 실행은 눈에 보이는 산출물을 내놓기 때문에 축하하기 쉽다. 실패한 실행은 그럴듯한 코드, 불완전한 테스트, 자신감 넘치는 요약 속에 결함을 숨길 수 있다. 감독자는 원래 작업을 직접 끝내는 것보다 그럴듯하게 다듬어진 실수를 감사하는 데 더 많은 시간을 쓸 수 있다.
Claude Opus 4.6가 중요한 이유는 Anthropic이 이를 더 긴 에이전트 워크플로를 위한 모델로 명확히 포지셔닝했기 때문이다. 회사의 model announcement는 이 모델이 더 신중하게 계획하고, 더 큰 코드베이스에서 더 안정적으로 작업하며, 자체 실수를 더 많이 포착한다고 말한다. Anthropic은 베타로 100만 토큰 컨텍스트 윈도우도 도입했다.
컨텍스트 윈도우는 모델이 한 번의 상호작용에서 처리할 수 있는 정보의 양이다. 더 많은 컨텍스트는 에이전트가 더 큰 리포지터리를 살피고 더 긴 기록을 유지하게 해준다. 하지만 그 윈도우 안에 들어간 모든 내용을 모델이 올바르게 추론할 것이라고 보장하지는 않는다.
긴 컨텍스트와 긴 작업 시간 범위는 서로 다른 제약을 해결한다. 전자는 모델이 얼마나 많은 자료에 접근할 수 있는지와 관련된다. 후자는 특정 신뢰도 수준에서 완료할 수 있는 작업의 난도를 추정한다. 두 요소를 결합하면 활용 가능한 작업 공간은 넓어지지만 실행 위험이 사라지지는 않는다.
실제 개발 상황을 떠올리면 신뢰 격차가 더 분명해진다. 인간 엔지니어라면 하루 대부분이 걸릴 데이터베이스 마이그레이션을 에이전트에게 맡긴다고 가정해 보자. 에이전트는 마이그레이션 스크립트를 작성하고, 애플리케이션 코드를 업데이트하며, 테스트를 수정한다.
신뢰도 50%에서는 팀이 이 결과를 완료된 작업으로 취급할 수 없다. 엔지니어가 스키마 가정, 롤백 동작, 데이터 보존, 배포 순서를 점검해야 한다. 이 검토 비용은 작업을 직접 수행하는 비용에 근접할 수 있다.
이제 인간 기준선이 70분인 더 작은 작업을 생각해 보자. 에이전트는 정의된 컴포넌트를 업데이트하고, 테스트를 실행하며, 간결한 변경 세트를 만든다. 예상 성공률 80%도 여전히 검토를 요구하지만, 검토 범위가 더 좁고 실패를 격리하기도 쉽다.
이 차이는 모델 선택만큼이나 제품 설계에도 영향을 준다. 유용한 에이전트 시스템에는 체크포인트, 테스트, 권한 경계, 그리고 모델이 변경한 내용을 빠짐없이 기록하는 체계가 필요하다. 불확실성이 커질 때의 에스컬레이션 경로도 갖춰야 한다.
이는 지식 작업에서 추적 가능한 컨텍스트가 특히 중요한 이유이기도 하다. 검색 가능한 AI knowledge base는 요구사항, 회의 결정, 원본 자료를 보존할 수 있다. 올바른 추론을 보장하지는 못하지만, 사람이 에이전트의 결론을 검토할 증거를 제공한다.
현재 벤치마크는 에이전트를 완전한 직무의 대체재로 홍보하는 팀에도 압박을 가한다. METR의 측정은 그런 해석을 뒷받침하지 않는다. 하나의 직무는 모호한 요청, 조직적 맥락, 협상, 판단, 그리고 서로 연결된 많은 작업에 대한 책임을 결합한다.
이 작업 모음은 오히려 맥락을 거의 모르는 작업자에게 주어진, 명확히 범위가 정해진 과제에 가깝다. METR은 특히 자사의 시간 범위를 회사의 역사를 이해하는 숙련된 직원이 수행하는 업무와 동일시해서는 안 된다고 경고한다.
이 경고는 구매자가 AI 헤드라인을 해석하는 방식을 바꾼다. 관련 있는 단위는 명목상 작업 시간이 아니라, 인간의 주의 1시간당 검증을 거쳐 완료되는 작업량이다.
진짜 경쟁은 AI 자율성과 인간 검증의 대결이다
핵심적인 한계는 더 이상 AI 에이전트가 긴 작업을 시도할 수 있느냐가 아니라, 사람이 그 작업을 다시 수행하지 않고도 검증할 수 있느냐에 있다.
더 긴 작업 시간 범위는 여전히 의미 있는 진전이다. METR의 초기 연구는 최전선 모델의 작업 시간 범위가 수년에 걸쳐 기하급수적으로 증가했음을 발견했다. 연구진은 이러한 개선을 더 나은 추론, 도구 사용, 신뢰도, 실수로부터의 복구 능력에 일부 기인한다고 봤다.
이들의 long-task study는 2019년 이후 약 7개월의 역사적 두 배 증가 주기를 보고했다. METR의 더 새로운 TH1.1 분석은 2024년 이후 출시된 모델만 적합할 경우 89일이라는 더 짧은 두 배 증가 간격을 발견했다.
두 수치는 서로 다른 기간을 설명한다. 더 빠른 최근 추정치가 더 긴 역사적 추세를 지우는 것은 아니다. 이는 하나의 적합 방식에서 가속을 시사하는 한편, 그 속도가 지속될지는 열어 둔다.
TH1.1 업데이트는 작업 모음도 170개에서 228개 과제로 확대했다. 인간 기준으로 최소 8시간이 걸리는 과제 수는 14개에서 31개로 두 배 이상 늘었다. 새 과제들은 최신 모델이 기존 벤치마크의 한계를 소진하던 긴 작업 구간의 범위를 개선했다.
Claude Opus 4.6는 바로 그 경계를 밀어붙였다. 모델이 거의 모든 짧은 작업에서 성공하면, 적합된 곡선은 소수의 긴 과제 집단에 크게 의존하게 된다. 그러면 추정치는 작업 선택과 통계적 가정에 더 민감해진다.
METR은 modeling assumptions에 관한 3월 분석에서 이 문제를 인정했다. 이 기관은 작업 모음이 포화 상태에 가까워지고 있으며, 최근 결과가 분석적 선택에 더 민감해졌다고 밝혔다.
그렇다고 12시간 결과가 무의미해지는 것은 아니다. 정확한 헤드라인 시간 수치를 둘러싼 확신이 헤드라인이 암시하는 것보다 약하다는 뜻이다. 성공적인 작업 범위가 길어지는 큰 흐름은 한 모델의 정확한 위치보다 더 분명하게 유지된다.
이 긴장은 80%가 더 큰 주목을 받아야 하는 이유도 설명한다. 50% 시간 범위는 성공과 실패가 균형을 이루는 불확실한 최전선에 강하게 반응한다. 80% 시간 범위는 모델이 더 많은 성공 증거를 축적한 구간에 더 가깝다.
그럼에도 80%는 보편적인 신뢰 기준이 아니다. 허용 가능한 비율은 작업의 성격과 검증 비용에 달려 있다.
코딩 에이전트는 자동화된 검사가 많은 오류를 잡아낼 수 있으므로 테스트가 잘 갖춰진 기능을 시도할 수 있다. 비공개 문서를 요약하는 리서치 에이전트는 미묘한 누락이 단순 테스트를 통과할 수 있으므로 인용이 필요하다. 접근 제어를 변경하는 에이전트는 한 번의 놓친 실수로 민감한 시스템이 노출될 수 있으므로 더 엄격한 검토를 요구한다.
이런 차이는 위임의 세 가지 실용적 범주를 만든다.
비용이 낮고 되돌릴 수 있는 작업은 잦은 실패를 감수할 수 있다. 예로는 테스트 케이스 초안 작성, 구현 옵션 탐색, 일회용 프로토타입 제작이 있다. 사람은 에이전트를 다시 실행하거나 결과를 거부할 수 있다.
검증 가능한 프로덕션 작업에는 더 강한 증거가 필요하다. 예로는 국소적인 버그 수정이나 문서화된 API 클라이언트 업데이트가 있다. 테스트, 정적 분석, 코드 리뷰로 위험을 제한할 수 있다.
영향이 크고 검증이 어려운 작업에는 훨씬 높은 신뢰도가 필요하다. 전략적 권고, 보안 결정, 법률 분석, 되돌릴 수 없는 데이터 작업은 에이전트가 더 오래 작업했다는 이유만으로 안전해지지 않는다.
업계는 이 세 범주를 모두 흔히 “자율성”이라는 단어로 압축한다. 하지만 이 틀은 실제 가치를 결정하는 메커니즘을 가린다. 에이전트는 산출물을 만들어내는 것보다 검증하기 쉬울 때 유용하다.
따라서 12시간이라는 기준은 충분한 확실성 없는 역량을 의미한다. 70분이라는 기준은 더 신뢰할 만한 운영 범위를 의미하지만, 여전히 감독 없는 고위험 업무에는 적합하지 않다.
이것이 헤드라인 뒤에 있는 역전이다. 더 긴 숫자는 야망을 측정한다. 더 짧은 숫자는 신뢰를 측정한다.
Claude Opus 4.6 수치가 증명하지 못하는 것
METR의 결과는 Claude가 하루 업무를 자동화하거나, 개발자를 대체하거나, 소프트웨어 작업 외의 영역에서도 동등하게 잘 수행할 수 있음을 증명하지 않는다.
첫 번째 한계는 도메인 범위다. METR의 현재 스위트는 소프트웨어 엔지니어링, 머신러닝, 사이버보안에 집중돼 있다. 이 분야들은 실행 가능한 환경과 객관적 채점 기준을 제공하므로 에이전트 평가에 유난히 적합하다.
많은 비즈니스 작업에는 이런 특성이 없다. 시장 분석은 결정적인 출처를 빠뜨린 채 설득력 있게 들릴 수 있다. 영업 계획은 요청된 모든 단계를 따르면서도 고객을 잘못 이해할 수 있다. 정책 메모는 자동화된 어떤 테스트로도 점수화할 수 없는 판단을 요구할 수 있다.
두 번째 한계는 작업 정의다. 벤치마크 과제는 독립적으로 완결돼 있고 대체로 명확한 완료 기준을 갖는다. 실제 프로젝트는 불완전한 요구사항, 상충하는 이해관계자의 기대, 문서화되지 않은 제약에서 시작된다.
정확한 명세를 받은 뒤 성공하는 모델이 올바른 명세를 찾아낼 수 있음을 보여준 것은 아니다. 인간 전문가는 구현이 시작되기 전에 그 불확실성을 해소하는 데 상당한 시간을 쓴다.
세 번째 한계는 맥락에 관한 것이다. METR는 기존 직원이 보유한 조직 친숙성 없이 과제에 접근하는 인간 전문가와 에이전트를 비교한다. 이는 벤치마크의 비교 가능성을 높이지만, 경제적 결론의 범위는 좁힌다.
경험 많은 엔지니어는 이상한 우회책이 왜 존재하는지 안다. 제품 관리자는 어떤 고객 약속이 기능을 제약했는지 기억한다. 보안 책임자는 회사가 이미 수용한 이론적 위험이 무엇인지 이해한다. 이런 사실은 티켓 안에 좀처럼 담기지 않는다.
대규모 컨텍스트 윈도우는 더 많은 문서를 제공할 수 있지만, 올바른 맥락을 선택하는 일은 여전히 어렵다. 오래된 결정은 최신 결정과 충돌할 수 있다. 비공식 예외는 회의나 개인 메시지에 남아 있을 수 있다. 더 많은 입력은 유용한 자료와 함께 더 많은 무관한 증거를 끌어들일 수 있다.
네 번째 한계는 추정치 자체가 적합화된 값이라는 점이다. 시간 지평은 다양한 작업을 하나의 지속 시간 축으로 요약한다. 작업 길이는 난이도와 상관관계가 있지만, 인간에게 같은 시간이 필요한 두 과제도 모델에는 전혀 다른 방식의 도전이 될 수 있다.
한 과제는 에이전트가 잘 처리하는 반복적 코드 변경을 요구할 수 있다. 다른 과제는 미묘한 아키텍처 제약을 알아차리는 능력에 달려 있을 수 있다. 같은 지속 시간이라고 해서 두 작업의 실패 확률까지 같아지는 것은 아니다.
METR는 현재 스위트로는 16시간을 넘는 측정이 신뢰하기 어렵다고도 경고한다. Claude의 12시간 추정치는 그 경계에 가깝고 신뢰구간도 넓다. 독자는 점추정치를 보정된 서비스 보장이 아니라 불확실성의 범위로 받아들여야 한다.
다섯 번째 한계는 모델과 스캐폴드에 대한 의존성이다. 스캐폴드는 모델에 도구, 지침, 메모리, 행동을 취하기 위한 루프를 제공하는 소프트웨어 시스템이다. Claude Code, Codex 및 기타 에이전트 시스템은 동일한 기반 모델로도 서로 다른 결과를 낼 수 있다.
프롬프트, 도구 권한, 토큰 예산, 재시도 정책의 변화는 성능에 실질적인 영향을 미칠 수 있다. 특정 구성의 에이전트에 대한 벤치마크 결과가 같은 모델 이름을 쓰는 모든 제품으로 자동 이전되지는 않는다.
마지막으로, 성공률은 감독에 드는 인적 비용을 보여주지 않는다. 실패가 즉각적이고 명백하다면 50%의 결과도 상업적으로 가치 있을 수 있다. 반면 각 산출물마다 전문가 감사를 요구한다면 80%의 결과도 매력적이지 않을 수 있다.
METR는 이러한 단서에 대해 유난히 직접적으로 설명해 왔다. METR의 한계 안내는 50% 지평이 사용자가 그보다 짧은 모든 작업을 단순히 위임할 수 있다는 뜻은 아니라고 밝힌다. 일부 과제는 자동화의 가치가 생기기 전에 98% 이상의 성공률을 요구한다.
이 문장은 Google News 헤드라인에 대한 가장 중요한 균형추다. 이 벤치마크는 확장되는 최전선을 측정하지만, 배포 준비 상태를 인증하지는 않는다.
Anthropic 자체 안전성 문서도 또 하나의 필요한 경계를 제공한다. 이 회사의 시스템 카드는 특정 테스트 조건에서의 역량 및 안전성 평가를 제시한다. 이는 가치 있는 공개 자료이지만, 모든 후속 워크플로에 대한 보장은 아닌 모델 평가에 머문다.
기업 구매자는 시스템 수준의 증거를 요구해야 한다. 여기에는 모델, 에이전트 스캐폴드, 연결된 도구, 조직 데이터, 권한, 검토 절차가 포함된다. 신뢰성은 이 전체 구성에서 나온다.
Google News 헤드라인 이후 주목할 점
다음 단계는 더 나은 장기 작업 테스트, 더 높은 신뢰성의 결과, 그리고 감독된 업무 현장 배포에서 나온 증거가 결정할 것이다.
첫 번째 신호는 METR의 다음 작업 스위트 확장이다. Claude Opus 4.6은 이미 현재 벤치마크의 일부 구간, 특히 짧은 지속 시간에서 포화에 가까워지고 있다. 탄탄한 인간 기준선을 갖춘 더 많은 장기 작업은 최전선 추정치를 둘러싼 불확실성을 줄일 것이다.
이러한 추가 항목의 질은 원시적인 작업 수보다 더 중요하다. 연구자들은 결과 평가가 가능하면서도 중요한 업무를 닮은, 독립적으로 완결된 과제가 필요하다. 또한 전문가 추정에 과도하게 의존하지 않고 완료 시간을 산정할 수 있을 만큼 충분한 인간 시도도 필요하다.
새로운 평가가 더 큰 스위트에서도 12시간 지평을 유지한다면 역량 추세에 대한 신뢰는 강해질 것이다. 추정치가 급격히 떨어진다면, 현재의 헤드라인은 벤치마크 상한 근처에서 나타난 측정 인공물에 더 가까워 보일 것이다.
두 번째 신호는 더 엄격한 성공 기준에서의 움직임이다. 모델이 50% 지평을 연장하면 더 어려운 작업을 시도할 수는 있지만, 운영 위험을 반드시 낮추는 것은 아니다. 80% 지평의 성장은 더 긴 작업이 신뢰성 있게 해결 가능해지고 있음을 보여줄 것이다.
더 강력한 신호는 90%, 95% 또는 그 이상의 신뢰성에서 공개된 성능일 것이다. 이런 기준은 반복된 실패가 검토 비용을 만드는 프로덕션 워크플로와 더 밀접하게 맞닿아 있다. 또한 신뢰성 곡선이 고르게 개선되는지, 아니면 여전히 가파른지를 보여줄 것이다.
그런 이유로 50%와 80% 사이의 격차는 계속 주목할 가치가 있다. Claude Opus 4.6은 거의 12시간과 70분 사이에 큰 차이를 보인다. 향후 모델이 이 격차를 좁힌다면 자율성은 더 쉽게 배포될 것이다.
두 지평이 모두 증가하면서 그 간격이 여전히 넓다면, 헤드라인 속 역량은 계속해서 신뢰할 수 있는 역량을 앞지를 것이다. 그러면 에이전트 플랫폼은 검증, 재시도, 인간 점검 지점에 더 크게 의존하게 된다.
세 번째 신호는 생성된 산출물이 아니라 완료된 결과를 측정하는 업무 현장 증거다. 조직은 승인된 변경, 유출된 결함, 검토 시간, 롤백 빈도, 그리고 상당한 수정이 필요했던 에이전트 작업의 비율을 추적해야 한다.
이 지표들은 벤치마크가 해결할 수 없는 경제적 질문에 답한다. 에이전트는 감독 후의 총 전문가 노력을 줄이는가, 아니면 그 노력을 디버깅과 검증으로 옮길 뿐인가?
통제된 배포는 어떤 작업 범주가 벤치마크를 넘어 전이되는지도 식별할 수 있다. 모델은 고립된 코딩 과제에서는 잘 수행하지만 리포지터리 전반의 변경에는 어려움을 겪을 수 있다. 재무 분석 초안은 효과적으로 작성하면서도 결정적인 내부 가정을 찾는 데 실패할 수 있다.
가장 좋은 보고서는 작업 지속 시간과 작업 유형을 분리할 것이다. 또한 스캐폴드, 권한, 검토 절차, 실패의 정의도 공개할 것이다. 이런 세부 사항이 없다면 자율 작업 시간에 대한 주장을 비교하기는 여전히 어렵다.
경쟁 결과는 유용한 맥락을 제공하겠지만, 모델 리더보드가 주요 이야기가 되어서는 안 된다. METR의 대시보드는 Anthropic, OpenAI, Google 및 기타 개발사의 시스템을 측정해 왔다. 리더십은 출시와 평가 설정이 바뀔 때마다 달라질 수 있다.
더 깊은 경쟁은 더 긴 위임과 감당 가능한 검증 사이에 있다. 모델은 차트 정상에 오른다고 자율적 작업자가 되는 것이 아니다. 팀이 더 낮은 총 주의 비용으로 산출물을 신뢰할 수 있을 때 운영상 유용해진다.
개발자에게 당장의 대응은 조정된 위임이어야 한다. 명시적인 승인 테스트가 있는 경계가 분명한 작업을 에이전트에 맡겨라. 로그를 보존하고, 변경된 파일의 요약을 요구하며, 작업에 필요하지 않은 시스템에 대한 접근을 제한하라.
기업 구매자에게는 조달 질문이 모델 지능을 넘어가야 한다. 부분 실패 뒤에 어떤 일이 일어나는지 물어야 한다. 시스템이 변경을 롤백하고, 근거를 인용하고, 불확실성을 드러내며, 사람에게 에스컬레이션할 수 있는지 확인하라.
지식 근로자에게 70분이라는 수치는 더 현실적인 기대를 제시한다. AI는 점점 더 여러 단계를 거쳐 정의된 과제를 수행할 수 있다. 그러나 과제를 구성하고, 결과를 확인하며, 그 결과에 책임질 사람은 여전히 필요하다.
신뢰성이 개선되면 이 책임 분담도 달라질 것이다. 하지만 현재의 증거는 지금 이를 포기하는 것을 뒷받침하지 않는다.
Google News 헤드라인은 실제 이정표를 포착했지만, 가장 극적인 숫자가 가장 유용한 숫자는 아니다. 12시간은 성공과 실패가 동등하게 균형을 이룰 때 Claude가 얼마나 멀리 도달할 수 있는지를 보여준다. 70분은 신뢰가 실용적이기 시작하는 지점을 보여준다.
에이전트에게 하루 업무 전체를 맡기기 전에, 명확한 증거와 되돌릴 수 있는 결과를 갖춘 작업 하나를 선택하라. 명세 작성, 모니터링, 검토에 들어간 인간 시간을 기록하라. 그런 다음 그 총합을 기존 워크플로와 비교하라.
검증 후에도 에이전트가 주의력을 절약해 준다면 경계를 신중하게 넓혀라. 검토가 이득을 소모한다면, 더 긴 모델 지평이 프로세스를 고치지는 못한다. 다음의 중요한 AI 뉴스는 또 하나의 기록만이 아닐 것이다. 신뢰할 수 있는 작업이 인상적인 시도를 따라잡고 있다는 증거가 될 것이다.


