Anthropic Simon Pelican 테스트: Claude Fable 5.1은 더 좋아 보이지만, 훨씬 더 오래 생각한 뒤에야 그렇다
Anthropic은 과학 벤치마크 점수 52.6%를 기록했다고 밝힌 Claude Fable 5.1을 출시했지만, anthropic simon pelican 테스트는 다른 성능 양상을 드러낸다. Simon Willison은 모델에 자전거를 타는 펠리컨의 SVG를 생성해 달라고 요청했다. 모델은 최대 추론 노력 설정에서 훨씬 더 많은 시간과 출력 토큰을 쓴 뒤에야 가장 설득력 있는 결과를 냈다.
이 대조는 다소 엉뚱해 보이는 전제보다 이 실험을 더 유용하게 만든다. Anthropic은 Fable 5.1을 코딩, 지식 업무, 장기 실행 문제를 위한 모델로 제시한다. Willison의 펠리컨 테스트는 이런 역량이 명확한 물리적 제약을 지닌 작은 시각적 프로그래밍 작업과 만날 때 어떤 일이 벌어지는지 살핀다.
이 결과는 Anthropic의 공식 평가를 대체하지 않는다. 대신 그 이면의 절충을 압축해서 보여준다. Fable 5.1은 자신의 작업을 점검하고 수정하며 개선할 수 있지만, 더 많은 추론이 일관된 향상으로 이어지지는 않는다. 최상의 출력은 훨씬 높은 계산 노력을 들였을 때 나왔고, 낮은 설정에서는 눈에 띄는 숙고가 거의 나타나지 않았다.
Anthropic은 계속 작업하도록 설계된 모델을 출시했다
Claude Fable 5.1은 하나의 프롬프트에 빠르게 답하는 것보다, 세부 요소가 맞물릴 때까지 작업을 지속하는 데 더 초점이 맞춰져 있다.
Anthropic은 2026년 9월 1일 Claude Fable 5.1과 Claude Mythos 5.1을 공개했다. 회사는 두 모델이 서로 다른 안전장치를 적용한 동일한 기반 모델이라고 설명한다. Fable은 일반적으로 이용할 수 있는 반면, Mythos는 승인된 연구 프로그램으로 접근이 제한된다.
회사의 출시 자료는 코딩, 연구, 장기 지식 업무에 초점을 둔다. Anthropic은 Fable 5.1이 피상적인 수정에 그치지 않고, 자신의 작업을 점검하며, 수시간 또는 여러 애플리케이션에 걸친 프로젝트에서도 효과를 유지한다고 말한다.
이런 주장은 많은 현재 AI의 실패가 유망한 출발 이후에 발생한다는 점에서 중요하다. 모델은 그럴듯한 계획을 작성하고 작동하는 코드를 생성할 수 있지만, 이후 수정 과정에서 제약 조건을 놓칠 수 있다. 장기 실행 성능은 상태를 유지하고, 중간 결과를 테스트하며, 이전 작업을 훼손하지 않고 오류를 바로잡는 능력에 달려 있다.
Anthropic의 벤치마크 결과는 여러 기존 테스트에서 중간 수준의 향상을 보여준다. 가장 큰 폭의 개선은 터미널 환경을 통해 완료하는 과학 작업 평가인 Terminal-Bench-Science 0.1에서 보고됐다.
Fable 5.1은 Anthropic의 설정에서 52.6%를 기록했다. 회사는 동일한 비교에서 Fable 5가 24.7%, Opus 5가 29.0%, GPT-5.6 Sol이 22.4%였다고 밝혔다. Anthropic은 각 모델의 표준오차도 3.5~4.5%포인트라고 공개했다.
다른 결과의 변화 폭은 더 작았다. Fable 5.1은 Terminal-Bench 4.0에서 55.8%를 기록했으며, Fable 5는 42.0%였다. AutomationBench에서는 31.4%를 기록했고, Fable 5는 17.1%였다.
이는 회사가 보고한 수치이지, 모델 품질의 보편적 척도는 아니다. Anthropic은 안전장치가 일부 평가 작업에 영향을 미쳤다고도 언급한다. 특정 플래그가 지정된 요청에는 0점이 부여됐고, 다른 요청은 서로 다른 Claude 모델로 전달됐다.
이 공개는 직접 비교를 복잡하게 만든다. 벤치마크는 기반 모델, 배포된 안전 시스템, 에이전트 하니스 또는 이 세 요소의 조합을 측정할 수 있다. 기업 사용자는 결합된 제품을 접하므로, 이런 운영 세부 사항도 성능 논의에 포함돼야 한다.
Anthropic의 초기 고객들은 이를 뒷받침하는 사례를 제공했다. MongoDB는 모델이 며칠에 걸쳐 프로토타입을 구축하기 전에 자사 서비스와 문서를 조사했다고 밝혔다. Millennium은 이전 모델들이 원인을 놓친 뒤 Fable 5.1이 드문 충돌을 외부 라이브러리까지 추적했다고 말했다.
이 보고들은 유용하지만, 선정된 출시 파트너들로부터 나온 것이다. 이는 성공적인 배포가 어떤 모습일 수 있는지를 보여줄 뿐, 모든 코드베이스나 워크플로 전반의 평균 결과를 뜻하지는 않는다.
Willison의 펠리컨은 평가 스펙트럼의 정반대에 놓인다. 기업 시스템도, 연구실도, 방대한 문서 모음도 없다. 그 가치는 모델의 행동을 눈에 보이게 만든다는 데 있다.
Simon Willison이 여전히 모델에게 펠리컨을 그리게 하는 이유
펠리컨 프롬프트는 작업이 사소하게 들리더라도, 성공하려면 많은 작은 관계가 동시에 맞아떨어져야 한다는 점에서 가치가 있다.
Willison은 언어 모델에 자전거를 타는 펠리컨의 SVG를 생성해 달라고 반복해서 요청해 왔다. SVG는 텍스트 기반 이미지 형식이므로, 언어 모델은 구조화된 마크업과 그리기 지시문을 작성해 그림 전체를 만들 수 있다.
그럴듯한 결과를 내려면 알아볼 수 있는 바퀴, 자전거 프레임, 핸들바, 페달, 펠리컨이 필요하다. 좋은 결과는 이 요소들을 올바르게 연결해야 한다. 새의 발은 페달에 닿아야 하고, 날개는 핸들바에 닿아야 하며, 몸은 프레임 위에 놓여야 한다.
이런 관계는 계획 능력과 공간적 일관성을 압축적으로 시험한다. 모델은 유효한 SVG 코드를 생성하면서도 실제 장면 구현에는 실패할 수 있다. 연결되지 않은 다리, 잘못 배치된 바퀴, 불가능한 관절, 또는 자전거 위에 그저 떠 있는 동물을 그릴 수도 있다.
이 테스트는 초기 개선을 쉽게 확인할 수 있었기 때문에 인기를 얻었다. 더 나은 모델은 대체로 더 깔끔한 코드, 더 일관된 기하 구조, 더 높은 프롬프트 준수도를 보였다. 하나의 이미지는 긴 벤치마크 보고서가 종합 점수 뒤에 감출 수 있는 오류를 드러낼 수 있었다.
Willison은 이후 그 연관성에 대해 확신이 줄었다. 그는 7월 재평가에서 펠리컨 품질이 더는 과거만큼 일반적인 모델 품질을 안정적으로 추적하지 않는다고 주장했다. 이미지 제작 스타일, 학습 선호도, 추론 설정이 결과에 점점 더 큰 영향을 미쳤다.
이 한계는 벤치마크의 목적을 바꾼다. 한 모델이 다른 모델보다 보편적으로 우수하다고 선언하기에는 약한 근거다. 그러나 비슷한 조건에서 관련 모델, 추론 수준, 반복 실행을 비교하는 데는 여전히 유용하다.
Claude Fable 5.1 실험은 이처럼 더 좁은 접근을 따른다. Willison은 낮음, 중간, 높음, 매우 높음, 최대의 다섯 가지 추론 설정을 시험했다. Fable 5.1에는 추론을 완전히 끄는 설정이 없었다.
낮은 노력 설정에서 모델은 깔끔하고 알아볼 수 있는 일러스트레이션을 생성했다. Willison이 기록한 트랜스크립트에는 요약된 추론이 표시되지 않았지만, 응답에는 1,998개의 출력 토큰이 포함됐고 23.8초가 걸렸다.
중간 노력 설정도 비슷하게 작동했다. 출력은 1,977개 토큰을 사용했고 23초가 걸렸으며, 역시 추론 요약은 표시되지 않았다. 최종 이미지는 낮은 설정 결과에 비해 뚜렷한 이점을 보이지 않았다.
높은 노력 설정에서야 작은 계획 흔적이 드러났다. 모델은 자전거, 펠리컨, 배경, 바퀴, 몸의 배치를 포함해 의도한 장면을 설명했다. 2,612개의 출력 토큰을 사용했고 29.6초 만에 완료됐다.
눈에 보이는 개선은 여전히 제한적이었다. 이 결과는 추론 제어 기능이 흔히 단순한 품질 조절 다이얼처럼 제시된다는 점에서 중요하다. 이 실험에서 낮음에서 높음으로 이동한 것은 비례하는 향상을 만들지 못했다.
매우 높은 설정은 행동을 극적으로 바꿨다. 모델은 36,767개의 출력 토큰을 생성했고 7분 51초 동안 작업했다. 추론은 새의 비율, 발, 페달, 날개 위치, 시각적 특성을 다뤘다.
최대 노력 설정은 이 과정을 더 연장했다. 65,927개의 출력 토큰을 사용했고 13분 54초가 걸렸다. Willison은 이 결과를 Anthropic 모델에서 본 펠리컨 가운데 최고라고 평가했다.
이미지에는 파란 헬멧, 물고기 바구니, 일관된 자전거, 그리고 새와 기계 사이를 더 세심하게 연결한 접점이 포함됐다. 시각적 세부 요소는 한 번에 생성한 결과라기보다 반복적인 점검을 반영했다.
이 진행 과정이 실제 실험이다. 프롬프트는 안정적으로 유지된 반면, 모델이 활용할 수 있는 숙고의 양은 바뀌었다. Fable 5.1은 단순히 더 높은 설정마다 더 나은 펠리컨을 그린 것이 아니다. 최상단 근처에서 다른 작업 모드로 넘어갔다.
Anthropic Simon 테스트가 드러내는 노력 격차
최고의 펠리컨은 더 강한 자기 수정 능력을 보여주지만, 품질이 추론 노력에 얼마나 급격히 의존할 수 있는지도 드러낸다.
anthropic simon 테스트는 하나의 모델 계열 안에서 비교할 때 가장 많은 정보를 제공한다. 낮음, 중간, 높음 설정은 눈에 띄는 차이가 제한적인 수용 가능한 일러스트레이션을 만들었다. 매우 높음과 최대 설정은 훨씬 긴 추론과 더 의도적인 수정을 촉발했다.
최대 노력 설정에서 모델은 그려야 할 객체를 나열하는 데 그치지 않았다. 그 객체들이 어떻게 상호작용해야 하는지도 고려했다. 추론 흔적은 헬멧 배치, 부리 겹침, 깃털 모양, 핸들바 세부 요소, 자전거 앞 포크의 곡선을 검토했다.
이 행동은 반복적인 디자인 검토와 닮았다. 모델은 구조를 생성하고, 있을 법한 결함을 점검한 뒤, 개별 구성 요소를 조정했다. 또한 불필요한 추가 요소가 명확성을 해칠 때는 이를 거부했다.
한 추론 흔적은 자전거 헬멧이 펠리컨의 알아보기 쉬운 볏을 방해할 수 있다는 이유로 이를 재고하는 모습을 보였다. 또 다른 흔적은 포크의 잘못된 곡선을 찾아내고, 방향을 개선하기 위해 제어점을 바꿨다.
이 결정들은 작지만, 더 큰 역량을 보여준다. 유용한 장기 실행 에이전트는 자신의 첫 시도가 그저 그럴듯할 뿐임을 감지해야 한다. 이어 약점을 분리해 내고, 다른 모든 것을 불안정하게 만들지 않으면서 수정해야 한다.
이 메커니즘은 펠리컨 테스트를 실제 코딩 작업과 연결한다. 소프트웨어 에이전트는 기본 테스트를 통과하지만 아키텍처 제약을 위반하는 기능을 만들 수 있다. 연구 에이전트는 하나의 가정이 결론을 훼손한다는 사실을 알아차리기 전에 분석을 완료할 수 있다.
더 어려운 문제는 더 많은 텍스트를 생산하는 것이 아니다. 적절한 점검에 추가 계산을 투입하는 일이다. Fable 5.1의 최대 설정 흔적은 적어도 이 시각적 코딩 작업 안에서는 해당 행동의 진전을 시사한다.
그러나 이 실험은 고르지 않은 노력 곡선도 드러낸다. 중간 설정은 더 높은 설정임에도 낮음보다 의미 있게 뛰어나지 않았다. 높음은 일부 계획을 추가했지만 이미지를 변모시키지는 못했다. 눈에 보이는 향상의 대부분은 훨씬 뒤에 나타났다.
따라서 개발자는 모든 추론 단계가 동일한 품질 향상을 가져온다고 가정하지 말아야 한다. 어떤 작업은 추가 노력이 거의 변화를 만들지 않는 임계값 아래에 머물 수 있다. 다른 작업은 모델이 반복 점검을 수행할 충분한 여유가 있을 때만 이점을 얻을 수 있다.
이는 평가 과제를 만든다. 팀이 기본 설정만 시험하면 모델의 실제 역량을 과소평가할 수 있다. 최대 노력 설정만 시험하면 일반적인 사용에는 지나치게 느린 구성을 측정하게 될 수 있다.
Anthropic은 Fable 5.1이 Claude Code에서 기본적으로 높은 노력 설정을 사용하며, 다른 Claude 인터페이스에서는 중간 설정을 사용한다고 말한다. Willison의 결과는 인터페이스 기본값이 사용자의 모델 인상 전체를 형성할 수 있음을 시사한다.
이 테스트는 출력 품질과 운영 효율성도 구분한다. 최대 설정의 펠리컨은 더 좋았지만, 낮은 노력 버전보다 훨씬 더 많은 토큰과 시간이 필요했다. 특정 가격을 논의하지 않는 기사에서도 이 절충은 중요하다.
장기 실행 에이전트는 계획을 세우고, 파일을 점검하고, 도구를 호출하고, 테스트를 실행하고, 작업을 수정하는 동안 컴퓨팅 자원을 소비한다. 어려운 작업이라면 성공적인 결과가 그 노력을 정당화할 수 있다. 하지만 일회용 일러스트레이션이나 일상적인 변환 작업에는 같은 과정이 과도할 수 있다.
실질적인 질문은 최대 추론이 좋은지 여부가 아니다. 추가 작업이 결정을 바꾸는지, 이후 검토를 줄이는지, 또는 비용이 큰 실수를 막는지 여부다.
그러한 구분은 Anthropic과 경쟁사들에 압박을 가한다. OpenAI, Google 및 기타 모델 제공업체들은 점점 더 추론 제어 기능을 노출하거나 연산 자원을 자동으로 배분하고 있다. 구매자들은 이러한 제어 기능이 업무 가치와 명확히 연결된다는 증거를 원한다.
펠리컨 사례는 그 연결이 여전히 불규칙함을 시사한다. 더 높은 레이블이 눈에 띄게 더 나은 결과를 보장하지는 않으며, 최상위 설정은 실질적으로 다른 제품처럼 작동할 수 있다.
과학 벤치마크가 판돈을 높인다
Anthropic의 과학 점수는 Fable 5.1을 중요하게 만들지만, 펠리컨 사례는 그 점수가 운영 맥락을 필요로 하는 이유를 설명한다.
Terminal-Bench-Science 0.1은 에이전트가 터미널 환경에서 수행하는 과학 워크플로를 중심으로 설계됐다. 이 작업들은 생물학, 화학, 물리학, 지구과학, 수학, 공학 등 다양한 분야를 다룬다.
과학 벤치마크는 Fable 5.1 직전에 출시됐다. 과학자들이 기여한 70개 과제로 구성되며, 결과는 통제된 환경 안에서 검증할 수 있다.
이러한 구조는 일러스트레이션을 평가하는 것보다 더 엄격하다. 과제는 에이전트가 소프트웨어를 탐색하고, 데이터를 조작하며, 과학 도구를 사용하고, 검증 가능한 결과에 도달하도록 요구한다. 실제 연구 업무의 일부를 닮도록 설계됐다.
Anthropic의 52.6% 결과가 눈길을 끄는 이유는 Fable 5에 대해 보고한 24.7% 점수를 두 배 이상 높였기 때문이다. 그 격차는 공개된 표준오차보다도 훨씬 크다.
다만 이 비교에는 여전히 주의가 필요하다. Anthropic은 자체 평가 설정을 사용해 이전 모델의 결과를 재현했다. 공개 리더보드에서는 Opus 5가 30.0%, Fable 5가 21.4%를 기록했지만, Anthropic은 각각 29.0%와 24.7%로 측정했다.
회사는 이러한 차이가 예상 가능한 통계적 잡음 범위에 있다고 말한다. 그럼에도 독자들은 공개 리더보드 실행 결과와 공급업체가 직접 수행한 비교를 구분해야 한다.
새 벤치마크는 축적된 이력도 제한적이다. 연구자들은 개발자들이 이 과제를 중심으로 프롬프트, 하니스, 도구를 얼마나 빠르게 최적화하는지 아직 관찰하지 못했다. 벤치마크 향상과 측정 가능한 과학적 산출물을 연결하는 장기 기록도 부족하다.
그렇다고 이 결과가 중요하지 않다는 뜻은 아니다. 이는 확정된 결론이 아니라 초기 신호라는 의미다.
공식 벤치마크와 펠리컨 테스트는 서로 다른 것을 측정한다. Terminal-Bench-Science는 에이전트가 정해진 과학 워크플로를 완료하는지 묻는다. 펠리컨은 모델이 눈에 보이는 제약 조건 문제를 해결하는 동안 어떻게 노력을 배분하는지 드러낸다.
두 결과를 함께 보면 더 좁은 결론을 뒷받침한다. Fable 5.1은 지속적인 도구 기반 작업에 더 뛰어난 것으로 보이며, 중간 결과를 점검할 수 있을 만큼 충분한 연산이 주어질 때 가장 강한 행동을 보인다.
Anthropic은 벤치마크 외에도 여러 과학 사례를 제시한다. 회사는 자사 모델이 단백질 결합체, 행성 지도화, 생물학 모델용 GPU 최적화 작업에 활용됐다고 말한다. 이러한 주장은 모델 출력과 외부 도구를 결합하며, 일부 사례에서는 실험실 검증도 포함한다.
회사는 또한 Fable 5.1이 금성의 3분의 1을 덮는 더 높은 해상도의 고도 지도를 생성한 신경망을 훈련했다고 말한다. Anthropic에 따르면 이 지도는 기존 10~20km 대신 2~3km 수준의 세부 정보를 식별한다.
이러한 사례는 단발성 프롬프트보다 더 면밀한 검토를 받을 만하다. 과학적 결과는 데이터 선택, 도구 구성, 검증 방법, 인간의 감독에 좌우된다. 모델은 발견 과정 전체를 책임지지 않더라도 중요한 작업을 수행할 수 있다.
이 구분은 기업 도입에 중요하다. 구매자가 배포하는 것은 벤치마크 점수가 아니다. 권한, 독점 데이터, 검토자, 예산, 안전장치, 실패 절차를 갖춘 시스템 안에 모델을 배포하는 것이다.
가장 강력한 증거는 팀이 완료율, 수정 시간, 인간 검토 요건을 비교할 수 있는 반복 워크플로에서 나올 것이다. 더 높은 점수를 받더라도 광범위한 검증을 요구하는 모델은 예상보다 적은 가치를 만들 수 있다.
반대로 해결하기 어려운 오류를 막는다면 더 느린 모델도 가치가 있을 수 있다. Anthropic의 출시 파트너들은 드문 실패, 여러 서비스에 걸친 코드 변경, 무인 연구와 관련된 사례를 강조한다. 바로 추가 추론이 그럴듯한 수익을 낼 수 있는 경우들이다.
과학 벤치마크는 새로운 에이전트형 평가에서 눈에 띄는 선두를 확립했다는 점에서 OpenAI와 Google에 압박을 높인다. 그러나 더 큰 경쟁은 하나의 리더보드가 아니다. 모델이 확장된 추론을 신뢰할 수 있고 감사 가능한 작업으로 전환할 수 있는지가 핵심이다.
펠리컨이 증명하지 못하는 것
완성도 높은 SVG는 하나의 성공적인 실행을 보여주는 증거일 뿐, Claude Fable 5.1이 무관한 과제 전반에서 안정적으로 추론한다는 증거는 아니다.
첫 번째 한계는 표본 크기다. Willison은 다섯 가지 노력 설정에 걸친 하나의 시퀀스를 보여줬다. 프롬프트와 구성이 동일해도 모델 출력은 실행마다 달라질 수 있다.
더 강한 비교를 하려면 각 설정을 여러 번 반복해야 한다. 그러면 검토자는 물리적 일관성, 코드 유효성, 시각적 품질, 실행 시간, 출력 길이를 평가할 수 있다. 이를 통해 최대 설정의 결과가 전형적인지, 아니면 유난히 뛰어났는지 알 수 있다.
두 번째 한계는 주관적 판단이다. 대부분의 시청자는 최대 설정의 펠리컨이 더 완성도 높아 보인다는 데 동의할 수 있지만, 시각적 매력은 하나의 측정 가능한 속성이 아니다. 어떤 사람은 미니멀한 일러스트레이션을 선호하고, 다른 사람은 장식적 디테일을 높게 평가할 수 있다.
세 번째 한계는 오염이다. 펠리컨 프롬프트는 오랫동안 공개적으로 유통됐다. 모델 개발자들은 사례를 볼 수 있으며, 관련 이미지는 학습 또는 평가 데이터에 포함됐을 수 있다.
Anthropic이 이 프롬프트를 위해 Fable 5.1을 명시적으로 최적화했다는 증거는 없다. 그럼에도 많은 출력과 토론이 공개된 뒤에는 익숙한 테스트가 독립적 척도로서 덜 유용해진다.
Willison도 이 벤치마크와 일반적인 모델 품질 간의 관계가 약해졌음을 이미 인정했다. 남아 있는 가장 좋은 용도는 통제된 비교이며, 특히 한 공급업체의 모델 제품군 내부 비교에 적합하다.
네 번째 한계는 눈에 보이는 추론에 관한 것이다. 추론 요약이 없다고 해서 모델이 내부 추론을 전혀 하지 않았다는 의미는 아니다. 제품은 추적 정보를 숨기거나, 압축하거나, 선택적으로 표시할 수 있다.
Willison은 낮음과 중간 설정이 추론을 건너뛰는 듯 보였다고 신중하게 표현했다. 이러한 보도상의 구분은 유지돼야 한다. 기록된 인터페이스 동작은 관찰할 수 있지만, 모델의 내부 과정은 완전히 공개되지 않는다.
다섯 번째 한계는 긴 추적이 잘못된 확신을 줄 수 있다는 점이다. 많은 세부 사항을 논의하는 모델도 기본적인 실수를 할 수 있다. 더 많은 숙고는 오류 탐지를 개선할 수 있지만, 불필요한 수정으로 이어지거나 결함 있는 접근 방식을 합리화할 수도 있다.
애니메이션 후속 사례는 이 위험을 눈에 보이게 한다. Hacker News 요청은 완성된 펠리컨에 애니메이션을 넣을 수 있는지 물었다. Willison은 최대 설정으로 생성된 SVG를 Fable 5.1에 다시 입력하고, 높은 노력 설정에서 애니메이션을 적용하라고 지시했다.
모델은 26,201개의 출력 토큰을 사용해 애니메이션 버전을 만들었다. Willison은 원본 SVG는 올바르게 보였지만, 비디오로 변환한 뒤 바퀴가 반대 방향으로 회전하는 것처럼 보였다고 언급했다.
이 후속 사례는 단순한 농담 이상이다. 모델이 작동하는 산출물을 보존하면서 동작을 추가할 수 있는지 시험한다. 이는 새 기능이 원래 구현에는 없던 문제를 드러낼 수 있는 소프트웨어 유지보수와 닮아 있다.
Willison의 전체 펠리컨 실험 역시 최종 산출물은 직접 점검해야 하는 이유를 보여준다. 유효한 SVG, 일관된 추론 추적, 성공적인 애니메이션 명령이 모든 시각적 관계가 내보내기 과정에서도 유지됐음을 보장하지는 않는다.
여섯 번째 한계는 벤치마크 정렬에서 비롯된다. 펠리컨은 주로 SVG 생성, 공간적 관계, 반복적 디자인을 시험한다. 사실 신뢰성, 보안 판단, 과학적 판단, 비공개 기업 데이터 성능에 대해서는 거의 말해주지 않는다.
Anthropic의 공식 평가는 이들 영역 일부를 다루지만, 많은 결과는 여전히 공급업체 보고에 기반한다. 출시 파트너의 추천사 역시 통제된 실패율이 아니라 선별된 성공 사례를 설명한다.
그로 인해 중요한 검증 공백이 남는다. Fable 5.1은 더 지속적인 작업을 수행할 수 있는 듯 보이지만, 팀은 여전히 자체 과제로 구축한 독립적 테스트가 필요하다. 모델의 최고의 세션이 얼마나 인상적인지가 아니라, 얼마나 자주 정확하게 완료하는지를 측정해야 한다.
유용한 평가는 모호한 요구사항, 도구 실패, 오래된 문서, 적대적 콘텐츠를 포함해야 한다. 장시간 실행되는 에이전트는 목표를 조용히 바꾸지 않으면서 이러한 조건을 처리해야 한다.
따라서 핵심 긴장은 여전히 해결되지 않았다. Fable 5.1은 출력물을 개선하는 데 훨씬 더 긴 시간을 쓸 수 있지만, 사용자는 그 노력이 정당한 때와 모델이 멈춰야 할 때를 판단할 신뢰할 수 있는 방법이 필요하다.
Fable 5.1의 성과를 보여줄 세 가지 신호
다음 시험대는 Fable 5.1의 벤치마크와 데모 성과가 반복 실행, 실제 워크플로, 경쟁 압력 속에서도 유지되는지다.
첫 번째 신호는 Terminal-Bench-Science 0.1의 독립적 재현이다. 연구자들은 문서화된 하니스와 비교 가능한 도구 접근 권한을 사용해 여러 차례의 시험에서 Fable 5.1을 실행해야 한다.
Anthropic의 52.6% 수치에 근접한 결과가 나온다면 회사의 주장은 더 강해질 것이다. 공개 점수가 실질적으로 더 낮다면, 평가 설정, 프롬프팅 또는 비공개 구성이 헤드라인이 시사하는 것보다 더 크게 기여했음을 뜻할 수 있다.
실행 간 분산도 중요하다. 평균 성능은 좋지만 예측 불가능하게 실패하는 모델은 약간 낮더라도 더 안정적인 결과를 내는 모델과 다른 운영 프로필을 제시한다.
두 번째 신호는 개발자와 기업 팀의 업무 수준 증거다. 가장 드러나는 지표에는 성공적인 완료율, 검토 시간, 수정된 결함, 중단된 실행, 인간 개입 빈도가 포함될 것이다.
팀은 동일한 내부 과제에서 높은 추론과 최대 추론을 비교해야 한다. 또한 추가 노력이 아무것도 바꾸지 않거나 결과를 더 나쁘게 만드는 사례도 기록해야 한다.
그러한 증거는 anthropic simon 노력 격차를 운영상의 질문으로 바꿀 것이다. 최대 추론이 비용이 큰 실패를 일관되게 막는다면, 더 긴 실행 시간은 정당화될 수 있다. 향상이 선별된 데모에서만 나타난다면 최상위 설정은 여전히 정당화하기 어려울 것이다.
세 번째 신호는 경쟁 모델이 어떻게 대응하는지다. Anthropic의 과학 비교에서 OpenAI의 GPT-5.6 Sol은 Fable 5.1에 뒤처지는 반면, Google의 모델들은 시각적으로 표현력 있는 SVG 생성에서 여전히 강세를 보인다.
경쟁사는 여러 방식으로 대응할 수 있다. 공개 과학 리더보드에서 Fable을 능가하거나, 자동 추론 배분을 개선하거나, 비슷한 결과에 필요한 시간을 줄이거나, 더 강력한 독립 워크플로 평가를 공개할 수 있다.
가장 의미 있는 대응은 품질과 예측 가능성을 결합하는 것이다. 개발자에게 필요한 것은 단지 놀라운 산출물을 만들 수 있는 모델이 아니다. 과제가 얼마나 많은 노력을 받았는지, 시스템이 왜 멈췄는지를 알려주는 제어 기능이 필요하다.
지식 노동자에게도 같은 원칙이 적용된다. 더 긴 답변이 반드시 더 좋은 답변은 아니다. 유용한 시스템은 증거를 확인하고, 누락된 제약을 포착하며, 불확실성을 명확히 드러내는 시스템이다.
anthropic simon pelican 테스트는 Claude Fable 5.1에 기억에 남는 시연을 제공하지만, 그 교훈은 벤치마크가 해결됐다는 것이 아니다. 지속적인 자체 검토가 이제 눈에 띄게 더 나은 작업을 만들어내지만, 그 검토의 비용은 여전히 고르지 않다는 점이다.
개발자는 직접 점검할 수 있는 산출물과 이미 이해하고 있는 실패 사례로 모델을 시험해야 한다. 동일한 작업을 여러 노력 수준에서 실행하고, 최종 결과를 비교하며, 추가 추론이 결과를 바꾸는 지점을 기록해야 한다.
다음으로 설득력 있는 시연은 또 하나의 완벽한 새가 되어서는 안 됩니다. Fable 5.1이 매번 최대한의 노력을 요구하지 않으면서도 반복적이고 중요한 작업 전반에 걸쳐 같은 수준의 세심한 수정 작업을 제공할 수 있음을 보여줘야 합니다.



