top of page

Anthropic Claude, Claude Code 시스템 프롬프트의 80%를 줄이며 ‘규칙이 많을수록 좋다’는 접근에 도전

7월 26일
12분 분량

Anthropic Claude는 최신 모델을 위해 Claude Code의 시스템 프롬프트를 80% 이상 제거했지만, 내부 코딩 평가에서 측정 가능한 성능 저하는 없었다고 밝혔다. 7월 24일 변경은 Claude Opus 5와 Claude Fable 5를 포함한 고급 모델에 적용된다. 이는 AI 에이전트에 관한 익숙한 가정을 뒤집는다. 더 상세한 지시가 언제나 더 신뢰할 수 있는 행동으로 이어지는 것은 아니다.

Anthropic은 이전 Claude Code 버전이 부실한 주석, 원치 않는 문서, 안전하지 않은 파일 작업을 막기 위해 명시적 규칙을 필요로 했다고 설명한다. 이러한 보호 장치는 시스템 프롬프트, 프로젝트 지침, 스킬, 도구 설명, 메모리, 개별 사용자 요청 전반에 걸쳐 누적됐다. 그 결과 컨텍스트에는 중복되거나 서로 충돌하는 지시가 포함될 수 있었다.

이제 Claude 5 context engineering은 다른 전제에서 출발한다. Anthropic은 팀이 성능 좋은 모델에 판단의 여지를 주고, 더 명확한 인터페이스를 설계하며, 전문화된 지침은 필요한 때에만 불러오기를 원한다. 핵심 경쟁은 더 이상 Anthropic과 다른 모델 제공업체 간의 대결이 아니다. 규범적 프롬프팅과 선택적 컨텍스트의 대결이다.

이 구분은 Claude Code를 넘어 중요하다. 개발자들은 리포지터리를 읽고, 도구를 호출하고, 파일을 편집하고, 코드를 검토하며, 긴 세션 동안 상태를 유지하는 에이전트를 만들고 있다. 모든 상시 지침은 작업 내용, 현재 파일, 도구 결과, 사용자 의도와 주의를 두고 경쟁한다.

다만 회사의 근거는 여전히 제한적이다. Anthropic은 “측정 가능한 성능 저하 없음”이라는 주장에 근거한 평가 스위트, 기준 점수, 작업 분포, 모델별 결과를 공개하지 않았다. 80% 축소는 의미 있지만, 실질적인 적용 범위는 여전히 독립적인 검증이 필요하다.

Anthropic Claude가 한때 필수로 보였던 규칙을 제거했다

당장의 변화는 더 큰 컨텍스트 윈도우가 아니다. 상시 지침 계층이 훨씬 작아졌다는 점이다.

Anthropic은 context engineering을 사용자의 즉각적인 프롬프트 외에 모델이 받는 모든 것을 구성하는 일로 설명한다. 여기에는 시스템 지침, 프로젝트 파일, 스킬, 메모리, 도구 정의, 대화 기록, 검색된 참고 자료가 포함된다.

시스템 프롬프트는 대화 전반에 걸쳐 에이전트의 행동을 형성하는 초기 지침 집합이다. 행동 방식, 도구 사용, 응답 스타일, 보안 경계, 실행 환경에 관한 가정을 정의할 수 있다.

Anthropic의 context engineering guidance에 따르면, 이 회사는 Opus 5와 Fable 5용 Claude Code 시스템 프롬프트의 80% 이상을 삭제했다. 이후 코딩 평가에서 측정 가능한 성능 저하가 나타나지 않았다고 설명한다.

이 발표는 지침이 불필요해졌다는 뜻은 아니다. 대신 상시 규칙과 다른 위치에 있어야 할 정보를 구분한다. 보안 경계, 권한, 도구 계약, 명시적인 사용자 요구사항은 여전히 분명하게 표현될 필요가 있다.

바뀐 것은 그러한 지침의 기본 배치 방식이다. Anthropic은 이전에는 상세한 코딩, 검토, 문서화, 검증 행동을 메인 프롬프트에 넣었다. 해당 지침은 특정 작업에 필요하지 않을 때도 모델과 함께했다.

이전 규칙 중 일부는 좁은 범위의 실패 모드를 제어하려는 목적도 있었다. Anthropic은 요청이 없는 한 여러 문단으로 된 docstring과 계획 문서를 피하라고 Claude에 지시했던 과거 규칙을 예로 든다. 이 규칙은 원치 않는 출력을 줄였지만, 복잡한 코드에서 유용한 문서화를 저해하기도 했다.

대체 지침은 더 짧고 더 맥락적이다. Claude는 주변 코드의 주석 밀도, 명명 방식, 관용구에 맞춰야 한다. 하나의 보편적 출력 패턴을 규정하는 대신, 관련 기준을 어디에서 찾아야 하는지 모델에 알려준다.

이 변화는 이 글의 핵심 긴장을 만든다. 상세한 규칙은 행동이 눈에 보이고 테스트 가능하기 때문에 더 안전해 보일 수 있다. 그러나 리포지터리, 사용자 요청, 또는 작업이 예외를 요구할 때 모든 경직된 지침은 잘못될 수 있다.

Claude Code는 여러 겹치는 채널을 통해서도 지침을 받는다. 사용자는 적절한 문서화를 요청할 수 있지만, 전역 규칙은 주석을 억제할 수 있다. 한 스킬은 검증을 요구하는 반면, 다른 파일은 에이전트에 추가 작업을 최소화하라고 지시할 수 있다.

모델은 실제 엔지니어링 문제를 다루기 전에 이러한 충돌을 해결해야 한다. 따라서 더 많은 텍스트는 유용한 지식을 단순히 추가하는 것이 아니라 또 하나의 추론 과제를 만든다.

Anthropic은 이 문제에 대응하기 위한 진단 기능도 추가했다. 회사는 /doctor 명령어가 사용자가 스킬과 CLAUDE.md 파일을 적절한 규모로 조정하는 데 도움이 될 수 있다고 말한다. 이 파일들은 리포지터리 규칙과 반복 지침을 포함한 지속적인 프로젝트 컨텍스트를 제공한다.

실무적 메시지는 “프롬프트를 삭제하라”보다 더 좁다. 팀은 어떤 정보가 실제로 모든 요청에 적용되는지 식별해야 한다. 나머지는 더 정확한 트리거, 위치, 또는 전달 메커니즘이 필요하다.

Claude 5 Context Engineering이 선택적 컨텍스트를 선호하는 이유

Anthropic은 더 나은 모델 판단이 상시적인 행동 미세 관리의 가치를 낮춘다는 데 베팅하고 있다.

기존 접근법에는 이유가 있었다. 이전 코딩 모델은 과도한 주석을 만들고, 불필요한 계획 파일을 생성하며, 도구를 잘못 다루거나, 예시를 지나치게 문자 그대로 따르는 일이 잦았다. 상세한 지침은 가능한 행동의 범위를 좁혔다.

그러한 제한에는 대가가 따랐다. 흔한 실패 하나를 막는 것이 이례적인 작업에 대한 올바른 대응을 가로막을 수 있었다. 긴 주석을 금지하면 일상적인 편집은 개선될 수 있지만, 복잡한 알고리즘이나 보안에 민감한 코드 작업에는 해가 될 수 있다.

Claude 5 context engineering은 그 결정을 작업에 더 가깝게 옮긴다. 모델은 사용자 요청을 받고, 인근 코드를 살피며, 지역적 규칙을 적용한다. Anthropic은 시스템이 원래 목적을 다한 제약을 제거한다는 의미에서 이를 Claude의 “unhobbling”이라고 부른다.

이 표현을 무제한 자율성으로 오해해서는 안 된다. Claude Code는 여전히 도구, 권한, 컨텍스트, 실행을 관리하는 주변 소프트웨어인 하니스 안에서 작동한다. Anthropic은 그 하니스 안의 한 계층을 단순화하고 있다.

회사는 여러 “과거와 현재”의 변화를 제시한다. 규칙은 판단으로, 도구 예시는 표현력 있는 인터페이스로, 사전 지침은 점진적 공개로, 반복은 간결한 도구 설명으로 바뀐다.

점진적 공개는 모든 정보를 초기 컨텍스트에 넣는 대신, 작업이 요구할 때 상세 정보를 불러오는 것을 뜻한다. Claude Code는 이제 코드 검토와 검증 같은 영역에 전용 스킬을 사용한다.

이 접근법은 지속적인 주의 비용을 부과하지 않으면서 접근성을 유지한다. 검토 절차는 상세하게 남을 수 있지만, Claude는 검토를 수행할 때 이를 불러온다. 일상적인 파일 편집에 전체 절차가 따라붙을 필요는 없다.

Claude Code는 도구에도 같은 원칙을 적용한다. 일부 도구는 지연 로딩을 사용해 처음에는 가벼운 설명만 노출한다. 전체 스키마는 에이전트가 검색을 통해 해당 도구를 선택한 뒤에만 나타난다.

Anthropic의 context window guide는 이 구분이 중요한 이유를 보여준다. 프로젝트 지침, 메모리, 스킬 설명, 파일, 응답, 숨겨진 런타임 콘텐츠는 모두 동일한 작업 컨텍스트를 차지한다.

큰 컨텍스트 용량이 선택 문제를 없애지는 않는다. 모델은 더 많은 토큰을 수용할 수 있어도, 여전히 관련 없거나 오래됐거나 상충하는 자료를 받을 수 있다. 용량은 얼마나 들어가는지를 답할 뿐, 무엇이 주목받을 가치가 있는지는 답하지 않는다.

선택적 컨텍스트는 팀이 리포지터리 지식을 구성하는 방식도 바꾼다. 단일 CLAUDE.md 파일이 모든 엔지니어링 선호도의 백과사전이 되어서는 안 된다. Anthropic은 에이전트가 적절할 때 불러올 수 있는 참조 트리를 권장한다.

이 설계는 좋은 소프트웨어 아키텍처를 닮았다. 안정적인 인터페이스는 작게 유지되고, 전문화된 행동은 명시적 경계 뒤에 위치한다. 에이전트는 시작 시 모든 구현 세부 사항을 받지 않고도 무엇이 존재하는지 알게 된다.

이 모델에서는 도구 정의가 특히 중요해진다. Anthropic은 예시가 모델을 이미 제시된 패턴으로 유도해 탐색을 제한할 수 있다고 주장한다. 명확한 매개변수와 상태 정의는 하나의 경로를 규정하지 않고도 의도를 전달할 수 있다.

Todo 예시는 pending, in progress, completed 같은 열거형 상태를 사용한다. 활성 항목을 하나만 허용하는 제약은 유효한 시스템 상태를 설명한다. 그러면 모델은 해당 인터페이스 안에서 행동을 선택할 수 있다.

이는 에이전트 신뢰성이 자리하는 위치에 관한 의미 있는 변화다. 프롬프트 작성자는 한때 주로 산문을 통해 신뢰성을 인코딩하려 했다. Anthropic은 이제 인터페이스 설계, 컨텍스트 라우팅, 권한, 모델 판단에 더 많은 책임을 부여한다.

진짜 경쟁은 규범적 프롬프팅과 모델 판단 사이에 있다

80% 축소는 관찰된 모든 에이전트 실패에 또 하나의 상시 지침이 필요하다는 믿음에 도전한다.

AI 에이전트 팀은 실수에 대응해 규칙을 추가하는 경우가 많다. 에이전트가 테스트를 건너뛰면 프롬프트에 테스트 요구사항이 추가된다. 관련 없는 파일을 편집하면 또 다른 문단이 범위를 좁힌다. 설명이 지나치게 길면 장황함 제한이 뒤따른다.

이 과정은 래칫을 만든다. 추가는 삭제보다 안전해 보이기 때문에 지침은 계속 쌓인다. 현재 모델, 도구, 워크플로에서 오래된 규칙이 여전히 성능을 개선하는지 정기적으로 테스트하는 팀은 드물다.

Anthropic Claude는 이제 이 래칫이 품질을 낮출 수 있다고 주장한다. 문제는 단지 토큰 소비가 아니다. 상충하는 지침은 모델이 우선순위를 추론하고, 예외를 해석하며, 오래된 보호 장치와 현재 사용자 의도를 조정하도록 만든다.

규범적 프롬프팅은 팀이 이를 감사할 수 있기 때문에 여전히 매력적이다. 보안 검토자는 명시적 금지 조항을 찾을 수 있다. 제품 관리자는 형식 규칙을 가리킬 수 있다. 개발자는 요청에 포함된 텍스트를 재현할 수 있다.

모델 판단은 유연성을 제공하지만 예측하기는 더 어렵다. 일반적으로 최소한의 주석을 선호하더라도 복잡한 함수에는 문서화가 필요하다는 점을 Claude가 인식하게 한다. 같은 재량은 작업마다 일관되지 않은 선택을 낳을 수도 있다.

따라서 Anthropic의 주장을 가장 강하게 뒷받침하는 요소는 모델 역량이다. 역량이 낮은 모델은 여전히 상세한 예시, 반복된 경고, 좁은 규칙을 필요로 할 수 있다. 여러 모델을 혼합해 배포하는 환경에서는 모든 에이전트가 간결한 지침을 똑같이 잘 해석한다고 가정할 수 없다.

이는 여러 세대의 모델을 지원하는 팀에 부담을 만든다. Opus 5나 Fable 5에 맞춰 최적화된 지침은 이전 또는 더 작은 모델에는 행동을 충분히 규정하지 못할 수 있다. 이전 모델용으로 작성된 프롬프트는 최신 모델을 과도하게 제약할 수 있다.

버전별 컨텍스트는 운영상 필수 요건이 된다. 팀은 어떤 규칙이 각 모델에 적용되는지, 평가가 어떻게 바뀌었는지, 공유 지침이 언제부터 가치를 더하지 않게 됐는지를 알아야 한다. 그렇지 않으면 단순화는 또 하나의 검증되지 않은 관행이 된다.

이 변화는 프롬프트 템플릿을 지속 가능한 자산으로 판매하는 기업에도 압박을 가한다. 긴 템플릿은 유용한 전문성을 담을 수 있지만, 길이는 더 이상 완전성을 보여주는 신뢰할 만한 지표가 아니다. 그 가치는 관련성, 라우팅, 측정 가능한 결과에 달려 있다.

맞춤형 에이전트를 구축하는 개발자도 비슷한 선택에 직면한다. Anthropic의 system prompt documentation은 전체 Claude Code 프리셋, 최소 기본값, 완전 맞춤형 지침을 구분한다.

전체 프리셋은 사람이 작업을 지켜보며 방향을 조정하는 코딩 에이전트에 적합하다. 반면 서로 다른 정체성, 인터페이스 또는 권한 모델을 갖춘 에이전트에는 맞춤형 프롬프트가 더 잘 맞는다. Anthropic은 커스텀 빌더가 제거한 모든 안전 지침을 반드시 대체해야 한다고 경고한다.

이 경고는 새로운 플레이북의 경계를 드러낸다. 행동 관련 군더더기를 제거하는 일은 권한을 약화하는 일과 다르다. 간결한 에이전트라도 파괴적 작업, 민감한 데이터, 외부 커뮤니케이션, 무인 실행에 대한 명시적 제한이 필요하다.

팀은 지침을 삭제하기 전에 분류해야 한다. 스타일 선호는 종종 저장소 규칙에 맡길 수 있다. 검증 워크플로는 스킬이 될 수 있다. 권한 경계는 단순히 정중한 문장이 아니라 강제 가능한 소프트웨어에 속해야 한다.

이러한 구분은 업계를 컨텍스트 아키텍처로 이끈다. 핵심 작업은 무엇을 전역으로 유지하고, 무엇을 경로별로 불러오며, 무엇을 작업별로 활성화하고, 무엇을 모델과 독립적으로 소프트웨어가 강제할지 결정하는 일이 된다.

엔지니어링 조직에서 이 아키텍처는 조직의 기억이기도 하다. 저장소 규칙, 의사결정, 기술 참고 자료에는 명확한 소유자와 검색 경로가 필요하다. 검색 가능한 엔지니어링 지식 베이스는 팀이 지속적인 사실과 일시적인 에이전트 지침을 분리하는 데 도움이 될 수 있다.

이 경쟁의 승자는 모든 경우에 “짧은 프롬프트”가 아닐 것이다. 안전성, 작업 충실도, 재현 가능한 성능을 보존하면서도 필요한 최소한의 컨텍스트를 제공하는 시스템이 승리할 것이다.

Claude Code 시스템 프롬프트 결과는 여전히 독립적인 검증이 필요하다

Anthropic의 핵심 결과는 주목할 만하지만, 공개된 근거만으로는 모든 팀이 동일한 80%를 제거할 수 있다고 입증되지 않는다.

회사는 Claude Code 시스템 프롬프트 축소가 코딩 평가에서 측정 가능한 손실을 초래하지 않았다고 말한다. 이 표현은 몇 가지 중요한 질문을 남긴다.

Anthropic은 이 비교에 사용된 평가 작업을 공개하지 않았다. 독자는 해당 평가군이 코드 생성, 디버깅, 저장소 탐색, 테스트, 문서화, 도구 사용 또는 장시간 자율 작업 중 무엇을 중점적으로 다뤘는지 알 수 없다.

회사는 기준 점수나 신뢰 구간도 공개하지 않았다. “측정 가능한 손실 없음”은 동일한 결과, 통계적으로 유의하지 않은 차이 또는 선택한 벤치마크가 감지하기에 너무 작은 변화를 의미할 수 있다.

이 주장은 고급 모델을 위한 Anthropic 내부의 Claude Code 구성에 관한 것이다. 사용자가 자신의 CLAUDE.md 파일, 스킬 또는 맞춤형 에이전트 프롬프트의 80%를 아무런 결과 없이 삭제할 수 있다는 뜻은 아니다.

이 파일들은 조직별 요구 사항을 담는 경우가 많다. 예를 들어 빌드 명령, 규제 대상 워크플로, 리뷰 기준, 의존성 정책, 배포 제한, 그리고 기본 모델이 주변 코드만으로 추론할 수 없는 규칙 등이 있다.

저장소에는 일관되지 않은 패턴도 존재할 수 있다. 주변 코드에 맞춰 달라고 Claude에게 요청하는 방식은 주변 환경이 원하는 표준을 대표할 때 효과적이다. 오래된 규칙과 새로운 규칙이 공존하면 기술 부채를 재현할 수도 있다.

점진적 공개는 그 자체로 실패 모드를 만든다. 에이전트는 특화된 스킬이나 참고 자료가 필요한 시점을 인식해야 한다. 라우팅에 실패하면 올바른 정보가 존재하더라도 활성 컨텍스트에 도달하지 못한다.

지연 로딩 도구도 유사한 의존성을 만든다. 가벼운 설명은 초기 컨텍스트를 절약하지만, 에이전트가 올바른 기능을 발견할 수 있을 만큼 구체적이어야 한다. 이름이 부실한 도구는 사실상 보이지 않게 될 수 있다.

컨텍스트 압축은 상황을 더 복잡하게 만든다. Claude Code는 컨텍스트가 가득 차면 긴 대화를 요약한다. Anthropic의 문서에 따르면 일부 프로젝트 지침과 메모리는 이후 다시 로드되지만, 경로 범위 규칙은 또 다른 일치 파일을 읽을 때까지 기다릴 수 있다.

따라서 중요한 정보는 한 세션 동안 영속 계층과 일시 계층 사이를 이동할 수 있다. 컨텍스트 변경을 테스트하는 팀은 고립된 코딩 프롬프트뿐 아니라 압축 경계를 넘는 장기 작업도 포함해야 한다.

프롬프트 캐싱도 아키텍처에 영향을 미친다. 이는 반복 계산을 줄이기 위해 안정적인 요청 접두사를 재사용한다. Anthropic은 Claude Code가 캐시 일치를 유지하기 위해 정적 콘텐츠를 앞에, 동적 메시지를 뒤에 배치한다고 설명한다.

회사의 프롬프트 캐싱 교훈은 세션 중간에 도구나 모델을 변경하면 캐시된 접두사가 무효화될 수 있다고 경고한다. 따라서 선택적 컨텍스트는 관련성과 안정성의 균형을 맞춰야 한다.

Claude Code의 지연 로딩 전략은 이 긴장의 일부를 해결한다. 가벼운 도구 스텁은 안정적으로 유지하면서 전체 스키마는 나중에 로드할 수 있다. 이 접근법은 기본 도구 세트를 끊임없이 변경하지 않고도 컨텍스트를 절약한다.

그럼에도 더 작은 시스템 프롬프트가 전체 컨텍스트 사용량 감소를 자동으로 보장하지는 않는다. 에이전트는 더 많은 참고 자료를 읽거나, 더 많은 스킬을 호출하거나, 지침을 발견하는 데 추가 턴을 사용할 수 있다.

프롬프트 축소가 일관된 행동을 보장하는 것도 아니다. 반복된 지침을 제거하면 광범위한 코딩 평가가 놓치는 드문 실패가 드러날 수 있다. 보안에 민감하거나 규제를 받는 팀은 평균 작업 점수만이 아니라 꼬리 위험을 테스트해야 한다.

적절한 대응은 통제된 평가다. 팀은 대표적인 저장소, 고정된 작업, 반복 실행, 명확히 정의된 실패 범주 전반에서 기존 구성과 축소 구성을 비교할 수 있다.

유용한 측정 항목에는 작업 완료율, 의도하지 않은 파일 변경, 테스트 커버리지, 리뷰 발견 사항, 도구 오류, 사용자 수정, 총 컨텍스트 소비량이 포함된다. 팀은 에이전트가 실제로 어떤 지침을 로드했는지도 기록해야 한다.

자율성이 높을수록 입증 책임도 커진다. 모든 편집을 감독하는 개발자는 판단 오류를 빠르게 잡아낼 수 있다. 풀 리퀘스트를 열거나 프로덕션 시스템을 변경하는 무인 에이전트에는 더 엄격한 통제와 심층 평가가 필요하다.

Anthropic의 결과는 프롬프트 부채가 존재한다는 증거로 보는 것이 가장 적절하다. 이는 보편적인 삭제 목표가 아니며, 회사 역시 자체 모델과 하니스 외부에서 이 결과를 독립적으로 검증하지 않았다.

더 작은 프롬프트는 더 많은 책임을 에이전트 아키텍처로 옮긴다

컨텍스트 단순화는 복잡성을 제거하지 않는다. 복잡성을 라우팅, 도구, 메모리, 평가, 권한으로 옮긴다.

이러한 이전은 이번 발표가 가져오는 가장 중요한 비즈니스 결과다. 프롬프트를 에이전트 제품 그 자체로 여겼던 팀은 이제 모델 주변의 전체 시스템을 살펴봐야 한다.

신뢰할 수 있는 에이전트에는 관련 지식을 식별하는 방법이 필요하다. 명확한 이름, 표현력 있는 매개변수, 제한된 상태를 갖춘 도구가 필요하다. 또한 지속적인 선호와 일시적인 세션 세부 정보를 분리하는 메모리가 필요하다.

관찰 가능한 실행도 필요하다. 개발자는 에이전트가 어떤 파일을 읽었는지, 어떤 스킬을 호출했는지, 어떤 도구를 선택했는지, 어떤 지침이 의사결정에 영향을 주었는지 확인할 수 있어야 한다.

Claude 5 컨텍스트 엔지니어링은 메인 프롬프트에 명시적 절차가 더 적게 담기기 때문에 이러한 역량의 가치를 높인다. 라우팅 계층이 실패하면 모델이 대안으로 활용할 수 있는 중복 지침도 줄어든다.

Anthropic의 자동 메모리 기능은 이러한 변화를 보여준다. Claude Code는 작업 전반에서 관련성이 있다고 판단한 정보를 저장할 수 있다. 이는 수동으로 관리되는 메모리 저장소로서 CLAUDE.md를 사용할 필요성을 줄인다.

그러나 자동화된 메모리는 거버넌스 문제를 도입한다. 팀은 무엇이 저장되었는지, 그것이 여전히 정확한지, 상충하는 메모리를 어떻게 해결하는지 알아야 한다. 메인 프롬프트가 간결하더라도 오래된 컨텍스트는 에이전트를 오도할 수 있다.

풍부한 참고 자료는 또 다른 아키텍처 변화를 만든다. Anthropic은 Claude가 단순한 Markdown 계획에만 의존하지 않고 더 복잡한 아티팩트로 작업할 수 있다고 말한다. 이는 에이전트가 설계와 구현 과정에서 검사할 수 있는 범위를 넓힌다.

이점은 발견 가능성에 달려 있다. 상세한 아티팩트는 에이전트가 그 존재를 알고 언제 참조해야 하는지 이해할 때만 도움이 된다. 참고 자료 트리에는 정보가 풍부한 이름, 간결한 인덱스, 작업별 진입점이 필요하다.

도구 설계는 프롬프팅의 한 형태가 된다. 열거형은 유효한 상태를 전달한다. 필수 매개변수는 필요한 정보를 알린다. 권한 경계는 모델이 문장을 어떻게 해석하든 유효하지 않은 작업을 막는다.

이 접근법은 자연어 경고보다 소프트웨어 제어가 강제하기 쉽기 때문에 엔터프라이즈 구매자에게 매력적일 것이다. 권한 시스템은 작업을 차단할 수 있다. 프롬프트는 모델에게 이를 수행하지 말라고 요청할 수 있을 뿐이다.

하지만 인터페이스 설계에는 문단 하나를 추가하는 것보다 더 많은 엔지니어링 노력이 필요하다. 팀은 워크플로를 모델링하고, 도구 오류를 처리하며, 상태를 노출하고, 모델과 제품이 변화함에 따라 호환성을 유지해야 한다.

따라서 80% 축소는 단순한 데모와 프로덕션 에이전트 사이의 격차를 넓힐 수 있다. 데모는 제약이 적을수록 더 좋아 보일 수 있다. 프로덕션 시스템은 필요한 경우 제거된 프롬프트 행동을 더 강력한 아키텍처로 대체해야 한다.

그 영향은 소프트웨어 개발 외부에서 AI를 사용하는 지식 근로자에게도 미친다. 리서치, 운영, 분석 에이전트도 동일한 컨텍스트 문제에 직면한다. 대규모 지침 문서는 종종 목표, 선호, 참고 자료, 일회성 절차를 뒤섞는다.

이 범주들을 분리하면 검색과 유지보수를 개선할 수 있다. 안정적인 정체성과 안전 규칙은 전역으로 유지된다. 도메인 참고 자료는 관련될 때 로드된다. 작업 절차는 호출 가능한 워크플로가 된다. 일시적 사실은 활성 세션 안에 머문다.

이는 모든 워크플로에 정교한 플랫폼이 필요하다는 뜻은 아니다. 이 원칙은 짧은 프로젝트 인덱스, 범위를 좁힌 참고 파일, 반복 작업에 기반한 테스트 세트로 시작할 수 있다.

핵심은 컨텍스트를 구분되지 않은 텍스트 블록으로 취급하지 않는 것이다. 각 요소에는 로드될 이유, 정의된 범위, 소유자, 그리고 그 가치를 테스트할 방법이 있어야 한다.

Anthropic의 움직임은 경쟁 코딩 에이전트 벤더에게도 간접적인 압박을 가한다. 사용자는 벤치마크 점수뿐 아니라 각 제품이 지침, 메모리, 도구, 압축, 컨텍스트 가시성을 어떻게 관리하는지도 점점 비교하게 될 것이다.

원시 역량이 높은 모델도 복잡한 하니스 안에서는 성능이 떨어질 수 있다. 도구와 작업 경계가 좁으면 더 작은 모델도 유용하게 유지될 수 있다. 에이전트 경쟁은 시스템 경쟁이 되고 있다.

새롭게 부상하는 이점은 컨텍스트를 검사 가능하게 만드는 제품에 돌아간다. 사용자는 무엇이 모델에 들어갔는지, 무엇이 숨겨진 채 남았는지, 무엇이 압축 이후에도 살아남았는지, 실행 간 무엇이 달라졌는지 이해할 필요가 있다.

Anthropic은 방향을 분명히 했다. 더 나은 모델은 보편적인 행동 규칙을 더 적게 담아야 하며, 주변 시스템이 필요한 순간에 정확한 정보를 제공해야 한다.

80% 축소 이후 주목할 점

세 가지 신호가 Anthropic의 소형 프롬프트 전략이 업계 규칙이 될지, Claude에 특화된 최적화에 머물지를 보여줄 것이다.

첫 번째 신호는 독립적인 평가다. 개발자는 실제 저장소와 반복 실행 전반에서 이전 Claude Code 시스템 프롬프트와 축소된 프롬프트를 통제된 방식으로 비교한 결과를 찾아야 한다.

강력한 근거에는 작업 수준 점수, 평균이 아닌 분포, 안전성과 의도하지 않은 변경에 대한 명시적 범주가 포함될 것이다. 비교 가능한 결과는 많은 영구 규칙이 프롬프트 부채가 되었다는 Anthropic의 주장을 강화할 것이다.

일관되지 않은 행동의 증가는 이를 약화할 것이다. 특히 에이전트가 지속적인 인간 검토 없이 작동할 때 드물지만 비용이 큰 실패는 중요하다. 가장 유용한 연구는 긴 세션, 도구 발견, 컨텍스트 압축을 테스트할 것이다.

두 번째 신호는 다른 모델 세대가 동일한 컨텍스트를 어떻게 처리하는지다. Anthropic의 발표는 구체적으로 Opus 5와 Fable 5를 언급한다. 팀은 Sonnet급, 더 작은 모델 또는 오래된 모델도 동일하게 간결한 지침을 견딜 수 있는지 확인해야 한다.

축소된 구성이 여러 모델에서 작동한다면 선택적 컨텍스트는 일반적인 에이전트 설계 패턴이 된다. 성능이 크게 달라진다면 팀은 모든 모델 계열에 맞춰 버전이 관리되는 프롬프트와 라우팅 정책이 필요할 것이다.

그 결과는 멀티모델 제품을 복잡하게 만들 수 있다. 제공업체나 모델 크기를 전환하는 일이 단순히 API 식별자를 바꾸는 수준을 넘어설 수 있기 때문이다. 모델마다 판단, 예시, 반복, 제약 사이에서 서로 다른 균형이 필요할 수 있다.

세 번째 신호는 /doctor, skills, memory, deferred tools를 둘러싼 제품 동작이다. Anthropic은 /doctor가 지나치게 큰 프로젝트 지침과 skills를 식별할 수 있다고 말한다. 이 기능의 권고 사항은 회사가 사용자가 지침을 얼마나 과감하게 단순화하길 기대하는지 보여줄 것이다.

Claude Code가 어떤 규칙이 충돌하는지, 어떤 파일이 거의 활성화되지 않는지, 어떤 지침이 내장 동작을 중복하는지 보고하는지도 지켜볼 필요가 있다. 이런 진단 기능은 프롬프트 정리를 주관적인 편집 작업에서 측정 가능한 유지보수로 바꿀 수 있다.

Anthropic이 더 충실한 평가 세부 사항을 공개하는지도 주목해야 한다. 현재의 주장은 작업 구성, 원점수, 모델별 비교를 제시하지 않는다. 투명성이 높아지면 팀은 이 결과가 자신들의 환경에도 적용되는지 판단하는 데 도움이 될 것이다.

개발자에게 당장의 조치는 무분별하게 80%를 삭제하는 것이 아니다. 목적에 따라 지침을 감사해야 한다. 강제 가능한 안전 제한은 유지하고, 명백한 중복은 제거하며, 전문화된 절차는 명확한 트리거 뒤로 옮겨야 한다.

그런 다음 축소된 구성을 팀이 실제로 수행하는 작업에서 테스트해야 한다. 일상적인 수정, 모호한 요청, 검토 작업, 리포지토리 규칙, 도구 실패, 장시간 세션을 포함해야 한다. 완료 여부와 함께 수정률도 측정해야 한다.

엔터프라이즈 구매자는 공급업체에 컨텍스트가 어떻게 구성되고 점검되는지 물어야 한다. 큰 컨텍스트 윈도우만으로는 충분하지 않다. 구매자에게는 범위, memory, 권한, 검색, 압축, 모델별 동작을 제어할 수 있는 기능이 필요하다.

지식 근로자도 지속적인 AI 지침에 같은 원칙을 적용해야 한다. 안정적인 선호 사항은 간결하게 유지하고, 참조 자료는 검색할 수 있는 곳에 저장해야 한다. 앞으로의 모든 요청에 과거의 모든 교훈을 담도록 강제하는 일은 피해야 한다.

Anthropic의 Claude 결과가 중요한 이유는 정교함의 의미를 다시 규정하기 때문이다. 가장 고도화된 에이전트가 가장 긴 프롬프트를 가진 것은 아닐 수 있다. 대신 지금 이 순간 모델에 무엇이 필요한지 판단하는 가장 명확한 시스템을 갖췄을 수 있다.

독립적인 테스트가 Anthropic의 결과를 재현할까, 아니면 삭제된 규칙이 여전히 중요한 작업을 드러낼까? 앞으로 몇 달 동안 그 답은 모든 진지한 Claude Code 컨텍스트 감사의 방향을 결정할 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page