DeepSeek Pro는 Minimal 모드에서 눈부시게 뛰어나다. 그것이 바로 문제이기도 하다
- Ethan Carter

- 4일 전
- 10분 분량
DeepSeek pro는 8월 13일 정식 출시됐지만, 보고된 가장 뛰어난 동작은 사용자가 유난히 특정한 하나의 에이전트 구성을 재현한 뒤에야 나타났다.
그 구성은 DeepSeek Harness의 Minimal 프리셋이다. 이는 도구를 사용하는 AI 에이전트를 위한 회사의 새 런타임이다. 커뮤니티 테스트에 따르면 이 프리셋은 일관성이 부족한 코딩 모델을 DeepSeek의 벤치마크 발표에 훨씬 가까운 수준으로 바꾼다.
이러한 개선은 통제된 다양한 작업 세트 전반에서 독립적으로 측정되지 않았다. 그러나 가장 극적인 시연이 재현에 실패하더라도 이 논란은 중요하다. DeepSeek 자체 자료는 에이전트 성능을 특정 프롬프트, 도구, 추론 설정, 실행 환경과 연결한다.
따라서 진짜 질문은 DeepSeek-V4-Pro가 “좋은가” 혹은 “나쁜가”보다 더 좁다. 훈련 환경과 일치하는 harness 안에서만 안정적으로 나타나는 능력에 모델이 온전히 공을 인정받아야 하는가의 문제다.
Anthropic, OpenAI 및 다른 모델 공급업체도 자사의 모델이 Claude Code, Codex 또는 다른 에이전트 런타임을 통해 작동할 때마다 같은 문제에 직면한다. DeepSeek는 그 의존성을 유난히 가시적으로 만들었을 뿐이다.
DeepSeek Pro GA는 에이전트 성능 논쟁과 함께 도착했다
8월 13일 출시로 이용 가능한 모델은 바뀌었지만, 실제로 어떤 시스템이 평가되고 있었는지는 정리되지 않았다.
DeepSeek는 2026년 8월 13일 앱, 웹사이트, API 전반에 걸쳐 V4-Pro의 정식 출시 버전을 공식 공개했다. 회사의 GA 출시 발표는 에이전트 업그레이드, 세 가지 추론 노력 수준, OpenAI의 Responses API에 대한 네이티브 지원을 강조했다.
낮은 노력 수준은 단순한 작업을 겨냥한다. 높은 노력 수준은 일반적인 에이전트 워크플로를 처리하고, 최대 노력 수준은 복잡한 작업에 더 많은 추론을 할당한다. 이번 출시에는 V4-Pro API 모델 이름을 바꾸지 않은 Codex 지향 설정 경로도 추가됐다.
이 발표는 더 넓은 V4 제품군의 4월 24일 프리뷰에 뒤따랐다. DeepSeek는 V4-Pro를 총 1조6천억 개의 매개변수와 추론 중 활성화되는 490억 개의 매개변수를 갖춘 mixture-of-experts 모델로 설명했다.
mixture-of-experts 모델은 각 토큰을 네트워크의 일부만 거치도록 라우팅한다. 이 설계는 모든 요청에서 모든 매개변수를 활성화하지 않고도 전체 용량을 늘릴 수 있다.
이 모델은 100만 토큰 컨텍스트 창을 지원한다. DeepSeek는 32조 개 이상의 토큰으로 사전 학습한 뒤 지도 학습, 강화 학습, 온폴리시 증류를 거쳤다고 밝혔다.
이러한 사양이 논란을 일으킨 것은 아니었다. 마찰은 초기 사용자들이 GA 출시 후 DeepSeek의 에이전트 벤치마크 주장과 자신의 결과를 비교하면서 시작됐다.
일부 커뮤니티 보고서는 짧은 추론 흔적, 약한 계획 수립, 일관되지 않은 도구 사용을 언급했다. 널리 공유된 한 사용기는 이번 출시를 실망스럽다고 평가하며 배포 또는 서버 측 구성 문제가 모델의 의도된 동작을 억제하고 있을 수 있다고 제기했다.
이러한 관찰은 일화 수준이었다. 서로 다른 프롬프트, 계정, 도구, 운영체제, 요청 경로에서 나왔다. 일반적인 성능 수준을 확립할 수는 없다.
그러자 두 번째 보고 물결이 나타났다. 사용자들은 같은 모델을 Linux 또는 Windows Subsystem for Linux에서 DeepSeek Harness Minimal로 실행했을 때 능력이 크게 향상됐다고 말했다.
한 커뮤니티 테스트는 여러 사용자가 이 개선을 재현했다고 주장했다. 작성자는 여전히 이 모델이 선도적인 비교 모델보다 낮다고 평가했고, 시각적 취향을 비판했다.
이러한 단서는 중요하다. Minimal 모드가 모든 약점을 해결했다는 주장이 아니었다. 많은 일반 세션에서는 보이지 않던 수준의 코딩 동작을 이 프리셋이 드러냈다는 주장이다.
별도의 저장소 분석은 Minimal 모드를 8월 10일 커밋과 연결했다. 그 분석에 따르면, 해당 커밋은 프리셋을 강화 학습 중 사용된 에이전트 구성에 맞췄다.
분석은 절제된 시스템 프롬프트, 지속적인 셸 접근, 지정된 파일 편집기, 특정 컨텍스트 압축 정책을 포함한 좁은 환경을 설명했다. 또한 프리셋이 시스템 프롬프트를 오염시킬 수 있는 관련 없는 도구 설명을 제외했다고 전했다.
이 해석은 여전히 공개 코드와 문서에 대한 커뮤니티의 독해다. DeepSeek는 V4-Pro가 Minimal 모드 밖에서 실패한다거나 특정 공개 프리셋 하나에 의도적으로 최적화됐다는 증거를 공개하지 않았다.
그럼에도 순서는 구체적이다. DeepSeek는 8월 13일 V4-Pro GA를 출시하고, 개발자 프리뷰로 harness를 공개했으며, 에이전트 평가와 밀접하게 관련된 환경을 노출했다.
긴장은 이 조각들이 어떻게 맞물리는지에서 비롯된다. 모델의 최선의 동작에 그 환경이 필요하다면, 사용자는 상호 교환 가능한 모델 엔드포인트가 아니라 모델-harness 시스템을 구매하는 셈이다.
DeepSeek Harness가 벤치마크의 의미를 바꾸는 이유
에이전트 벤치마크는 리더보드에 모델 이름만 표시되더라도 모델, 프롬프트, 도구, 메모리 정책, 런타임을 함께 측정한다.
에이전트 harness는 언어 모델이 파일을 살피고, 명령을 실행하며, 도구를 호출하고, 상태를 유지하고, 다음에 일어날 일을 결정하도록 해주는 소프트웨어 계층이다. 텍스트 예측을 작동 루프로 바꾼다.
그 루프는 중요한 선택을 많이 내린다. 시스템 프롬프트를 형식화하고, 도구 스키마를 정의하며, 오류를 반환하고, 기록을 자르고, 앞선 작업을 요약하고, 모델이 다음 턴을 언제 받는지 결정한다.
작은 변화도 큰 성능 차이를 낼 수 있다. 모델은 작업을 이해하더라도 도구 설명이 모호해서 실패할 수 있다. 컨텍스트 압축이 이전 제약을 제거했기 때문에 잘못된 파일을 편집할 수도 있다.
모델은 잡음이 많은 상태 메시지를 받은 뒤 추론 예산을 낭비할 수도 있다. 다른 harness는 프롬프트를 짧게 유지하고 올바른 상태를 보존해 같은 실패를 막을 수 있다.
DeepSeek의 공식 저장소는 DeepSeek Harness를 모든 것이 플러그인인 오픈소스 에이전트 런타임으로 설명한다. 이 프로젝트는 개발자 프리뷰 단계이며 호환성을 깨는 변경이 발생할 것이라고 경고한다.
플러그인 아키텍처는 사용자를 하나의 고정된 에이전트 설계에 묶어두지 않고 기능을 교체하거나 재구성할 수 있다. 이러한 유연성은 프로젝트를 유용하게 만들지만, “DeepSeek-V4-Pro 성능”에 대한 어떤 주장도 복잡하게 만든다.
어떤 플러그인이 활성화됐는가? 어떤 프리셋이 이를 불러왔는가? 어떤 시스템 프롬프트가 사용됐는가? 대화 기록은 어떻게 압축됐는가? 턴 사이에도 셸이 유지됐는가?
이런 세부 사항은 구현상의 사소한 정보가 아니다. 모든 단계에서 모델에 उपलब्ध한 정보와 행동을 형성한다.
DeepSeek의 모델 문서는 이러한 시스템 의존성을 드러낸다. 회사는 까다로운 에이전트 작업에 최대 추론을, 해당 모드에는 최소 384,000개 컨텍스트 토큰을 권장한다.
해당 모델 카드 역시 추론 설정에 따라 큰 차이가 난다고 보고한다. Terminal Bench 2.0에서 DeepSeek는 V4-Pro가 비사고 모드에서 59.1, 높은 노력 수준에서 63.3, 최대 노력 수준에서 67.9를 기록했다고 제시한다.
SWE-bench Verified에서 보고된 수치는 73.6, 79.4, 80.6으로 이어진다. BrowseComp에서는 높은 노력 수준과 최대 노력 수준이 80.4와 83.4를 기록했으며, 비사고 결과는 제시되지 않았다.
이는 독립 재현이 아니라 DeepSeek 자체 평가다. 하지만 추론 구성이 측정되는 능력을 실질적으로 바꾼다는 회사의 입장을 보여준다.
기술 보고서는 평가 환경을 더 자세히 설명한다. 코드 에이전트 작업에서 DeepSeek는 셸 접근과 파일 편집을 포함한 최소한의 도구 집합을 사용했다.
검색 에이전트 작업에서는 회사가 내부 harness를 사용했다. 이는 보고된 에이전트 점수가 고립된 프롬프트에 응답하는 순수 모델을 결코 나타내지 않았다는 뜻이다.
그 자체로 본질적으로 부적절한 일은 아니다. 에이전트 모델에는 도구가 필요하고, 벤치마크는 어떤 런타임이든 제공해야 한다. 모든 공급업체가 하나를 선택한다.
문제는 harness 특화 점수가 여러 제품에 걸친 모델의 일반 능력을 나타내는 약칭이 될 때 시작된다. 지속적인 셸과 훈련 환경에 맞춘 압축으로 생성된 결과가 다른 편집기 확장 프로그램으로 자동 전이되지는 않는다.
Anthropic 호환 클라이언트를 사용하는 개발자는 다르게 구성된 도구 결과를 보낼 수 있다. 기업 플랫폼은 보안 지침, 감사 메시지, 검색 결과, 승인 절차를 삽입할 수 있다.
이러한 추가 요소는 프로덕션 환경에서 필요할 수 있다. 동시에 프롬프트를 강화 학습에 사용된 환경에서 멀리 이동시킬 수도 있다.
따라서 Minimal 모드는 단순히 데모를 개선하는 데 그치지 않는다. 모델 점수 뒤에 얼마나 많은 숨은 인프라가 놓여 있는지를 드러낸다.
이것이 DeepSeek pro 논쟁이 한 번의 출시를 넘어 중요한 이유다. 모델 카드는 DeepSeek-V4-Pro를 명시하지만, 에이전트 작업에서 실제로 작동하는 단위는 DeepSeek-V4-Pro와 harness 구성의 조합이다.
이 구분이 명확해지면 리더보드는 두 부분을 모두 보고해야 한다.
훈련 정렬이 자동으로 과적합을 뜻하지는 않는다
공개 증거는 구성 민감성을 뒷받침하지만, DeepSeek-V4-Pro가 하나의 harness에 과적합됐다는 점까지는 아직 입증하지 못한다.
과적합에는 정확한 의미가 있다. 시스템은 훈련 분포에서는 잘 작동하지만 의미 있게 다른 입력으로 일반화하지 못하는 패턴을 학습할 때 과적합된다.
이 경우 의심되는 훈련 분포에는 코딩 문제 이상의 것이 포함된다. 에이전트의 프롬프트 구조, 도구 이름, 응답 형식, 셸 동작, 컨텍스트 관리 정책도 포함될 수 있다.
강화 학습이 하나의 구성 안에서의 성공을 반복적으로 보상했다면, 모델은 그 구성에 적응하는 것이 합리적이다. 일관된 도구 의미 체계는 불확실성을 줄이고 보상 신호를 더 쉽게 학습하게 한다.
그러한 적응은 유익할 수 있다. 인간 역시 익숙한 인터페이스, 신뢰할 수 있는 도구, 안정적인 워크플로에서 더 나은 성과를 낸다.
예측 가능한 파일 편집기를 사용하도록 훈련된 모델은 문서화되지 않은 편집기 동작을 추론해야 하는 모델보다 뛰어난 성능을 보여야 한다. 이런 모든 향상을 “과적합”이라고 부른다면 그 용어는 거의 쓸모없어질 것이다.
더 강한 주장을 하려면 더 광범위한 실패 패턴이 필요하다. V4-Pro는 근본 작업이 동등하게 유지되는데도 관련 없는 환경 세부 사항이 바뀔 때 유난히 가파른 성능 저하를 보여야 한다.
예를 들어 연구자들은 설명과 동작을 유지한 채 도구 이름을 바꿀 수 있다. 도구 스키마의 순서를 바꾸고, 무해한 표현을 달리하며, 편집기를 동등한 인터페이스로 교체하거나, 필요한 사실을 제거하지 않고 압축 방식을 변경할 수 있다.
일반적인 에이전트라면 그러한 변화 중 다수를 견뎌야 한다. harness에 묶인 모델은 같은 실질적 능력을 제공받고도 상당한 성능을 잃을 것이다.
아직 공개된 연구 중 충분한 작업과 무작위 시행에 걸쳐 그러한 패턴을 확립한 것은 없다. 스크린샷, 동영상, 개인 코딩 세션은 연구 질문을 식별할 수는 있지만 일반화 성능을 측정할 수는 없다.
“Minimal이 진짜 모델을 해방한다”는 주장에는 몇 가지 다른 설명도 있다.
첫째, Minimal 모드는 프롬프트 잡음을 제거할 수 있다. 긴 도구 매뉴얼과 겹치는 지침은 특히 긴 세션에서 에이전트 동작을 악화시키는 경우가 많다.
둘째, 상태를 더 효과적으로 보존할 수 있다. 지속적인 셸을 사용하면 모델은 작업 디렉터리, 환경 상태, 실행 중인 프로세스를 매번 재구성하지 않고 유지할 수 있다.
셋째, 이 프리셋은 사후 학습 과정에서 사용된 도구 인터페이스를 노출할 수 있다. 이는 분포 정렬을 만들지만, 반드시 벤치마크 암기를 의미하지는 않는다.
넷째, 초기 GA 요청은 배포 편차를 겪었을 수 있다. 커뮤니티 보고에서는 비정상적으로 짧은 추론과 가능한 라우팅 변경이 언급됐지만, DeepSeek는 긴급 롤백을 확인하지 않았다.
다섯째, 사용자는 가장 눈에 띄는 성공 사례를 선택해 공유할 수 있다. 긍정적인 시연은 빠르게 확산되는 반면, 실패한 재현 사례는 관심을 덜 받는다.
반대 방향의 편향도 존재한다. 실망한 사용자는 특히 기대를 높인 벤치마크 주장을 접한 뒤, 한 번의 실패한 세션을 일반화할 수 있다.
DeepSeek의 공식 결과 역시 회의적 시각의 여지를 남긴다. 회사는 V4-Pro Max가 SWE-bench Verified의 80.6%를 해결하고 Terminal Bench 2.0에서 67.9점을 기록했다고 밝혔다.
또한 Codeforces 레이팅 3206과 LiveCodeBench 통과율 93.5%를 보고했다. 이 수치들은 명시된 평가 환경에서 해당 모델을 고급 코딩 시스템으로 제시한다.
독립 평가는 더 유용한 기준점이 된다. 미국 정부의 Center for AI Standards and Innovation은 개발사 권장 설정을 사용해 프리뷰 모델을 평가했다.
독립 평가에서 CAISI는 H200 및 B200 GPU에서 DeepSeek V4를 실행했다. 내부 추론을 보존하고 컨텍스트, 샘플링, 시스템 프롬프트, 최대 사고량에 권장 값을 적용했다.
CAISI는 DeepSeek가 자체 보고한 GPQA-Diamond 결과도 재현해, 해당 벤치마크에서 기본적인 추론 구성 오류가 발생했을 가능성을 낮췄다. 그러나 에이전트 테스트에서는 DeepSeek Harness Minimal 대신 Inspect에 내장된 ReAct 에이전트를 사용했다.
이 차이가 바로 향후 분석이 검토해야 할 대상이다. 모델은 정적 추론 벤치마크에서는 일치하는 성능을 보이면서도, 이를 둘러싼 에이전트 루프에는 매우 민감할 수 있다.
따라서 현재 증거는 신중한 결론을 뒷받침한다. DeepSeek-V4-Pro는 환경 민감성이 있으며, DeepSeek는 알려진 구성 방식에 맞춰 에이전트 워크플로를 최적화했다.
이 증거는 DeepSeek가 공개 벤치마크 과제를 암기했다는 사실을 입증하지 않는다. 의도적인 조작 역시 증명하지 않는다.
현재 모델을 과적합이라고 부르는 것은 데이터를 앞서간다. Harness가 무관하다고 하는 것은 DeepSeek의 문서와 커뮤니티 테스트 모두가 보여주는 사실을 무시하는 일이다.
진짜 경쟁은 학습 정렬 에이전트와 이식 가능한 모델 간의 대결이다
DeepSeek의 당면 과제는 경쟁 모델 하나를 이기는 것이 아니다. 선호하는 런타임 밖에서도 그 역량이 유지됨을 입증하는 일이다.
모델 공급업체들은 점점 더 완전한 에이전트 시스템을 최적화하고 있다. 모델 자체도 여전히 중요하지만, 그 추론이 유용한 산출물을 만들어 내는지는 오케스트레이션이 결정한다.
OpenAI는 모델을 Codex와 결합한다. Anthropic은 Claude Code와 함께 모델을 개발한다. Google은 Gemini의 코딩 제품 안에서 모델 동작을 통제하는 한편, 독립 런타임은 자체 프롬프트와 도구를 추가한다.
이제 DeepSeek에도 같은 전략적 선택지가 있다. V4-Pro를 DeepSeek Harness와 공동 설계하고, 실패를 엔드투엔드로 측정하며, 이러한 추적 기록을 강화학습에 활용할 수 있다.
이 접근 방식은 API를 고립된 텍스트 생성기로 취급하는 것보다 더 나은 실제 성능을 낼 수 있다. 회사가 상호작용의 양쪽을 모두 통제하기 때문에 디버깅도 가속할 수 있다.
안정적인 Harness는 학습팀에 반복 가능한 환경을 제공한다. 올바른 명령 사용에 보상을 주고, 파일 변경을 검증하며, 미완성 작업에는 불이익을 주고, 장시간 세션을 테스트할 수 있다.
그 대가는 이식성이다. 기업은 모델을 공급업체의 손대지 않은 참조 환경 안에 배포하는 경우가 드물다.
기업은 권한 검사, 비공개 검색, 로깅, 정책 필터, 사람 승인 절차, 조직별 도구를 추가한다. 개발자는 기존 에디터, 명령줄 에이전트, 자동화 프레임워크를 가져온다.
각 추가 요소는 상호작용 분포를 바꾼다. 하나의 간결한 시스템 프롬프트에 의존하는 모델은 기업 보안 정책이 수천 개의 토큰을 추가할 때 성능이 저하될 수 있다.
하나의 파일 편집 프로토콜을 중심으로 학습된 모델은 다른 프로토콜의 오류 메시지를 잘못 처리할 수 있다. 코딩에 적합한 압축 전략은 법률 또는 분석 업무에 필요한 증거를 버릴 수 있다.
이식 가능한 역량이란 이러한 변화 전반에서 성능을 유지하는 것을 뜻한다. 어디서나 동일한 점수를 요구하는 것은 아니지만, 점진적이고 안정적인 성능 저하를 요구한다.
학습 정렬 역량은 다른 약속을 제시한다. 공급업체가 알려진 설정의 권장 시스템을 제공하고, 사용자는 전체 스택을 채택함으로써 광고된 성능을 얻는다.
어느 접근법도 보편적으로 우월하지는 않다. 긴밀하게 통합된 시스템은 이를 중심으로 표준화할 의향이 있는 팀에 더 나은 결과를 제공할 수 있다.
이식 가능한 모델은 플랫폼 구축자에게 더 많은 자유를 준다. 또한 런타임 간 벤치마크 결과를 비교하기 쉽게 만든다.
DeepSeek의 현재 메시지는 두 가지 장점을 모두 주장하려 한다. V4-Pro는 여러 API 형식으로 제공되며 주요 에이전트 제품과 호환되는 것으로 소개된다.
동시에, 가장 강력하다고 보고된 동작은 최대 추론과 특수한 Harness 구성에 밀접하게 연결된 것으로 보인다. 이 격차는 이식성 주장에 압력을 가한다.
공식 프리뷰 발표에서 DeepSeek는 Claude Code, OpenClaw, OpenCode 및 기타 에이전트 제품에 맞춰 V4를 최적화했다고 밝혔다. 또한 회사가 에이전트형 코딩에 V4를 내부적으로 사용하고 있다고도 말했다.
이러한 발언은 하나의 Minimal 프리셋보다 더 폭넓은 적응을 시사한다. DeepSeek는 동일한 예산 아래 여러 독립 런타임의 결과를 공개함으로써 이를 뒷받침할 수 있다.
비교는 최종 점수 이상을 통제해야 한다. 연구자들은 토큰 사용량, 실행 시간, 완료율, 도구 오류, 재시도, 실패 범주를 보고해야 한다.
또한 모델 실패와 Harness 실패를 분리해야 한다. 에디터가 형식이 잘못된 패치를 거부했다면, 추적 기록은 스키마, 파서, 모델 중 무엇이 결함을 일으켰는지 보여줘야 한다.
이 수준의 보고는 전체 에이전트 시장을 개선할 것이다. 현재 리더보드는 종종 복잡한 시스템을 하나의 모델명 옆에 놓인 단일 백분율로 압축한다.
이런 표시는 구매자가 오케스트레이션을 무시한 채 모델 엔드포인트를 비교하도록 부추긴다. 또한 공급업체가 결과의 민감도를 보여주지 않은 채 유리한 Harness를 선택하게 한다.
DeepSeek Harness는 회사가 플러그인 설계를 통제된 절제 실험에 활용한다면 이 문제를 해결하는 데 도움이 될 수 있다. 팀은 한 번에 하나의 구성 요소를 교체하고, 그에 따른 점수 변화를 공개할 수 있다.
절제 테스트는 기여도를 측정하기 위해 한 요소를 제거하거나 변경한다. 여기서는 지속적 셸 상태, 압축 정책, 도구 명명, 시스템 프롬프트 길이의 가치를 정량화할 수 있다.
Minimal 모드가 관련 없는 지침을 제거하기 때문에 승리한다면, 다른 Harness 개발자들도 그 교훈을 적용할 수 있다. 모델이 학습 시점의 정확한 토큰을 기대하기 때문에 승리한다면, 이식성 우려는 더 커진다.
어느 결과든 또 하나의 쇼케이스 실행보다 더 많은 정보를 제공할 것이다. 이 논쟁에는 열광적인 클립과 좌절한 게시물 간의 경쟁이 아니라 측정이 필요하다.
DeepSeek Pro 우려를 확인하거나 약화할 수 있는 요소
관찰 가능한 세 가지 신호가 Minimal 모드가 합리적인 참조 설정인지, 아니면 성능 의존성인지 판별할 수 있다.
첫 번째 신호는 0813 모델에 대한 통제된 크로스-Harness 평가다. 동일한 작업을 DeepSeek Harness Minimal, 표준 프리셋, 그리고 최소 두 개의 독립 에이전트 런타임에서 실행해야 한다.
각 구성에는 동일한 추론 수준, 토큰 예산, 샘플링 정책, 도구 기능, 재시도 허용량이 필요하다. 에이전트 결과는 실행마다 달라지므로 평가자는 여러 번의 시도를 사용해야 한다.
Minimal의 큰 우위는 구성 의존성 우려를 강화할 것이다. 동등한 런타임 간에 유사한 결과가 나온다면 과적합 이론은 약화되고, 초기 실패가 설정 또는 배포 문제에서 비롯됐음을 시사할 것이다.
두 번째 신호는 무해한 인터페이스 변경에 대한 회복력이다. 평가자는 도구 이름을 바꾸고, 스키마 순서를 재배치하고, 지침을 바꿔 쓰며, 기능적으로 동등한 에디터로 교체해야 한다.
정보와 이용 가능한 작업이 변하지 않는다면 성능은 대체로 안정적으로 유지돼야 한다. 급격한 하락은 모델이 일반적인 도구 이해보다 표면적 특징에 의존한다는 점을 보여줄 것이다.
이 테스트는 한 공급업체의 Harness를 다른 것과 비교하는 것보다 중요하다. 서로 다른 제품은 한꺼번에 많은 변수를 도입하기 때문에 점수 변화의 원인을 분리하기 어렵다.
세 번째 신호는 DeepSeek 자체의 공개다. 회사는 프롬프트, 도구 스키마, 압축 규칙, 추론 설정을 포함해 각 주요 벤치마크 결과 뒤에 있는 정확한 에이전트 구성을 공개해야 한다.
또한 프리뷰 모델과 8월 13일 GA 체크포인트를 구분해야 한다. 버전별 결과가 없으면 사용자는 이전 점수가 자신이 호출하는 엔드포인트로 이전되는지 알 수 없다.
DeepSeek는 이 투명성을 제공하기 위해 비공개 학습 데이터를 공개할 필요가 없다. 재현 가능한 평가 스크립트와 완전한 런타임 구성은 핵심 질문에 답할 수 있다.
그러면 독립 연구자들은 주장된 성능 향상이 다른 저장소, 언어, 작업 길이, 보안 제약에서도 유지되는지 테스트할 수 있다. 기업 구매자는 참조 Harness를 채택하는 일이 자신의 시스템에 맞는지 판단할 수 있다.
개발자를 위한 실용적 교훈은 이미 분명하다. 하나의 채팅 창으로 DeepSeek pro를 평가하지 말고, 하나의 Minimal 모드 성공을 보편적 결과로 신뢰하지도 말라.
프로덕션에 들어갈 정확한 모델-Harness 조합을 테스트하라. 최종 문장만 판단하지 말고 추론 설정, 컨텍스트 정책, 도구 정의, 재시도, 작업 완료 여부를 기록하라.
벤치마크 발행자는 구성을 일급 항목으로 보고해야 한다. “DeepSeek-V4-Pro with DSH Minimal”은 단순히 “DeepSeek-V4-Pro”라고 표시된 행보다 더 정직하다.
DeepSeek에 있어 기회는 하나의 출시를 방어하는 것보다 더 크다. 회사는 이 논란을 에이전트 시스템 평가를 위한 더 명확한 표준으로 전환할 수 있다.
가장 강력한 결과는 Minimal 모드가 V4-Pro를 예외적으로 보이게 만든다는 증명이 아닐 것이다. 실제 조직이 Minimal을 자체의 복잡한 환경으로 교체해도 모델이 유용하게 유지된다는 증거일 것이다.
그 결과가 나올 때까지 “과적합”은 입증되지 않은 진단으로 남는다. 구성 의존성은 확립된 우려이며, 그 자체만으로도 충분히 중요하다.
0813 릴리스를 테스트하고 있다면, 동일한 저장소 작업을 최소 두 개의 Harness에서 실행하고 각 실행을 반복하라. 추적 기록을 보존하고, 예산을 정규화하며, 성공 사례와 함께 실패 사례도 공개하라. 그 증거가 DeepSeek pro가 이전 가능한 에이전트 행동을 학습했는지, 아니면 유난히 익숙한 하나의 워크플로만 학습했는지를 알려줄 것이다.


