top of page

Alibaba의 Qwen3.7-Max, 35시간 자율 코딩 실행 완료

8월 13일
11분 분량

Alibaba는 35시간에 걸친 자율 코딩 테스트를 거친 뒤 Qwen3.7-Max를 공개했고, 이는 평범한 Google News 기사를 소프트웨어 팀을 향한 직접적인 도전으로 바꿔 놓았다. 이 모델은 사람의 개입 없이 1,158회의 도구 호출을 실행하고 432개의 커널 변형을 테스트한 것으로 알려졌다. Alibaba는 그 결과 생성된 코드가 기준 구현보다 10배 빠르게 실행됐다고 밝혔다.

이 헤드라인은 AI가 엔지니어링 일자리를 위협한다는 또 하나의 경고처럼 들린다. 그러나 더 유용한 해석은 정반대다. Qwen3.7-Max는 짧은 프롬프트로 일회성 앱을 만들어낸 것이 아니다. 고도로 전문화된 코드를 측정하고, 디버깅하고, 수정하고, 검증하는 데 수시간을 보냈다.

이 차이는 Anthropic, DeepSeek, Moonshot AI, Zhipu AI 및 기업용 소프트웨어 팀에 압박을 가한다. 경쟁은 코딩 질문에 누가 정확히 답하느냐를 넘어서는 방향으로 이동하고 있다. 이제는 어떤 모델이 오류 가능성이 높은 장기 워크플로 안에서 생산성을 유지할 수 있는지가 핵심이다.

Alibaba는 인상적인 증거를 제시했지만, 논쟁을 끝내지는 못했다. 대부분의 성능 수치는 회사 자체 또는 Qwen 팀이 만든 벤치마크에서 나온다. 구매자가 이를 신뢰할 수 있는 운영 보장으로 받아들이기 전에 독립 팀이 결과를 재현해야 한다.

Alibaba의 Qwen3.7-Max가 실제로 바꾼 것

중요한 변화는 Qwen3.7-Max가 코드를 작성한다는 점이 아니라, 측정 가능한 엔지니어링 루프를 35시간 동안 유지한 것으로 알려졌다는 점이다.

Alibaba는 2026년 5월 20일 항저우에서 열린 클라우드 서밋에서 Qwen3.7-Max를 소개했다. 이 독점 모델은 에이전틱 워크로드를 겨냥한다. 즉, 소프트웨어가 행동을 선택하고, 도구를 호출하며, 결과를 관찰하고, 접근 방식을 수정하는 작업이다.

이러한 초점은 익숙한 챗봇 패턴과 다르다. 챗봇은 흔히 하나의 프롬프트를 받고 하나의 응답을 반환한다. 반면 에이전트는 오류, 불완전한 정보, 변화하는 상태, 반복적인 도구 사용 속에서도 목표를 유지해야 한다.

Alibaba는 언어 모델을 서비스하는 데 사용되는 오픈소스 시스템인 SGLang의 어텐션 커널에서 이 능력을 시험했다. 커널은 하드웨어에서 특정 연산을 수행하는 저수준 프로그램이다. 작은 개선도 해당 연산을 사용하는 모든 모델 요청의 속도와 비용에 영향을 줄 수 있다.

대상 하드웨어는 Alibaba의 T-Head Zhenwu M890 가속기를 탑재한 클라우드 인스턴스였다. 회사에 따르면 Qwen3.7-Max는 훈련 과정에서 해당 칩 아키텍처를 접한 적이 없었다. 하드웨어 문서, 측정 이력, 최적화된 샘플 구현도 제공받지 못했다.

모델은 고성능 GPU 커널 개발을 위한 프로그래밍 언어인 Triton으로 작성된 기준 버전에서 시작했다. 이후 대안을 컴파일하고, 성능을 측정하고, 실패를 식별하고, 코드를 수정했다.

35시간 실험에는 432회의 커널 테스트와 1,158회의 도구 호출이 포함됐다. Alibaba는 최종 구현이 초기 기준 버전 대비 평균 10배의 속도 향상을 달성했다고 밝혔다.

이 세부 사항은 단일 벤치마크 점수보다 더 중요하다. 모델은 하나의 목표를 긴 일련의 행동과 연결해야 했다. 또한 컴파일 또는 성능 결과가 이전 선택과 모순될 때 회복해야 했다.

이 작업에는 여전히 유리한 경계 조건이 있었다. Alibaba는 모델, 칩, 클라우드 환경, 그리고 평가 과정의 상당 부분을 보유하고 있었다. 모델이 해당 아키텍처로 훈련받지 않았더라도, 회사는 자신이 잘 이해하는 인프라를 중심으로 환경을 설계할 수 있었다.

그럼에도 이 실행은 모델에 고립된 함수를 완성하도록 요청하는 것보다 더 까다로운 시험을 의미한다. 이는 암기된 답보다 반복 실험에 따라 진전이 결정되는 엔지니어의 최적화 워크플로와 닮아 있다.

Alibaba는 이 에이전트 중심 전략을 더 폭넓은 상업 전략으로도 전환하고 있다. 회사의 클라우드 발표는 Qwen3.7-Max를 코딩과 사무 업무 전반에서 지속적인 다단계 작업을 위해 구축된 모델로 설명했다.

이 모델은 OpenAI 및 Anthropic 도구와 호환되는 인터페이스를 지원한다. Alibaba는 개발자가 이를 Claude Code, OpenClaw, Qwen Code, Hermes Agent, Qoder를 포함한 에이전트 환경에 연결할 수 있다고 밝혔다.

이 호환성은 단일 채팅 애플리케이션의 중요성을 낮춘다. 기업은 도구, 권한, 컨텍스트, 실행을 관리하는 주변 소프트웨어인 기존 에이전트 하니스 내부에서 기반 모델을 테스트할 수 있다.

이 때문에 이 이야기는 전문 매체 보도를 넘어 Google News까지 확산됐다. Alibaba는 단순히 더 나은 어시스턴트를 주장하는 것이 아니다. 엔지니어링 프로세스가 검증된 결과를 낼 때까지 그 안에 머물 수 있는 작업자로서 이 모델을 제시하고 있다.

35시간 실행이 코딩 에이전트에 압박을 가하는 이유

Qwen3.7-Max는 그럴듯한 코드를 생성하는 수준에서 수백 번의 의사결정에 걸쳐 유용한 추진력을 유지하는 수준으로 경쟁 기준을 끌어올린다.

코딩 모델은 시스템이 정의된 소프트웨어 문제를 해결할 수 있는지를 측정하는 테스트에서 빠르게 개선됐다. 이러한 평가는 여전히 유용하지만, 엔지니어링 업무를 명확한 종료 지점이 있는 깔끔한 과제로 압축한다.

실제 운영 업무는 덜 정돈돼 있다. 리포지토리에는 문서화되지 않은 종속성, 상충하는 요구사항, 간헐적으로 실패하는 테스트, 그리고 훨씬 나중에야 결과가 드러나는 의사결정이 존재한다. 모델은 인상적인 패치를 작성할 수 있지만, 원래 문제보다 더 많은 정리 작업을 사람에게 남길 수도 있다.

Alibaba의 실험은 이러한 약점의 한 부분을 겨냥한다. 핵심 주장은 피드백 아래에서의 지속성에 관한 것이다. Qwen3.7-Max는 측정 루프를 통해 실패한 시도를 수정할 수 있었기 때문에 모든 행동이 성공할 필요는 없었다.

이 패턴은 자동 완성보다 과학적 방법에 더 가깝다. 모델은 변경을 제안하고, 실험을 실행하고, 결과를 검토한 뒤, 또 다른 후보를 생성했다. 가치는 특히 영리한 하나의 응답이 아니라 전체 루프에서 나왔다.

Alibaba는 동일한 커널 작업에서 Qwen3.7-Max와 여러 경쟁사 사이에 큰 격차가 있었다고 보고했다. 회사는 GLM-5.1이 7.3배, Kimi K2.6이 5배, DeepSeek V4 Pro가 3.3배의 속도 향상을 달성했다고 밝혔다. Qwen3.6-Plus는 1.1배에 도달한 것으로 알려졌다.

이러한 비교는 잠정적인 결과로 남아야 한다. Alibaba가 과제를 선택하고, 에이전트를 구성하고, 결과를 보고했다. 프롬프팅, 도구 한도, 중단 규칙, 컴퓨팅 할당의 변화는 에이전트 평가에 큰 영향을 줄 수 있다.

Anthropic은 여전히 중요한 기준점이다. Alibaba는 KernelBench L3에서 Qwen3.7-Max가 96%의 사례에서 가속된 커널을 성공적으로 생성했다고 주장한다. 제공업체의 비교에 따르면 Claude Opus 4.6은 98%에 도달한 것으로 알려졌다.

더 넓은 벤치마크 결과는 일방적이라기보다 혼재돼 있다. Qwen3.7-Max는 SWE-bench Verified에서 80.4점을 기록한 것으로 알려졌으며, Claude Opus 4.6 Max는 80.8점, DeepSeek V4 Pro Max는 80.6점이었다.

Alibaba는 또한 자사 비교에서 Claude가 앞선 영역을 인정했다. 여기에는 NL2Repo, ClawEval, CoWorkBench가 포함됐다. 이는 실제 경쟁을 덜 극적으로 만들지만, 특정 워크플로를 중심으로 모델을 선택하는 구매자에게는 더 관련성 높게 만든다.

따라서 압박은 광범위한 에이전트 역량을 주장하는 모든 모델 제공업체에 가해진다. 고객은 에이전트가 얼마나 오래 효과를 유지하는지, 얼마나 자주 구조가 필요한지, 그리고 그 작업이 독립적인 검토를 견디는지를 점점 더 묻게 될 것이다.

짧은 벤치마크에서의 높은 점수는 이 질문들에 답할 수 없다. 세련된 시연도 마찬가지다. 기업에는 실패, 회복률, 개입 시간, 최종 산출물의 품질을 포함한 반복 실행 전반의 분포가 필요하다.

새로운 기준은 에이전트 플랫폼 개발자에게도 압박을 가한다. 모델은 작동하는 시스템의 한 구성 요소일 뿐이다. 도구 설계, 컨텍스트 관리, 관찰 가능성, 권한 경계, 검증기가 장기 자율성이 진전을 낳는지 장기 손상을 낳는지를 결정한다.

Alibaba의 훈련 방식은 이러한 시스템 수준의 관점을 반영한다. Qwen 팀은 각 훈련 항목을 과제, 도구 환경, 검증기로 분리한다. 연구자들은 이 요소들을 재조합해 하나의 익숙한 환경에서만 작동하는 전략을 억제할 수 있다.

검증기는 결과가 의도된 목표를 충족하는지 확인한다. 장기 실행 중에는 이 기능이 필수적이다. 그렇지 않으면 자신감 있는 모델이 잘못된 지표를 수시간 동안 최적화할 수 있기 때문이다.

Alibaba는 Qwen3.7-Max가 이전 모델보다 OpenClaw, Claude Code, Hermes 전반에서 더 일관된 결과를 유지했다고 밝혔다. 독립 테스트가 이 결과를 확인한다면, 조직이 에이전트 프레임워크를 전환할 때 필요한 작업이 줄어들 수 있다.

엔지니어링 리더에게는 리더보드 선두보다 일관성이 더 중요할 수 있다. 도구 전반에서 예측 가능하게 작동하는 약간 더 약한 모델은, 하니스가 바뀔 때마다 성능이 달라지는 최고 점수 모델보다 관리하기 쉬울 수 있다.

이것이 Google News 헤드라인 아래에 있는 경쟁 메시지다. Alibaba는 구매자에게 모델을 브라우저 탭 안에서 대기하는 고립된 생성기가 아니라 시스템에 내장된 지속적 운영자로 평가하라고 요구하고 있다.

Qwen이 맡는 일은 반복적인 실험 루프다

가장 신뢰할 수 있는 단기적 대체는 반복적인 엔지니어링 반복 작업과 관련되며, 목표, 제약, 결과에 대한 책임은 여전히 사람이 맡는다.

"당신의 일을 빼앗는다"는 표현은 서로 다른 많은 활동을 하나의 극적인 예측으로 묶는다. 소프트웨어 엔지니어링에는 제품 탐색, 아키텍처, 구현, 테스트, 보안 검토, 장애 대응, 협상, 유지보수가 포함된다.

Qwen3.7-Max는 이 모든 기능을 수행하지 않았다. 계측된 환경에서 좁은 최적화 목표를 다뤘다. 가장 강력한 결과는 기계가 사람보다 더 빠르고 오래 실행할 수 있는 루프를 반복한 데서 나왔다.

커널 최적화는 좋은 사례다. 엔지니어는 종종 여러 구현 선택지를 시도하고, 벤치마크를 수행하고, 병목 지점을 검토하며, 대부분의 시도를 폐기해야 한다. 이 작업에는 전문성이 필요하지만, 경과 시간의 상당 부분은 반복 실험에서 발생한다.

이러한 반복을 자동화하는 에이전트는 전문가의 역량 범위를 넓힐 수 있다. 한 명의 엔지니어가 목표를 정의하고, 정확성 테스트를 수립하고, 환경을 감독하며, 사람이 수동으로 수행할 수 있는 것보다 더 큰 탐색 과정을 검토할 수 있다.

이러한 방식은 책임을 없애지 않으면서 업무를 변화시킨다. 여전히 누군가는 무엇이 "더 빠른" 것인지, 어떤 수치 허용 오차가 수용 가능한지, 그리고 최적화가 보안 또는 유지보수 문제를 일으키는지를 결정해야 한다.

모델의 실패 역시 엔지니어링 업무의 일부가 된다. 생성된 코드는 검토가 필요하며, 장시간의 자율 실행에는 어떤 파일이 변경됐는지, 어떤 명령이 실행됐는지, 어떤 가정이 결과를 형성했는지 설명하는 로그가 필요하다.

낙관적 해석이 어느 정도 신뢰를 얻는 지점이 바로 여기다. 지루한 탐색과 측정은 에이전트로 넘어가고, 사람은 시스템 설계와 판단에 더 많은 시간을 쓸 수 있다.

하지만 이러한 이점이 자동으로 보장되는 것은 아니다. 조직은 생산성 향상을 품질 개선, 더 어려운 업무 시도, 인력 감축, 또는 산출량 기대치 상향에 사용할 수 있다. 기술이 경영진이 이익을 어떻게 분배할지 결정하지는 않는다.

개발자는 또한 작업 자동화와 직업 대체를 구분해야 한다. 모델은 이를 둘러싼 비즈니스 맥락을 이해하지 못한 채 상당한 활동을 자동화할 수 있다. 충분한 활동이 자동화 가능해지면 고용주는 여전히 역할을 재편할 수 있다.

전환은 고르지 않게 진행될 가능성이 높다. 테스트가 잘 갖춰진 리포지토리에서 일하는 팀은 검증 도구가 회귀를 빠르게 감지할 수 있기 때문에 에이전트로부터 더 큰 이득을 얻을 것이다. 문서화가 부실한 시스템은 피드백이 약해 에이전트가 그럴듯하지만 해로운 변경을 만들어낼 수 있다.

전문 인프라 작업도 더 쉽게 접근할 수 있게 될 수 있다. 커널 경험이 수년간 없는 개발자라도, 자격을 갖춘 검토자가 정확성과 하드웨어 동작을 확인한다는 전제하에 에이전트를 사용해 구현 옵션을 탐색할 수 있다.

그렇다고 전문성이 중요하지 않게 되는 것은 아니다. 오히려 에이전트가 팀이 과거에는 시도할 시간조차 없었던 후보 작업을 더 많이 생성하기 때문에, 전문가 검토의 가치가 더 커질 수 있다.

이 변화 속에서 지식 관리 역시 더 중요해진다. 제한된 벤치마크를 넘어 에이전트가 작동할 것으로 기대한다면, 에이전트는 요구사항, 과거 의사결정, 런북, 제약 조건에 접근할 수 있어야 한다.

팀들은 이미 인간 엔지니어가 이 맥락을 검색 가능하게 만드는 데 어려움을 겪고 있다. 잘 관리된 기술 지식 베이스는 사람들이 에이전트가 어떤 정보를 사용했는지 검증하고, 실행 전에 누락된 정보를 식별하는 데 도움이 될 수 있다.

에이전트가 사무 업무 전반에서 작동하면 작업의 성격은 다시 바뀐다. Alibaba는 Qwen3.7-Max가 다중 파일 프로젝트와 외부 도구가 관련된 워크플로를 조율할 수 있다고 말한다. 이러한 주장은 모델의 역할을 코드 생성에서 운영 프로세스로 확장한다.

연례 보고서는 Alibaba의 야망을 명확히 보여준다. 회사 경영진은 에이전트가 디지털 작업에서 점점 더 큰 비중을 수행하고, 사람과 소프트웨어 사이의 주요 인터페이스가 될 것으로 기대한다.

이러한 기업 비전은 독립적으로 확립된 전망이 아니라 전략으로 읽어야 한다. Alibaba는 모델, 클라우드 용량, 칩, 에이전트 플랫폼을 판매한다. 에이전트 도입이 넓어질수록 이 사업의 모든 부분이 직접적인 지원을 받는다.

그럼에도 이 회사는 일관된 논지를 중심으로 사업을 구축하고 있다. 모델은 행동을 생성하고, 행동은 클라우드 자원을 소비하며, Alibaba는 그 아래의 인프라를 제공한다. 따라서 Qwen은 제품이자 스택의 나머지 부분에 대한 수요 엔진 역할을 한다.

개발자에게 실질적인 대응은 에이전트의 인내심과 경쟁하는 것이 아니다. 에이전트의 작업이 출시할 가치가 있는지를 결정하는 역량을 강화하는 일이다.

그러한 역량에는 실행 가능한 요구사항 작성, 의미 있는 테스트 구축, 권한 경계 설계, 생성된 변경 사항 검토, 모델이 잘못된 목표를 최적화한 경우를 인식하는 능력이 포함된다.

35시간 실행이 인상적인 이유는 그처럼 제한된 실험을 그렇게 오랫동안 반복하고 싶어 하는 사람이 드물기 때문이다. 조직이 지속성을 완전한 엔지니어링 책임과 혼동할 때에만 그것은 위협이 된다.

Google News 헤드라인이 입증하지 못하는 것

Alibaba가 보여준 것은 설득력 있는 회사 주도 실험이지, 자율 소프트웨어 개발의 보편적 척도는 아니다.

가장 큰 한계는 출처의 집중이다. Alibaba는 모델, 하드웨어, 벤치마크 조건, 성능 주장, 그리고 다수의 경쟁 결과를 제공했다. The Decoder는 인용된 여러 벤치마크가 Qwen 팀에 의해 만들어졌다고 적절히 지적한다.

자체 제작 벤치마크가 본질적으로 무효인 것은 아니다. 기존 평가가 새로운 역량을 더 이상 포착하지 못하기 때문에 모델 개발자가 테스트를 만드는 경우가 많다. 위험은 외부 재현 없이 이러한 테스트를 광범위한 증거로 사용하는 데 있다.

커널 실험에는 다수의 프로덕션 환경에서 발견되는 불확실성도 없다. 측정 가능한 목표, 실행 가능한 코드, 접근 가능한 하드웨어, 긴밀한 피드백 루프가 있었다. 이러한 조건은 자율 반복을 유난히 다루기 쉽게 만든다.

“온보딩을 더 쉽게 하라”와 같은 제품 요구사항은 이에 상응하는 피드백을 제공하지 않는다. 사용자 조사, 디자인 판단, 법적 고려, 상충하는 목표 사이의 선택이 필요하다.

긴 실행 시간은 실수도 증폭할 수 있다. 과도한 접근 권한을 가진 모델은 더 많은 파일을 수정하고, 더 많은 자원을 소비하며, 민감한 정보를 노출하거나, 잘못된 전제에 기반한 의존성을 구축할 수 있다.

도구 호출 횟수 자체가 가치를 측정하는 것은 아니다. 1,158개의 절제된 행동을 수행하는 에이전트는 더 짧은 실행보다 뛰어난 결과를 낼 수 있다. 다른 시스템이 더 적은 작업으로 같은 결과에 도달한다면, 이는 비효율성을 가릴 수도 있다.

따라서 팀에는 운영 지표와 함께 결과 지표가 필요하다. 정확성, 검토 시간, 롤백 빈도, 보안 발견 사항, 배포 전 필요한 인간의 노력을 측정해야 한다.

Qwen3.7-Max가 학습 중 Zhenwu M890 아키텍처를 한 번도 보지 못했다는 Alibaba의 주장도 외부인이 감사하기는 어렵다. 독점 최전선 모델의 학습 데이터셋은 완전한 검사를 위해 공개되는 경우가 드물다.

모델은 참조 구현을 제공받았고, 그 아티팩트에는 계산 방식에 관한 상당한 정보가 담겨 있다. 따라서 문서 없이 시작했지만 기술적으로 의미 있는 출발점 없이 시작한 것은 아니다.

경쟁 모델 비교에도 비슷한 주의가 필요하다. 에이전트의 결과는 하니스, 프롬프트, 도구 인터페이스, 컨텍스트 할당, 종료 정책에 좌우된다. 중립적 평가는 각 모델에 강점에 맞는 구성을 제공해야 한다.

하니스 간 일관성에도 같은 우려가 적용된다. Alibaba는 새로운 학습 접근법이 서로 다른 에이전트 환경에서의 성능 변화를 줄였다고 말한다. 독립 연구자들은 공개 리포지토리와 고정된 평가 규칙을 사용해 이 테스트를 반복해야 한다.

보안은 또 다른 미해결 문제다. 장시간 실행되는 코딩 에이전트는 리포지토리, 문서, 이슈 트래커, 도구 출력 내부의 악성 지시를 마주할 수 있다. 지속적인 자율성은 조작에 활용할 수 있는 시간과 공격 표면을 넓힌다.

권한 설계가 실질적인 방어 수단이 된다. 팀은 작업에 필요한 최소한의 접근 권한만 부여하고, 실행을 격리하며, 완전한 로그를 보존하고, 변경 사항이 민감한 시스템에 도달하기 전에 승인을 요구해야 한다.

인간 검토는 여전히 필요하지만, 실질적이어야 한다. 요약을 훑어본 뒤 대규모 패치를 승인하는 것은 의미 있는 통제를 제공하지 않는다. 검토자에게는 테스트, diff, 출처 정보, 해결되지 않은 불확실성에 대한 명확한 설명이 필요하다.

Alibaba는 학습 중 Qwen3.7-Max의 또 다른 흥미로운 사용 사례를 보고했다. 이 모델은 모델이 의도한 문제를 해결하는 대신 평가를 악용할 때 발생하는 보상 해킹을 위해 소프트웨어 엔지니어링 궤적을 모니터링한 것으로 전해진다.

회사에 따르면 이 에이전트는 86시간 동안 13,952개의 궤적을 검토했다. 13개의 탐지 규칙을 만들고 1,618건의 의심 사례를 표시했다.

이 적용 사례는 에이전트 평가의 가능성과 순환성을 모두 보여준다. 한 모델이 다른 모델의 부정행위를 식별하는 데 도움을 줄 수 있지만, 연구자들은 여전히 그 탐지가 정확했는지 검증해야 한다.

거짓 양성은 정당한 학습 사례를 제거할 수 있다. 거짓 음성은 나중에 인상적인 벤치마크 성능으로 나타나는 지름길에 보상을 줄 수 있다. 따라서 모니터링 에이전트 역시 자체 감사 프로세스가 필요하다.

이러한 불확실성이 35시간 결과를 지우는 것은 아니다. 이는 그 결과가 무엇을 뒷받침할 수 있는지를 정의한다. 통제된 조건에서 최전선 모델이 특화된 최적화 루프를 지속할 수 있다는 증거다.

이는 Qwen3.7-Max가 낯선 프로덕션 시스템을 독립적으로 유지보수하거나, 모호한 이해관계자 요구를 해석하거나, 실패한 배포에 책임을 질 수 있다는 증거는 아니다.

Google News를 통해 유입된 독자는 양극단 모두를 피해야 한다. 이 실험은 연출된 챗봇 데모보다 실질적이지만, 엔지니어링 부서를 대체하는 것보다는 범위가 좁다.

Qwen3.7-Max 출시 이후 주목할 점

Alibaba가 지속 가능한 에이전트 플랫폼을 내놓았는지, 아니면 유난히 유리한 하나의 시연을 내놓았는지는 세 가지 신호가 보여줄 것이다.

첫 번째 신호는 커널 결과의 독립적 재현이다. 연구자들은 작업 정의, 시작 코드, 정확성 테스트, 실행 조건, 프롬프트, 도구 정책, 종료 기준에 접근할 수 있어야 한다.

Alibaba가 아닌 하드웨어에서의 성공적인 재현은 핵심 주장을 강화할 것이다. 반복적인 실패나 비공개 인프라에 대한 높은 의존성은 그 관련성을 좁힐 것이다.

가장 유용한 연구는 하나의 최고 결과를 공개하는 대신 여러 실행을 비교하는 것이다. 에이전트 시스템은 시도마다 결과가 크게 달라질 수 있으므로, 단일 성공 궤적보다 평균과 실패 분포가 더 중요하다.

두 번째 신호는 실제 리포지토리에서 장기간에 걸친 Qwen3.7-Max의 성능이다. 기업은 개입 빈도, 수용된 변경 사항, 되돌린 변경 사항, 검토 시간, 배포 후 발견된 결함을 보고해야 한다.

Alibaba는 소프트웨어 및 에이전트 벤치마크 전반의 점수를 인용하지만, 공개 사례 연구는 이러한 역량이 지저분한 조직 환경에서도 유지되는지를 보여줄 것이다. 유용한 배포는 단지 생성된 코드를 늘리는 것이 아니라 총 인간 노력을 줄여야 한다.

특히 유지보수와 관련된 사례를 주목해야 한다. 새 프로토타입 구축은 폭넓은 자유를 허용하지만, 기존 시스템 유지보수는 과거 의사결정 및 운영 제약과의 호환성을 요구한다.

세 번째 신호는 경쟁 모델 제공업체의 반응이다. Anthropic, DeepSeek, Moonshot AI, Zhipu AI는 이제 더 명확한 평가 규칙을 갖춘 더 긴 자율 실행을 공개할 유인을 갖게 됐다.

제공업체가 재현 가능한 작업과 실패 사례를 공개한다면 경쟁은 증거를 개선할 수 있다. 실행 시간 수치와 자체 선정 벤치마크 승리만 끌어올린다면 증거는 약화될 수 있다.

Alibaba의 이후 에이전트 인프라는 그 방향성에 관한 또 다른 단서를 제공한다. 이 회사는 다수의 에이전트를 추적, 평가, 조율, 관리하기 위한 도구를 도입했다.

이 투자는 핵심적인 진실을 인정한다. 모델 지능만으로는 신뢰할 수 있는 작업자가 만들어지지 않는다. 조직에는 에이전트가 무엇을 했는지 드러내고 피해가 확산되기 전에 사람들이 개입할 수 있도록 하는 통제가 필요하다.

Qwen3.7-Max는 일부 이전 Qwen 출시와 달리 Alibaba의 호스팅 서비스에서만 독점적으로 제공된다. 이러한 선택은 회사에 배포에 대한 더 큰 통제권을 주고, 사용을 클라우드 사업과 더 밀접하게 연결한다.

이는 독립적인 검사를 복잡하게 만들기도 한다. 연구자들은 출력과 행동을 평가할 수 있지만, 모델 뒤의 가중치, 학습 과정, 서빙 변경 사항을 완전히 검토할 수는 없다.

Alibaba는 전략적 트레이드오프에 직면해 있다. 호스팅 접근 방식은 보안 업데이트와 관리형 운영을 지원할 수 있다. 오픈 웨이트는 로컬 제어, 맞춤화, 더 심층적인 기술 평가가 필요한 개발자들 사이에서 도입을 촉진할 수 있다.

더 넓은 Qwen 로드맵은 회사가 이러한 목표의 균형을 어떻게 맞추는지 보여줄 것이다. Alibaba는 일부 오픈 모델과 인프라 구성 요소를 계속 공개하는 한편, 가장 강력한 Max 시스템은 호스팅 접근용으로 남겨두고 있다.

엔터프라이즈 구매자에게 즉각적인 질문은 어느 연구소가 모든 벤치마크에서 앞서느냐보다 더 좁다. 이들은 Qwen3.7-Max가 규정 준수, 데이터, 검토 요구사항 안에서 자신의 업무를 신뢰성 있게 수행하는지 알아야 한다.

짧은 파일럿은 측정 가능한 승인 기준을 갖춘 실제 백로그 항목을 사용해야 한다. 에이전트는 모든 도구 호출이 기록되고 민감한 행동이 차단되는 격리 환경에서 작동해야 한다.

팀은 총 완료 시간을 현재 워크플로와 비교해야 한다. 이 계산에는 프롬프트 준비, 감독, 코드 검토, 테스트, 수정, 문서화가 포함되어야 한다.

개발자도 저위험 내부 작업에서 비슷한 실험을 실행할 수 있다. 반복적인 테스트를 포함하지만 여전히 판단이 필요한 작업을 선택하라. 모델이 어디에서 진전하고, 멈추고, 누락된 맥락을 요청하는지 기록하라.

목표는 에이전트가 누군가를 대체할 수 있음을 증명하는 것이 아니다. 생산적인 위임과 비용이 큰 감독 사이의 경계를 찾는 것이다.

그 경계는 모델이 개선됨에 따라 이동할 것이다. 또한 리포지토리, 조직, 규제 환경에 따라 달라질 것이다. 어떤 Google News 헤드라인도 모든 팀의 그 경계를 결정할 수는 없다.

Alibaba의 실험이 주목받는 이유는 모델이 실제 최적화 과정을 35시간 동안 지속해 나가는 모습을 보여줬기 때문이다. 고무적인 점은 목표가 그 역할 전체가 아니라 반복적인 기술 업무였다는 데 있다.

다음 단계는 이 시스템을 사용할 것으로 예상되는 사람들의 몫이다. 자신의 업무를 기준으로 이 주장을 검증하고, 감독에 드는 전체 비용을 측정하며, 어떤 의사결정은 반드시 사람이 맡아야 하는지 물어야 한다. Qwen3.7-Max가 신중한 엔지니어 한 명이 해낼 수 있는 범위를 꾸준히 넓힌다면, 이 시스템이 맡게 될 가장 중요한 일은 그 엔지니어가 다시는 반복하고 싶지 않았던 업무일지도 모른다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page