top of page

Xenon Hunmin VLM 397B는 공개됐지만, 더 어려운 테스트에서는 여전히 Qwen-CUA가 앞선다

16분 전
10분 분량

Xenon은 Hunmin VLM 397B를 오픈소스로 공개하며, 8개의 Nvidia B200 GPU로 학습한 3,970억 파라미터 모델에 새로운 컴퓨터 제어 기능을 부여했다. 이번 공개로 화면 인식, 클릭, 타이핑, 다단계 데스크톱 작업을 Apache 2.0 라이선스 아래에서 이용할 수 있게 됐다. 그러나 Xenon이 공개한 자체 결과는 인터페이스 요소를 인식하는 능력과 더 긴 작업을 완료하는 능력 사이에 중요한 차이가 있음을 보여준다.

Xenon Hunmin VLM 397B는 전문 애플리케이션에서 모델이 인터페이스 대상의 위치를 찾을 수 있는지 측정하는 벤치마크인 ScreenSpot-Pro에서 75.6점을 기록했다. 회사에 따르면 이 결과는 모델 출시 당시 해당 벤치마크의 Hugging Face 리더보드에서 2위에 해당했다. 또한 보고된 5개 인터페이스 그라운딩 평가에서 Qwen3.5 기반 모델과 Qwen-CUA를 모두 앞섰다.

하지만 버튼 위치를 찾는 테스트에서 전체 워크플로를 완료하는 테스트로 넘어가면 순위는 달라진다. Xenon은 자체 360개 작업 OSWorld 평가에서 70.5점을 보고했으며, 동일하게 재현한 설정에서 Qwen-CUA는 77.1점을 기록했다. 이 격차는 이번 공개를 단순한 리더보드 발표 이상으로 의미 있게 만든다.

Hunmin은 비교적 작은 학습 클러스터만으로 특화된 기능을 거대한 오픈 모델에 이전할 수 있음을 보여주는 사례다. 다만 시각적 정확도만으로 가장 신뢰할 수 있는 컴퓨터 에이전트가 만들어진다는 증거는 아니다. 개발자와 엔터프라이즈 구매자에게는 모델의 눈에 띄는 파라미터 수보다 이 구분이 더 중요하다.

Xenon Hunmin VLM 397B, Qwen3.5에 컴퓨터 제어 기능 추가

이번 공개는 3,970억 파라미터 기반 모델 전체를 재학습하지 않고 범용 멀티모달 모델을 오픈 컴퓨터 사용 모델로 전환한다.

국제적으로 GenON으로도 알려진 Xenon은 2026년 9월 18일 이 모델을 공개했다. 회사는 Hugging Face의 mncai 조직을 통해 모델을 배포한다. 새 저장소에는 전체 정밀도 모델, FP8 버전, 평가 결과, 구현 가이드가 포함돼 있다.

Hunmin은 Alibaba Qwen 팀의 오픈 웨이트 mixture-of-experts 모델인 Qwen3.5-397B-A17B를 기반으로 한다. 총 파라미터는 3,970억 개이지만, 각 순전파에서는 약 170억 개만 활성화된다. 이 설계는 모든 토큰에 모든 파라미터를 사용하지 않으면서도 매우 큰 모델의 지식 용량을 제공한다.

원래의 Qwen3.5 release는 텍스트, 이미지, 비디오를 위한 네이티브 멀티모달 처리를 도입했다. Xenon은 이 기반을 유지하면서 컴퓨터 사용 기능을 추가했다. 이러한 기능은 모델이 스크린샷을 해석하고, 좌표를 생성하며, 다음에 어떤 인터페이스 동작을 수행해야 할지 결정하도록 한다.

모델의 전체 공개 명칭은 Hunmin-397B-A17B-CUA다. CUA는 사람이 사용하는 그래픽 인터페이스를 통해 작업을 수행하는 시스템인 computer-use agent를 의미한다. 이러한 모델은 웹사이트 API에만 의존하는 대신, 보이는 제어 요소를 통해 브라우저, 오피스 애플리케이션, 데스크톱 소프트웨어를 조작할 수 있다.

이 접근 방식은 Xenon의 이전 Hunmin 작업을 확장한다. 회사는 2025년에 Hunmin 32B를 공개했고, 2026년 초에는 Hunmin VLM 235B를 선보였다. company timeline은 Hunmin 시리즈를 행동 지향적 엔터프라이즈 AI 제품인 OneAgent와도 연결한다.

Xenon은 새 모델이 Qwen3.5의 한국어 성능 대부분을 유지한다고 밝혔다. 보고된 8개 한국어 벤치마크에서 점수는 기반 모델과 비교해 약 2점 이내 차이를 보였다. 일부 개별 결과는 소폭 상승한 반면, 다른 결과는 하락했다.

이 균형은 Xenon에 전략적으로 중요하다. 언어 능력을 지나치게 잃은 컴퓨터 사용 모델은 지시문, 문서, 현지화된 인터페이스를 처리하는 데 어려움을 겪을 수 있다. 한국어 성능을 유지함으로써 회사는 영어 웹 작업에만 최적화된 모델보다 더 분명한 엔터프라이즈 입지를 확보한다.

공개된 model card는 출시 헤드라인보다 더 상세한 정보를 제공한다. 학습 데이터, 소프트웨어 스택, 하드웨어 구성, 비교 설정, 알려진 평가 한계를 명시한다. 또한 기준선 결과를 제공업체 보고 점수가 아니라 저자가 재현한 결과로 표시한다.

이러한 공개는 이번 릴리스의 활용도를 높인다. 개발자는 서로 다른 리더보드의 호환되지 않는 수치를 결합하는 대신, 어떤 비교가 동일한 설정을 공유하는지 확인할 수 있다. 또한 Hunmin의 현재 위치를 규정하는 트레이드오프를 드러낸다.

8개의 B200 GPU가 사후 학습을 수행했다

Xenon의 가장 중요한 주장은 모델의 총 파라미터 수가 아니라 학습 효율성에 관한 것이다.

3,970억 파라미터 기반 모델을 처음부터 학습하려면 8개보다 훨씬 많은 GPU가 필요하다. Xenon은 그렇게 하지 않았다. 기존 컴퓨터 사용 기능을 Qwen3.5로 이전한 뒤, 지도 학습과 강화 학습을 통해 결과 모델을 정제했다.

첫 단계에서는 컴퓨터 제어 행동의 소스로 Qwen-CUA를 사용했다. Xenon은 Qwen-CUA와 이에 대응하는 Qwen3.5 기반 체크포인트 간 파라미터 차이를 계산했다. 이후 큰 행렬을 더 낮은 랭크의 구성 요소로 압축하는 수학적 방법인 절단 특이값 분해를 통해 이 차이를 근사했다.

이 압축된 차이는 LoRA 스타일 어댑터가 됐다. 저랭크 적응인 LoRA는 원래의 모든 가중치를 개별적으로 변경하는 대신, 더 작은 학습 가능한 행렬로 모델 업데이트를 표현한다. Xenon은 이 어댑터를 더 큰 Qwen3.5-397B-A17B 체크포인트에 병합했다.

이 기술이 중요한 이유는 모델 규모가 커질수록 전통적인 미세 조정이 어려워지기 때문이다. 옵티마이저 상태, 그래디언트, 활성화 값, 모델 가중치는 모두 GPU 메모리를 소비한다. 제한된 저랭크 표현만 업데이트하면 학습 데이터 양과 이에 따른 메모리 부담을 줄일 수 있다.

이후 Xenon은 이전된 체크포인트를 FP8로 양자화했다. FP8은 많은 수치 값을 8비트로 저장해 16비트 형식과 비교해 메모리 사용량을 줄인다. 팀은 FP8 QLoRA, 지도 미세 조정, 에이전트 강화 학습을 통해 추가 사후 학습을 수행했다.

지도 미세 조정은 원하는 인터페이스 동작이 포함된 예시를 통해 모델을 학습시켰다. 이후 에이전트 강화 학습은 컴퓨터 환경 내에서 성공적인 행동에 보상을 제공했다. Xenon은 이 단계에서 사용한 강화 학습 방법으로 GRPO, 즉 Group Relative Policy Optimization을 지목한다.

학습 스택에는 MS-Swift, Ray, Megatron-Core, vLLM이 포함됐다. Xenon은 OpenGVLab의 ScaleCUA-Data를 지도 학습 데이터셋으로 명시한다. 또한 ScaleCUA와 CUA-Gym을 강화 학습 환경으로 열거한다.

Xenon에 따르면 전체 사후 학습 과정은 8개의 Nvidia B200 GPU에서 실행됐다. 이 설명은 전체 기반 모델이 8개의 가속기로 만들어졌다는 의미는 아니다. Qwen이 이미 기반 모델을 구축한 뒤, 기능 이전과 사후 학습 단계에 해당 클러스터를 사용했다는 뜻이다.

이 구분은 인상적인 엔지니어링 성과가 오해를 부르는 컴퓨팅 비교로 바뀌는 것을 막는다. Xenon은 Qwen의 원래 모델, Qwen-CUA의 특화 체크포인트, 공개 학습 데이터셋, 확립된 최적화 소프트웨어의 혜택을 받았다. Xenon의 기여는 이 구성 요소를 효율적으로 결합하고 목표 기능에 맞게 조정한 데 있다.

이 방법은 더 작은 AI 공급업체에 가능한 템플릿을 제시한다. 새 기반 모델에 자금을 투입하는 대신, 기업은 오픈 체크포인트에서 시작해 좁은 운영 기술을 추가할 수 있다. 이후 일반 사전학습을 반복하는 대신 작업 데이터, 평가, 강화 학습에 제한된 컴퓨팅 자원을 쓸 수 있다.

이 경로는 학술 연구와 배포 가능한 엔터프라이즈 모델 간 거리도 줄인다. 팀은 애플리케이션, 현지 언어, 통제된 환경에 집중할 수 있다. 결과 모델은 여전히 기반 모델의 폭넓은 시각 및 언어 능력을 물려받을 수 있다.

다만 이 모델은 추론 시점에도 높은 자원을 요구한다. mixture-of-experts 아키텍처는 파라미터 세트의 일부만 활성화하지만, 3,970억 개 가중치 전체를 저장해야 한다. Xenon의 FP8 릴리스는 저장 요구량을 대략 절반으로 줄이지만, 배포에는 여전히 상당한 멀티 GPU 인프라가 필요하다.

따라서 8개 GPU 학습 주장을 8개 GPU 배포 약속으로 해석해서는 안 된다. 어댑터 학습과 병합 모델 서빙은 서로 다른 리소스 요건을 제시한다. 엔터프라이즈 팀은 이 아키텍처를 선택하기 전에 메모리 용량, 인터커넥트 대역폭, 지연 시간, 동시성, 에너지 사용량을 평가해야 한다.

화면 인식은 Hunmin의 가장 뚜렷한 강점이다

Hunmin의 가장 강력한 결과는 특히 복잡한 전문 화면에서 인터페이스 대상을 식별할 수 있음을 보여준다.

그래픽 사용자 인터페이스 그라운딩은 서면 지시를 스크린샷의 특정 위치와 연결한다. 사용자가 에이전트에게 스프레드시트 수식을 선택하라고 요청하면, 모델은 관련 셀이나 도구 모음 제어 요소를 찾아야 한다. 작은 좌표 오류도 에이전트를 잘못된 메뉴로 보내거나 잘못된 파일을 변경하게 할 수 있다.

ScreenSpot-Pro는 고해상도 전문 애플리케이션 전반에서 이 능력을 테스트한다. 이 작업에는 일반 소비자 웹사이트보다 더 복잡하고 실수를 덜 용납하는 인터페이스가 포함된다. ScreenSpot-Pro benchmark는 이전의 그라운딩 테스트가 특수 데스크톱 소프트웨어를 충분히 반영하지 못했기 때문에 설계됐다.

Xenon은 단일 뷰 추론에서 75.6점, 확대 방법에서 76.6점을 보고했다. 재현한 Qwen3.5 기반 점수는 각각 72.7점과 75.1점이었다. 동일하게 보고된 환경에서 Qwen-CUA는 확대 없이 62.2점, 확대 적용 시 71.9점을 기록했다.

Hunmin은 ScreenSpot-v2에서도 96.2점을 기록했으며, 이는 기반 모델의 95.2점과 Qwen-CUA의 95.0점보다 높다. 그라운딩에 초점을 둔 평가인 OSWorld-G에서는 79.9점에 도달했다. 정제된 OSWorld-G-R 버전에서는 86.8점을 기록했다.

모델 카드는 이러한 그라운딩 결과가 Xenon이 재현한 설정에서 평가한 비교 그룹을 이끌었다고 설명한다. 이 표현은 중요하다. 모든 모델, 평가 구성, 이후 제출 결과를 아우르는 영구적인 선두를 확립하는 것은 아니다.

그럼에도 보고된 결과는 일관된 패턴을 보여준다. Hunmin은 하나의 유리한 수치에 의존하기보다 여러 테스트에서 인터페이스 인식을 개선했다. Qwen-CUA 대비 가장 큰 우위는 ScreenSpot-Pro에서 나타나며, Xenon의 설정에서 격차는 13.4점에 이른다.

엔터프라이즈 소프트웨어에서 이 강점은 실질적 가치가 있다. 복잡한 인터페이스는 회계 시스템, 고객 관계 플랫폼, 개발 환경, 내부 관리 도구에서 여전히 흔하다. 이러한 제품 중 다수는 불완전한 API를 제공하거나 보이는 인터페이스 상태를 가로지르는 작업을 요구한다.

그라운딩된 모델은 AI 통합을 전제로 설계되지 않은 오래된 애플리케이션에서도 작동할 수 있다. 구조화된 웹페이지 요소에 의존하는 대신 픽셀과 레이블을 통해 제어 요소를 식별할 수 있다. 이는 적용 범위를 넓히지만, 동시에 신뢰성과 보안 문제도 만든다.

Xenon은 사용자에게 네이티브 해상도 스크린샷을 제공하고 좌표를 0부터 1,000까지 범위로 정규화하도록 안내한다. 이후 생성된 좌표는 화면의 실제 너비와 높이에 맞춰 조정해야 한다. 이러한 세부 사항은 클릭 정확도에 실질적인 영향을 줄 수 있다.

또한 모델은 보고된 컴퓨터 사용 평가에서 5개의 스크린샷으로 시각적 기록을 제한한다. Xenon은 기록을 20개 이미지에 가깝게 늘리면 메모리 사용량과 추론 비용이 증가할 수 있다고 말한다. 더 작은 창은 단순한 벤치마킹 선택이 아니라 배포를 위한 선택을 반영한다.

시각적 기록을 제한하면 서빙 비용을 더 관리하기 쉽게 유지할 수 있다. 하지만 에이전트가 이전 행동, 대화 상자 또는 페이지 상태에 관한 근거를 덜 확보하게 될 수도 있다. 작업이 길어질수록 이 긴장은 더욱 중요해진다.

정확한 한 번의 클릭에는 방대한 기억이 필요하지 않다. 하지만 30단계 워크플로를 완수하려면 필요하다. 이 차이는 Hunmin의 강력한 그라운딩 점수가 완전한 컴퓨터 작업에서의 선두로 자동 연결되지 않는 이유를 설명한다.

Qwen-CUA는 여전히 엔드투엔드 컴퓨터 작업에서 선두

핵심 결과는 엇갈린다. Hunmin은 인터페이스 대상을 더 잘 인식하지만, Qwen-CUA는 더 많은 장기 작업을 완료한다.

OSWorld는 고립된 좌표를 시험하는 대신 실제 컴퓨터 애플리케이션 안에서 에이전트를 평가한다. 작업에는 브라우저, 파일 작업, 이메일 클라이언트, 이미지 편집기, 문서 도구 및 여러 애플리케이션이 포함될 수 있다. 에이전트는 상태를 관찰하고, 행동을 선택하며, 변화에 대응한 뒤 완료될 때까지 계속해야 한다.

공식 OSWorld benchmark는 원래 재현 가능한 초기 상태와 실행 기반 평가를 갖춘 369개의 컴퓨터 작업으로 구성됐다. Xenon은 모델 카드의 결과에 360개 작업 구성을 사용했다. 모든 비교 모델이 동일하게 이미지 5장의 시각적 기록 제한을 사용했다고 밝혔다.

Hunmin은 이 평가에서 70.5점을 기록했다. Qwen3.5 기본 모델은 48.2점에 그쳐 Hunmin의 향상 폭은 22.3점이었다. 이는 상당한 개선이며, 사후 학습이 의미 있는 컴퓨터 제어 행동을 추가했다는 Xenon의 주장을 뒷받침한다.

그러나 동일하게 재현된 환경에서 Qwen-CUA는 77.1점을 기록해 Hunmin을 6.6점 앞섰다. WindowsAgentArena도 같은 순위를 보여준다. Hunmin은 기본 모델의 41.8점에서 9.1점 오른 50.9점을 기록했고, Qwen-CUA는 57.3점에 도달했다.

이 결과가 Hunmin의 그라운딩 향상을 무효화하는 것은 아니다. 정확한 시각적 타기팅만으로는 충분하지 않다는 점을 보여준다. 에이전트는 계획을 세우고, 진행 상황을 추적하며, 오류를 관리하고, 애플리케이션 상태를 이해하고, 워크플로를 이탈시키는 행동을 피해야 한다.

예를 들어 스프레드시트의 수치를 업데이트하고 결과를 이메일로 보내라는 요청을 받은 에이전트를 생각해 보자. 모든 메뉴, 셀, 버튼을 정확히 찾을 수 있다. 그럼에도 잘못된 통합 문서를 수정하거나, 잘못된 범위에 수식을 적용하거나, 오래된 파일을 첨부해 실패할 수 있다.

작업이 길어질수록 작은 실수가 누적된다. 초기 오류는 이후 스크린샷을 바꾸고 원래 계획을 무효화한다. 모델은 잘못된 경로를 확신에 차 계속 따르는 대신, 이러한 이탈을 감지하고 복구해야 한다.

Hunmin의 학습 결과는 일부 개선이 어디에서 비롯됐는지 보여준다. Xenon은 이후 학습 전 역량 전이 체크포인트가 OSWorld에서 66.2점에 도달했다고 밝혔다. 지도 미세 조정과 강화 학습은 이 점수를 70.5점으로 끌어올려 추가로 4.3점을 개선했다.

이 흐름은 Xenon 방식의 가치를 뒷받침한다. 역량 전이가 초기 컴퓨터 사용 능력의 상당 부분을 제공했고, 작업 특화 사후 학습이 이를 개선했다. 하지만 남아 있는 Qwen-CUA의 우위는 일부 행동이 불완전하게 압축됐거나 통합 과정에서 변했을 가능성을 시사한다.

한국어 중심의 목표 역시 이러한 절충에 영향을 미칠 수 있다. Hunmin은 여러 비교에서 Qwen-CUA보다 8개 한국어 벤치마크 전반의 성능을 더 잘 유지한다. Xenon은 가능한 한 높은 OSWorld 점수만을 최적화하지 않았다.

예를 들어 Hunmin은 KMMLU-Pro에서 76.1점을 기록했고, Qwen-CUA는 71.4점이었다. K-MMStar에서도 Hunmin은 80.3점, Qwen-CUA는 75.0점에 도달했다. 이러한 결과는 보다 균형 잡힌 다국어 프로필을 시사하지만, 여전히 회사가 재현한 평가라는 한계가 있다.

이러한 균형은 한국 기업에 중요할 수 있다. 모델의 클릭 능력이 유용해지기 전에 먼저 현지 지시문, 문서, 용어 및 사용자 인터페이스를 이해해야 한다. 더 높은 영어 중심 에이전트 점수가 모든 도입 결정을 확정하지는 않는다.

그럼에도 Xenon은 그라운딩 선도 성과를 전반적인 컴퓨터 사용 선도 성과와 동등한 것으로 제시해서는 안 된다. 모델 카드는 불리한 OSWorld 비교 결과를 공개함으로써 이 실수를 피한다. 엔드투엔드 격차를 설명하지 않은 채 ScreenSpot-Pro 2위를 강조하는 출시 보도는 덜 유용하다.

구매자에게 적절한 비교는 의도한 워크로드에 달려 있다. 밀집된 인터페이스 타기팅이 중심인 워크플로라면 Hunmin의 특성이 유리할 수 있다. 복구와 계획이 필요한 더 긴 작업 순서는 Qwen-CUA 대비 현재의 약점을 드러낼 수 있다.

모델의 개방성은 팀에 또 다른 선택지를 제공한다. 개발자는 릴리스를 검토하고, 이를 조정하며, 자체 소프트웨어에서 통제된 평가를 수행할 수 있다. 이런 유연성은 가치 있지만, 애플리케이션별 테스트의 필요성을 없애지는 않는다.

오픈 웨이트가 배포 위험을 없애지는 않는다

Apache 2.0 접근성은 통제력을 높이지만, 다운로드 가능한 컴퓨터 사용 모델이 안전한 자율 작업자와는 아직 거리가 멀다.

Xenon은 원본 모델과 FP8 변형을 모두 Apache 2.0으로 공개했다. 이 라이선스는 일반적으로 조건을 준수하는 한 상업적 사용, 수정 및 재배포를 허용한다. 호스팅 인터페이스를 통해서만 제공되는 폐쇄형 에이전트보다 기업에 더 큰 배포 자유를 제공한다.

공개 접근성은 비공개 평가도 가능하게 한다. 기업은 스크린샷을 제3자 모델 제공업체에 보내지 않고 내부 애플리케이션에서 Hunmin을 테스트할 수 있다. 팀은 현지 언어, 특수 양식 및 조직별 워크플로에서의 동작을 측정할 수 있다.

하지만 모델 접근성은 컴퓨터 사용 시스템의 한 계층일 뿐이다. 프로덕션 에이전트에는 여전히 런타임, 행동 제어기, 권한 모델, 감사 추적, 자격 증명 전략 및 복구 프로세스가 필요하다. 웹페이지나 문서에 삽입된 악의적 지시에 대한 방어도 필요하다.

컴퓨터 사용 모델은 운영 계정이 접근할 수 있는 모든 것과 상호작용할 수 있다. 여기에는 이메일, 고객 기록, 클라우드 스토리지, 내부 대시보드 및 금융 애플리케이션이 포함될 수 있다. 한 번의 잘못된 행동은 잘못된 챗봇 답변과는 다른 결과를 낳을 수 있다.

화면 그라운딩 벤치마크는 권한 부여나 의도에 관한 근거를 거의 제공하지 않는다. 올바른 “Delete” 버튼을 찾는 것은 그것을 누르는 행위가 정책을 위반하더라도 기술적으로는 성공이다. 주변 에이전트 시스템은 해당 행동이 허용되는지, 사람의 승인이 필요한지를 판단해야 한다.

벤치마크 작업도 통제된 상태에서 시작한다. 실제 데스크톱에는 알림, 소프트웨어 업데이트, 브라우저 확장 프로그램, 만료된 세션, 사용자 지정 레이아웃 및 일관되지 않은 창 크기가 쌓인다. 이러한 변동은 모델이 보는 것과 행동의 결과를 모두 바꿀 수 있다.

Xenon은 여러 평가 한계를 인정한다. 결과는 스크린샷 해상도, 추론 설정, 상호작용 제한, 서빙 소프트웨어 및 벤치마크 버전에 따라 달라진다고 밝혔다. 또한 훨씬 긴 스크린샷 기록을 사용해 나온 결과와 점수를 직접 비교하지 말라고 경고한다.

이러한 주의 사항은 독자가 릴리스의 모든 수치를 해석하는 방식에 반영돼야 한다. 회사는 자체 환경에서 기준 모델을 재현했다. 이는 더 공정한 내부 비교를 만들지만, 독립 팀들이 아직 결과를 폭넓게 재현하지는 않았다.

리더보드 순위도 또 다른 불확실성을 안고 있다. 새로운 모델과 추론 방식이 등장함에 따라 ScreenSpot-Pro 순위는 바뀔 수 있다. 출시 당시 2위는 영구적인 지위가 아니라 시점이 지난 스냅샷이다.

파라미터 규모 역시 운영 위험을 초래한다. FP8 양자화와 희소 활성화를 적용하더라도 조직에는 적합한 인프라가 필요하다. 더 작은 특화 모델이 더 낮은 지연 시간, 간단한 배포 및 쉬운 미세 조정으로 충분한 정확도를 제공할 수 있다.

따라서 팀은 워크플로 수준에서 시스템을 비교해야 한다. 유용한 지표에는 완료율, 개입 빈도, 평균 단계 수, 복구 성공률, 지연 시간 및 실패한 행동의 심각성이 포함된다. 단일 종합 벤치마크 점수는 이 모든 차원을 포착할 수 없다.

이 원칙은 에이전트 운영을 둘러싼 지식 업무에도 적용된다. 팀은 지시, 출력, 예외 및 인간의 결정을 검색 가능한 기록으로 남겨야 한다. 통제된 AI knowledge base는 검토자가 자동화 작업이 특정 결과를 낳은 이유를 재구성하는 데 도움이 될 수 있다.

이것만으로 에이전트가 안전해지는 것은 아니다. 검토, 디버깅 및 정책 개선을 위한 근거를 만든다. 컴퓨터 사용 시스템은 그 행동이 이를 승인한 문서와 결정에 계속 연결될 때 더 쉽게 관리할 수 있다.

Xenon의 릴리스는 가장 강력한 점수와 함께 한계와 불리한 비교 결과를 공개했다는 점에서 인정받을 만하다. 이러한 투명성은 개발자가 더 나은 질문을 하도록 돕는다. 다음 단계는 역량과 실패 결과를 모두 측정하는 독립 테스트다.

Hunmin이 격차를 좁힐 수 있는지 보여줄 세 가지 신호

Hunmin의 중요성은 이제 독립 재현, 더 나은 장기 작업 결과, 모델 저장소를 넘어선 도입에 달려 있다.

첫 번째 신호는 독립적인 벤치마크 재현이다. 외부 연구자들은 동일한 하드웨어, 스크린샷 기록, 추론 설정 및 작업 하네스에서 Hunmin, Qwen3.5 및 Qwen-CUA를 실행해야 한다. 유사한 결과가 나온다면 저순위 전이가 유용한 컴퓨터 제어 역량을 보존했다는 Xenon의 주장은 더 강해질 것이다.

재현은 ScreenSpot-Pro에만 국한돼서는 안 된다. 연구자들은 그라운딩, 전체 작업 완료, 복구, 지연 시간 및 리소스 소비를 테스트해야 한다. 종합 점수뿐 아니라 실패 범주도 공개해야 한다.

독립 실행에서 75.6의 그라운딩 결과와 70.5의 OSWorld 점수가 재현된다면 Xenon의 평가에 대한 신뢰는 높아질 것이다. 큰 차이가 발생한다면 출시 서사는 약화되고 구성 민감성을 가리키게 된다.

두 번째 신호는 Xenon이 Qwen-CUA와의 장기 작업 격차를 좁히는지 여부다. 현재 모델은 이미 대상을 정확히 찾으므로, 다음 개선은 계획과 상태 관리에서 나와야 한다. 더 나은 메모리, 더 강력한 강화 학습 환경 또는 향상된 오류 복구가 엔드투엔드 완료율을 높일 수 있다.

향후 체크포인트는 한국어 성능을 희생하지 않으면서 보고된 OSWorld 6.6점 격차를 줄여야 한다. 그러한 결과는 효율적인 사후 학습으로 균형 잡히고 실용적인 컴퓨터 사용 모델을 만들 수 있다는 Xenon의 주장을 뒷받침할 것이다. 그라운딩 개선만으로는 핵심 한계가 해소되지 않는다.

세 번째 신호는 OneAgent 또는 다른 엔터프라이즈 제품 안에서의 배포다. 공개 체크포인트는 기술적 접근성을 보여주지만, 제품 사용은 모델이 지연 시간 제약과 예측 불가능한 인터페이스를 견디는지를 드러낸다. 실제 도입은 기업이 모델의 인프라 요구 사항을 감수할 만큼 현지 언어 제어를 가치 있게 여기는지도 보여줄 것이다.

Xenon은 새 역량을 활용해 OneAgent를 개선하고 AI가 수행할 수 있는 업무를 확장할 계획이라고 밝혔다. 구매자들은 명시된 배포 사례, 재현 가능한 워크플로, 개입률 및 벤치마크 환경 밖에서도 작업이 신뢰성을 유지한다는 근거를 지켜봐야 한다.

가장 유용한 사례 연구는 성공만큼이나 경계를 명확히 설명할 것이다. 에이전트가 어떤 애플리케이션을 조작할 수 있는지, 어떤 행동에 승인이 필요한지, 사람이 얼마나 자주 개입해야 하는지를 식별해야 한다. 이러한 세부 정보가 없다면 고객 발표는 기술적 근거를 거의 제공하지 못한다.

Xenon Hunmin VLM 397B는 이미 주목할 만한 엔지니어링 릴리스다. 비교적 집중된 팀이 사후 학습을 위해 8개의 고성능 GPU를 사용해 거대한 오픈 모델에 컴퓨터 제어 행동을 추가할 수 있음을 보여준다. 자체 수치 역시 손쉬운 승리 서사를 허용하지 않는다.

모델을 평가하는 개발자는 좁은 워크플로와 되돌릴 수 있는 샌드박스에서 시작해야 한다. 클릭 정확도만이 아니라 전체 작업 성공을 측정하고, 모든 개입 또는 복구를 기록해야 한다. 그런 다음 동일한 조건에서 Qwen-CUA 및 더 작은 대안과 결과를 비교해야 한다. 오픈 라이선스는 이러한 작업을 가능하게 하지만, Hunmin의 그라운딩 우위가 신뢰할 수 있는 행동으로 이어지는지는 독립 테스트만이 입증할 수 있다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page