top of page

GLM-5.3 Sparse Attention은 연산량을 줄이지만 HBM 수요는 지속된다

12시간 전
10분 분량

GLM-5.3 sparse attention은 각 attention 연산이 읽어야 하는 컨텍스트 양을 줄이지만, 모델의 HBM 용량 문제를 자동으로 해소하지는 않는다. 9월 28일 분석에 따르면 관련 토큰을 선별하려면 여전히 전체 컨텍스트 이력에 접근해야 할 수 있다. 이는 attention 대상 토큰이 줄어들면 GPU 메모리도 비례해 줄어든다는 매력적인 가정에 의문을 제기한다.

이 구분이 중요한 이유는 GLM-5.3가 툴 호출, 파일, 테스트 결과, 수정 작업을 거치며 컨텍스트가 누적되는 장시간 코딩 및 에이전트 작업을 겨냥하기 때문이다. Sparse attention은 핵심 attention 계산 내부의 작업량을 낮춘다. 이전 토큰의 재사용 가능한 key 및 value 표현을 저장하는 KV cache는 전체 시퀀스 길이에 따라 계속 커질 수 있다.

DeepSeek Sparse Attention은 아키텍처의 기준점이 된다. 이 방식의 indexer는 모델이 핵심 attention 계산을 수행하기 전에 유용한 토큰의 제한된 집합을 식별한다. GLM-5.3는 이 방법을 압축 cache 표현, cross-layer index 재사용, 비활성 cache 항목을 host memory로 옮길 수 있는 서빙 소프트웨어와 결합한다.

따라서 핵심 경쟁 구도는 sparse attention과 dense attention의 단순한 대결이 아니다. 알고리즘적 희소성과 긴 대화를 계속 사용할 수 있어야 한다는 물리적 요구 사항의 대결이다. 이 대결은 메모리 절감이 더 낮은 HBM 용량, 더 낮은 대역폭 수요, 더 높은 동시성, 혹은 GPU와 시스템 메모리 간의 다른 균형으로 나타날지를 결정한다.

GLM-5.3 Sparse Attention이 실제로 바꾸는 것

GLM-5.3는 토큰당 비용이 큰 attention 작업량을 줄이지만, 모델은 여전히 이력 전체에서 관련 정보를 찾을 방법이 필요하다.

GLM-5.3는 mixture-of-experts 아키텍처를 사용하는 Z.ai의 GLM-5 제품군에 속한다. Mixture-of-experts 모델은 각 토큰에 대해 전체 파라미터 중 일부만 활성화한다. GLM-5 report에 따르면, 이 제품군은 이러한 라우팅 연산을 DeepSeek의 연구에서 파생된 long-context attention 설계와 결합한다.

Z.ai는 GLM-5.3가 GLM-5.2와 동일한 base model을 사용한다고 밝혔다. 보고된 성능 향상은 또 한 번의 base-model pretraining이 아니라 post-training에서 비롯된다. 즉, 현재의 메모리 논의는 새롭게 고안된 GLM-5.3 attention layer가 아니라 기존 아키텍처가 실제 서빙 부하에서 어떻게 동작하는지에 관한 것이다.

관련 메커니즘은 DSA, 즉 DeepSeek Sparse Attention이다. Sparse attention은 모든 이전 토큰을 동일한 비용으로 처리하는 대신, 선별된 이전 토큰 부분집합에만 full attention을 적용한다. DeepSeek은 V3.2 research에서 이 production-oriented 설계를 소개했다.

DSA는 먼저 lightning indexer라는 경량 컴포넌트를 실행한다. Indexer는 이전 위치에 점수를 매기고 top-k 토큰, 즉 현재 query와 가장 관련성이 높다고 판단된 제한된 집합을 선택한다. 이후 핵심 Multi-Head Latent Attention 계산은 해당 위치들만 대상으로 수행된다.

MLA, 즉 Multi-Head Latent Attention은 각 attention head마다 별도의 전체 key 및 value vector를 저장하는 대신 압축된 latent 표현을 저장한다. 이 압축은 토큰당 저장되는 cache 크기를 줄인다. 이어 sparse selection은 핵심 attention 연산이 읽는 cache의 양을 줄인다.

이는 서로 다른 두 종류의 절감이다. MLA는 각 토큰의 cached state 크기를 겨냥한다. DSA는 비용이 큰 attention 계산에서 소비되는 cached position 수를 겨냥한다.

이 조합은 연산 및 대역폭 프로필을 크게 바꾼다. 핵심 attention은 전체 컨텍스트의 관계를 처리하는 방식에서 고정된 top-k 선택 집합을 처리하는 방식으로 전환될 수 있다. 시퀀스 길이가 길어질수록 이는 핵심 attention 작업량의 증가를 억제한다.

그러나 lightning indexer는 보존된 이력 전체의 후보에 점수를 매길 수 있을 만큼의 정보를 여전히 필요로 한다. 서빙 시스템이 해당 토큰의 사용 가능한 표현을 모두 버렸다면 모델은 오래된 토큰을 선택할 수 없다.

SemiAnalysis examination은 이를 결정적인 한계로 지목한다. Sparse attention은 핵심 scaled dot-product attention 연산 중 메모리 트래픽을 줄인다. 하지만 선택 가능한 컨텍스트를 보존하는 데 필요한 총 메모리 용량을 반드시 줄이지는 않는다.

이 한계는 sparse threshold 아래에서 더 분명해진다. SemiAnalysis가 논의한 구성에서 DSA는 2,048개 position의 top-k 설정을 사용한다. 이보다 적은 position을 포함한 시퀀스에는 줄일 더 큰 후보 풀이 없으므로 attention은 dense 상태로 유지된다.

서빙 엔진은 시퀀스 길이와 배포 토폴로지에 따라 서로 다른 실행 모드도 선택한다. 구현체는 짧은 컨텍스트에서는 더 낮은 연산량 모드를 선호하다가, 메모리 트래픽이 지배적인 요소가 되면 더 낮은 메모리 사용 모드로 전환할 수 있다. 따라서 sparse attention은 모든 요청에서 동일하게 고정된 속도 향상을 제공하지 않는다.

의미 있는 변화는 더 좁은 범위이지만 더 실용적이다. GLM-5.3 sparse attention은 긴 이력을 참조하는 반복 비용을 줄인다. 그렇다고 그 이력이 존재하지 않게 되는 것은 아니다.

더 낮은 Attention 트래픽이 더 낮은 HBM 용량을 의미하지 않는 이유

HBM 부담은 보존된 컨텍스트에서 발생하며, sparse attention은 주로 각 연산에서 GPU가 읽는 보존 항목을 바꾼다.

HBM, 즉 high-bandwidth memory는 accelerator에 직접 연결된 고속 메모리다. 높은 대역폭은 GPU가 대규모 행렬 연산을 처리하도록 돕지만, 제한된 용량은 각 장치에 얼마나 많은 모델과 활성 요청을 담을 수 있는지를 제약한다.

Autoregressive generation 중 모델은 토큰을 하나씩 순차적으로 생성한다. KV cache를 통해 이전 토큰에서 계산한 key와 value를 재사용한다. 이 cache가 없다면 서버는 앞선 시퀀스 전체를 반복해서 다시 계산해야 한다.

따라서 각 활성 요청은 해당 컨텍스트를 위한 메모리를 예약한다. 긴 코딩 세션에는 repository 파일, command output, patch 시도, test log, 이전 추론 과정이 포함될 수 있다. 에이전트는 일반적인 질문·답변 교환보다 훨씬 많은 토큰을 생성할 수 있다.

Sparse attention은 읽기 패턴을 바꾼다. 모든 과거 position을 핵심 attention 연산에 로드하는 대신, 모델은 선택된 top-k 집합을 로드한다. 이는 메모리 대역폭 소비와 선택 이후 수행되는 연산량을 줄일 수 있다.

용량은 다른 규칙을 따른다. 이전 position이 선택 후보로 남아 있다면, 그 표현은 어딘가에서 접근 가능한 상태로 유지돼야 한다. 기존 서빙 설계는 핵심 attention kernel이 일부만 읽더라도 전체 KV 이력을 HBM에 유지한다.

그 결과 시스템은 연산 한계에 도달하기 전에 용량 한계에 도달할 수 있다. 각 요청은 더 적은 attention 작업을 수행할 수 있지만, 여전히 컨텍스트 길이에 비례하는 메모리를 차지한다. 동시성을 높이면 같은 장치에 더 많은 완전한 이력이 올라간다.

이것이 sparse attention이 HBM 수요의 동등한 감소로 곧바로 이어지지 않는 이유를 설명한다. 시스템은 상주 상태를 반드시 줄이지 않은 채 활성 트래픽을 절감한다. 각 attention 단계가 선택적으로 수행되더라도 모델이 이력을 바라보는 논리적 관점은 완전하게 유지된다.

이 차이는 빠른 검색 시스템을 갖춘 대규모 아카이브와 비슷하다. 검색이 빨라지면 한 질문당 읽는 문서 수는 줄어든다. 하지만 오래된 문서가 다른 곳으로 옮겨지거나 사라지지 않는 한 아카이브 자체가 작아지는 것은 아니다.

GLM-5.3 KV cache 압축도 여전히 중요하다. 토큰당 표현이 작아지면 일정한 메모리 예산 안에 더 많은 컨텍스트를 담을 수 있다. 선택된 항목이 attention 연산에 들어갈 때 전송되는 바이트 수도 줄어든다.

하지만 압축된 state 역시 시퀀스 길이에 따라 계속 누적된다. 더 완만한 선형 메모리 곡선도 여전히 선형 메모리 곡선이다. 긴 컨텍스트와 많은 동시 요청은 결국 절감된 용량을 소진할 수 있다.

동시성은 이러한 트레이드오프를 빠르게 드러낸다. SemiAnalysis는 동시 요청 수를 8개에서 16개로 늘리자 GPU memory의 prompt-token 재사용이 줄어든 결과를 보고했다. GPU 재사용 비중은 90.3%에서 54.8%로 하락했다.

같은 비교에서 host-memory 재사용은 6.0%에서 40.3%로 상승했다. 결합된 cache hit rate는 보고된 모든 동시성 수준에서 95%를 웃돌았다. 이 결과는 유용한 cache 용량이 accelerator 밖으로 확장될 수 있음을 보여준다.

이는 host memory가 HBM latency와 같다는 뜻은 아니다. CPU-GPU 연결을 통해 데이터를 이동하면 I/O 비용이 발생하며, cache miss는 다른 면에서 효율적인 decode 경로를 방해할 수 있다. 서빙 시스템은 전송이 generation 시간을 지배하지 않도록 데이터를 예측, fetch, eviction해야 한다.

메모리 시장에 대한 함의도 단순한 수요 감소보다 더 복합적이다. Sparse attention은 attention 단계당 HBM 트래픽을 줄일 수 있다. 동시에 더 저렴해진 long-context inference는 더 긴 세션과 더 높은 요청 동시성을 부추길 수 있다.

이러한 반등은 인프라 계획에서 중요하다. 요청 하나를 처리하는 비용이 낮아지면 운영자는 보통 더 많은 동시 작업을 수용한다. 절감된 메모리 대역폭은 유휴 하드웨어가 되는 대신 추가 처리량으로 전환될 수 있다.

따라서 attention이 더 선택적으로 변해도 HBM 수요는 지속될 수 있다. 전체 이력이 더 크고 느린 메모리 계층으로 이동하면서 host DRAM 수요도 증가할 수 있다. 더 큰 규모에서는 스토리지 시스템이 재사용 가능한 prefix 또는 비활성 cache 데이터를 수용할 수 있다.

실용적인 질문은 더 이상 sparse attention이 추상적으로 메모리를 절감하는지 여부가 아니다. GLM-5.3 KV cache의 각 부분을 어느 메모리 계층이 보관하며, 서빙 엔진이 이를 얼마나 자주 이동시키는지가 핵심이다.

HiSparse는 전체 이력을 GPU 밖으로 옮긴다

HiSparse는 논리적 cache 가용성과 물리적 GPU 상주 상태를 분리해 sparse attention의 선택적 읽기를 실제 HBM 용량 절감으로 전환한다.

SGLang 팀은 sparse-attention 서빙을 위한 계층형 KV cache로 HiSparse를 설계했다. HiSparse는 GPU에 작은 working set을 유지하면서 전체 KV 이력은 pinned host memory에 저장한다. Pinned memory는 accelerator로 예측 가능한 전송을 할 수 있도록 준비된 CPU memory다.

이 설계에서 오래된 cache 항목은 GLM-5.3에서 논리적으로 계속 사용할 수 있다. 다만 모두가 HBM에 물리적으로 상주하지는 않는다. Indexer가 position을 선택하면 GPU에 없는 경우 서빙 시스템이 해당 position을 가져올 수 있다.

HiSparse는 device cache에 least-recently-used 정책을 적용한다. 선택된 토큰이 HBM에 없으면 시스템은 host memory에서 이를 로드한다. GPU working set을 제한된 크기로 유지하기 위해 더 오래 사용되지 않은 항목을 eviction한다.

이 아키텍처는 모델 수준의 특성을 시스템 수준의 절감으로 바꾼다. Sparse attention은 현재 연산에 필요한 작은 집합을 식별한다. HiSparse는 decoding 중 제한된 선택 항목과 working buffer만 HBM을 차지하도록 보장한다.

HiSparse paper는 이 시스템을 exact 및 indexer-agnostic으로 설명한다. Exact는 cache 배치가 모델이 선택한 attention 출력을 의도적으로 근사하지 않고 바뀐다는 뜻이다. Indexer-agnostic은 memory manager가 하나의 선택 알고리즘에 의존하지 않는다는 뜻이다.

평가는 H200, B200, GH200 플랫폼에서 DSA, Native Sparse Attention, Quest를 다룬다. 저자들은 long-context workload에서 최대 4.7배 높은 peak generation throughput을 보고했다.

이는 테스트된 구성에서의 시스템 결과이지, GLM-5.3의 속도가 보장된 배수로 향상된다는 뜻은 아니다. Workload 길이, 요청 동시성, interconnect 대역폭, 선택 locality, cache miss rate가 모두 결과에 영향을 미친다.

HiSparse는 전송과 유효한 연산도 겹쳐 처리합니다. 한 레이어가 실행되는 동안 시스템은 이후 레이어를 위해 선택된 캐시 항목을 준비할 수 있습니다. 이러한 레이어 단위 중첩은 호스트에서 디바이스로의 이동으로 발생하는 지연 시간 일부를 숨깁니다.

크로스 레이어 재사용은 이러한 스케줄링을 더 쉽게 만듭니다. 인접 레이어가 동일한 위치를 많이 선택하면 시스템은 예상 캐시 수요를 미리 파악할 수 있습니다. 한 레이어를 위해 가져온 항목은 이후 레이어에서도 계속 유용할 수 있습니다.

남는 비용은 I/O입니다. 선택 미스가 발생하면 데이터는 CPU 메모리에서 HBM으로 이동해야 합니다. 빈번한 미스, 분산된 선택 또는 제한적인 호스트-디바이스 대역폭은 처리량 향상의 일부를 상쇄할 수 있습니다.

이 위험은 이론적 희소성과 프로덕션 효율성을 가릅니다. 희소 커널은 항목이 도착한 뒤에는 더 적은 항목을 읽을 수 있습니다. 하지만 전체 시스템은 여전히 해당 항목을 찾아 전송하고, 사용할 수 있는 페이지에 매핑하며, 수명 주기를 조율해야 합니다.

첫 토큰까지 걸리는 시간은 또 다른 제약을 만듭니다. 초기 프롬프트를 처리하는 프리필은 토큰 단위 디코딩과 특성이 다릅니다. HiSparse는 주로 캐시가 이미 존재하고 생성이 지속될수록 커지는 디코딩 측을 겨냥합니다.

SGLang의 구현은 HiSparse를 프리필-디코드 분리와 결합합니다. 이 아키텍처는 프롬프트 처리와 토큰 생성을 서로 다른 워커에 할당합니다. 그러면 각 단계는 자체 워크로드에 맞는 메모리 레이아웃과 하드웨어 할당을 사용할 수 있습니다.

이 설계는 인프라 수요도 바꿉니다. HBM은 활성 대화의 유일한 저장소가 아니라 핫 캐시가 됩니다. 호스트 DRAM이 더 큰 기록을 보관하며, 인터커넥트는 크리티컬 패스의 일부가 됩니다.

이는 각 디코딩 요청에 필요한 HBM 용량을 줄일 수 있습니다. 다만 대화를 표현하는 바이트 자체를 없애지는 않습니다. 그중 많은 부분을 다른 위치로 옮기고, 올바른 하위 집합을 GPU 가까이에 유지하는 소프트웨어를 추가합니다.

따라서 운영자에게 중요한 지표는 단순히 모델 크기나 최대 컨텍스트 길이가 아닙니다. 현실적인 동시성 환경에서 요청당 HBM 사용량, 호스트 메모리 할당량, 미스율, 전송량, 출력 토큰 지연 시간을 확인해야 합니다.

희소 어텐션은 이러한 계층형 설계를 가능하게 합니다. HiSparse는 이를 운영 가능한 형태로 만듭니다. 그렇다고 어느 쪽도 메모리 관리를 공짜로 만들지는 않습니다.

IndexShare는 관련 토큰을 찾는 비용을 낮춘다

풀 어텐션이 희소화되면 인덱서 자체가 눈에 띄는 병목이 되며, GLM의 다음 최적화는 레이어 간 선택 결정을 재사용합니다.

표준 DSA 레이어에는 자체 라이트닝 인덱서가 있습니다. 이 구성 요소는 메인 어텐션 계산이 top-k 집합을 선택하기 전에 과거 토큰을 점수화합니다. 인덱서는 풀 어텐션보다 가볍지만, 여전히 컨텍스트를 검사합니다.

컨텍스트가 길어질수록 모든 레이어에서 모든 과거 위치를 반복적으로 점수화하는 비용이 커집니다. 메인 어텐션 경로는 축소되었기 때문에, 한때 사소해 보이던 작업이 전체 지연 시간에서 더 큰 비중을 차지하게 됩니다.

Z.ai는 공개적으로 IndexCache라고도 설명한 IndexShare로 이 문제를 해결합니다. 모든 희소 어텐션 레이어에서 독립적인 인덱서를 실행하는 대신, 레이어 그룹이 공유 선택 결과를 재사용합니다.

이 접근법은 관찰된 패턴에 기반합니다. 인접한 레이어는 종종 동일한 과거 토큰을 많이 선택합니다. IndexCache 연구는 분석에서 인접 레이어의 top-k 선택 사이에 70~100%의 중복이 있다고 보고합니다.

이 중복은 불필요한 반복을 만듭니다. 지정된 풀 레이어가 인덱스를 계산하고, 이후 공유 레이어는 선택된 위치를 재사용할 수 있습니다. GLM에 대해 논의된 프로덕션 패턴은 네 개의 DSA 레이어 그룹마다 하나의 인덱서를 할당합니다.

300억 파라미터 DSA 모델에서 연구진은 보고된 품질 저하가 미미한 상태로 인덱서 계산의 최대 75%를 제거했습니다. 표준 DSA와 비교해 프리필은 최대 1.82배, 디코딩은 최대 1.48배 빨랐다고 측정했습니다.

논문은 초기 프로덕션 규모 GLM-5 결과도 보고합니다. 이 결과는 메커니즘을 뒷받침하지만, GLM-5.3 워크로드와 서빙 스택 전반에 걸친 광범위한 독립 테스트를 대체하지는 않습니다.

선택 재사용에는 자체적인 학습 요구사항이 따릅니다. 공유 인덱서는 단순히 한 레이어의 어텐션 분포에 맞추는 것이 아니라 여러 레이어에 도움이 되는 토큰을 식별해야 합니다. IndexCache는 유지된 인덱서를 그들이 지원하는 어텐션 분포의 평균에 맞춰 학습합니다.

이 조정은 연속된 레이어가 관련되어 있지만 동일하지는 않기 때문에 중요합니다. 초기 레이어는 어휘적 세부 정보를 우선시할 수 있는 반면, 이후 레이어는 중간 처리 과정에서 형성된 의존성을 선호할 수 있습니다. 그룹 구성원 중 하나에만 필요한 토큰을 제거하면 재사용은 해로워집니다.

따라서 이 방법은 두 번째 트레이드오프를 드러냅니다. 더 많은 공유는 추가적인 인덱서 작업을 제거합니다. 더 적은 공유는 레이어별 선택 동작을 더 많이 보존합니다.

IndexShare는 HiSparse와도 상호작용합니다. 레이어가 인덱스를 공유하면 서빙 엔진은 해당 레이어들 전반에서 가져온 캐시 항목을 재사용할 수 있습니다. 공유 선택은 반복적인 top-k 계산을 줄이고 호스트-디바이스 페칭을 더 예측 가능하게 만들 수 있습니다.

이 조합은 세 가지 서로 다른 비용을 공략합니다:

  • MLA는 토큰마다 저장되는 표현을 압축합니다.

  • DSA는 풀 어텐션을 선택된 과거 위치로 제한합니다.

  • IndexShare는 모든 레이어에서 유사한 선택을 재계산하는 일을 피합니다.

  • HiSparse는 비활성 KV 항목을 HBM에서 호스트 메모리로 옮깁니다.

이 구성 요소들을 하나의 메모리 주장으로 합쳐서는 안 됩니다. 압축은 토큰당 바이트 수에 영향을 줍니다. 희소 어텐션은 활성 읽기에 영향을 줍니다. 인덱스 공유는 선택 오버헤드에 영향을 줍니다. 오프로딩은 물리적 배치에 영향을 줍니다.

각 최적화 계층은 병목을 다른 곳으로 옮길 수 있습니다. 더 작은 캐시는 연산 오버헤드를 드러낼 수 있습니다. 더 저렴한 메인 어텐션은 인덱서 지연 시간을 드러낼 수 있습니다. 오프로딩은 전송 대역폭을 드러낼 수 있습니다. 더 높은 동시성은 호스트 메모리 용량을 드러낼 수 있습니다.

하드웨어 특성은 어떤 병목이 먼저 나타나는지를 결정합니다. SemiAnalysis는 GLM의 어텐션 구성 방식이 DeepSeek의 H800 지향 균형과 다르다는 점을 시사하는 산술 집약도 프로필을 추정했습니다. 또한 GLM의 설계와 중국 가속기 공급업체 Moore Threads의 지원을 연결했습니다.

이 하드웨어 해석은 공개된 Z.ai 설계 목표가 아니라 추론에 불과합니다. GLM-5.3은 여러 서빙 프레임워크와 가속기 플랫폼을 지원하므로, 운영자는 자체 배포 경로에서 모델을 측정해야 합니다.

더 넓은 교훈은 GLM-5.3의 희소 어텐션을 단일 FLOP 수치로 평가할 수 없다는 것입니다. 서빙 성능은 인덱서, 압축 캐시, 메모리 계층, 커널, 워크로드의 결합된 동작에서 나옵니다.

진정한 시험대는 프로덕션 메모리 효율성이다

GLM-5.3은 운영자가 용납하기 어려운 비용을 지연 시간, DRAM 또는 운영 복잡성으로 전가하지 않고 장기 에이전트 세션을 유지할 수 있을 때에만 메모리 설계를 검증할 것입니다.

가장 먼저 주목할 신호는 긴 컨텍스트와 높은 동시성에서의 독립적인 GLM-5.3 벤치마킹입니다. 단일 요청의 최고 속도는 많은 지속형 에이전트를 처리하는 서비스에 대해서는 거의 알려주지 못합니다. 테스트는 HBM 사용량, 호스트 DRAM 사용량, 캐시 미스, 지연 시간 분포를 함께 보고해야 합니다.

설득력 있는 결과는 GLM-5.3 KV 캐시 오프로딩이 토큰당 지연 시간을 안정적으로 유지하면서 더 많은 동시 요청을 수용한다는 것을 보여줄 것입니다. 대규모 지연 시간 급증을 감수한 뒤에만 처리량이 증가한다면, 메모리 절감은 인터랙티브 코딩 에이전트에 제한적인 가치만 가집니다.

두 번째 신호는 HiSparse와 유사한 메모리 관리자를 위한 더 폭넓은 배포 지원입니다. SGLang은 HiSparse를 통합했으며, vLLM도 이 아키텍처 관련 작업을 문서화했습니다. 엔진 전반에서 일관된 동작이 확인되면 희소 모델이 프로덕션에서 제한된 HBM 상주성을 활용할 수 있다는 근거가 강해집니다.

분절된 커널 지원은 그 근거를 약화시킵니다. 희소 어텐션은 특화된 선택, 페이지 관리, 캐시 형식, 어텐션 커널에 의존합니다. 모델이 오픈 웨이트라고 해도 제한된 소프트웨어 스택 밖에서는 효율적으로 서빙하기 어려울 수 있습니다.

세 번째 신호는 장기 에이전트 품질에 대한 증거입니다. 메모리 최적화는 모델이 이전 요구사항, 코드 결정, 도구 결과를 신뢰성 있게 검색할 때만 의미가 있습니다. 세션 후반에 나타나는 선택 오류는 진단하기 어려울 수 있습니다.

GLM-5.3의 후학습 전략은 이 점을 특히 중요하게 만듭니다. Z.ai는 내부 Z.ai Code Bench에서 GLM-5.3의 코딩 능력이 GLM-5.2보다 50% 향상됐다고 밝혔습니다. 이는 여전히 회사가 보고한 비교입니다.

Z.ai는 CyberGym에서 GLM-5.3이 84.5%를 기록했다고도 보고했으며, GLM-5.2는 77.2%였습니다. CyberGym은 모델이 소스 코드에서 소프트웨어 취약점을 찾아 검증할 수 있는지를 측정합니다. GLM-5.3 출시 발표는 이러한 향상을 더 강력한 에이전틱 및 사이버보안 역량의 증거로 제시합니다.

이러한 역량은 유용성과 위험을 모두 높입니다. 더 긴 도구 기반 세션은 리포지터리 분석, 테스트, 취약점 연구를 지원할 수 있습니다. 같은 지속성은 익스플로잇 단계를 자동화하거나 서빙 캐시 내부에 민감한 자료를 보존하는 데도 도움이 될 수 있습니다.

따라서 메모리 배치에는 보안 차원이 있습니다. 호스트 DRAM, 공유 프리픽스 캐시, 분산 캐시 계층은 대화 상태가 존재할 수 있는 위치를 늘립니다. 운영자는 모든 계층에 걸쳐 격리, 제거, 접근 제어, 관찰 가능성을 확보해야 합니다.

모델의 Single-Rollout Asynchronous Optimization 작업은 추론 메모리를 직접 줄이지는 않지만 이 맥락에 속합니다. SAO는 프롬프트당 하나의 롤아웃으로 학습하며, 별도의 가치 모델을 사용해 토큰 수준의 반환을 추정합니다.

SAO 논문은 이 방법이 비동기 에이전트 학습에서의 불안정성과 오프폴리시 효과를 다룬다고 말합니다. 이 방법은 GLM-5.2의 에이전틱 학습 파이프라인에 배포됐으며 GLM-5.3의 후학습 계보에 영향을 미쳤습니다.

SAO는 길고 불균일한 에이전트 궤적에 대한 학습 효율성을 개선할 수 있습니다. 또한 가치 모델이 정책 모델과 함께 실행되므로 추가적인 학습 오버헤드가 발생합니다. 이는 한 병목을 줄이는 대신 다른 곳의 비용을 수용하는 또 하나의 사례입니다.

엔터프라이즈 팀의 당면 과제는 규율 있는 평가입니다. 동일한 워크로드에서 전체 프롬프트, 선택된 컨텍스트, 캐시 배치, 미스 동작, 출력 지연 시간, 작업 성공률을 추적해야 합니다. 집계된 초당 토큰 수는 너무 많은 정보를 가립니다.

팀에는 모델 구성과 서빙 실험에 관한 지속적인 기록도 필요합니다. 검색 가능한 지식 베이스는 벤치마크 결과를 커널 버전, 캐시 설정, 배포 인시던트와 연결할 수 있습니다.

GLM-5.3의 희소 어텐션은 긴 컨텍스트를 읽는 경제성을 바꿉니다. 하지만 이를 보존해야 한다는 요구사항을 없애지는 않습니다. 이 아키텍처는 활성 어텐션 트래픽을 낮추고, IndexShare는 선택 오버헤드를 줄이며, HiSparse는 GPU 상주 범위를 제한합니다.

다음 벤치마크 물결의 질문은 구체적입니다. GLM-5.3은 이러한 절감 효과를 호스트 전송이나 검색 품질로 병목을 옮기지 않고 지속적인 동시성으로 전환할 수 있을까요? 측정된 HBM 점유율, 캐시 미스 지연 시간, 장기 에이전트 정확도를 지켜봐야 합니다. 이 신호들을 함께 보면 희소 어텐션이 고립된 더 나은 커널이 아니라 더 나은 서빙 시스템을 제공하는지 알 수 있습니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page