top of page

Monodratic, 학습된 라우팅으로 희소 인과 어텐션을 더 선택적으로 만들 수 있다고 주장

Monodratic은 눈에 띄는 결과와 함께 등장했다. 학습된 라우터는 원격 블록 두 개만 선택하고도 768개의 합성 리콜 질문 중 763개에 정답을 냈다. 평균 99.35%라는 수치는 희소 인과 어텐션이 오랫동안 안고 있던 문제에 도전한다. 모든 쿼리가 고정된 패턴을 따를 때 어텐션 비용을 줄이는 일은 쉽다. 모든 정보를 훑지 않고도 멀리 떨어진 올바른 정보를 찾는 일은 훨씬 어렵다.

이 독립 프로젝트는 쿼리를 이전 토큰의 작은 그룹으로 유도하는 시스템인 학습된 제품 해시 라우팅을 제안한다. 원격 후보를 보장된 로컬 컨텍스트와 결합한 뒤, 선택된 토큰에만 정확한 인과 softmax를 적용한다. 작성자의 연구 게시물에 따르면, 학습되지 않은 라우터는 425개의 정답을 냈다. 로컬 전용 어텐션은 151개에 그쳤다.

이 수치들은 핵심적인 긴장을 드러낸다. Monodratic은 통제된 과제에서 유용한 라우팅을 학습하는 듯 보이지만, 완전한 언어 모델로서는 아직 시험되지 않았다. CPU 스케일링 결과 역시 가속기에서의 프로덕션 추론이 아니라 균형 잡힌 라우팅 구성만을 측정한다. 따라서 이 프로젝트는 메커니즘 차원에서 학습된 희소 어텐션 연구에 문제를 제기하면서도, 실질적 가치는 미해결 상태로 남긴다.

Monodratic은 희소 어텐션을 검색 결정으로 바꾼다

Monodratic의 중요한 변화는 또 하나의 고정 희소 마스크가 아니라는 점이다. 각 쿼리에 제한된 수의 이전 블록으로 향하는 학습된 경로를 부여한다.

밀집 인과 어텐션은 모든 토큰이 조건을 충족하는 모든 이전 토큰을 살필 수 있게 한다. 이는 컨텍스트에 폭넓게 접근할 수 있게 하지만, 어텐션 행렬은 시퀀스 길이에 따라 제곱으로 증가한다. 시퀀스 길이가 두 배가 되면 어텐션 연산 내 쿼리-키 비교 수는 대략 네 배가 된다.

전통적인 희소 설계는 미리 정의된 연결을 통해 이 행렬을 줄인다. 토큰은 로컬 윈도우, 일정 간격의 위치 또는 몇 개의 전역 토큰에 어텐션할 수 있다. 이런 패턴은 비용을 통제하지만, 관련 정보가 나타나는 위치를 반드시 반영하지는 않는다.

대신 Monodratic은 원격 어텐션을 제약된 검색 문제로 취급한다. 일반적으로 RoPE라고 불리는 rotary positional encoding 이후, 소스 블록에는 학습된 제품 주소가 부여된다. RoPE는 어텐션 점수를 계산하기 전에 쿼리와 키 표현을 회전시켜 토큰 위치를 주입한다.

각 제품 주소는 여러 학습된 코드 구성 요소의 결정을 결합한다. 생성된 주소는 해당 위치에 할당된 제한된 소스 블록 집합인 포스팅 리스트를 가리킨다. 쿼리는 주소를 탐색해 후보를 받고, 이를 재순위화한 뒤 고정된 수의 원격 블록을 선택한다.

쿼리에는 보장된 로컬 블록도 제공된다. 인접 토큰은 구문, 단거리 의존성, 그리고 자기회귀 시퀀스의 즉각적인 상태를 담고 있기 때문에 중요하다. 학습된 라우팅은 모든 쿼리마다 지역성을 다시 발견할 필요가 없다.

최종 어텐션 계산은 선택된 집합 내에서 정확하게 유지된다. Monodratic은 선택된 원격 및 로컬 블록의 토큰에 일반적인 인과 softmax를 적용한다. 후보 선택 이후 어텐션 점수를 근사하지 않는다.

이 구분은 라우팅 품질과 어텐션 품질을 나눈다. 라우터는 어떤 블록이 방 안에 들어오는지를 결정한다. 이후 표준 softmax가 허용된 각 토큰이 어느 정도의 영향력을 갖는지 결정한다.

작성자는 이 구성 요소를 상태 비저장 믹서로 구현했다. 배치, 시퀀스, 너비 형태의 텐서를 받아 어텐션 델타를 반환한다. 호스트 모델은 정규화, 잔차 연결, 피드포워드 레이어, 추론 스케줄링을 계속 담당한다.

이 모듈 경계는 실험을 더 쉽게 검토할 수 있게 한다. 동시에 Monodratic이 완전한 transformer 아키텍처나 배포 가능한 언어 모델은 아니라는 뜻이기도 하다. 공개 코드 저장소는 구현, 보고서, 구성, 테스트 및 재현 경로를 제공한다.

인과성도 또 다른 중요한 제약이다. 소스 블록은 자신보다 앞선 위치의 쿼리에서 사용할 수 있게 되어서는 안 된다. 이 프로젝트는 인과 포스팅 리스트를 설명하고 선택 집합 어텐션 중 인과 마스크를 적용한다.

이 접근법은 미묘한 실패 모드를 다룬다. 희소 시스템은 라우팅 단계에서 미래 정보를 누출하면서도 효율적으로 보일 수 있다. 최종 softmax가 인과적으로 보이더라도 이러한 누출은 자기회귀 결과를 무효화한다.

제한된 포스팅 리스트는 또 다른 시스템 위험을 해결한다. 학습된 해싱은 많은 블록을 같은 주소로 보낼 수 있어, 불균등한 버킷과 예측하기 어려운 작업량을 만들 수 있다. 엄격한 용량 제한은 반환되는 각 리스트를 정해진 한도 내에 유지한다.

용량은 그 자체로 절충을 만든다. 오버플로 처리 과정에서 블록이 폐기되거나 다른 곳으로 보내질 수 있으며, 관련 정보를 가릴 가능성이 있다. 작성자는 공개된 학습 라우팅 및 스케일링 실행에서 포스팅 오버플로가 0건이었다고 보고했지만, 이 실행은 통제된 구성을 사용했다.

따라서 이 사건은 새로운 장문맥 모델 출시보다 범위가 좁다. 한 독립 연구자가 이례적으로 투명한 제어 장치를 갖춘 라우팅 프리미티브를 공개했다. 이 메커니즘이 더 어려운 데이터, 더 큰 모델, 실제 하드웨어에서도 살아남는지에 그 가치가 달려 있다.

지금 학습된 제품 해시 라우팅이 중요한 이유

장문맥 모델에는 선택적 메모리 접근이 필요하지만, 선택 오버헤드는 희소성이 약속하는 절감 효과를 지워버릴 수 있다.

희소 어텐션은 수년간 같은 긴장을 조율해 왔다. 유용한 패턴은 쿼리를 멀리 있는 근거와 연결해야 한다. 효율적인 패턴은 그 연결을 발견하기 위해 밀집 연산을 수행하는 일을 피해야 한다.

2021년 Routing Transformer는 영향력 있는 콘텐츠 기반 접근법을 제시했다. 온라인 k-means 클러스터링으로 쿼리와 키를 그룹화해 어텐션 복잡도를 제곱 수준에서 \(O(n^{1.5}d)\)로 낮췄다. 저자들은 라우팅 연구에서 언어 모델링과 이미지 생성의 개선을 보고했다.

이 연구는 고정 윈도우에 대한 지속적인 대안을 확립했다. 시퀀스를 읽기 전에 선택된 패턴을 수용하는 대신, 콘텐츠가 연결성을 결정할 수 있다. 그러나 클러스터링, 균형 조정, 하드웨어 활용은 여전히 설계의 어려운 부분이다.

보다 최근의 시스템들은 토큰 점수화, 블록 선택, 키-값 캐시 압축, 밀집 및 희소 헤드 결합을 탐색해 왔다. 공통의 목표는 단순히 어텐션 항목을 줄이는 것이 아니다. 유용한 정보를 담은 항목을 보존하는 일이다.

Monodratic은 특정한 시스템 제안으로 이 흐름에 합류한다. 제품 주소는 정확한 어텐션이 일어나기 전에 검색 공간을 좁힐 수 있다. 포스팅 리스트 용량은 반환 작업량을 제한하고, 재순위화는 검색된 후보 사이에서 정확도를 회복할 수 있다.

이는 어텐션 내부의 정보 검색 파이프라인과 닮아 있다. 인덱스 할당은 거친 필터를 만든다. 쿼리 탐색은 후보를 생성한다. 재순위화는 더 정교한 결정을 내린다. 정확한 어텐션은 최종 가중 집계를 처리한다.

이 아키텍처의 블록 수준 선택은 중요하다. 개별 토큰을 선택하면 GPU가 잘 처리하지 못하는 분산 메모리 접근이 생길 수 있다. 블록은 더 규칙적인 데이터 이동을 제공할 수 있지만, Monodratic은 아직 융합된 가속기 커널로 이 장점을 입증하지 않았다.

보고된 과제는 연관 리콜이었다. 이러한 과제는 모델이 시퀀스의 다른 위치에 놓인 키와 연결된 값을 검색할 수 있는지를 시험한다. 개방형 언어 모델링보다 장거리 접근을 더 깔끔하게 분리한다.

적격 블록 다섯 개 중 원격 블록 두 개를 선택하는 조건에서, 학습된 버전은 768개 시행과 세 개의 시드 전체에서 763개의 정답을 기록했다. 평균 정확도는 99.35%였고, 보고된 최저치는 98.05%였다.

동일한 폭의 학습되지 않은 라우터는 425개의 정답을 반환했다. 로컬 전용 어텐션은 151개를 기록했다. 이 통제 조건은 성능이 학습된 라우팅, 무작위 연결성, 또는 인접 컨텍스트만으로부터 나왔는지를 시험하기 때문에 중요하다.

763과 425의 차이는 작성자의 제한적인 주장을 뒷받침한다. 이 합성 설정에서 학습은 라우팅 행동을 충분히 바꿔 리콜을 크게 향상시켰다. 이는 자연어에서 비슷한 향상을 입증하지는 않는다.

또 다른 진단에서는 레이블된 타깃 블록을 선택 집합에 강제로 포함했다. 동일한 최대 2단계 어텐션 예산에서 이 개입은 남아 있던 다섯 오류를 모두 회복해 768개의 정답에 도달했다.

이 결과는 관찰된 실패를 특정 위치에 국한한다. 관련 블록이 후보 집합에 들어오면, 선택 집합 어텐션은 정답을 생성할 수 있었다. 따라서 남은 오류는 최종 어텐션 계산보다 라우팅 리콜과 관련된 것으로 보인다.

실험은 희소 선택 집합 어텐션을 독립적으로 구성한 밀집 마스크 오라클과도 비교했다. 최대 절대 차이는 \(1.43 \times 10^{-6}\)로 보고됐다. 이 일치는 희소 수집과 인과 마스킹이 동일한 선택 위치에 대해 의도된 밀집 계산을 재현하는지 점검한다.

이는 언어 이해의 증거가 아니라 우수한 실험 위생이다. 선택한 마스크 내 구현 일관성을 검증한다. 마스크가 실제 모델에 필요한 근거를 담고 있는지는 판단할 수 없다.

프로젝트는 4,096개에서 32,768개 토큰 사이에서 0.993의 적합된 CPU 타이밍 지수도 보고한다. 이는 고정되고 균형 잡힌 구성에서 측정한 패킹 라우팅 구현의 거의 선형적인 성장에 가깝다.

단서가 중요하다. 다섯 개 시퀀스 길이에 걸친 적합 지수가 보편적인 점근 동작을 확립하지는 않는다. 또한 가능한 모든 인덱스 구축, 디코딩, 메모리 전송 또는 가속기 비용을 포함하지도 않는다.

작성자는 더 광범위한 주장을 명시적으로 피한다. 보고서는 자연어 품질, 점근적으로 선형적인 구축, 배포 속도 또는 융합 커널의 이점을 주장하지 않는다. 이러한 절제는 공개된 결과를 실제 조건에 맞춰 더 쉽게 평가하게 한다.

학습된 라우팅은 밀집 어텐션의 신뢰성 우위와 맞선다

핵심 경쟁은 학습된 선택적 접근과, 조건을 충족하는 모든 키가 계속 이용 가능하다는 밀집 어텐션의 단순한 보장 사이에 있다.

밀집 어텐션에는 별도의 검색 정책이 필요하지 않다. 관련 토큰이 인과 접두사에 존재하면 어텐션 레이어는 이를 점수화할 수 있다. 모델은 여전히 그 근거를 활용하지 못할 수 있지만, 연결 패턴이 먼저 이를 제외하지는 않았다.

희소 라우팅은 새로운 실패 경계를 도입한다. softmax가 가중치를 할당하기 전에 라우터가 올바른 블록을 검색해야 한다. 정확한 어텐션은 누락된 토큰을 결코 보지 못하기 때문에, 누락은 해당 레이어에서 결정적이다.

Monodratic의 강제 타깃 테스트는 이 경계를 명확히 드러낸다. 레이블된 블록을 포함했을 때 남아 있던 다섯 합성 오류가 모두 사라졌다. 이는 라우터 리콜을 이 메커니즘의 핵심 품질 지표로 만든다.

이 설계는 여러 단계를 통해 리콜을 개선하려 한다. 제품 해싱은 압축된 주소 공간을 만든다. 여러 탐색은 인접하거나 그럴듯한 주소를 포괄할 수 있다. 이후 재순위화가 후보에서 고정된 수의 원격 블록을 선택한다.

로컬 블록은 안전망을 제공한다. 원격 라우팅이 불확실할 때도 즉각적인 컨텍스트를 보존한다. 그러나 로컬 전용 결과가 보여주듯, 지역성은 윈도우 밖 멀리 배치된 의존성을 복구할 수 없다.

밀집 어텐션의 신뢰성에는 긴 시퀀스 길이에서 높은 계산 비용이 따른다. 모든 쿼리는 계속 확장되는 접두사와 비교된다. 메모리 트래픽과 키-값 캐시도 추론 시스템에 부담을 준다.

희소 어텐션은 이러한 비용 절감을 실제 지연 시간 또는 용량 이점으로 전환해야 한다. 라우팅, 정렬, 수집, 불규칙한 메모리 접근이 실행 시간을 지배한다면, 이론적으로 더 작은 어텐션 집합만으로는 충분하지 않다.

Monodratic은 아직 이 시스템적 임계점을 넘지 못했다. 구현은 이식성 높은 PyTorch를 사용하며, 시간 측정 연구는 CPU에서 수행됐다. 공개된 벤치마크 중 최적화된 GPU용 밀집 어텐션 커널과 종단 간 처리량을 비교한 것은 없다.

이 아키텍처의 상태 비저장 인터페이스는 통합 실험에 유용하다. 호스트 모델은 정규화나 잔차 상태 관리를 맡기지 않고도 일반적인 트랜스포머 블록 내부에 이 믹서를 배치할 수 있다.

이 유연성은 중요한 결정을 뒤로 미루기도 한다. 실제 배포된 디코더는 새 토큰이 들어올 때 라우팅 구조를 갱신해야 한다. 쿼리를 효율적으로 스케줄링하고, 인과성을 보존하며, 라우터를 키-값 캐시 저장소와 조율해야 한다.

배치 처리도 또 다른 과제를 더한다. 서로 다른 시퀀스는 서로 다른 주소를 탐색하고 다른 블록을 반환할 수 있다. 구현이 작업을 규칙적인 형태로 묶지 못하면, 이러한 변동성은 하드웨어 활용률을 낮출 수 있다.

경계가 설정된 포스팅 리스트는 이 문제를 더 관리하기 쉽게 만든다. 예측 가능한 리스트 크기는 최악의 후보 볼륨을 제한할 수 있다. 그러나 실제 텍스트는 균형 잡힌 합성 데이터와 다른 주소 분포를 만들 수 있다.

밀집 어텐션은 품질 기준선을 설정하고 수년간의 커널 최적화 혜택을 받기 때문에 여전히 경쟁 상대다. 고정 희소 패턴도 관련된 맥락이지만, 궁극적으로 Monodratic이 충족해야 할 가장 강력한 기준은 아니다.

학습된 라우터는 의미 있는 시스템 제약을 줄이면서 모델 품질을 유지할 때에만 그 가치를 입증한다. 이는 더 낮은 지연 시간, 더 작은 캐시, 더 긴 컨텍스트 또는 동일한 하드웨어 예산에서 더 나은 처리량을 의미할 수 있다.

관련 연구는 하이브리드 설계가 여전히 매력적인 이유를 보여준다. Mixture of Sparse Attention, 즉 MoSA는 expert-choice 라우팅을 사용해 어텐션 헤드가 볼 토큰을 선택한다. 저자들은 MoSA experiments에서 동일한 연산 예산 기준으로 최대 27% 더 나은 퍼플렉서티를 보고했다.

하지만 이 논문은 순수 희소 변형 모델이 학습하기 어렵다는 사실도 확인했다. 가장 강력한 설계는 밀집 헤드 네 개를 유지했으며, 순수 MoSA는 대체로 밀집 기준선보다 성능이 낮았다. 저자들은 이러한 현상을 라우팅과 어텐션 간의 불안정한 조정과 연결한다.

Monodratic은 현재 이 밀집 대 희소 품질 경쟁에 직접 답하지 않는다. 연관 기억은 라우팅 역량을 분리해 측정하지만, 퍼플렉서티, 다운스트림 추론, 사실 검색 또는 생성 일관성을 검증하지는 않는다.

다음으로 의미 있는 비교에는 통합 모델이 필요하다. 파라미터, 학습 데이터, 최적화 노력, 하드웨어 예산을 일치시켜야 한다. 이후 언어 품질과 실제 시스템 성능을 모두 보고해야 한다.

그런 증거가 나오기 전까지 Monodratic은 후보 라우팅 메커니즘으로 보는 것이 가장 적절하다. 이 접근법은 합성 모델이 성공하는 이유를 명확히 해주는 제어 장치를 제공한다. 하지만 학습된 제품 해싱이 유용한 배포 환경에서 최적화된 밀집 어텐션을 능가한다는 점은 아직 입증하지 못했다.

99.35% 결과는 언어 품질을 입증하지 않는다

Monodratic의 증거는 학습된 합성 라우팅을 뒷받침하지만, 같은 증거로 자연어 모델링이나 프로덕션 효율성을 검증할 수는 없다.

연관 기억은 의도적으로 정보 문제를 단순화한다. 쿼리는 알려진 관계를 가리키며, 평가는 이산적인 답을 확인한다. 실제 언어는 구문, 의미, 담화, 그리고 여러 불확실한 출처에 걸쳐 증거를 분산한다.

자연어 토큰은 멀리 떨어진 여러 구절에 의존할 수 있다. 각각은 개별적으로 약할 수 있지만, 함께라면 결정적일 수 있다. 원격 블록 두 개만 선택하면 밀집 어텐션이 결합했을 증거가 사라질 수 있다.

라우팅 레이블도 면밀히 살펴볼 필요가 있다. 학습 감독이 답을 포함한 블록을 식별한다면, 라우터는 일반적인 다음 토큰 예측보다 더 깨끗한 신호를 받는다. 따라서 공개 작업은 정확한 학습 목표와 계획된 통합 경로를 기준으로 평가해야 한다.

보고된 세 개 시드 평가는 단일 실행보다 낫다. 그러나 합성 과제의 답 768개는 현대 언어 모델 평가와 비교하면 작은 증거 기반이다. 최저 점수 역시 학습 실행 간 일부 변동을 보여준다.

공개된 동료 심사, 독립 재현 또는 제3자 벤치마크 결과는 없다. 저장소는 재현을 가능하게 하지만, 공개 가능성과 재현은 서로 다른 기준이다. 독자는 모든 벤치마크를 저자가 보고한 결과로 받아들여야 한다.

무작위 라우터 대조군은 유용하지만 완전한 기준선은 아니다. 동일하게 넓은 미학습 라우터는 이 아키텍처 안에서 학습된 파라미터가 무작위 라우팅을 능가하는지 검증한다. 그러나 동일한 예산에서 더 강력한 검색, 클러스터링, 고정 블록 또는 밀집 메커니즘과 비교하지는 않는다.

로컬 전용 대조군은 또 하나의 필요한 기준점이다. 정답 151개는 이 과제가 대체로 먼 거리의 정보를 요구함을 보여준다. 하지만 더 큰 로컬 윈도우나 구조화된 전역 패턴이 어떤 성능을 낼지는 알려주지 않는다.

포스팅 오버플로는 더 폭넓은 테스트가 필요하다. 보고된 실행에서는 오버플로가 0건으로 기록됐고, 이는 선택한 설정이 의도대로 작동했음을 검증한다. 자연어, 코드, 반복적인 문서는 더 집중된 주소 할당을 만들 수 있다.

중요한 블록 여러 개가 하나의 경계가 설정된 주소에 충돌하면, 용량 관리는 무엇을 남길지 결정해야 한다. 쿼리가 올바른 주소를 선택했더라도 이 결정은 검색 재현율을 낮출 수 있다. 따라서 로드 밸런싱은 속도뿐 아니라 품질에도 영향을 미친다.

학습된 어텐션 라우터는 라우팅 흡수라고 불리는 최적화 문제에도 직면한다. 모델의 쿼리, 키, 값 프로젝션은 부과된 마스크에 맞춰 적응할 수 있으며, 학습된 라우팅과 무작위 라우팅의 차이를 줄일 수 있다.

2026년 2월 분석에서는 하나의 통제된 종단 간 트랜스포머에서 학습된 소프트 게이트가 무작위 게이트보다 근소하게만 더 좋은 성능을 보였다. 저자들의 routing analysis는 각각 48.73과 49.83의 퍼플렉서티를 보고했다.

이 결과가 Monodratic을 반증하는 것은 아니다. 아키텍처, 과제, 학습 신호, 라우팅 세분성은 서로 다르다. Monodratic의 학습된 라우터는 보고된 기억 실험에서 미학습 대조군을 분명히 앞섰다.

다만 이 결과는 Monodratic이 건너뛸 수 없는 시험을 제시한다. 연구자들은 이 구성 요소가 전체 모델과 공동 학습된 뒤에도 라우팅이 진정으로 정보를 제공하는지 물어야 한다. 통합 후 학습된 라우터를 미학습 라우터로 교체하는 것은 유의미한 절제 실험이 될 것이다.

이산 선택을 통한 그래디언트 흐름도 또 다른 문제다. 하드 top-k 결정은 선택된 인덱스를 통해 일반적인 그래디언트를 제공하지 않는다. 아키텍처에는 보통 대리 목적 함수, 소프트 학습 경로, 보조 감독 또는 다른 추정기가 필요하다.

이러한 선택은 안정성과 최종 라우팅 품질 모두에 영향을 줄 수 있다. 명시적 증거 레이블에서 잘 작동하는 라우터는 다음 토큰 손실만으로 학습할 때 다르게 동작할 수 있다.

CPU 시간 측정의 지수 역시 신중히 해석해야 한다. 거의 선형적인 적합 스케일링은 측정된 구현이 시험 범위 내에서 명백한 이차 곡선을 피했다는 뜻이다. 종단 간 디코더가 선형으로 확장된다는 증거는 아니다.

특히 프리필 단계에서는 인덱스 구축이 중요할 수 있다. 자기회귀 디코딩은 빈번한 증분 업데이트를 도입한다. GPU 실행에는 단순한 복잡도 설명에는 없는 커널 실행, 동기화, 메모리 수집, 패킹 비용이 포함된다.

FlashAttention 스타일의 밀집 커널과 비교하는 일은 까다롭지만 필요하다. 밀집 어텐션은 더 많은 연산을 수행하지만, 최적화된 커널은 하드웨어를 효율적으로 활용한다. 희소 방식은 이론적 연산을 절감하는 대신 불규칙한 작업으로 시간을 잃는 경우가 많다.

속도 시험에는 품질 일치가 동반돼야 한다. 라우터는 더 적은 블록을 선택해 빨라질 수 있지만, 낮은 커버리지는 퍼플렉서티나 검색 성능을 해칠 수 있다. 유용한 곡선은 여러 선택 예산에 걸쳐 품질과 실제 지연 시간을 함께 그린다.

롱 컨텍스트 평가는 적대적인 배치도 필요하다. 관련 증거는 서로 다른 거리와 방해 정보가 많은 문서 안에 배치돼야 한다. 반복, 거의 중복된 키, 과부하된 해시 주소는 제품 라우팅이 선택성을 유지하는지 시험할 수 있다.

실제 애플리케이션은 추가 질문을 제기한다. 코드 완성은 파일 전반에 걸친 정확한 참조를 요구한다. 문서 분석은 분리된 주장을 결합해야 한다. 에이전트 히스토리에는 반복되는 도구 출력, 수정 사항, 오래된 계획이 포함된다.

이 사례들은 단지 하나의 키가 하나의 값을 검색할 수 있는지 묻는 것이 아니다. 어떤 증거가 중요한지 미리 알 수 없는 상황에서 경계가 설정된 경로가 여러 상호작용 의존성을 보존할 수 있는지 검증한다.

현 단계에서 Monodratic의 가장 강력한 특징은 반증 가능성이다. 이 프로젝트는 무엇을 시험했는지 밝히고, 대조군을 공개하며, 주장하지 않는 바를 명시한다. 이는 독자에게 합성 정확도만으로 배포 가치를 추론하라고 요구하는 대신, 재현을 위한 구체적인 의제를 만든다.

희소 어텐션 연구자들이 다음으로 주목해야 할 것

Monodratic이 유용한 어텐션 구성 요소가 될지, 잘 통제된 라우팅 실험에 머물지는 세 가지 신호가 결정할 것이다.

첫 번째 신호는 기존 결과의 독립 재현이다. 유용한 재현 연구는 세 개 시드를 모두 다시 실행하고, 밀집 마스크 오라클을 검증하며, 여러 무작위 초기화에서 포스팅 리스트 동작을 시험해야 한다.

또한 제품 주소 수, 탐색 수, 블록 크기, 원격 블록 예산을 변화시켜야 한다. 합리적인 설정 전반에서 정확도가 높게 유지된다면, 라우팅 메커니즘은 하나의 균형 잡힌 구성에 덜 의존하는 것으로 보일 것이다.

오버플로 스트레스 테스트도 이 단계에 포함돼야 한다. 연구자들은 많은 소스가 유사한 주소로 향하도록 편향된 시퀀스를 구성할 수 있다. 결과는 누락된 후보, 폴백 동작, 경로 재현율, 시간 변동성을 보고해야 한다.

재현 연구가 768개 중 763개 결과와 거의 선형적인 CPU 곡선을 복원한다면 현재 해석은 더 강해질 것이다. 시드나 구성에 대한 민감성이 크다면 신뢰할 수 있는 학습 라우팅이라는 주장은 약해질 것이다.

두 번째 신호는 인과적 언어 모델로의 통합이다. 이 믹서는 정규화, 잔차 경로, 피드포워드 네트워크, 일반적인 다음 토큰 목적 함수를 포함한 레이어 내부에서 학습돼야 한다.

이 실험은 밀집 어텐션, 고정 희소 어텐션, 미학습 라우터, 학습된 제품 해시 라우팅을 비교해야 한다. 파라미터 수, 토큰 예산, 학습 데이터, 최적화 노력은 일치된 상태로 유지돼야 한다.

언어 모델 퍼플렉서티는 첫 번째 지표일 뿐이다. 평가는 롱 컨텍스트 검색, 다중 문서 추론, 코드 과제, 생성 안정성을 포함해야 한다. 결과는 여러 컨텍스트 길이와 라우팅 예산에서의 성능을 보여줘야 한다.

라우터별 절제 실험은 필수적이다. 학습된 라우팅을 무작위 라우팅으로 교체하면 전체 모델이 실제로 학습된 주소를 사용하는지 시험할 수 있다. 오라클 블록을 강제하면 남은 오류 중 후보 선택에서 비롯되는 비중을 측정할 수 있다.

하이브리드 모델도 검토할 가치가 있다. 밀집 또는 로컬 헤드는 초기 학습을 안정화하고, 제품 라우팅 헤드는 원격 접근을 처리할 수 있다. MoSA의 공개 결과는 라우팅과 어텐션이 함께 학습될 때 하이브리드화가 중요할 수 있음을 시사한다.

성공적인 종단 간 학습은 Monodratic의 메커니즘 주장을 강화할 것이다. 무작위 또는 고정 라우팅을 앞서지 못한다면, 합성 감독이 다음 토큰 학습으로 전이되지 않는다는 점을 시사할 것이다.

세 번째 신호는 온라인 디코딩을 포함한 융합 가속기 벤치마크다. 이 시험은 실제 GPU 하드웨어에서 프리필 처리량, 디코드 지연 시간, 메모리 사용량, 키-값 캐시 동작을 측정해야 한다.

보고된 수치에는 라우팅과 인덱스 관리 비용이 포함돼야 한다. 이 단계를 제외하면 희소성이 사용자에게 이점을 주는지 결정하는 오버헤드가 가려진다.

벤치마크는 단순히 서로 다른 어텐션 집합을 처리하는 커널이 아니라, 품질이 맞춰진 모델을 비교해야 한다. 또한 배치 크기, 시퀀스 길이, 블록 크기, 데이터 타입, 하드웨어도 공개해야 한다.

평균 처리량만큼 테일 레이턴시도 중요하다. 학습된 주소는 포스팅 리스트에 상한을 두더라도 작업량을 불균등하게 만들 수 있다. 실제 운영 시스템에는 다양한 프롬프트 전반에서 예측 가능한 지연 시간이 필요하다.

메모리 측정에서는 모델 가중치, 임시 라우팅 버퍼, 포스팅 리스트, 키-값 캐시를 구분해야 한다. 모든 토큰의 키와 값이 계속 상주한다면, 더 작은 어텐션 집합이 자동으로 더 작은 저장 캐시를 뜻하는 것은 아니다.

품질을 유지하면서 밀집 어텐션을 능가하는 최적화 결과가 나온다면, 이 프로젝트의 시스템적 논지를 뒷받침할 수 있다. 더 느린 결과가 나온다고 해서 학습 기반 라우팅이 무효화되는 것은 아니지만, 그 가치는 연구 또는 특수 하드웨어로 좁혀질 것이다.

Monodratic이 흥미로운 이유는 부족한 증거를 유난히 선명하게 드러내기 때문이다. 보고된 99.35% 재현율 결과는 학습된 제품 해싱이 엄격한 예산 아래에서도 멀리 떨어진 합성 증거를 찾아낼 수 있음을 시사한다.

강제 타깃 제어 실험은 남아 있는 오류가 정확히 어디에서 발생하는지 보여준다. 밀집 선택 마스크 오라클은 선택 이후의 수학적 일치 여부를 검증한다. CPU 스케일링 연구는 이를 배포 증거로 포장하지 않으면서도 초기 시스템 측정을 제공한다.

이제 결정적인 작업은 이러한 제어 실험을 넘어선다. 연구자들은 라우팅이 언어 모델 학습, 복잡한 정보 분포, 가속기 실행 환경에서도 유지되는지 검증해야 한다.

희소 인과 어텐션을 추적하는 개발자에게 당장의 질문은 실용적이다. 깔끔한 레이블이 사라진 뒤에도 이 라우터가 유용한 원거리 증거를 유지할 수 있을까? 먼저 메커니즘을 재현한 뒤, 퍼플렉서티, 라우트 재현율, 엔드투엔드 지연 시간을 관찰해야 한다. 이 세 가지 측정이 Monodratic이 선택적 어텐션을 발전시키는지, 아니면 밀집 모델이 흡수할 또 하나의 합성 환경 성공 사례를 기록하는지 결정할 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page