Aleph Alpha Kolibri 모델, 해외 AI 의존에 맞서 독일의 주권을 내세우다
Aleph Alpha는 10월 3일 오픈 웨이트, 독일 중심 학습, 그리고 유럽에서 가장 엄격한 규제를 받는 기관들을 직접 겨냥한 전략과 함께 Kolibri를 출시했다. Aleph Alpha Kolibri 모델은 정부가 근본적인 갈등에 직면한 시점에 등장했다. 선도적인 해외 AI 서비스를 이용할 것인가, 아니면 핵심 기술에 대한 더 깊은 통제권을 유지할 것인가의 문제다.
Kolibri는 단순한 독일어 챗봇이 아니다. 데이터 위치와 운영 통제가 조달 결정에 영향을 미치는 공공 행정, 산업, 국방 및 기타 환경을 위해 설계된 이중언어 모델이다. Aleph Alpha는 기관들이 자체 인프라에서 이 모델을 운영할 수 있기를 바라고 있다.
이는 Kolibri를 벤치마크 점수 이상의 경쟁 구도에 놓는다. SAP와 OpenAI는 이미 미국 기업이 공급한 기술을 독일이 운영하는 클라우드 인프라에 배치하는 방식의 다른 주권 모델을 제공하고 있다. Mistral AI는 오픈 모델, 정부 파트너십, 유럽 호스팅을 통해 또 다른 유럽 경로를 구축하고 있다.
Aleph Alpha의 해법은 이례적으로 구체적이다. 오픈 웨이트, 독일이 통제하는 학습 파이프라인, 효율적인 mixture-of-experts 아키텍처, 그리고 규제 업무에 특화된 후속 학습을 결합한다.
해결되지 않은 질문은 이러한 요소들이 공공 인프라에 필요한 수준의 실질적 신뢰성을 제공하는지 여부다. Aleph Alpha는 광범위한 기술 결과를 공개했지만, 상당수의 근거는 여전히 회사가 설계한 평가에서 나온다.
Kolibri, Aleph Alpha의 공공 부문 전략을 바꾸다
Kolibri는 Aleph Alpha의 주권 논리를 기관이 다운로드하고, 검토하고, 배포하고, 맞춤화할 수 있는 모델로 구체화한다.
회사는 독일 통일의 날에 Kolibri를 출시하며 의도적으로 정치적·제도적 맥락을 부여했다. Kolibri 출시 발표에 따르면, 웨이트는 Apache 2.0 라이선스로 제공된다.
이 라이선스는 비교적 허용적인 조건 아래 상업적 이용, 수정, 재배포를 허용한다. 오픈 웨이트가 모든 학습 결정을 공개하는 것은 아니지만, 폐쇄형 application programming interface보다 고객에게 더 큰 배포 자유를 제공한다.
Kolibri는 흔히 MoE로 줄여 부르는 mixture-of-experts 아키텍처를 사용한다. 이 설계는 모든 응답에서 모든 파라미터를 실행하는 대신, 각 토큰마다 모델의 일부만 활성화한다.
이 모델은 총 781억 개의 파라미터를 포함하지만, 각 토큰에는 약 34억6000만 개만 활성화한다. Aleph Alpha는 이 차이를 더 낮은 서비스 비용과 더 빠른 추론으로 이어지는 경로로 제시한다.
Kolibri는 독일어와 영어를 지원한다. 광고된 컨텍스트 윈도우는 1,048,576토큰에 이르지만, Aleph Alpha는 효율적인 프로덕션 업무를 위해 262,144토큰을 권장한다.
긴 컨텍스트 윈도우는 모델이 한 요청 안에서 대규모 텍스트 컬렉션을 처리하도록 한다. 이는 규정, 사건 파일, 정책 문서 또는 긴 행정 기록을 검토하는 기관에 중요하다.
이 모델은 도구 호출과 선택 가능한 추론 수준도 지원한다. 운영자는 추론 없음 또는 낮음, 중간, 높음 모드를 선택해 응답 속도와 추가 연산 간의 균형을 조정할 수 있다.
이러한 기능은 구체적인 공공 부문 워크플로를 뒷받침한다. 시민 서비스 에이전트는 기록을 조회하고, 자격 규칙을 검토하며, 서식을 준비할 수 있다. 분석가는 정책 문서를 비교하거나 계획 가정을 평가할 수 있다.
Aleph Alpha는 Kolibri가 고객이 통제하는 인프라에서 실행될 수 있다고 말한다. 문서가 기관의 보안 경계를 벗어나거나 외부 추론 서비스를 거칠 수 없는 경우 이 선택지는 중요하다.
회사는 독일과 핀란드의 인프라에서 Kolibri를 학습시켰다. 모델, 개발 파이프라인, 공급망이 독일과 유럽의 법적 통제 아래에 남아 있다고 설명한다.
이는 프롬프트를 독일 내에 저장하는 것보다 더 폭넓은 주권 주장이다. 모델이 어떻게 구축됐는지, 어디에서 학습됐는지, 누가 배포를 통제하는지, 그리고 고객이 작동 가능한 사본을 보유할 수 있는지를 포괄한다.
Aleph Alpha는 독일 바덴뷔르템베르크주와 함께 개발한 행정 보조 도구 F13을 통해 이미 공공 부문 전략을 시험했다. 웹사이트에는 정부 기관 사용자 8만 명을 대상으로 한 AI 보조 도구 도입 계획도 언급돼 있다.
이러한 배포는 제도적 접근성을 보여주지만, Kolibri가 정부 전반에서 안정적으로 작동한다는 증거는 아니다. 문서 지원에서 실제 조치를 수행하는 에이전트로 이동하면 권한, 책임성, 오류 복구에 관한 더 심각한 문제가 제기된다.
그럼에도 Kolibri는 Aleph Alpha에 이러한 전환을 위한 더 명확한 기술 제품을 제공한다. 정부 구매자는 이제 독점 플랫폼에 관한 약속에만 의존하지 않고 다운로드 가능한 모델을 평가할 수 있다.
이번 출시는 Aleph Alpha의 경쟁적 위치도 바꾼다. 회사는 더 이상 유럽 구매자가 현지 전문성의 대가로 더 낮은 배포 자유를 받아들여야 한다고 주장할 필요가 없다.
대신 독일에서 구축된 대안이 검토 가능한 웨이트, 이중언어 추론, 온프레미스 운영을 제공할 때 해외 통제 모델이 여전히 필요한지를 물을 수 있다.
Aleph Alpha Kolibri 모델이 독일 업무를 중심으로 설계된 이유
Kolibri의 가장 중요한 차별점은 독일어를 구사한다는 사실이 아니라, Aleph Alpha가 독일어와 독일의 제도, 행정 문체를 중심으로 이를 학습시켰다는 데 있다.
대부분의 주요 언어 모델은 독일어 질문에 답할 수 있다. Aleph Alpha는 법률, 공공 기록, 정책 언어, 문화적으로 특수한 가정이 관련된 업무에서는 표면적인 유창성만으로 부족하다고 주장한다.
영어는 가장 규모가 큰 웹 데이터셋과 다수의 후속 학습 컬렉션을 지배한다. 따라서 다국어 모델은 주로 영어 사례에서 습득한 추론 패턴에 의존하면서도 독일어 텍스트를 생성할 수 있다.
Aleph Alpha는 사전 학습 과정에서 이러한 불균형을 줄이려 했다. Kolibri의 사전 학습 토큰 가운데 독일어는 21.3%를 차지했으며, 20조 토큰 학습 과정에서 약 4조3000억 회의 토큰 제시량에 해당한다.
회사는 필터링과 중복 제거 뒤 처음 확보한 사용 가능한 독일어 토큰이 3900억 개에 불과했다고 밝혔다. 이는 계획한 데이터 혼합에 필요한 약 4조 토큰에 크게 못 미치는 수준이었다.
Aleph Alpha는 독일어 특화 웹 큐레이션과 합성 재표현으로 격차를 메웠다. 독일어 데이터 분석은 전용 Common Crawl 파이프라인을 통해 1조3000억 개의 고유 토큰을 수집했다고 설명한다.
팀은 독일어 문서를 다양한 독일어 형태로 다시 작성해 약 1조 토큰도 생성했다. 이 과정은 자료를 질의응답 대화나 백과사전식 문단과 같은 형식으로 변환했다.
이 방법은 영어 콘텐츠를 번역하는 방식과 다르다. 원문 문서에 담긴 제도, 지리적 참조, 문화적 가정을 더 많이 보존한다.
이러한 차이는 행정 업무에서 중요하다. 영어 단어 길이를 기준으로 설계된 학습 필터는 독일어 복합명사와 격식 있는 정부 문서를 잘못 제거할 수 있다.
Aleph Alpha는 이 자료를 유지하도록 필터링 규칙을 재조정했다고 말한다. 모델의 독일어 코퍼스에는 의회 회의록, 법률 문서, 기타 퍼블릭 도메인 문서도 포함된다.
Kolibri는 텍스트를 모델이 처리할 수 있는 단위로 변환하는 이중언어 토크나이저를 사용한다. Aleph Alpha는 독일어 형태론과 복합어를 더 효율적으로 처리하기 위해 UniBPE라는 방법을 개발했다.
토큰 수가 적으면 추론 시간과 메모리 사용량을 줄일 수 있다. 더 의미 있는 단어 분할은 특수한 독일어 용어 내부의 구조적 단서도 보존할 수 있다.
회사의 사례에는 독일 연방사회법원 및 행정 로그 데이터와 관련된 단어가 포함된다. Kolibri는 여러 범용 토크나이저보다 해당 용어를 언어적 구성 요소에 더 가깝게 분할하는 것으로 알려졌다.
Aleph Alpha는 추론을 위한 독일어 지도 미세 조정 사례 약 80만 개도 만들었다. 독일어 추론 연구에 따르면, 이 사례들은 독일어 문장 시작 부분을 모델에 프롬프트로 제공해 생성됐다.
목표는 사용자가 독일어로 질문했을 때 중간 추론도 독일어로 유지하는 것이었다. 이러한 학습이 없으면 다국어 모델은 내부적으로 영어로 옮겨가거나 언어를 섞는 경우가 많다.
정부 사용자에게 이해 가능한 추론은 실질적 가치를 갖는다. 독일어 사용자 직원은 모델의 설명을 머릿속으로 번역하거나 언어 의존적인 오류를 놓치지 않고 답변을 검토해야 한다.
그러나 가시적인 추론을 완전한 감사 추적과 혼동해서는 안 된다. 생성된 설명이 답변을 만들어낸 모든 내부 작동을 반드시 드러내는 것은 아니다.
공공기관에는 여전히 출처 인용, 접근 기록, 버전 통제, 문서화된 승인 절차가 필요하다. 또한 시스템이 지역별 언어와 행정 영역 전반에서 일관되게 작동하는지를 보여주는 테스트도 필요하다.
따라서 Kolibri의 독일어 특화는 신뢰할 만한 기술적 차별점을 만들지만, 자동적인 제도적 신뢰를 보장하지는 않는다. 평가자에게 독일 공공 업무 환경에서 이 모델을 시험할 더 강한 이유를 제공한다.
가장 강력한 평가는 통제된 조건에서 실제 워크플로를 활용할 것이다. 사실 정확성, 적절한 답변 보류, 문서 검색, 도구 선택, 직원이 결과를 확인하는 데 쓰는 시간을 측정할 수 있다.
이러한 근거는 또 하나의 일반 지식 리더보드보다 더 많은 것을 보여줄 것이다. 행정 시스템은 극적인 사실 오류만큼이나 작은 절차적 실수로 실패한다.
공공 부문 조달이 핵심 경쟁 무대다
핵심 경쟁은 유럽의 전면적 통제와 현지에서 운영되는 해외 기술을 통해 제공되는 주권 사이에서 벌어진다.
OpenAI와 SAP는 2025년 9월 OpenAI for Germany를 발표했다. 이 모델은 SAP의 Delos Cloud와 Microsoft Azure를 통해 제공되는 환경 안에 OpenAI 기술을 배치한다.
독일 파트너십은 현지 보안 및 법적 요건을 충족하면서 수백만 명의 공공 부문 직원을 지원하는 방안으로 제시됐다.
이 접근법은 운영 주권과 완전한 기술 독립성을 분리한다. 독일 조직은 기반 모델이나 개발 파이프라인을 소유하지 않고도 현지 통제와 규제 호스팅을 제공받을 수 있다.
많은 기관에는 이러한 방식으로 충분할 수 있다. 조달팀은 모델 웨이트에 대한 직접 접근보다 인증된 인프라, 애플리케이션 통합, 공급업체 지원, 예측 가능한 서비스를 우선시하는 경우가 많다.
Aleph Alpha는 구매자에게 더 엄격한 정의를 채택하라고 요구한다. 데이터 큐레이션, 모델 학습, 인프라, 배포, 맞춤화, 지속적인 접근 전반에 대한 통제를 주권으로 본다.
Kolibri는 이 입장을 구체화한다. 기관은 모델을 보유하고, 온프레미스에서 운영하며, 내부 자료를 외부 추론 제공업체에 전송하지 않을 수 있다.
그러나 소유에는 책임이 따른다. 조직은 서비스 인프라를 유지하고, 모델을 보호하며, 업데이트를 관리하고, 수정 사항을 테스트하며, 이를 기반으로 구축된 애플리케이션을 모니터링해야 한다.
오픈 웨이트는 운영 업무를 늘리는 대신 공급업체 의존도를 낮출 수 있다. 클라우드 서비스는 더 제한적일 수 있지만, 더 빠른 업데이트와 더 단순한 지원을 제공할 수 있다.
이것이 Aleph Alpha Kolibri 모델이 여러 집단에 동시에 압박을 가하는 이유다. 미국 모델 제공업체는 고객이 핵심 기술을 독립적으로 운영할 수 없을 때 주권이 무엇을 의미하는지 설명해야 한다.
유럽 클라우드 기업들은 현지 호스팅이 실질적인 기술적 독립성을 제공하는지 입증해야 한다. 다른 유럽 모델 개발사들도 이에 상응하는 독일어 성능과 공공 부문 준비도를 보여줘야 한다.
Aleph Alpha는 Mistral AI의 압박도 받고 있다. 프랑스와 독일은 Mistral 및 SAP가 참여하는 공공행정 협력을 검토해 왔으며, 프랑스는 정부 직원들을 위해 Mistral 기반 도구를 도입했다.
Mistral의 전략은 유럽 내 모델 개발, 다운로드 가능한 모델, 상업 서비스의 결합이다. 이는 폐쇄형 미국 서비스보다 Kolibri에 더 가까운 구조적 경쟁자로 만든다.
공적 지원을 받는 연구 부문에서도 경쟁이 다가오고 있다. 예를 들어 Soofi 모델 프로젝트는 Deutsche Telekom의 German Industrial AI Cloud에서 학습한 주권형 독일어-영어 기반 모델을 표방한다.
정부 구매자는 결국 하나의 국내 공급자와 미국 플랫폼을 비교하는 대신 여러 유럽 모델 가운데 선택할 수 있게 될 것이다. 이러한 변화는 조달의 초점을 측정 가능한 성과로 옮길 수 있다.
그때 성능은 독일어 텍스트 생성만을 의미하지 않게 된다. 구매자는 안전한 배포, 통합 비용, 업데이트 주기, 문서 기반 응답, 접근성, 조달 규정 준수를 검토하게 될 것이다.
Aleph Alpha가 계획 중인 Cohere와의 결합은 주권성 논의를 더욱 복잡하게 만든다. 두 회사는 베를린과 토론토를 거점으로 운영될 대서양 횡단 그룹을 발표했다.
최근 공개 자료에 따르면, 제안된 회사의 직원 수는 1,000명을 넘을 전망이다. 이 회사는 Aleph Alpha의 유럽 공공 부문 관계망과 Cohere의 모델 엔지니어링 및 국제적 도달력을 결합하게 된다.
Cohere CEO Aidan Gomez는 정부가 성능과 기술 통제력 중 하나를 선택할 필요가 없어야 한다고 주장해 왔다. 합병 세부 사항은 이러한 균형을 통합 회사의 핵심 약속으로 제시한다.
이 합병은 Kolibri에 더 강력한 유통망, 인프라 접근성, 연구 역량을 제공할 수 있다. 동시에 어려운 거버넌스 문제도 제기한다.
대서양 횡단 기업은 독일이 통제하는 공급자와 동일하지 않다. 기관들은 거래 이후 지식재산권, 모델 개발, 지원 의무, 관할권 노출이 어떻게 달라지는지 알고자 할 것이다.
Kolibri는 해당 기업 구조가 효력을 갖기 전에 완성됐다. 장기적 가치는 이후 버전들이 동일한 배포 권리와 유럽 공급망 약속을 유지하는지에 달려 있다.
따라서 공공 부문 고객들은 서로 경쟁하는 주권성의 정의에 직면한다:
현지 운영은 워크로드가 어디에서 실행되고 누가 클라우드를 관리하는지에 초점을 둔다.
모델 이동성은 고객이 기술을 보유하고 이전할 수 있는지에 초점을 둔다.
공급망 통제는 학습, 소프트웨어 의존성, 하드웨어, 법적 관할권을 포괄한다.
제도적 주권성은 상업적 또는 정치적 분쟁 상황에서 누가 필수 서비스를 유지할 수 있는지를 다룬다.
어떤 단일 정의도 모든 의존성을 해결하지는 못한다. 현지에서 학습한 모델조차 수입 가속기, 오픈소스 소프트웨어, 전력, 네트워킹, 전문 공급업체에 의존한다.
중요한 질문은 의존성이 사라지는지 여부가 아니다. 어떤 의존성이 남는지, 누가 이를 중단시킬 수 있는지, 그리고 기관이 각 구성 요소를 얼마나 빨리 대체할 수 있는지다.
오픈 웨이트는 주권성을 강화하지만 해결하지는 않는다
Kolibri는 폐쇄형 모델 서비스보다 고객에게 더 많은 통제권을 제공하지만, 오픈 웨이트만으로 공공 시스템이 안전하거나 책임성을 갖추는 것은 아니다.
Aleph Alpha는 모델 저장소를 통해 Kolibri의 웨이트를 공개했다. 이를 통해 연구자와 조직은 릴리스를 검토하고, 평가를 실행하며, 맞춤형 변형을 개발할 수 있다.
Apache 2.0 라이선스는 상업적 장벽도 낮춘다. 기관과 계약업체는 기본 모델에 대해 별도의 연구 전용 라이선스를 협상하지 않고도 애플리케이션을 개발할 수 있다.
이러한 개방성은 중요한 검증 기회를 만든다. 독립 팀은 독일어 성능, 긴 컨텍스트 처리, 보안, 그리고 회사가 주장하는 효율성을 시험할 수 있다.
또한 모델의 하드웨어 요구 사항이 현실적인 공공 부문 예산에 맞는지 검토할 수 있다. 활성 파라미터가 적은 모델도 모든 웨이트를 항상 사용할 수 있어야 하므로 상당한 메모리를 요구할 수 있다.
따라서 전문가 혼합 모델의 효율성은 워크로드에 따라 달라진다. 낮은 활성 파라미터 수는 연산량을 줄일 수 있지만, 배포 비용은 양자화, 동시성, 메모리, 네트워킹, 컨텍스트 길이에도 좌우된다.
100만 토큰 컨텍스트라는 주장은 비슷한 주의가 필요하다. 허용 가능한 최대 길이가 그 범위 전체의 모든 세부 정보를 신뢰성 있게 활용할 수 있음을 뜻하지는 않는다.
긴 컨텍스트 평가는 위치별 검색, 상충하는 증거, 반복되는 문단, 문서 내부에 숨겨진 지시를 시험해야 한다. 정부 기록 보관소는 하나의 명확한 답만 있는 깔끔한 자료 집합인 경우가 드물다.
프롬프트 인젝션도 또 다른 우려다. 검색된 문서 안에 포함된 악의적이거나 우발적인 지시가 주변 애플리케이션에서 엄격한 통제를 적용하지 않으면 에이전트의 동작을 바꿀 수 있다.
Kolibri의 도구 사용 기능은 애플리케이션이 초안 작성을 넘어설 때 이러한 위험을 키운다. 기록을 검색하거나 양식을 작성하는 에이전트는 공식 데이터를 변경하기 전에 권한 경계와 사람의 승인이 필요하다.
Aleph Alpha는 제공된 문서가 답변을 뒷받침하지 않을 때 모델이 응답을 보류하도록 학습시켰다. Merlin-Arthur 방법은 긍정적 컨텍스트와 의도적으로 불완전한 컨텍스트를 생성해 모델이 언제 응답을 거부해야 하는지 학습시킨다.
이 접근법은 실제 배포 문제를 겨냥한다. 표준 모델 학습은 잘못된 시도도 때때로 보상을 받는 반면, 거부는 요청된 답을 결코 생성하지 않기 때문에 추측을 장려하는 경우가 많다.
Aleph Alpha는 자사 평가 중 하나에서 Kolibri가 근거가 없는 항목의 44퍼센트에서 답변을 보류했다고 보고했다. Kolibri Origin은 15퍼센트였다.
또한 Kolibri가 또 다른 근거성 시험에서 개선을 보였고, 뒷받침되지 않는 진술을 더 적게 생성했다고 회사는 밝힌다. 이러한 결과는 고무적이지만 신중한 해석이 필요하다.
높은 응답 거부율은 환각을 줄일 수 있지만 시스템의 유용성도 떨어뜨릴 수 있다. 적절한 균형은 업무가 일상적인 초안 작성, 복지급여 결정, 법률 분석, 공공 커뮤니케이션 중 무엇과 관련되는지에 달려 있다.
공개된 결과는 널리 인정된 벤치마크와 Aleph Alpha의 내부 시험을 혼합한다. 내부 평가는 고객 업무를 더 밀접하게 반영할 수 있지만, 외부인은 데이터와 채점 절차 없이는 이를 완전히 재현할 수 없다.
Aleph Alpha는 독일 공공 부문 대리 점수가 Kolibri Origin의 0.54에서 Kolibri의 0.75로 상승했다고 보고했다. 회사는 이 결과를 독립적으로 감사를 받은 지표로 제시하지 않았다.
이 공백이 해당 점수를 무효화하는 것은 아니다. 다만 독자는 이를 실제 운영 신뢰성의 증명이라기보다 내부적 진전의 근거로 받아들여야 한다는 뜻이다.
동일한 주의는 규정 준수 주장에도 적용된다. EU AI Act, GDPR, General-Purpose AI Code of Practice를 염두에 두고 설계하는 것은 유용하지만, 규정 준수 여부는 실제 배포된 시스템에 달려 있다.
공공기관은 의도된 사용 목적, 데이터 흐름, 영향을 받는 사람들, 인간 감독, 로깅, 사이버보안, 잠재적 피해를 평가해야 한다. 규정을 준수하는 기본 모델이 연결된 모든 애플리케이션을 자동으로 규정 준수 상태로 만들 수는 없다.
오픈 웨이트는 보안 업무도 만든다. 기관은 모델 파일, 의존성, 파인튜닝 버전, 평가 기록, 업데이트를 공개할 수 있는 주체를 추적해야 한다.
현지 배포는 민감한 문서를 통제된 환경 안에 둘 수 있다. 그러나 자원이 부족한 조직이 복잡한 AI 스택의 패치와 모니터링을 책임지게 할 수도 있다.
따라서 최선의 주권성 아키텍처는 모델 이동성과 관리형 운영을 결합하는 방식일 수 있다. 모든 기관이 자체 AI 인프라를 운영해야 한다고 가장하지 않으면서도, 기관에는 서비스를 이전하거나 계속 운영할 권리가 필요하다.
Kolibri는 이러한 선택 가치를 강화한다. 서비스 계약이 끝날 때 종료되는 접근 권한이 아니라, 구매자에게 복구 가능한 기술 자산을 제공한다.
기관이 이 선택권을 실제로 활용할지는 패키징에 달려 있다. 배포 도구, 문서화, 지원 파트너, 인증된 인프라, 재현 가능한 평가는 모델 파일만큼 중요하다.
벤치마크는 상세하지만, 다음 단계는 독립 검증이다
Aleph Alpha는 일반적인 출시보다 더 많은 기술적 세부 사항을 공개했지만, 결정적인 공공 부문 근거는 회사 외부에서 나와야 한다.
Kolibri는 9월 11일에 사전학습을 완료하고 10월 3일 출시됐다. Aleph Alpha에 따르면 핵심 사전학습 실행은 Nvidia B200 GPU 768대에서 21일간 지속됐다.
모델은 사전학습 토큰 20조 개를 처리했다. 중간 학습에서는 3조 4,400억 개 토큰이 추가됐고, 이어 긴 컨텍스트 적응을 위해 2,000억 개 토큰이 사용됐다.
Aleph Alpha는 필터링과 큐레이션 이전에 파이프라인이 200조 개가 넘는 원시 토큰을 처리했다고 말한다. 또한 지도 파인튜닝을 위해 1,740억 개의 합성 토큰을 생성했다.
필터링 후 이를 허용적 라이선스 데이터세트와 결합해 2,680억 토큰 규모의 파인튜닝 혼합물을 구성했다. 강화학습에는 큐레이션된 작업 120만 개 이상이 사용됐다.
이 수치는 상당한 엔지니어링 작업을 보여준다. 동시에 외부 연구자에게 회사의 데이터 및 효율성 주장을 평가할 유용한 세부 정보를 제공한다.
Aleph Alpha는 21일간의 사전학습 실행 중 계획되지 않은 중단이 38회 있었다고 보고했다. 자동화된 파이프라인은 사람의 개입 없이 작업을 재시작하고 체크포인트에서 재개했다.
이 운영상 복원력은 모델 개발이 재현성에 의존하기 때문에 중요하다. 학습 실행을 재시작하고, 평가하고, 재현할 수 있는 팀은 취약한 연구 스크립트를 사용하는 팀보다 실패를 더 빠르게 바로잡을 수 있다.
회사는 Kolibri의 50개 레이어 중 10개만 전체 어텐션을 사용한다고 말한다. 나머지 레이어는 512토큰 슬라이딩 윈도우를 적용해 추론 중 연산량과 메모리 증가를 제한한다.
Aleph Alpha는 1,230억 파라미터의 실험적 구성과 Kolibri의 780억 파라미터 설계도 비교했다. 회사는 더 작은 모델이 H100 GPU 두 대에서 긴 컨텍스트 요청 18건을 동시 처리했다고 말한다.
더 큰 구성은 보고에 따르면 세 건을 처리했다. Kolibri는 해당 회사 시험에서 디코딩 속도도 28퍼센트 더 빨랐다.
이러한 아키텍처 선택은 목표 시장에 부합한다. 정부 기관에는 일반 리더보드에서만 상위권을 차지하는 모델이 아니라 인프라 제약 속에서도 실행할 수 있는 모델이 필요하다.
Kolibri의 공개 점수는 수학, 코딩, 도구 사용, 긴 컨텍스트 작업, 일반 평가의 독일어 번역본 전반에서 경쟁력 있는 결과를 보여준다.
이 모델은 Aleph Alpha의 독일어 버전 AIME 2026에서 90퍼센트를 기록했다. 독일어 GPQA Diamond 평가에서는 81.3퍼센트에 도달했다.
벤치마크 비교에는 Qwen, Nvidia의 Nemotron 제품군, Mistral Small이 포함된다. Aleph Alpha는 Kolibri가 일부 과제에서 활성 파라미터 수가 최대 네 배 더 많은 모델들과 맞먹는다고 말한다.
그러나 벤치마크 수치는 프롬프트, 추론 설정, 추론 예산, 오염, 채점 방식에 여전히 민감하다. 번역된 평가는 원래 독일어로 작성된 시험과 다르게 작동할 수도 있다.
가장 유용한 다음 단계는 대학, 공공 디지털 서비스 팀, 독립 모델 평가기관이 수행하는 재현 가능한 시험이다. 이들 그룹은 프롬프트, 구성, 하드웨어, 실패 사례를 공개해야 한다.
현실적인 시험에는 독일 법률 용어, 지방자치단체 용어, 복지급여 행정, 조달 문서, 불완전한 증거가 포함된 서신이 포함돼야 한다.
또한 지역별 변이도 측정해야 한다. 독일 공공행정은 서로 다른 어휘, 절차, 문서 형식을 지닌 연방, 주, 지방자치단체 기관에 걸쳐 있다.
평가는 모델 연구자뿐 아니라 일반 직원도 포함해야 합니다. 기술적으로 정확한 답변이라도 시간 압박 속에서 설명을 검증하기 어렵다면 실패할 수 있습니다.
공공기관은 직원들이 출력 결과를 수용, 수정, 거부 또는 상위 검토로 이관하는 빈도를 기록해야 합니다. Kolibri가 검증 이후 시간을 절약하는지 측정해야 하며, 검증 이전을 기준으로 해서는 안 됩니다.
도구를 사용하는 에이전트에는 별도의 테스트가 필요합니다. 평가자는 접근할 수 없는 기록, 상충하는 정책, 철회된 권한, 오래된 문서, 악의적인 지시를 도입해야 합니다.
모델의 응답 보류 행동은 집중적인 검토가 필요합니다. 테스트는 정당한 거부와 불필요한 거부, 그리고 근거 없이 자신 있게 제시된 출력을 구분해야 합니다.
독립 팀은 다운로드 가능한 릴리스를 Aleph Alpha의 호스팅 또는 맞춤형 제품에서 사용하는 버전과도 비교 평가해야 합니다. 시스템 프롬프트와 검색 방식의 차이는 행동을 크게 바꿀 수 있습니다.
그 결과가 나올 때까지 Kolibri의 벤치마크는 신뢰할 만한 엔지니어링 주장을 뒷받침합니다. 하지만 이 모델이 시민에게 영향을 미치는 의사결정에 관여할 준비가 되었는지는 결론내리지 못합니다.
이 구분은 특히 중요합니다. 공공 인프라는 오류에 대한 허용 수준이 다르기 때문입니다. 결함 있는 소비자용 답변은 불편을 초래하지만, 행정 오류는 서비스 지연이나 법적 결과의 변경으로 이어질 수 있습니다.
Kolibri의 중요성을 보여줄 세 가지 신호
공공기관이 Kolibri를 검증하고, 의미 있는 규모로 배포하며, 이를 운영할 실질적인 자유를 유지할 때 Kolibri는 중요해질 것입니다.
첫 번째 신호는 독립적인 기술 재현입니다. 연구자들은 공개된 방법을 사용해 독일어 성능, 장문맥 검색, 도구 사용, 하드웨어 효율성, 응답 보류를 확인해야 합니다.
강력한 재현 결과는 특화 모델이 더 큰 범용 모델과 경쟁할 수 있다는 Aleph Alpha의 주장을 뒷받침할 것입니다. 큰 격차가 드러난다면 조달 대상 모델로서의 입지는 약화될 것입니다.
두 번째 신호는 Kolibri 자체를 사용하는, 명시된 프로덕션 배포입니다. Aleph Alpha는 공공 부문과의 관계를 보유하고 있지만, 구매자는 이번 릴리스와 정의된 워크플로에 연결된 증거를 필요로 합니다.
유용한 공개 정보는 과업, 사용자 그룹, 보안 통제, 평가 기간, 측정된 시간 절감 효과를 식별해야 합니다. 또한 오류 범주와 인간 검토 요건도 보고해야 합니다.
배포 건수만으로는 거의 알 수 없습니다. 수천 명의 적격 사용자가 있는 비활성 파일럿은 중요한 행정 절차에서의 일상적 사용과 동등하지 않습니다.
세 번째 신호는 Aleph Alpha와 Cohere를 둘러싼 합병 이후의 거버넌스 구조입니다. 구매자는 모델 소유권, 향후 릴리스, 유럽 내 운영, 계약 연속성에 관한 명확한 답을 필요로 합니다.
Kolibri가 계속 공개적으로 제공되고 자주 업데이트된다면, 합병은 그 입지를 강화할 수 있습니다. 이후 모델이 제한된 서비스 뒤로 이동한다면, 현재의 주권 주장은 덜 지속 가능한 것으로 보일 것입니다.
경쟁사의 대응은 추가적인 맥락을 제공할 것입니다. SAP와 OpenAI는 유통망, 기존 소프트웨어 관계, 관리형 인프라를 통해 Aleph Alpha에 도전할 수 있습니다.
Mistral은 유럽 정체성, 공개 모델, 정부 파트너십을 통해 경쟁할 수 있습니다. 공공 연구 프로젝트는 한 스타트업의 상업적 로드맵에 의존하지 않는 대안을 제공할 수 있습니다.
이러한 압력은 공공 구매자에게 건전합니다. 기관이 하나의 국가 챔피언을 지정하는 대신 대체 가능한 여러 공급업체를 비교할 수 있을 때 주권은 더 신뢰할 만해집니다.
Aleph Alpha Kolibri 모델은 이러한 경쟁을 더 구체적으로 만듭니다. 독일어 특화, 공개 가중치, 현지 학습, 효율적인 추론을 하나의 검토 가능한 릴리스로 묶습니다.
이 모델의 등장이 독일이 공공 부문 AI 문제를 해결했다는 증거는 아닙니다. 다만 주로 호스팅 계약으로 정의되는 주권에 대한 진지한 대안을 제시합니다.
이제 공공기관은 투명한 조달과 공개된 평가를 통해 이 주장을 검증해야 합니다. 개발자는 Kolibri가 더 높은 위험도의 워크플로에 들어가기 전에 가중치를 검토하고, 결과를 재현하며, 실패 사례를 문서화할 수 있습니다.
기업 및 정부 구매자에게 당장의 조치는 간단합니다. 모델을 선택하기 전에 통제가 실제로 무엇을 의미하는지 정의해야 합니다. 이식성, 법적 관할권, 독일어 추론, 지속적 운영이 중요하다면 각 요건에는 측정 가능한 테스트가 필요합니다.



