Aleph Alpha Kolibri 模型让德国主权与对外国 AI 的依赖正面交锋
Aleph Alpha 于 10 月 3 日发布 Kolibri,主打开放权重、以德国为中心的训练,以及面向欧洲监管最严格机构的直接定位。Aleph Alpha Kolibri 模型的推出,正值各国政府面临一项根本冲突:是采用领先的外国 AI 服务,还是保留对关键技术更深入的控制权。
Kolibri 并不只是又一个德国聊天机器人。它是一款双语模型,面向公共行政、工业、国防以及其他数据位置和运营控制会影响采购决策的环境。Aleph Alpha 还希望各机构能在自身基础设施上运行该模型。
这使 Kolibri 进入了一场不止关乎基准测试分数的竞争。SAP 和 OpenAI 已经提供了另一种主权模式:围绕美国公司提供的技术,使用由德国运营的云基础设施。Mistral AI 则通过开放模型、政府合作伙伴关系和欧洲托管服务,构建另一条欧洲路径。
Aleph Alpha 的回答具有不同寻常的明确性。它结合了开放权重、由德国控制的训练流程、高效的混合专家架构,以及面向受监管工作的专项后训练。
尚未解决的问题是,这些要素是否能为公共基础设施带来足够的实际可靠性。Aleph Alpha 已公布大量技术结果,但其中许多证据仍来自该公司自行设计的评测。
Kolibri 改变了 Aleph Alpha 面向公共部门的定位
Kolibri 将 Aleph Alpha 对主权的论述,转化为一个机构可以下载、检查、部署和调整的模型。
该公司选择在德国统一日发布 Kolibri,为此次发布赋予了明确的政治和制度框架。根据 Kolibri 发布公告,其权重以 Apache 2.0 许可证提供。
该许可证以相对宽松的条款允许商业使用、修改和再分发。开放权重并不会披露每一项训练决策,但相较于封闭的应用程序接口,它能赋予客户更大的部署自由度。
Kolibri 采用混合专家架构,通常简称为 MoE。该设计并非在每次响应中运行全部参数,而是仅为每个 token 激活模型的一部分。
该模型总计拥有 781 亿个参数,但每个 token 仅激活约 34.6 亿个参数。Aleph Alpha 将这一差距视为降低服务成本和加快推理速度的途径。
Kolibri 支持德语和英语。其宣传的上下文窗口可达 1,048,576 个 token,不过 Aleph Alpha 建议在高效的生产工作中使用 262,144 个 token。
长上下文窗口让模型能够在一次请求内处理大量文本集合。这对于审核法规、案件档案、政策文件或冗长行政记录的机构而言尤为重要。
该模型还支持工具调用和可选的推理级别。运营方可以选择不推理,或选择低、中、高模式,在响应速度与额外计算量之间取舍。
这些特性支持具体的公共部门工作流程。市民服务代理可能会检索记录、核查资格规则并准备表格。分析师则可能比较政策文件或评估规划假设。
Aleph Alpha 表示,Kolibri 可以在客户控制的基础设施上运行。当文件不能离开机构的安全边界,或不能经由外部推理服务处理时,这一选项尤为重要。
该公司在德国和芬兰的基础设施上训练了 Kolibri。它表示,模型、开发流程和供应链仍受德国及欧洲法律控制。
这是一项比将提示词存储在德国更广泛的主权主张。它涵盖模型如何构建、在哪里训练、谁控制部署,以及客户能否保留可运行的副本。
Aleph Alpha 已通过 F13 测试其公共部门战略。F13 是与德国巴登-符腾堡州共同开发的一款行政助手。该公司网站还提及一项面向 80,000 名政府机构用户的 AI 助手部署计划。
这些部署证明了其获得制度性准入,并不能证明 Kolibri 能在整个政府体系中可靠运行。从文档辅助转向能够采取行动的代理,会引入关于权限、问责和错误恢复的更严肃问题。
不过,Kolibri 确实为 Aleph Alpha 的这一转变提供了更清晰的技术产品。政府采购方如今可以评估一款可下载模型,而不必仅依赖有关专有平台的承诺。
此次发布也改变了 Aleph Alpha 的竞争定位。该公司不再需要主张欧洲买家应以本地专业能力为交换,接受较弱的部署自由度。
相反,它可以提出这样的问题:当德国打造的替代方案提供可检查的权重、双语推理和本地部署能力时,是否仍有必要采用受外国控制的模型。
为什么 Aleph Alpha Kolibri 模型围绕德国工作场景打造
Kolibri 最相关的差异不在于它会说德语,而在于 Aleph Alpha 围绕德国的语言、制度和行政文风对其进行了训练。
大多数主流语言模型都能回答德语问题。Aleph Alpha 认为,对于涉及法律、公共记录、政策语言或特定文化假设的工作而言,表面的语言流利度并不足够。
英语主导着规模最大的网络数据集和许多后训练数据集。因此,多语言模型可以生成德语文本,却主要依赖从英语示例中学到的推理模式。
Aleph Alpha 尝试在预训练期间缩小这种失衡。德语占 Kolibri 预训练 token 的 21.3%,即在 20 万亿 token 的训练过程中,大约有 4.3 万亿次 token 呈现来自德语。
该公司表示,经过过滤和去重后,最初仅找到 3900 亿个可用德语 token。这远低于其计划数据配比所需的约 4 万亿个 token。
Aleph Alpha 通过德语专属网页筛选和合成改写填补了这一缺口。其 德语数据分析介绍称,团队通过专门的 Common Crawl 流程收集了 1.3 万亿个独特 token。
团队还通过将德语文档改写为不同的德语形式,生成了约一万亿个 token。该过程将材料转换为问答交流、百科全书式段落等格式。
这种方法不同于翻译英语内容。它能保留更多源文件中的制度、地理指涉和文化假设。
这一区别在行政工作中十分重要。围绕英语单词长度设计的训练过滤器,可能会错误地丢弃德语复合名词和正式政府文体。
Aleph Alpha 表示,它重新调整了过滤规则以保留这类材料。该模型的德语语料还包括议会记录、法律文本及其他公共领域文件。
Kolibri 使用双语 tokenizer,将文本转换为模型可以处理的单元。Aleph Alpha 开发了一种名为 UniBPE 的方法,以更高效地处理德语词法形态和复合词。
更少的 token 可以减少推理时间和内存使用。更具语义的词语切分,也能保留专业德语术语内部的结构线索。
该公司的示例包括与德国联邦社会法院和行政日志数据相关的词语。据称,Kolibri 对这些术语的切分比若干通用 tokenizer 更接近其语言组成部分。
Aleph Alpha 还为推理创建了约 80 万个德语监督微调示例。其 德语推理研究称,这些示例通过向模型提供德语句首提示生成。
目标是在用户提出德语问题时,让中间推理过程保持德语。若缺少此类训练,多语言模型往往会在内部转向英语,或混用不同语言。
对于政府用户而言,可理解的推理具有实际价值。讲德语的员工应能审查答案,而无需在脑中翻译模型解释,或忽略依赖语言的错误。
不过,可见的推理不应被误认为完整的审计轨迹。生成的解释不一定会揭示导致答案产生的每一项内部操作。
公共机构仍然需要来源引用、访问记录、版本控制和有文档记录的审批流程。它们还需要测试,以证明系统在不同地区语言和行政领域中的行为是否一致。
因此,Kolibri 的德语专长构成了可信的技术差异,但不会自动带来制度信任。它为评估人员提供了更充分的理由,在德国公共工作场景中测试该模型。
最有力的评估应在受控条件下使用真实工作流程。它应衡量事实准确性、恰当弃答、文档检索、工具选择,以及员工核查输出所花费的时间。
这些证据比又一个通识知识排行榜更有说明力。行政系统往往因细微的程序性失误而失败,其频率不亚于严重的事实错误。
公共部门采购是主要竞争焦点
核心竞争在于:一方是欧洲全栈控制,另一方是通过本地运营的外国技术实现主权。
OpenAI 和 SAP 于 2025 年 9 月宣布推出 OpenAI for Germany。该方案将 OpenAI 技术置于由 SAP 的 Delos Cloud 和 Microsoft Azure 提供的环境中。
这项 德国合作伙伴关系被定位为在满足本地安全和法律要求的同时,服务数百万公共部门员工的一种方式。
这种方法将运营主权与完全的技术独立性区分开来。德国机构可以获得本地控制和受监管托管服务,而无需拥有底层模型或其开发流程。
对于许多机构而言,这种安排可能已经足够。采购团队通常优先考虑经过认证的基础设施、应用集成、供应商支持和可预测的服务,而非直接获取模型权重。
Aleph Alpha 则要求买家采用更严格的定义。它将主权视为对数据筛选、模型训练、基础设施、部署、定制和持续访问的全流程控制。
Kolibri 让这一立场变得具体可感。机构可以保留该模型、在本地运行它,并避免将内部材料发送给外部推理提供商。
但所有权也意味着责任。组织必须维护服务基础设施、保护模型安全、管理更新、测试修改,并监控围绕该模型构建的应用。
开放权重能够减少对供应商的依赖,同时增加运营工作量。云服务可能限制更多,但也能提供更快的更新和更简单的支持。
这正是 Aleph Alpha Kolibri 模型同时向多个群体施压的原因。美国模型提供商必须解释:当客户无法独立运行其核心技术时,主权究竟意味着什么。
欧洲云计算企业必须证明,本地托管是否能够提供实质性的技术独立性。其他欧洲模型开发商则必须展示可比的德语性能以及面向公共部门的成熟度。
Aleph Alpha 同样面临来自 Mistral AI 的压力。法国和德国一直在探索涉及 Mistral 与 SAP 的公共行政合作,而法国已为政府雇员部署由 Mistral 驱动的工具。
Mistral 的战略结合了欧洲模型开发、可下载模型和商业服务。这使其成为比封闭式美国服务更接近 Kolibri 的结构性竞争对手。
竞争也来自获得公共支持的研究。例如,Soofi 模型项目将自身描述为一个在 Deutsche Telekom 的 German Industrial AI Cloud 上训练的、具备主权属性的德英双语基础模型。
政府采购方最终可能会在多个欧洲模型之间进行选择,而非将一家本土供应商与美国平台进行比较。这种变化将推动采购转向可衡量的结果。
届时,性能评估将不止涵盖德语文本生成。采购方还会考察安全部署、集成成本、更新频率、文档依据能力、无障碍性以及采购合规性。
Aleph Alpha 与 Cohere 计划中的合并,进一步复杂化了主权叙事。两家公司宣布将组建一家横跨大西洋、在柏林和多伦多运营的集团。
根据近期披露信息,拟议中的公司将拥有逾 1,000 名员工。它将把 Aleph Alpha 在欧洲公共部门建立的关系,与 Cohere 的模型工程能力和国际覆盖面结合起来。
Cohere CEO Aidan Gomez 曾表示,政府不应被迫在能力与技术控制权之间二选一。这项合并细节将这种平衡定位为合并后公司的核心承诺。
此次合并可能为 Kolibri 带来更强的分发能力、基础设施资源和研究能力,但也引入了一个棘手的治理问题。
一家跨大西洋公司并不等同于一家由德国控制的供应商。政府机构将希望了解,交易完成后知识产权、模型开发、支持义务和司法管辖风险会如何变化。
Kolibri 在这一公司架构生效前就已完成。它的长期价值将取决于未来版本是否保留相同的部署权利和欧洲供应链承诺。
因此,公共部门客户面临着彼此竞争的主权定义:
本地运行侧重于工作负载在哪里运行,以及由谁管理云环境。
模型可移植性关注客户能否保留并迁移该技术。
供应链控制涵盖训练、软件依赖、硬件和法律管辖权。
制度主权关乎在商业或政治争端期间,谁能够维护关键服务。
没有任何一种定义能消除所有依赖。即使是在本地训练的模型,也依赖进口加速器、开源软件、电力、网络和专业供应商。
关键问题不在于依赖是否会消失,而在于哪些依赖仍然存在、谁能够中断它们,以及政府机构能以多快速度替换每个组成部分。
开放权重增强主权,但并未一锤定音
Kolibri 比封闭式模型服务赋予客户更多控制权,但仅有开放权重并不能使公共系统变得安全或可问责。
Aleph Alpha 已通过其模型仓库发布 Kolibri 的权重。这使研究人员和组织能够检查该发布版本、运行评估并开发适配方案。
Apache 2.0 许可证也降低了商业门槛。政府机构和承包商可以构建应用,而无需为基础模型另行协商仅限研究用途的许可证。
这种开放性带来了重要的验证机会。独立团队可以测试德语性能、长上下文行为、安全性以及公司提出的效率主张。
它们还可以检验模型的硬件需求是否符合现实的公共部门预算。即使模型的活跃参数较少,所有权重仍必须保持可用,因此仍可能需要大量内存。
因此,混合专家模型的效率取决于具体工作负载。较低的活跃参数数量可以减少计算量,但部署成本还受到量化、并发、内存、网络和上下文长度的影响。
关于百万 token 上下文的主张同样需要谨慎看待。最大可接受长度并不意味着模型能在整个窗口内可靠地利用每一个细节。
长上下文评估应测试跨位置检索、冲突证据、重复段落,以及隐藏在文档中的指令。政府档案很少是只有一个明显答案的整洁资料集合。
提示注入带来了另一项担忧。除非周边应用实施严格控制,嵌入检索文档中的恶意或意外指令可能会重定向智能体的行为。
当应用超越起草阶段时,Kolibri 的工具使用能力会增加这一风险。能够检索记录或准备表单的智能体,在修改官方数据之前需要权限边界和人工批准。
Aleph Alpha 已训练模型在所提供文档无法支持答案时选择拒答。其 Merlin-Arthur 方法生成正向上下文和刻意不完整的上下文,以教会模型何时应拒绝回答。
这种方法针对了真实的部署问题。标准模型训练常常奖励猜测,因为错误尝试偶尔也会获得认可,而拒答永远无法产出被要求的答案。
Aleph Alpha 报告称,在一项公司内部评估中,Kolibri 对 44% 缺乏支持依据的项目拒绝作答。Kolibri Origin 的比例为 15%。
该公司还表示,Kolibri 在另一项依据性测试中有所提升,并生成了更少的无依据陈述。这些结果令人鼓舞,但仍需谨慎解读。
较高的拒答率可以减少幻觉,却也可能降低系统的实用性。合适的平衡取决于任务涉及的是日常起草、福利决策、法律分析还是公共沟通。
公开结果混合了公认基准与 Aleph Alpha 的内部测试。内部评估可能更贴近客户工作,但外部人士无法在缺少数据和评分流程的情况下完全复现。
Aleph Alpha 报告称,其德国公共部门代理评分从 Kolibri Origin 的 0.54 上升至 Kolibri 的 0.75。该公司并未将这一结果表述为经过独立审计的指标。
这一缺口并不会使该评分失效。它意味着读者应将其视为内部进展的证据,而非生产环境可靠性的证明。
同样的谨慎也适用于合规主张。在设计时考虑欧盟《AI 法案》、GDPR 和《通用目的 AI 实践准则》是有益的,但合规性取决于已部署的系统。
公共机构必须评估预期用途、数据流、受影响人群、人工监督、日志记录、网络安全以及可能造成的伤害。合规的基础模型无法自动使每一个连接的应用都合规。
开放权重也带来了安全工作。政府机构必须追踪模型文件、依赖项、微调版本、评估记录,以及谁有权发布更新。
本地部署能够将敏感文档保留在受控环境中,但也可能让资源不足的组织承担修补和监控复杂 AI 技术栈的责任。
因此,最佳主权架构可能是将模型可移植性与托管运营相结合。政府机构需要拥有迁移或持续服务的权利,但无需假装每个机构都应自行运营 AI 基础设施。
Kolibri 增强了这种选择价值。它为采购方提供了一项可恢复的技术资产,而非一旦服务合同终止便随之失效的访问权限。
政府机构是否行使这一选择权,将取决于产品封装。部署工具、文档、支持合作伙伴、认证基础设施和可复现的评估,将与模型文件本身同样重要。
基准测试细节充分,但下一步是独立测试
Aleph Alpha 披露的技术细节多于典型产品发布,但决定性的公共部门证据必须来自公司之外。
Kolibri 于 9 月 11 日完成预训练,并于 10 月 3 日发布。Aleph Alpha 表示,主要预训练运行在 768 张 Nvidia B200 GPU 上持续了 21 天。
该模型处理了 20 万亿个预训练 token。中期训练增加了 3.44 万亿个 token,随后又进行了 2,000 亿个 token 的长上下文适配训练。
Aleph Alpha 表示,其流水线在过滤和整理前处理了超过 200 万亿个原始 token。该公司还为监督微调生成了 1,740 亿个合成 token。
在筛选这些样本并将其与宽松许可的数据集结合后,公司组建了一个 2,680 亿 token 的微调数据组合。强化学习使用了超过 120 万项经过整理的任务。
这些数字反映了大量工程工作,也为外部研究人员评估公司的数据和效率主张提供了有用细节。
Aleph Alpha 报告称,在为期 21 天的预训练期间发生了 38 次非计划中断。其自动化流水线无需人工干预,即可重启任务并从检查点继续运行。
这种运营韧性很重要,因为模型开发依赖可重复性。能够重启、评估并复现训练运行的团队,能比依赖脆弱研究脚本的团队更快纠正失败。
该公司表示,Kolibri 的 50 层中只有 10 层使用全注意力机制。其余层采用 512-token 滑动窗口,从而限制推理期间计算和内存的增长。
Aleph Alpha 还将一项拥有 1,230 亿参数的实验性配置与 Kolibri 的 780 亿参数设计进行了比较。该公司表示,较小模型可在两张 H100 GPU 上处理 18 个并发的长上下文请求。
据称,较大配置只能处理 3 个。Kolibri 在该公司测试中的解码速度也快了 28%。
这些架构选择契合其目标市场。政府机构需要的是能够在基础设施约束下运行的模型,而不只是能登上通用排行榜榜首的模型。
Kolibri 公布的评分显示,它在数学、编程、工具使用、长上下文任务以及常见评估的德语翻译版本上取得了具有竞争力的结果。
该模型在 Aleph Alpha 的德语版 AIME 2026 上获得了 90% 的成绩,并在德语 GPQA Diamond 评估中达到 81.3%。
基准比较包括 Qwen、Nvidia 的 Nemotron 系列和 Mistral Small。Aleph Alpha 表示,在选定任务上,Kolibri 可与活跃参数数量高达其四倍的模型相匹敌。
然而,基准数字仍会受到提示词、推理设置、推理预算、数据污染和评分选择的影响。翻译后的评估也可能与最初以德语编写的测试表现不同。
最有价值的下一步,是由大学、公共数字服务团队和独立模型评估机构开展可复现测试。这些团体应公布提示词、配置、硬件和失败案例。
现实测试应包括德国法律语言、市政术语、福利管理、采购文件,以及包含不完整证据的通信内容。
它们还应衡量区域差异。德国公共行政涵盖联邦、州和市级机构,且各自拥有不同的词汇、程序和文档格式。
评估必须涵盖普通员工,而不只是模型研究人员。技术上正确的答案,若其解释在时间压力下难以验证,仍可能无法通过评估。
公共机构应记录员工接受、编辑、拒绝或上报输出的频率。他们应衡量的是 Kolibri 在完成验证后是否节省时间,而不是验证前。
使用工具的智能体需要单独测试。评估人员应引入无法访问的记录、相互冲突的政策、已撤销的权限、过时文档和恶意指令。
模型的拒答行为值得重点审查。测试应区分合理拒答、不必要的拒答,以及看似自信却缺乏支持的输出。
独立团队还应将可下载版本与 Aleph Alpha 托管或定制产品中所使用的版本进行评估对比。系统提示词和检索机制的差异可能显著改变其行为。
在这些结果公布之前,Kolibri 的基准测试支持一项可信的工程主张。但它们并未解决该模型是否已准备好影响涉及公民的决策。
这种区分尤为重要,因为公共基础设施对错误的容忍度不同。存在缺陷的消费级回答只会造成不便,而行政错误则可能延误服务或改变法律结果。
三个信号将表明 Kolibri 是否重要
只有当公共机构验证它、以有意义的规模部署它,并保有真正自主运行它的自由时,Kolibri 才会变得重要。
第一个信号是独立的技术复现。研究人员应使用已发布的方法,确认其德语表现、长上下文检索、工具使用、硬件效率和拒答行为。
有力的复现将支持 Aleph Alpha 的主张,即专业化模型能够与更大的通用模型竞争。若差距较大,则会削弱该模型在采购中的说服力。
第二个信号是明确点名、并实际使用 Kolibri 本身的生产部署。Aleph Alpha 拥有公共部门合作关系,但采购方需要看到与这一版本及明确工作流程相关的证据。
一份有价值的披露应说明任务、用户群体、安全控制措施、评估周期和测得的时间节省情况。它还应报告错误类别和人工审查要求。
仅靠部署数量几乎说明不了什么。拥有数千名符合资格用户却未被实际使用的试点项目,并不等同于在关键行政流程中的日常使用。
第三个信号是 Aleph Alpha 与 Cohere 合并后围绕二者建立的治理结构。采购方需要明确了解模型所有权、未来版本、欧洲业务以及合同连续性。
如果 Kolibri 继续开放获取并频繁更新,这次合并可能会加强其地位。如果后续模型转向受限服务,当前的主权主张就会显得不那么持久。
竞争对手的回应将提供更多背景。SAP 和 OpenAI 可以凭借分发能力、既有软件关系和托管基础设施挑战 Aleph Alpha。
Mistral 可以通过欧洲身份、开放模型和政府合作关系参与竞争。公共研究项目也可以提供替代方案,而不必依赖一家初创公司的商业路线图。
这种压力对公共采购方是健康的。当机构能够比较多个可替代的供应商,而非指定一家国家级冠军企业时,主权就会显得更可信。
Aleph Alpha 的 Kolibri 模型让这种竞争变得更具体。它将德语专业化、开放权重、本地训练和高效推理整合为一个可检视的发布版本。
它的到来并不能证明德国已经解决了公共部门 AI 的问题。但它确实为主要通过托管合同定义的主权,提供了一个严肃的替代方案。
公共机构现在应通过透明采购和公开评估来检验这一主张。开发者可以检查权重、复现结果,并在 Kolibri 进入更高风险的工作流程之前记录其失败案例。
对于企业和政府采购方而言,眼下的行动很简单:在选择模型之前,先定义控制权究竟意味着什么。如果可移植性、法律管辖权、德语推理能力和持续运行能力都很重要,那么每项要求都需要可衡量的测试。



