top of page

Aleph Alpha Kolibri 将主权 AI 控制置于前沿规模之上

3天前
讀畢需時 15 分鐘

Aleph Alpha 于 10 月 3 日发布了 Kolibri,这是一款拥有 781 亿参数、开放权重的模型,并直接挑战了云优先的模型市场。Aleph Alpha Kolibri 的主张并不是德国打造出了全球最大的模型,而是政府机构和受监管企业无需放弃具竞争力的推理、文档处理与工具使用能力,也能保留实质性的控制权。

这一差异至关重要,因为许多组织不能只依据基准测试分数评估 AI 模型。它们还必须确定数据流向何处、谁控制部署、训练材料如何筛选,以及管理员能否审查系统的边界。Kolibri 围绕一款面向德语和英语工作负载设计的双语模型,整合了这些要求。

此次发布也让 Aleph Alpha 走上了与那些将最强能力集中在专有服务中的实验室不同的道路。Kolibri 采用 Apache 2.0 许可证,可在客户选定的基础设施上运行。不过,开放权重并不会自动带来可信的决策、合规性或低运营成本。

因此,Aleph Alpha 希望买家评估另一种权衡:其模型提供更高的部署控制权和德语专业化能力,但也让集成、验证、安全与硬件责任更多地落在客户身上。

Aleph Alpha Kolibri 将主权 AI 从政策带入部署

Kolibri 将 Aleph Alpha 的主权论点转化为技术团队可下载、检查并在所选环境中运行的模型。

该公司于 10 月 5 日宣布 Kolibri,距离模型开放使用两天后。根据 Kolibri 公告,该模型在欧洲开发和训练,面向公共管理和工业领域的业务关键型工作。

Kolibri 是一款混合专家模型,意味着它会将每个 token 路由至选定的专业组件,而非激活全部参数。它共有 781 亿个参数,但每个 token 仅激活约 34.6 亿个参数。

这种分离可减少每个生成 token 所需的计算量。不过,它并不能消除容纳更大模型所需的内存。Aleph Alpha 表示,其 FP8 权重的模型占用空间约为 78 GB。

该模型支持德语和英语、显式推理控制、结构化输出及原生工具调用。用户可关闭扩展推理,或选择低、中、高不同工作强度。这让运营人员能针对较难请求,在响应时间与额外计算之间取得平衡。

Kolibri 还支持检索增强生成,即 RAG:模型回答问题时会获得选定文档。Aleph Alpha 表示,若这些文档缺乏足够的支撑证据,模型经过训练会选择不作答。

这种行为针对的是一个实际的公共部门问题:当提供的法规未包含相关内容时,政府助手不应杜撰资格规则;当源文件不完整时,工业系统也不应自行生成维护指令。

其预期场景仍以辅助性用途为主。模型卡将 Kolibri 定位于由人员在采取行动前审核输出的系统中。Aleph Alpha 并未将其描述为可用于重大案件的自主决策者。

示例包括文档处理、起草、基于组织记录的问答、内部研究、结构化提取,以及调用经批准工具的工作流。这些场景足够聚焦,能够根据组织自身材料进行评估。

此次发布的开放程度也高于仅提供托管 API。权重似乎采用 Apache 2.0 许可证发布,Aleph Alpha 还通过其推理软件包提供兼容 OpenAI 的服务接口。组织可将该系统置于自身的访问控制与监控机制之后。

开放权重并不等同于完全开放的开发流程。已发布的软件包让用户能够广泛访问模型和详尽的技术文档。要复现整个训练过程,仍需要远超普通部署团队能力范围的数据、专业知识与计算资源。

尽管如此,这一具体变化仍意义重大。欧洲买家如今拥有一款大型、聚焦德语的模型,可按常规自托管审查流程推进。他们不必从请求将敏感提示词发送至另一家公司公共云服务开始。

这让 Kolibri 成为一项检验:控制权本身是否已成为具有竞争力的产品特性。答案不只取决于许可证,还取决于组织能否将这种控制转化为可靠系统,而不承担难以管理的技术负担。

德语优先模型为何改变采购决策

Kolibri 凭借语言深度、可记录的来源以及客户可控部署参与竞争,而不是追求最大的全球规模。

德语占 Kolibri 预训练语料的 23.9%,英语约占 62.5%,代码则占其余 13.6%。完整的预训练语料共包含 20 万亿个 token。

这些比例体现了一种有意的专业化。许多多语言模型支持德语,但支持并不一定意味着德语获得了同等程度的训练关注。法律复合词、行政用语和行业术语,可能暴露出广泛英语主导型基准测试未能发现的弱点。

Aleph Alpha 开发了一个包含 128,000 个 token 的词表,其分词器部分针对德语形态特征进行定制。分词器会将文本拆分为语言模型处理的单位。更高效的切分可以减少长复合词和密集行政文件所需的 token 数量。

该公司报告称,德语平均每个 token 为 4.7 字节,英语为 4.2 字节。其主张并不只是德语可用,而是德语压缩效果得到改善,同时不会对英语处理造成实质性损失。

这可能同时影响运营成本和可用上下文。占用更少 token 的采购文件,可为支持文档、对话历史或检索证据留出更多空间。它还可能降低重复文档工作流中的计算量。

语言专业化只是采购理由的一部分。该公司表示,Kolibri 的训练数据流程依据包含超过 450 万个 URL 的屏蔽清单进行了筛查。其文档描述了对许可条款、合法来源、退出机制及第三方数据集的检查。

这些措施并不能证明所有潜在的版权或隐私问题均已解决。但相较于笼统地保证负责任训练,它们为法务和合规团队提供了更具体的审查记录。

Aleph Alpha 还表明自己是欧盟《通用 AI 行为准则》的签署方。欧盟委员会将 GPAI Code 描述为一项自愿机制,旨在帮助提供商证明其符合相关 AI 法案义务。

签署该准则并不意味着每项部署都获得认证。运营 Kolibri 的组织仍须评估自身系统、数据、用途及风险类别。用于总结公共会议记录的模型,与用于对福利申请排序的模型,面临的关注点不同。

模型与运营系统之间的区别至关重要。Kolibri 提供语言能力,但客户仍控制检索层、用户权限、审计记录、系统提示词、工具和人工审核流程。

这正是主权变得可衡量的地方。组织可以决定模型权重存放位置、哪些文档进入提示词、谁能访问日志,以及外部供应商能否在未通知的情况下改变行为。

自托管模型也能支持更严格的信息边界。制造商可将其连接至获批准的维护手册,同时排除无关的设计文件。政府部门则可按部门和安全等级限制检索范围。

这些场景类似于受控的 AI knowledge base,其中检索质量和权限与文本生成同样重要。模型只是完整系统中的一层。

因此,Kolibri 改变了采购问题。买家不再只问哪种托管助手能给出最佳通用答案,而是可以问:哪款模型符合其语言、基础设施、证据和治理要求。

这种更聚焦的竞争有利于 Aleph Alpha 的设计。它并未消除对准确性、吞吐量、人员配置或全生命周期运营成本的比较需求,但使这些比较针对受监管工作负载,而不是把公共聊天机器人排行榜视为最终答案。

开放权重控制与云端便利性竞争

主要竞争是客户控制权与托管便利性之间的较量,而不是 Aleph Alpha 与某一家美国或欧洲实验室之间的竞争。

云模型服务提供了一种颇具吸引力的运营模式。买家将应用连接至 API,由提供商处理容量、模型更新和大部分服务基础设施。无需内部部署项目,新的功能即可推出。

这种便利性将重要决策转移给提供商。供应商决定可用区域、保留控制、模型版本、服务限制和弃用时间表。合同条款可以缩小这些风险,但客户仍依赖外部运营环境。

Aleph Alpha Kolibri 将更多权力交还给客户。团队可持有权重、选择基础设施、限制网络访问,并控制更新后的模型何时进入生产环境。

同样的转移也适用于责任。自主管理的部署需要容量规划、身份验证、可观测性、安全补丁、模型评估及事件处置流程。开放许可证不会自行运行生产服务。

硬件很好地说明了这种权衡。Aleph Alpha 表示,FP8 模型需要约 78 GB 内存。其列出的最低配置包括两块 A100 80 GB 加速器、两块 H100 SXM5,或一块 H200、B200 或 B300。

该公司建议某些部署采用两块 H100 SXM5 或两块 H200 加速器,尽管其指南中也列出了较新的单加速器配置。这些要求表明,Kolibri 所处的是企业级基础设施环境,而非普通办公硬件。

其稀疏架构有助于降低每个 token 的计算量。在每一层中,384 个路由专家中仅有 6 个参与处理每个 token,另有 1 个共享专家始终启用。不过,系统仍需访问模型的完整权重集。

这也是为什么 34.6 亿个激活参数不应与传统 34.6 亿参数模型的占用规模混为一谈。稀疏激活可提升吞吐量,但内存容量、通信模式和服务软件仍然重要。

Aleph Alpha 在预训练阶段使用了 768 块 Nvidia B200 加速器,对 Kolibri 进行了 21 天训练。其模型卡报告称,该阶段消耗了 392,000 GPU 小时,此外还有额外的中期训练和长上下文训练工作。

该公司估计,已披露训练阶段的总训练能耗为 950 MWh,其中包括数据中心开销。该估算不包括监督微调、强化学习、小规模实验以及其他部分活动。

这些细节强化了其文档披露的说服力,同时也揭示了此次发布背后的资源投入。主权 AI 并不意味着小型或可在本地复现的 AI。它通常意味着,机构能够选择由哪些可信运营方控制一套昂贵的技术栈。

Kolibri 的上下文窗口也带来了另一项运营层面的选择。该模型原生训练至 262,144 个 token,Aleph Alpha 则通过外推将其验证至 1,048,576 个 token。该公司建议,对于复杂任务和高效推理服务,应将长度控制在原生训练长度以内。

百万 token 的设定对于处理庞大档案似乎很有吸引力。但在实践中,更长的提示词可能增加延迟、内存使用量,以及核验哪些证据塑造了最终答案的难度。

与其加载全部内容,检索或许是更好的方法。一个经过精心设计的系统会找出少量相关段落,保留其引用来源,并要求模型仅依据这些证据作答。

同样的谨慎也适用于工具调用。Kolibri 可以为搜索、API 或代码执行生成结构化调用。周边系统必须验证这些调用、限制权限,并在允许产生重要影响的操作前检查返回数据。

托管云平台通常会打包处理其中部分工作。自主管控的技术栈让客户可以自行作出每项决策,但也会暴露每一项缺失的防护措施。

对政府和受监管行业而言,这或许是一种可以接受的交换。关键问题在于,本地控制是否能充分降低法律与运营风险,从而值得额外的工程投入。

Kolibri 能否成功,取决于客户是否会在生产环境中看重这种交换,而不只是将其写入采购文件。它必须成为一个可运营的替代方案,而不是一款仅停留在试点环境中的出色模型。

Aleph Alpha Kolibri 基准测试尚未解决的问题

Aleph Alpha 报告了具有竞争力的结果,但其自身的评估数据也说明,主权性无法替代针对具体工作负载的测试。

公开发布的 Kolibri 模型卡 包含了异常广泛的训练、架构、预期用途、评估和局限性细节。它还将 Kolibri 与 Mistral、Qwen、Nvidia、Google 及其他开发者的模型进行了比较。

Aleph Alpha 表示,Kolibri 在德语和英语场景中处于有利的质量与服务成本前沿。其比较采用平均基准性能以及每张 GPU 每秒生成的文本量。

在高等数学基准测试 AIME 2025 上,该公司报告的英语得分为 96.9,德语得分为 87.5。其 AIME 2026 结果分别为 96.0 和 90.0。

Kolibri 在英语 GPQA Diamond 基准测试中也获得了 84.3 分,在德语版本中获得 81.3 分。在该公司的表格中,这些分数优于若干每个 token 激活更多参数的模型。

但在智能体和工具任务上的表现并不那么一致。Kolibri 在 BFCL v4 总体测试中获得 61.4 分,而列出的 Qwen3.6 35B-A3B 结果达到 67.2 分。其 BFCL 多轮结果为 47.5,低于多个对比模型。

在 TerminalBench 2.1 上,Kolibri 获得 27.7 分。表格显示,Qwen3.6、Nemotron 3 Super 和稠密模型 Qwen3.8 的得分更高。

Kolibri 在某些面向特定领域的智能体基准测试中表现更强。它在一项电信任务中获得 94.7 分,在航空公司场景中获得 76.7 分,在银行业场景中获得 38.1 分。其他模型在若干单项指标上仍然领先。

这些结果支持一个较为平衡的结论。Kolibri 在其激活参数量级中似乎具有竞争力,尤其是在数学、双语推理和部分智能体任务方面。它并未在所有对企业系统重要的评估中占据主导地位。

该公司的长上下文结果同样需要谨慎解读。在 RULER 测试套件中,Kolibri Base 在 256,000 个 token 时得分为 69.8,在一百万个 token 时得分为 63.2。后者是超出其原生训练窗口的外推长度。

更大的宣传上下文长度并不能保证模型在所有位置上都能保持一致的推理能力。随着提示词增长,精确检索、指令保持和跨文档综合能力可能以不同方式退化。

Aleph Alpha 还为汽车供应商、半导体、德国公共部门、工业传动技术和航空航天使用了内部客户代理评估。该公司报告称,在开发过程中,这五个类别均有所改善。

这些私有测试套件可能比通用学术测试更准确地反映相关工作流。但在缺少底层提示词、数据、评分流程和基准线的情况下,独立读者无法复现它们。

因此,该公司的基准测试应当用于指导评估,而非取代评估。公共机构应在其自身的文档格式、术语、弃答要求和对抗性案例上测试 Kolibri。

制造商应以经验证的维护记录衡量其信息提取准确率。银行则应在将模型暴露给运营系统前,测试工具调用、权限、多语言文档和故障恢复。

模型卡本身也承认了广泛的局限性。语言模型可能产生事实错误、带有偏见的输出、过时信息,以及会被用户误认为人类判断的文本。Kolibri 的知识截止日期为 2026 年 6 月 18 日,因此当前事实需要通过检索或工具获取。

其基于证据作答的行为仍然只是一种模型能力,而非保证。系统可能检索到错误文档、遗漏决定性段落,或提供相互矛盾的内容。模型随后可能基于有缺陷的证据生成一份看似完善的答案。

这对于 Aleph Alpha 的弃答主张尤为重要。能够拒绝回答缺乏支持的问题的模型,或可减少部分幻觉。买方必须衡量它在何种频率下恰当地弃答、在证据薄弱时仍然作答,或在证据充分时拒绝回答。

社区反应已反映出这种不确定性。早期开发者称赞 Kolibri 的开放性和德语侧重,而另一些人则质疑,其总体规模和硬件需求是否能由基准测试结果证明合理性。

这场讨论很有价值,因为它区分了两种主张。Kolibri 可以作为一个透明、可控的欧洲模型而具备价值,而不必在每一项公开测试中成为全球领先者。

Aleph Alpha 的文档使这一区别更容易被审视。其余的证明仍须来自独立评估和持续的生产环境使用。

主权 AI 仍依赖硬件、合作伙伴与治理

Kolibri 减少了对专有模型访问的依赖,但并不会让组织摆脱对芯片、基础设施提供商或集成合作伙伴的依赖。

“主权 AI”一词可能暗示完全的技术自给自足。Kolibri 提出的是一个更务实的版本:基于控制权、选择权、有据可查的决策,以及在可信基础设施内运营模型的能力。

这种版本仍然包含外部依赖。公开的硬件配置依赖 Nvidia 加速器。生产部署需要数据中心、网络、电力、存储和软件专业知识。

大型组织可能自行运行模型。其他组织则将依赖国家云、区域服务商、系统集成商或技术合作伙伴。届时,主权性取决于整个供应链中的合同、司法管辖权、技术访问权和切换选择。

Aleph Alpha 的公司发展方向进一步强化了这一点。该公司宣布,计划在 2026 年与加拿大企业 AI 开发商 Cohere 合并,但仍须获得监管批准。

拟议中的集团将以 Cohere 名义在全球运营,并在加拿大和德国开展业务。支持者认为,这将形成一家拥有企业分销能力和欧洲研究实力的更大型跨大西洋竞争者。

这笔交易也使简单的国家叙事变得更复杂。Kolibri 被描述为在欧洲开发和训练,而 Aleph Alpha 的未来可能置于一家跨越两个司法管辖区的公司之中。

这并不会自动削弱客户控制权。主权性可以来自可移植的权重、可执行的数据边界、透明治理和多种部署选择,而非某一家供应商的国籍。

不过,买方应审视实施后哪些内容仍可移植。即使基础模型可以下载,自定义适配器、检索系统、监控工具和编排代码也可能形成新的锁定形式。

组织还应区分模型透明度与运营透明度。详细的训练报告有助于评估基础模型,但不会揭示每一次生产响应受到哪些检索段落、提示词、工具或访问规则的影响。

可审计性必须被纳入应用设计。团队需要可追溯的来源检索、版本化提示词、模型标识符、访问日志、评估记录和已记录的人类审批流程。

数据治理构成了另一道边界。自托管可以将提示词保留在受控环境中,但无法纠正糟糕的权限设置或重复存放的敏感文件。将模型连接到缺乏治理的文档库,可能扩大暴露面。

安全团队必须考虑提示词注入——一种将恶意指令隐藏在文档或外部内容中的技术。具有工具访问权的模型可能会遵循这些指令,除非周边系统将数据与权限分离。

因此,工具权限应遵循最小权限原则。文档助手不需要不受限制的电子邮件访问权限。维护助手也不应仅因检索到的文件提出要求,就执行设备命令。

监管责任同样仍由多方承担。Aleph Alpha 可以记录模型及其训练流程。部署方必须评估最终应用,包括预期用户、受影响人群、监督机制、日志记录和救济措施。

这正是 Aleph Alpha Kolibri 发布背后的核心权衡。客户获得了自行作出更多决策的能力,同时也失去了将每项重要选择归咎于远程平台提供商的借口。

对于成熟的公共机构和工业企业而言,这或许正是重点所在。其现有的风险、安全和采购团队已经在管理具有重大影响的系统。Kolibri 为它们提供了另一个可纳入这些控制体系的组件。

较小的组织可能会发现该模型更难以证明其合理性。它们可能通过托管服务或基础设施需求更低的小型开放模型获得可接受的结果。

主权性并不是一个具有单一制胜配置的通用产品类别。它是一组会随司法管辖区、工作负载、议价能力和组织能力而变化的要求。

Kolibri 为买方在这一范围内提供了一个具体选择。下一个问题是,其控制优势能否经受住采购、集成和日常运营的检验。

三个信号将显示 Kolibri 是否重要

下一阶段不是又一次基准测试公告,而是有证据表明受监管组织能够可靠、独立地部署 Kolibri,并以可持续的运营成本运行它。

第一个信号是独立技术评估。研究人员和企业团队需要复现重要的基准测试结果,测试德国行政语言,并在现实条件下检验长上下文行为。

独立测试应包括失败案例,而不仅是平均准确率。有价值的报告将衡量缺乏支持的答案、恰当弃答、引用质量、提示词注入抵抗能力和工具调用错误。

强有力的第三方结果将强化 Aleph Alpha 的主张:专业化模型能够与能力更广泛的模型竞争。若公司测试与外部测试之间存在较大差距,其“主权”论述中有关质量的部分就会受到削弱。

第二个信号是生产环境的采用情况。Aleph Alpha 需要披露具名部署案例,且这些案例应超越演示和有限试点,尤其是在公共行政、制造业、金融或其他受监管领域。

最有参考价值的案例会披露实际工作负载。成功的文档搜索助手,对于自主工具使用的说明意义不如能够与运营数据库交互的系统。

买方应关注可衡量的结果,例如审核准确率、节省的时间、拒答率、事件数量,以及需要修正的输出占比。这些指标比公布的合作伙伴数量更重要。

生产环境案例还应明确由谁运营基础设施。由客户直接部署将支持其可移植性主张。若高度依赖某一家托管合作伙伴,虽然仍可实现区域控制,但独立性会更为有限。

第三个信号是拟议中的 Cohere 交易完成后,该模型的发展路径。Aleph Alpha 已根据 Apache 2.0 发布 Kolibri,因此当前权重仍可在这些条款下获取。

未来的投资将显示,以德国为先的模型开发是否仍是持续的产品方向。买方将关注更新、安全支持、推理改进,以及与常见服务工具的兼容性。

他们还应关注未来模型是否保留可下载权重和详细技术报告。若转向托管访问,将改变使 Kolibri 与众不同的控制主张。

Cohere 的企业覆盖范围可能加快部署,并为研究团队提供更多资源。但这也可能导致产品整合。最终形成的平衡将揭示,Kolibri 是一个模型家族的起点,还是通往更大平台的战略桥梁。

对开发者而言,眼下的任务是进行严谨测试。可下载权重和熟悉的 API 使实验成为可能,但生产就绪性必须针对明确的工作负载加以验证。

对企业买方而言,决策始于控制要求。如果数据所在地、模型可移植性、德语性能和有据可查的来源是硬性要求,Aleph Alpha Kolibri 值得评估。

如果托管服务的便利性和广泛的通用能力更重要,托管模型可能仍是更好的运营选择。这次发布并未消除这一选项,只是让替代方案更具可信度。

对公共部门领导者而言,Kolibri 提出了一个务实的问责测试:机构追求主权,是因为它们能够更有效地治理技术,还是因为这个标签听起来令人安心?

可信的答案需要证据、预算、受过培训的人员和透明监督。模型本身并不会自动提供这些条件。

Kolibri 最重要的贡献,或许是迫使买方界定控制究竟意味着什么:本地托管、开放权重、区域基础设施、获取文档的权限、合同保障,还是更换供应商的能力?

组织应在选择模型之前写明这些要求。随后应据此测试 Kolibri,在可能的情况下公布有意义的结果,并将每一项缺乏支持的能力视为尚未解决的问题。这正是 Aleph Alpha 的主权 AI 论点从发布声明转变为可验证运营选择的方式。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page