top of page

Aleph Alpha Kolibri 将德国 AI 主权推向公共部门的考验

35分钟前
讀畢需時 16 分鐘

Aleph Alpha 于 10 月 3 日发布了拥有 780 亿参数、开放权重的 Kolibri,直接向依赖进口技术的政府 AI 发起挑战。Aleph Alpha Kolibri 模型面向希望获得强大系统能力、又不愿放弃基础设施控制权的政府机构和受监管行业。这一主张比又一次泛泛的欧洲数字独立倡议更为具体。

Kolibri 是一款德英双语推理模型,客户可以在自己的基础设施上运行。它支持工具调用、长文档处理、编程、结构化提取,以及对组织数据的检索。Aleph Alpha 表示,这一设计使客户能够更好地控制部署、知识产权和敏感信息。

如今的竞争已不再是欧洲 AI 对抗不受限制的美国云服务。OpenAI、SAP 和 Microsoft 已经为德国公共部门提供了本地治理路径。因此,Kolibri 必须证明:拥有模型权重并运行完整技术栈,能带来超越本地托管外国模型访问方式的实质优势。

Aleph Alpha Kolibri 的发布实际带来了什么

Kolibri 将 Aleph Alpha 关于主权的论点转化为可供技术团队检查、托管和适配的可下载模型。

该公司在 Apache 2.0 许可证下发布了 Kolibri 的完整权重。其发布详情将其描述为一款拥有 780 亿总参数的双语混合专家 Transformer 模型。混合专家模型会将每个 token 路由至选定的内部组件,而非激活整个网络。

Kolibri 每个 token 大约激活 34.6 亿参数。该设计旨在结合大模型的知识容量与更低的推理计算成本。不过,完整模型仍须保留在内存中,因此该设计降低的是处理需求,而非硬件存储需求。

Aleph Alpha 为 Kolibri 设计的是德语和英语能力,而非广泛的多语言覆盖。其训练语料包含 20 万亿个预训练 token。该公司称,其中约 62.5% 为英语、23.9% 为德语、13.6% 为代码。

随后,该模型又接受了额外的中期训练和长上下文训练。其文档所列的知识截止日期为 2026 年 6 月 18 日,适用于两种支持语言。工具访问可以提供更新的信息,但模型的内部知识不会自行更新。

Kolibri 宣称支持 1,048,576 个 token 的上下文窗口。上下文窗口是指模型在一次交互中能够考虑的文本量。这种容量可能支持处理冗长的案件卷宗、技术手册、监管记录或行政文件集合。

这项规格附带一项重要限定。Aleph Alpha 建议,对于复杂任务或对速度和吞吐量敏感的部署,上下文不要超过 262,144 个 token。百万 token 的数字代表经验证的上限,并不一定是每种工作负载的最佳运行点。

该模型支持显式推理模式和结构化工具调用。应用程序可以要求它搜索数据库、调用 API,或以指定格式返回输出。Aleph Alpha 提供与 OpenAI 兼容的接口,可减少已采用这一常见 API 模式的团队的集成工作。

Kolibri 还可以支持检索增强生成,即 RAG。这种方法会在每次请求中提供选定的组织记录,而不是仅依赖模型已学习的知识。对于需要基于现行政策、文件或程序指引作答的政府机构而言,这种方法很有用。

这一组合创造了实用的部署选项。某个部委可以使用 Kolibri 在自身环境中总结记录。市政办公室可以构建用于起草函件的助手,同时保留人工审批。工业运营商可以将模型连接到维护文档,而无需将其发送至外部推理服务。

这些是预期用途,而非经验证的生产结果。此次发布并不能证明 Kolibri 已经在德国各机构中处理公共记录。它证明的是,一个可部署的模型现已面向测试这一方法的组织推出。

这份模型文档对于一则发布公告而言异常详尽。它涵盖架构、训练数据构成、硬件、能耗估计、预期用途、评估和已知风险。这份文档使独立测试成为可能,尽管测试才刚刚开始。

Kolibri 的 FP8 版本模型内存占用约为 78 GB。Aleph Alpha 将一块 B200、一块 H200 或多块较旧的高内存加速器列为最低配置之一。买家仍需要合适的硬件、运营专业知识,以及围绕模型构建的应用层。

因此,开放权重并不意味着部署毫不费力。它意味着组织可以获取并运行模型,而不必在每一次推理请求中都依赖 Aleph Alpha。这一区别在采购规则、涉密网络或内部数据政策限制外部服务时尤为重要。

为什么较小的活跃模型对政府 AI 很重要

Kolibri 的核心技术押注是:专用性能和高效推理比赢得通用模型规模竞赛更重要。

政府系统很少需要一个连接到所有可能领域、不受限制的聊天机器人。它们需要受控的应用程序来总结文件、提取字段、起草文档或检索政策信息。在受限工作流内的可靠性,比对无关提示给出令人印象深刻的回答更重要。

Kolibri 的稀疏架构针对的是这一方程中的成本问题。尽管该模型拥有 780 亿参数,但每个 token 只激活其中一部分。这可以减少生成答案所需的计算量,同时保留更广泛的已学习表征池。

代价是内存。即使每个 token 仅由选定专家处理,运营者仍必须加载完整的权重集合。政府机构不能把 Kolibri 当作能在普通办公电脑上轻松运行的小型模型。

不过,在活跃计算量方面,这一设计仍比许多稠密模型更小。这可以提升吞吐量,并使私有化部署更加现实。它还可以让多项内部服务共享受控硬件环境,而无需将请求路由至公共端点。

Aleph Alpha 表示,Kolibri 的主要预训练使用了 768 块 Nvidia B200 加速器。该阶段持续 511 小时,约 21 天,消耗 392,000 GPU 小时。中期训练增加了 90,000 GPU 小时,长上下文训练则增加了另外 10,000 小时。

该公司估计,预训练、中期训练和长上下文工作合计消耗了 950 兆瓦时电力,其中包括数据中心开销。这一估计不包括监督微调、强化学习、空闲状态和实验性代理模型,因此不应被解读为完整的开发能耗。

这些披露很有价值,因为“主权”并不意味着无需资源。训练仍依赖美国设计的加速器和大规模基础设施。即使供应链中的每个组件都不是本土制造,运营独立性依然可以提高。

德语语言专业化是效率论点的另一部分。分词器会将文本转换为模型可处理的单位。Aleph Alpha 针对德语词汇结构调整了 Kolibri 的分词器,同时力求保持相当的英语效率。

德语包含许多复合词和词形变化形式,通用多语言分词器可能无法高效处理。更高效的分词可降低德语文档的序列长度、处理时间和成本。它还可以在行政工作流中更清晰地保留领域术语。

然而,高效分词并不能证明判断能力更强。政府文件包含模糊规则、例外情况、引用和特定案例事实。模型仍需要检索、验证、访问控制、审计日志和人工审查,才能支持可靠决策。

Kolibri 的工具调用功能可能有助于连接这些保障措施。应用程序可以要求模型在起草回复前检索最新法规。它可以依据官方数据库验证标识符,或在缺少必要证据时拒绝继续执行。

这种方式更像是受控工作流,而不是自主运行的公务员。模型卡明确将 Kolibri 定位于决策支持的咨询侧。它表示,人们应在采取行动前审查输出,并不鼓励未经审查的运行方式。

对于知识密集型团队而言,同样的原则也适用于政府以外的领域。当模型基于受治理、可搜索的知识库并具备可追溯来源运行时,其实用性会更高。模型能力本身无法修复杂乱或过时的记录。

Aleph Alpha 还训练 Kolibri 在所提供的信息不足以支持答案时,在某些情况下选择弃答。该公司使用了隐藏上下文练习,旨在奖励正确答案和拒答。这项训练直接针对基于文档的助手中常见的一类失败。

独立用户仍需测试这种行为能否迁移到真实的行政材料中。法律德语、不完整表格、相互冲突的记录和扫描文件会造成标准化评估未必能复现的条件。本地测试将决定这种专业化能力能否经受日常工作的检验。

主权 AI 如今有两种相互竞争的定义

Kolibri 将德国的讨论从“主权 AI 是否必要”转向“何种控制才配得上这一标签”。

Aleph Alpha 将主权定义为对开发、部署、数据处理和知识产权的控制。客户可以下载权重、选择自己的基础设施,并在不将每条提示发送给外部模型提供商的情况下运行。这是通过持有和运营独立性实现的主权。

另一条路径则通过本地治理和基础设施来定义主权。在这一模式下,组织可以使用外国开发的技术,同时将工作负载保留在受控的德国环境中。合同、云架构、法律监督和访问限制构成控制层。

OpenAI、SAP 和 Microsoft 已经承诺采取第二种方法。这项德国倡议将 OpenAI 模型与 SAP 的公共部门经验及 Delos Cloud 相结合。该服务在专为满足德国主权要求而设计的架构内使用 Microsoft Azure 技术。

SAP 表示,基础设施将扩展至 4,000 块 GPU,以支持 AI 工作负载。合作伙伴将政府行政、研究机构、文档管理和行政分析列为目标领域。他们的主张与 Kolibri 的目标市场直接重叠。

这使 OpenAI for Germany 成为 Aleph Alpha Kolibri 最明确的竞争对手。这场竞争并不只是本土创业公司面对消费级聊天机器人,而是开放权重控制与由三家拥有强大企业市场影响力的公司组建的托管服务之间的较量。

托管方案具有其优势。机构可以获得成熟的支持服务、熟悉的采购关系,以及高能力模型的使用权限。它们无需依赖稀缺的内部工程人才来运营复杂的模型技术栈。

开放权重方案则提供了另一种杠杆。机构可以保留稳定的模型版本,审查其文档,并确定其运行位置。它还可以调整周边系统,而不必依赖单一托管端点或其未来的商业条款。

两种路径都无法消除依赖关系。本地部署仍依赖加速器供应商、数据中心运营商、软件库和熟练的承包商。托管的主权云仍依赖供应商的模型路线图、许可决策和技术控制措施。

相关问题在于,机构能够审计、替代或治理哪些依赖关系。物理数据位置只能回答其中一部分问题。模型访问权限、更新权限、训练透明度、事件响应和退出选项,同样决定着运营控制力。

Kolibri 的 Apache 2.0 权重提升了可移植性,但此次发布并不等同于公开全部开发产物。Aleph Alpha 表示,该许可证涵盖仓库中的权重和配置文件;公司仍保留其代码、架构细节、训练方法及其他知识产权的权利。

这也是为什么“开放权重”比“完全开源”更准确。用户可以在宽松许可证下运行和修改已发布的权重,但未必能仅凭公开材料复现完整的训练过程。

该模型还需要 Aleph Alpha 的推理包来实现其专用的 vLLM 集成。该软件包可供安装,接口也遵循常见模式。不过,技术独立性取决于外部团队能否在不存在隐性运营瓶颈的情况下维护部署。

Aleph Alpha 计划与 Cohere 合并,也进一步复杂化了其国家属性的叙事。两家公司于 9 月签署了最终协议,交易尚待最终监管批准。合并后的业务预计将以 Cohere 名义在全球运营。

这份合并协议承诺在柏林和多伦多设立总部,并继续在海德堡开展研究活动。协议还描述了针对德国和加拿大要求的保障措施。这些承诺将影响客户在交易完成后如何理解 Kolibri 的主权属性。

此次合并可以增强 Kolibri 的分发和支持能力。Cohere 带来国际企业客户关系和部署经验;Aleph Alpha 则贡献德国研发能力、公共部门联系,以及围绕本地需求构建的模型。

但它也提出了一个此次发布无法解决的问题:如果一个德国模型属于一家跨大西洋公司,买方将审视谁控制更新、治理、知识产权和战略优先级。主权必须在企业整合后继续能够以运营层面的方式衡量。

政府采用才是真正的衡量标准

一款面向政府的模型必须在采购、安全、法律和人工审核体系中取得成功,而不仅仅是在公开排行榜上表现出色。

Aleph Alpha 列举了对德语能力、推理、数学、工具使用、检索、编程和长上下文的评估。该公司还将 Kolibri 与 Mistral、Nvidia、Google、阿里巴巴 Qwen 团队和 OpenAI 的模型进行了比较。

这些结果有助于技术评估人员确定测试方向,但不能独立证明其对德国行政体系具有优越性。基准构成、提示词格式、推理设置和评分选择,都可能对比较结果产生实质影响。

公共部门的性能表现具有不同形态。模型在总结长文件时,可能需要保留引文;它还可能需要区分具有约束力的规则与指导意见,或在不虚构答案的前提下识别缺失信息。

一个成功的助手还需要严格的权限控制。不能仅因为模型能够广泛搜索,就让一名员工检索到另一部门的受限记录。身份管理和文档级授权应位于语言模型之外。

可审计性带来了另一项要求。机构需要知道哪些记录支撑了某项输出、由哪个模型版本生成,以及由谁批准了该操作。由于生成结果可能在不同运行之间变化,复现完全相同的措辞仍可能很困难。

因此,Kolibri 最适合的近期用途是边界明确且可审核的任务,例如起草信件、分类文档、提取结构化字段或查找相关段落。不适合在无人类监督的情况下作出资格认定或执法决定。

巴登-符腾堡州提供了相关先例。该州已在 F13 中使用 Aleph Alpha 技术;F13 是与公共部门合作伙伴共同开发的行政助手。尽管 Kolibri 本身刚刚发布,这一合作关系已让该公司获得了政府工作流程的实际经验。

德国公共广播机构的报道围绕数据保护、可追溯性和客户控制权来描述此次发布。Aleph Alpha 联合创始人 Samuel Weinbach 表示,该模型针对德语需求进行了定制。首席执行官 Ilhan Scheer 则将主权与保留开发和引导这项技术的能力联系起来。

这篇地区报道同样采用了谨慎的归因方式:它报道的是公司所称 Kolibri 能够做到的事情,而非将每项能力都视为已被独立证实。这一区别也应指导买方。

可信的政府评估应采用真实的文档结构和具有代表性的语言。测试应包括过时政策、相互矛盾的附件、非典型案例和对抗性提示词,也应衡量恰当的拒答表现,而不仅仅是完成答案的数量。

评估人员需要区分模型错误与检索错误。模型可能基于搜索系统错误选取的文档进行正确推理;反过来,检索系统也可能提供正确证据,而模型却误述其含义。

测试还必须比较完整系统。在同一机构可用的托管替代方案面前,应比较运行于本地、搭配特定检索技术栈的 Kolibri。仅比较孤立的基准得分,无法揭示集成工作量、监控质量或运营可靠性。

成本比较也需要同样的严谨性。稀疏激活可以降低推理计算量,但本地运行会带来硬件、人员、维护和安全开支。托管服务将其中部分成本打包,却也引入对供应商的依赖。

目前尚无公开部署数据表明,政府工作人员会多频繁地接受、编辑或拒绝 Kolibri 的输出。此次发布也没有既定的事件记录、正常运行时间历史或长期维护证据。这些指标将比发布当天的关注度更重要。

欧盟监管环境进一步提高了标准。Aleph Alpha 被列为 GPAI code 的签署方;这是一项涵盖透明度、版权、安全和安保义务的自愿合规工具。签署有助于合规,但下游系统仍承担各自的法律责任。

政府机构不能把问责责任外包给模型卡。它必须评估最终应用、其用户以及失败的后果。无论底层模型来自海德堡、巴黎、多伦多还是加利福尼亚,这一点都不变。

开放权重并不会消除棘手风险

Kolibri 提供了更多部署控制权,但这种控制权也将责任转移给运行它的组织。

Aleph Alpha 自身的文档警告称,Kolibri 可能生成不正确、过时、不相关、重复、有偏见或有害的内容。该公司建议在高风险环境中增加额外防护措施,也表示模型不应在无人类监督的情况下作出决策。

这一警告很重要,因为政府语言带有权威性。一段流畅的回答即使误读了规则,也可能显得正式可靠。德语专业化或许能提高语言质量,却也可能让错误在德国用户面前显得更具说服力。

模型的训练截止日期带来了可预测的风险。法规、行政决定和内部程序会在 2026 年 6 月 18 日后发生变化。生产系统必须检索最新材料,并将其与过时记录区分开来。

检索并不会自动解决这一问题。文档可能索引不佳、受访问控制、重复,或缺少重要背景。模型也可能忽略提供的证据,或错误地组合段落。

政治偏见需要谨慎测试。Aleph Alpha 表示,其围绕人的尊严、民主、多元主义和法治,对训练数据进行了过滤和对齐。模型卡仍承认,训练材料中的政治偏见可能会在某些情境中出现。

这一问题对面向公众的助手尤其相关。机构必须防止不平等对待、不当语气和虚构的政策声明。测试应涵盖方言、姓名、与残障相关的请求、移民议题以及其他敏感行政场景。

开放权重同样带来安全选择。本地控制可以避免将提示词发送给外部服务,但它本身并不能保护应用安全。运营方必须修补软件、保护模型端点、监控访问并隔离连接的工具。

工具调用扩大了风险面。仅返回文本的起草助手后果有限;如果应用授予相应权限,已连接的代理则可以搜索系统、创建记录或触发流程。

Kolibri 的文档建议在应用层进行验证。这意味着在输出进入另一系统前进行检查、限制可用操作,并记录重要交互。高影响力工具应要求明确的人类确认。

百万 token 上下文同样值得保持怀疑。更大的上下文可以容纳更多材料,但并不保证模型会准确使用其中每个部分。Aleph Alpha 自身的长上下文结果会随序列长度增加而变化,并建议为要求严格的任务设定更低的上限。

技术团队应在真实长度下测试检索质量,而非填满整个上下文窗口。一组经过精心选择的较小段落,可能优于庞大而嘈杂的记录转储。更多上下文可能引入矛盾,并使模型偏离决定性证据。

硬件需求构成了采用障碍。量化模型需要大显存加速器,而许多机构并不在内部管理此类资源。组织仍可能转向公共数据中心、州级 IT 服务商或商业合作伙伴。

如果治理和技术控制足够强,这种安排仍可保持主权属性。不过,这意味着“本地部署”只是一个部署选项,而非每个市政机构的默认选择。共享的主权基础设施可能更具实用性。

与 Cohere 的企业过渡增加了运营不确定性。监管机构尚未完成两家公司所描述的交易,产品整合细节也仍有待公布。

考虑长期部署的客户需要获得有关支持期限和兼容性的明确答复。他们会希望了解谁维护 Kolibri、更新如何交付,以及未来版本是否保留相同的许可模式。

该发布仍然具有价值,因为它让这些问题可以接受检验。政府机构能够下载该模型、考察其行为,并将其与托管式替代方案进行比较。当采购团队能够评估一个具体的产品时,主权就不再那么抽象。

错误在于把可获得性当作验证。Kolibri 已经跨越了从承诺到产品的界线,但尚未跨越从产品到经验证的公共基础设施的界线。

三个信号将显示 Kolibri 是否改变市场

接下来的证据应来自实际部署、独立评估和持久的产品承诺,而不是又一轮发布宣传。

第一个信号是某个具名政府机构在生产环境中部署并使用 Kolibri 本身。Aleph Alpha 现有的合作关系提供了一条路径,但宣布试点项目还不够。有价值的证据应包括明确的工作流程、人工管控措施以及可衡量的成果。

如果某个机构报告其能够在真实记录上可靠使用,采用情况将加强 Aleph Alpha 的论点。错误率、修正率、处理时间和员工接受度,将帮助采购方判断其价值。保密演示的说服力不如有据可查的运营证据。

第二个信号是独立模型测试。研究人员和技术用户如今已获得模型权重,因此可以进行复现。他们应测试德语法律推理、基于事实的检索、工具使用、长文档处理、偏见以及拒答行为。

独立结果不必宣布唯一的普遍赢家。它们需要展示 Kolibri 在哪些方面表现良好、又会在哪些方面失效。这种画像会比单一平均分数更有用。

测试应采用可比较的硬件和推理设置。稀疏模型的效率高低,可能会因批处理、量化和内存配置而呈现不同结果。透明的方法将决定 Aleph Alpha 的性能成本比主张能否在其自身环境之外成立。

第三个信号是 Cohere 交易完成后会发生什么。客户应关注最终监管决定、组织结构以及 Kolibri 的路线图。以宽松条款持续发布,将支持其实现持久控制的承诺。

转向更封闭的服务模式将削弱这一承诺。维护、支持或未来模型开发的责任归属不清,同样会产生这种影响。反过来,更深入地整合 Cohere 也可能在不限制客户控制权的前提下,扩大部署能力。

竞争对手的反应将在这三个信号之中提供额外背景。OpenAI for Germany 已经提出了另一种对主权的定义。Mistral、欧洲开放模型项目及其他提供商,将继续争夺受监管工作负载。

Kolibri 不需要超越所有前沿模型才具有意义。它需要在特定的德语和英语工作流程中具备足够能力,同时提供采购方能够验证的控制权。这是一个更狭窄的标准,但并不容易达到。

对开发者而言,此次发布带来了一个值得审查和测试的重要新模型。其兼容 OpenAI 的接口和已发布的模型权重,降低了初步实验的门槛。硬件、集成和验证仍然是重大项目。

对于企业和政府采购方,Kolibri 扩大了谈判空间。他们可以比较开放权重的本地运行方式与本地治理的托管服务。这种选择可以厘清其政策实际要求哪些形式的主权。

对于知识工作者,短期影响将是间接的。Kolibri 将通过文档搜索、起草和行政分析助手出现,而不是作为消费者聊天机器人。它的价值将取决于围绕它的记录和控制措施。

因此,Aleph Alpha 推出 Kolibri 的意义,与其说是一场民族主义模型竞赛,不如说是一次检验:所有权、专业化和部署自由是否能够改善真实的机构系统。

评估它的机构应提出三个直接问题:独立测试能否复现其优势,员工能否在明确的工作流程中安全使用它,以及组织能否在不失去控制权的情况下切换供应商?

如果这些问题的答案最终都是肯定的,Kolibri 将为德国带来的不只是一个象征性的本土模型,还会是一种面向敏感 AI 基础设施的实用替代方案。如果这些答案仍不明确,主权仍将只是附着在未经验证的部署选择上的一个吸引人标签。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page