top of page

六家 AI 实验室现在正在发布与 GPT 竞争的模型。其中没有一家是 OpenAI。

2026 年 4 月是开源 AI 历史上竞争最激烈的月份。六家主要实验室发布的模型在关键基准测试上与专有替代方案相当,而且它们都不叫 OpenAI。Alibaba、Google、Meta、Zhipu AI、DeepSeek 和 Mistral 各自发布了在或接近前沿水平的 open-weight 模型。问题已不再是开源模型是否足够好,而是哪一个适合你的特定用例。

r/LocalLLaMA 社区的“Best Local LLMs, April 2026”超级线程吸引了 143 篇帖子和 440 次互动,形成了共识排名,AINews at Latent.Space 报道了。结果在独立评估中保持一致:Gemma 4 在一般本地可用性上领先,GLM-5 在开源模型排名中名列前茅,Qwen3-Coder-Next 主导本地编码,DeepSeek V4 树立了推理基准。

两年前,问题还是开源能否与 GPT-4 竞争。2026 年 4 月,六家实验室同时给出了答案,模型可以下载并自行运行。open-weight 平等时代已经到来。

六实验室格局

正如 LushBinary 总结的,open-weight 领域如今有了真正的深度:六家实验室,各有独特优势,每家都发布了在或接近前沿水平的模型。这不是一个模型的起起落落,而是一种持续的竞争动态。

Alibaba(Qwen 3.6)。 跨用例最广泛推荐的系列。从 0.8B 到 9B 参数的四款小型模型,均原生多模态,支持 262000-token 上下文窗口,采用 Apache 2.0 许可。9B 变体性能超过上一代 30B 模型,实现了代际效率飞跃。Qwen3-Coder-Next 单独主导本地编码基准。关键数字:Qwen 3.5-9B 在 GPQA Diamond 上得分 81.7,以十三分之一的尺寸击败 OpenAI 的 GPT-OSS-120B。对于需要一个从微型到中型、质量一致的生态系统的开发者,Qwen 是默认选择。

Google(Gemma 4)。 引领本地可用性。不是任何单一基准上的最高分模型,但跨最广泛任务范围最一致可用。Gemma 4 代表 Google 在部署质量而非基准霸权上的竞争策略。对于希望有一个无需配置即可可靠工作的模型的用户,Gemma 4 是推荐选择。在 Llama 4 丑闻后,这一策略显得更明智:如果基准不可信,可用性就成为差异化因素。

Zhipu AI(GLM-5.1)。 接近广泛开源模型排名的顶端,日益成为“最佳整体”讨论的一部分。在推理、编码和一般知识上表现强劲,同时保持有竞争力的推理速度。Zhipu 从清华大学学术实验室崛起为全球 open-weight 竞争者,是 AI 领域报道最不足的故事之一。GLM 系列已悄然成为最有能力的 open-weight 选项之一。

Meta(Llama 4)。 最复杂的条目。Llama 4 是一个有能力的模型,但信誉永久受损。Yann LeCun 确认基准被篡改,使用不同模型变体进行不同测试以夸大分数,意味着每个声明都必须独立验证。社区现在会在发布后数小时内验证每个 Llama 基准。模型本身有能力。用来推销它的数字却不是。

DeepSeek(V4)。 推理领导者。DeepSeek 的前沿模型及其蒸馏小型变体将思维链推理带入 open-weight 模型。蒸馏版本将前沿级推理压缩到可在消费级 GPU 上运行的包中。DeepSeek 在华为 Ascend 芯片而非 Nvidia GPU 上训练 V4,证明非 NVIDIA 硬件可产生前沿结果,这一故事对 AI 芯片供应链具有重大地缘政治影响。

Mistral(Small 4)。 欧洲效率专家。Mistral 的模型始终以小搏大,在较小参数量下提供有竞争力的性能。对于每个 VRAM 吉字节都重要的部署场景,Mistral 往往是最优选择。Apache 2.0 许可使其在企业部署上优于 Gemma 和 Llama。

这一格局为何重要

open-weight 生态系统不再追赶专有领导者。它正设定自己的步伐。

两年前,开源 AI 的叙事是关于追赶。每个模型发布都与 GPT-4 比较。每次比较都被框定为开源与闭源的对立。正如 ComputingForGeeks 总结的,问题已经反转:专有模型现在必须证明其成本和限制相对于能提供可比质量且无需 API 账单或数据暴露的 open-weight 替代方案是合理的。

竞争动态在专有市场不具备的方面更健康。六家实验室在 open weights 上竞争,制造价格压力,加速改进,并给开发者真正的选择。专有市场有三个 serious 竞争者,OpenAI、Anthropic、Google,它们正趋同于类似的企业服务策略,而非在模型质量上差异化。open-weight 竞争迫使专有实验室在部署和集成上竞争,而非仅靠 API 访问。

地理多样性意义重大。Alibaba 和 Zhipu 代表发布全球有竞争力 open-weight 模型的中国 AI 实验室。DeepSeek 在华为 Ascend 芯片上训练 V4。Mistral 代表欧洲 AI 独立。Google 和 Meta 代表美国科技建制。open-weight 生态系统在专有市场(集中在旧金山)所不具备的方式上真正全球化。AI 能力正通过 open weights 全球化,这对监管、贸易政策和技术地缘政治的影响才刚刚开始被理解。

许可已成为战略差异化因素。Qwen 和 Mistral 使用的 Apache 2.0 允许全面商业使用,是企业部署的首选。Gemma 和 Llama 使用的自定义许可对竞争产品施加限制。一些 DeepSeek 蒸馏变体使用的 MIT 许可最大程度宽松。对于在 open-weight 模型之上构建产品的企业,许可与基准分数同样重要。Apache 2.0 模型在企业采用中具有结构性优势,这种优势将随时间累积。

社区已成为评估权威。r/LocalLLaMA 的超级线程排名比供应商基准更受信任。社区从多个维度评估模型,而非仅原始分数:部署实用性、真实世界任务性能、许可兼容性和生态系统支持。这种多维框架比任何单一排行榜更诚实。Llama 4 丑闻证明了社区验证为何重要。超级线程不只是排名。它是一个机构。

基准问题笼罩一切

Llama 4 丑闻的阴影笼罩本文中的每一个数字。Meta 的操纵,经其首席科学家确认,表明供应商发布的基准未经独立验证不可信。社区已通过构建自己的评估基础设施回应。这里讨论的每个排名都基于社区运行的测试,而非供应商声明。

但更深层问题依然存在。基准是靶子,靶子会被瞄准。这里讨论的每个模型都已针对其评估的基准优化。优化是真实的,能力是真实的,但泛化是不确定的。在 HumanEval 上得分 90% 的模型仍可能在特定代码库上失败。领先推理基准的模型仍可能在特定领域产生幻觉。

社区已开发出更复杂的评估框架作为回应。除原始分数外,他们评估部署实用性:需要多少 VRAM,每秒生成多少 token,是否与 Ollama 配合。他们评估真实世界任务性能:不只是基准数字,而是实际编码任务、实际写作任务、实际推理问题。他们评估许可兼容性和生态系统支持。这种多维方法比任何单一数字更诚实。

实用建议未变:不要相信基准。在自己的任务上运行自己的评估。2026 年的不同之处在于,你现在可以在自己的硬件上、在自己控制的模型上运行这些评估,而无需将数据发送给任何人。独立验证的基础设施已存在。社区已构建它。唯一的问题是你是否使用它。

接下来

六实验室格局不会停留在六家。整合很可能通过收购或竞争淘汰发生。训练前沿模型耗资数亿美元。并非所有六家实验室都能无限期维持。结合技术能力和基准信誉的实验室将存活。Llama 4 的丑闻显示失去信誉会发生什么。

代理差距是下一个前沿。当前 open-weight 模型在生成和推理上强劲。在定义代理 AI 的工具使用、多步规划和自主行动上较弱。首先弥合这一差距、发布能可靠使用工具并执行多步任务的 open-weight 模型的实验室,将定义开源 AI 竞赛的下一阶段。几家实验室正在研究此问题。尚无一家发布。

地理影响将加剧。中国实验室在非 NVIDIA 硬件上发布全球有竞争力的模型改变了 AI 基础设施方程。欧洲实验室提供主权 AI 替代方案对监管合规很重要。open-weight 生态系统不只是技术故事。它是地缘政治故事。

企业从云 API 向自托管 open-weight 模型的迁移正在加速。成本、隐私、战略控制和基准信任危机都在推动同一方向。问题不是这一转变是否发生,而是多快,以及哪家 open-weight 实验室将抓住目前专有 API 拥有的企业市场。

FAQ:关于 Open-Weight LLMs 的常见问题

哪款 open-weight 模型整体最佳?

没有单一答案。GLM-5.1 领先广泛排名。Gemma 4 最一致可用。DeepSeek V4 领先推理。Qwen 3.6 拥有最广泛的尺寸范围。你的用例决定哪个“最佳”重要。

这些模型真的免费吗?

Open-weight 意味着模型权重可公开下载和使用。商业部署取决于许可。Apache 2.0(Qwen、Mistral)允许全面商业使用。Gemma 和 Llama 有带限制的自定义许可。商业部署前请检查。

如何运行这些模型?

Ollama 是最简单的入口点,一条命令即可下载并运行。LM Studio 提供 GUI。llama.cpp 提供最大性能。均支持此处讨论的主要 open-weight 模型。

open-weight 模型会超越 GPT-5.5 吗?

在特定基准上,它们已经超越。在前沿级推理和代理能力上,专有领导者仍保持优势。差距正在缩小,open-weight 模型的改进速度超过专有步伐。

商业部署应选择哪种许可?

Apache 2.0(Qwen、Mistral)用于最大灵活性。自定义许可(Gemma、Llama)如果限制不影响你的用例。MIT(DeepSeek 蒸馏变体)用于最大宽松。部署前阅读具体许可条款。

两年前,AI 行业问开源能否与 GPT-4 竞争。2026 年 4 月,六家实验室同时回答了这个问题,模型可以下载并自行运行。AI 能力不再集中在旧金山的三座建筑中。它可供下载,有六种不同风格,针对六种不同用例优化。open-weight 平等时代已经到来。仅靠 API 依赖的时代结束了。现在的问题不是谁构建最好的模型。而是谁控制你选择运行的那个。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page