top of page

一个90亿参数的模型刚刚击败了OpenAI的1200亿参数模型。在笔记本电脑上。

2026 年 3 月,Alibaba 发布了一款 90 亿参数的语言模型,在研究生级推理基准 GPQA Diamond 上得分 81.7,击败了参数量为其 13 倍的 OpenAI GPT-OSS-120B。该模型 Qwen 3.5-9B 可在配备 16GB RAM 的笔记本电脑上运行。它采用开放权重、Apache 2.0 许可,可通过 Ollama 用单条命令获取。

这不是特例,而是新常态。

Gemma 4、GLM-5.1、DeepSeek V4 和 Mistral Small 4 现已在关键基准上达到或超过 GPT-3.5 Turbo 的质量,且可在消费级 GPU 上运行。两年前,本地运行 AI 意味着以隐私换取更差的结果。2026 年,性能损失已消失。默认假设——使用云端 API——已不再成立。

发生了什么变化

突破并非来自单一模型,而是三股趋势在 2026 年初汇聚,使小模型能力大幅提升。

首先,Mixture-of-Experts 架构改变了效率方程。Qwen 3 30B-A3B 每 token 仅激活 30 亿参数中的 30 亿,却能提供接近 140 亿参数密集模型的质量。它在 RTX 4090 上每秒生成 196 个 token,比许多更小的密集模型更快。效率提升并非增量式,而是消费级硬件能力的阶跃变化。一块 Nvidia RTX 4090 售价约 1600 美元。按 GPT-4 级别模型每百万 token 15 美元的云 API 定价,对于任何严肃部署,硬件成本可在数月内收回。

其次,来自前沿模型的蒸馏将能力向下压缩。实验室现在训练 1000 亿参数模型,然后将推理能力蒸馏到小于 40 亿参数的变体中。学生模型以极低的计算成本继承了教师模型的大部分推理能力。r/LocalLLaMA 上广泛讨论的 MiniMax M2.7 GGUF 量化变体是最突出的例子:一个 1000 亿+ 参数模型被蒸馏到可在笔记本上运行的尺寸。该技术并不新鲜,但 2026 年的结果代表了即使在十二个月前都不可能实现的质的飞跃。

第三,开放权重生态系统从零散实验成熟为竞争格局。六家主要实验室现已发布生产级开放权重模型:Alibaba 的 Qwen 3.6、Google 的 Gemma 4、Meta 的 Llama 4、Zhipu AI 的 GLM-5.1、DeepSeek 的 V4 以及 Mistral 的 Small 4。竞争是真实的。每家实验室在不同维度上差异化:Qwen 注重跨尺寸的广泛能力,Gemma 注重可用性,GLM 注重基准性能,DeepSeek 注重推理,Mistral 注重小规模效率。正如 ComputingForGeeks 总结的那样,Qwen 3.5、DeepSeek V3.2、GLM-5 和 Llama 4 等模型“现已在关键基准上匹配或超越专有替代方案,且可在自己的硬件上运行。”

工具已跟上模型。Ollama 将入门门槛从“配置 Python 环境并管理依赖”降低到“输入一条命令”。LM Studio 添加了 GUI。llama.cpp 最大化利用了消费级硬件性能。四位量化将 VRAM 需求降低约 75%,质量损失极小。2026 年的本地 LLM 体验已不再是爱好者项目,而是一款产品。

重要的模型

r/LocalLLaMA 社区 2026 年 4 月的“最佳本地 LLM”超长帖吸引了 143 篇帖子和 440 次互动,形成了共识排名,并被 Latent.Space 报道。排名并非基于厂商声明,而是基于真实硬件上的社区运行评估。

通用可用性:Gemma 4。Google 的开放权重产品在本地部署质量上领先。它并非在任何单一基准上得分最高,但跨最广泛任务范围始终最可用。对于想要一款能合理完成所有任务的模型的人,Gemma 4 是默认推荐。Google 的策略是在部署质量而非基准霸权上竞争,这一做法在 Llama 4 丑闻后显得更明智。

编码:Qwen3-Coder-Next。Alibaba 的编码优化模型主导本地编码基准。其前代 Qwen2.5-Coder 32B 在 700 美元 GPU 上 HumanEval 得分已达 92.7%。下一代进一步推进。对于想要本地代码生成媲美 GitHub Copilot 的开发者,这是类别领导者。

整体能力:GLM-5 和 GLM-4.7。Zhipu AI 的模型接近开放模型广泛排名的顶端。它们在推理、编码和通用知识上表现强劲,同时保持有竞争力的推理速度。Zhipu 从清华大学学术实验室崛起为全球开放权重竞争者,是 AI 领域报道最不足的故事之一。

推理:DeepSeek V4 及其蒸馏变体。DeepSeek 的前沿模型及其更小的蒸馏版本将思维链推理带到本地硬件。蒸馏变体尤为重要:它们将 DeepSeek 的推理能力压缩到可在消费级 GPU 上运行的包大小,同时保留大部分推理质量。DeepSeek 使用华为 Ascend 芯片而非 Nvidia GPU 实现此目标,这是关于 AI 硬件地缘政治的另一个同样重要的故事。

效率:Qwen 3.5 小系列。Alibaba 的 0.8B 至 9B 范围模型均原生多模态,具备 262000 token 上下文窗口,采用 Apache 2.0 许可,代表效率前沿。9B 模型超越了上一代 30B 模型,意味着开发者现在可从可在中端游戏 GPU 上运行的模型获得 2025 年中期旗舰性能。具体基准数字值得注意:MMLU-Pro 上 82.5 分,超过 GPT-OSS-120B 的 80.8 分,多语言 MMLU 上 81.2 分,略胜于两个 GPT-OSS 变体。

Llama 4 附注。Llama 4 是一个有能力的模型,但信誉永久受损。基准丑闻意味着每个声明都必须独立验证。社区将其纳入排名时附带警告:信任,但请自行验证。

为什么这很重要

本地模型的性能上限现已足够高,默认假设——使用云端 API——已不再成立。

经济学已逆转。云 API 推理成本在每百万 token 0.15 至 15 美元之间,且无限期持续。本地推理在一次性硬件购买后仅需电费。本地比云端更便宜的交叉点,比大多数企业架构师假设的更快到来。一块 RTX 4090 以每秒 196 token 运行 Qwen 3 30B-A3B,每天可处理数千次查询,成本仅为电费。

隐私——本地 LLM 社区的传统论点——已成为免费附赠而非主要卖点。当本地模型匹配云端质量时,你不再以性能换取数据主权。你同时获得两者。对于处理敏感数据的受监管行业、无法承担随使用量扩展的 API 账单的初创公司、希望控制模型允许说什么的开发者,本地选项在结构上更优越。

战略维度同样重要。云 API 依赖意味着你的 AI 能力受制于他人的定价、他人的速率限制和他人的内容政策。本地模型消除了这三项约束。2023 年采用 OpenAI API 的企业现在正在评估是否可迁移到自托管替代方案。Llama 4 基准丑闻对云提供商的论点没有帮助。当最突出的开源公司被发现操纵基准,而社区仍偏好开放权重模型时,本地部署的结构性论点得到加强。

举证责任已反转。云 API 提供商现在必须证明为什么你应该按 token 付费而非自己运行模型。对于越来越多的用例,这种证明越来越难成立。

本地 AI 的局限

诚实地说明局限至关重要。本地模型并非云 API 的通用替代品。

前沿推理仍存在差距。Qwen 3.5 在 AIME 2026 数学上得分 91.3,强劲但落后于 GPT-5.2 的 96.7 和 Claude Opus 4.6 的 93.3。在最难的推理任务上,专有领导者仍保持优势。差距正在缩小,开放权重模型的改进速度超过专有速度,但尚未弥合。

代理能力是下一个前沿。本地模型目前擅长生成和推理。在工具使用、多步规划和自主行动上较弱。发布具备可靠代理能力的开放权重模型的实验室将定义本地 AI 竞赛的下一阶段。多家实验室正在研究此问题。尚无一家发布。

硬件需求随野心扩展。70 亿至 90 亿参数模型可在配备 8GB VRAM 的笔记本上运行。300 亿参数 MoE 模型需要 16-24GB,大致相当于 RTX 4090 或 Mac Studio。前沿级本地部署(全精度运行 DeepSeek V4)需要服务器级硬件。“笔记本”框架对 Qwen 3.5-9B 故事准确,但并非适用于每款模型。

以及现在伴随每个 AI 性能声明的基准警告:厂商基准不可信。Llama 4 丑闻已证明这一点。在 HumanEval 上得分 90% 的模型仍可能在你的特定代码库上失败。在推理基准上领先的模型仍可能在你的领域产生幻觉。唯一重要的评估是你在自己的硬件上用自己的数据运行的评估。

接下来

轨迹清晰。模型正变得更小、更强大。硬件正变得更快、更便宜。工具正变得更易获取。本地与云端之间的差距将继续缩小。

代理差距是下一个前沿。弥合这一差距——发布能可靠使用工具、执行多步计划并自主行动的开放权重模型——的实验室将定义下一阶段。多家实验室正在研究此问题。竞赛开放。

企业从云 API 向自托管模型的迁移正在加速。成本、隐私、战略控制和基准信任危机都在推动同一方向。在单一专有 API 上构建 AI 栈的公司现在正在运行向开放权重替代方案的概念验证迁移。问题不是这种转变是否发生,而是发生得多快。

六家开放权重实验室之间的整合很可能。六家实验室发布竞争模型是健康市场。六家实验室无限期维持前沿模型训练成本则不然。将技术能力与基准信誉结合的实验室将存活。Llama 4 丑闻展示了信誉丧失时的后果。

FAQ:关于本地 LLM 的常见问题

我需要强大的 GPU 吗?

取决于模型大小和量化。70 亿至 90 亿参数模型可在配备 8GB VRAM 的笔记本上运行。300 亿 MoE 模型需要 16-24GB,大致相当于 RTX 4090。四位量化将 VRAM 降低约 75%,质量损失极小。

本地模型真的和 ChatGPT 一样好吗?

在特定任务上,是的。Qwen3-Coder-Next 在编码基准上匹配或超过 GPT-3.5 Turbo。Gemma 4 在通用对话质量上与之匹配。在前沿级推理上,GPT-5.5 和 Claude Opus 4.7 等云模型仍领先,但差距正在缩小。

我应该从哪个模型开始?

通用用途用 Gemma 4,编码用 Qwen3-Coder,推理用 DeepSeek 蒸馏变体。均可通过 Ollama 用单条命令获取。

它们可合法用于商业用途吗?

讨论的大多数模型采用宽松许可。Apache 2.0(Qwen、Mistral)允许完全商业使用。Gemma 和 Llama 有带限制的自定义许可。商业部署前请检查具体许可。

本地模型会超越 GPT-5.5 吗?

在特定基准上,它们已经做到。在前沿级推理和代理能力上,专有领导者仍保持优势。差距正在缩小,开放权重模型的改进速度超过专有速度。

本地 LLM 社区花了两年时间告诉任何愿意倾听的人隐私很重要。2026 年,他们可以停止提出这一论点。性能平价为他们做了这件事。一款在笔记本上运行的 90 亿参数模型刚刚击败了 OpenAI 的 1200 亿参数云模型。仅依赖 API 的时代结束了。下载一个。自己运行。数字这次是真的。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page