top of page

Google 和 MIT 的遗产,邂逅追逐 LLM 下一个重大突破的初创公司

自九年前 Google 的八名研究人员提出 transformer 以来,Google 和 MIT 的研究如今正面临最严峻的架构挑战。初创公司正在质疑:几乎所有领先 LLM 背后的机制,是否仍应是行业默认选择。

这场竞争并非为了再造一个聊天机器人,而是围绕 ChatGPT、Claude、Gemini 以及大多数开源模型底层的计算结构展开。Subquadratic、Liquid AI、Cartesia 和 AI21 Labs 正在探索无需在每一层都执行密集注意力、即可处理长序列的系统。

它们提出的方案涵盖稀疏注意力、状态空间模型以及以卷积为主的混合架构。每条路线都承诺降低内存占用、加快处理速度,或提供更长的可用上下文。但目前尚无任何一种方案能在所有重要任务上全面取代 transformer。

这一限定条件定义了这场竞赛。下一种重要的 LLM 架构不会仅凭一张亮眼的实验室图表胜出。它必须在企业既有的软件、芯片和部署系统中运行,同时保留推理与回忆能力。

Transformer 的成功造就了自身的瓶颈

推动现代生成式 AI 的架构,会随着输入量增加而变得更加昂贵。

Google 研究人员在 2017 年的论文 Attention Is All You Need 中提出了 transformer。该论文以注意力机制取代了循环处理;这种机制使模型能够判断输入中的哪些部分值得重点关注。

注意力机制让训练具备高度并行化的能力,也帮助模型连接文档中相距较远位置的信息。这些优势支撑了后续的规模化路径,最终催生了如今的大语言模型。

标准形式的自注意力会将序列中的每个 token 与其他所有 token 进行比较。token 是文本的最小单位之一,例如一个词的片段。因此,序列长度翻倍,注意力操作中的成对比较次数大致可能增加四倍。

工程师将这种行为称为二次扩展。这并不意味着在所有部署条件下,整个模型的成本都会恰好变成四倍。硬件、缓存、批处理和实现方式同样会影响结果。

但这种底层关系依然带来压力。回答简短问题的聊天机器人,比起要阅读多个代码库、数月消息记录和漫长操作历史的智能体,更容易承受密集注意力。

上下文窗口虽然不断扩大,但模型标称的上限并不保证在接近该上限时仍能以可负担的成本或足够准确地使用。团队必须考虑处理提示词所需的时间、内存消耗、推理成本,以及模型是否能找到正确证据。

检索增强生成(RAG)会在要求模型回答前先筛选相关段落,从而减轻负担。它依然非常有用,尤其是当组织维护着大型 AI knowledge base 时。

检索也引入了一个独立的故障点。如果搜索层遗漏了关键段落,模型就永远看不到它。能够直接检查更多源材料的系统,或许能降低代码分析、法律审查、研究和持续运行智能体中的这一风险。

这正是架构研究重新获得商业紧迫感的原因。更多算力能够延展 transformer,但不断变长的提示词暴露出一种结构性成本,单靠更好的芯片无法消除。

Google 与 MIT 的关联在这里很重要:Google 提供了奠基性论文,而与 MIT 有关联的研究人员后来帮助创建了探索替代方案的公司。这场竞争与其说是两家机构间的争端,不如说是从学术洞见迈向相互竞争的生产系统的转变。

初创公司看到了当前模型宣传能力与客户实际可部署能力之间的机会。如果它们能在不损失质量的前提下降低长上下文的成本,就能同时向模型实验室和基础设施提供商施压。

Google 和 MIT 的研究正在催生不止一种替代方案

尚未出现单一的后 transformer 设计,因此初创公司正将问题拆分为不同的技术押注。

Subquadratic 采取了最直接的路线。这家总部位于迈阿密的初创公司表示,其 SubQ 模型使用 Subquadratic Sparse Attention,即 SSA,以避免检查每一种可能的 token 关系。

稀疏注意力限制模型需要评估的 token 对集合。难点在于,必须在执行密集注意力所需的高成本计算之前,先选出哪些连接真正重要。

Subquadratic 表示,其机制会随上下文长度线性扩展,并支持 1200 万 token 的研究上下文。其公布的示例包括完整的软件代码库和长期运行的智能体历史记录。

这些是公司的说法,而非业界已有定论的结果。该公司的技术说明称,SSA 会识别重要关系,同时跳过绝大多数可能的比较。

Liquid AI 则押注于另一条路线。这家公司由具有 MIT 背景的研究人员创立,为设备及其他资源受限环境开发 Liquid Foundation Models。

其 LFM2 架构并未完全消除注意力,而是将门控短卷积与数量较少的分组查询注意力块结合起来。

卷积通过可复用的滤波器处理局部模式。分组查询注意力则让多个查询头共享键和值表示,以降低内存需求。

Liquid 表示,LFM2 是通过硬件感知架构搜索选出的。这意味着团队依据实际内存和速度特征评估设计,而非只优化抽象的运算量。

该公司的 LFM2 设计中,卷积块数量多于注意力块。这种安排旨在实现 CPU 和嵌入式处理器上的快速执行。

Cartesia 正在探索状态空间模型(SSM)。这类模型通过不断变化的内部状态来概括序列。SSM 不会保留每一对 token 之间的显式关系,而是在新输入到来时更新紧凑的表示。

Cartesia 的创始人曾参与开发 Mamba,这是一种选择性状态空间架构。选择性使模型能够根据当前输入决定保留或遗忘哪些信息。

最初的 Mamba 研究报告称,在其实验中,该模型会随序列长度线性扩展,吞吐量也强于可比的 transformer。研究还展示了它在语言、音频和基因组学领域的应用。

Cartesia 将其大部分商业工作聚焦于语音。语音是高效序列处理的天然试验场,因为交互式音频系统必须在追踪不断演进的对话时快速响应。

AI21 Labs 提供了第四条路线。其 Jamba 架构交错使用 Mamba 层、transformer 注意力层和混合专家组件。

混合专家模型会针对每个 token 只激活其整体网络的一部分。这样可在不为每次计算使用所有参数的情况下提升总容量。

Jamba 的设计体现了一个务实结论:高效序列处理和密集注意力各自解决不同的问题。AI21 保留部分 transformer 层以实现全局回忆,同时使用 Mamba 层降低内存压力。

这些方法让 Google 和 MIT 的故事演变为一场分支式的架构竞赛。Subquadratic 试图保留注意力,同时让其变得稀疏;Liquid AI 将注意力与卷积结合;Cartesia 强调状态空间处理,而 AI21 则混合使用状态空间层和 transformer 层。

它们的共同目标是效率。分歧在于:LLM 能够安全地舍弃、压缩或局部处理哪些内容,而不会破坏产生有用答案所需的关系。

稀疏注意力提出了最大胆的主张

Subquadratic 正面挑战密集注意力,但其证据仍需跟上其承诺的规模。

Subquadratic 于 2026 年 5 月公开亮相时提出了一项不同寻常的宏大主张:SubQ 能够处理长达 1200 万 token 的上下文,同时所需注意力计算远少于 transformer 模型。

这种容量足以在一个提示词中容纳多个完整代码库,或大量合同文件。它也可能让智能体保留更长的操作记录,而无需反复总结过去。

该公司认为,密集注意力浪费了计算资源,因为绝大多数可能的 token 关系对结果贡献甚微。SSA 试图找出真正重要的那一小部分关系。

这比简单地随机删除连接困难得多。一个相关线索可能出现在数百万 token 之外,而其重要性可能要等到模型读完另一段内容后才会显现。

因此,稀疏架构需要有效的路由机制。如果它选错了连接,计算节省就会以牺牲回忆或推理能力为代价。

Subquadratic 表示,其架构执行依赖内容的选择。模型会从输入中选择注意力模式,而非只依赖固定的局部窗口。

由于公开访问和技术细节有限,其最初发布引发了质疑。该公司后来公布了更多基准测试信息,并援引了由 Appen 进行的评估。

根据最初的 MIT 分析,独立研究员 Will Depue 指出,研究人员已经尝试过多种方法,以克服密集注意力的成本问题。

这段历史很重要。稀疏注意力、线性注意力、循环网络、长卷积和压缩记忆都曾展现优势。许多方法在任务需要从遥远位置精确检索信息时也会遇到困难。

另一个担忧与 SubQ 的来历有关。MIT Technology Review 报道称,该公司复用了 Alibaba 的 Qwen 模型某个版本的权重,以帮助初始化 SubQ。

权重是决定神经网络行为的学习所得数值。复用它们可以加速开发,但也会使关于新架构独立学习能力的主张变得复杂。

经过转换或引导启动的模型可能继承 transformer 训练带来的能力。这并不意味着新机制无效,但仍留下一个问题:该架构能否从一开始就高效训练。

这种区别在商业上很重要。改造现有模型的方法仍可能成为有价值的基础设施;而能够从零开始训练出具备竞争力的基础模型的方法,则会挑战整个市场的经济逻辑。

开发者需要的不仅是上下文上限演示。他们还需要稳定的 API、可预测的延迟、工具使用准确性、结构化输出、安全控制,以及与常见推理框架的集成。

长上下文本身也带来评估问题。模型在技术上可以接受数百万 token,却仍可能遗漏相关事实,或将它们错误组合。

简单的“针”测试会将一条显著事实放入长输入中,再要求模型将其检索出来。它们衡量基本回忆能力,但无法涵盖需要跨多个文件分散证据的任务。

仓库维护提供了更严苛的压力测试。模型必须识别接口、追踪依赖关系、理解测试,并在不破坏相距甚远的组件的前提下完成修改。

法律与金融分析也提出了类似要求。正确结论可能取决于分散在众多文档中的定义、例外、修订条款和日期。

Subquadratic 必须证明,其稀疏路由能够在对抗性和常规工作负载下保持这些关系。跨多个领域的独立测试,比单一基准测试提供方的结果更具说服力。

它面临的挑战很明确。这家公司提出了一种直接挑战二次复杂度注意力机制的方法,但要实现广泛采用,还需要可重复验证的证据和易于获取的模型。

混合模型正在押注不会发生彻底断裂

Liquid AI 和 AI21 将注意力视为一种需要节制使用的昂贵成分,而非必须移除的缺陷组件。

混合架构体现了一种工程判断:transformer 在灵活、基于内容的检索方面依然格外出色。其弱点在于,将这种能力应用于所有位置的成本很高。

Liquid AI 的 LFM2 将大部分序列处理交给短卷积。此类模块能够高效检查局部模式,并避免与密集注意力相关、不断扩大的缓存。

该模型仍保留了注意力模块,用于受益于更广泛比较的操作。这种划分类似于一个系统:大多数时候采用低成本的局部处理,只在必要时有选择地调用全局分析。

Liquid 的硬件感知方法也凸显了理论比较的一个弱点:渐近扩展性更优的操作,并不必然能在手机、笔记本电脑、GPU 或加速器上运行得更快。

现代 AI 硬件针对 transformer 工作负载进行了高度优化。密集矩阵乘法受益于成熟的内核、编译器和推理服务系统。

一种新架构即便需要更少的理论运算,如果软件无法高效调度,也可能运行缓慢。内存搬运、缓存行为和批处理大小的重要性,可能不亚于描述该层的公式。

Liquid 通过架构搜索直接评估这些约束。该公司称,其 2026 年推出的 LFM2-24B-A2B 模型总计拥有 240 亿参数,其中每个 token 约有 20 亿参数处于活跃状态。

该模型将稀疏混合专家系统与 LFM2 以卷积为主的骨干网络相结合。Liquid 表示,它可容纳于 32GB 内存之内,因此能够在部分高端消费级系统上本地部署。

这些均为厂商公布的特性。其质量与更大型云端模型相比如何,仍需独立的应用测试来判定。

这一路线在商业上仍然自洽。许多组织并不需要针对每项任务都使用当前可获得的最大模型。它们需要的是质量可接受,同时延迟、隐私和基础设施使用量可控的方案。

设备端模型可以支持私密文档分类、命令解析、摘要生成或语音界面,而无需将每一项输入发送至远程服务。在网络访问受限时,它也可以继续工作。

AI21 的 Jamba 从状态空间方向实现了类似的折中。该架构交替采用 Mamba 和 transformer 组件,而非完全押注于其中任何一种。

AI21 表示,纯状态空间模型在检索方面可能存在困难。Jamba 保留了间歇性的注意力层,以恢复对序列中详细信息的访问能力。

该公司的 Jamba 架构还使用混合专家层,将模型总容量与活跃计算量分离开来。

这种方法放弃了“注意力并无必要”这一简洁叙事。它获得了一条更保守的生产落地路径,因为开发者可以在最关键之处保留已知的 transformer 行为。

因此,混合系统是传统模型在短期内面临的最强压力。它们不需要证明 transformer 从一开始就是错误的。

它们只需证明,并非每一层都需要同一种昂贵操作。如果这一主张成立,模型构建者便可在保留既有训练和部署实践的同时,逐步减少注意力的使用。

这一路径类似于早期的计算技术转变。新设计通常先作为专用组件进入市场,之后才取代通用默认方案。

图形处理器最初加速的是狭窄的工作负载,后来才成为 AI 的核心。固态存储也曾与硬盘共存,之后才接管许多对性能敏感的角色。

注意力替代方案也可能遵循同样的模式。卷积或状态空间层或许会先负责局部处理、流式输入和长期历史信息;注意力则可以继续承担棘手的全局关系处理。

最终形成的架构可能不会拥有一个令人印象深刻的统一标签。它可能是根据目标硬件和工作负载塑造的可配置组合。

这一可能性使得 LLM 的下一个重大变化,不再像又一次“Attention Is All You Need”时刻那样戏剧化。它或许会通过持续减少注意力的使用范围而到来。

真正的竞争是单位计算量下的质量

替代架构只有在其节省能够经受住准确性、延迟和部署复杂度的现实测试时,才算获胜。

模型比较往往孤立地考察单一维度。一篇论文可能报告更低的计算复杂度、更长的上下文窗口,或更高的 token 吞吐量。

企业买家面对的是一道综合方程。他们关心的是,系统在延迟、内存和可靠性预算内能够完成多少有用工作。

一个会遗漏合同例外条款的快速模型,并不高效。一个检索能力卓越但响应时间难以预测的模型,也可能不适合交互式软件。

因此,这场竞赛中的主要对手并非某一家初创公司或某一家既有巨头,而是 transformer 已建立起来的质量与基础设施之间的平衡。

Google、OpenAI、Anthropic、Meta 及其他实验室可以继续改进 transformer 系统。它们可以使用优化后的注意力内核、更好的缓存、量化、蒸馏和更快的加速器。

它们也可以采用成功的替代组件。一家验证了新机制的初创公司,或许会影响既有厂商,但未必会取代其模型家族。

兼容性又带来了一项防御优势。transformer 推理可在成熟的 GPU 内核、分布式训练系统、优化库和部署平台生态中运行。

新颖的循环或稀疏操作可能需要定制内核和缓存逻辑。开发者可能还需要新的监控工具,因为其性能故障与熟悉的 transformer 行为不同。

训练稳定性仍是另一项考验。研究人员已了解 transformer 在众多模型规模和数据集上的表现。替代架构在最大规模下的证据则更少。

一个模型可能在数十亿参数规模下看起来很高效,却在进一步扩展时遭遇优化问题。如果为了弥补较弱的检索能力而需要更多层或更多训练数据,它也可能失去优势。

基准测试的选择可能掩盖这些差异。通用知识测试对多文件推理的参考价值可能有限。长上下文检索测试也未必能预测对话质量或工具使用能力。

最有力的评估将把架构与实际工作连接起来。相关任务包括修改大型代码仓库、核对相互冲突的报告、在长时间对话中追踪事实,以及分析随时间变化的记录。

测试应同时衡量答案质量、首个 token 延迟、总完成时间、峰值内存、能耗和硬件利用率。

测试还应披露比较是否采用等效的参数量、训练数据、上下文长度、精度设置和推理服务条件。

缺少这些控制条件时,所谓架构优势可能只是不同工程选择的反映。即使数字本身准确,测试条件的差异也可能造成误导性印象。

Google MIT 这一关键词反映了真实的技术传承,却并不代表清晰的机构对立。Google 研究人员提出了 transformer,而 MIT 研究人员则为多条替代技术路线作出了贡献。

当前真正的较量发生在架构成熟度与架构效率之间。transformer 提供了一条通往高能力的已知路径;挑战者则承诺以更少的计算浪费达到相近能力。

任何一方都不具备永久优势。既有厂商可以复制经过验证的创意,而初创公司则可以在无需支持多年遗留基础设施的情况下优化自身系统。

客户不应将宣传中的上下文长度视为决定性指标。更好的问题是:在固定预算内,一个模型能准确利用多少相关信息。

对开发者而言,这意味着应使用具有代表性的数据测试模型,而不能只依赖公开排行榜。法律团队、软件公司和语音平台会暴露出不同的架构弱点。

对知识工作者而言,更高效的长上下文能力可以减少反复上传和摘要生成。它也可能帮助助手在更大规模的工作内容中维持连续性。

这些好处取决于隐私和访问控制。能够读取数百万 token 的模型,会放大提供错误文档或过度保留信息所带来的后果。

架构无法解决这些治理问题。它只能改变系统能够处理的信息量,以及完成此事所需的资源。

后 Transformer 竞赛发展过程中值得关注的事项

三个信号将揭示这些初创公司究竟找到了继任者,还是仅仅为 transformer 技术栈提供了有用补充。

第一个信号是对 SubQ 的独立访问。外部研究人员需要获得足够的可用性,以复现长上下文结果、测试复杂的检索模式,并审查系统在变化工作负载下的表现。

如果用户能够验证其质量和线性扩展主张,广泛发布将强化 Subquadratic 的论点。持续的有限访问则会保留围绕该架构的不确定性。

最有价值的测试不应止于在长提示词中插入一项事实。它们应要求模型跨文件关联证据、拒绝误导性上下文,并在输入扩展时维持准确性。

研究人员还应在已披露的硬件上比较处理时间和内存使用量。否则,有关计算节省的主张仍难以转化为部署决策。

第二个信号是混合层的更广泛采用。Liquid AI 和 AI21 并不要求行业放弃注意力,因此它们的设计可以渐进式传播。

关注模型开发者是否开始披露更低比例的注意力层,或在新的生产模型中采用卷积和状态空间组件。

这种转变将支持本文的核心判断:第一个后 transformer 时代很可能会先节制注意力的使用,再考虑彻底消除它。

硬件和软件支持也将揭示同样的趋势。面向混合模型的原生内核、推理引擎和监控工具,会降低架构选择的风险。

第三个信号是持续型智能体的表现。智能体构成了一个要求严苛的序列问题,因为它们会随着时间积累指令、工具结果、代码修改和失败尝试。

当前系统往往会压缩或丢弃这些历史信息。摘要能够节省上下文,但也可能移除智能体之后所需的细节。

如果其记忆主张成立,稀疏或状态空间模型应在此展现出明确优势。智能体应能完成更长的项目,而不会丢失约束、重复工作,或让上下文成本失控增长。

这也是名义上下文与可用上下文差异开始显现的地方。模型并不需要同等地记住此前的每一个 token;它必须保留正确的承诺与证据。

Transformer 之所以仍是标准方案,是因为它结合了灵活的注意力机制、可扩展的训练能力和成熟的基础设施。经过九年的持续打磨,这种组合依然难以超越。

不过,行业的工作负载正在变化。更长的代码仓库、多模态记录、持续语音和持久化智能体,都在加剧密集注意力的弱点。

追逐 LLM 下一个重大突破的初创公司,尚未形成共同答案。这种分歧很有价值,因为它揭示了真正的设计空间。

Subquadratic 正在探索稀疏路由能否保留全局推理能力。Cartesia 测试状态是否可以取代显式的 token 关系。Liquid AI 和 AI21 则在追问:一个有能力的模型究竟需要多少注意力机制。

如果这些系统中的某一个成功,Google 和 MIT 的技术遗产也不会消失。Transformer 确立了注意力作为现代 AI 核心机制的地位,而它的后继者仍将保留其中许多思想。

更可能发生的变化是架构多元化。模型将根据设备、工作负载和所需记忆能力,结合不同的序列机制。

开发者应关注每单位计算资源所获得的、经验证的质量,而非关于 Transformer 已死的宣言。企业采购方则应测试完整工作流,包括检索、工具使用、延迟和访问控制。

哪一种信号会最先改变你的模型策略:经独立验证的稀疏注意力、更广泛的混合模型支持,还是一个能够利用数月历史记录且不丢失细节的智能体?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page