Kog 押注更深层的 GPU 优化可加速 AI 推理
- Aisha Washington

- 6天前
- 讀畢需時 15 分鐘
Kog 登上 Google News,直接挑战专用芯片的叙事:智能体 AI 未必需要放弃标准数据中心 GPU。这家巴黎初创公司表示,更紧密地协同模型、推理软件与硬件,能够提供复杂 AI 工作流所需的响应速度。
这一主张直指 AI 基础设施领域日益普遍的一种假设。智能体在规划、调用工具、评估结果和纠正错误时,会发起大量模型调用。这种模式会让缓慢的推理既昂贵又令人沮丧,也进一步强化了为 AI 模型服务而专门设计处理器的合理性。
Kog 则选择了相反的路线。它并不打算替换 GPU,而是希望消除阻碍这些 GPU 发挥潜力的多层软件开销。专用硬件与更深层 GPU 优化之间的这场较量,如今正成为智能体 AI 最具决定性的基础设施问题之一。
为什么 Kog 正进一步深入 GPU 推理
Kog 正超越孤立的运行时改进,将模型、推理引擎和 GPU 视为一个统一的优化问题。
在 8 月 14 日的一篇报道考察了该公司试图从熟悉的硬件中提取更多推理性能的努力后,其立场获得了更广泛关注。这篇 GPU 推理报道将 Kog 的工作置于一个反主流的观点之中:即使智能体应用需要快速、重复的模型响应,GPU 也未必天然不适合这类应用。
这一区别之所以重要,是因为推理并非单一、统一的工作负载。面向消费者的聊天机器人可以在输出长回答前容忍短暂等待;而编码智能体或语音界面,在完成一项可见任务之前,往往必须连续做出多项决策。
每一次延迟都可能沿着这条链路累积。如果智能体必须等待一次模型响应后才能发起下一步操作,那么缩短单次响应的延迟,就能缩短整个工作流。
Kog 的解决方案始于推理引擎,即当用户或应用发出请求时,负责执行已训练模型的软件。大多数生产级引擎会将模型执行拆分成许多被称为 kernel 的 GPU 操作。kernel 是在处理器上执行特定计算的低层程序。
启动并协调大量 kernel 会引入开销。数据可能需要在不同内存位置之间移动,处理器必须同步,主机系统还要反复调度工作。每一项延迟单独看都很小,但在对延迟敏感的生成过程中,累积成本就会变得明显。
Kog 表示,它通过将解码序列置于一个持久 kernel 中降低了这一开销。解码是语言模型逐个生成输出 token 的阶段。持久 kernel 会持续在 GPU 上运行,而不是在每个较小操作后都交还控制权。
在 5 月的技术预览中,Kog 报告称,使用八张 AMD MI300X GPU 处理一项请求时,输出速度超过每秒 3,000 个 token。它还报告称,在八张 Nvidia H200 GPU 上达到每秒 2,100 个 token。根据 Kog 的 推理预览,测试使用的是一个 20 亿参数模型、FP16 精度,且未采用推测解码。
推测解码利用较小模型提出 token,再由较大模型分组验证。它可以提高生成速度,但也为比较引入了另一个变量。通过排除这一技术,Kog 将报告结果主要归因于其模型和运行时设计。
这家初创公司还开发了 Laneformer 2B,一款围绕低延迟解码设计、拥有 23 亿参数的编码模型。这是其战略的核心部分,而非附带项目。Kog 正为其引擎最擅长处理的执行模式优化模型架构。
其设计包括延迟张量并行,旨在让通信与计算及权重移动重叠进行。张量并行会将模型计算拆分到多张 GPU 上。该方法可提供更高的聚合计算能力,但 GPU 之间的通信可能成为瓶颈。
Kog 的方法试图将这种通信隐藏在其他有价值的工作之后。该公司实际上认为,GPU 效率不足在一定程度上是调度问题。更好的执行顺序能够在减少依赖操作之间停顿的同时,让处理器保持活跃。
这些结果仍属于公司自行报告的基准测试。它们并不能证明在更大模型、更长提示词、大量并发用户或生产流量下具有等效性能。不过,这些结果解释了为何这家初创公司选择进一步深入,而非仅在现有模型外围再增加一层服务。
这项工作也带来了本文的核心张力。如果 Kog 能将这些收益扩展到其小型、协同设计的模型之外,专用推理硬件便会失去部分最有力的论据。如果收益高度依赖于狭窄的配置,那么专用硬件的论点仍然成立。
Google News 将 GPU 与定制芯片之争置于焦点
Kog 的故事之所以重要,是因为它对“实时智能体需要新型处理器架构”这一信念提出了压力测试。
专用推理公司首先基于一个合理的观察:GPU 是作为通用并行处理器构建的,而语言模型解码则具有可预测的数学和内存访问模式。专用芯片可以移除这类工作负载不需要的硬件功能。
Groq、Cerebras、SambaNova 和 Etched 都在追求某种版本的这一策略。它们的架构各不相同,但共同承诺是对推理延迟、吞吐量、内存移动或能耗实现更严格的控制。
Groq 因可预测地调度操作的处理器而闻名。Cerebras 构建晶圆级系统,将异常庞大的计算能力置于一块硅片之上。Etched 则专注于专为 transformer 模型构建的芯片。
这些设计从硬件层面切入工作负载。Kog 希望通过软件和模型架构获取类似收益,同时继续使用数据中心中已广泛可用的 GPU。
因此,Kog 出现在 Google News 上的意义不止于一次普通的基准测试发布。该公司正在验证:在客户承诺采用另一套基础设施栈之前,软件能否缩小通用硬件与定制硅片之间的差距。
更换硬件影响的不只是基准速度。运营者还必须考虑供应、部署工具、监控、模型兼容性、工程技能,以及与现有集群的集成。Nvidia 的优势不仅在于硅片,也包括其用于 GPU 编程的软件平台 CUDA。
AMD 一直在构建其 ROCm 软件栈作为替代方案。Kog 在 AMD MI300X 硬件上报告的性能表明,更底层的推理工程也能强化非 Nvidia GPU 的论据。这一结果会对寻求更大供应商灵活性的云服务商和企业具有重要意义。
因此,这一压力落在多个群体身上。专用芯片供应商必须证明,其性能优势经得住激进 GPU 优化的考验。Nvidia 则必须持续改进推理软件,同时捍卫使其平台具备吸引力的广泛兼容性。
AMD 面临的是不同挑战。它必须将有竞争力的硬件和零散的技术演示转化为可靠的生产环境。如果 Kog 的引擎能够在不同模型和真实工作负载中稳定运行,这将有助于强化 AMD 的论点。
推理软件公司同样面临压力。广泛使用的引擎已经采用连续批处理、kernel 融合、量化、前缀缓存和推测解码等技术。Kog 必须证明,其更深层的架构能够带来这些成熟系统无法迅速复制的收益。
连续批处理会动态合并请求,让 GPU 一次处理更多工作。这可以提高衡量单位时间完成总工作量的吞吐量。但吞吐量并不能保证单个请求拥有最低延迟。
这一差异对智能体尤为重要。高吞吐量服务器可以高效处理大量相互独立的请求,但一个多步骤智能体仍可能需要等待漫长的连续执行过程。Kog 关注的是这一单独工作流的体验。
该战略反映出从训练经济学向推理经济学的更广泛转变。训练模型是一个规模庞大但有边界的项目;而服务模型会产生持续成本,并随着请求量、输出长度以及每项任务中隐藏的模型调用次数而增长。
智能体会放大这些成本,因为一条用户指令可能触发规划、检索、工具选择、代码执行、验证和修订。每个阶段都可能涉及另一次推理调用。因此,更快的生成速度既能改变用户体验,也能改变运营模式。
这并不意味着每个智能体都受 GPU 限制。工具调用、网络请求、数据库和外部 API 都可能主导总完成时间。有些工作流花在等待软件系统上的时间,比生成 token 的时间更多。
当模型解码处于关键路径上时,Kog 的论点最为有力。编码、语音、模拟和交互式推理应用都可能符合这一描述。异步运行的后台研究任务,可能更看重总成本和吞吐量,而非即时 token 输出。
专用芯片面临的挑战同样取决于工作负载。针对 transformer 推理优化的处理器,在模型符合其假设时能够表现出色。当客户需要运行多样化架构、训练任务、多模态工作负载或快速变化的研究代码时,通用 GPU 仍保有优势。
这正是为什么主要竞争并不只是 Kog 对阵某一家芯片制造商,而是更深层的 GPU 优化对阵硬件专用化。两条路线都在追求更快、更经济的推理,但它们将复杂性置于技术栈的不同位置。
模型与运行时成为一个系统
Kog 的核心逆转在于:当软件不再将通用 GPU 视为泛化目标时,它可以表现得更像专用推理硬件。
传统模型开发往往将研究与部署分开。研究人员针对模型质量优化架构和训练;基础设施团队随后将完成的模型适配到可用的服务环境。
这种分工让团队能够独立推进,但也可能牺牲性能。模型可能包含跨 GPU 协调成本高昂的操作。即使这些操作与其最快执行路径相冲突,服务引擎也必须保留它们。
Kog 正采用协同设计,即围绕彼此的约束共同构建模型与运行时。Laneformer 让该公司能够控制影响内存访问、同步和 GPU 间通信的架构决策。
该公司的 Laneformer 模型为这一理念提供了具体示范。Kog 发布了模型权重和代码,使外部开发者能够检查其架构,并测试这一主张的部分内容。
持久化内核设计在更低层面遵循相同逻辑。传统执行方式可能会为归一化、注意力、矩阵运算及其他阶段分别启动独立内核。融合则将这些操作合并,使数据更靠近处理器,并避免反复调度。
Kog 将这一思路进一步推进:让解码过程始终运行在一个驻留于 GPU 的程序中。目标是消除操作之间的中断,并更直接地管理执行序列。
这类似于专用处理器所具备的一项优势。专门设计的硬件通常通过限制通用性和控制数据移动来实现可预测性。Kog 正试图通过一条范围狭窄、深度优化的软件路径施加类似的约束。
据称的每秒 3,000 个 token 成绩之所以引人注目,是因为它聚焦于单请求生成。许多推理基准更强调大批量场景下的总体吞吐量。这一指标对服务提供商很重要,但它可能掩盖单次交互请求的实际等待时间。
批量大小为一会带来更棘手的利用率问题。系统无法依靠大量并发用户来让 GPU 的每个单元始终保持忙碌。Kog 的模型和运行时旨在减少这种条件下更为明显的空闲时段。
但速度本身并不能决定智能体性能是否实用。模型能力依然至关重要。一个生成速度很快的小模型,如果会出错、重复工作,或需要更强的模型来检查输出,其总体耗时仍可能更长。
这就形成了 token 延迟和任务延迟之间的重要区别。token 延迟衡量文本出现的速度;任务延迟衡量系统完成用户实际目标所需的时间。
一个每秒生成 3,000 个 token、却选择了错误工具的智能体,并没有提供更快的解决方案。它只是更快地产生了一个错误的中间步骤。Kog 更深层的押注最终必须在任务层面展现出收益。
根据其技术材料,这家初创公司计划支持更大的第三方混合专家模型。混合专家模型会针对每个 token 激活其参数中的选定子集。这可以减少计算量,但对这些专家进行路由和分发会带来新的通信挑战。
对广泛使用的外部模型提供支持,将使 Kog 的主张对买家更具相关性。除非某个小模型在一项狭窄任务上表现格外出色,否则企业很少会围绕它来选择基础设施。
兼容性同样决定客户能否在不重新设计应用的情况下采用该引擎。兼容 OpenAI 的接口可以简化 API 集成,但模型支持、可观测性、调度和故障恢复仍决定着生产就绪程度。
这正是成熟 GPU 软件依然强大的原因。Nvidia 正在开发 TensorRT-LLM 和其他为其硬件优化推理的库。vLLM 和 SGLang 等开源项目则受益于庞大的社区、广泛的模型支持和生产环境反馈。
Nvidia 将 TensorRT 描述为面向其处理器执行优化而设计的高性能推理系统。其推理软件可在支持的模型中应用计算图优化、低精度计算和内核选择。
因此,Kog 面对的是一个不断变化的竞争目标。若其技术具有通用性且可复现,更大的平台就能采用类似思路;若这些技术仍是专有的,或与 Laneformer 紧密绑定,Kog 将获得差异化优势,但兼容市场也会更小。
其可能的机会位于这两个极端之间。Kog 可以把云服务商或 AI 团队不愿自行复现的复杂底层工作封装为引擎。其价值将来自跨硬件代际持续稳定的执行质量,而非某一次基准测试的峰值。
模型与运行时的组合也可能吸引对响应速度有严格要求的应用开发者。语音系统需要低延迟来维持对话节奏;编程智能体必须在生成与执行之间反复迭代;交互式创意工具则会在每次模型调用打断用户时体验受损。
知识密集型智能体还引入了另一层复杂性。它可能会收集文档、融合上下文,并在给出答案前进行多轮推理。构建这类系统的团队需要审视整个 AI 工作流,因为生成速度只解决了链条中的一部分问题。
即使推理并非唯一瓶颈,Kog 的论点依然有价值。它鼓励团队测量每一个阶段,而不是因为软件栈尚未优化,就断言 GPU 不适合这类工作。
更深层的教训并不是软件总能击败定制硬件,而是硬件之间的比较取决于其上层软件的质量。调度不佳的 GPU 并不能证明 GPU 的最终极限。
Kog 的基准测试尚未说明什么
Kog 展示了一个可信的技术方向,但其公开数据尚不足以证明它在主流智能体工作负载中具备生产级优势。
第一个限制在于模型规模。Laneformer 有 23 亿参数,而许多要求严苛的智能体应用使用的模型大得多。更大的系统会给内存容量、通信和缓存管理带来更大压力。
当小模型可以由一个节点容纳时表现良好的技术,在权重和中间数据跨越更多设备时可能会呈现不同效果。通信成本会增加,而引擎可用于隐藏这些成本的机会会减少。
Kog 表示,未来将支持大型第三方混合专家模型。在可比结果出现之前,最有力的解读仍应保持在较窄范围内。该公司展示的是其协同设计的软件栈在特定测试下能做什么,而不是每个生产模型都能实现什么。
第二个限制在于工作负载形态。Kog 强调单请求和低延迟,但商业推理服务还必须处理变化的提示词长度、多用户、流量突发、长上下文、取消请求以及不断变化的输出限制。
针对批量大小为一优化的引擎,在更高并发下可能面临权衡。买家真正关心的问题并非单个请求能否运行得极快,而是系统能否在保持集群经济利用率的同时维持有意义的低延迟。
第三个限制是基准测试的可比性。每秒 token 数会随模型架构、词表、精度、输出条件、硬件数量和测量方法而变化。若不匹配这些变量就比较两个公开数字,可能会造成虚假的确定感。
运行在八块 GPU 上的小模型,不能与运行在一颗定制处理器上的大模型直接比较;它同样不能与处理大量请求的高吞吐量服务器直接比较。每一种配置回答的都是不同的运营问题。
第四个限制是输出质量。协同设计可以提升效率,但架构仍必须满足应用的准确性要求。编程模型需要可靠的代码生成与推理能力,而不只是快速生成文本。
公开评测应在相关编程任务上,将 Laneformer 与规模相近的模型进行比较。它们还应衡量:当智能体进行规划、执行代码、遇到错误并调整方法时,其速度是否能缩短端到端完成时间。
第五个限制是成本。Kog 将其引擎描述为更快、更便宜,但速度并不会自动决定总服务成本。即使单个请求完成得很快,八块高端 GPU 依然会消耗大量容量。
一项有价值的比较需要纳入硬件购置或租赁假设、能源消耗、平均利用率、并发量、故障率和运维人力。随后应以每项完成任务的成本来呈现结果,而不只是每个生成 token 的成本。
第六个限制涉及生产成熟度。企业需要身份验证、监控、容量管理、服务级目标、模型更新、安全控制,以及故障期间可预测的行为。技术预览并不覆盖完整的运营层面。
这些保留意见并未否定该架构。它们界定了 Kog 接下来必须提供的证据。该公司已将讨论从理论主张推进到一组可验证的工程问题。
独立复现将提供最有力的验证。Kog 已发布技术说明和模型工件,但外部团队需要获得足够的代码和配置细节,才能在可比的 AMD 和 Nvidia 系统上复现结果。
竞争对手同样能提供有价值的压力测试。Groq 和 Cerebras 可以在匹配条件下比较任务延迟、吞吐量、能耗和模型可用性。成熟 GPU 引擎则可以测试类似的融合或持久化执行是否会缩小 Kog 的领先优势。
Infinity 代表了另一种以软件为中心的方法。该初创公司并非构建单一、深度集成的模型—运行时栈,而是在开发能够跨不同芯片编写和调优底层代码的智能体。其自动化内核工作说明,AI 本身正进入基础设施优化的闭环。
这一路径可能加速原本需要稀缺系统专业知识的技术传播。它也意味着,Kog 的优势不能仅建立在知道如何编写更快的内核之上。该公司需要一个可重复的平台、专有的执行知识,或一条能将工程能力转化为持久客户价值的分发路径。
依赖硬件供应商也存在战略风险。AMD 和 Nvidia 可以改进自身的编译器、运行时和参考引擎,也可以暴露有利于其首选软件栈的新硬件特性。
Kog 可以通过跨供应商合作来抵消这一风险。其在 AMD MI300X 和 Nvidia H200 系统上的结果表明,可移植性是计划的一部分。不过,从每个平台榨取最大性能通常仍需要不同的底层工作。
公司的小规模有助于其快速行动,但也限制了它能支持的模型、配置和客户环境数量。广泛兼容性需要持续的工程投入,而不只是一次成功的优化行动。
因此,买家应将这一基准测试视为一个有前景的信号,而不是最终采购结论。下一步应是基于买家自身模型、提示词分布、并发需求和任务级成功标准进行针对工作负载的评估。
Kog 正在挑战一种误解,但尚未证明一个普遍适用的相反结论。GPU 在智能体推理方面可能远优于浅层软件栈所暗示的水平,但这并不意味着它们会在每种工作负载下都胜过每一种专用处理器。
将决定 Kog GPU 押注的三个信号
未来几个月,Kog 的论据将通过更大模型的结果、独立生产测试和客户采用情况得到强化或削弱。
第一个信号是其在广泛使用的第三方混合专家模型上的表现。Kog 表示该支持是其发展方向的一部分,而这一测试将消除小型协同设计模型所带来的保护。
比较应采用匹配的精度、上下文长度、输出长度、硬件和并发条件。报告应涵盖首个 token 延迟、输出速度、总任务时间、吞吐量、内存使用和能耗。
强劲的结果将表明,持久化内核和延迟并行思路能够推广到 Laneformer 之外。若性能大幅下降,则说明 Kog 当前的优势高度依赖于对模型架构的控制。
第二个信号是独立的生产环境评估。云服务商、企业 AI 团队或基准测试机构应在流量波动和长时间运行的智能体工作流下测试该引擎。
评估应涵盖故障、请求取消、提示词缓存、长上下文和混合工作负载。衡量重点应是单位基础设施所完成的任务量,而非仅关注峰值 token 生成速度。
生产环境证据将强化 Kog 关于 GPU 仍适用于交互式智能体的主张。若该引擎只能在受控演示中实现高速表现,那么专用硬件和成熟的服务系统仍具备更有力的运营优势。
第三个信号是超越技术预览阶段的实质性部署。具名客户、受支持的云环境,或可重复部署的自托管软件包,都将表明 Kog 能够将其优化工作转化为易于使用的产品。
客户采用情况也将揭示哪个市场最重视该系统。云 GPU 服务商可能用它改善现有算力集群的经济性。智能体开发者可能采用它以缩短响应时间。企业则可能看重能够继续使用熟悉硬件的能力。
这些部署的性质比一个醒目的大客户标志更重要。一款对延迟有严格要求的小型编程或语音应用,可能比没有可衡量使用数据的广泛合作更能提供技术证据。
Google News 的关注可以将 Kog 的观点带给更广泛的受众,但能否持续仍取决于反复验证的结果。这家初创公司提出了一个聚焦明确的主张:作为智能体推理基础的 GPU 尚未过时,因为其软件栈仍有改进空间。
开发者现在应当思考,他们的智能体究竟在什么环节等待。如果解码占据主导,更深入的推理优化值得直接测试。如果数据库、工具调用或模型决策能力不足才是主要瓶颈,更快的 token 生成并不能解决全部问题。
下一步应以可测量的方式推进。在相同工作负载下,将 Kog 即将公布的更大模型结果与专用芯片及成熟的 GPU 引擎进行比较。随后跟踪任务完成率、可靠性和基础设施使用情况。这些证据将表明,Kog 找到的是一条具有广泛价值的路径,还是一个令人印象深刻但适用范围有限的性能峰值。


