top of page

Abacus.AI Smaug 模型向企业代理的闭源模型路线发起挑战

9月12日
讀畢需時 15 分鐘

Abacus.AI 于 9 月 10 日发布了三款 Smaug 模型,瞄准了一个仍在限制企业代理能力的短板——尽管通用模型质量正快速提升。Abacus.AI Smaug 模型专为涉及反复决策、工具调用和不断扩展上下文的长时间任务而设计。它们的发布挑战了这样一种假设:有能力的企业代理必须依赖 Anthropic 或 OpenAI 的闭源模型。

Smaug Flash、Smaug Mini 和 Smaug Agentic 分别处于不同的部署定位。Abacus.AI 表示,企业可以下载其权重,并在私有云环境中托管。这使对数据、基础设施和模型行为的控制成为产品价值主张的一部分,而不再只是可选的合规功能。

因此,真正重要的竞争并非 Abacus.AI 与某一家模型供应商之间的较量,而是开放权重、自托管的代理基础设施与便利但保留更多运营控制权的闭源模型 API 之间的竞争。Abacus.AI 声称,微调可以在不改变底层架构的前提下缩小这一能力差距。其自身的基准测试结果支持了这一论点的部分内容,但独立的生产环境证据仍然有限。

Abacus.AI Smaug 模型将代理工作分为三类

Abacus.AI 将企业智能体 AI 视为多种不同的工作负载,而非一个通用智能问题。

该公司通过其企业代理平台和 Super Assistant 推出了这一三模型系列。每个模型都基于现有开放权重基础模型进行适配,而非引入新的基础架构。这些模型也通过 Hugging Face 发布,并受各自基础模型继承许可证的约束。

Smaug Flash 基于 DeepSeek V4 Flash。Abacus.AI 将其定位为该系列中可持续运行的成员。其目标任务包括处理消息、阅读文档、查询数据系统、调用 API,以及跨多个轮次维护工作流。

根据该公司的技术研究,Smaug Flash 保留了基础模型的百万 token 上下文以及现有的推理服务布局。上下文窗口指模型在一次活跃序列中能够考虑的信息量。该公司表示,已经支持该基础模型的推理系统无需进行架构改动即可加载 Smaug Flash。

Smaug Mini 是紧凑型选择。它在 270 亿参数的 Qwen3.8 27B 模型基础上进行了微调,面向多模态任务、指令遵循、自动化及较短的推理工作负载。多模态意味着该模型不仅可处理文本,也可处理基础架构支持的图像或视频等内容。

这一定位适合边界明确的企业任务。例如,客户服务代理可以检查用户上传的图像、检索账户记录并起草回复。文档工作流则可以对表单分类、核查政策,并将结果路由至另一套系统。

Abacus.AI 表示,Smaug Mini 可部署在单块 GPU 上。这一说法之所以重要,是因为部署规模往往决定模型能否在接近公司数据的位置运行。它也会影响团队能否预留专用算力,而不是共享大型外部服务。

Smaug Agentic 是其中最大的成员。它基于 Moonshot AI 的 Kimi K3 进行微调,后者是一款包含 2.8 万亿总参数的混合专家模型。混合专家架构会针对每个 token 仅激活选定的模型组件,相较于动用全部参数,可减少活跃计算量。

Smaug Agentic 模型卡列出了 1040 亿激活参数、896 个专家以及 1,048,576 个 token 的上下文长度。它还将基于代理轨迹的监督微调列为适配方法。

Abacus.AI 将该模型定位于长周期的编程和工具使用循环。这类任务中,代理会读取代码库、编辑文件、运行测试、解读失败原因,并反复执行这一流程。难点在于如何在大量相互依赖的步骤中维持连贯计划。

该公司表示,三款模型均可在企业虚拟私有云,即 VPC 内运行。VPC 是由客户控制的隔离云网络。自托管能够将提示词、检索到的文档、工具输出和生成的数据保留在这一受控环境中。

这一选择并不会自动使部署变得安全。企业仍需具备访问控制、日志记录、模型治理,以及围绕已连接工具的保护措施。不过,可下载的权重为基础设施团队提供了闭源 API 无法提供的选择。

这一组合构成了该产品发布的核心张力。企业并非被要求仅为隐私而接受更小的本地模型。Abacus.AI 的论点是,经过适配的开放权重模型能够在生产环境中关键的代理行为上展开竞争。

为什么长时间运行的代理需要不同的训练

Smaug 的策略着眼于让代理在给出第一个正确答案之后仍能保持实用性。

传统基准测试通常提供一个提示词,并衡量一次回复。企业代理的行为则不同:它可能完成数十个步骤、查询多个系统、从错误中恢复,并在数小时内保留指令。

在这种环境下,小错误会不断累积。一次不必要的工具调用会消耗时间和算力。混乱的回复可能破坏代理的工作上下文。重复推理可能在工作流产出结果前耗尽 token 预算。

Abacus.AI 将这些失败模式称为循环、停滞和失控的反复推敲。循环是指代理重复无效的行动或推理模式。停滞则是指工作流仍在运行,却没有取得实质进展。

闭源前沿模型同样可能出现这些行为。其供应商可以通过私有训练、推理调整和系统级编排来改进它们。客户获得的是由此形成的服务,但无法检查或托管模型权重。

Smaug 方法在保留各基础模型架构的同时,通过微调改变行为。Abacus.AI 表示,其方案结合了人工整理的代理轨迹,以及聚焦困难失败案例的合成样本。代理轨迹记录了任务中推理、行动、工具结果和后续决策的顺序。

对于 Smaug Agentic,该公司采用了经过筛选的多轮编程轨迹。其模型卡称,推理 token 会出现在上下文中,但会从训练损失中被屏蔽。这意味着训练会奖励更好的行动,而不会直接迫使模型模仿每一个内部推理 token。

Abacus.AI 表示,这项技术在保留常规推敲能力的同时,可缩短极端的推理长度。在科学编程和长上下文推理测试中,该公司报告称,最长的 1% 推理序列降至基础模型长度的约 60% 和 55%。

这比小幅分数提升更具运营相关性。能够以更少病态循环获得类似答案的模型,可以降低延迟和无效计算。它也能让代理更易于监控,因为更少的任务会陷入失控推理。

该公司报告称,Smaug Agentic 在 113 个编程任务中持续完成了超过 7 小时的运行。每项任务的代理步骤中位数为 78 步,且未出现基础设施错误或超时。这些测量来自 Abacus.AI 自己的受控评估,而非独立的企业部署。

Smaug Flash 采用了更窄范围的适配方式。Abacus.AI 表示,它仅通过三个 LoRA 适配器修改了注意力因子矩阵。LoRA 是一种微调方法,它学习相对较小的参数更新,而非重新训练每一个模型权重。

由此产生的增量已合并至发布的权重中。据称,专家模块、路由器、嵌入层和推测解码组件均与基础版本保持一致。对于已经运行 DeepSeek V4 Flash 的团队,这种兼容性可以减少集成工作。

这种方法也解释了 Abacus.AI 为何能够发布一个模型系列,而非单一孤立模型。其主要资产并不是新发明的架构,而是一套旨在推动现有模型呈现更稳定、更果断代理行为的训练流程。

这种与模型无关的策略也带来了依赖性。Smaug 继承了每个基础模型的核心能力、硬件特征、许可证和局限性。微调可以重新引导行为,但无法抹去基础模型的每一项弱点。

因此,这次发布是对专业化的一场押注。通用模型仍在不断提升,但企业代理需要围绕重复行动和真实系统塑造行为。Abacus.AI 相信,聚焦式训练能够带来比又一次大规模模型扩展更高的运营价值。

开放权重代理向闭源 API 施压

只要其性能能够在真实工作中保持足够竞争力,Smaug 最有力的论点便是控制权。

Anthropic 和 OpenAI 提供对高能力模型的托管访问。这一路线免除了大部分托管、优化和更新推理基础设施的负担。它也让客户无需重建推理服务栈,便能获得模型改进。

代价是依赖外部接口。供应商决定可用性、支持的功能、模型退役时间表,以及数据处理的许多方面。企业可以协商保护措施,但仍需在供应商的技术边界内运营。

开放权重模型颠倒了这种安排。客户可以将模型部署在敏感数据附近,选择推理服务软件,预留硬件,并控制更新时机。他们还可以针对内部工具或专业工作流微调模型行为。

开放权重并不必然意味着开源。权重可能可下载,但训练数据、代码或使用权仍受限制。每款 Smaug 模型都继承了基础模型的重要条款,因此买方必须在部署前审查相关许可证。

安全问题也不止于提示词留存。企业代理可能访问电子邮件、源代码、客户记录、数据库和内部应用程序。每一个连接的工具都会扩大系统权限,并增加一条出错或被滥用的路径。

自托管让企业能够直接控制这一环境。它并不能消除提示注入、过度权限、不安全行动或错误输出。治理必须覆盖整个代理工作流,而不仅仅是模型权重的位置。

尽管如此,在受监管和数据敏感的环境中,部署控制仍具有实际价值。金融机构可能要求推理在获批的网络边界内进行。制造商可能希望专有流程数据不被纳入第三方服务。

组织也关心连续性。可下载模型在其创建者调整托管产品后仍可保持可用。团队可以在采用更新前进行测试,保留经过验证的版本,并围绕已知基础设施建立备用能力。

Abacus.AI 将经济性主张纳入这一控制权论点。其发布公告称,开放权重部署的成本可比前沿闭源模型低 10 到 100 倍。该公司还声称,微调可在不增加成本的情况下,将长时间运行代理的性能提升 15% 至 20%。

这些宏观数字尚未得到独立验证。实际经济效益取决于利用率、硬件、工程人力、上下文长度、延迟要求以及所选的闭源模型服务。闲置的私有集群可能会抵消表面上的每 token 成本优势。

比较结果也会随工作负载形态而变化。持续运行的内部智能体可能因需求可预测而有理由采用预留基础设施。偶发性工作流则可能通过外部 API 成本更低,因为客户无需承担闲置容量。

大型模型又带来一项复杂因素。Smaug Agentic 会激活 1,040 亿参数,并在八块 Nvidia B300 GPU 上接受评测。即便其权重可用,这样的硬件配置也远超常规部门级部署的范围。

Smaug Mini 为这一论点提供了更易于验证的案例。根据 Abacus.AI 的说法,其 270 亿参数规模可支持单 GPU 部署。如果其任务表现能够迁移到生产环境,它将为企业提供一条摩擦更低的路径,以部署可控的本地智能体。

Smaug Flash 位于这一战略论述的中间地带。它瞄准高吞吐量工作流,在这些场景中,步骤效率的微小提升会不断累积。它与基础模型服务栈的兼容性,可能会吸引已投资于该基础设施的团队。

即使很少有客户完全自托管,闭源提供商仍面临压力。可信的开放替代方案能够增强采购谈判筹码,并支持混合架构。企业可以将闭源模型保留给困难任务,同时把可预测的工作路由至受控模型。

这种路由模式很可能带来直接的竞争影响。Smaug 无需取代每一个前沿 API 才能产生意义。它只需可靠地处理足够多的重复性智能体工作,从而降低对单一外部提供商的依赖。

Abacus.AI Smaug 基准测试实际展示了什么

已公布的结果显示出针对性的提升,但并未证明其在所有方面都优于闭源模型。

Abacus.AI 报告称,Smaug Flash 在整体 LiveBench 上得分为 77.4,而 DeepSeek V4 Flash 为 74.2。在 LiveBench 智能体编程项目中,报告得分分别为 61.1 和 46.8。

该公司还报告,Smaug Flash 在 NL2Repo-Bench 上得分 73.3,而基础模型为 54.2。AutomationBench 结果为 38.8,对比 25.1。这些差异与该模型宣称专注于工具使用和持续性智能体工作相一致。

LiveBench 试图通过定期增加基于近期材料的问题来减少测试污染。其任务尽可能采用客观答案,而非模型评审。相关的 LiveBench 论文介绍了涵盖推理、编程、数学、数据分析、语言和指令遵循的评测。

Smaug Mini 呈现出较不均衡的表现。Abacus.AI 报告其整体 LiveBench 得分为 76.9,而 Qwen3.8 27B 为 75.3。其 IFBench 指令遵循得分从 79.5 提升至 82.0。

据报告,Mini 模型在 AutomationBench 上得分为 41.8,而其基础模型为 37.3。JobBench 从 33.4 上升至 50.5,NL2Repo-Bench 则从 42.3 上升至 55.8。

不过,Smaug Mini 在 LiveBench 智能体编程上的得分为 60.8,略低于基础模型的 61.4。其 NL2Repo-Bench 得分也落后于 Claude Sonnet 5 所列出的 66.3 分。微调在多个目标领域带来了提升,但并未赢得每一项比较。

Smaug Agentic 相比一个规模大得多的基础模型展现出较小的提升。它在 DeepSWE 上得分 69.9,而 Kimi K3 为 67.5。LiveBench 智能体编程从 62.2 提升至 64.6,SciCode 则从 58.7 提升至 60.8。

在其他测试中,情况有所变化。Smaug Agentic 在 Terminal-Bench 2.1 上得分 86.5,低于 Kimi K3 公布的 88.3。它在 MMMU-Pro 上的得分也为 81.0,而基础模型为 81.6。

Abacus.AI 明确披露了 Terminal-Bench 的一项重要限制。其 Smaug 结果使用了 Terminus 2 agent,而 Kimi K3 公布的结果使用了 Kimi Code。当 Abacus.AI 使用 Kimi Code 时,记录到 Smaug Agentic 得分为 76.4。

这一差异表明,基准比较需要谨慎对待。在智能体评测中,编程模型并非独自行动。周边的智能体框架、提示词、工具、采样设置和重试规则都可能对结果产生实质影响。

部分比较数字来自供应商报告,而非 Abacus.AI 在相同条件下的运行。该公司在其研究材料中标注了这些情况。跨供应商列可以提供背景,但其说服力弱于在同一可复现测试框架下进行的盲测。

Abacus.AI 在专用的八块 B300 部署上,以最高推理强度运行 Smaug Agentic。它使用了 1.0 的温度参数,并为单步骤任务和智能体任务设置了不同的 top-p 值。这些细节有助于复现,但也界定了一套要求很高的评测配置。

训练数据透明度仍是另一项缺口。模型卡描述了经过筛选的、多轮、使用工具的编程轨迹,但未披露数据集内容。缺少这些细节,外部人士无法充分评估数据重叠、代表性、安全筛选或隐藏的选择偏差。

基准测试也会将性能压缩为平均值。企业买家更关心权限错误、工具选择不当、恢复行为、可审计性,以及罕见故障的严重程度。平均分的小幅提升,几乎无法说明自主智能体可能采取的最糟糕行动。

因此,最具说服力的结果是行为层面的,而非竞争层面的。Abacus.AI 报告称,模型减少了失控式推理,并能在长循环中稳定运行。如果独立用户复现这一模式,Smaug 将解决排行榜平均分经常忽略的一项高成本弱点。

在此之前,这些结果应被视为公司自行产出的证据,并附有特别有用的方法学说明。它们足以支持测试这些模型,但不足以证明开放权重智能体已在广泛范围内超越最佳闭源系统。

部署控制也带来企业自身的成本

下载模型权重将控制权转移给买方,同时也将周边的一切责任一并转移。

闭源 API 将模型托管、更新、扩缩容以及大量服务优化打包提供。自托管 Smaug 部署则将这些职责转移给企业或其基础设施合作伙伴。这种转变需要人员、硬件、可观测性和事件响应能力。

Smaug Agentic 展现了规模问题。其架构包含 2.8 万亿总参数,尽管每个 token 仅激活其中的 1,040 亿。Abacus.AI 的评测使用了八块 B300 GPU,树立了较高的运营参考标准。

企业还必须验证量化和服务方案。量化通过降低数值精度来减少内存与计算需求。它可以提升部署效率,但团队必须测试其是否改变准确性、延迟或稳定性。

在已运行 DeepSeek V4 Flash 的场景中,Smaug Flash 看起来更容易采用。Abacus.AI 表示,它保留了基础模型的布局和量化格式。现有兼容性仍不能免除容量规划、监控和访问管理的需求。

Smaug Mini 为许多团队提供了更实际的切入点。单 GPU 模型可以支持部门级试点、边缘部署或专用内部服务。然而,周边的智能体系统可能仍比模型本身更复杂。

工具权限需要格外谨慎。能够读取知识库的智能体面临一种级别的风险。能够发送消息、修改记录、执行代码和批准交易的智能体,则面临高得多的风险。

长时间运行的智能体还会从多种来源累积上下文。检索到的文档可能包含恶意指令或过时政策。工具响应可能并不完整,模型早期的错误也可能在后续步骤中演变为假设。

企业必须决定哪些操作需要人工批准。它必须记录智能体看到了什么、调用了哪些工具,以及系统为何接受某一结果。无论模型是开放还是闭源,这些控制措施都是必要的。

因此,评测应在受限权限下采用真实的内部工作流。团队可以重放历史案例、引入已知故障条件,并将 Smaug 与当前模型进行比较。成功率应与延迟、恢复能力和人工审核指标结合评估。

合理的试点应从可逆工作开始。文档分类、草稿生成、研究综合和工单路由能够创造可衡量的价值,同时不会授予不可逆的权限。更高风险的自动化应仅在受控证据支持扩大范围后再推进。

知识密集型智能体还需要可靠的检索能力。当源材料分散或陈旧时,模型无法正确行动。团队可以在测试自主操作前,先构建一个受治理的可搜索知识库。

许可必须始终是部署审查的一部分。Smaug 模型建立在 DeepSeek、Qwen 和 Kimi 基础之上,而非采用单一统一许可证。“开放权重”描述的是对参数的访问,而不是一套通用的商业权利。

模型更新带来另一项运营选择。Abacus.AI 表示,Smaug 方法可以随基础模型的改进而演进。这可能带来更好的版本,但每个新的基础模型或微调版本都需要安全审查、回归测试和重新验证。

私有托管可以支持数据驻留,但硬件和系统遥测也会承载信息。日志、缓存、备份和追踪记录需要与提示词同等的治理。本地部署的私密性取决于其完整数据路径的私密性。

这些责任并不会抵消开放权重的优势。它们界定了最适合利用这一优势的买方。拥有稳定工作负载和成熟 AI 基础设施的组织,可以将控制权转化为经济和合规价值。

即使模型可获取,较小团队也可能更偏好托管服务。它们的限制性资源可能是工程关注度,而非推理支出。闭源 API 仍然具有吸引力,因为它们将基础设施工作转化为由供应商管理的依赖关系。

企业真正的选择并不只是开放还是闭源,而是组织希望将运营责任置于何处。Smaug 增加了可以可信地划定这一边界的选项数量。

三个信号将决定 Smaug 是否重要

Smaug 的意义如今取决于独立采用、可复现的行为,以及闭源模型提供商可信的回应。

第一个信号是第三方复现基准测试和长循环结果。独立团队需要在相同的智能体、提示词、硬件假设和评分规则下,将 Smaug 与其基础模型进行测试。

对于报告中减少失控式推理的表现,复现尤为重要。即使基准平均分几乎没有变化,这种行为也会影响成本和任务完成情况。在不同工作负载中出现类似结果,将增强 Abacus.AI 对其核心机制的主张。

负面结果同样具有参考价值。如果减少推理导致过早行动、脆弱计划或遗漏边缘情况,那么这种优化可能只是用一种故障模式交换另一种。企业需要的是分布层面的证据,而不仅是平均分。

第二个信号是在受控企业环境中的生产采用。下载量和模型点赞只能体现好奇心,不能证明持续使用。更有意义的证据包括重复部署、已完成的工作流、可衡量的人工审核减少,以及稳定的服务级性能。

Smaug Mini 在这里值得密切关注。其单 GPU 特性降低了实验门槛。如果买方将其用于多模态文档工作和受限工具调用,这一版本无需前沿规模的基础设施也可能获得发展势头。

Smaug Flash 提供了另一项采用测试。其价值取决于始终在线的智能体能否在消息传递和运营系统之间持续运行。成功的部署应在较长周期内展现出更少的停滞循环和可预测的成本。

Smaug Agentic 面临着最高门槛。其基础设施要求缩小了能够直接托管它的组织范围。采用可能会集中在云服务提供商、大型企业和专业推理运营商之间。

第三个信号是闭源模型提供商将如何回应。Anthropic 和 OpenAI 可以降低推理成本、改进缓存、扩展私有部署选项,或加强对敏感数据的控制。这些举措中的任何一项都会削弱 Smaug 的差异化优势。

它们还可以通过模型和托管编排提升长周期智能体的表现。闭源厂商能够获取来自大量客户的工具使用遥测数据,从而形成强大的反馈循环。开放权重提供商则必须以透明度、可移植性和社区适配能力来应对。

基础模型开发者同样会影响结果。Smaug 依赖于 DeepSeek、Alibaba 的 Qwen 团队、Moonshot AI 以及其他开放模型实验室持续发布新成果。更好的基础模型将为 Abacus.AI 未来面向智能体的训练提供更强的素材。

Abacus.AI Smaug 模型已经清楚地说明了一点:企业级智能体的性能不能仅凭对话质量来判断。在重复操作、长上下文、工具故障和延迟结果中的稳定性,正逐渐成为独立的模型类别。

尚未解决的问题是,专业化是否能带来持久的生产环境收益。Abacus.AI 已发布权重、部署细节、局限性,以及由公司自行开展的大量测量结果。这让它成为一个可验证的命题,而非封闭产品的宣称。

开发者应将 Smaug 与自己实际运行的系统进行比较,而不是与抽象的排行榜优胜者比较。企业采购方应衡量完整工作流的经济性,包括硬件、工程投入、审核时间和失败操作。

未来几个月应能揭示,独立运行是否会复现其所声称的行为改进。应关注真实部署中的证据,尤其是那些持续与文档、代码、消息系统和内部 API 交互的智能体。

如果这些信号出现,开放权重的企业级智能体将成为闭源 API 的实用制衡力量。如果没有,Smaug 将仍是一项有趣的微调成果,其运营前景超出了已测得的实际覆盖范围。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page