top of page

Grok AI Agent 突破聊天边界,但长时运行任务才是真正考验

SpaceXAI 于 8 月 12 日发布 Grok 4.6,并提出了更明确的承诺:其 Grok AI agent 能在更长、更复杂的工作流中持续保持生产力。该公司瞄准的场景包括编程、研究、文档分析和视觉项目,这些任务都需要许多彼此关联的步骤。

这一重点让 Grok 4.6 进入了前沿模型开发商最重要的竞争领域。竞争正从“谁最擅长回答孤立提示词”,转向“谁能在有限监督下完成实质性工作”。

SpaceXAI 表示,其在编程和专业工作评测中的得分有所提高。公司还称,该模型在延长任务中会进行更多自我测试。这些说法暗示了有意义的进展,但尚不足以证明其在日常条件下具备可靠的自主性。

OpenAI、Anthropic、Cursor 和其他智能体开发商正通过模型、工具、记忆与编排的不同组合,追求同一目标。它们面临的共同障碍并非生成一个出色的初始答案,而是在经历数十次决策、工具调用、修改和上下文变化后仍能保持方向。

因此,Grok 4.6 的意义不止在于其基准排名。它检验了模型内部的改进能否减少长时运行智能体目前所需的大量支撑架构。

Grok 4.6 将目标从回答转向完成工作

核心变化在于,Grok 4.6 强调完成相互关联的工作,而不只是生成更强的回答。

SpaceXAI 将 Grok 4.6 描述为适用于编程、智能体任务和知识工作的模型。其发布详情特别强调了长时运行智能体,以及更具雄心的交互式或视觉项目。

长时运行智能体是指能在一系列决策、工具调用和修改中持续工作的系统。即使中间信息发生变化,它也必须保留用户的意图。

这一要求听起来很简单,直到任务跨越多个阶段。一项研究任务可能涉及寻找来源、比较主张、提取证据、起草论证,以及检查最终输出。

编程任务可能更具挑战。智能体必须检查代码仓库、理解依赖关系、编辑多个文件、运行测试、调查失败原因,并修正其方法。

SpaceXAI 表示,Grok 4.6 能在这些更长的任务轨迹中持续投入。公司重点提及研究、信息分析、代码库工作、应用开发和完善的工作产物等目标场景。

该模型可通过 SpaceXAI API、Grok Build、Cursor 以及多个模型网关使用。这种分发方式让开发者能在不同的智能体系统中测试同一底层模型。

Grok 4.6 还支持函数调用、网页搜索、X 搜索和代码执行。函数调用让模型能够请求外部软件执行结构化操作,而非仅依赖生成文本。

根据模型文档,Grok 4.6 接受文本和图像输入,并返回文本。它提供 500,000 token 的上下文窗口,以及可配置的推理强度。

更大的上下文窗口让智能体能在一次工作流中查看更多源材料。但这并不能保证模型会正确地优先处理每一项相关细节。

文档建议为长智能体循环使用上下文压缩。上下文压缩会总结或重组早期活动,让智能体无需持续携带所有原始交互即可继续工作。

这一建议揭示了一个重要限制。即使拥有很大的上下文窗口,智能体在反复读取文件、调用工具和生成中间结果时,仍需要主动管理。

SpaceXAI 还建议通过会话专用缓存键,将相关请求路由到同一服务器。这种方法可提升提示词缓存效果,并减少对未变上下文的重复处理。

这些实现细节很重要,因为长时运行工作依赖整个执行循环。即使模型具备很强的推理能力,一旦记忆、工具状态或上下文处理出现问题,仍可能失败。

因此,Grok 4.6 既是一次模型发布,也是一次系统挑战。它的实际价值将通过决定其看到什么、记住什么、检查什么以及改变什么的运行环境显现出来。

为什么长时运行智能体成为新战场

前沿模型日益围绕持续性展开竞争,因为孤立提示词的质量已无法定义最有价值的专业使用场景。

一次简短聊天掩盖了许多失败模式。模型接收一个边界明确的请求,生成一次回答,且很少会因早期错误而承担后果。

更长的工作流会暴露这些弱点。一个错误假设可能会影响后续搜索、代码修改、计算和结论,而原始错误尚未被任何人发现。

智能体还需要在工具返回意外结果时恢复。它们必须识别未完成的工作、修订计划,并区分暂时的障碍与已经完成的任务。

Cursor 在扩展其智能体研究预览时描述了这一问题。该公司观察到,前沿模型在有雄心的项目中会失去更大的目标,或在仅完成部分工作后停止。

Cursor 的应对方式是开发定制 harness,即负责规划任务、提供工具、跟踪进度并检查结果的软件层。这一做法表明,模型能力本身并不能决定智能体表现。

SpaceXAI 则从另一个方向发力。该公司称,Grok 4.6 接受了旨在提升持续推理与智能体行为的训练,这些改进直接发生在模型内部。

公司表示,Grok 4.6 的补充训练周期长于 Grok 4.5。该训练使用了经过筛选的模型生成推理数据、工程数据,以及对优化器和训练流程的调整。

随后,SpaceXAI 使用 Grok 4.5 重新生成监督微调轨迹。轨迹记录了完成一项任务时采取的行动与决策序列。

这些轨迹覆盖了多种推理设置、智能体 harness 和领域。SpaceXAI 称,在后续强化学习阶段之前,基于模型的检查会过滤存在问题的样本。

强化学习通过与结果关联的反馈来训练行为。对于 Grok 4.6,SpaceXAI 称这些任务包括通用编程、知识工作、网页开发、计算机辅助设计和内核优化。

预期结果是,模型在训练中已练习过更多完整工作流。这不同于部署后依赖编排层去纠正每一种弱点。

OpenAI 正通过另一种架构选择追求类似目标。其 GPT-5.6 发布将更强的单体模型与程序化工具使用及可选的并行智能体结合起来。

并行智能体会在合并结果前,将工作分配到彼此独立的上下文中。当子任务确实相互独立时,这种结构可加快研究或编程速度。

然而,并行也会带来协调成本。不同智能体可能重复工作、采用相互冲突的假设,或返回主智能体未能整合的发现。

这场竞争并非只是 Grok 与某一个竞争模型之间的较量。它是以模型为中心的持续性,与日益复杂的编排系统之间的竞争。

对开发者而言,这一区别会影响复杂度。能够可靠管理更长任务的模型,可能需要更少的重试、检查点和监督组件。

对企业买家而言,这一区别会影响治理。每增加一个工具、记忆存储或子智能体,就多了一个权限、敏感数据或责任归属可能变得不清晰的环节。

长时运行智能体正成为战场,因为它们集中了这些技术和组织问题。若能成功,AI 将从偶尔的助手转变为持续工作中的参与者。

Grok AI Agent 检验以模型为先的策略

Grok AI agent 正在检验:更强的经训练行为,能否在外部编排接管前承担更多工作流任务。

SpaceXAI 表示,Grok 4.6 能跨越多个步骤坚持处理复杂任务。公司还称,该模型在更长的任务轨迹中会进行更多自我测试和验证。

自我测试意味着模型会在继续之前检查自己的输出。在编程中,这可能包括运行测试、检查失败情况,以及修改实现方案。

在研究中,这可能包括比较来源,或检查证据是否支持结论。在视觉工作中,这可能包括在下一轮迭代前审查布局、交互或一致性。

这种行为很重要,因为每一步都需要批准时,人类监督的成本会变得高昂。但如果过早取消监督,小错误也可能不断累积。

以模型为先的策略寻求更好的平衡。智能体应执行更多内部检查,同时仍向用户呈现重要决策与不确定性。

SpaceXAI 表示,与 Grok 4.5 相比,Grok 4.6 能为视觉和交互项目生成更强的初始版本。公司称,该模型可在一次尝试中建立应用结构和视觉语言。

公司还称,该模型能够研究陌生领域、构建核心交互,并根据反馈持续完善项目。这些仍是供应商报告的观察,而非独立的可靠性测量结果。

不过,这一方向值得关注。智能体开发商往往通过僵化的工作流、详细提示词、重复评估和专用子智能体,来弥补模型的不一致性。

更好的原生持续性可以简化这一技术栈。它也能让同一模型更容易迁移到编程工具、研究系统和企业应用中。

Grok 4.6 API支持四种推理级别。开发者可以为困难任务分配更多推理资源,而不必以相同方式处理每一个请求。

这种控制有助于让投入与风险相匹配。简单的分类任务不需要与代码仓库迁移或法律文件审阅相同的处理模式。

但推理强度并不等同于可靠性。如果模型的初始假设始终未受质疑,它可能花费更长时间去追求错误的解读。

因此,有效的智能体需要可观察的检查点。用户应能够查看计划、审查具有重要后果的操作,并识别哪些来源影响了一项决策。

这一要求对于知识工作尤为重要。一份精致的报告可能比一个明显的编程错误更有效地掩盖缺乏支持的主张。

团队还需要存在于模型活跃上下文之外的持久知识。个人知识库可以在不同运行之间保留已批准的来源、决策和机构背景。

这种外部记录不应变成未经筛选的记忆倾倒。智能体需要与权限相适配的相关检索机制,以区分当前事实与过时笔记。

当 Grok AI agent 能将模型层面的持续性与严格的外部状态结合时,它才最有用。两者都不能安全地取代另一方。

如果 Grok 4.6 比同类模型需要更少的纠正性支撑架构,开发者很快就会注意到。他们将看到更少被放弃的计划、重复搜索、相互矛盾的修改,以及不必要的工具调用。

如果做不到这一点,基准测试带来的提升仍然重要,但主要会成为更大型智能体架构的输入。周边的执行框架仍将是竞争的真正单位。

Grok 4.6 基准测试未能说明什么

Grok 4.6 在多项基准测试中取得广泛提升,但已公布的结果并不能证明它能在开放式职场环境中可靠运行。

SpaceXAI 的评测表显示,Grok 4.6 High 的 AA Intelligence 得分为 61。Grok 4.5 High 在同一表格中的得分为 56。

这一综合得分与 GPT-5.6 Sol Max 所列结果一致。Fable 5 Max 则以 62 分高出一分。

在衡量专业任务表现的 GDPVal-AA v2 上,Grok 4.6 取得了 1753 分。GPT-5.6 Sol 所列结果为 1728,Fable 5 为 1741。

这些数字支持了 SpaceXAI 对其知识工作能力的定位。它们也表明,排名会随所选评测的不同而变化。

编程结果也呈现出相同的模式。Grok 4.6 在 CursorBench v3.2 上取得了 69.9%,而 Grok 4.5 为 66.7%。

它在 DeepSWE v1.1 上获得 65.9%,高于前代的 54%。不过,表格中 GPT-5.6 Sol 为 73%,Fable 5 为 70%。

在 FrontierCode v1.1 Extended 上,Grok 4.6 达到 61.3%。对比表中,GPT-5.6 Sol 为 60.6%,Fable 5 为 63.6%。

Grok 4.6 在 APEX-Agents 和 APEX-SWE 上还分别取得了 57.5% 和 56.4%。其所列 AA-Briefcase 得分为 1577。

Harvey LAB 的结果为 15.8%,高于 SpaceXAI 表格中展示的所有对比对象。该评测聚焦法律工作,这是知识工作中要求尤其严苛的场景。

Terminal-Bench v3.0 给出了更为谨慎的信号。Grok 4.6 得分为 26%,而表中 GPT-5.6 Sol 和 Fable 5 的结果均超过 34%。

综合来看,这些分数描绘的是一款整体具有竞争力的模型,而非毫无争议的领先者。Grok 4.6 在部分评测中领先,在另一些评测中则落后。

基准测试的版本同样重要。不同发布版本或执行框架配置下的结果,不应被视为可以直接互换比较。

SpaceXAI 指出,第三方分数采用最佳的自报或公开可得结果。这种做法具有实用性,但并未形成统一、独立的测试环境。

基准测试通常会为智能体提供明确目标和可衡量的完成条件。现实中的职场任务往往始于缺失的需求与对成功定义的争议。

代码仓库任务可能会奖励通过隐藏测试的表现。生产工程还要求可维护的设计、兼容性决策、审慎审查,以及与其他贡献者的沟通。

知识工作评测可以衡量提交产物的质量,却更难捕捉智能体是否使用了过时证据,或不当处理了机密上下文。

长期自主运行带来了另一道鸿沟。单个长时间任务的成功,并不能说明系统在数百次部署中能保持多高的一致性。

较高的平均值可能掩盖代价高昂的失败。一次错误的数据库变更、缺乏依据的法律主张,或未经授权的外部操作,都可能抵消许多常规成功。

因此,用户应将基准测试表视为能力证据,而不是运营可靠性的证明。这些结果足以支持测试 Grok 4.6,但不足以支持取消人工监督。

独立评测需要考察完成率、纠正成本、工具错误和人工干预,还应报告重复运行之间的性能方差。

最具说明力的指标或许是无需大幅返工即可被接受的工作占比。这个数字能将模型表现直接与用户投入联系起来。

在此类证据不断积累之前,Grok 4.6 的基准测试地位仍然前景可期,但并不完整。尚未解决的问题是:其更长的推理过程究竟有多频繁地能产出可信、完成度足够的工作。

知识工作让风险超越编程

知识工作扩大了 Grok 4.6 的机会,但也让溯源、权限与审查变得更加重要。

编程智能体运行在反馈异常有用的环境中。编译器、测试、静态检查工具和版本控制可以在部署前暴露许多错误。

研究和商业分析很少具备同等的检查机制。一项流畅却缺乏依据的结论,可能在工作流中一路通过,而不会触发技术错误。

SpaceXAI 在对 Grok 4.6 的定位中,将知识工作与编程并列。这一类别可包括研究、文档综合、财务分析、法律审查和战略规划。

每项活动都不仅仅需要回忆事实。智能体必须判断哪些信息重要、化解相互冲突的证据,并传达不确定性。

设想一位产品经理正在准备发布评审。智能体可能需要收集客户反馈、比较既往决策、分析使用数据,并起草建议。

长期运行的工作流可以节省大量时间,但也可能混合不兼容的数据周期,或将过时决策视为现行政策。

解决方案并不只是更大的上下文窗口。系统需要准确检索、可追溯的来源,以及针对智能体可访问哪些仓库的控制机制。

AI second brain 可以帮助组织源材料和既往决策。智能体仍需要有关如何解决冲突和保留来源链路的指令。

当输出会影响客户、员工、合同或财务决策时,专业审查仍然必不可少。智能体应当加速判断,而不是掩盖判断发生的位置。

视觉与交互式工作也带来相关挑战。SpaceXAI 表示,Grok 4.6 可以将宽泛的想法转化为应用程序内容充实的初始版本。

令人信服的原型可以缩短创意与用户反馈之间的距离。但如果界面看起来已经完成、底层行为却仍不完整,它也可能制造虚假的信心。

团队需要将呈现质量与实现质量区分开来。安全性、无障碍性、数据处理和故障恢复都需要明确验证。

长期运行的智能体也扩大了权限边界。研究助手可能只读取文档,而运营型智能体则可能编辑代码、更新记录或联系外部系统。

权限应遵循最小必要范围。具备执行更多操作能力的模型,不应自动获得执行这些操作的权限。

审计记录同样变得重要。团队需要知道智能体访问了什么、使用了哪些工具,以及它为何更改某份文档或系统。

SpaceXAI 表示,Grok 4.6 接受了其覆盖范围最广的部署前评测套件,并扩大了安全防护校准。这些表述在公告中仅提供了关于具体失败率的有限细节。

该公司还将漏洞修补、工程设计和 AI 研究列为合理的目标用途。每个领域都将有价值的自动化与潜在的严重滥用结合在一起。

成熟的部署方式会将模型安全防护与系统控制相结合,包括身份验证、审批关卡、隔离执行、日志记录和回滚程序。

最强的 Grok AI agent 部署,不会是人工参与最少的那个,而会是在关键时刻请求人工判断的那个。

这种设计也能提升采用率。当专业人士能够检查证据并撤销变更时,他们更可能委托具有实际意义的工作。

Grok 4.6 为开发者提供了另一款可用于构建此类系统的能力型模型。它对知识工作的雄心意味着,评估不能止步于输出是否听起来正确。

三个信号将决定 Grok 4.6 能否兑现承诺

下一阶段取决于独立可靠性证据、生产环境采用情况和竞争对手的回应,而非又一次孤立的基准测试胜利。

第一个信号是重复的现实世界评测。开发者应关注独立测试者是否能以相同的模型设置和透明的执行框架复现 SpaceXAI 的结果。

这些证据应超越单一完成分数。具有参考价值的报告应包括重试次数、工具失败、干预率、处理时间,以及所需人工返工的数量。

一致的结果将强化 SpaceXAI 的模型优先论点。较高的方差则意味着,编排与监督仍决定着大部分实际结果。

第二个信号是其在 Cursor 和 Grok Build 中的生产环境表现。这两个环境让 Grok 4.6 接触到实质性的编程任务,而非受控演示。

Cursor 尤其重要,因为它可以在共同的产品环境中比较不同模型。这减少了由无关工具和界面造成的部分差异。

应关注是否有证据表明,Grok 4.6 能在不丢失原始目标的情况下完成更大的任务。合并接受率和生成后的修复情况,比生成代码量更具参考价值。

开发者还应检查该模型是否有效利用了长上下文。重复读取文件或出现相互矛盾的编辑,可能暴露出即使拥有较大上下文额度,其状态管理依然薄弱。

对于知识工作,采用信号会有所不同。企业将关注来源可追溯性、访问控制、审查负担,以及与现有信息系统的集成。

第三个信号是竞争对手如何回应。OpenAI 已将 GPT-5.6 Sol 与程序化工具调用和多智能体选项结合,用于处理复杂工作流。

Anthropic 和智能体平台开发者也在投入持久性、计算机操作和更长时间的执行能力。他们的回应可能会在可靠性、效率或编排方面向 SpaceXAI 施压。

竞争对手可能通过改进周边智能体系统,而不是发布得分更高的基础模型,来超越 Grok。这样的结果会削弱模型优先的解释。

SpaceXAI 可以通过提供更好的检查点、上下文管理和验证控制来回应,也可以对完整智能体系统提供更详细的评测。

关键比较应始终是任务结果,而不是品牌层面的基准测试总分。不同模型适合不同环境、风险水平和工作流结构。

评估 Grok 4.6 的团队应从范围受限但有实际意义的任务开始。任务应具备足够复杂度,以要求规划、工具使用和至少一个修订周期。

记录它在何处要求澄清、改变方向或声称完成,然后检查最终产物,以及产出它所经历的完整路径。

将同一任务重复多次。长期运行的智能体必须表现得足够一致,团队才能围绕它们设计可靠的审查流程。

Grok AI agent 值得关注,是因为 SpaceXAI 瞄准了正确的问题。专业价值取决于完成相互关联的工作,而不是赢得孤立的对话。

其已公布结果显示,Grok 4.6 在多项评测中相较 Grok 4.5 有显著提升。它们也清楚表明,竞争模型仍在一些领域领先。

下一个问题很实际:Grok 4.6 是否能在不增加隐性风险的前提下,减少产出可接受工作所需的监督?

开发者、企业采购方和知识工作者应使用自己的文档、代码仓库和审批标准来检验这一问题。答案将比任何单一排行榜位置都更重要。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page