Datadog AI 自动化瞄准风险,但企业仍掌握控制权
- Sophie Larsen

- 24小时前
- 讀畢需時 14 分鐘
尽管企业仍不愿让软件在关键系统中独立行动,Datadog AI 自动化正逐步超越仪表板。该公司如今将可观测性、安全和自动化修复视为应对不断上升的运营风险的一体化方案。这一主张对澳大利亚尤为相关:当地大型组织通常需要同时管理云服务、传统基础设施和外包运营。
这一转变改变了 Datadog 的角色。传统上,可观测性帮助工程师理解应用变慢、故障或触发告警后究竟发生了什么。如今,Datadog 希望其软件能够利用实时运营上下文调查事件、推荐应对措施,并执行获批准的操作。
关键矛盾不在于人工智能能否总结一条告警,而在于企业是否会在保持问责、安全与人工监督的前提下,信任拥有生产环境访问权限的 AI 代理。Splunk、Dynatrace、云服务提供商和安全厂商都在争夺类似机会,因此 Datadog 必须证明,统一上下文能够带来更安全的自动化。
Datadog AI 自动化从答案走向行动
Datadog 正将其监控平台转变为面向企业 AI 代理的受控运营层。
该公司的扩展建立在可观测性数据、安全信号、工作流自动化和生成式 AI 的结合之上。可观测性是指收集并关联有关应用、基础设施、网络、用户体验及其他技术系统的信息。
Datadog 澳大利亚和新西兰区域副总裁 Roz Gregory 将这种融合描述为管理成本、AI 安全和合规的机会。在一次 ANZ 企业访谈中,她认为,碎片化的技术栈使这些优先事项更难通过彼此独立的工具来解决。
Gregory 表示,Datadog 已从两款产品扩展至 30 多款。其平台如今覆盖基础设施、应用、软件交付、数字体验、数据、安全和 AI 工作负载。
这种广度很重要,因为自动化事件处理需要上下文。代理无法仅凭一个孤立指标,就安全地诊断结账失败问题。它需要应用追踪、基础设施健康状况、近期部署、安全事件、数据库行为以及面向客户的性能数据。
Bits AI 是 Datadog 面向开发、安全和运营任务的代理系列。Datadog 表示,这些代理可以调查事件、分析相关遥测数据,并帮助团队在既定控制范围内采取行动。
该公司在 2026 年 6 月的 DASH 大会上进一步拓展了这一战略。其 100 多项产品发布包括新的 Bits AI 功能、代理构建器、AI 安全控制,以及更多企业数据管理选项。
Bits Agent Builder 让团队能够在 Datadog 内创建专用代理。这些代理可在客户设定的边界内支持修复、报告和标准执行。
Agent Console 则解决了相关的管理问题。Datadog 表示,它可帮助组织观察 Claude Code、Cursor 和 GitHub Copilot 等工具。管理者能够查看使用情况、任务、结果和支出,而非将代理活动视为不可见的一层。
Datadog 还在 2026 年 3 月正式全面推出其 Model Context Protocol 服务器。MCP 是一种标准接口,可让 AI 应用访问获批准的工具和数据源。
这项 受治理的代理访问将外部编程代理和开发环境与实时 Datadog 遥测数据连接起来。该公司将这种连接定位为:在将运营证据引入 AI 辅助工作流程的同时,保留权限控制和治理能力。
这一架构构成了本文的核心矛盾。同样能够帮助代理诊断生产问题的访问权限,也可能放大错误或遭操纵操作带来的后果。
读取监控数据的代理代表一种风险等级;修改检测规则、创建工单、压制发现结果或启动修复的代理,则代表另一种风险等级。
因此,Datadog 销售的不只是更快的事件响应。它还提出了一项主张:当 AI 通过统一的技术上下文来源和既有控制机制运行时,自动化便可被接受。
这一主张如今必须经受采购审查、安全测试和真实生产故障的考验。
澳大利亚的混合系统提高了风险门槛
澳大利亚企业并非在一套纯净的技术基础上采用自动化。
许多大型组织仍在运行传统基础设施,同时增加公有云服务、软件即服务应用和 AI 系统。外包协议又增加了一层责任与访问控制。
这种环境造成了证据碎片化。一次事件可能跨越应用代码、云基础设施、身份系统、外部提供商,以及物理或虚拟网络。
团队往往针对这条路径的每个部分使用不同产品。这些产品可能生成相互重叠的告警,却无法共享足够的上下文来确定根因和业务影响。
Gregory 认为,工具繁多的环境会使 AI 安全和复杂性更难管理。她的立场支持 Datadog 的商业方向,但企业仍会检验整合究竟能降低风险,还是只会将风险集中起来。
眼前的压力落在技术运营、安全团队和风险负责人身上。他们必须在不失去对数据、凭据、合规证据或生产变更控制权的情况下,支持更快的软件交付。
开发人员同样面临压力。编程代理可以更快地生成和修改软件,但这种速度也增加了进入审查、测试和部署系统的变更量。
安全团队必须区分可被利用的问题和优先级较低的发现。运营团队则必须判断故障究竟来自代码、基础设施、容量、数据,还是 AI 模型提供商。
Datadog 自身的研究说明了这一运营问题。其 AI 工程数据发现,约 5% 的 AI 模型请求在生产环境中失败。
该公司称,其中近 60% 的失败源于容量限制。Datadog 分析了数千家在生产环境中运行大语言模型的客户所提供的匿名使用数据。
报告还发现,69% 的组织使用至少三种模型。代理框架的采用率同比翻倍,而每次请求发送的数据平均量也有所增加。
这些发现来自 Datadog 的客户环境,因此不应被视为涵盖所有企业的普查数据。不过,它们仍描述了 Datadog 希望通过其平台管理的那类复杂性。
多模型意味着更多的路由决策、故障模式、使用限制和供应商依赖。代理则增加了这样的工作流:其下一步行动可能取决于模型输出,而非确定性的应用逻辑。
澳大利亚的治理环境又提出了一项要求。联邦政府的 AI 采用指南呼吁建立问责制、风险管理、数据治理、测试、监控以及有实质意义的人工监督。
该指南由澳大利亚自愿 AI 安全标准演变而来。它本身并不创设新的法律义务,但有助于组织为当前义务和未来可能出现的要求做好准备。
多项实践与可观测性高度契合。组织应监控已部署的 AI 系统、记录风险、重新评估控制措施,并跟踪行为或预期用途的变化。
不过,收集遥测数据并不自动满足这些责任。仪表板无法决定组织的风险承受度、识别受影响的利益相关方,或为有害结果分配责任。
这一区别对 Datadog 的主张至关重要。该平台可以提供运营证据、访问控制和技术监控;企业领导者仍必须界定代理可执行哪些操作,以及由谁对结果负责。
因此,澳大利亚市场既带来机会,也构成严峻考验。混合环境催生了对统一可见性的需求,但监管和机构层面的谨慎限制了客户允许自主行动的速度。
统一上下文是 Datadog 的核心押注
Datadog 押注:拥有更广泛遥测数据的代理,能够比困在单一专用工具中的助手更安全地行动。
运营代理需要从散布在技术栈各处的证据中重建根因。Datadog 的平台已为监控和故障排查收集了其中大部分证据。
该公司可以向代理提供应用追踪、日志、基础设施指标、部署事件、云安全发现和组织知识的访问权限。Datadog 表示,这些上下文能帮助 Bits AI 关联原本需要人工调查的信号。
Winning Group 提供了一个具体案例。这家澳大利亚零售商拥有 Winning Appliances 和 Appliances Online,后者的网站是主要面向客户的线上门店。
技术经理 Nick Rivett 表示,公司采用 Datadog 的部分原因是希望让工程团队以外的人员也能获得性能信息。共享仪表板使更多员工能够查看变化,而无需等待工程师解释每一项指标。
Winning Group 还使用了 Bits AI 和 Datadog 的 MCP 功能。Rivett 描述了一起事件:人工团队调查了数小时后,Bits AI 在约 10 分钟内关联起相关证据。
这一说法来自客户报告,而非独立基准测试。尽管如此,它仍展示了 Datadog AI 自动化能够在不立即赋予代理无限权限的情况下创造价值的场景。
更快的调查缩短了告警出现到形成可信解释之间的时间。随后,人类可以审查证据并选择应对措施。
Flowstate 展现了另一种运营场景。这家澳大利亚公司为冲浪者录制视频并进行处理,使客户能在一次冲浪结束后不久收到影像。
停机会直接影响产品,因为错过的录制时间可能意味着客户影像丢失。Flowstate 使用 Datadog 监控其实时视频基础设施,并识别性能瓶颈。
随着视频从每秒 30 帧的 4K,升级至每秒 60 帧的 4K,再到每秒 60 帧的 6K,其处理需求不断增加。每次升级都会增加数据量和处理压力。
这一案例说明了关联遥测数据为何重要。性能问题可能源于摄像头、网络、计算资源、存储、应用代码或处理服务。
只查看应用日志的代理看到的是一个不完整的系统。Datadog 的优势取决于其平台能否关联该系统中足够多的部分,以识别有用关系,同时避免制造误导性的确定感。
该公司的商业增长势头为其推进这一战略提供了资源。Datadog 报告称,2026 年第二季度营收为 11.2 亿美元,同比增长 36%。
其第二季度业绩显示,约有 4,720 家客户的年度经常性收入至少达到 10 万美元。这一数字较一年前的约 3,850 家有所增加。
Datadog 还报告称,该季度经营现金流为 3.16 亿美元,自由现金流为 2.79 亿美元。截至 6 月末,公司持有 50 亿美元的现金、现金等价物和有价证券。
这些数字并不能证明客户已接受自主运维。它们表明,Datadog 拥有可观的企业客户基础,以及在成熟平台上扩展 AI 功能的财务能力。
这种分发优势很重要。企业可能更愿意采用附着于现有监控系统的自动化能力,而不是引入另一套拥有独立权限和数据管道的代理。
平台关系也会形成迁移压力。客户在一个系统中保留的运维历史、工作流、仪表盘和安全控制越多,该系统就越难被替换。
Datadog 必须在这一优势与整合带来的担忧之间取得平衡。统一平台可以减少集成工作,但一次故障、配置错误或安全事件也可能产生更广泛的影响。
因此,其机制很直接,尽管执行起来并不容易。Datadog 收集上下文,将这些上下文提供给受控代理,并利用自动化缩短调查和响应时间。
其成功取决于上下文质量、权限设计,以及诊断后所采取每项行动的可靠性。
自动化带来了新的控制难题
最大的障碍并不在于 Bits AI 能否找到事件原因,而在于当其分析出错时,企业能否约束该代理。
传统监控工具会向人发出告警。自主系统还可以发起行动,因此错误结论或遭篡改指令可能带来更大的影响。
错误的摘要只会浪费时间。错误的基础设施变更则可能中断服务、削弱安全控制,或抹除后续调查所需的证据。
提示词注入带来了另一种风险。提示词注入是指隐藏或恶意指令操纵 AI 系统,使其无视原定规则。
Datadog 推出了 AI Guard,用于检测代理活动中的可疑行为。该公司称,它结合了代理追踪和有状态行为分析,后者会考察多个步骤中的行为,而非只审查单次提示词与响应。
这一差别具有现实意义,因为针对代理的攻击可能会随着时间推移逐步展开。看似无害的输入,可能导致代理获取敏感信息、调用外部服务,或在数个步骤之后采取未经授权的行动。
在客户和独立研究人员于多样化的生产环境中进行测试之前,Datadog 对 AI Guard 的说法仍只是公司自身的说法。任何行为检测器都无法保证识别出每一条有害指令。
因此,权限边界至关重要。代理应仅获得完成特定任务所需的访问权限,敏感操作则应要求额外审批。
企业还需要完整记录代理观察到的内容、作出的推断以及实施的变更。没有这条追踪记录,团队就无法重构故障过程或厘清责任。
人工监督不能只是把一个形式上的批准按钮放在不透明流程的末端。审核人员需要足够的上下文,才能理解拟议行动及其可能产生的影响。
自动化速度可能会与这一要求相冲突。如果代理生成数百条建议,人们可能机械式地批准,从而在缺乏实质性审查的情况下制造出受控的表象。
Datadog 还必须管理其自身广泛集成带来的风险。一个连接生产遥测数据、安全发现、开发者工具和修复工作流的平台,会成为颇具吸引力的攻击目标。
公司可以通过身份验证、授权、审计日志、数据控制和工作负载隔离来降低这一风险。客户则必须正确配置这些控制措施,并在团队和系统变化时持续维护。
数据驻留是受监管组织面临的另一项担忧。Datadog 的 Bring Your Own Cloud 选项通过将部分平台部署在客户控制的环境中,并使用客户的对象存储来应对这一问题。
这种设计可以帮助企业对不断增长的日志量保留更多控制权。但它无法消除涉及元数据、支持访问、配置或关联服务的所有治理问题。
成本同样可能减缓采用速度。可观测性系统处理大量遥测数据,而 AI 工作负载还可能生成新的日志、追踪数据、提示词、响应和代理事件。
客户必须决定保留、索引、分析或丢弃哪些数据。过度过滤可能隐藏代理所需的证据,而不加区分地收集则可能推高成本并暴露敏感数据。
此外还存在衡量问题。更快的调查不一定意味着更安全的运维,更多自动化行动也不一定带来更好的业务结果。
可信的部署应跟踪事件持续时间、复发情况、错误建议、已回滚行动、审批率和安全例外。它还应区分由代理解决的事件,与代理反而增加混乱的事件。
Datadog 的 Agent Console 为编码代理指向了这类评估方式。企业将在每一项自动化运维工作流中都需要保持类似的严谨性。
该公司的战略仍然很有前景,因为它将 AI 与真实系统证据相连接。尚未解决的问题是,这种连接究竟会带来可靠判断,还是仅仅带来更快的活动。
Datadog 面临拥挤的平台竞争
Datadog 的真正对手是碎片化的企业工具体系,但竞争平台也在提出相同的整合主张。
多年来,组织一直在组装专门的监控、安全、工单、云管理和开发者产品。Datadog 希望在同一数据与自动化层中连接更多这类功能。
这一主张给那些只覆盖事件某一环节的既有工具带来压力,也给维护告警、调查和修复系统之间定制集成的工程团队带来压力。
不过,Datadog 并不独占统一可观测性或 AI 辅助运维的主张。Dynatrace、Splunk、New Relic、ServiceNow、Microsoft、Google Cloud 和 Amazon Web Services 都在将 AI 与运维数据相连接。
云服务提供商在自身环境中拥有结构性优势。它们可以将代理与基础设施控制、身份服务、安全产品和计费数据相连接。
服务管理厂商掌握审批流程、工单、资产清单和企业工作流。安全厂商则拥有专业的威胁信息和响应能力。
Datadog 的防御优势在于其跨混合环境的中立性。大型组织很少只运行一种云、一种编程语言或一种安全产品。
广泛集成的可观测性层可以跨越这些边界比较行为。Datadog 还可以利用应用和基础设施遥测数据,将技术故障与客户体验联系起来。
然而,中立性也有局限。每个外部系统都会引入集成边界、权限模型和潜在延迟。云服务提供商可能能够访问原生信息,而独立平台只能通过 API 获取这些信息。
MCP 等开放标准可以降低集成摩擦,也可以让客户更容易地用相同工具连接竞争代理。
这意味着 Datadog 必须在上下文质量、推理能力、控制机制和用户体验方面竞争。仅仅支持 MCP 并不能维持持久优势。
该公司还必须证明,其不断扩大的产品范围确实具有统一体验。只有当团队能够在组合平台中顺畅操作、而不会制造另一层复杂性时,减少供应商数量才有帮助。
企业采购方将考察告警是否共享一致的数据模型、权限是否能跨产品协作,以及自动化行动是否保留可审计性。他们还会考虑数据消耗将如何影响合同承诺。
安全负责人可能更倾向于在高风险调查中使用专业产品。运维团队则可能偏好 Datadog,因为它已包含诊断应用故障所需的遥测数据。
这些偏好可能带来渐进式采用。客户可能先从 AI 生成的摘要开始,然后允许创建工单、进行低风险修复,最后才授予更具影响力的行动权限。
这一渐进过程挑战了自主运维会突然到来的观点。企业采用更可能遵循一条信任阶梯。
每一次成功行动都可能为更广泛的权限提供依据。每一次错误诊断或意外变更,都可能使项目退回到仅建议模式。
Datadog 的机会在于让这条阶梯可衡量。采购方需要证据来判断代理何时值得获得更多权限,以及何时应继续限制其访问范围。
这场竞争的胜者未必拥有最自主的演示。它将提供一条从有用辅助到可追责行动的最清晰路径。
企业接下来应关注什么
三个信号将显示 Datadog 能否将其自动化战略转化为值得信赖的企业运维。
第一个信号是生产环境权限的扩展。Datadog 已在其部分安全工具集中,将 MCP 能力从只读访问进一步扩展。
重要的问题是客户如何使用这些能力。创建工单和生成建议,与更改规则、进行抑制处理或自动化修复所承担的风险不同。
可重复的生产部署证据将强化 Datadog 的论点。这些部署应包括权限边界、审批要求、审计记录和已记录的回滚流程。
少数引人注目的事件案例并不足够。采购方需要汇总证据,涵盖不同环境下的错误行动、升级率、节省时间和结果。
第二个信号是其更大客户群中的采用情况。该公司拥有 4,720 家年度经常性收入至少为 10 万美元的客户,这构成了重要的分发渠道。
未来财务报告或许会显示,AI 功能是否提高了现有客户所使用产品的数量。管理层评论也可能显示,Bits AI 和 Agent Builder 是否支持新的企业承诺。
仅靠营收增长无法回答这个问题。Datadog 销售多种产品,客户即使不授予代理更广泛的运维权限,也可能增加支出。
更有力的信号应将商业扩张与披露的使用情况结合起来。Datadog 可以报告有多少客户在生产环境中运行 Bits AI、代理执行哪些操作,以及在哪些场景下人工审批仍属强制要求。
有限的披露会使采购方依赖经过挑选的客户案例。透明的运营指标将使公司的主张更易于评估。
第三个信号是监管机构和企业治理团队的反应。澳大利亚的指导意见强调持续风险评估、测试、监控、问责和人工控制。
采购流程将把这些原则转化为技术问题。采购方将询问 Datadog 如何处理访问权限、敏感数据、模型变更、第三方组件、事件记录和代理行为。
针对高风险 AI 的新强制要求将提高对证据与监控的需求。如果 Datadog 及其客户无法将代理活动映射到具体控制措施,这些要求也可能拖慢部署进程。
在这一信号中,竞争对手的反应同样重要。竞争平台将展示各自在治理、数据驻留和自主运营方面的方法。
如果竞品提供更清晰的控制模型,Datadog 的广泛遥测优势将不再那么重要。如果它们依然割裂,Datadog 的统一策略就会更具吸引力。
企业团队不应将自主性视为非此即彼的决策。它们可以按影响程度对操作分类,在受限环境中测试代理,并且只在性能表现支持时才扩大其权限。
它们还应保留人类可读的记录。AI 知识库可以帮助团队留存决策、事故背景与运营经验,但它不能替代技术审计日志。
Datadog AI 自动化归根结底是一个披着产品扩张外衣的治理故事。根据客户说法,这项技术可以将数小时的调查压缩至几分钟。
更困难的任务在于证明:当代理误解系统、遇到被操纵的数据,或超出其预期职责范围时,更快的行动依然安全。
Datadog 拥有平台覆盖能力、企业客户和财务资源,可大规模验证这一命题。企业如今应在以可见性换取自主性之前,要求获得可量化的证据。
贵组织今天会信任代理执行哪些运营操作?又需要哪些证据,才会有理由授予它更高一级的访问权限?


