top of page

NVIDIA NeMo Agent Toolkit 内存迁移至 Amazon S3 Vectors,但检索质量仍决定最终效果

6天前
讀畢需時 14 分鐘

随着 AWS 发布一项由三部分组成的实施方案,NVIDIA 获得了实现持久化智能体记忆的新路径:该方案采用 Amazon S3 Vectors 和 Amazon EKS。NVIDIA NeMo Agent Toolkit 的内存集成以托管向量存储取代专用向量数据库,让智能体能够跨会话共享记忆。

AWS 于 2026 年 10 月 1 日发布该实施方案。它将 NVIDIA 的开源智能体框架连接至自定义 S3 Vectors 提供程序,再将生成的工作流部署在 Kubernetes 上。其核心矛盾在于运维层面:团队获得了持久、轻量的基础设施存储,但仍需自行负责记忆选择、隔离、评估和删除策略。

这一区别很重要,因为持久化记忆正成为生产环境智能体应用状态的一部分。Redis、Zep、Mem0 及其他专业提供商提供了更丰富的面向记忆功能。AWS 的主张则是,当规模、一致性和 AWS 访问控制最为关键时,对象存储可以成为持久化检索层。

AWS 将 NVIDIA NeMo Agent Toolkit 内存转化为 S3 工作负载

这项发布将一种架构设想变为开发者可检查、部署和测试的具体实施方案。

这项 AWS 实施方案连接了三项产品。NVIDIA NeMo Agent Toolkit,即 NAT,用于编排和评估智能体。Amazon S3 Vectors 存储可搜索的记忆。Amazon EKS 则通过 Kubernetes 控制机制运行智能体服务。

NAT 是一个用于构建、分析、评估和优化智能体工作流的开源框架。它可与基于 LangChain、LlamaIndex、CrewAI、Strands Agents 或自定义代码的智能体实现协同工作。

其内存子系统可存储超出单次模型调用范围的信息。这些信息可包括对话历史、用户偏好、先前发现或程序性知识。当其他智能体需要上下文时,提供程序会检索相关条目。

该框架通过 MemoryEditor 接口提供三项基本操作:添加项目、搜索记忆和删除项目。每个项目可携带对话数据、标签、元数据、用户标识符以及记忆的文本表示。

这种抽象让开发者无需重新设计上层智能体即可添加后端。AWS 通过名为 s3vectors_memory 的自定义插件实现该接口,NAT 会通过其 YAML 配置发现该插件。

参考设计创建了一个向量存储桶和一个向量索引。向量存储桶是专为向量数据设计的 S3 资源,而索引用于组织嵌入向量以进行相似性搜索。

示例将维度设为 1,024,并采用余弦相似度。这些选择与 Amazon Titan Text Embeddings V2 相匹配,后者会将每段记忆转换为其语义含义的数值表示。

该提供程序通过 Amazon Bedrock 将文本发送给嵌入模型,随后将生成的向量与描述其来源和允许范围的元数据一同存储。

当智能体搜索记忆时,该提供程序会对查询进行嵌入,并调用 S3 Vectors 相似性 API。它会将返回的记录转换为 NAT MemoryItem 对象,再传回工作流。

该实施方案还会将智能体层面的限制转化为元数据过滤条件。这些条件可包括 agent_id、memory_type、ticker、team_id、user_id,以及记录是否共享。

这一过滤步骤比基础相似性搜索更重要。即使一段记忆在语义上相关,若它属于另一位客户、另一种智能体角色,或已过时的分析任务,它仍然是错误的。

AWS 将完整的记忆内容标记为不可过滤元数据。系统会随匹配向量返回该文本,但不会将内容本身计入可过滤元数据配额。

这与 AWS 针对大型参考字段的指导一致。开发者可将过滤条件保留给控制检索的紧凑字段,包括身份、时间、类别和所有权。

该示例已使用 NVIDIA NeMo Agent Toolkit 1.6 以及 Python 3.11 或 3.12 进行测试。它还假定已有 EKS 集群、Docker、kubectl、Bedrock 访问权限,以及 S3 Vectors 资源权限。

这份前提条件清单表明,该发布并非即插即用的连接器。它是一种面向已准备在 AWS 和 Kubernetes 内部运行智能体的团队的参考架构。

持久化记忆改变多智能体研究的运作方式

共享记忆使专业智能体能够复用先前工作,但也让检索到的上下文成为团队必须治理的一项依赖。

AWS 通过一套投资研究工作流展示了这一设计。三个专业智能体分别承担研究、分析和综合工作。

研究智能体收集市场信息、财报材料和新闻。分析智能体寻找量化模式。综合智能体将这些发现整合为报告。

没有持久化记忆时,每次运行都只能从有限的既有工作知识开始。智能体可能重复相同搜索、重新计算先前结果,或因临时上下文不同而得出不一致的结论。

持久化存储改变了这种行为。研究智能体可以保存一项观察结果,并附带其股票代码、记忆类型、来源上下文和共享状态。另一名获得授权的智能体随后可通过语义相似度和元数据过滤条件检索它。

语义检索按含义而非精确关键词进行搜索。因此,它可以将有关利润率下降的问题,与采用不同措辞的已存观察结果匹配起来。

这一方法也将记忆与特定模型的上下文窗口分离。上下文窗口是模型在单次请求中可处理的有限输入量。持久化记录在该请求结束后仍然可用。

这一架构并不意味着每条存储记录都应进入每个提示词。检索会先选择一小组候选项,通常称为 top-k 结果,然后智能体再决定如何使用它们。

AWS 示例将默认 top-k 值设为五。这是一个配置选择,而非普遍最优值。较小的结果集可以减少噪声,而较大的结果集可提升覆盖率,但会增加 token 消耗和可能的干扰。

NAT 的自动内存包装器能够捕获和检索信息,无需模型调用显式内存工具。这降低了提示词复杂度,但也将重要行为移入系统配置。

NVIDIA 内存接口为这类提供程序提供了契约。它并不决定哪些事实值得长期保留,或何时旧记忆已变得不安全。

对于构建智能体研究系统的团队而言,这形成了新的工程层。他们需要制定提取记忆、合并重复项、解决矛盾和删除陈旧主张的规则。

投资示例展示了三类有用的记忆。情景记忆记录先前运行中发生的事情。语义记忆存储事实或关系。程序性记忆保留有效的方法或操作序列。

这些类别可支持不同的保留策略。经验证的申报日期可能多年后仍有价值,而市场价格或突发新闻解读可能很快过期。

它们也可能需要不同的访问规则。分析方法可在团队中共享。用户的投资组合详情则应保持隔离,即便另一名用户的查询在语义上看起来相似。

正是在这里,NVIDIA NeMo Agent Toolkit 内存成为应用设计问题,而非存储功能。后端可以返回匹配记录,但应用程序决定该匹配是否仍然有效、已获授权且有用。

这一挑战类似于另一种规模下的个人知识管理。捕获更多信息并不会自动带来更好的回忆。系统必须保留来源信息,并在恰当时刻检索正确证据。

探索这一问题面向用户一侧的团队,可以将其与 个人知识库进行比较;在这里,所有权和上下文同样决定存储的信息是否有帮助。

AWS 的设计为智能体团队提供了可复用的存储基础。其真正价值将取决于叠加在这一基础之上的策略。

S3 Vectors 挑战专用向量数据库的默认选择

AWS 正将 S3 Vectors 定位为持久化记忆层,而不是对所有低延迟检索系统的全面替代。

NAT 已支持包括 Mem0、MemMachine、Redis 和 Zep 在内的内存提供程序。这些选项代表了不同的智能体记忆路径,从内存数据基础设施到围绕记忆提取与管理设计的服务。

S3 Vectors 集成提供了另一条路径。开发者可以保留 NAT 的编排接口,同时将嵌入向量置于无需配置专用向量服务器的存储中。

AWS 表示,S3 Vectors 提供强一致性写入。成功写入会立即可供检索,这在多个智能体通过同一索引协调时十分重要。

最终一致性会带来棘手的故障模式。一名智能体可能保存了一项重要发现,而另一名智能体在该记忆变得可见前就开始工作。

强一致性缩小了这种协调缺口。它并不保证智能体认同存储的结论,但确保它们能够检索到最新的成功写入。

规模是 AWS 论点的另一部分。文档中的 S3 Vectors 限制允许单个索引最多包含 20 亿个向量,一个向量存储桶最多可包含 10,000 个索引。

该服务支持从 1 到 4,096 的向量维度。每个向量最多可携带 40 KB 的总元数据,其中最多 2 KB 为可过滤元数据。

这些限制有利于存储大规模的紧凑嵌入向量和结构化属性。同时,它们也迫使团队谨慎设计元数据,而非为每个向量附加无限的应用状态。

S3 Vectors 提供余弦距离和欧氏距离指标。选定的指标和维度数量在创建索引后无法更改,因此迁移模型可能需要新建索引并重新嵌入。

这种不可变性值得关注。嵌入模型不断演进,其输出维度或推荐的距离计算方式可能不同。长期运行的智能体系统需要在第一个索引变得不可或缺前制定版本控制和迁移计划。

AWS 将查询延迟描述为:低频访问时低于一秒,更频繁访问时最低可达 100 毫秒。这一特征更适合持久化记忆检索,而非每一种实时交互。

对响应时限严格的语音助手可能仍需要更快的服务层或缓存。当模型推理已主导工作流时,异步研究智能体通常能够容忍额外一次低于一秒的查询。

AWS 还会在客户需要混合检索、聚合、分面搜索或更高查询速率等高级搜索功能时,引导其使用 OpenSearch。这一区分限制了任何有关 S3 Vectors 能取代更广泛向量数据库类别的说法。

因此,核心竞争对手是架构,而非企业。团队既可以运行功能更丰富的专用检索服务,也可以使用基于对象的托管向量存储,获得持久且低维护的记忆能力。

这并非赢家通吃的选择。成熟的系统可以将 S3 Vectors 作为持久记录,同时为高频访问或对延迟敏感的记忆增加更快的搜索层。

NAT 的提供商抽象优势在于编排层的可移植性。风险则在于,统一接口可能掩盖不同后端之间的重要差异。

search() 方法在代码中看似一致,但召回质量、过滤语义、索引行为、吞吐量和故障模式仍各不相同。开发者必须使用自己的数据衡量这些差异。

AWS 的公告给专业记忆供应商和向量数据库提供商带来压力,要求它们证明额外基础设施的合理性。它们需要表明,更丰富的提取、排序、可观测性或更低延迟能够带来更好的智能体成果。

与此同时,该集成也促使 AWS 用户证明,较低的运维开销并未掩盖检索上的妥协。只有当正确的记忆出现在智能体上下文中时,持久存储才有价值。

Amazon EKS 在提供控制能力的同时也保留了运维责任

EKS 让智能体层具备可扩展性和可治理性,但团队仍需负责 Kubernetes 身份与存储记忆之间的控制措施。

AWS 的参考架构将研究智能体部署为 Kubernetes 服务。其示例清单以两个副本启动,并为容器定义了 CPU 和内存请求。

水平 Pod 自动扩缩器可将部署缩减至一个副本,或扩展至 10 个。该示例将平均 CPU 利用率目标设为 70%。

每个副本均连接到同一个 S3 向量索引。这种设计将智能体执行与记忆存储解耦,因此 Pod 重启不会抹去此前的发现。

它也避免某个特定副本成为某段对话历史的所有者。任何获得授权的 Pod 都可以检索相同的已提交记忆。

该架构使用 IAM Roles for Service Accounts,通常称为 IRSA。该机制将 Kubernetes 服务账户与 AWS 身份关联,避免在容器镜像内使用长期凭证。

示例策略授予四项向量操作权限:写入、查询、获取和删除向量。其资源范围指向指定的记忆存储桶。

这一权限模型提供了有用的基线。生产系统仍需要在智能体承担不同职责或面对不同数据边界时设置独立角色。

综合智能体可能只需要读取权限。研究智能体可能能够添加记录,但没有批量删除权限。行政维护服务则可能通过独立角色处理过期和移除操作。

AWS 文档称,向量存储桶始终强制启用 Block Public Access。S3 Vectors 概览还支持针对存储桶和索引的 IAM 及组织级控制。

这些控制措施可以隔离基础设施资源,但不会自动执行向量元数据中编码的每一项应用层规则。

如果多个租户共用一个索引,缺少 user_id 或 team_id 过滤器可能会将无关记忆暴露给发起请求的工作流。相似度搜索会返回数学意义上接近的结果,但并不理解业务边界。

独立索引可以提供更严格的隔离。AWS 建议对查询始终局限于特定租户的多租户工作负载采用这一模式。

这一选择也带来了自身的管理权衡。更多索引可提升隔离性并分散查询负载,但也会增加配置、策略、迁移和监控工作。

团队还应审视吞吐量范围。AWS 记录显示,每个索引每秒最多可处理 1,000 个合计写入或删除请求。

该服务还允许每个索引每秒插入或删除最多 2,500 个向量。应用程序可在一次写入请求中批量处理最多 500 个向量。

对于读取操作,AWS 表示,一个索引每秒可支持数百个查询、获取或列出请求。超过服务速率可能会返回 TooManyRequestsException。

S3 向量指南建议批量写入、实施重试机制,并将合适的工作负载分配到多个索引。

这些边界不太可能限制小型研究团队。但当一个智能体平台为庞大客户群中的每次交互记录多条记忆时,它们就会变得重要。

自动扩缩 Kubernetes Pod 无法消除存储侧的请求限制。增加副本实际上可能提高并发查询量,并更快暴露限流问题。

因此,可观测性必须连接这两个层面。团队需要 NAT 提供的延迟、Token 和智能体轨迹指标,以及 EKS 健康状况和 S3 Vectors 限流或错误数据。

运维控制正是 AWS 在这一设计中使用 EKS 的原因,也是额外复杂性的来源。

选择这一路线的团队需要负责容器构建、集群升级、网络策略、自动扩缩行为和服务身份。无服务器智能体平台或托管记忆提供商可以免除其中一部分工作。

正确的比较不应只是托管存储与专用数据库之间的对比,而应考察整个系统,包括 Kubernetes 运维、嵌入调用、记忆策略、评估和事件响应。

NVIDIA NeMo Agent Toolkit 记忆设计中尚未得到证明的是检索质量

AWS 提供的是方向性预期,而非证明该记忆层能够改善智能体回答的基准测试结果。

文章提出使用同一数据集进行两次 NAT 评估运行。一次启用记忆,另一次则提供无记忆基线。

NAT 可以衡量准确性、事实依据性、Token 使用量和延迟。事实依据性评估回答是否遵循所提供的上下文,而轨迹评估则审视智能体操作序列。

AWS 预计,工作流复用既有上下文时,被召回的记忆能够提升事实依据性、减少重复工作并降低 Token 使用量。该公司也预计每次记忆查询都会增加一定延迟。

该公司明确将这些结果描述为方向性的,而非经过基准验证的结果。具体幅度取决于工作负载、检索预算、重复程度以及智能体之间的协作情况。

这一限定是评估 NVIDIA NeMo Agent Toolkit 记忆能力的核心。公告中没有任何已发布结果能证明普遍适用的准确率提升或 Token 减少。

当检索到的记录包含经过验证且相关的证据时,记忆可以改善智能体表现。当存储中含有错误结论或过时解读时,它也可能放大错误。

在多智能体工作流中,风险会进一步增长,因为一个智能体的输出可能成为另一个智能体的输入。一项薄弱主张在多个系统检索并转述后,可能获得虚假的可信度。

投资研究能清楚地说明这种风险。盈利数据可能被修订,业绩指引可能变化,市场数据也会迅速过时。

因此,一条记忆项目应包含的不只是股票代码和文本。有用的元数据可以包括来源身份、发布时间、观测时间、验证状态和过期规则。

检索还应区分原始证据与智能体生成的解读。被引用的申报文件与模型对该文件的摘要不应具有同等权威性。

删除是另一个尚未解决的问题。NAT 的提供商支持移除记录,而 S3 Vectors 也公开了删除操作。应用程序仍必须确定要删除哪些标识符,以及如何满足用户级删除请求。

当相同信息出现在合并记忆中时,这会变得更加困难。后续智能体可能将多条记录整合为具有不同向量键的新摘要。

安全测试必须覆盖基础设施访问之外的内容。攻击者可能植入旨在操纵后续智能体的文本,形成一种持久化的提示注入。

元数据过滤器能够减少跨用户暴露,但无法判断所存内容是否安全。系统需要在存储前进行验证,并控制检索到的文本如何进入模型提示词。

还存在排序问题。基础向量相似度能够识别语义接近的记录,但接近并不等同于真实、新鲜或权威。

生产级检索流水线可以根据时间、来源质量、任务相关性或额外模型对候选结果进行重排序。示例提供商有意保持该机制简单。

这种简单性让代码易于理解。但它也意味着读者应将其视为基础,而非完成的记忆治理系统。

评估需要对抗性案例,而不仅是平均任务得分。团队应测试相互矛盾的记忆、已删除用户、过时数据、格式错误的元数据、被限流的查询以及不可用的嵌入端点。

他们还应将 S3 提供商与 NAT 现有的记忆后端进行比较。无记忆基线能够揭示持久化是否有帮助,但无法说明 S3 Vectors 是否是最佳持久化选择。

最有价值的实验应在多个提供商之间保持提示词、模型和数据集不变,随后报告检索召回率、回答质量、延迟分布、Token 消耗和运维故障率。

在这些证据出现之前,AWS 展示的是可行性而非优越性。该集成证明 NAT 可通过其提供商契约使用 S3 Vectors。

它并未证明每种智能体工作负载都能从持久记忆中受益,也未证明对于每种访问模式,基于对象的向量存储都优于专业服务系统。

三个信号将表明由 S3 支撑的智能体记忆能否经受考验

下一项考验在于,开发者能否将可运行的参考架构转化为可衡量、可治理的生产级记忆。

首先,应关注可复现的记忆质量评估。团队应使用相同任务、模型和提示词,发布启用记忆与不使用记忆运行之间的对比。

这些结果不能只包含平均准确率,还应包括检索精度、过时记忆故障、p95 延迟、Token 变化和智能体重复工作率。

持续收益的证据将强化 AWS 关于持久共享记忆改善多智能体协作的主张。结果参差不齐则会表明,记忆选择比存储后端更重要。

其次,应关注 NVIDIA 和 AWS 如何发展提供商体验。当前模式需要自定义插件代码、Bedrock 嵌入调用、元数据设计、YAML 配置、容器打包、IAM 和 EKS 部署。

由官方维护的集成、可复用的软件包或经过测试的部署模板将降低采用阻力。当团队更换嵌入模型或索引架构时,更好的迁移支持也会有所帮助。

当前索引配置在创建时便固定了维度和距离度量。生产用户需要有文档说明的版本控制、双写、回填和切换模式。

第三,应关注生产团队如何划分和治理记忆。决定性信号将是,它们选择使用带元数据过滤器的共享索引,还是采用独立索引以实现更强的租户隔离。

真实部署应揭示关于保留、删除、溯源和有毒记忆检测的实用策略。它们还应表明,在并发智能体流量下,S3 Vectors 是否能维持在可接受的延迟范围内。

AWS 的参考实现为将持久化智能体记忆迁移至托管向量存储提供了可信论据。它为开发者提供了明确的插件边界、部署模型和评估起点。

其更深层的含义是,记忆正从智能体框架本身中分离出来。编排可以继续保留在 NVIDIA NeMo Agent Toolkit 中,而状态则存储在一个独立治理的服务内。

这种分离可以让系统更易于扩展和替换。但当团队默认检索到语义相似的记录就等同于正确记忆时,也可能形成隐性依赖。

正在评估 NVIDIA NeMo Agent Toolkit 记忆功能的开发者,应从一个边界明确的工作流和带标签的测试集开始。将其与无记忆方案以及至少一家替代供应商进行比较。

随后,在扩大访问范围之前,测试隔离性、删除操作、陈旧记录和对抗性内容。如果这些检查均告通过,S3 Vectors 的意义将不止于低成本持久化。它将成为在不同会话和副本之间运行的智能体可信的共享记忆层。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page