top of page

Elvis Saravia 的任务优先 AI 智能体挑战以提示词作为默认界面

Elvis Saravia 提出了一种明确的界面转变:用完整的多模态任务包取代孤立的提示词。他的任务优先提案在 AI 智能体开始工作之前,将语音、屏幕、文本和标注结合起来。

这听起来只是输入设计上的一个小变化。实际上,它是在挑战自 ChatGPT 问世以来一直定义着生成式 AI 的聊天框。Elvis Saravia 任务优先 AI 智能体背后的核心理念是,用户应当一次性使用所有相关信号来描述一项工作。

据报道,这种方法的灵感来自 Andrej Karpathy 将长时间语音对话用作丰富提示词的做法。Saravia 则进一步扩展了这一概念,将语音视为结构化任务的一个组成部分,而不是整个界面。

它所挑战的是传统的“提示词—修正”循环。目前,用户会提交不完整的指令,检查不理想的结果,补充缺失的上下文,然后重复这一过程。任务优先界面试图将这些澄清工作提前到一开始。

目前,这项提案仍是一种观点,而不是经过独立评估的产品发布。尚无公开基准能够证实它究竟能节省多少时间、哪些模型最适合支持它,以及额外上下文导致新错误的频率。

尽管如此,其提出时机仍然意义重大。如今,AI 智能体已经能够操作软件、调用工具、查看屏幕,并维持更长时间的工作会话。它们最薄弱的环节日益集中在用户意图与为执行任务而组装的上下文之间。

从提示词到任务:Saravia 提出了什么

真正有意义的变化并不是更长的提示词,而是一种用于传达意图的新容器。

传统提示词通常以文本形式输入模型,即使用户的真实目标依赖多个应用程序、文件和此前的决策。用户必须将这一环境转化为文字。

Saravia 的提案扭转了这种负担。界面应当捕捉周围的相关证据,并在执行开始前将其作为一个任务包统一提交。

这个任务包可以包括口头说明、选中的文本、当前屏幕、视觉标注、文档,以及对完成标准的明确界定。每一种输入都传达用户意图的不同部分。

语音能够承载人们在打字时可能省略的叙述性细节。屏幕展示正在讨论的对象。高亮或标注则指出需要关注的确切区域。

文本对于精确要求、名称、日期、公式和限制条件仍然很有用。附加材料则提供智能体应当查阅而不是猜测的证据。

以一位正在准备每周更新的产品经理为例。文本提示词可能会写道:“总结项目并找出风险。”这条指令会迫使智能体追问是哪个项目、哪个时间段,以及哪些风险最重要。

任务优先界面可以将当前路线图、一张高亮显示的分析图表、对某项延迟集成的口头说明,以及最近一次评审的笔记打包在一起。它还可以指定预期的输出格式。

智能体由此获得更接近产品经理真实思维模型的信息。它无需经过多轮交互,才能发现产品经理原本就已掌握的信息。

这种方法将任务与消息区分开来。消息是对话中的一次表达,而任务则是对预期成果及其支持上下文的有组织呈现。

当系统能够采取实际行动时,这一区别就变得十分重要。写作助手可以通过重新起草来弥补歧义,而编辑文件或更新软件的智能体可能会将歧义转化为操作错误。

该提案也将界面设计纳入智能体技术栈。模型质量仍然重要,但由应用程序决定哪些信号能够传递给模型,以及如何组织这些信号。

这与从提示词工程转向上下文工程的整体趋势一致。Anthropic 将上下文工程定义为对模型推理期间可用信息的筛选与组织。

按照这一定义,提示词只是其中一种输入。工具描述、检索到的文档、消息历史、当前状态和外部数据都在争夺有限的注意力。

Elvis Saravia 的任务优先 AI 智能体将这一原则应用于用户界面。前端负责在模型开始推理循环之前收集有用的上下文。

这正是该提案的真正意义所在。它将沟通质量视为一个系统问题,而不是一场写出完美句子的竞赛。

为什么 AI 智能体的效率如今取决于上下文

智能体越来越多的失败并不是因为缺少另一条巧妙的指令,而是因为它们接收到的任务描述并不完整。

当模型主要用于回答问题或生成范围明确的文本时,聊天界面表现良好。用户可以检查每一条回复,然后再决定下一步做什么。

智能体的运作方式有所不同。它们会规划多个步骤、使用工具、修改状态,并根据中间结果作出反应。因此,早期的歧义可能会在整个任务序列中持续扩散。

假设一个智能体必须将客户反馈与产品路线图进行核对。它需要相关反馈、路线图版本、公司优先事项、职责边界,以及对“可执行发现”的定义。

简短的提示词很少会包含这五项内容。因此,用户实际上成了上下文的搬运工,需要在不同应用程序之间传递信息,并在智能体按照非预期理解执行时不断纠正它。

这种反复修正存在隐性成本。每次澄清都会消耗用户的注意力、增加对话长度,并带来另一次指令相互矛盾的可能性。

更大的上下文窗口并不会自动解决这个问题。容量衡量的是模型能够接收多少信息,而不是应用程序是否选择了正确的信息。

Anthropic 的上下文指南将上下文描述为有限资源,并强调应当选择高价值 token。这一警告直接适用于多模态任务,因为图像、转录文本和工具输出可能会占用大量容量。

因此,新兴的界面挑战在于选择性完整。智能体需要足够的上下文来理解任务,但并不需要用户工作区中的每一项可用资料。

有关屏幕感知辅助的研究支持了其底层机制。早期的一项屏幕上下文研究表明,视觉界面信息可以消除口头表达中对屏幕对象指代的歧义。

这项研究早于当前的生成式智能体,但其交互问题依然令人熟悉。当系统能够看到与用户相同的屏幕时,“把这个部分移到那张图表下方”就变得可以理解。

更新的证据则凸显了更广泛的意图识别仍然有多困难。Google 的 GUIDE 基准使用了 120 名新手用户在 10 个复杂应用程序中操作时产生的 67.5 小时屏幕录像。

在八个多模态模型中,报告的最佳结果在行为状态检测方面仅达到 44.6%,在帮助预测方面达到 55.0%。提供结构化用户上下文后,帮助预测能力最多提升了 50.2%。

这些结果并不能直接验证 Saravia 的提案。GUIDE 评估的是界面工作流中的辅助能力,而不是社交媒体帖子中描述的具体任务包。

但该基准确实支持一个更有限的结论:当模型获得关于用户行为和意图的明确信息时,其表现会有所改善,但它们仍难以可靠地推断这些细节。

这给每一家开发计算机操作智能体的公司都带来了压力。OpenAI、Anthropic、Google、Microsoft 和独立开发者可以改进模型,但他们也需要更好的用户意图捕捉方式。

这种压力对工作场所智能体尤为迫切。它们必须在创建于不同时间的会议、文档、消息、仪表盘和决策之间开展工作。

有用的任务界面必须连接这些信息源,同时避免迫使用户手动重建全部历史记录。个人知识库可以帮助检索过去的材料,但检索仍然需要任务层面的指引。

这就是为什么任务优先设计不仅仅是一项语音功能。它试图让上下文组装成为工作委派过程中一个可见、可管理的环节。

Elvis Saravia 的任务优先 AI 智能体向修正循环发起挑战

只有当更充分的准备所消除的工作量大于它新增的工作量时,这项提案才能胜出。

传统的智能体工作流启动得很快。用户输入一条指令,收到输出,然后才发现智能体误解了什么。

这种较低的初始投入解释了提示词为何如此持久。它通用、熟悉且易于实现,同时也能高效处理简单请求。

其弱点会在复杂工作中显现出来。用户通常只有在看到错误输出后才会补充要求,因为第一次结果暴露出了他们此前没有明确表达的假设。

这就形成了一个修正循环:智能体生成结果,用户诊断问题并补充上下文,然后智能体再次尝试。

Saravia 的任务优先模型将这种诊断工作提前。界面会在生成第一个结果之前收集多种类型的上下文。

这种机制类似于同事之间的任务简报。管理者不会只对分析师说“检查这些数字”。管理者会指出相关仪表盘、解释需要做出的决策,并明确存在争议的假设。

多模态捕捉可以压缩这一简报过程。用户可以在浏览文档时进行口头说明,高亮两段相互矛盾的内容,并附上最初作出该项决定的会议记录。

仅有转录文本会失去口头表述与屏幕对象之间的联系。仅有屏幕截图则会遗漏用户的推理。结合多种输入可以同时保留两者。

标注则增加了另一层定位信息。图表周围的方框、两个部分之间的箭头,或被划掉的段落,都能表达难以用语言描述的空间关系。

这改变了首次尝试的成本结构。用户需要投入更多精力来构建任务,但智能体也更有可能返回可用的结果。

这种效率主张仍需谨慎衡量。更长的设置过程并不一定更好,尤其是在任务很小或很容易撤销的情况下。

查询一个定义仍应使用提示词。重命名一个文件仍应是一条直接命令。当误解的成本高于组装上下文的成本时,任务打包才会体现价值。

这种方法还取决于界面如何处理同步。语音、指针移动、屏幕变化和标注需要时间戳或其他共享的参照结构。

如果缺乏对齐,“使用这个数字”仍然可能含义不明。系统必须知道用户说出“这个”时,屏幕上显示的是哪个区域。

成熟的实现方式可能会将原始信号转换为结构化任务记录。该记录可以包含目标、相关资料、限制条件、权限、预期输出和完成标准。

随后,模型接收到的是经过筛选和组织的内容,而不是未经区分的完整记录。这一区别十分重要,因为原始多模态数据包含噪声、重复信息和私人信息。

同一份记录也能提升可观测性。用户和开发者可以检查智能体在采取行动前接收了哪些上下文。

这一检查层将使故障更易诊断。团队可以区分上下文缺失、推理错误、工具使用不当或外部系统不可靠等不同问题。

它还可以支持复用。一个结构良好的任务可以转化为每周报告、客户研究、文档审阅或工程问题分流的可重复工作流。

然而,可复用任务不应变成附带更多附件的僵化提示词模板。它们的优势在于保留特定工作的相关状态。

对于知识工作者而言,这意味着一种实用的分工。持久化系统保存文档、笔记、会议和先前的决策,而任务界面则选择当前所需的子集。

knowledge blending 之类的工具围绕明确目标整合个人信息源时,它便符合这一模式。任务仍然需要边界、权限和明确要求的结果。

OpenAI 的计算机操作智能体提供了一个有益的对照。它的 computer-use model 会处理屏幕截图、推理下一步操作,并通过虚拟鼠标和键盘执行行动。

OpenAI 报告称,该模型在 OSWorld 上的成功率为 38.1%,而人类为 72.4%。它在 WebArena 上的结果达到 58.1%,在 WebVoyager 上则达到 87.0%。

这些数据来自 OpenAI 自己的评估,并反映了不同的环境。不应将其视为衡量任务优先界面的直接指标。

这些数据确实揭示了令人印象深刻的演示与可靠工作之间的差距。智能体可以理解屏幕并采取行动,却仍然无法完成许多完整任务。

更完善的初始上下文可以减少一种故障来源。它无法弥补薄弱的视觉感知、不稳定的网站、糟糕的规划或执行过程中的错误操作。

因此,纠正循环不会消失。更现实的目标是减少由初始意图缺失造成的、原本可以避免的纠正。

更多上下文也会带来更多失败方式

多模态任务可以澄清意图,但也可能放大噪声、隐私暴露和错误的信心。

第一个风险是上下文过载。一段屏幕录制、一段冗长的语音说明、若干文档和标注,可能包含远超任务所需的信息。

模型不会平等对待每个词元或视觉细节。当重要约束被重复对话或无关屏幕内容包围时,其显著性可能会降低。

智能体可能会关注高亮显示的图表,却忽略口头提到的截止日期。它也可能检索到一个旧决定,因为包含该决定的文档与当前计划相比具有更强的文本匹配度。

因此,任务优先系统需要确定优先级。用户应当能够区分强制性指令、背景材料和可选参考信息。

系统还需要来源追踪,即记录每项事实的出处。来自最终定稿政策的主张,应当具有不同于会议记录中非正式评论的权重。

时效性会带来另一个问题。周一整理的任务包,在周二路线图发生变化后就可能产生误导。

持久化上下文不应被视为不会过时的记忆。应用需要日期、版本信息,以及在执行重要操作前刷新材料的规则。

隐私问题更为严重,因为屏幕和语音捕获会观察到比文本提示更多的内容。屏幕可能暴露私人消息、账户详情、客户记录或无关的浏览器标签页。

语音录音可能会录下原本无意参与 AI 任务的其他人。背景对话也可能被误认为指令。

最安全的界面应当准确展示其捕获的内容,并允许用户在提交前删除。它应默认尽量减少数据,并在适当情况下保留本地处理方式。

权限必须随任务一同传递。能够访问某份文档,并不意味着智能体自动获得对外总结、编辑该文档或将其用于其他项目的授权。

多模态输入也扩大了攻击面。恶意指令可能出现在网页、文档、图像或屏幕上可见的消息中。

如果智能体将每个捕获到的元素都视为可信上下文,它就可能遵循与用户真实目标相冲突的指令。任务打包需要明确区分用户命令和不可信内容。

自主性会放大每个弱点。聊天机器人可能返回有缺陷的答案,而计算机操作智能体则可能发送消息、修改文档或提交表单。

OpenAI 对计算机操作功能的描述指出,其智能体会针对敏感操作请求确认。即使初始任务看起来已经完整,这种模式仍然不可或缺。

任务包应当规定行动限制,而不仅仅是期望结果。“准备回复”和“发送回复”代表不同的权限。

下一个风险是虚假信心。丰富的上下文可以让输出听起来更具针对性,却不一定使其更加准确。

一份精美的报告可能引用了正确的会议和文档,却得出了缺乏依据的结论。对于会产生重大影响的工作,用户仍然需要证据链接和审查节点。

Google 的 GUIDE 结果在此尤其相关。即便拥有多模态工作流证据,当前模型仍难以识别行为并判断何时适合提供帮助。

结构化上下文提升了表现,但并未消除根本的不确定性。由此得出的结论并不是更多输入能够解决智能体问题。

更有力的结论是:明确的上下文优于缺乏依据的推断。界面应要求用户确认不确定的意图,而不是假装理解每个手势或停顿。

成本和延迟也很重要。处理音频、多个屏幕、OCR、标注、检索和工具状态,比读取一条短消息需要更多计算资源。

系统可能需要一个预处理阶段来提取与任务相关的信息。在主要智能体开始工作之前,这个阶段本身就可能引入错误。

评估必须衡量完整的流程。当研究人员提供干净的上下文时,模型可能表现良好;但如果消费者界面的捕获层遗漏信息或标注错误,其表现可能很差。

Saravia 的文章没有提供基准测试结果、参考实现或隐私架构。因此,这一效率主张仍然只是一个可信的假设,而非已经得到证实的结果。

应通过任务完成率、纠正次数、用户耗时和错误严重程度来评判这一提议。仅衡量输出质量,会忽略准备任务所需的成本。

还应将其与强大的文本基线进行比较。如果一个包含目标、来源、约束和完成标准的简短表单能够取得同样效果,那么多模态界面的增益就很有限。

这些局限并不会否定 Elvis Saravia 的任务优先 AI 智能体。它们定义了将界面层面的洞见转化为可靠系统所需的工程工作。

三个信号将表明任务能否取代提示词

只有当产品、评估和用户都证实任务优先理念能够减少总体交互成本时,它才会变得重要。

第一个信号,是一个能够将语音、屏幕状态、文本和标注整合为单一、可检查任务对象的真实界面。

已有若干产品支持不止一种输入类型。但仅凭这一点还不足以实现该提议。

关键的检验标准是:各种关系能否在捕获后保留下来。智能体应当知道,哪一句口头表达指向哪个屏幕对象、文档段落或标注。

用户还应能够在执行前编辑组装好的任务。如果应用隐藏了自己的解读,就仍然难以防止错误。

可见的任务记录会强化 Saravia 的论点。另一个带有附件按钮的不透明聊天输入框则会削弱这一论点。

第二个信号,是基于完整工作的评估,而非孤立的模型能力。

开发者应当在相同工作上比较任务优先输入和普通提示方式。有效的衡量指标包括完成率、纠正轮次、用户主动投入时间、延迟和严重错误。

比较应当将准备和执行分开衡量。如果一个系统减少了三次纠正,却需要漫长的设置过程,它可能并未改善整体体验。

结果应涵盖不同规模的任务。多模态打包可能对简单问题几乎没有价值,却能为跨应用项目带来更多价值。

独立复现很重要,因为界面评估很容易被有意塑造。演示可以专门选择视觉上下文异常有用的任务。

GUIDE 等基准测试提供了基础,因为它们将屏幕活动与用户意图联系起来。未来的测试应加入能够采取行动的智能体,并衡量结构化任务输入能否改善最终结果。

如果在现实工作流中普遍取得显著提升,就能支持任务优先论点。如果提升幅度很小,且仅限于精心挑选的示例,则表明它只是一项实用功能,而非新的交互单元。

第三个信号,是新鲜感消退后的用户行为。

人们会不会在委派工作前,自然地通过说话、指点、高亮和附加证据来表达意图?还是会因为组装任务过于麻烦而重新使用短消息?

采用情况将取决于捕获速度。界面必须能将非正式说明转化为结构化上下文,而无需强迫用户填写冗长的表单。

信任同样重要。用户需要确信,无关的屏幕内容和私人对话不会在不知情的情况下进入任务。

团队可能会率先在高度依赖上下文的工作流中采用任务优先交互。产品评审、研究综合、事故分析和文档准备都涉及分散在多个来源中的证据。

这些工作也会受益于明确的完成定义。任务可以要求生成一份决策备忘录,其中包含引用的证据、尚未解决的问题和指定的受众。

消费者的采用路径可能有所不同。人们可以将语音和屏幕上下文用于旅行规划、表单填写、技术故障排除或整理个人记录。

这种更广泛的转变不会消灭提示词。对于精确、低风险的请求,文本仍然是最快的界面。

相反,任务会位于提示词之上。它们会将目标、上下文、约束、工具、权限和预期输出打包成智能体可以执行的单元。

这种层级关系比“语音对文本”提供了更有用的框架。问题在于,智能体接收到的是一句话,还是一份切实可用的工作表示。

对于开发者来说,当前的首要任务是检测与记录。追踪用户为何介入、缺少了哪些上下文,以及澄清发生在错误操作之前还是之后。

对于企业买家来说,首要任务是治理。询问系统会捕获什么、这些数据在哪里处理、权限如何持续生效,以及哪些操作仍然需要确认。

对于知识工作者来说,实际实验很简单。将一个复杂任务先以简短提示的形式交付,再以附带相关证据和完成标准的形式交付,然后比较两者。

统计纠正次数,而不只是衡量首次回复的质量。还要计算组装上下文所花费的时间。

如果这些衡量结果表明不同任务的总体投入都得以降低,Elvis Saravia 的提议就会得到强化。如果用户只是在对话式修正和繁琐准备之间做交换,这一提议就会被削弱。

提示词之所以成功,是因为它让模型访问变得即时。只有在上下文、行动和责任归属比即时性更重要的场景中,任务才能取代提示词。

这才是对 Elvis Saravia 任务优先 AI 智能体的真正考验:更丰富的任务说明能否帮助智能体完成更多工作,同时将用户投入、权限和私人上下文控制在合理范围内?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page