NASA航天器AI自主能力让长期担忧的权衡更近一步
当生成式AI为火星上的Perseverance规划了两次行驶路线时,NASA航天器AI自主能力跨过了实用门槛,尽管数十年来工程界一直抵触不可预测的系统。
这辆火星车于2025年12月8日和10日沿着由Anthropic的Claude模型生成的航点行驶。人类规划人员在将建议路线发送至火星前进行了审核。这并非一台无人监管的机器在指挥火星车,但它让生成式AI进入了真实任务的工作流程。
此后,其他实验进一步拓宽了这一领域。一款经压缩的NASA和IBM模型在轨处理卫星图像,而宇航员则测试了语言模型对技术流程的支持。这些项目共同挑战了航天器与任务控制中心之间的传统关系。
工程师历来偏好在严格定义的条件下能给出可重复结果的软件。生成式模型的工作方式不同。它们解读陌生输入的能力颇具吸引力,但输出可能变化,也可能以意料之外的方式失效。
这种张力愈发难以回避。通信延迟限制了地球之外的直接控制,而商业任务正在增加轨道运行机器的数量。问题不再是航天系统是否需要自主能力,而是工程师能安全地允许多少不确定性。
NASA航天器AI自主能力已进入任务运行阶段
Perseverance的演示将生成式AI从实验室中的可能性带入了现役行星任务的规划链条。
NASA喷气推进实验室通常依靠人类火星车规划人员研究轨道图像、地形坡度和已知危险因素。这些规划人员确定安全航点,引导Perseverance穿越火星表面。
在12月的演示中,视觉语言模型协助完成了这项分析。视觉语言模型可同时处理图像和文本,使其能够借助书面指令和任务数据解读可视化地形。
该项目与JPL的Rover Operations Center合作,使用了Anthropic的Claude模型。根据Mars drive announcement,该系统在生成建议航点前分析了轨道图像和数字高程信息。
Perseverance于12月8日行驶了689英尺,即210米。它于12月10日又行驶了807英尺,即246米。
这些数据之所以重要,是因为这些行驶发生在另一个世界,而非模拟环境中。不过,该演示仍受到严格限制。人类操作员检查了路线,在需要时作出调整,并上传最终指令。
该模型并未独立决定任务应前往何处。它也没有直接操控火星车绕过每一个障碍物。Perseverance仍保留现有的机载导航能力,用于在获批航点之间进行局部移动。
这种责任划分展示了NASA目前处理生成式AI的方式。模型能够加快一项困难的规划任务,但既有系统和人工审核者仍对其权限施加约束。
火星让这项实验不只是一个便利的自动化项目。这颗行星距离地球的平均距离约为1.4亿英里,即2.25亿公里。因此,无线电信号无法支持类似操纵杆的驾驶方式。
任务团队规划活动、传送指令并等待结果。任何能够安全提高每个指令周期行驶距离的规划工具,都可能提升任务的科学回报。
JPL太空机器人专家Vandi Verma将感知、定位、规划和控制描述为自主异星驾驶的核心支柱。生成式系统最终或可帮助火星车在更长路线中连接这些功能。
这仍是一种愿景,而非12月行驶的成果。经验证的结果更为有限,但仍然重要:生成式AI在人类审核后,为一项正在执行的火星任务产出了可用的规划结果。
因此,NASA航天器AI自主能力正通过受控授权向前发展。工程师并未将整艘航天器交出去,而是在灵活解读有价值、且仍可进行独立核查的环节中隔离任务。
这种方法也不同于传统的火星车自动化。Perseverance已使用确定性导航软件,在行驶期间评估附近地形并避开障碍物。生成式AI则更早介入,即根据轨道数据准备路线阶段。
这一区别避免将此次测试误导性地讲述为一辆AI火星车独自在火星漫游的故事。真正的变化在于流程:概率模型参与了此前由任务专家手动完成的工作。
这种参与构成了本文的核心冲突。如果模型能够更快规划并解读更多信息,限制它们可能会降低任务生产力。若其权限扩张过快,一次不可靠的输出便可能威胁到难以维修的硬件。
距离正迫使任务控制中心交出部分控制权
深空任务需要本地决策,因为最有价值的事件可能在指令从地球抵达前便已结束。
通信延迟始终影响着行星探索。火星任务要求团队提前规划,而更遥远的任务则面临更长的往返通信时间。
一艘未来在Europa附近运行的航天器说明了这一问题。木星这颗冰卫星可能会在有限时段喷出水羽流。航天器或许探测到一次羽流,却可能在地球收到观测结果之前穿过这一机会并继续远离。
NASA软件与机器人工作前负责人Robert Ambrose告诉IEEE Spectrum,没有具备实际意义的机载自主能力,这类任务将不可能完成。控制人员看到的事件可能大约发生在一小时前。
传统自动化能很好地应对可预测的情况。工程师定义状态、允许的动作和恢复程序,随后测试系统能否在预期条件下正确响应。
当航天器遇到设计人员未能精确描述的事物时,生成式AI便显得有趣。模型无需匹配某一条预先写好的规则,就能对观测进行分类、将其与已有知识关联,并提出行动建议。
这份灵活性也是工程师抵触它的原因。同一输入并不总能保证通往答案的路径相同。上下文、此前步骤和模型行为都可能改变输出。
传统航天测试依赖可追溯性。调查人员需要了解软件为何选择某项行动,复现当时条件,并验证安全措施是否稳定有效。
生成式模型让这一过程变得复杂。工程师不仅必须测试预期输入,还要测试上下文、传感器噪声、模糊指令和早期模型响应的各种组合。
Ambrose描述了在Orion等航天器项目中,自主能力如何扩大团队必须检查的路径数量。其中一种解决办法,是将测试过程本身的部分环节自动化。
这段历史很重要,因为生成式AI并未引入第一种航天器自主能力。火星车多年来一直能够导航局部地形,卫星也会定期控制姿态、电力和故障响应。
Perseverance也在Claude路线实验之前配备了机载自动调度器。JPL表示,automated scheduler于2023年10月成为这辆火星车的主要调度方式。
较新的转变涉及自主能力的类型。传统系统在工程化边界内表现出色。基础模型能够在不同任务间复用广泛学习到的表征,尽管其行为更难预测。
商业活动加大了接受这一权衡的压力。更多卫星、私人空间站、机器人维修任务和月球车辆,将带来超出地面团队手动处理能力的决策数量。
任务开发也在加速。得克萨斯大学奥斯汀分校Center for Autonomy主任Ufuk Topcu,将如今的速度与过去需要10年或15年开发的项目进行了对比。
更多任务的出现改变了控制的经济性。为检查每一张图像、路线、流程和异常情况而配置专家团队,无法随航天器数量增长而扩展。
被迫作出的回应将是渐进式授权。操作员将界定AI可提出建议或采取行动的有限区域,监测结果,并仅在证据不断积累后扩大这些区域。
这一转变令传统任务保障面临压力。这一学科必须维持其安全标准,同时找到认证为陌生条件而设计的系统的方法。
选择并非人类判断与完全机器控制之间的对立,而是集中式人工规划与受监督的机载智能之间的取舍;随着距离和工作负荷增加,权限将向航天器一侧转移。
对可预测性的旧有要求正成为一种负担
太空工程师曾主要将非确定性行为视为风险,但当地球无法及时响应时,僵化行为同样可能变得危险。
在太空中使用生成式AI的最有力理由,不是语言模型很时髦,而是预定指令在操作员无法快速干预的环境中存在局限。
一艘僵化的航天器可能完全按设计运行,却错过意外出现的科学事件。当新情况超出其编程决策树时,它也可能进入安全模式。
安全模式通过暂停正常活动并等待地面指令来保护硬件。当通信可用且延迟可以接受时,这种响应有效。但在稍纵即逝的事件中,它的作用就会减弱。
生成式系统承诺提供不同的响应。它们能够解读不完整信息、比较选项,并利用从大型数据集学习到的模式制定计划。
NASA的Prithvi实验在另一个场景中展示了这种灵活性。Prithvi是一种地理空间基础模型,这意味着它在适配具体图像任务之前,已接受过广泛的地球观测数据训练。
研究人员压缩了NASA和IBM的模型,并将其上传至两个轨道平台。其中一个是南澳大利亚的Kanyini卫星,另一个是国际空间站上IMAGIN-e计算载荷。
Prithvi orbital test评估了这两个平台上的洪水和云层检测。NASA将其描述为地理空间基础模型首次在轨部署。
Prithvi使用了13年的Harmonized Landsat和Sentinel-2数据进行训练。其潜在应用包括洪水制图、灾害监测、作物分析及其他地球观测任务。
在轨处理图像可减少发送至地面的无关数据量,也能缩短从拍摄图像到识别重要特征之间的时间。
带宽使这一能力具有价值。卫星收集的数据多于它们能够始终立即传输的数据,尤其是在仅能于有限窗口期间与地面站联络时。
能够识别云层的航天器可以避免存储无用的光学图像。能够识别洪水或火灾的系统,则可以优先处理有价值的观测结果,并更快发出警报。
NASA 已经测试过这一构想的一个更专门化版本。其动态目标系统利用星载分析区分云层与晴空,再决定仪器应观测哪里。
该系统会沿卫星轨道前进方向大约提前观察 300 英里,即 500 公里。如果云层遮挡目标,航天器可以取消一次成像活动并节省存储空间。
Prithvi 指向了一种更具适应性的架构。基础模型无需为每项观测都携带一个独立的窄域模型,而是可在经过专门微调后支持多项任务。
压缩至关重要。IBM 研究人员表示,他们通过蒸馏和量化将模型缩小至原先体积的十五分之一。
蒸馏是训练较小模型复现较大模型中有用行为的方法。量化则降低模型参数使用的数值精度,从而减少内存和计算需求。
这些方法针对的是一个基本限制。由于任务优先考虑可靠性、能效、抗辐射能力和长期运行寿命,具备空间认证的计算机通常落后于数据中心硬件。
Prithvi 测试并未赋予卫星开放式控制权。它展示的是推理能力,即将训练完成的模型应用于新数据的过程,并且是在轨道计算环境中完成。
不过,这一模式与 Perseverance 项目相吻合。NASA 航天器 AI 自主能力始于定义明确的任务、受限的硬件条件,以及由人类设计的运行边界。
这种转变在于,如今什么才算保守工程。过去,将每一个复杂决策都留在地球上可以最大限度减少不确定性。对于遥远或数量众多的任务而言,这种依赖可能造成延迟、瓶颈和错失观测机会。
可预测性依然有价值,但它不再是唯一的安全措施。及时适应同样可以保护任务,尤其当环境变化快于任务控制中心的响应速度时。
生成式 AI 仍未通过航天器无法忽视的考验
一次有用的演示,并不能证明概率模型能够安全地控制推进、生命保障或其他不可逆系统。
12 月的火星行驶任务之所以包含人工审查,是有原因的。生成式模型可能误读图像、忽略约束条件、编造解释,或因提示词发生细微变化而给出不同答案。
在地球上,错误响应可能只是浪费时间。在火星上,它可能让探测车陷入无法移动的状态、损坏车轮、耗尽能源,或使通信设备处于不理想的朝向。
涉及宇航员时,失误的代价会更高。一条错误的维护指令可能让机组成员前往错误部件,或遗漏某个安全步骤。
语言模型可能以自信的措辞作出不准确陈述。检索增强生成能够通过将答案建立在经批准的文档上来降低这一风险,但检索并不能保证推理正确。
检索增强生成通常称为 RAG,会在生成答案前搜索可信知识库。系统可以使用任务程序,而非仅依赖模型训练数据。
研究人员已经探索将这种架构用于宇航员支持。拟议中的 CORE 助手结合了程序检索、知识图谱、语言模型和增强现实提示。
知识图谱以结构化形式组织实体及其关系。这种结构可以帮助系统关联部件、程序步骤、警告和所需工具。
相关的程序助手研究面向国际空间站和 Lunar Gateway 等环境。研究强调离线访问,因为未来机组不能假定能够立即连接云端。
这类助手可以让密集的技术手册更易于搜索,也可以根据机组成员眼前的问题调整呈现方式。
不过,提供有帮助的答案不同于保证答案安全。工程师仍需设置控制机制,防止模型替换未经批准的步骤,或在权限范围外行动。
微重力还带来了另一项验证缺口。在地球上训练的机器人模型会学习受重力、摩擦力和熟悉物体运动方式影响的物理关系。
在轨道上,物体被从表面推开后不会落下,而会持续运动,直到另一种力改变其轨迹。因此,陆地操作模型可能犯下基础性错误。
Icarus Robotics 在开发 Joy 时正面临这一差异。Joy 是一款计划在国际空间站上执行任务的自由飞行机器人。该公司已在减重力飞行期间测试这一系统。
Joy 提议的早期工作包括在空间站模块之间搬运货物袋。Icarus 计划先从遥操作开始,并利用运行数据训练更高程度的自主能力。
这种推进方式是合理的,因为相关训练数据仍然稀缺。地面机器人公司可以在仓库、办公室和家庭中收集数百万次交互数据,而轨道机器人获得的机会少得多。
仿真可以扩充数据集,但模拟的接触与运动无法完美复现硬件行为。失重飞行能够提供有用样本,但每段微重力状态持续时间都很短。
因此,安全挑战包含三个层面:模型必须正确理解环境,机器人必须执行预期动作,系统还必须在造成损害前检测到失败。
没有单一基准能够解决这些问题。测试必须将传感器、模型输出、机械控制、时序、通信和恢复行为作为一个相互连接的系统加以覆盖。
NASA 航天器 AI 自主能力很可能会通过权限边界逐步发展。模型可能先进行摘要,再提出建议,然后执行可逆操作,最后才控制后果更严重的系统。
每个阶段都需要独立监控。确定性安全控制器可以阻止违反位置、能源、温度或碰撞限制的指令。
工程师也可以将模型限制在获批工具和结构化输出范围内。模型可以从已验证区域中选择航点,而不是生成不受限制的坐标。
这些控制措施能够降低风险,但也会限制生成式 AI 吸引人的适应性。严格限制可能将灵活模型变成另一层狭窄的自动化系统。
这正是核心权衡。航天器需要能够应对陌生事件的模型,但陌生行为在发射前很难获得认证。
因此,对于独立航天器的说法应使用谨慎措辞。当前项目展示的是受控条件下的规划辅助、星载图像分析和程序支持,而非可靠的通用自主能力。
最关键的证据将来自重复运行。工程师需要失败率、人工干预记录、边缘案例表现,以及在传感器降级或数据不完整情况下成功恢复的记录。
在这些结果出现之前,生成式 AI 应当只是更大系统中的一层。它可以理解和提出建议,而经过验证的软件则负责执行保护任务的边界。
三项测试将揭示自主能力能否走出沙盒
下一阶段取决于重复的任务表现、更大的星载权限,以及安全系统能够控制模型错误的可信证据。
第一个信号是 NASA 是否会在更长的行驶任务中重复使用 AI 辅助探测车规划。12 月的路线合计覆盖 456 米,证明了运行可行性,但尚未证明日常可靠性。
更有力的结果应包括在不同地形上的多轮规划。关于被拒路线、人工修正和规划时间的公开信息,比单次成功更能说明问题。
如果随着试验推进,操作人员需要的修改越来越少,生成式规划的论据将更有说服力。频繁修正则表明,该模型仍是生产力辅助工具,而非自主规划器。
第二个信号是轨道基础模型是否从检测迈向行动。Prithvi 在图像中分类特征,而动态目标系统已经将云层识别与仪器调度连接起来。
未来的模型可能会优先处理灾害图像、重新调度传感器,或与另一艘航天器协调观测。这将缩短解释与物理行动之间的链条。
这样的转变也会提高后果严重性。误分类可能浪费有限的电力、存储空间或观测机会。操作人员将需要审计日志,以说明输入、输出和适用约束。
如果机构在轨道试验后允许这些受限行动,NASA 航天器 AI 自主能力就已超越分析阶段。如果模型仍与指令系统隔离,信心的建立就会更慢。
第三个信号是载人航天项目如何验证语言模型辅助。程序工具具有明显价值,因为宇航员必须搜索大量技术资料。
决定性测试不在于模型能否回答常规问题,而在于机组能否识别不安全答案、迅速恢复,以及在连接或传感器数据恶化时继续工作。
可信的部署应将对话便利性与指令权限分开。助手可以定位获批信息,而关键操作仍需机组明确确认。
成功将支持把类似工具用于月球空间站和火星任务,因为来自地球的帮助到达得太慢。表现不佳则会强化对更狭窄、结构化界面的需求。
开发者和企业 AI 采购方应密切关注这些实验。载人航天暴露了他们在智能体与文件、数据库、机器或业务流程交互时面临的同一问题。
模型可能在演示中看似能力出众,却在环境变化时失效。安全部署需要可信信息、明确权限、可观察的操作和恢复路径。
开发自有 AI 工作流的团队需要同样的纪律。可搜索的工程知识库可以为答案提供依据,但仅靠依据并不能取代审查或访问控制。
航天项目让后果变得格外可见。更深层的教训适用于任何软件能够行动而非仅仅回答问题的场景。
NASA 尚未解决适应性与可预测性之间的冲突。它已开始在真实任务中测试这一冲突,在那里证据可以取代宽泛承诺。
最安全的路径既不是永久远程控制,也不是立即实现机器独立,而是经过衡量的授权:每一项新增权限都要通过可重复的表现赢得。
关注下一次 Perseverance 规划活动、第一个获准触发实质行动的轨道模型,以及第一个经过独立评估的宇航员助手。这些里程碑将揭示生成式 AI 是否已成为可靠基础设施,还是仍只是能力异常出色的顾问。



