top of page

AI 模型通过在约束下学习重现人类阅读决策

9月2日
讀畢需時 15 分鐘

Google News 在 2026 年 8 月报道了一项引人注目的成果:一个 AI 模型在未被明确告知如何跳读或重读的情况下,复现了多种阅读行为。

这项基础研究的意义不止于预测视线如何在页面上移动。它将这些移动与理解、记忆限制、视觉不确定性,以及在文本上投入更多时间的成本联系起来。

这种联系构成了真正的张力。该模型之所以看起来像人类,并非因为其设计者赋予了它无限智能或完美记忆,而是因为他们为它施加了约束。

这一结果挑战了人们对强大 AI 系统的一项熟悉假设:移除限制并不会生成一个更准确的人类阅读模型,反而会产生看起来更不像人类的行为。

这项发表于 Nature Human Behaviour 的研究来自 Yunpeng Bai、Xiaofu Jin、Shengdong Zhao 和 Antti Oulasvirta。他们所在机构包括阿尔托大学、香港城市大学、新加坡国立大学和香港科技大学。

研究人员将阅读描述为一连串在压力下作出的决策。读者必须决定看向何处、跳过什么、何时回看,以及保留哪些信息。

这一框架使该研究与早期眼动计算模型并列比较。不过,它也要求这些模型解释理解过程,而不只是注视模式。

Google News 发现了一个将每次扫视视为决策的模型

该模型将阅读从被动识别任务转变为一种主动策略,用于分配有限的注意力。

这项于 2026 年 8 月 10 日发表的研究提出了研究人员所谓的“分层资源理性”概念。该术语指的是:在考虑有限记忆、视觉、努力和时间的前提下,最大化预期理解的决策。

模型在三个相互关联的层级运行。词语层控制器决定在一个词内注视何处。句子层控制器管理跳读和回视。

文本层控制器则决定哪些句子值得投入注意力或再次阅读。回视是指眼睛向后移动,以重新查看先前的文本。

每个层级都使用强化学习,这是一种对产生更好结果的行动给予奖励的训练方法。在这里,理想结果结合了理解能力提升与更低的认知和时间成本。

控制器并未收到任何手工制定的指令,例如“应跳过常见词”。它们也没有得到重读含糊语言的固定规则。

相反,这些行为是在系统寻找高效阅读策略的过程中自然涌现的。模型利用不完整的视觉信息和不断变化的内部记忆状态来选择行动。

这种设计使该研究区别于仅被训练来模仿记录下来的注视坐标的系统。模仿系统可以复现可见模式,却无法解释这些模式为何有助于理解。

该模型则试图从一个目标中推导出眼动。它所问的是:下一次注视应提供哪些有用信息,且成本仍可接受?

这项同行评审研究将阅读描述为连续的信息采样。每次注视都会更新读者的信念,而这些信念又会影响下一次移动。

这一反馈循环很重要。一个词之所以困难,并不只由其字母构成决定。它的重要性还取决于所在句子、已有记忆和剩余阅读时间。

因此,该模型能够预测不同尺度上的行为。它可以在词内选择字母、跳过可预测的词、重读令人困惑的内容,并在句子之间分配注意力。

这一结果受到关注,是因为这些模式与既有的人类阅读研究发现相似。人们通常会在较长、不常见或不可预测的词上停留更久。

读者也会跳过一些高频词,并回到难以整合的段落。当这些动作被视为保护理解的尝试时,才不再显得杂乱无章。

Google News 的报道强调了这些移动背后隐藏的决策。但重要变化不只是 AI 能生成一条看似人类的扫视路径。

研究人员提出了一个关于扫视路径为何形成的计算假设。阅读行为成为一个由稀缺性塑造的优化过程。

这一假设统一了两个常常彼此分离的领域。眼动研究解释读者看向哪里,而理解研究解释意义如何累积。

新模型认为,这些过程同属一个控制问题。在不可避免的限制下,眼睛移动是为了改善对文本的内部表征。

这一主张仍是一种基于模型的解释,而非对神经决策过程的测量。该程序并未揭示大脑中运行的字面算法。

它的价值取决于一个原则能否复现大量彼此独立的观察结果。这正是该研究与人类比较变得重要的原因。

人类测试将时间压力置于核心位置

时间压力使人类读者和模拟读者朝相同方向变化,将眼动与可测量的理解损失联系起来。

研究人员将该模型与八个现有的人类数据集进行了比较。他们还开展了一项实验,让 39 名成年人在屏幕上阅读短文。

眼动仪以每秒 1,200 次的频率采样视线。参与者面临 30、60 或 90 秒的阅读时限。

阅读后,参与者进行了 20 秒的算术计算。这一干扰降低了他们依赖对段落即时记忆的能力。

随后,他们完成自由回忆并回答五道选择题。32 名参与者进入理解分析,28 名参与者进入眼动分析。

他们的平均年龄为 24 岁。在判断这些发现的适用范围时,这一样本的局限性很重要。

当时间变得紧张时,参与者读得更快,跳过的词更多。他们较少向后移动,也记住了更少的信息。

模型也朝相同方向变化。其策略发生转变,因为检查另一个词的价值必须与剩余时间竞争。

据报告,在涵盖三种时间条件的 15 项汇总测量中,模型结果与人类结果的相关系数达到 0.9999。

这一数字引人注目,但需要谨慎解读。它概括的是实验条件之间的汇总指标,而不是对每位参与者视线的完美预测。

报道的研究结果也显示,效应量存在显著差异。人类在词中每增加一个字母时,平均多花约 14 毫秒。

模拟结果增加了约 21 毫秒。它对这种关系方向的捕捉,比对其精确幅度的捕捉更为接近。

这一差异区分了结构性一致与个体预测。一个模型可以复现平均趋势,却无法预测某个个体会在何时停顿或回视。

研究还发现了一种意外的注视模式。人类读者往往落在一个词的开头和中部之间,而不是直接瞄准其中心。

模拟读者在未被指定落点位置的情况下,也形成了类似偏好。这一结果支持了这样一种观点:有用的注视模式可以从任务目标中自然涌现。

不过,该研究并未证明每次注视都反映了有意识的决策。“决策”一词描述的是模型的控制过程,并不必然代表读者的意识。

许多人类阅读体验是自动化的。如果习得的策略能够高效分配有限资源,资源理性解释同样可以描述自动行为。

时间压力实验强化了这一解释,因为它直接操纵了一项资源。更少的时间会改变检查、跳过和重读文本的价值。

它也说明了为何不能仅凭速度评判快速阅读。读者可能通过接受更弱的回忆和理解能力来提高处理量。

这种权衡对教育软件、工作场景中的阅读工具,以及传递紧急信息的界面都很重要。一个只优化速度的系统可能会强化浅层浏览。

更好的系统需要估计读者的目标。提取一项事实、审阅一份合同和学习技术文档,需要不同的注意力策略。

该模型为表征这些差异提供了一个框架。它尚未成为一种可为任何用户可靠推断这些差异的成熟产品。

这一缺口对自适应阅读的主张提出了挑战。在软件根据预测的注意力重新排列文本之前,它必须知道其预测是否真正描述了眼前这个人。

真正的机制是稀缺性,而非完美智能

当记忆、感知和时间受到限制时,模型会变得更像人类;当这些限制消失时,它也失去了这种相似性。

研究人员通过消融实验检验了这一机制;消融实验是为揭示哪些组件产生某一结果而设计的改动版本。

其中一个改动后的智能体获得了无限记忆。它保留了每一条已解析的命题,而不是选择哪些内容值得长期储存。

该智能体在选择题中的正确率为 85.2%。在报告所述比较条件下,人类参与者的正确率为 71.6%。

无限记忆智能体在自由回忆上也表现得更好,并且回视次数少得多。由于它几乎没有遗忘,重读的价值很低。

这一版本在测验上表现更好,却作为人类阅读理论更差。它优越的记忆能力消除了某种熟悉人类行为的必要性。

这一反转构成了该研究最有力的论点。看起来像人类的智能,并非源于将每项能力都最大化。

它源于协调不完美的能力。系统必须拥有受限的记忆、部分视觉信息和时间成本,策略性眼动才会变得有用。

团队还测试了短视智能体,即优先考虑即时奖励而非后续理解的控制器。

这些智能体反复关注早期内容,而未能有效推进阅读过程。据报告,两个版本的阅读速度分别为每分钟 34 和 42 个词。

在相关比较中,人类参与者平均每分钟阅读 176 个词。局部优化使智能体陷入一种保护近处确定性、却牺牲整篇文章理解的行为。

因此,类人阅读同时需要两种属性。模型既需要现实的限制,也需要重视未来的理解。

这一机制不同于简单地说人类并不完美。限制会改变某一时刻哪种行动变得理性。

当词义可预测且时间紧张时,跳过一个词可能是有用的。当该词带有核心限定时,同样的跳读则可能有害。

同样,回视不一定意味着处理失败。当当前句子暴露出矛盾时,回到先前文本可能是一项合理投资。

这种解释延伸到阅读之外。知识工作往往涉及选择打开哪份文档、检查哪个段落,以及核实哪项主张。

人们很少处理每一项可得信息。他们会根据预期相关性、可用时间和自己已经记住的内容来采样信息。

这也是为什么,AI knowledge base能够支持工作,而不取代人类判断。检索仍然需要对相关性和充分性作出决策。

这项研究不应被误解为大型语言模型像人一样阅读文本。其控制器使用语言表征、强化学习以及明确的资源约束。

由此产生的行为为注视分配提供了一种计算解释。它并不表明普通语言模型具有人类的理解能力或视觉体验。

这种区别很重要,因为“AI 像人一样阅读”可能引出拟人化的结论。匹配部分行为统计特征,并不能证明双方具有相同的心理过程。

更强的主张其实更为具体,也更有用:在类人约束下接受训练、以最大化理解为目标的系统,能够复现若干已被证实的阅读模式。

其他研究人员也曾将注意力、语言预测和注视行为联系起来。早期的 NEAT reading model考察了任务要求如何影响阅读时的神经注意力。

另一种 active-inference model将语言模型与层级预测结合,用于研究眼动和阅读障碍。

这些路径表明,该领域存在相互竞争的计算方法。新研究的优势在于,它在注视、句子和完整文本之间建立了统一的层级结构。

它的负担也同样明确:当实验超出简短英文段落和受控实验室任务时,这一广泛模型必须继续有效。

眼动模型如今面临理解力测试

如果一个注视模型无法解释读者保留了什么信息,那么仅凭预测注视坐标看起来可信已经不够。

传统眼动模型对词语识别、扫视和词汇处理提供了宝贵解释。许多模型密切关注是什么触发了从一个词到另一个词的移动。

数据驱动系统也可以从记录下来的注视轨迹中学习。它们或许能够预测可能的注视位置,却不一定表征读者逐步形成的理解。

这项新研究提出了更高标准。如果眼动服务于理解,那么成功的模型应同时预测行为和学习结果。

这一要求给两条研究路线都带来了压力。机制模型必须解释更大规模任务中的表现,而机器学习模型则必须变得更具可解释性。

高度准确的注视预测器仍可能依赖于在新文本或新读者群体中失效的相关性。透明的认知理论也可能在精心挑选的条件之外表现不佳。

因此,核心竞争并非一家公司对另一家公司,而是注视模仿与理解驱动控制之间的竞争。

注视模仿从观察到的运动出发,尝试预测下一个位置。理解驱动控制则从目标出发,推导出应当如何移动才能支持该目标。

这种区别影响研究人员如何解读被跳过的词。模仿模型可能学到:简短且常见的词获得的注视较少。

资源理性模型则会追问:跳过它们为什么有帮助。可预测的词通常比罕见或在语境中令人意外的词提供更少的新信息。

同样的逻辑也适用于回视。除非模型将其与不确定性、记忆丢失或整合失败联系起来,否则仅凭回视频率本身无法告诉研究人员太多。

这种转变还使行为干预变得可检验。研究人员可以改变时间、记忆要求、文本难度或视觉访问条件,并预测注意力应如何变化。

这项 8 月研究测试了时间限制和模型消融。未来工作必须检验,同一策略是否能预测不同目标下的行为。

查找一个事实所产生的注视轨迹,应与准备概括一段文字不同。校对也应不同于为娱乐而阅读。

专家读者可能以不同方式分配注意力,因为他们的先验知识会改变哪些词携带新信息。第二语言读者则面临不同的识别成本。

阅读障碍读者可能遭遇不同的知觉或预测约束。作者表示,他们的模型为阅读障碍阅读中更长的注视和更多的回视提出了假设。

这仍然是一项预测,而非临床验证。报告中的实验并未确立诊断准确性或治疗有效性。

这一区别避免了研究作出轻率夸大的主张。对群体层面模式进行建模,并不会自动形成能够识别或帮助某个具体个体的工具。

不过,这一框架提供了连贯的实验路径。研究人员可以拟合个体参数,将预测的注视轨迹与实际注视进行比较,并评估理解情况。

他们还可以检验拟合参数是否对应有意义的认知差异。一个能提高预测效果的参数,未必能清晰对应于记忆容量或视觉不确定性。

这正是独立复现变得决定性的地方。灵活的模型可以拟合许多模式,却不一定能锁定某一种真实机制。

竞争性理论应面对相同的数据集、留出的读者和未见过的段落。它们应在研究人员查看新结果之前就预测结果。

诸如 EyeBench 的基准正在迈向对读者属性及读者—文本交互进行标准化评估。这一方向与新模型的雄心相辅相成。

共享测试可以揭示,理解驱动控制是否比注视轨迹模仿具有更好的泛化能力。它也可能暴露出更简单的预测器依然足够的情形。

Google News 头条未能证明什么

该研究解释了若干平均行为,但尚不能预测某个特定人会如何阅读任意文档。

最重要的限制涉及泛化能力。团队将其模型与八个数据集进行了比较,使这项工作比单一实验拥有更广泛的基础。

但这些数据集并不代表所有语言、书写系统、年龄群体、阅读障碍、设备或任务。

新实验招募了平均年龄为 24 岁的大学年龄段成年人。参与者在屏幕上、在人工设置的时间限制下阅读短文本。

这一环境不同于阅读长篇报告、浏览手机、审阅代码或遵循道路指示。每项活动都会产生不同的成本与目标。

理解力测量也存在边界。自由回忆和五道选择题能够捕捉有用的结果,但并未穷尽“理解”的全部含义。

读者可能记住事实,却错过论证结构。另一个人可能理解论证,却无法复现其措辞。

0.9999 的相关性同样值得谨慎解读。它描述的是时间压力比较中 15 项汇总指标之间的一致性。

这并不意味着系统预测了 99.99% 的眼动。它也不证明其对理解的建模近乎完美。

汇总层面的一致性可能掩盖个体差异。两名读者可能通过截然不同的序列,产生相同的平均注视时间。

该模型目前代表的是一个泛化读者。研究人员承认,他们尚未将模型拟合到个体,并验证这些个体化预测。

这在将该方法应用于自适应界面之前尤为重要。错误地修改文本的系统可能增加干扰,或隐藏信息。

以驾驶显示为例。作者设想了一种支持驾驶员、又不要求其投入不必要注意力的文本设计。

这一使用场景带来了很高的验证门槛。自适应显示必须避免删去那些在异常道路条件下变得关键的词。

智能眼镜带来另一项挑战。持续的注视追踪可能生成关于注意力、不确定性、兴趣和潜在困难的敏感数据。

该研究关注的是认知建模,而不是已部署的监控系统。但未来产品将需要对收集、存储和推断设定明确边界。

注视轨迹揭示的不只是人们看向何处。结合文本,它还可能暗示他们被什么困惑、忽略了什么,以及重读了什么。

这些信息可以支持无障碍设计或学习,也可能助长侵入式工作场所监控和操纵性的内容优化。

出版商已经在测试标题、版式和互动模式。预测性阅读模型可以围绕理解进一步优化这些系统。

它同样可能优化注意力捕获,而非理解。产品负责人选择的目标将决定由此产生的行为。

该模型的资源理性框架使这种张力变得可见。理性始终取决于既定目标、可用行动和被赋予的成本。

针对测验表现优化的策略,不同于针对知情同意优化的策略。针对阅读速度优化的策略,也不同于保护审慎审阅的策略。

在解释的唯一性方面也存在科学不确定性。复现行为并不能证明人脑使用相同的计算架构。

不同机制可以产生相似观察结果。研究人员必须设计实验,使竞争模型能够预测具有实质差异的结果。

这份大学概述将该系统描述为对人类阅读进行异常广泛模拟的模型。

这种广度很有价值,但也增加了对外部测试的需求。模型应在用于开发和调优它的条件之外同样成功。

Google News 为这项研究提供了一个围绕隐性决策的引人入胜的公共叙事框架。证据支持的是这些决策的模型,而不是对无意识思维的直接访问。

这一区别并未削弱这一成就。它界定了下一项科学任务。

三个信号将表明该模型能否走出实验室

下一阶段必须测试个体预测、新的阅读条件和有用的应用,而不能将行为相似性夸大为过度主张。

第一个信号是针对未见读者和文本的预注册复现。研究人员应在收集或检查新的注视数据之前公布预测。

强有力的结果将会在不同于原始训练和评估材料的条件下,同时复现眼动和理解表现。

成功将强化资源理性捕捉到一般阅读机制的主张。表现不佳则意味着当前拟合依赖于特定数据集或任务。

第二个信号是来自多样化人群和阅读系统的证据。测试应涵盖老年人、年轻读者、第二语言读者,以及已被诊断出阅读差异的人群。

研究还应考察使用不同书写系统的语言。围绕英文单词和句子开发的模型,在其他语言环境中可能需要进行重大调整。

这一信号将澄清,三级层级结构反映的是广泛的阅读规律,还是主要反映已研究的条件。

临床或无障碍主张尤其需要谨慎评估。在针对性研究完成之前,预测的阅读障碍模式不应被视为已验证的诊断标记。

第三个信号是受控的自适应界面。研究人员需要证明,模型指导的呈现方式能够改善有意义的结果,同时不会带来新的错误。

一项有用的试验可以比较标准文本与根据时间压力、理解目标或测得的阅读难度进行调整的版式。

关键成果不应仅限于速度提升。研究人员还应衡量理解、记忆保持、分心、信任,以及未能注意到重要信息的情况。

如果一个界面让阅读更快,却削弱了判断力,那么该模型并没有解决应用层面的问题。它只是优化了一项可量化的成本。

开发者还应关注,当系统接收到更丰富的个人数据时会发生什么。个体化校准或许能提高准确性,但也会增加隐私风险。

本地处理、有限留存和透明的控制机制可以降低部分暴露风险。这些保障措施不属于当前模型本身,却应属于任何负责任的产品设计。

对于知识工作者而言,这项研究提供了一个无需眼动追踪的实用启示:跳读、回看和选择性注意并不一定意味着阅读能力欠佳。

它们是分配有限资源的策略。关键问题在于,这些策略是否符合目标,并保留了足够的理解。

这一洞见可以指导文档设计。作者可以让限定条件更醒目,减少不必要的歧义,并将关键信息放在读者更可能记住的位置。

读者也可以把快速筛选与细致审阅区分开来。第一遍阅读可以判断相关性,之后再进行一遍阅读,以建立可靠的心理模型。

Google News 很可能会继续将这项工作描述为 AI 正在学习像人一样阅读。更有价值的解读则更为聚焦,也提出了更高要求。

该系统之所以类似人类读者,是因为它同样必须在资源稀缺的条件下做出选择。当记忆失效、时间不足,或不确定性让再次查看变得值得时,它的行为最具揭示性。

下一个问题并不是 AI 能否在页面上画出一条令人信服的路径,而是同一理论能否预测不同人群、不同语言以及真实决策中的理解情况。

请密切关注这三项检验:独立复现、更广泛的人群,以及自适应界面带来的可量化收益。它们将共同说明,这究竟是一套经得起考验的阅读理论,还是一次令人印象深刻的实验室拟合。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page