Fable 5.1 破解 Cyphral Distich,迎来严苛验证考验
据称,Fable 5.1 在 44 分钟内破解了 Cyphral Distich,结束了一个与 1653 年出版物有关的谜团。Fable 5.1 对 Cyphral Distich 的破解结果之所以显得格外令人信服,是因为其提出的信息既符合该密码的结构,也契合作者的政治立场。随后,研究者检查了不同留存版本、质疑了证据,并将这个看似干净利落的胜利故事变成了对 AI 研究标准的检验。
这份 8 月 31 日的报告来自 AI 评估公司 Vals AI,而非 Anthropic 或学术密码学团队。Vals 表示,Claude 模型在没有进一步人工干预的情况下处理了 176,000 个 token。它提出了一条简单的索引规则,将 64 个数字转换为一首支持国王查理二世的两行祈祷诗。
这一解释合理、令人印象深刻,并且在一定程度上可以复现。然而,一次早期复现尝试发现,一份数字化的 1653 年版本没有包含该密码,且其底层文本也不相同。后续检查发现,另一份留存版本据称包含这首 Distich。目前争议集中于不同版本、确切输入,以及每一个解码字母能否被独立重建。
Fable 5.1 实际发现了什么
该模型的核心洞见是,密码的密钥似乎就是周围的书籍文本,而不是一套独立的密码字母表。
Thomas Urquhart 爵士的 Cyphral Distich 包含两行、每行 32 个数字。distich 是一种两行诗,而 cryptogram 则是依照既定编码规则隐藏的信息。自至少 1899 年以来,这个谜题一直出现在历史讨论中,但始终没有获得公认的解答。
根据这项 密码实验,Fable 5.1 将两行各含 32 个数字的内容,与 32 个名为 Proquiritations 的章节联系起来。这些段落表达了 Urquhart 的愿望、期许或希望。Urquhart 也在周边文本中强调了数字 32。
这一规则是机械性的。对于任一密码行中的第一个数字,读者需前往第一则 Proquiritation。该数字选定该章节中的一个词,该词的首字母便构成明文字母。第二个数字则指向第二则 Proquiritation,如此持续完成全部 32 个位置。
将这一规则应用于两行内容后,会得到一则祈求上帝扶持查理二世、使其成为这片土地至高统治者的信息。“Charls”的拼写符合 17 世纪的用法,并非显而易见的现代修正。
有几个特征令这一解读颇具说服力。每条解码行均包含 32 个字母,与 32 个数字的结构相符。两行以押韵词语结尾,满足 distich 的预期形式。该信息也反映了 Urquhart 有据可查的保皇党立场。
政治背景之所以重要,是因为 Urquhart 写作于查理一世被处决之后的时期。相关作品问世时,查理二世仍未掌权。为其复辟而发出的隐晦呼吁,与作者及当时的历史情境相吻合。
Vals 表示,该模型经过 44 分钟和 176,000 个 token 后得出了这一解释。据称,操作员 Geby Jaff 提供了宽泛目标和最初的鼓励,但在成功运行期间没有进行干预。
这项实验并不是一项预先选定固定目标的盲测基准测试。Jaff 要求模型选择一个尚未破解、且答案具备合理可验证性的密码。他还引导模型避开 Kryptos K4 等难度极高的目标。
这一差异并不会使结果失效,但会改变结果所衡量的内容。该会话综合测试了问题选择、在线研究、假设形成、持续探索和自我检查。它并未通过受控比较来单独衡量密码分析能力。
该模型显然在最终锁定 Urquhart 的谜题之前考察了多个候选对象。Vals 还称,其他前沿模型在此前的尝试中未能给出经过验证的解答。该公司没有公布完整的分母数据,即所有模型、提示词、候选谜题和失败运行的完整情况。
缺少这些信息,44 分钟这一数字只能描述一条成功轨迹。它并不能证明 Fable 5.1 解决类似历史谜题的一般概率。
Fable 5.1 的 Cyphral Distich 机制才是真正的重点
重要能力并非暴力穷举,而是将一份文献的结构、语言与历史背景连接成一条可检验的规则。
传统攻击方式显然将这些数字视作外部密码系统的输入。研究者曾考虑替换、频率分析及相关技术。这些方法假定数字序列会借助独立密钥映射到字母或符号。
Fable 5.1 则将文献视为一种数据结构。数量上的对应提供了初始信号:每行有 32 个编号位置,附近也有 32 则 Proquiritations。反复出现的愿望相关语言,则为引言诗与这些章节之间提供了语义联系。
这更接近档案研究,而非传统的密码破译。模型必须检索相关来源、比较文本特征、注意到数字对应关系、提出索引程序,并检查输出结果。
规则一旦说出,听起来很简单。但这种表面的简洁不应掩盖其搜索难题。历史研究者可能花费数年运用复杂方法,却忽略了一条嵌在书籍实体组织结构中的线索。
因此,Fable 5.1 的密码解答展示了一种有价值的机器辅助形式。模型能够在文献之间探索繁琐的组合,同时保留多条较弱线索。它们还可以编写脚本,将历史假设转化为逐位置的验证。
这项能力的意义不止于娱乐密码学。类似工作也出现在历史地图分析、手稿比对、科学文献综述、软件考古,以及涉及零散记录的调查中。
研究者可能面对数千页材料、拼写不一致、不完整扫描件,以及多个看似合理的版本。最难的部分往往在于将正确的来源片段与正确的检验方式联系起来。模型可以将这种搜索从不切实际降为仅仅耗时。
技术讨论中的评论既反映了兴奋,也体现了谨慎。一些读者描述了如何利用模型处理此前因数据录入负担过重而不现实、但长期被忽视的历史项目。另一些人则质疑开放式浏览后选出的答案,其实验分母和可靠性是否足够。
这种分歧捕捉到了真正的意义。该事件并不表明语言模型已经掌握了历史研究。它表明,在人类关注稀缺的领域,模型能够生成值得认真对待的候选发现。
区分生成候选结果与确立一项发现至关重要。一种连贯的解释只是研究的起点,而非最终阶段。解释看起来越有说服力,就越应仔细核验其推导过程。
当模型能够在线搜索时,这一点尤其重要。其训练数据或检索到的页面可能包含被遗忘的提示、部分解答或后来的转录。Vals 将该谜题描述为未解,但已公开的说明没有提供足够信息,无法审计模型访问过的每一个页面。
这使得多种解释都与公开证据相容。Fable 5.1 可能独立提出了这项索引洞见;也可能重组了历史讨论中晦涩的线索;还可能找到了此前未被识别的建议。完整的工具与检索记录将有助于区分这些可能性。
这些情况都不会自动使所提明文变为错误。但它们会影响更强的主张:即该模型独立解决了一个困扰人们数百年的问题。
此案例也凸显了保留研究背景的重要性。一套有用的可搜索知识库应将来源版本、笔记和推导记录保存在一起。否则,一个令人信服的结果可能会脱离其产生所依赖的材料。
第二个密码既加强了论证,也提高了验证门槛
据称,Fable 5.1 将同一思路扩展到更大型的 Urquhart 密码,为该假设提供了更多支持,但也暴露出尚未解决的边缘问题。
Urquhart 还留下了另一道数字谜题,即 Cyphral Octastich。octastich 是一种八行诗。这第二道谜题出现在 1652 年出版的 The Jewel 中,若计入结尾材料,共包含 285 个数字。
据称,模型注意到 The Jewel 有 284 个编号页。它提出,每个连续的密码数字都索引相应页面上的一个词。该词的首字母构成隐藏诗歌中的一个字符。
这产生了另一首保皇党祈祷诗的大部分内容。其诗行提及查理二世、其王室家族,以及对篡夺权威的反对。恢复出的文本遵循 ottava rima 模式,即一种采用 ABABABCC 押韵方案的八行诗形式。
第二个采用相关机制的结果,降低了 Distich 输出仅由无限制模式匹配产生的可能性。两条拟议信息共享同一作者、政治立场、文学形式和书籍索引设计。
然而,Octastich 并不是一次干净的解码。Vals 报告称,其第五行有九个无法读取的字母。拟议的提取过程还遇到了“IRSH”序列,而预期应为“IRISH”。
另一个复杂情况出现在第 158 个位置之后。据称,从第 159 个位置开始,成功解读使用的是前一页,而非原始规则所预期的页面。Vals 提出,重复选择页面或印刷页码重复或许可以解释这一现象。
这些不规则之处未必是致命问题。早期印刷书籍存在拼写变体、排版错误、损坏页面以及不同留存版本之间的差异。现代转录则可能因缺失字符、合并词语和连字符处理不一致而引入更多错误。
然而,每一个例外都会增加对透明证据的需求。当文本变得困难时便改变方法,解码过程可能从破解滑向重建。研究者需要看到哪些选择是在明文出现之前就已确定的。
Vals 的说明称,在 275 个可读的 Octastich 位置中,有 231 个与其页面上首次出现的合适词语相匹配。另有 44 个相差一至三个词,据称是由于可识别的转录差异所致。
这一模式颇具吸引力,但已发布的文章引用的是内部脚本和文件,而非公开完整资料包。读者无法使用模型所描述的确切输入,独立检查全部 285 个坐标。
后续检查增加了支持证据。Bruce Schneier 的密码报道中,一名评论者称,其已根据一份实体 1652 年 Glasgow 版本的研究扫描件,核查了关键的 Octastich 位置。
据报道,该检查复现了第149至157位上那段棘手的序列。它还通过后续字母支持了第158位之后提出的位移。研究者提醒说,其中一个坐标取决于如何计算一个被换行拆开的单词。
这使 Octastich 主张的一部分超越了仅仅听起来合理的明文,但尚未完成验证。以已确认的实体副本为基础,逐坐标进行完整重建,仍是更严格的标准。
因此,这个更大的谜题既是支持性证据,也是一个警示。它表明 Fable 5.1 可能发现了 Urquhart 密码之间真实的家族相似性;同时也说明,历史文本的版本差异会多么迅速地使看似机械的解法变得复杂。
首次反驳揭示了版本问题
最尖锐的质疑并非只是指责模型产生幻觉;它表明,已发布的解释无法经受某一特定数字化见证本的检验。
在 Vals 的文章发布不久后,Reticuli 使用一份大英图书馆胶片和 EEBO-TCP 转录文本发表了复现实验。该测试报告了两项严重冲突。
首先,所检查的 1653 年副本在 Vals 所描述的位置并没有以两行编号文字结束。最后部分包括第32篇 Proquiritation、一则题词、结束标记和勘误表。
其次,该副本中的 Proquiritation 文本无法生成所声称明文所需的若干字母。一个被重点指出的例子是 “KING” 中的 “K”。据报道,对应部分没有任何以 K 开头的单词。
研究者测试了涉及分词、索引、章节映射和字母选择的65种组合。据报道,最佳结果仅匹配了所提议64个字母中的8个。可复现代码和证据后来被放入公开的复现资料包。
这是一项有意义的挑战,因为它针对的是推导过程,而非解码句子是否看起来合理。一副长度和押韵都正确的保王党对句,若无法由所述索引生成,仍然可能是错误的。
这项挑战起初似乎动摇了整个故事。如果引用书籍中不存在该密码,而源文本又缺少必要词汇,那么这一解法可能混淆了不同版本,或建立在缺乏依据的重建之上。
后来的信息使这一结论变得更复杂。一名在 Schneier 网站发表评论的研究者称,苏格兰国家图书馆保存的一份 1653 年存世副本包含 Distich。大英图书馆的见证本显然缺少另一副本中存在的内容。
这种差异在近代早期印刷中是合理的。被称为同一版本的副本,可能包含不同印张、撤换页、增补页、修订文本,或不同的装订历史。数字化见证本只证明该副本的情况,并不自动代表整批印刷品中的每一份。
后续报告还称,Distich 机制可依据 1834 年版本所采用的 Proquiritation 排序进行复现。这表明,早期反驳或许测试了一个正当但不兼容的见证本。
这一事件并未使反驳失去价值。它揭示了原始发布中的重大弱点:Vals 未能清楚标明确切的实体或数字化见证本,以至于其他研究者无法立即选择相同输入。
“该密码文出现在 1653 年作品末尾”的说法过于宽泛。据报道,一些存世副本并不包含它。该书的 Proquiritations 在相关来源之间也存在措辞或顺序上的差异。
这是一个来源问题,即关于某件文献从何而来、又如何变化的问题。来源决定了数值索引指向哪一份文本。一句新增短语就可能改变某一部分后续每个单词的编号。
对于普通阅读而言,两个版本可能传达的思想大致相同;但对于书本密码而言,它们是不同的密码学对象。标点、连字符、拉丁语短语和印刷商的决定都可能改变输出。
因此,最初的反驳与后来的修正传达了同一个教训:AI 辅助的历史发现需要精确的来源标识。当方法依赖单词位置时,书名和出版年份并不足够。
有说服力的明文并不等于完整验证
Fable 5.1 的密码解法拥有强有力的内部证据,但其公开文档仍未达到完整独立审计的标准。
所提议的 Distich 信息具有若干看似独立的检验点:它恰好填满两行、每行32个字母;末词押韵;政治立场与 Urquhart 的保王主义一致;其机制将密文与附近32个章节连接起来。
这些特性使随机巧合的可能性较低,也令答案在情感上令人满足。一旦有人意识到书本身就是钥匙,一个存在数百年的谜题便变得容易。
但这种满足感可能成为验证陷阱。研究者可能把有意义的结果视为每一步中间过程都正确的证明。语言模型会加剧这一风险,因为它们擅长围绕部分证据生成连贯叙事。
最有力的验证应公布精确的扫描标识符、外交式转录文本、分词规则,以及全部64个位置映射。外交式转录会充分保留原始拼写和文本特征,以便进行机械核验。
每个映射都应标明密码位置、选定的 Proquiritation、数值索引、得到的单词和提取的字母。存在歧义的情况应被标记,而不是被悄然规范化。
随后,第二位研究者应在未预先看到所提议明文的情况下复现输出。这可以防止解释性选择在无意识中向预期答案靠拢。
该过程还应区分 1653 年见证本与 1834 年文集版。如果该方法仅能基于后来的排序或措辞生效,研究者必须说明该文本与原始密码之间的关系。
尚未解决的拉丁语计数细节也应得到类似处理。报告显示,至少有一个坐标依赖于将一个短语视为一个单位。该决定需要独立于目标字母的文本或排版依据。
Vals 在文章开头附近采用了谨慎措辞,称模型“似乎”破解了密码。但在其他地方,标题和呈现方式使用了更确定的语言。这种张力在 AI 能力报道中很常见。
标题需要清晰,而研究需要不确定性。结果往往是较窄的保留意见包裹着强烈的公开主张。读者记住的是谜题被破解,而不是尚未解决的来源对应问题。
Anthropic 的角色也应保持清晰。Fable 5.1 是 Claude 模型,但 Vals 设计并报告了这项实验。此处审阅的公开材料并未将该密码结果列为 Anthropic 基准测试或同行评议发现。
模型的表现无法与其周围的代理系统分割开来。搜索访问权限、提示词、上下文管理、工具、token 预算和操作者的筛选标准,共同塑造了结果。
因此,将这次运行称为自主运行会夸大事实。在所报告的44分钟轨迹中没有人类干预,但人类设定了目标、鼓励选择雄心勃勃的问题,并限制了搜索空间。
最准确的描述是,Vals 引导了一次大体自我驱动的研究运行。模型在人类定义的边界内选择并研究了一个可处理的历史密码。
这依然令人印象深刻。对于开发者和企业买家而言,这也是更有用的描述。真实的研究系统通过脚手架、检索、权限和审查运作,而不是依靠孤立的聊天回复。
开放的问题并不是该模型是否产出了有价值的工作。它显然提出了一个值得认真研究的假设。问题在于,在完整推导公开之前,社区是否应将该假设称为已破解的密码。
研究者接下来应关注什么
三项进展将决定这是否成为一项经验证的历史发现,还是一个 AI 研究报告不完整的警示案例。
第一个信号,是与已命名实体见证本绑定的公开64位置 Distich 重建记录。该记录应包括扫描件或稳定的目录参考、精确章节文本、计数规则和提取出的字母。
如果独立研究者能够复现全部64个字母,Fable 5.1 Cyphral Distich 的核心主张将显著增强。如果重建需要反复采用由输出驱动的例外处理,可信度则应下降。
第二个信号,是完整的 Octastich 审计。针对 Glasgow 副本的部分检查已经支持了所提议机制的重要部分。剩余任务是验证全部285个坐标,包括不可读区域和页面位移。
成功的审计将具有重要意义,因为第二个密码提供了一个相关但规模更大的检验。它将表明模型识别出了 Urquhart 更广泛的编码实践,而不是只拟合了一句吸引人的话。
失败并不会自动推翻 Distich,但会将主张缩小为一个谜题,并削弱“共同作者机制解释两部作品”的论点。
第三个信号,是 Vals 或类似评估组织提供更好的实验披露。有用的记录包括初始提示词、考虑过的候选谜题、失败运行、完整检索历史、模型设置,以及生成的验证工具。
在解读前沿模型演示时,这个分母很重要。如果一次成功会话此前经历过两次失败、200次失败,或大量人工筛选,它的意义就不同。
透明披露也将有助于区分模型能力与工具链质量。开发者可以检视,究竟是持久性、上下文长度、搜索策略,还是模型自行生成的代码创造了优势。
这个案例不应被简化为信徒与怀疑者之间的竞赛。早期批评者发现了真实的来源不匹配;后来的调查者则发现,证据显示这种不匹配反映的是副本差异,而非密码根本不存在。
两个阶段都改进了记录。这正是当主张传播速度快于正式发表时,健康验证应有的样子。
对于知识工作者而言,眼下的教训很实用。AI 现在可以以更低成本,将被忽视的文献转化为可检验的研究线索。它可以比较结构、编写验证代码,并持续处理人们往往会放弃的工作。
相应的义务同样实用:保留精确输入,记录转换过程,区分观察与解释,并要求另一人复现具有重要影响的结果。
Fable 5.1 无需取代密码学家才具有意义。它只需要提出专家原本无暇追究的假设。这种角色可以扩大社会所研究的档案材料范围。
然而,速度不能替代来源考证。一个44分钟的答案可以开启一项发现,但最终主张属于那个逐一核查每一份来源、每一个字母的较慢过程。
下一个里程碑不是又一次戏剧性的模型演示,而是一份枯燥、完整、可由独立人士重复的工作表。如果该记录证实了所提议的明文,这段密码长期的沉默将通过机器搜索与人类验证的协作而终结。
在此之前,最准确的结论仍应保持审慎。Fable 5.1 似乎找到了一个颇具说服力的 Cyphral Distich 机制,后续证据也回应了部分早期质疑。完整的公开审计将决定,“已解决”究竟是一项历史事实,还是一个颇具吸引力的暂定标签。



