top of page

Elon Musk 的 AI 驱动 Grokipedia 再次更新,但其黑箱依旧存在

4小时前
讀畢需時 14 分鐘

Elon Musk 的 AI 驱动 Grokipedia 在数月停摆后再次开始更新,尽管它在今年早些时候留下了数千条未解决的建议。近期活动显示,Grok 正在检查文章,并至少接受了一项提交的修正。此次重启已足够明显,但其范围仍不清楚。

这一差别至关重要,因为 Grokipedia 不只是由 AI 撰写页面组成的集合。它是在试验让大型语言模型维护一部公开参考资料库。如果系统可以悄然停止又重新启动,读者就需要证据证明其审核流程依然可靠。

眼下的对手是 Wikipedia 由人类治理的模式。Wikipedia 会公开编辑、回退、讨论和争议,即使这一过程有时会变得缓慢或充满争执。Grokipedia 承诺更快的自动化维护,但其长期停摆表明,当这套机制停止运转时,外界几乎无从得知。

因此,当前活动带来的问题比网站是否仍在运行更加尖锐:自动化百科全书能否提供一份可信、持续且可审计的知识变更记录?

Elon Musk 的 AI 驱动 Grokipedia 再次更新,但并不均衡

新的活动证明 Grokipedia 再次处理了部分变更,但并不能证明它已全面恢复正常运作。

2026 年 9 月 29 日,近期页面活动显示,该网站各处出现了新的检查和变更。据报道,实时动态中的许多条目都带有“重新检查所有参考资料和来源”的指令。这一措辞表明可能存在自动化审核操作,但并未揭示系统究竟检查了什么。

这种模式并不均衡。Barack Obama 的文章显示一则通知,称 Grok 在两天前已对其进行事实核查。The Verge 报道此事期间,Elon Musk 的页面也收到了类似检查。

其他页面仍然陈旧。据报道,通过 Obama 页面链接访问的 Honolulu 文章已长达七个月未被检查。这一反差表明,Grokipedia 并未按照明确公开的时间表进行透明的全站更新。

一项更具体的测试得到了更好的结果。The Verge 向 Gears of War: E-Day 的页面提交了一项修正,请求 Grokipedia 添加该游戏 10 月 6 日的发售日期。

Grokipedia 接受了这项建议并添加了日期。这个例子表明,系统再次能够处理至少部分外部提交内容并修改文章正文。相比单独的自动事实核查标签,这构成了更有力的证据。

第二项请求并未如此迅速地推进。一项关于 Meta 的 Muse 聊天机器人的文章提案仍标记为“In Review”。一项获接受的修改和一项待处理请求,样本量太小,无法衡量恢复后系统的覆盖范围或一致性。

据报道,SpaceXAI 未立即说明究竟重启了什么。它也没有披露底层审核软件是否发生改变。因此,读者无法判断这些活动代表着修复后的流程、有限测试,还是分阶段推出。

在活动变得可见之前,X 和 SpaceXAI 的设计负责人 Benji Taylor 曾给出一个公开信号。他写道,公司并未忘记 Grokipedia,并称 0.2 版本将会改进。这条消息令人困惑,因为 Grokipedia 已在 2025 年 11 月推出过带有该版本号的版本。

据 The Verge 报道,Musk 自 2 月以来一直未在 X 上发布有关 Grokipedia 的内容。这种沉默与他最初宣称该服务将显著优于 Wikipedia 的说法形成对比。

实际结论应当收窄。Elon Musk 的 AI 驱动 Grokipedia 确实再次开始更新,网站也能够处理至少部分提交的修正。但目前公开的信息并未证明其编辑系统的每一部分均已恢复。

这种不确定性直接让人回到此前的停摆——那远不只是几篇被忽视页面的问题。

一个三分钟审核系统变成了持续数月的队列

Grokipedia 的停摆暴露出运营故障:一个快速、自动化的审核系统在没有预警或公开状态说明的情况下停止了运作。

Grokipedia 于 2025 年 10 月 27 日上线,拥有约 88.5 万篇机器生成文章。到 2026 年 8 月,其首页宣称文章数量已超过 600 万篇。快速扩张支持了这样一种观点:生成式 AI 能够比人类编辑者更快地建立参考资料覆盖范围。

用户也可以提出修改建议。一个可见的工作流程会将每项提交标记为“in review”、“approved”、“rejected”或“implemented”。这一界面看起来为纠正模型输出提供了直接途径。

起初,决定来得很快。Renée DiResta 和 Ronald Robertson 的一项审核流程审计引用早期 Tow Center 数据称,中位响应时间约为三分钟。

大约在 4 月 24 日,这些活动停止了。建议仍不断进入队列,但研究人员发现,在随后三个月中没有任何被接受或拒绝的修正。平台没有向用户宣布此次停摆。

研究人员检查了包含 225,496 项建议修改的 34,519 个页面。他们发现仍有 13,002 项建议标记为“in review”。在明显停摆之后,人类用户仍平均每周提交 216 项内容。

这些提交主要并非垃圾信息。标记为“UPDATE_INFORMATION”的事实性修正占数据集的 97%。在停摆之前,Grokipedia 已批准或实施了 76.5% 的事实性建议。

自动化一侧也陷入沉寂。名为“grok”和“Grok Editor”的账户在所分析数据中共生成了全部编辑请求的 57.8%。它们的提交在 3 月至 4 月中旬之间分阶段停止。

公开活动动态带来了另一个问题。此前,它会显示服务中的变更,让研究人员和用户得以有限地了解 Grokipedia 的运作情况。该动态在 1 月中旬至 3 月初之间停止工作。

DiResta 和 Robertson 还比较了约 480 个页面在 4 月 24 日前后的存档版本。他们发现,该样本中的正文没有发生变化。

这些信号合在一起表明,这不只是界面故障。自动化提交停止了,人类建议不断累积,审核决定消失了,存档文章也没有变化。

这次停摆影响了该服务的基本承诺。理论上,AI 百科全书应当能够比志愿者社群更快发现新信息并更新页面。相反,用户不断向一个没有实质回应的队列提交修正。

其中一个例子涉及 SpaceX 于 6 月 12 日进行的首次公开募股。研究人员将该事件作为事实更新提交,因为 Grokipedia 的 SpaceX 文章没有包含它。他们的请求以及类似提交一直处于审核中。

问题并不只是信息过时。贡献者没有收到审核机制已停止的通知。界面继续接受他们的工作,却没有表明该队列缺少活跃的决策系统。

这一经历对构建个人知识库的人很重要。知识系统只有在用户能够判断其来源、修订历史和当前状态时才有用。快速生成无法替代这些信号。

9 月重新出现的活动解决了事件的一部分。它表明系统不再完全休眠,却未解释停摆原因、积压内容还剩多少,或用户是否会获得可靠的状态信息。

Grokipedia 与 Wikipedia 的较量,本质上是自动化与可质疑性的较量

核心冲突并非 AI 写作对阵人类写作,而是不透明的自动化对阵可供外界检查和质疑的流程。

Wikipedia 的模式有着熟悉的弱点。编辑争议可能旷日持久,贡献者社群可能形成根深蒂固的规范,热门议题也会吸引有组织的施压。Musk 围绕这些被认为存在的偏见,构建了他支持 Grokipedia 的理由。

Grokipedia 试图以模型驱动的创作取代这一过程的大部分内容。Grok 撰写文章、审核建议并进行自动检查。人类贡献者可以提出修改,但无法直接编辑已发布页面。

当自动化正常运作时,这一结构为系统带来速度和一致性。模型可以扫描大量页面,应用统一风格,并在无需等待志愿者编辑的情况下评估建议。早期三分钟的中位审核时间说明了这种吸引力。

然而,集中化会将内部故障转化为全站编辑问题。当 Grokipedia 的审核流程停止时,用户无法将工作转交给另一组编辑者。他们只能继续向同一条封闭流程提交建议。

Wikipedia 通过公开历史、讨论页、回退机制和社群规则分散责任。这个系统并不能消除偏见,但它会让分歧可见,并为贡献者提供多种挑战决定的途径。

一项经过同行评审的比较研究考察了 17,790 对来自高编辑频率英文 Wikipedia 页面、相互匹配的文章。研究发现,许多 Grokipedia 文章与 Wikipedia 相似,但其中一个存在差异的子集表现出显著不同。

研究人员报告称,在这一存在差异的子集部分内容中,新闻来源相对更偏向右翼。这一效应在有关宗教和历史的文章中尤为明显。他们更广泛的担忧涉及自动化权威的透明度。

该研究认为,Wikipedia 的开放性使偏见可见且可被质疑。相较之下,Grokipedia 的系统将编辑选择嵌入模型行为之中。读者看到的是最终文章,却看不到每一处措辞决定背后可与之相比的讨论记录。

2026 年 3 月的重写凸显了这一弱点。根据 Lawfare 的审计,对 Grokipedia 文章进行的大规模重新生成切断了建议与其原始高亮段落之间的链接。

一些此前获接受的建议随后显示为被拒绝,因为系统无法再找到所引用的文本。在若干已审核案例中,所请求的变更实际上仍出现在文章里。

这意味着公开日志可能与已发布文本相冲突。贡献者可能看到一项有效修正被标记为拒绝,尽管 Grokipedia 已将其纳入。研究人员无法将该日志视为系统决定的稳定记录。

Elon Musk 的 AI 驱动 Grokipedia 再次开始更新,但新的事实核查时间戳并不能解决此前的不一致。时间戳只能记录一次操作发生过,无法显示 Grok 查阅了哪些来源,或哪些主张发生了变化。

“重新检查所有参考资料和来源”这一措辞也有相同局限。它听起来像是一项指令或流程标签,而不是详细的编辑记录。仅凭这一描述,读者无法判断一个页面是否接受了实质性审核。

维基百科也对人工智能采取了更为审慎的立场。维基媒体社区通常限制未经监督的 AI 生成内容,而基金会则在探索将 AI 工具用于更狭窄的编辑任务。

Jimmy Wales 曾表示,AI 或许可以帮助修复失效链接或改进搜索。他拒绝接受当前大语言模型能够独立产出可靠参考条目的说法。

在一篇周年采访中,Wales 表示,这些模型经常复现维基百科的内容,且在冷门主题上的表现更差。他的批评聚焦于自动化写作的局限,而不只是 Grokipedia 的政治立场。

维基百科也正在与 AI 公司建立商业数据合作关系。Amazon、Meta、Microsoft、Mistral AI、Perplexity 和 Google 已达成面向高流量使用场景的访问安排。这些协议承认维基百科是 AI 系统的基础设施之一。

这形成了一个颇具讽刺意味的竞争格局。Grokipedia 将自己定位为维基百科的替代品,但 AI 生成的知识仍依赖人类创建的来源。与此同时,维基百科在保留人类编辑问责机制的同时,也在尝试使用 AI。

恢复更新并不能决定哪种模式会胜出,但它让比较变得更加具体。自动化提供了规模优势,但参考工具同样需要持久的记录、可见的治理机制,以及可信的纠错路径。

新时间戳并不能证明知识是新的

值得质疑的是,Grokipedia 能否证明其进行了实质且准确的修订,而非只是展示自动化活动的迹象。

事实核查徽章可能代表几种不同操作。模型可能会扫描引文、将陈述与检索到的来源进行比对、重写文本,或只是确认链接仍可访问。Grokipedia 尚未公开说明近期标签由哪种流程产生。

这种模糊性使实时信息流难以评估。许多写着“重新检查所有参考资料和来源”的条目,可能反映了广泛维护;也可能只是排队等待执行的指令,而非已完成的编辑判断。

获得采纳的《Gears of War: E-Day》修正提供了更明确的证据,因为所请求的日期已出现在文章中。然而,一次成功更新无法证明数百万页面都具备准确性。

覆盖范围仍是一个悬而未决的问题。近期检查出现在有关 Obama 和 Musk 的热门页面上,而 Honolulu 的页面则带有七个月前的时间戳。高知名度主题可能比不太显眼的条目更早获得关注。

这将重现公共知识项目中常见的弱点。热门主题会吸引更新,冷门页面则逐渐陈旧。自动化本应减少这种失衡,但前提是系统能广泛且一致地执行检查。

积压队列提供了可衡量的测试。Lawfare 在 8 月发现有 13,002 条未解决建议。SpaceXAI 尚未说明还剩多少、原有排序是否保留,或恢复后的系统是否会重新审议它们。

旧提交也带来了技术问题。锚定某一特定句子的建议,在文章重新生成后可能不再匹配。Grokipedia 过去曾将部分失效锚点视为拒绝,即便其底层修正已经被纳入。

经过修复的工作流应区分无效建议、过时建议、重复更改和锚点失效。把这些结果混为一谈会产生误导性的记录。

该平台的覆盖范围提高了风险。根据 Lawfare 的分析,Similarweb 估计 Grokipedia 在 2026 年 6 月获得了 670 万次访问量。这使这项年轻服务在全球网站中排名第 11,022 位。

其信息也传播到了自身页面之外。Lawfare 引述的 Ahrefs 分析发现,2026 年 3 月,各类 AI 系统中约有 356,000 次 Grokipedia 引用。按同一指标,维基百科约有 2,500 万次引用。

差距很大,但 Grokipedia 的数量并非微不足道。搜索助手和聊天机器人可以在用户不访问原始页面的情况下重复参考内容。因此,过时的陈述可能传播到生成它的界面之外。

这种风险改变了读者应如何理解这次重启。有效的更新机制很有价值,但可靠性取决于变更之后发生的事情。系统需要保留来源脉络、解释决策,并防止已纠正的错误在重新生成过程中再次出现。

学术比较也表明,来源选择值得审视。模型可以引用许多参考资料,却仍会在何种来源应获得更高权重的问题上作出具有重要后果的编辑选择。

Grokipedia 的集中式设计让 SpaceXAI 对这些选择拥有相当大的控制权。对 Grok、检索排序、系统提示词或来源政策的改动,都可能在无需公开社区逐项批准的情况下改变数百万篇文章。

维基百科的方法可能混乱且充满政治性,但其历史记录仍让研究人员能够重建一篇文章如何形成当前版本。Grokipedia 早期不稳定的日志则让这种重建更加困难。

对知识工作者而言,最稳妥的做法并不是拒绝每一个 AI 生成的参考页面,而是将每个页面视为起点,并检查其底层证据。一套知识工作流应当在保留生成摘要的同时保留来源。

Elon Musk 的 AI 驱动 Grokipedia 再次开始更新,但真正有意义的里程碑将是可验证的编辑连续性。该服务必须证明,当模型大规模重写页面时,其记录依然保持连贯。

在此之前,不应将活动等同于问责。

重启给 SpaceXAI 带来的压力大于维基百科

更新重启提高了外界对 SpaceXAI 的期待,因为该公司现在必须说明 Grokipedia 是一款持续维护的产品,还是一项间歇性实验。

维基百科无需以 Grokipedia 的自动化速度来回应这一事件。它的竞争优势在于制度连续性:志愿者持续编辑,公开日志得以保留,即使在争议期间治理机制仍然可见。

SpaceXAI 则面临相反的负担。它可以快速处理变更,但用户需要确信这套机制会持续运行。长达数月的沉默暂停削弱了自动化维护的优势。

该公司尚未公开解释此次中断。它没有指出技术故障、产品重设、安全审查或人员配置决策。缺少这些背景,外部人士无法评估同样的故障是否可能再次发生。

这一点尤其重要,因为 Grokipedia 从大约 885,000 篇首发文章增长至超过 600 万个已列页面。规模放大了维护不完整的成本。每新增一个页面,就多了一个需要来源核查、修正和修订历史的对象。

传统百科全书将其中一部分负担分配给具备领域知识的编辑。Grokipedia 则将大部分任务交给一套技术与组织体系。这种集中化可以加快变更,但也会形成单一故障点。

9 月的活动同样没有伴随常规意义上的重新发布。没有详细的发行说明来描述恢复的队列或新的编辑架构。最明确的公开评论,是 Taylor 承诺 Grokipedia 并未被遗忘。

这条信息承认了认知问题。用户有合理理由质疑该项目是否仍在运营:公开信息流失效,Musk 停止谈论该网站,建议不断积累却没有决定。

恢复编辑仅部分回答了被放弃的问题。SpaceXAI 内部似乎有人正在运营或修改该服务,但这并未揭示它在合并后组织中的优先级。

与此同时,维基百科继续巩固其作为 AI 公司来源的地位。其企业数据协议让模型开发者能够通过为大规模访问设计的基础设施获取内容。

据报道,随着聊天机器人和 AI 摘要截获部分搜索,维基百科的人类流量下降了 8%。但这些系统仍在依赖维基百科由人类策划的材料。

这种动态让两个项目都承受压力,但方式不同。维基百科必须为支撑机器消费的基础设施提供资金。Grokipedia 则必须证明,机器生成可以在不复刻维基百科成果、也不隐藏编辑选择的前提下维护可信知识。

在发布时,Grokipedia 曾在吸引早期关注期间短暂下线。根据发布报道,它恢复时已有近 900,000 篇文章。部分页面与对应的维基百科页面高度相似,而政治敏感条目立即受到审视。

当前重启重复了其中一部分模式:在系统可靠性尚未被独立确立之前,可见活动便吸引了关注。

SpaceXAI 可以通过披露缩小这一差距。它可以公布冻结的原因和持续时间,定义每个状态标签,并报告有多少建议在队列中流转。

它还可以保留完整的文章差异记录,记录模型生成的变更,并区分自动检查与实质性修订。这些措施将使研究人员能够核实重启是否真正改善了知识库。

若没有这类证据,维基百科仍拥有更有力的问责论据。Grokipedia 或许能更快更新,但只有读者能够信任从来源到已发布主张的路径时,速度才有意义。

因此,压力不在于让 Grokipedia 模仿维基百科的每一个流程,而在于让 SpaceXAI 证明自动化治理能够以自身方式变得可观察、稳定且可纠正。

三个信号将显示 Grokipedia 是否真正回归

下一项测试是持续运行,而不是在热门页面上再度爆发一阵可见活动。

首先,关注未解决建议队列。关键问题在于,8 月发现的 13,002 个待处理项目是否开始获得有区分度且可信的结果。

积压数量下降将表明审查引擎处理的不只是新的、容易的提交。已发布的变更也应与其记录状态相符。如果被接受的修正出现在文章中,而被拒绝的修正附带有用理由,可靠性的论据便会增强。

如果队列依然庞大,而新提交只是偶尔成功,那么这次重启看起来便是不完整的。这将表明 Grokipedia 可以展示活动,却未能修复累积的编辑债务。

其次,关注 SpaceXAI 的公开解释。该公司应说明 4 月 24 日前后发生了什么,以及在 9 月重启前作出了哪些改变。

技术说明将澄清暂停是否涉及基础设施、模型行为、安全控制或计划中的重新设计。它也将表明现在是否已有监控机制来防止再次无声停摆。

没有解释将削弱 Grokipedia 作为负责任公共基础设施运行的论据。当系统所有者不承认长期故障时,用户无法评估复发风险。

第三,在接下来一到三个月比较文章变更。研究人员应检查涵盖热门人物传记、时事、技术主题和低流量页面的样本。

最有力的证据将包括实质性修订、准确来源、稳定历史记录,以及该样本中一致的审查时间戳。独立研究人员应当能够复现这些发现。

一个主要由通用参考核查通知构成的信息流,所提供的证据会更弱。若更新集中在涉及 Musk、政治或其他高度关注议题的页面上,情况也是如此。

Elon Musk 的 AI 驱动百科 Grokipedia 正在再次更新,但其回归应从这三个信号来判断:积压减少、运营披露,以及可由独立方验证的文章改进,将有助于支持 SpaceXAI 关于其构成可信替代方案的说法。

这次重启仍值得关注。AI 生成的参考信息系统将越来越多地影响搜索结果、聊天机器人的回答,以及人们在工作中使用的材料。它们的可靠性不能取决于访客是否恰好注意到某个信息流停止更新。

目前,读者应检查 Grokipedia 的引用,将重要主张与其他来源进行比较,并留意每个页面的修订历史。开发者不应把近期的事实核查标签视为当前准确性的证明。

更大的实验已不再是 AI 能否生成一部百科全书。Grokipedia 已经证明,它能够生成数百万个页面。更难的问题是:一部由 AI 运营的百科全书,能否通过日常更新、故障与纠正来维持公众信任。

关注 Grokipedia 接下来会改变什么,再观察其记录是否说明了原因。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page