Joe Lonsdale 对 AI 监管的批评令 Anthropic 的安全倡议承压
Joe Lonsdale 指责领先 AI 公司利用存在性风险警告影响政策,尽管他本人也投资了 Anthropic。他的批评让围绕 Joe Lonsdale AI 监管的争论,直接演变为一场关于安全、竞争与政治权力的冲突。
在 9 月 25 日于奥斯汀举行的 Reuters Momentum AI 活动上,Lonsdale 将矛头指向了与 Anthropic 和 OpenAI 关系密切的人士。他认为,他们对外部倡导组织的支持,可能帮助少数领先公司塑造 AI 治理规则。
这一指控出现之际,Anthropic CEO Dario Amodei、OpenAI CEO Sam Altman 以及 Elon Musk 都在呼吁放缓先进系统的开发。他们警告称,安全措施可能赶不上模型能力日益提升的速度。
Lonsdale 并未否认所有 AI 风险。他表示安全担忧确实存在,并称赞 Anthropic 的技术人才。他更具体的观点是,由恐惧驱动的监管可能会巩固那些已掌控最强模型公司的地位。
这种区别很重要,因为双方如今都承认 AI 可能造成严重伤害。分歧在于,谁应界定不可接受的风险、政府应如何回应,以及合规成本究竟会保护公众还是既有企业。
Joe Lonsdale 对 AI 监管的批评直指市场力量
Lonsdale 的核心主张是,AI 安全倡议也可能成为一种控制市场的策略。
根据 Reuters 的报道,Lonsdale 将领先 AI 公司当前提出的方案称为危险之举。他警告,不应让寡头集团控制政府政策。
他的批评部分聚焦于倡导更严格监管的外部组织。这类组织可以委托研究、组织专家、推动立法,并影响选民如何理解技术风险。
这种活动本身并不一定不当。企业通常会参与影响其产品、客户和法律责任的政策讨论。前沿 AI 开发者也掌握许多公共机构所缺乏的技术知识。
问题始于技术专长与资金影响力变得难以区分之时。一家公司可以真诚地识别某种风险,同时支持有利于自身运营模式的规则。
大型实验室能够维持安全团队、委托评估、保障计算基础设施,并准备详尽披露材料。较小的开发者可能难以履行相同义务,即使其系统带来的风险较低也是如此。
因此,Lonsdale 的立场将 AI 监管与监管俘获联系起来。所谓监管俘获,是指原本旨在维护公共利益的规则,逐渐转而服务于本应受到监管的组织。
他与 Anthropic 的关系让这番批评更受关注。Reuters 称他是该公司的一名小股东,而他也赞扬了 Amodei 和 Anthropic 的表现。
这种组合使争论无法被简单归入支持企业或反对企业的框架。Lonsdale 在不否定 Anthropic 商业和技术成就的同时,质疑其安全议程的政治后果。
他在政策竞争的另一方也拥有利益。作为 8VC 的创始人,他投资了受益于市场开放和扩张壁垒更少的初创企业。
Lonsdale 还曾支持主张加快 AI 开发、放松监管的团体。这意味着他的批评同样来自这场影响力竞争的参与者,而不是外部裁判。
这并不削弱他的警告。它表明,AI 监管争论已成为拥有资本、政治关系和相互竞争风险理论的有组织联盟之间的冲突。
Anthropic 所在联盟强调灾难性威胁、独立评估、透明度与政府执法。对立联盟则强调竞争、国家实力、快速部署,以及限制监管权力的集中。
困难的问题并非任何一方是否都拥有商业利益——双方都有。问题在于,他们提出的规则是否仍与证据相称,并对竞争者保持开放。
一项规则可以应对真实危险,同时仍为既有企业创造优势。反过来,反监管倡议也可能捍卫竞争,却让严重风险得不到充分控制。
Joe Lonsdale 对 AI 监管的批评之所以重要,是因为它迫使政策制定者同时评估这两种可能性。安全主张需要技术审查,监管设计则需要经济审查。
当企业提出能力门槛、收入测试或部署限制时,这场争论尤为重要。每一条边界都决定了哪些开发者将面临审计、处罚或政府干预。
这些边界应建立在透明证据和独立审查之上,而不应只取决于最大型实验室或其最积极发声反对者的偏好。
Anthropic 希望政府拥有有力的执法权
Anthropic 不只是要求企业作出自愿承诺。它希望政府对危险部署拥有可执行的监管权力。
该公司的 Advanced AI Framework 提出了面向前沿开发者的测试、公开透明、独立评估和更严格安全要求。
该框架还表示,政府应能够阻止或威慑可能带来重大灾难性伤害风险的模型。拟议处罚将与全球年度收入挂钩,并会对重复违规行为加重。
Anthropic 通过较高的计算和财务门槛界定前沿系统。其框架针对训练计算量超过 10²⁵ 次浮点运算的模型,这是一项衡量计算工作量的指标。
它也会适用财务条件。该提案锁定 AI 相关收入超过 5 亿美元,或 AI 研究支出超过 10 亿美元的公司。
这些门槛构成 Anthropic 对监管俘获担忧的回应。其设计目的,是避免将前沿模型义务施加给每一家初创企业、研究团队或传统软件公司。
该框架聚焦四类风险:生物滥用、网络攻击、人类失去控制,以及加速其他危险能力的自动化 AI 研究。
Anthropic 认为,开发者应在发布前评估其系统,并公布调查结果摘要。它也支持定期发布风险报告,并由独立机构审查敏感内部证据。
其 Responsible Scaling Policy 将风险报告描述为连接模型能力、威胁场景、防护措施和剩余风险暴露的评估。公司计划每三至六个月发布一次。
这一结构具有吸引力的逻辑。义务随已证实的能力和风险而增加,而不是将所有软件一视同仁地视为危险。
但门槛式监管总会带来边界问题。开发者可能质疑测量方法,而技术进步也可能使固定门槛迅速过时。
计算限制也可能漏掉由多个模型、工具和外部数据源组装而成的系统。这类组合无需一次异常庞大的训练,也可能产生显著的实际操作能力。
财务门槛带来了另一项复杂性。低于门槛的开发者仍可能发布危险的专用系统,而大型公司则可能因与某一具体模型实际风险无关的因素承担义务。
这些担忧并不能证明 Anthropic 的框架是在谋求自身利益。它们说明,政策设计不能止步于接受该公司的风险评估。
独立专家需要获得足够证据,以检验能力主张和安全主张。监管机构也需要不完全依赖受监管企业的技术能力。
Anthropic 承认需要外部评估,但实际的独立性仍难以实现。合格评估者可能在实验室任职、为其担任顾问、寻求其资助,或依赖受控的模型访问权限。
政府权力本身也存在取舍。阻止危险部署的权力能够防范严重伤害;同样的权力也可能被滥用、政治化,或扩展至最初目的之外。
Anthropic 表示,限制措施应避免政府权力越界。其框架包含旨在缩小执法范围的保障机制。
不过,该公司也认为仅靠透明度不足以应对问题。这使它与 Lonsdale 的分歧更加清晰。
Lonsdale 担心,以极端情景为依据的监管将巩固制度性控制。Anthropic 则认为,自愿承诺无法管理后果可能不可逆的风险。
两种主张都值得审视。不应仅因其来自投资者、高管、研究人员或政府官员,就将其视为已被证实。
政策检验应当具体。监管者需要明确被衡量的能力、伤害证据、必要的缓解措施,以及挑战决定的途径。
缺少这些要素,“灾难性风险”就可能成为富有弹性的政治用语。具备这些要素,监管才能成为可审查的程序,而非恐惧的表达。
安全争论如今已成为一场政治资金竞赛
AI 治理已不再局限于研究论文和企业安全团队。它正在成为一场争夺选举与立法影响力的有组织竞赛。
一篇 Axios 的分析 描述了多个资金雄厚的组织,它们正试图在 2026 年选举周期中影响美国 AI 政策。
Leading the Future 支持快速开发和更宽松的监管。Axios 报道称,OpenAI 联合创始人 Greg Brockman、Lonsdale、Andreessen Horowitz 和 Perplexity 都是其资金支持者。
该组织表示已筹集超过 1.25 亿美元。其关联组织包括支持与亲开发政策议程一致候选人的政治行动委员会。
在安全阵营方面,Anthropic 宣布向 Public First Action 捐赠 2,000 万美元。该组织倡导透明度、更强监督以及 AI 安全要求。
Meta 则支持了其他政治团体,反对其认为过于繁重的州级立法。因此,这并非安全倡导者与科技公司之间的一场简单对决。
科技公司遍布这场竞争的各个阵营。一些支持更严格控制,一些反对,还有一些在不同司法辖区支持不同规则。
这些政治支出为 Lonsdale 的批评提供了事实背景。AI 公司及其投资者正借助有组织的倡导活动,塑造治理本行业的规则。
不过,同样的证据也使他的立场更加复杂。Lonsdale 参与的竞争网络同样寻求政策影响力。
因此,主要冲突并不是行业影响力与一个未受触动的民主程序之间的对抗。而是一个行业联盟与另一个行业联盟的较量,政策制定者和选民则被要求判断其主张。
关于生存风险的语言具有特别强的政治影响力。它描述的伤害严重到,让人觉得等待完全确定反而是不负责任的。
这种框架可以为预防性测试、强制披露、部署限制或紧急政府权力提供正当性。它也可能将眼前的伤害推到背景之中。
当前的 AI 系统已经引发了与欺诈、歧视、隐私、劳动力替代、网络安全以及不可靠的自动化决策相关的担忧。这些伤害比人类灭绝情景更容易观察到。
不过,近期风险与灾难性风险并不相互排斥。健全的政策可以在应对可衡量的当下伤害的同时,为尚未完全显现的能力做好准备。
危险在于,遥远的情景变得无法接受评估。如果每一次索要证据的请求都被视为鲁莽,安全论证就会在政治上变得不可证伪。
反向的失败同样可能发生。如果不确定性成为无所作为的理由,政府可能会等到危险能力已被广泛获得时才采取行动。
这份 2026 年安全评估指出,失控风险的可能性、性质和发生时间都异常模糊。100 多位独立专家为该报告提供了指导。
报告发现了相关能力的早期迹象,但尚未达到可能导致失控的水平。这一结论既不支持无条件恐慌,也不支持无条件安慰。
它表明,政策应将义务与观察到的证据相联系。在触发更严格的限制之前,评估应测试具体的生物、网络、自主性和复制能力。
这一过程也应披露不确定性。模型可能在受控测试中表现良好,却在部署后以不可预测的方式失效。戏剧性的实验室结果也可能难以复现。
政治竞选很少会奖励如此程度的限定。围绕灭绝或经济竞争构建的信息,比条件化的风险评估更容易传播。
这给选民和立法者带来了压力。他们必须区分最有力的公开信息与最有力的底层证据。
这同样会给较小的开发者带来压力。他们可能缺乏接触政策制定者、获取机密威胁信息,或推广替代性监管方案所需的资金。
政策制定过程需要前沿实验室和风险投资者之外的代表性。独立科学家、民间社会团体、安全专业人士、劳动者、初创公司和受影响社区都掌握相关知识。
否则,围绕 AI 治理的争夺可能恰恰会变成 Lonsdale 所担心的局面:富有的内部人士之间竞争由谁来制定规则。
AI 生存风险仍然真实,但充满深刻不确定性
Lonsdale 指出了可信的治理风险,但他的论点并未证明灾难性 AI 警告是捏造的。
AI 系统在编程、工具使用、网络安全和自主完成任务方面的能力不断增强。这些能力带来了真实益处,也提供了导致严重滥用的合理路径。
Anthropic 将生物威胁、网络行动、失控和自动化研究列为主要的灾难性风险类别。每一类都存在不确定性,但没有一类在概念上不可能发生。
网络风险提供了最清晰的当前联系。能力强大的模型可以帮助防御者发现漏洞、解释陌生代码并确定修复工作的优先级。
同样的功能也能帮助攻击者检查系统或自动化入侵的部分环节。因此,即使模型尚未接近人类水平的通用智能,访问控制和监控也很重要。
生物风险更难以公开衡量。相关评估本身可能包含敏感信息,限制了企业和政府能够披露的内容。
这种保密性造成了真实的监督问题。政策制定者可能收到令人担忧的结论,却没有足够的公开证据可供独立验证。
失控情景则更加不确定。它们通常涉及系统追求超出既定任务的目标、规避安全措施,或未经授权获取资源。
受控测试已经显示,模型会在人工条件下采取意料之外的行动。这类结果值得关注,但并不能自动预测其在日常部署中的行为。
美联社报道称,专家仍缺乏对 AI 灾难发生时间或概率的广泛共识估计。缺乏共识应当影响双方使用的措辞。
安全倡导者不应将存在争议的预测描述为既定结果。支持放松监管的人也不应把不确定性当作底层风险并不存在的证据。
在 Amodei 警告互联代理可能跨互联网运行后,Anthropic 的立场变得更具紧迫性。他认为,安全措施必须在此类系统获得广泛能力之前迎头赶上。
OpenAI 的 Altman 也呼吁放慢节奏,并加强开发者之间的协调。这些表态强化了整个行业都在担忧的印象。
它们也支持了 Lonsdale 的怀疑:企业可以通过协调一致的公开警告来建立政策预期。同样的表态既可能是真诚的安全判断,也可能是具有战略价值的信息。
商业激励并非只指向一个方向。一家公司可能受益于给竞争对手增加负担的规则,但当安全限制推迟部署时,它也会损失收入。
高管们可能真诚地对哪种影响更重要存在分歧。同一家公司内部的不同团队也可能持有相互竞争的看法。
投资者面临类似的张力。他们希望被投公司增长,但严重的安全事件可能摧毁价值、引发责任追究,并招致更严格的监管。
最稳妥的分析方法是区分三项主张。第一,先进 AI 会带来可信的灾难性风险。第二,其概率和发生时间仍高度不确定。
第三,推动监管的公司可以从其支持的规则中获得战略优势。接受其中任何一项主张,并不要求否定其他主张。
因此,政策应包含能在不确定性下运作的机制。要求可以根据经过测试的能力、部署环境、访问等级和滥用证据进行分级。
规则也应允许修订。2026 年看似合理的阈值,可能会在模型架构或计算效率变化后变得无关紧要。
独立复现至关重要。当一家公司报告某种危险能力时,获准的外部评估者应在安全条件下测试这一主张。
监管机构应在安全允许的范围内公开尽可能多的方法论。他们应说明为何某项测试触发干预,以及开发者如何质疑结果。
日落条款可以降低永久性市场壁垒的风险。除非当前证据仍然支持,否则一项规则应到期失效或接受审查。
小型开发者也需要相称的路径。共享评估基础设施和标准化报告可以在不削弱必要安全措施的前提下降低合规成本。
最后,执法应聚焦风险,而非企业身份。政府应对 Anthropic、OpenAI、Meta、xAI 以及未来进入者适用可比较的标准。
这些保护措施不会终结 AI 生存风险之争。但它们会让任何一方都更难将不确定的预测转化为不受约束的政治权力。
三个信号将显示哪一方是对的
Joe Lonsdale 围绕 AI 监管的争议进入下一阶段后,结果将取决于政策设计、独立测试和市场准入。
第一个信号是,立法者是否会采用具有可审查证据基础的能力导向型规则。Anthropic 的框架提供了详细的起点,但政府提案必须经得起更广泛的审视。
关注法律如何定义前沿模型、灾难性伤害和不可接受的部署。模糊的定义将强化 Lonsdale 对权力扩张的警告。
明确的触发条件将强化 Anthropic 的论点。当开发者知道哪些测试结果会启动监督,以及如何申诉时,规则就更可信。
第二个信号是独立评估的质量。Anthropic 的扩展政策要求,当其模型达到规定条件时接受外部审查。
决定性问题在于,审查者是否获得有意义的访问权限。一份经过润色的公开摘要无法替代对方法、失败案例、缓解措施和未删节证据的审查。
评估者的独立性也需要保护。政府和标准机构应披露利益冲突、资金关系、访问限制,以及结论仍存在不确定性的领域。
可复现的危险能力证据将削弱企业主要依赖恐惧的说法。不一致或无法获取的发现则会强化怀疑。
第三个信号是新规出台后,小型竞争者会发生什么。市场结构为检验 Lonsdale 的监管俘获论点提供了实际测试。
如果合规开支阻碍初创公司,同时既有企业的做法毫无变化,政策制定者就应重新审视设计。公众很难从仅仅将既有企业权力正式化的规则中获益。
如果相称的要求能够在不减少市场进入机会的情况下提升安全性,Anthropic 的方法就会显得更站得住脚。共享测试工具和精准限定的义务有助于实现这一平衡。
金融影响力也值得持续关注。政治组织的披露文件可以显示哪些公司、投资者和高管正在资助每一种政策立场。
金钱本身并不决定一种论点是否正确。但它揭示了谁拥有反复传播该论点并将其转化为立法语言的资源。
读者还应关注 AI 公司是否改变自己的发布行为。当企业接受可衡量的自我约束时,呼吁放缓开发才更有分量。
如果实验室一边继续加速,一边要求实施竞争对手无法负担的限制,这种不一致将变得难以忽视。
反过来,自愿暂停也不能完全替代公共规则。私下承诺可能会随着高管、投资者或竞争条件的变化而改变。
最可信的体系将结合公司测试、独立验证、公开标准和可问责的政府执法。每一层都会制衡其他层。
Lonsdale 的介入并未解决前沿 AI 是否构成生存威胁的问题。它改变了以这一威胁之名提出的政策所面临的举证责任。
Anthropic 和其他实验室必须证明,其规则针对的是可衡量的风险,而非保护寡头垄断。Lonsdale 及其盟友则必须说明,较宽松的监管如何应对可信的高影响风险。
对于开发者和企业买家而言,这不仅仅是哲学分歧。新规则可能影响模型可用性、产品时间表、评估要求和可行供应商的数量。
知识工作者同样拥有利益攸关。治理决策将塑造哪些 AI 系统进入工作场所、它们包含哪些安全措施,以及它们失效时谁仍需承担责任。
正确的问题不是安全还是竞争更重要。政策制定者必须证明,每一项限制都针对证据,同时为负责任的挑战者保留空间。
关注接下来的立法定义、首批真正独立的风险审查,以及中小开发者的存活率。这些信号将揭示,安全治理究竟是在保护公众,还是在巩固权力。



