OpenAI 向 10 万名研究人员提供免费 AI 访问权限,但仍不开放模型权重
- Aisha Washington

- 7月31日
- 讀畢需時 16 分鐘
OpenAI 正向 10 万名高校研究人员免费提供前沿模型访问权限,但模型权重和训练数据仍不对他们开放。这项公告迅速登上 google news,因为它将大规模访问扩展与长期存在的透明度争议结合在了一起。
新的 ChatGPT for Academic Researchers 计划面向入选机构中的科学家、数学家和工程师。OpenAI 表示,首批 1 万名参与者将在今年夏季获得访问权限,随后将在 2027 年前逐步扩大覆盖范围。
参与者可使用 GPT-5.6 模型、Codex、deep research、更大的上下文窗口以及专门的研究工具。每位获批研究人员还可邀请同一机构内的四名合作者。
对于无法常态化为每位研究人员提供前沿订阅服务的实验室而言,这套方案能够降低实际使用门槛。它也让 OpenAI 能够直接接触具有价值的科学工作流程和反馈。
不过,免费产品访问并不等同于开放的科学访问。研究人员可以向模型提问,却无法检查底层参数、复现训练过程,或独立保存固定版本的模型。
这一区别构成了核心矛盾。OpenAI 希望其系统融入整个科学研究过程,同时仍保留对这些研究人员必须评估、引用和信赖的系统的控制权。
OpenAI 向 10 万名研究人员提供了什么
该计划扩大了对高级 AI 工具的访问,但参与资格仍由 OpenAI 和入选学术机构控制。
OpenAI 于 2026 年 7 月 29 日宣布推出 ChatGPT for Academic Researchers。其 research access program 承诺向科学、数学和工程领域的 10 万名研究人员提供免费账户。
首批将包括 2026 年夏季期间的 1 万名研究人员。OpenAI 指出,高等研究院和法国巴黎高等师范学院已在获得访问权限的机构之列。
OpenAI 计划在 2027 年前达成覆盖 10 万人的目标。这一安排意味着该项目将分阶段在机构层面推出,而非立即向所有拥有学术邮箱的人公开发布。
申请者必须就职于具备大量研究活动的合资格学术机构。他们需要验证所属关系,并说明正在进行的研究及预期的科学用途。
获批研究人员可以邀请四名本机构合作者。这些合作者必须各自完成验证,且每个账户都会计入该计划公布的容量上限。
参与者可通过 ChatGPT、ChatGPT Work 和 Codex 访问前沿模型。初始套餐包括 GPT-5.6 Sol Pro,OpenAI 将其定位为适合解决高难度科学和数学问题的工具。
ChatGPT Work 支持耗时更长的项目,包括文献综述、论文准备、基金申请和研究沟通。Codex 则更侧重于代码、数据分析、调试和可重复的计算工作流程。
扩展版 deep research 可以跨多个来源搜索、比较并综合资料。上下文窗口是指模型在一次交互中能够处理的信息量。
更大的上下文窗口可容纳更长的论文、数据集、代码文件或实验记录。但这并不保证模型能够正确理解每一项细节。
该计划还提供超过 75 项生命科学技能。OpenAI 表示,这些技能覆盖遗传学、基因组学、测序、蛋白质建模和药物发现等领域。
连接器可将文献数据库、笔记本、参考文献管理器、公共数据集和其他研究平台中的外部信息引入工作区。这些连接减少了在不同工具之间手动传输信息的需求。
OpenAI 表示,参与计划的工作区将获得企业级隐私和安全控制。该公司称,这些环境中的数据默认不会用于训练其模型。
这一承诺对于未发表的论文、早期假设和敏感的机构材料尤为重要。研究人员仍需遵守所在大学的数据治理和研究伦理要求。
该计划还包括培训和实操支持。OpenAI 表示,熟悉研究工作流程的专家将帮助研究人员把这些工具融入工作。
这种支持使该计划不同于简单的账户赠送。它让 OpenAI 能够研究前沿模型在真实实验室中的表现,同时研究人员也能获得调整研究方法的协助。
该计划与 OpenAI 现有的 Researcher Access Program 并行,后者为获批研究提供有限的 API 额度。此前的计划主要支持针对负责任部署、安全性、稳健性和社会影响的研究。
新计划的学科覆盖更广。它面向利用 AI 开展科学研究的研究人员,而不仅仅是研究 AI 系统本身的研究人员。
这一界限至关重要。研究蛋白质相互作用的生物学家,与调查语言模型为何会出现不可预测行为的计算机科学家,需要的访问权限并不相同。
前者可以从托管工具中获得显著收益。后者则往往需要新计划并未提供的内部访问权限。
为什么 Google News 标题很重要
该计划的规模强化了 OpenAI 在学术研究领域的地位,同时也对大学、公共项目和竞争模型提供商施加了压力。
google news 的表述强调免费访问,但更大的故事在于科学基础设施。OpenAI 正试图在机构实践尚未定型之前,成为研究工作流程中的标准层。
OpenAI 表示,每周约有 130 万人使用 ChatGPT 开展高级科学和数学工作。根据该公司的内部分析,这些用户产生了约 840 万条消息。
这些数据尚未经过独立审计。但它们仍显示了 OpenAI 对这一机会的定义:研究人员已经在使用其产品,但访问权限和机构支持仍不一致。
该公司称,高频用户会将比同侪更具挑战性的任务交给 AI。最高使用量群体中,近 7% 的请求对应预计需要四小时或更长时间的人类工作。
对照组则有 3.5% 的请求涉及类似高难度工作。OpenAI 将这一差距解读为,熟悉工具会促使研究人员尝试更具雄心的任务。
使用量并不能证明科学价值。耗时更长的任务可能产出有用的分析、存在缺陷的结果,或需要比原始工作投入更多核查的答案。
不过,反复使用能够影响实验室习惯。研究人员会开始围绕某个平台设计工作流程,在其中存储项目上下文,并教导同事使用其界面。
这会给大学带来压力。机构必须决定哪些研究数据可以进入托管系统、应如何披露 AI 辅助工作,以及由谁验证生成的分析结果。
大学还面临访问公平问题。如果一个院系加入计划、另一个院系仍被排除在外,研究人员可能会因机构资格不同而获得不同的计算支持。
公共基础设施项目也面临类似压力。美国国家科学基金会的 national AI resource 旨在将研究人员与计算、数据、模型、软件和培训资源连接起来。
公共倡议旨在分配访问权限,同时避免让单一商业平台成为默认入口。它们通常需要经历更缓慢的资金、资源分配和采购流程。
OpenAI 可以更快地配置托管账户。它已具备大规模推出所需的模型、界面、支持系统和身份控制能力。
这种速度赋予该公司采用优势。研究人员无需等待大学建设基础设施或获得专用计算能力,便可开始测试工作流程。
竞争 AI 公司必须应对同样的动态。若一家模型提供商在基金申请、分析和发表过程中变得熟悉,它便能在研究人员的日常工作中占据有价值的位置。
压力并不局限于匹配免费账户。竞争者必须在一个可用的整体方案中提供模型、机构级隐私、领域工具、协作功能和技术支持。
OpenAI 一直围绕这种组合扩展其更广泛的科学战略。其 national science plan 包括与大学、美国国家实验室和能源部开展的合作。
该公司通过模型访问、API 资源、技术协作和定向科学项目支持研究人员。它还已在国家实验室的计算环境中部署推理模型。
学术计划将这一战略扩展到集中式政府合作之外。它为 OpenAI 打开了通往更多学科、机构和早期研究项目的渠道。
直接受益的是入选研究人员。从长期战略看,受益的是其工具在整个研究生命周期中变得熟悉的公司。
这并不意味着该计划出于玩世不恭的动机,或缺乏科学价值。它意味着这一提议应同时被视为研究支持和平台扩张。
免费访问不等于开放访问
研究人员可以免费使用 OpenAI 的模型,但仍无法独立检查、保存或修改产生研究结果的系统。
模型权重是训练过程中学习到的数值参数。权重共同编码了决定模型如何响应输入的统计模式。
开放权重访问允许研究人员下载这些参数,并在自己的基础设施中运行模型。它也可以在不依赖提供商托管界面的情况下,实现微调、受控修改和测试。
OpenAI 的学术计划并未为其前沿系统提供这种访问权限。研究人员只能通过仍由 OpenAI 运营的产品和服务进行交互。
该公司也未披露这些系统背后的完整训练数据集。这限制了研究人员将输出追溯至可能训练来源的能力,也限制了他们衡量各种形式污染的能力。
当 AI 系统本身成为研究方法的一部分时,这一区别最为重要。科学家可能发表由某个模型生成的结果,而该模型之后可能发生变化或消失。
托管模型的权重、安全层、工具或系统指令可能更新。研究人员无法控制这些变化的时间,也无法获得完整文档。
因此,同一提示词在数月后可能产生不同结果。随机性本已会造成差异,而提供商侧更新又增加了另一种不确定性来源。
研究人员可以记录模型名称、日期、提示词和输出。这些记录能提高透明度,但无法重现已经无法使用的模型版本。
这正是为什么 google news 的标题只呈现了访问问题的一半。消除订阅门槛能够扩大参与范围,而封闭权重则保留了对 OpenAI 的依赖。
计算科学中的可复现性标准通常要求研究人员保存代码、数据、配置和训练好的模型。Nature Methods 的一项可复现性框架将存档模型权重视为实现机器学习可复现性的基本要求。
前沿语言模型使这一标准难以适用。其规模、训练数据、计算需求和商业价值,使普通实验室无法从头复现它们。
研究人员仍然可以复现其周边工作流。他们可以保存提示词、输入数据、检索方法、评估代码和中间输出。
这种方法支持程序透明度,但无法完全揭示模型的内部行为。它也依赖于 OpenAI 持续提供兼容的访问方式。
封闭访问还给独立安全研究带来另一项问题。评估偏见、鲁棒性、记忆化或隐藏能力的研究人员,往往需要稳定且广泛的测试条件。
托管访问可以支持黑盒评估,即通过系统的输入和输出来研究系统。它无法提供与直接分析权重或训练数据相同的证据。
速率限制、政策执行、监控和产品变更,也会影响哪些实验仍然可行。OpenAI 保留界定可接受使用方式以及限制账户的权力。
这些控制措施可以减少滥用并保护服务可靠性。它们也可能让被调查对象掌控调查者的访问权限。
这一问题并不能简单划分为开放即好、封闭即坏。开放权重发布也会带来自身的安全、隐私和保障问题。
一旦权重被下载,原始提供方就无法可靠地收回它们。用户可以移除防护措施、针对有害任务微调系统,或分发修改后的版本。
即使是开放权重模型,也可能依然不透明。其开发者可以不公开训练数据、数据清洗方法、评估细节,或用于训练的代码。
Nature 对开放 AI 系统的一项分析指出,开放性存在于多个组成部分之中。仅有权重,并不能让人完整了解数据、劳动力、基础设施或开发决策。
因此,OpenAI 的提议处于更广泛光谱的一端。它在扩展受控使用的同时,仍保留了实现更深层技术独立性所需的组成部分。
OpenAI 封闭模型的权衡
OpenAI 正在选择广泛的托管访问而非不受限制的技术访问,在优先推进受控部署的同时,接受独立验证受限的代价。
OpenAI 认为,前沿模型可能带来严重的滥用风险。托管访问使该公司能够监控活动、执行政策、更新防护措施,并在问题出现时作出响应。
这些控制在生物学、网络安全及其他领域尤其重要,因为能力强大的模型可能协助开展有害工作。该学术项目涵盖来自多个敏感领域的研究人员。
机构验证又增加了一层问责。申请者必须说明其所属机构和拟开展的研究,而协作者则必须核实自身与机构的关系。
隐私控制措施保护参与研究人员的数据,使其默认不会被用于模型训练。与此同时,OpenAI 仍在运营承载这些保护措施的环境。
这种结构类似于使用一台托管式科学仪器。研究人员可以使用其能力,但供应商拥有其内部设计,并控制未来版本。
这一类比也有局限。传统仪器通常可以依据公开标准进行校准,并通过已知的物理程序进行测试。
前沿语言模型结合了概率性行为、未披露的数据、隐藏的系统指令和不断变化的软件服务。这种组合使独立校准变得复杂。
因此,研究人员必须区分两个问题。第一个问题是,该系统是否有助于完成科学工作。第二个问题是,科学家能否独立验证该系统本身。
OpenAI 的项目直接回应了第一个问题。它为研究人员提供分析、编程、文献工作、假设生成和沟通工具。
它对第二个问题的帮助则少得多。研究可解释性、训练数据、模型内部机制或可复现性的研究人员,仍然缺乏所需访问权限。
这构成了该项目的核心权衡。受控部署可以降低某些风险,但控制权也将科学影响力集中在模型提供方手中。
OpenAI 决定哪些机构符合资格、哪些模型继续可用、包含哪些工具,以及哪些用途符合政策。它可以随时间改变每一项条件。
研究人员也可能面临便利性与方法学纪律之间的冲突。托管助手可以比团队逐一检查每个步骤更快地生成有用代码或解释。
这种速度会鼓励采用。它也可能使不确定的输出更难被察觉,尤其当它们以润色过的文字、看似合理的公式或可运行的代码呈现时。
科学团队必须在每一个具有实质影响的阶段保留人工审查。生成的假设需要实验检验,文献摘要需要核查来源,代码需要针对已知案例进行验证。
OpenAI 明确表示,研究人员仍掌握控制权。这是一个恰当目标,但仅有访问权限并不能证明这种控制在日常期限压力下仍能维持。
实验室需要制定书面规则,界定获批数据、必要披露、模型版本记录和审查责任。期刊编辑和同行评审者也需要具备相应的预期标准。
该项目的成功将部分取决于这些外围机构。在薄弱的验证流程中,强大的模型既可能加速错误,也可能加速有效工作。
封闭模型问题也会影响议价能力。一旦实验室围绕某一提供方建立工作流,迁移到另一套系统可能需要新的评估、集成和人员培训。
针对提示词、工具调用、数据集和评估记录的开放标准可以减少这种依赖。它们无法消除模型之间的差异,也无法重建无法获得的权重。
这正是免费提议具有战略重要性的地方。OpenAI 承担初始访问成本,而机构开始采用其环境。
如果这些工作流变得持久,未来的科研基础设施可能围绕 OpenAI 的接口发展。该公司便可在不发布底层系统的情况下影响研究方法。
这种结果并非不可避免。大学可以要求记录可导出、比较多个模型、维持本地替代方案,并支持公共研究基础设施。
它们还可以将 ChatGPT 视为多种仪器之一,而非每个项目的默认推理层。
研究收益确实存在,但并不均衡
该项目可以提升科研生产力,但其价值将因学科、机构、任务和验证能力而异。
OpenAI 描述的使用场景涵盖基因组分析、蛋白质建模、文献综述、基金申请写作、编程、数据分析和发表。这些任务承载的科学风险差异很大。
使用 AI 重新整理参考文献目录相对容易核查。要求它提出生物学机制或给出数学证明,则需要更深入的领域审查。
该项目最显著的即时收益,可能出现在科研相关的常规工作中。科学家会投入大量时间清洗数据、维护代码、检索文献和准备文件。
AI 辅助可以减少这些任务中的摩擦。研究人员随后便能将更多注意力投入实验设计、解释和验证。
OpenAI 还引用了更具雄心的案例。物理学家 Rogerio Jorge 及其合作者在开发聚变研究开源软件时使用 AI。
该公司表示,理论计算机科学家在开发一项关于高维几何的证明时使用了 GPT-5.5 Pro。据称,研究人员自行验证并完善了结果。
这些案例说明了理想的分工方式。AI 提出建议、搜索或执行步骤,而具备资质的研究人员仍对科学主张负责。
这种模式能否在 100,000 个账户中扩展,仍不确定。有经验的团队可能会建立审慎的验证流程,而准备不足的用户可能会过快接受看似令人信服的输出。
培训和支持可以缩小这一差距。不过,任何短期项目都无法替代统计学专业能力、学科知识、研究伦理或安全数据实践。
机构资源也将影响结果。一所大型研究型大学可以提供数据治理团队、计算人员、法律审查和方法学支持。
资源较少的机构可能从免费模型访问中获益更多,却可用于评估风险的人员更少。该项目可能减少一种不平等,同时暴露另一种不平等。
资格条件也带来相关担忧。OpenAI 已将第一阶段限制于满足其研究活动标准的选定机构。
这种做法简化了管理,并将支持集中于已经拥有大量研究活动的机构。它也可能偏向具备既有基础设施和公认地位的机构。
以教学为主的学院、独立研究所、小型非营利机构,或位于初始地理范围之外的机构中的研究人员,可能仍被排除在外。
“免费”一词也值得谨慎解读。参与者无需支付订阅费用,但机构仍需承担集成、培训、合规、审查和工作流重构成本。
研究团队必须决定哪些信息可以进入系统。敏感的健康、基因组、商业或国家安全数据,可能需要额外限制。
即便平台提供强有力的隐私保护,本地规则也可能禁止某些传输。机构审查委员会和数据使用协议仍具有约束力。
输出质量将因领域而异。当任务类似于其训练数据和所连接信息源中存在的模式时,语言模型尤其擅长。
新颖实验可能缺少这些模式。模型可能会用看似合理的主张填补空白,而非认识到证据并不存在。
科学推理基准提供了有用的比较,但它们并不代表完整的实验室实践。基准通常提供明确的输入、输出和评分规则。
真实科学包含模糊的测量、有缺陷的仪器、不完整的文献、未记录的假设,以及对于哪个问题重要的分歧。
OpenAI 报告称,GPT-5.6 Sol 在 FrontierMath Tier 4 上取得了 83% 的成绩,而 GPT-5.5 为 72.5%。它还报告了在 GeneBench Pro 上取得 31.5% 的结果。
这些是公司报告的基准测试结果。它们并不能证明该系统在每一项数学或生物学研究任务中都可靠。
一个能解决许多高难度测试的系统,仍可能以不可预测的方式失败。研究人员在赋予其角色之前,需要进行误差分析,而不只是查看汇总分数。
该项目可以为这些局限生成有价值的证据。跨越众多学科的使用将揭示模型在哪些方面有帮助、在哪些方面失败,以及哪些工作流需要更强的控制。
但只有当参与研究人员能够发表负面发现时,这些证据才最具可信度。他们必须能够批评模型表现,而不必担心失去访问权限。
OpenAI 表示希望获得关于不足之处的反馈。实际检验在于,独立研究人员能否以足够的访问和细节记录这些不足,从而经得起审查。
科学家在 2027 年前应关注什么
该计划的科学价值将取决于参与者的多样性、可复现性实践,以及 OpenAI 对更深入访问需求的回应。
第一个信号是首批 10,000 名研究人员的构成。OpenAI 已公布了一些知名机构,但更广泛的分布情况仍然重要。
研究人员应关注哪些国家、学科、机构类型和职业阶段的人获得账户。如果资源本已充足的大学占据主导,将削弱该计划关于扩大访问的论点。
更广泛的分布则会强化这一论点。较小机构以及计算资源有限的研究人员参与其中,将表明该计划覆盖范围超越了现有的 AI 中心。
第二个信号是利用该计划发表的研究质量。论文应明确说明模型版本、访问日期、提示词、工具、外部数据以及人工验证流程。
在隐私和许可条件允许的情况下,研究人员应保留完整的工作流程记录。他们还应报告失败的尝试、敏感性测试和与替代模型的比较。
学术期刊可通过制定披露标准来加快这一进程。审稿人需要获得足够的信息,才能区分可复现的方法与未经记录的对话。
根据 Nature Computational Science 对专有研究模型的讨论,闭源模型尤其需要谨慎论证。作者在承认某些情况下模型开放性并非首要因素的同时,强调了审计和可复现性方面的担忧。
如果期刊采用更明确的标准,OpenAI 的托管访问可在有据可查的限制内支持可信研究。如果标准仍不一致,已发表的结果可能会变得难以重新审视。
第三个信号是 OpenAI 是否扩大技术访问。该公司可以提供固定的研究快照、更完善的版本记录、受控评估环境,或向获批准的模型研究人员提供有限访问权限。
这些措施都不等同于不受限制地发布模型权重。但它们仍可提高可复现性,并为独立研究人员提供更稳定的测试条件。
OpenAI 还可能公布更多关于训练数据、系统变更、评估方法和已知失败模式的信息。更完善的文档能够在不发布权重的情况下减少部分不确定性。
如果该公司仅提供更多账户,最初的权衡依然存在。科学家将获得更多使用模型的机会,却几乎没有权限审查模型本身。
竞争对手的行为可作为补充背景。开放权重开发者可以通过提供可下载模型、固定版本和本地部署来挑战 OpenAI。
这些替代方案也必须提供可信的文档。训练数据不透明、评估薄弱的开放权重模型,并不能解决所有透明度问题。
公共基础设施将提供另一种比较。NAIRR 等项目可提供计算资源、数据集、模型和支持,而不必将每个工作流程绑定到单一商业提供商。
最佳结果可能涉及多种访问路径。研究人员可根据每个项目的要求,使用托管的前沿模型、公共计算资源和开放权重系统。
对于通过 google news 进入本文的读者而言,实际结论很直接。符合资格的研究人员应研究申请流程,但也应在将重要工作迁入 ChatGPT 前制定验证计划。
明确哪些数据可以进入工作区。记录模型版本和提示词,保留中间输出,对关键发现进行比较,并为每项科学主张指定一名人工审阅者。
应将免费账户视为使用一台有用但不断变化的工具,而不要将其视为对系统本身的独立访问。
如果该计划能帮助多元化的研究人员产出经得起同行评审和后续复现检验的成果,它就具有意义。如果采用率上升的同时方法却变得更难审查,其意义则会减弱。
如果这些工具适合你的研究,就申请;然后提出更困难的问题:在不依赖同一临时界面的情况下,另一支团队能否理解、测试并质疑你的结果?


