top of page

OpenAI 加速研究访问计划将 10 万名科学家置于 AI 可靠性测试之中

OpenAI 正在向 10 万名学术研究人员免费提供前沿 ChatGPT 模型访问权限,使科学 AI 从有限实验转变为一场机构级测试。OpenAI 加速研究计划将在 2026 年夏季先覆盖 1 万名参与者,并计划在 2027 年期间达到完整规模。

该计划面向入选学术机构的科学家、数学家和工程师。参与者将获得先进模型、研究工具、更大的上下文窗口、更高的使用限额,以及对长期项目的支持。他们还可以邀请最多四名来自同一机构、且已完成验证的协作者。

然而,访问权限本身并不能保证带来更好的科学研究。核心较量在于更快的研究工作流与更缓慢的证据验证过程之间。Google 和其他 AI 开发商也在推进类似的科学系统,而学术期刊仍在讨论披露、署名与可靠性问题。

因此,OpenAI 所做的不只是分发软件。它正在将前沿模型置入真实的研究环境中,其规模足以暴露这些模型的价值与局限。

OpenAI 的 10 万研究人员计划改变了什么

该计划将前沿 AI 的访问方式,从零散的个人订阅转向协同的学术工作空间。

OpenAI 于 2026 年 7 月 29 日宣布推出 ChatGPT for Academic Researchers。根据这项研究计划,符合条件的入选机构研究人员可立即提交申请。

该公司表示,将在 2026 年夏季从 1 万名研究人员开始。包括 Institute for Advanced Study 和 École normale supérieure 在内的机构已可使用该服务。OpenAI 计划在 2027 年期间将该计划扩展至 10 万名参与者。

申请者必须在获认可、具备学位授予资格且研究活动活跃的机构任职。他们必须验证其机构隶属关系,并说明正在开展的研究及预期的科学用途。受邀协作者也必须完成同样的验证流程。

参与者可在 ChatGPT、ChatGPT Work 和 Codex 中获得访问权限。ChatGPT Work 支持更长期的项目,而 Codex 则处理编程、数据分析和可复现的计算任务。可复现工作流会记录足够的代码、数据和流程,使另一名研究人员能够重复该项分析。

GPT-5.6 系列模型将在发布时提供,包括适用于高难度科学和数学工作的 GPT-5.6 Sol Pro。OpenAI 还列出适合常规研究的 GPT-5.6 Terra,以及用于更轻量、更快速任务的 GPT-5.6 Luna。

该套件包括扩展版深度研究功能、更大的上下文窗口和更高的使用限额。上下文窗口是指模型可在一次交互中处理的信息量。更大的窗口可容纳长篇论文、数据集、实验记录或多个相互关联的来源。

研究人员还可以使用超过 75 项生命科学技能,涵盖遗传学、基因组学、测序、单细胞分析、蛋白质建模和药物发现等领域。连接器可将文献、公共数据库、笔记本、卫星图像和参考文献管理工具引入工作环境。

OpenAI 表示,参与计划的工作空间具备企业级隐私与安全保护。默认情况下,这些工作空间中的数据不会用于训练其模型。拥有 ChatGPT Edu 的机构将通过现有工作空间协调该计划的访问权限。

这一机构层面至关重要。个人聊天机器人账户可以帮助总结论文,但无法在实验室内建立共同治理机制。受管理的工作空间则可以支持访问控制、协作和一致的数据政策。

免费访问是截至 2027 年、总额超过 2.5 亿美元的更广泛承诺的一部分。这项承诺包括 OpenAI 的 5000 万美元 NextGenAI 计划,以及其与美国能源部 Genesis Mission 的合作。

这个醒目的数字仍需放在背景中理解。OpenAI 尚未说明这 10 万个账户将如何在机构、国家、学科或职业阶段之间分配。该公司也尚未公布独立评估框架,以衡量该计划促成的科学发现。

因此,变化本身很明确,但结果尚未可知。前沿模型正触及规模大得多的学术群体。研究人员现在必须判断,这种访问是否提升了科学质量,而不只是提高了速度。

为什么 OpenAI 加速访问会给研究机构带来压力

直接压力落在那些尚未建立 AI 辅助研究、数据处理和披露共同规则的大学身上。

OpenAI 表示,目前每周已有约 130 万人使用 ChatGPT 开展高级科学和数学工作。根据该公司随公告发布的数据,这些用户生成了约 840 万条消息。

现有活动意味着,大学面对的并非研究人员是否会使用生成式 AI,而是这种使用会维持非正式状态,还是成为受治理的基础设施。免费的前沿访问权限使非正式采用更难被忽视。

研究密集型机构必须回答若干实际问题:哪些数据可以输入模型、如何核查输出,以及何时必须披露 AI 辅助。它们还必须明确,当生成的代码、引用或解释出现错误时,责任由谁承担。

这些决策不只涉及信息技术部门。科研诚信办公室、图书馆、法务团队、实验室负责人和期刊编辑都与此利害相关。如果这些群体各自为政,单一机构很容易形成相互冲突的规则。

该计划也可能在参与和未参与的机构之间形成压力差。拥有更高使用限额、更大上下文窗口和专业工具的研究人员,可以尝试更多计算型工作;他们的同行则可能依赖能力较弱的系统或有限的机构基础设施。

OpenAI 表示,在各自领域中 AI 使用量位于前 20% 的研究人员,会向模型分配更具挑战性的任务。他们的请求中,近 7% 属于估计至少需要四小时人工完成的工作;其他研究人员中,这一比例为 3.5%。

这些数字描述的是使用情况,而非研究质量。它们并未表明高强度用户是否产出了更准确的发现、更有力的实验或更具可复现性的论文。OpenAI 也未披露每项请求的预估人工工作时间是如何计算的。

尽管如此,这种模式解释了为何机构会感受到回应压力。看到同事将更大的任务交给模型后,研究人员会希望获得相当的访问权限。院系也可能担心,生产力、资助或人才会流向装备更完善的大学。

这种压力并不限于 OpenAI。Google 推出了由专业代理构成的AI co-scientist,可提出、辩论、排序并完善假设。2026 年 6 月,Google 介绍了涉及传染病、肝病、ALS 和细胞衰老的研究应用。

Google 将其系统定位为结构化协作者,而非自主科学家。OpenAI 则采取更广泛的路径,提供跨学科的通用模型、编程工具、连接器和专业技能。两种方法都让 AI 更深入地参与假设形成和研究执行。

这种竞争背景将影响机构采购和治理决策。大学必须比较通用平台与领域专用的科学系统,还需要考虑是否应由单一供应商来调解文献、代码、数据、写作和协作。

学术领导者不能将免费访问视为完整的成本核算。采用仍需要培训、安全审查、政策制定和人工验证。当模型或托管功能发生变化时,实验室也必须保留其记录。

知识管理成为这一应对措施的一部分。研究人员需要持久记录,以区分源材料、模型建议、人工决策和已验证结果。可搜索知识库可以帮助保存这条链路,而不会将生成文本视为既有证据。

因此,被迫作出的回应是组织层面的。研究机构需要在实验实践演变为永久习惯之前,建立受治理的 AI 工作流。OpenAI 的计划缩短了构建这些机制所剩的时间。

真正的较量是访问与验证之间的较量

OpenAI 可以消除一项主要访问障碍,但只有研究人员能够弥合验证缺口。

科学工作包含许多语言模型擅长处理的任务。研究人员检索文献、翻译技术语言、编写代码草稿、整理笔记、比较方法并准备基金申请材料。这些任务的执行速度加快,可以为实验和解读腾出更多时间。

然而,科学发现并不是已完成行政任务的简单总和。一个看似合理的假设必须经受与观测结果、既有工作、统计假设和替代解释的检验。流畅的语言无法取代这些核查。

这构成了该计划的核心张力。OpenAI 正在扩大对这类系统的访问:它们能通过同一界面给出有用答案,也能制造令人信服的错误。这些系统工作得越快,研究人员就必须越快验证其输出。

OpenAI 将研究人员定位为决策者。其公告表示,公司不希望选择哪些科学问题值得关注,而是希望领域专家引导模型处理他们所理解的问题。

这种分工是合理的,但它假定用户能够识别模型失误。处于职业早期的研究人员可能不知道某项引用、方法或结论何时与既有知识相冲突。专家也可能在截止日期压力或确认偏误影响审查时,接受方便的答案。

AI 辅助可能在整个工作流中加剧这些问题。一条虚构参考文献可能扭曲文献综述;这份综述可能塑造薄弱的假设,进而产生不恰当的代码和夸大的结论。

即使如此,输出在每个阶段仍可能看起来连贯。大语言模型通过根据学习到的模式预测可能的后续内容来生成文本。它们并不会天然证明每一项陈述都对应某个已观察到的事实。

Nature 曾记录模型如何在自信呈现的同时,捏造作者、标题和论文。即使经过改进的系统也尚未消除虚假引用,因此对学术使用而言,核查来源至关重要。

因此,验证必须在多个层面进行。研究人员应检查被引用的来源、测试生成的代码、记录提示词、保留模型版本,并将结论与原始数据进行比较。当结果支撑具有重要影响的主张时,独立复现仍然是必要的。

同样的原则也适用于形式化数学。模型可以提出证明,但专家必须审查每一个逻辑步骤。证明助手和可执行检查能够增强信心,但它们仍依赖于正确的形式化。

OpenAI 描述了一个涉及 Barna Saha、Yinzhan Xu 和 Christopher Ye 的案例。研究人员在开展一项关于高维几何算法极限的证明工作时使用了 GPT-5.5 Pro。OpenAI 表示,研究人员自行验证并完善了这一结果。

最后这句话至关重要。该模型协助了推理过程,而研究人员仍对验证负责。若去除人工验证,这一主张的性质就会改变。

当项目能让这种关系清晰可见时,它将最具价值。研究助手应当呈现不确定性、保留溯源信息,并鼓励测试。它不应诱导用户将完成等同于正确。

OpenAI 加速开放访问,能够扩大计算研究的参与范围。但它无法自动实现判断能力的民主化。专业知识、实验室资源、同行评审和复现能力的分布仍然不均衡。

衡量该项目的真正标准,不在于参与者生成了多少文本或代码,而在于有多少 AI 支持的工作能够经受专家审查和独立测试。

研究工作流的覆盖面先于发现获得证据

近期最显著的收益,很可能来自串联现有研究步骤,而非取代科学判断。

OpenAI 描述的用途涵盖基因组分析、蛋白质建模、文献综述、基金申请撰写和出版。这些任务的风险差异很大。起草一份资助摘要,并不等同于推荐一项生物学实验。

最站得住脚的工作流,会让模型紧贴可审查的材料。研究人员可以要求 ChatGPT 对比所提供的论文、识别分歧,或建议缺失的对照措施。随后,每一项输出都可以依据引用文献进行核查。

Codex 也可以通过代码支持类似模式。它可以起草分析脚本、解释错误、生成测试,并记录计算流程。研究人员仍需检查依赖项、验证假设,并将输出与已知结果进行比较。

智能体式执行增加了另一层能力。智能体系统能够借助工具规划并执行多个相互关联的操作。它可能收集文件、运行代码、检查结果,并在有限人工干预下调整方法。

这种能力可以缩短反馈循环。科学家可以在选择方法前测试更多分析方案。实验室也可以自动化此前占用专业人员时间的例行格式整理或质量检查。

更长的上下文窗口支持包含大量关联文档的项目。它们可帮助模型在同一工作区内对比方案、手稿、实验记录和审稿意见。然而,更大的上下文窗口并不保证每个细节都会获得同等关注。

连接器也可以通过将外部系统引入工作流来减少摩擦。它们可能提供文献、数据库记录、计算笔记本或参考文献库。每个连接器都会带来关于权限、溯源和数据时效性的问题。

生命科学技能展示了通用模型如何正成为研究平台。一项技能会为重复性任务打包指令、工具或领域流程。这可以让缺乏丰富编程经验的用户也能使用高级工作流。

当可访问性服务于专家时,它具有价值。当精致的界面掩盖了专业人士通常会审查的假设时,风险便会出现。领域技能应当让其方法和数据转换过程可见。

OpenAI 报告称,GPT-5.6 Sol 在 FrontierMath Tier 4 上获得了 83% 的成绩,而 GPT-5.5 为 72.5%。它还表示,GPT-5.6 Sol Pro 在 GeneBench Pro 上解决了 31.5% 的任务。

这些基准结果是公司自行报告的性能指标。它们并不能证明在每个实验室、数据集或研究问题上都能成功。31.5% 的 GeneBench Pro 结果也表明,大多数受评任务仍未解决。

基准测试可以识别进展,但科学环境中存在分布漂移。当真实输入与开发或评估期间所代表的数据不同,就会发生分布漂移。罕见疾病、非典型仪器和不完整数据集都可能造成这种漂移。

公司的案例研究提供了更具体的说明。物理学家 Rogerio Jorge 及其团队在开发开源聚变研究软件时使用 AI。该软件支持为工业界和国家实验室设计聚变能源装置。

这类项目说明了代码辅助为何重要。科学软件往往结合数学、专业库、遗留代码和有限的工程支持。即使模型没有带来原创发现,更快的调试和文档编写也能改善工作。

同样的区别也适用于文献工作。AI 可以帮助研究人员定位概念并梳理分歧,但它不能成为未经审查的引用生成器。每篇被引用的论文都必须真实存在,并支持其所归属的主张。

生成式 AI 研究为保持克制提供了理由。一项 2025 年实验发现,模型能够在已知表征内产生渐进式发现,但难以从零开始进行发现。作者还观察到,它对表面上的成功表现出过度自信。

这项发现实验使用了一个模型和一个构建的分子遗传学环境。它不能界定未来的每一种系统。不过,它说明了重组已知观点与识别真正重要异常之间的差别。

这种差别对 OpenAI 加速科学工作流至关重要。生产力提升可能早于更深层发现的证据出现。大学应分别衡量这些结果,而不是将每一小时的节省都视为科学进步。

免费访问并不能消除科学风险

该项目最大的不确定性在于,更广泛地使用 AI 是否会改善整体科学,还是仅仅提高个人产出。

OpenAI 的隐私条款回应了一项主要担忧。该公司表示,项目数据默认不会用于训练其模型。受管理的工作区也可以提供比非托管个人账户更严格的控制。

然而,隐私只是研究诚信的一部分。敏感数据集可能附带知情同意限制、许可限制、出口管制或临床义务。一家机构必须确定特定连接器或工作流是否满足这些要求。

研究人员还需要明确数据保留和访问情况。模型提供商的默认保护措施不能取代实验室的数据管理计划。团队必须知道源文件、提示词、生成的产物和工具输出存储在何处。

可靠性带来了另一项挑战。模型可能虚构引用、误读图表、引入软件依赖项,或应用不合适的统计检验。更高的基准性能能够减少一部分错误,但并不会让输出自行完成验证。

研究文化可能放大这种风险。学术激励机制奖励发表、资助和新颖性。加速写作和分析的工具可以增加产出,却未必改善底层证据。

Nature 讨论的一项大规模分析发现了一种令人担忧的生产力模式。使用 AI 工具的科学家产出了更多研究并获得更多引用,但其工作覆盖的主题范围更窄。

该研究考察了超过 4100 万篇论文,其中约 31.1 万篇被认定使用了 AI 增强。其研究集中度发现表明,AI 可能强化既有领域,同时抑制在代表性不足领域之外的探索。

这并不意味着 ChatGPT 会缩窄每位参与者的研究范围。但它表明,仅凭发表数量无法提供完整评估。OpenAI 和参与机构应追踪主题多样性、复现和阴性结果。

当许多研究人员使用相似的模型和来源时,趋同化可能发生。这些系统可能反复建议熟悉的方法、热门论文或传统假设。这种模式可能让研究更高效,同时减少思想多样性。

该项目的遴选流程可能带来另一项限制。OpenAI 将与入选机构中符合条件的研究人员合作,但尚未公布完整的分配模型。如果资源较少的机构未被纳入,其研究人员仍可能面临障碍。

免费账户也无法提供实验室设备、专有数据集、计算集群或经验丰富的合作者。AI 可以降低一部分知识和软件门槛,但科学机会仍取决于物质资源。

披露标准仍未确定。一项 Nature 对 5,000 名研究人员开展的调查显示,人们对于 AI 参与科学写作的可接受程度看法不一。这项研究人员调查也反映出对署名、抄袭和透明度的担忧。

当 AI 的贡献超越编辑时,这些分歧将变得更加紧迫。期刊需要针对生成的假设、分析代码、图表和解释制定政策。在手稿中致谢 ChatGPT 可能无法说明哪些结论依赖于它。

模型变化同样会使可复现性更加复杂。即使产品名称保持熟悉,托管系统也可能在实验之后发生变化。研究人员应记录模型版本、日期、设置、工具、提示词和相关输出。

提示词可能包含隐性的研究方法选择。要求模型排除离群值或优先考虑某一理论的请求,可能影响结果。保留提示词能让审稿人识别这些选择。

该项目包括培训和实操支持,这可以减少一部分误用。OpenAI 表示,参与者将学习适用于不同经验水平的工作流,并就模型局限性提供反馈。

培训应强调对抗性验证,而不只是功能使用。研究人员需要练习识别虚构引用、测试生成的代码,以及辨别缺乏支持的确定性。机构也应教授何时不应使用模型。

最有力的实施方式,会将 AI 输出视为暂定的研究对象。它会保留来源、记录转换过程,并要求结果进入论文前经过领域审查。这种方法能够支持效率提升,同时不降低证据标准。

OpenAI 已投入大量资源并提供广泛访问。它尚未证明这种部署模式能够产出更可靠或更具原创性的科学。该项目本身现在必须生成这样的证据。

三个信号将显示该项目是否奏效

下一项检验在于,OpenAI 是否会公布有关采用、验证和科学成果的证据,而非仅突出活动本身。

第一个信号是研究人员规模从 10,000 人向 100,000 人的扩展。OpenAI 应披露按机构类型、地理区域、学科和职业阶段划分的参与情况。这些细节将显示,该项目是扩大了访问范围,还是将其集中于本已知名的大学。

使用总量无法回答这个问题。一份可信的访问报告应区分活跃研究人员和获分配账户的人员。它还应说明合作者和较小研究团队是否获得了实质性容量。

广泛参与将增强 OpenAI 的主张:前沿工具不应继续集中于富裕实验室。即使总注册人数达到公布目标,若高度集中在精英机构,这一论点也会被削弱。

第二个信号是对 AI 支持研究的独立验证。读者应关注那些披露模型参与情况、提供可复现材料,并经受专业审查的同行评议论文。复现尝试将比精心包装的案例研究更重要。

OpenAI 表示,越来越多论文开始承认 ChatGPT 的贡献,尤其是在数学领域。下一步是识别这种贡献具体包含什么。提出研究思路、编写代码和完成关键证明步骤,所需的披露程度并不相同。

独立评估也应测试这些专业技能和连接器。研究人员需要了解真实领域工作流中的错误率,而不只是通用基准测试分数。评估应涵盖罕见案例、数据不完整的情况以及对抗性输入。

反复出现且可复现的贡献证据,将强化 ChatGPT 加速科学发现的论点。反之,若出现一连串修正、撤回的主张或未披露的依赖关系,则会削弱这一论点。

第三个信号是大学、期刊和竞争对手如何回应。机构可能会针对模型日志记录、数据处理、署名和验证制定通用规则。期刊则可能要求提供更详细的 AI 贡献声明。

竞争对手的行动将揭示 OpenAI 的广泛平台策略是否会成为默认选择。Google 的结构化协作科学家模型提供了一个明确替代方案,核心在于假设生成与辩论。其他供应商可能会强调私有化部署、开放模型或针对特定学科的验证。

强有力的机构回应将使 AI 的使用更易于审查。碎片化的回应则会让研究人员不得不在大学、资助方和期刊之间应对彼此不兼容的规则。即使底层工具不断改进,这种不确定性也可能拖慢协作。

因此,OpenAI 加速开放访问只是开场动作。10 万个账户的目标,构成了一场关于科学如何组织人机协作的大型实验。它能否成功,取决于机构衡量什么,以及研究人员拒绝在缺乏证据时接受什么。

研究人员在委派任何任务前,都应提出一个实际问题:另一位专家能否审查并复现结果?如果答案是否定的,那么更快的产出并没有加速科学。它只是加速了不确定性。

机遇依然巨大。模型可以减少行政工作、辅助编程、串联分散的文献,并帮助研究人员检验更多想法。这些收益值得谨慎采用,而非自动信任。

关注参与者的分布、独立验证记录以及逐步形成的治理标准。这些信号结合起来,将表明更广泛的 ChatGPT 使用究竟会带来持久的发现,还是仅仅产出更多看似科学的内容。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page