top of page

关于 GPT-OSS 在 2025 年你需要知道的一切

已更新:6月18日

Everything You Need to Know About GPT-OSS in 2025

您现在可以使用 GPT-OSS。它是 OpenAI 的新型开源大型语言模型。该模型为您提供开放权重访问,让您可以完全控制如何使用和修改它。该模型使用 Apache-2.0 license。这允许您将其免费用于商业用途,而不会被单一公司束缚。该模型具备强大的推理和代理能力,使得 GPT-OSS 非常适合构建安全且私密的 AI 工具。OpenAI 的 GPT-OSS 模型帮助更多人使用 AI,让您能在许多领域创造新事物。

核心摘要

  • GPT-OSS 是一个开源 AI 模型。您可以在自己的设备上运行它,从而完全掌控自己的数据和成本,无需依赖云服务。

  • 该模型采用称为 Mixture-of-Experts 的特殊设计。这有助于它快速且智能地运行,同时节省计算资源,使其非常适合编码、数学和研究任务。

  • 您可以选择 GPT-OSS 的思考深度,并查看其推理步骤。您可以 fine-tune it with your own data。这有助于它更好地适应您的需求。

  • GPT-OSS 可以 处理超长文本。您可以处理大型文档或长对话。您不会丢失信息。

  • Apache 2.0 license 允许您自由使用 GPT-OSS。您也可以更改和分享它。这有助于您构建私密、安全且灵活的 AI 工具。您可以将它们用于商业或个人项目。

什么是 GPT-OSS?

What Is GPT-OSS?

概览

GPT-OSS 是 OpenAI 最先进的开源模型系列。它的特别之处在于您可以完全访问其权重。这在旧版 GPT 发布中并不常见。您无需使用云服务或 API。您可以在自己的笔记本电脑或服务器上运行 GPT-OSS。这让您掌控自己的数据和成本。

OpenAI 开发 GPT-OSS 是为了开发者、研究人员和企业。您可以将其用于工作、学习或个人项目。您无需支付许可费用。Apache 2.0 license 允许您在任何地方使用该模型。即使在隐私规定严格的地方,您也可以使用它。您可以用自己的数据 fine-tune 该模型。这有助于您为自己的需求创建定制解决方案。

GPT-OSS 有两种尺寸。较小的 20-billion parameter model 可在笔记本电脑上运行。较大的 120-billion parameter model 智能程度堪比顶级付费模型。两种模型都允许您在自己的设备上分析数据。您无需将数据发送到云端。这为您提供更多控制权和隐私。

注意: GPT-OSS 仅支持文本。它无法处理图像或视频。但它可以浏览网页、运行代码和使用软件工具。

独特之处

GPT-OSS 具有使其区别于其他开源大型语言模型的特殊功能。您将获得一个 modular, multi-agent system。专用 AI 代理执行研究、总结和翻译等任务。一个主协调器管理这些代理。这使系统强大且灵活。您可以将该模型用于多种任务。

混合专家 (MoE) transformer 架构是一个重大优势。每个 token 仅使用部分参数。这节省资源并提高模型速度。该模型可处理长上下文窗口——最多 131,072 tokens。它使用 rotary position embeddings 和 sliding window optimization。您可以处理长文档或聊天而不会丢失信息。

GPT-OSS 使用先进的量化方法,如 MXFP4 4-bit quantization。这可将内存使用减少高达 90%,但保持高性能。您可以 run the 120-billion parameter model from a USB stick。这使其使用起来简单且廉价。

您可以在此表中查看 GPT-OSS 与其他模型的比较:

特性 / 模型维度

GPT-OSS-120b

GLM-4.5

Qwen3 Thinking

DeepSeek R1

Kimi K2

总参数量

1168 亿

大于 GPT-OSS-120b

大于 GPT-OSS-120b

更高的参数量

更小的专业化模型

单 Token 激活参数量

~51 亿 (MoE 设计)

全参数使用

全参数使用

高参数使用

不适用

架构亮点

混合专家模型 (MoE)

稠密模型

稠密模型

稠密模型

稠密模型

残差流维度

2880

N/A

N/A

N/A

N/A

注意力机制

分组查询注意力 (64 个查询头,8 个键值头)

N/A

N/A

不适用

不适用

位置嵌入 (Position Embeddings)

旋转位置嵌入 (Rotary position embeddings)

不适用

不适用

不适用

不适用

上下文长度

131,072 tokens (使用 YaRN)

高达 20k tokens (DeepSeek R1)

不适用

高达 20k tokens

不适用

量化

针对 MoE 权重的 MXFP4 量化

不适用

不适用

不适用

不适用

可变推理强度

是(低、中、高 CoT 长度)

不适用

不适用

不适用

不适用

智能体工作流支持

Browsing tool, Python tool, 自定义开发者函数

不适用

不适用

不适用

不适用

MMLU-Pro 基准测试得分

90.0%

84.6%

84.4%

85.0%

81.1%

AIME 2024 得分

96.6% (配合工具)

低于 GPT-OSS

低于 GPT-OSS

低于 GPT-OSS

不适用

AIME 2025 评分

97.9% (使用工具)

低于 GPT-OSS

低于 GPT-OSS

低于 GPT-OSS

不适用

GPQA 博士级科学基准测试

80.9% (使用工具)

79.1%

81.1%

81.0%

N/A

您可以 在 GPT-OSS 中选择推理级别。选择低、中或高以平衡速度或深度。该模型在给出最终答案前会显示其思考步骤。这有助于您检查并修正其推理过程。

您可以离线使用 GPT-OSS。您无需支付 API 费用,也不会面临速率限制。您不需要互联网。您的数据保持私密且安全。Apache 2.0 license 允许您将该模型用于任何用途,甚至包括商业用途。您可以用自己的数据 fine-tune 该模型,即使数据是私密的。

以下是 GPT-OSS 的一些主要优势:

GPT-OSS 为开源模型系列开启了新时代。您将获得一个性能堪比顶级付费系统的 chatgpt-level 模型。您可以将其用于研究、商业或个人项目。OpenAI 的 GPT-OSS 帮助您在保持控制权和隐私的同时,构建智能 AI 工具。

核心特性

Mixture-of-Experts Architecture

混合专家 (Mixture-of-Experts) 架构

混合专家 (MoE) 架构使 gpt-oss 强大。它不使用普通层,而是使用 MoE 层。每个 MoE 层有许多专家。120B 模型有 128 个专家。20B 模型有 32 个专家。每个专家是一个带门控的 SwiGLU MLP。小型路由器学习为每个 token 选择哪些专家。它为每个 token 挑选最佳的四个专家。token 被交给这些专家。该模型使用权重混合它们的答案。

您会在每个 transformer block 中找到 MoE 层。这些层位于自注意力部分之后。根据模型大小,有 36 或 24 个 Pre-LN Transformer 层。每层使用特殊连接和 RMS LayerNorm 来保持平衡。这种设置提供了更强的能力并保持高效。每个 token 仅由少数专家处理。这节省了内存和计算能力。

使用 gpt oss,您可以媲美 o3 和 o4-mini 等顶级模型。您可以轻松解决难题和代理任务。

4-bit Quantization

4-bit Quantization

Gpt-oss 使用 4-bit quantization (MXFP4) 来节省内存。这与 16 位模型相比 cuts memory use by about 75%。120B 模型适合 80GB GPU,例如 NVIDIA A100 或 H10020B 模型可在仅 16GB VRAM 的 GPU 上运行。您甚至可以使用性能良好的笔记本电脑或手机运行较小的模型。

  • 4-bit quantization 让大型模型可在简单硬件上运行。

  • 您能获得快速响应并占用更少内存。

  • 即使位数减少,模型仍能保持准确。

  • 您可以在自己的设备上使用 gpt-oss 以保护隐私并节省费用。

该量化与 MoE 权重配合良好。这使模型使用起来简单快捷。您不需要超级计算机或大型集群。您可以在自己的设备上使用先进模型。

Large Context Window

Large Context Window

Gpt-oss 可通过其 big context window处理长文档和聊天。该模型支持最多 128,000 tokens。这与 GPT-4o 和 DeepSeek R1 相当。您可以处理科学论文、手册或长对话而不会丢失信息。

模型 / 特性

最大上下文窗口

架构与用法说明

GPT-OSS (开源权重模型)

使用稠密与稀疏注意力机制、旋转位置编码 (RoPE) 以及分组查询注意力 (GQA)。在 16-80GB VRAM 上运行良好。

OpenAI GPT-4o

128,000 tokens (128k)

还具有大上下文窗口,适用于长文档和代码。

DeepSeek R1 & V3

128,000 tokens (128k)

采用混合专家模型(Mixture-of-Experts),非常适合思维链和多步骤任务。

Mistral Medium 3

128,000 tokens (128k)

高性能,适用于混合部署和本地部署。

Anthropic Claude 4 及相关模型

200,000 tokens (200k)

中等上下文窗口,适用于多步工作和研究。

OpenAI GPT-4.1, Google Gemini 2.5 Flash & Pro, Meta Llama 4 Maverick

1,000,000 tokens (1M)

超长上下文窗口,适用于复杂任务。

Magic.dev LTM-2-Mini

100,000,000 tokens (100M)

海量上下文窗口,适用于大型代码库或文档集。

Meta Llama 4 Scout

10,000,000 tokens (10M)

极长的上下文,适用于端侧工作和书籍摘要。

巨大的上下文窗口意味着您可以一次处理更多数据。您不需要外部系统来获取信息。这有助于您在长任务中保持跟踪。当您需要遵循长信息链时,可以将 gpt oss 用于研究、法律或技术支持。

  • 您在实际任务中可以获得更好的结果,例如书籍摘要或代码检查。

  • 模型可以思考长文档而不会遗忘。

  • 您需要更少的额外工具,因此您的工作会更轻松。

开放权重发布、Apache 2.0 许可证以及隐私/安全优势

通过 gpt-oss 的开放权重发布,您可以拥有完全的控制权。Apache 2.0 许可证允许您免费使用、修改和共享模型,甚至用于商业用途。您不会面临专利或 Copyleft 问题。您可以在您自己的硬件上运行模型,因此您的数据保持安全。您不需要将信息发送到外部服务器。

  • 你可以根据需要更改模型

  • 你可以避免被单一公司束缚,并确保数据安全。

  • 该模型具有安全特性,并已通过外部安全检查。

  • 你可以看到模型的思考过程,这有助于你信任并修正其回答。

像 gpt oss 这样的开源模型为你提供了更多选择和控制权。你可以检查代码、更改模型并使其更安全。你运行自己的系统,因此由你决定如何保护数据。

提示:在自己的电脑上运行 gpt-oss 可以确保你的私有数据安全,不被他人获取。

开源 LLM 对比

GPT-OSS 与其他开源模型的对比

如果你观察 gpt-oss 和其他开源 LLMs,你会发现一些明显的优势和局限。gpt-oss 120B 模型是最聪明的美国开源权重模型。在推理和 STEM 测试中,它的表现优于大多数美国开源模型(如 o3-mini 和 o4-mini)。你在数学、编程和工具使用方面可以获得很好的结果。但从综合性能来看,gpt-oss 不如 DeepSeek R1 或 Qwen3 235B 等顶尖的中国开源模型。

gpt-oss 模型最适合需要逻辑和解决任务的场景。该模型采用了混合专家(Mixture-of-Experts)设计。这意味着每个 token 仅由少数专家处理。这使得模型在编程、数学和科学领域既强大又高效。你可以在拥有 16GB RAM 的笔记本电脑上运行 20B 模型。这使得在家庭或工作中使用它变得非常容易。Apache 2.0 许可证允许你在自己的项目中运行、修改和共享该模型。

提示:你可以在 gpt-oss 中设置推理级别。这有助于你在项目的速度和深度之间做出选择。

性能基准测试

gpt-oss 模型在多项测试中表现出色。120B 模型在困难推理任务上几乎与 o4-mini 持平. 20B 模型与 o3-mini 一样出色,且能在更小的设备上运行。这两个模型在数学、编程和通用知识方面表现优异。它们可以回答博士级的科学问题,并能使用网页浏览和 Python 代码等工具。

以下是快速对比:

  • GPT-OSS-120B 在推理和 STEM 任务中的表现优于大多数美国开源模型。

  • 该模型在创意写作和多语言推理方面的表现不如其他一些模型。

  • 合规性测试显示其具有强大的防护栏,这可能会改变某些回答。

  • 你可以在自己的电脑上运行该模型,因此你的数据可以保持私密和安全。

  • 该模型支持工具和 API,适用于高级 AI 工作流。

Gpt-oss 为你提供了很多选择。你可以在自己的硬件上运行它,更改其设置,并将其用于多种 AI 任务。这使得 gpt oss 成为追求控制权、隐私和强劲性能的开发者的理想选择。

使用 GPT-OSS

Using GPT-OSS

部署选项

你可以在不同位置部署 gpt oss。该模型可以在云端、你自己的计算机或边缘侧运行。以下是一个简单的表格:

部署环境

gpt-oss-120b

gpt-oss-20b

云端

Azure AI Foundry, AWS SageMaker, serverless endpoints

本地部署

企业级 GPU (NVIDIA H100)

本地工作站 (GeForce RTX, RTX PRO)

边缘端

不可用

Windows 设备 (16GB+ VRAM),即将支持 macOS

你可以使用云服务,例如 Azure 或 AWS。这些服务为你提供 API 访问和高性能 GPU。如果你愿意,也可以在自己的大型 GPU 或工作电脑上运行模型。对于边缘端使用,20B 模型可以在配备强力 GPU 的 Windows 上运行。你可以混合使用云端、本地和边缘端,以获得更好的隐私保护和运行速度。

提示:将模型导出为 ONNX 或 Triton 格式,以便在 Kubernetes 或边缘端使用。这有助于你根据需要灵活调整架构。

微调

你可以使用自己的数据训练 gpt oss。该模型允许你根据需求进行调整。120B 和 20B 模型都支持微调。你可以使用家用 GPU 或云端 GPU 来完成此操作。许多人使用 PyTorch FSDP 或 DeepSpeed 来提升内存效率和速度。

模型

微调方法

所需硬件

使用场景

gpt oss

PyTorch FSDP, DeepSpeed

8×A100 GPU 或 16GB+ 显存

定制聊天机器人,领域任务

Vicuna-13B

PyTorch FSDP

8×A100 GPUs

多轮对话

GPT-NeoX

Megatron, DeepSpeed

多 GPU

通用语言任务

你可以让模型更好地服务于你的工作、学习或个人项目。微调比直接使用基础 api 能提供更优质的回答。

集成

你可以通过不同的 API 将 gpt oss 连接到你的应用程序。该模型支持 RESTful API 工具(如 FastAPI 或 Flask)。你也可以使用 vLLM,它与 OpenAI API 类似。这使得从其他模型切换变得非常容易。

  • 使用 Redis 来处理高并发请求。

  • 添加缓存以提高重复回答的速度。

  • 使用 WebSocket 为实时应用流式传输回答。

  • 在模型副本之间分配工作负载以保持稳定的速度。

注意:对于大型公司,DICloak 可以帮助多位用户共享模型并确保数据安全。

您可以使用 the model 来创作内容、检查数据等。该 API 允许您为团队构建安全、灵活且强大的工具。

您可以参与决定开源 AI 的未来形态。OpenAI 开发此模型是为了让您和您的团队能够使用先进技术。它 更易于获取并根据您的需求进行调整您可以了解其工作原理并节省成本. 您还可以根据自己的需求调整模型。该模型的开放方式有助于人们创造新事物并安全地使用它。尝试在您的下一个项目中使用此模型。它可以帮助您和他人让 AI 变得更好。

常见问题

如何访问 GPT-OSS 的 API?

您可以通过在自己的服务器上运行模型或使用支持的云平台来访问 API。大多数开发人员使用 RESTful 端点或 vLLM,以便轻松集成到应用程序中。

可以离线运行 GPT-OSS 吗?

是的,您可以在自己的硬件上离线运行 GPT-OSS。这种设置可以保护您的数据隐私,且不需要互联网连接或外部 API 调用。

运行 GPT-OSS 需要什么硬件?

对于 120B 模型,您需要强大的 GPU,例如 NVIDIA H100。20B 模型可以在具有 16GB VRAM 的笔记本电脑上运行。您可以使用 API 部署这两个模型。

GPT-OSS 支持微调吗?

你可以使用自己的数据对 GPT-OSS 进行微调。许多用户选择 PyTorch FSDP 或 DeepSpeed。微调后,你可以通过 API 提供模型服务,以处理自定义任务。

GPT-OSS 支持与现有应用集成吗?

是的,你可以使用 API 将 GPT-OSS 连接到你的应用。FastAPI 或 Flask 等流行框架可以帮助你快速构建聊天机器人、数据工具或研究助手。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page