关于 GPT-OSS 在 2025 年你需要知道的一切
- Aisha Washington

- 6月7日
- 讀畢需時 11 分鐘
已更新:6月18日

您现在可以使用 GPT-OSS。它是 OpenAI 的新型开源大型语言模型。该模型为您提供开放权重访问,让您可以完全控制如何使用和修改它。该模型使用 Apache-2.0 license。这允许您将其免费用于商业用途,而不会被单一公司束缚。该模型具备强大的推理和代理能力,使得 GPT-OSS 非常适合构建安全且私密的 AI 工具。OpenAI 的 GPT-OSS 模型帮助更多人使用 AI,让您能在许多领域创造新事物。
核心摘要
GPT-OSS 是一个开源 AI 模型。您可以在自己的设备上运行它,从而完全掌控自己的数据和成本,无需依赖云服务。
该模型采用称为 Mixture-of-Experts 的特殊设计。这有助于它快速且智能地运行,同时节省计算资源,使其非常适合编码、数学和研究任务。
您可以选择 GPT-OSS 的思考深度,并查看其推理步骤。您可以 fine-tune it with your own data。这有助于它更好地适应您的需求。
GPT-OSS 可以 处理超长文本。您可以处理大型文档或长对话。您不会丢失信息。
Apache 2.0 license 允许您自由使用 GPT-OSS。您也可以更改和分享它。这有助于您构建私密、安全且灵活的 AI 工具。您可以将它们用于商业或个人项目。
什么是 GPT-OSS?

概览
GPT-OSS 是 OpenAI 最先进的开源模型系列。它的特别之处在于您可以完全访问其权重。这在旧版 GPT 发布中并不常见。您无需使用云服务或 API。您可以在自己的笔记本电脑或服务器上运行 GPT-OSS。这让您掌控自己的数据和成本。
OpenAI 开发 GPT-OSS 是为了开发者、研究人员和企业。您可以将其用于工作、学习或个人项目。您无需支付许可费用。Apache 2.0 license 允许您在任何地方使用该模型。即使在隐私规定严格的地方,您也可以使用它。您可以用自己的数据 fine-tune 该模型。这有助于您为自己的需求创建定制解决方案。
GPT-OSS 有两种尺寸。较小的 20-billion parameter model 可在笔记本电脑上运行。较大的 120-billion parameter model 智能程度堪比顶级付费模型。两种模型都允许您在自己的设备上分析数据。您无需将数据发送到云端。这为您提供更多控制权和隐私。
注意: GPT-OSS 仅支持文本。它无法处理图像或视频。但它可以浏览网页、运行代码和使用软件工具。
独特之处
GPT-OSS 具有使其区别于其他开源大型语言模型的特殊功能。您将获得一个 modular, multi-agent system。专用 AI 代理执行研究、总结和翻译等任务。一个主协调器管理这些代理。这使系统强大且灵活。您可以将该模型用于多种任务。
该 混合专家 (MoE) transformer 架构是一个重大优势。每个 token 仅使用部分参数。这节省资源并提高模型速度。该模型可处理长上下文窗口——最多 131,072 tokens。它使用 rotary position embeddings 和 sliding window optimization。您可以处理长文档或聊天而不会丢失信息。
GPT-OSS 使用先进的量化方法,如 MXFP4 4-bit quantization。这可将内存使用减少高达 90%,但保持高性能。您可以 run the 120-billion parameter model from a USB stick。这使其使用起来简单且廉价。
您可以在此表中查看 GPT-OSS 与其他模型的比较:
特性 / 模型维度 | GPT-OSS-120b | GLM-4.5 | Qwen3 Thinking | DeepSeek R1 | Kimi K2 |
总参数量 | 1168 亿 | 大于 GPT-OSS-120b | 大于 GPT-OSS-120b | 更高的参数量 | 更小的专业化模型 |
单 Token 激活参数量 | ~51 亿 (MoE 设计) | 全参数使用 | 全参数使用 | 高参数使用 | 不适用 |
架构亮点 | 混合专家模型 (MoE) | 稠密模型 | 稠密模型 | 稠密模型 | 稠密模型 |
残差流维度 | 2880 | N/A | N/A | N/A | N/A |
注意力机制 | 分组查询注意力 (64 个查询头,8 个键值头) | N/A | N/A | 不适用 | 不适用 |
位置嵌入 (Position Embeddings) | 旋转位置嵌入 (Rotary position embeddings) | 不适用 | 不适用 | 不适用 | 不适用 |
上下文长度 | 131,072 tokens (使用 YaRN) | 高达 20k tokens (DeepSeek R1) | 不适用 | 高达 20k tokens | 不适用 |
量化 | 针对 MoE 权重的 MXFP4 量化 | 不适用 | 不适用 | 不适用 | 不适用 |
可变推理强度 | 是(低、中、高 CoT 长度) | 不适用 | 不适用 | 不适用 | 不适用 |
智能体工作流支持 | Browsing tool, Python tool, 自定义开发者函数 | 不适用 | 不适用 | 不适用 | 不适用 |
MMLU-Pro 基准测试得分 | 90.0% | 84.6% | 84.4% | 85.0% | 81.1% |
AIME 2024 得分 | 96.6% (配合工具) | 低于 GPT-OSS | 低于 GPT-OSS | 低于 GPT-OSS | 不适用 |
AIME 2025 评分 | 97.9% (使用工具) | 低于 GPT-OSS | 低于 GPT-OSS | 低于 GPT-OSS | 不适用 |
GPQA 博士级科学基准测试 | 80.9% (使用工具) | 79.1% | 81.1% | 81.0% | N/A |
您可以 在 GPT-OSS 中选择推理级别。选择低、中或高以平衡速度或深度。该模型在给出最终答案前会显示其思考步骤。这有助于您检查并修正其推理过程。
您可以离线使用 GPT-OSS。您无需支付 API 费用,也不会面临速率限制。您不需要互联网。您的数据保持私密且安全。Apache 2.0 license 允许您将该模型用于任何用途,甚至包括商业用途。您可以用自己的数据 fine-tune 该模型,即使数据是私密的。
以下是 GPT-OSS 的一些主要优势:
根据您的需求更改并微调模型。
使用代理工作流(agentic workflows),如网页浏览和运行代码。
获得完全控制权并查看模型的推理过程。
GPT-OSS 为开源模型系列开启了新时代。您将获得一个性能堪比顶级付费系统的 chatgpt-level 模型。您可以将其用于研究、商业或个人项目。OpenAI 的 GPT-OSS 帮助您在保持控制权和隐私的同时,构建智能 AI 工具。
核心特性

混合专家 (Mixture-of-Experts) 架构
混合专家 (MoE) 架构使 gpt-oss 强大。它不使用普通层,而是使用 MoE 层。每个 MoE 层有许多专家。120B 模型有 128 个专家。20B 模型有 32 个专家。每个专家是一个带门控的 SwiGLU MLP。小型路由器学习为每个 token 选择哪些专家。它为每个 token 挑选最佳的四个专家。token 被交给这些专家。该模型使用权重混合它们的答案。
您会在每个 transformer block 中找到 MoE 层。这些层位于自注意力部分之后。根据模型大小,有 36 或 24 个 Pre-LN Transformer 层。每层使用特殊连接和 RMS LayerNorm 来保持平衡。这种设置提供了更强的能力并保持高效。每个 token 仅由少数专家处理。这节省了内存和计算能力。
MoE 层帮助模型出色地完成许多任务。
您将获得 更快的回答 并消耗更少的资源。
您可以选择模型推理的深度。
该模型允许您使用 tools like browsing and running code。
使用 gpt oss,您可以媲美 o3 和 o4-mini 等顶级模型。您可以轻松解决难题和代理任务。
4-bit Quantization

Gpt-oss 使用 4-bit quantization (MXFP4) 来节省内存。这与 16 位模型相比 cuts memory use by about 75%。120B 模型适合 80GB GPU,例如 NVIDIA A100 或 H10020B 模型可在仅 16GB VRAM 的 GPU 上运行。您甚至可以使用性能良好的笔记本电脑或手机运行较小的模型。
4-bit quantization 让大型模型可在简单硬件上运行。
您能获得快速响应并占用更少内存。
即使位数减少,模型仍能保持准确。
您可以在自己的设备上使用 gpt-oss 以保护隐私并节省费用。
该量化与 MoE 权重配合良好。这使模型使用起来简单快捷。您不需要超级计算机或大型集群。您可以在自己的设备上使用先进模型。
Large Context Window

Gpt-oss 可通过其 big context window处理长文档和聊天。该模型支持最多 128,000 tokens。这与 GPT-4o 和 DeepSeek R1 相当。您可以处理科学论文、手册或长对话而不会丢失信息。
模型 / 特性 | 最大上下文窗口 | 架构与用法说明 |
GPT-OSS (开源权重模型) | 使用稠密与稀疏注意力机制、旋转位置编码 (RoPE) 以及分组查询注意力 (GQA)。在 16-80GB VRAM 上运行良好。 | |
OpenAI GPT-4o | 128,000 tokens (128k) | 还具有大上下文窗口,适用于长文档和代码。 |
DeepSeek R1 & V3 | 128,000 tokens (128k) | 采用混合专家模型(Mixture-of-Experts),非常适合思维链和多步骤任务。 |
Mistral Medium 3 | 128,000 tokens (128k) | 高性能,适用于混合部署和本地部署。 |
Anthropic Claude 4 及相关模型 | 200,000 tokens (200k) | 中等上下文窗口,适用于多步工作和研究。 |
OpenAI GPT-4.1, Google Gemini 2.5 Flash & Pro, Meta Llama 4 Maverick | 1,000,000 tokens (1M) | 超长上下文窗口,适用于复杂任务。 |
Magic.dev LTM-2-Mini | 100,000,000 tokens (100M) | 海量上下文窗口,适用于大型代码库或文档集。 |
Meta Llama 4 Scout | 10,000,000 tokens (10M) | 极长的上下文,适用于端侧工作和书籍摘要。 |
巨大的上下文窗口意味着您可以一次处理更多数据。您不需要外部系统来获取信息。这有助于您在长任务中保持跟踪。当您需要遵循长信息链时,可以将 gpt oss 用于研究、法律或技术支持。
您在实际任务中可以获得更好的结果,例如书籍摘要或代码检查。
模型可以思考长文档而不会遗忘。
您需要更少的额外工具,因此您的工作会更轻松。
开放权重发布、Apache 2.0 许可证以及隐私/安全优势
通过 gpt-oss 的开放权重发布,您可以拥有完全的控制权。Apache 2.0 许可证允许您免费使用、修改和共享模型,甚至用于商业用途。您不会面临专利或 Copyleft 问题。您可以在您自己的硬件上运行模型,因此您的数据保持安全。您不需要将信息发送到外部服务器。
你可以避免被单一公司束缚,并确保数据安全。
该模型具有安全特性,并已通过外部安全检查。
你可以看到模型的思考过程,这有助于你信任并修正其回答。
像 gpt oss 这样的开源模型为你提供了更多选择和控制权。你可以检查代码、更改模型并使其更安全。你运行自己的系统,因此由你决定如何保护数据。
提示:在自己的电脑上运行 gpt-oss 可以确保你的私有数据安全,不被他人获取。
开源 LLM 对比
GPT-OSS 与其他开源模型的对比
如果你观察 gpt-oss 和其他开源 LLMs,你会发现一些明显的优势和局限。gpt-oss 120B 模型是最聪明的美国开源权重模型。在推理和 STEM 测试中,它的表现优于大多数美国开源模型(如 o3-mini 和 o4-mini)。你在数学、编程和工具使用方面可以获得很好的结果。但从综合性能来看,gpt-oss 不如 DeepSeek R1 或 Qwen3 235B 等顶尖的中国开源模型。
gpt-oss 模型最适合需要逻辑和解决任务的场景。该模型采用了混合专家(Mixture-of-Experts)设计。这意味着每个 token 仅由少数专家处理。这使得模型在编程、数学和科学领域既强大又高效。你可以在拥有 16GB RAM 的笔记本电脑上运行 20B 模型。这使得在家庭或工作中使用它变得非常容易。Apache 2.0 许可证允许你在自己的项目中运行、修改和共享该模型。
提示:你可以在 gpt-oss 中设置推理级别。这有助于你在项目的速度和深度之间做出选择。
性能基准测试
gpt-oss 模型在多项测试中表现出色。120B 模型在困难推理任务上几乎与 o4-mini 持平. 20B 模型与 o3-mini 一样出色,且能在更小的设备上运行。这两个模型在数学、编程和通用知识方面表现优异。它们可以回答博士级的科学问题,并能使用网页浏览和 Python 代码等工具。
以下是快速对比:
GPT-OSS-120B 在推理和 STEM 任务中的表现优于大多数美国开源模型。
该模型在创意写作和多语言推理方面的表现不如其他一些模型。
合规性测试显示其具有强大的防护栏,这可能会改变某些回答。
你可以在自己的电脑上运行该模型,因此你的数据可以保持私密和安全。
该模型支持工具和 API,适用于高级 AI 工作流。
Gpt-oss 为你提供了很多选择。你可以在自己的硬件上运行它,更改其设置,并将其用于多种 AI 任务。这使得 gpt oss 成为追求控制权、隐私和强劲性能的开发者的理想选择。
使用 GPT-OSS

部署选项
你可以在不同位置部署 gpt oss。该模型可以在云端、你自己的计算机或边缘侧运行。以下是一个简单的表格:
部署环境 | gpt-oss-120b | gpt-oss-20b |
云端 | Azure AI Foundry, AWS SageMaker, serverless endpoints | |
本地部署 | 企业级 GPU (NVIDIA H100) | 本地工作站 (GeForce RTX, RTX PRO) |
边缘端 | 不可用 | Windows 设备 (16GB+ VRAM),即将支持 macOS |
你可以使用云服务,例如 Azure 或 AWS。这些服务为你提供 API 访问和高性能 GPU。如果你愿意,也可以在自己的大型 GPU 或工作电脑上运行模型。对于边缘端使用,20B 模型可以在配备强力 GPU 的 Windows 上运行。你可以混合使用云端、本地和边缘端,以获得更好的隐私保护和运行速度。
提示:将模型导出为 ONNX 或 Triton 格式,以便在 Kubernetes 或边缘端使用。这有助于你根据需要灵活调整架构。
微调
你可以使用自己的数据训练 gpt oss。该模型允许你根据需求进行调整。120B 和 20B 模型都支持微调。你可以使用家用 GPU 或云端 GPU 来完成此操作。许多人使用 PyTorch FSDP 或 DeepSpeed 来提升内存效率和速度。
模型 | 微调方法 | 所需硬件 | 使用场景 |
gpt oss | PyTorch FSDP, DeepSpeed | 8×A100 GPU 或 16GB+ 显存 | 定制聊天机器人,领域任务 |
Vicuna-13B | PyTorch FSDP | 8×A100 GPUs | 多轮对话 |
GPT-NeoX | Megatron, DeepSpeed | 多 GPU | 通用语言任务 |
你可以让模型更好地服务于你的工作、学习或个人项目。微调比直接使用基础 api 能提供更优质的回答。
集成
你可以通过不同的 API 将 gpt oss 连接到你的应用程序。该模型支持 RESTful API 工具(如 FastAPI 或 Flask)。你也可以使用 vLLM,它与 OpenAI API 类似。这使得从其他模型切换变得非常容易。
使用 Redis 来处理高并发请求。
添加缓存以提高重复回答的速度。
使用 WebSocket 为实时应用流式传输回答。
在模型副本之间分配工作负载以保持稳定的速度。
注意:对于大型公司,DICloak 可以帮助多位用户共享模型并确保数据安全。
您可以使用 the model 来创作内容、检查数据等。该 API 允许您为团队构建安全、灵活且强大的工具。
您可以参与决定开源 AI 的未来形态。OpenAI 开发此模型是为了让您和您的团队能够使用先进技术。它 更易于获取并根据您的需求进行调整。 您可以了解其工作原理并节省成本. 您还可以根据自己的需求调整模型。该模型的开放方式有助于人们创造新事物并安全地使用它。尝试在您的下一个项目中使用此模型。它可以帮助您和他人让 AI 变得更好。
常见问题
如何访问 GPT-OSS 的 API?
您可以通过在自己的服务器上运行模型或使用支持的云平台来访问 API。大多数开发人员使用 RESTful 端点或 vLLM,以便轻松集成到应用程序中。
可以离线运行 GPT-OSS 吗?
是的,您可以在自己的硬件上离线运行 GPT-OSS。这种设置可以保护您的数据隐私,且不需要互联网连接或外部 API 调用。
运行 GPT-OSS 需要什么硬件?
对于 120B 模型,您需要强大的 GPU,例如 NVIDIA H100。20B 模型可以在具有 16GB VRAM 的笔记本电脑上运行。您可以使用 API 部署这两个模型。
GPT-OSS 支持微调吗?
你可以使用自己的数据对 GPT-OSS 进行微调。许多用户选择 PyTorch FSDP 或 DeepSpeed。微调后,你可以通过 API 提供模型服务,以处理自定义任务。
GPT-OSS 支持与现有应用集成吗?
是的,你可以使用 API 将 GPT-OSS 连接到你的应用。FastAPI 或 Flask 等流行框架可以帮助你快速构建聊天机器人、数据工具或研究助手。


