top of page

Kimi K2.6 在 Claude Opus 4.7 发布四天后问世。定价低 10×,且为开放权重。

Moonshot AI 于 4 月 20 日发布了 Kimi K2.6,比 Anthropic 发布 Claude Opus 4.7 晚了四天。Kimi K2 现在是一个拥有 1 万亿参数的混合专家模型,具备 262,144 令牌的上下文窗口、本地视频输入,以及一个能协调最多 300 个并行子代理、每次运行跨 4000 步的代理群原语。

它在修改后的 MIT 许可下发布,通过 Kimi API 的定价为每百万输入令牌 0.60 美元、每百万输出令牌 2.50 美元。Claude Opus 4.7 在相同表面上的定价为 5 美元和 25 美元。GPT-5.4 Pro 的定价更高。就每任务而言,对于大多数代理工作负载,Kimi K2 比闭源前沿模型便宜大约一个数量级。

基准测试情况喜忧参半。在 SWE-Bench Verified 上,Claude Opus 4.7 以 87.6% 胜过 Kimi 的 80.2%。在 SWE-Bench Pro、Toolathlon 和 BrowseComp 上,K2.6 领先或持平闭源前沿。代理工具使用是 2026 年大多数生产构建者真正关心的地方,也是 Moonshot 选择领先的领域。

本文将介绍 Kimi K2.6 实际发布的内容、它在基准测试上的胜负、定价和许可细则对实际部署的意义,以及发布时机——与 Claude Opus 4.7 同在一周内发布——为何是更具启示性的故事。

Kimi K2.6 实际发布的内容

K2.6 不是一个编码模型。它是一个附带模型的代理平台,这一框架解释了整个发布。

标题规格为开放权重层级设立了新标杆。Kimi K2.6 tech blog详细介绍了一个 1T 参数 MoE 架构,具备长时程推理的注意力优化、262K 上下文窗口,以及接受视频与图像和文本的原生多模态输入路径。K2.5 仅支持文本。K2.6 是首个从第一天起就支持原生视频输入的开放权重前沿模型。

代理特定新增功能是 Moonshot 真正下注的地方。K2.6 内置代理群原语,每次运行可协调最多 300 个并行子代理,协调窗口跨 4000 步。主动代理可在无用户提示的情况下以 24/7 循环自主运行。K2.5 上尚可的前端生成表面,现在可作为一级输出格式生成带视频背景和 3D 效果的动画 UI。长时程代码生成——大多数代理构建者报告在先前开放权重模型上表现不稳定的能力——是 Moonshot 在发布说明中强调的稳定性领域。

部署是发布中另一个读起来像是为生产而非演示而设计的内容。原生支持 INT4 量化,在自托管硬件上推理速度大约快 2 倍。第一天支持覆盖 vLLM、SGLang 和 KTransformers,这意味着在 AWS、Azure 或裸金属集群上运行的企业团队无需自定义推理代码即可部署。Kimi API 完全兼容 OpenAI,因此将现有代理从 GPT-5.4 或 Claude 切换到 K2.6 只是更改 base-URL 而非重写整个 SDK。该模型还列于 OpenRouter,并可通过 Kimi.com 网站、移动 Kimi App 以及名为 Kimi Code 的 CLI 获取,后者镜像了 Claude Code / Cursor 的终端原生代理工作流模式。

300 个子代理的数量是值得记住的具体形象。Claude Code 的代理模型、Cursor 的代理模型和 Devin 的代理模型实际上仍作为带工具调用的单一主代理运行。K2.6 的架构旨在编排一个通过共享状态并行运行、协调并重新组合结果的代理树。这是一种不同的工作流形态,Moonshot 押注它符合生产代理工作的发展方向。

基准测试情况

Kimi K2 在通用编码上落后于闭源前沿,但在代理工具使用上领先。这一差距是本次发布的核心战略声明。

将 K2.6 与 Claude Opus 4.7、GPT-5.4 和 Gemini 3.1 Pro 进行正面比较,模式一致。在最常被引用的编码能力基准 SWE-Bench Verified 上,Opus 4.7 以 87.6% 胜过 K2.6 的 80.2%。GPT-5.3-Codex 在同一测试上为 85.0%。Gemini 3.1 Pro 接近 80.6%。Kimi K2 处于竞争行列,但不是领先者。

在更难的变体 SWE-Bench Pro 上,该变体会因脆弱或幻觉补丁而惩罚模型,K2.6 以 58.6% 夺得榜首,略胜 GPT-5.4 的 57.7%,并击败 Claude Opus 4.6 的 53.4%。Anthropic 在同一套件上报告 Opus 4.7 为 64.3%,这是闭源前沿在纯编码基准上仍对 K2.6 保持的唯一干净胜利。Toolathlon 基准衡量跨多步工作流的代理工具使用,是 Moonshot 最明显领先的地方:K2.6 得分为 50.0%,而 Claude 为 47.2%。BrowseComp(网页浏览代理基准)K2.6 为 83.2%,接近 Gemini 3.1 Pro 的 85.9%,并领先 Opus 4.7 的 79.3% 回归。

来自TheDecoder analysis的综合解读是,Moonshot 针对最接近代理在生产中实际执行的基准进行了优化——工具使用、长时程推理和网页浏览——并在纯编码标题数字上接受了小幅落后。这与 2024 年的模式相反,当时每个开放权重发布都追逐 SWE-Bench 以获得标题平价。

带工具的人类最后考试(一个综合推理基准)K2.6 得分为 54.0%。这个数字有意义的原因不在于绝对值,而在于它确认该模型能以与闭源模型同等的层级胜任工具增强推理。基准选择偏差是真实存在的,持怀疑态度的读者应等待独立复现。不过,方向性信号是,Kimi K2 是首个基准组合看起来故意以代理为导向而非事后代理相邻的开放权重模型。

对于 4 月下旬挑选模型的代理构建者,实际解读很简单。如果你的工作负载是带已知测试用例的纯代码生成,Opus 4.7 仍有显著优势。如果你的工作负载涉及工具使用、浏览或多步协调,K2.6 在衡量这些能力的基准上具有竞争力或领先,并且是唯一可自托管的模型。

定价论据

每令牌差距为 8-10 倍。一旦考虑开放权重,每任务差距则取决于你想要什么。

截至 4 月 20 日发布,OpenRouter listing for K2.6显示每百万输入令牌 0.60 美元、每百万输出令牌 2.50 美元。Claude Opus 4.7 列为输入 5.00 美元、输出 25.00 美元,意味着 K2.6 通过托管 API 在输入上便宜约 8 倍,在输出上便宜约 10 倍。Claude Sonnet 4.6(大多数企业实际大规模部署的较低层级)列为 3.00 美元 / 15.00 美元,意味着与 K2.6 的差距仍为输入 5 倍、输出 6 倍。GPT-5.4 Pro 和 Gemini 3.1 Pro 处于与 Claude Opus 相似的区间。

代表性代理任务的数学计算使差距具体化。消耗 20,000 输入令牌和 8,000 输出令牌的代理运行在 Claude Opus 4.7 上成本约为 0.30 美元(输入 0.10 美元,输出 0.20 美元)。在 Kimi K2 上相同运行成本约为 0.03 美元(输入 0.012 美元,输出 0.02 美元)。将其扩展到每天运行 10,000 个代理任务的团队(这是中型企业内部生产部署的合理数字),年度成本差额约为 100 万美元对 10 万美元的等效工作。

开放权重选项进一步改变了数学。对于自托管有意义的工作负载——受监管行业、高容量自动化、网络往返重要的延迟敏感路径——边际令牌成本降至 GPU 时间加上摊销后的任何值,在规模上通常远低于 0.60 美元的托管价格。INT4 量化支持以及与 vLLM、SGLang 和 KTransformers 的第一天兼容性意味着自托管路径在操作上是现实的,而非理论选项。

定价差距本身就值得注意。结合开放权重发布,它成为自 DeepSeek V3 以来代理工作成本-质量前沿首次与闭源领导者显著分化的发布。Anthropic 的 Opus 4.7 定价未动。Moonshot 的发布可能迫使其变动。

许可细则

修改后的 MIT 意味着主要是 MIT,除了一个条款会让最可能受益的公司在部署前暂停。

Moonshot 在修改后的 MIT 许可下发布 K2.6,值得仔细阅读而非假设其行为与标准 MIT 相同。署名条款是新颖的部分:任何月活跃用户超过 1 亿或月收入超过 2000 万美元的商业部署,必须在产品用户界面中明显注明“Powered by Kimi K2.6”。较小的部署(包括大多数初创公司、中小企业、内部企业工具和低于该规模的代理壳供应商)不受影响,可在标准 MIT 兼容条款下使用该模型。

这一模式呼应了 Meta 的 Llama 许可,后者将商业使用上限设为 7 亿 MAU,超过该阈值需签订定制协议。Moonshot 的版本在阈值上更宽松——允许继续使用而非要求单独许可——但它施加了可见 UI 署名义务,这比标准许可页提及更难 invisibly 满足。对于拥有数亿用户的 B2C 产品,在 UI 中添加“Powered by Kimi K2.6”是一项重大的品牌和设计决策,而非仅法律脚注。

对于许可最直接针对的企业买家——Apple、Microsoft、Google、Meta、ByteDance——署名条款是实际摩擦。将 K2.6 嵌入其助手产品中的超大规模厂商必须权衡工程和成本优势与在可见位置承认运行中国开放权重模型的让步。这与中型公司纯粹的成本效益权衡不同,后者可在大致零许可成本且无 UI 义务的情况下获得前沿层级模型。

更广泛的战略解读是,Moonshot 利用许可 carve out 了它实际想要的市场细分——超大规模以下的所有人——同时留下一个最大参与者无法忽视的压力点。一个拥有 3 亿用户的超大规模厂商若想在生产中运行 K2.6,要么遵守 UI 署名(对大多数消费产品而言难以置信),要么与 Moonshot 协商定制许可(这是开源到商业货币化的通常方式)。无论哪种方式,Moonshot 都赢得了在标准 MIT 下不会拥有的选择权。

部署与 Kimi Code 赌注

Moonshot 在模型同日发布了一个代理 CLI。这是最清晰的信号,表明他们认为竞争实际所在。

Kimi Code——与 K2.6 一起发布的命令行代理 shell——是使本次发布成为平台玩法而非模型发布的举措。它镜像了 Claude Code 确立的模式:一个带一流工具调用、文件编辑和会话记忆的终端原生代理界面,以及 Cursor 的终端工作,同时保持基础模型开放权重且可自托管。Build Fast with AI preview将 Kimi Code 定位为希望进行代理编码而无需 Claude 或 Cursor 订阅的团队的实用替代方案。

自托管选项是开放权重论点经受考验的地方。vLLM 是美国企业的参考部署路径。SGLang 是为大规模吞吐优化而首选的路径。KTransformers 是与华为 Ascend 硬件或其他非 NVIDIA 加速器相关的团队最相关的路径。这三者在发布日均获支持,这是一个有意义的指标,表明 Moonshot 与开放推理生态系统进行了协调,而非将集成留给社区。

对于受监管行业——金融服务、医疗保健、国防——自托管选项是解锁。在现有 H100 或 A100 集群上以 INT4 量化在本地运行前沿层级代理模型,现在是一个受支持的配置,而非自定义集成项目。这是对 Claude、GPT 和 Gemini 的结构性优势,后者只能通过合作伙伴云(AWS Bedrock、Azure、Vertex AI)以闭源定价自托管。

OpenAI 兼容 API 是转换成本杠杆。当前调用api.openai.com/v1/chat/completions的代理可以通过更改 base URL 指向 Kimi 的端点,并保持相同的 SDK、相同的请求模式和相同的响应处理。这与 DeepSeek、Together 和 Fireworks 所做的可移植性赌注相同,也是过去 18 个月推动最多生产模型切换的赌注。

中美开闭源分化

每个美国前沿实验室都在闭源。每个中国前沿实验室都在开放。Kimi K2.6 是迄今为止这一分裂的最清晰例证。

Anthropic 的 Claude Opus 4.7 以闭源方式发布,公司明确承认其前沿模型 Mythos 仍为内部。OpenAI 的 GPT-5.4 是闭源。Google 的 Gemini 3.1 Pro 是闭源。三家美国前沿实验室已在其顶级模型上收敛于闭源权重姿态,理由各不相同,包括安全、能力 gating 和商业经济。

每个中国前沿实验室正朝相反方向移动。Moonshot 已将 Kimi K2.0 至 K2.6 以开放权重方式发布。DeepSeek V3 和 V4 是开放的。Qwen 的最新版本是开放的。战略分化在每一层可见:架构披露、权重发布、许可条款,以及至关重要的每令牌定价。

对代理构建者的后果是市场分化。绝对能力前沿——SWE-Bench 的最后 5-7 分、能连贯运行自主代理八小时的模型——仍为闭源,由 Anthropic、OpenAI 和 Google 掌握。成本-质量前沿——大多数生产部署实际发生的地方——是开放权重,且日益由中国实验室占据。大多数企业若在 10 倍成本的闭源模型与 90% 能力的开放权重模型之间选择,只要治理和安全审查允许,就会选择开放的那一个。

治理和安全审查是剩余摩擦。中国模型出处引发了出口管制、数据处理和供应链审查问题,美国企业买家尚未普遍解决。一些大型银行和国防承包商有明确政策禁止部署中国来源模型。相反出现的模式是间接使用:企业通过 OpenRouter、通过美国托管合作伙伴或在美国拥有的基础设施上自托管运行 K2.6 或 DeepSeek,从而绕过采购异议而不拒绝能力。

可能破坏发布的因素

许可、出处审查和基准选择是三个现存风险。

署名条款是首要摩擦。大型企业的法律团队将希望将可见 UI 署名的成本与相对于 Claude 或 GPT 的节省进行建模,而这一计算对面向消费者的产品并不总是对 Kimi 有利。预计 Q2 将出现一波安静的“我们喜欢它但无法发布”的对话,因为 B2C 团队处理该条款。

中国出处是第二个。针对中国来源模型的企业安全审查比针对美国模型的同等审查更慢、更昂贵,且更可能以“否”结束。Moonshot 的开放权重发布有帮助——模型可被检查、审计和自托管——但财富 500 强规模的采购流程仍将原产国视为主要标志。

基准可复现性是第三个。K2.6 在 SWE-Bench Pro、Toolathlon 和 BrowseComp 上的领先将在未来一个月内被独立重新基准测试,Moonshot 内部数字与第三方重新运行之间的任何差距都将快速改变叙事。更广泛的开放权重生态系统在此有良好记录——DeepSeek 的声明大多经得起审查——但验证周期是建立信任的一部分。

支持节奏是更安静的风险。前沿实验室持续发布安全更新、质量补丁和细微安全调整。开放权重发布是时间点。未跟踪上游更新的企业部署将在细微能力差异上落后于闭源竞争对手。Moonshot 的发布计划表明他们处于快速刷新周期,但自托管部署继承了保持最新的责任,这是真正的运营工作。

代理构建者的实用解读

Kimi K2 发布是最清晰的信号,表明代理工作的成本-质量前沿已转向开放权重。如果工作负载是带已知测试用例的编码密集型,Claude Opus 4.7 仍会在正面比较中获胜。如果工作负载是代理型、工具密集且对成本敏感,K2.6 在能力上具有竞争力且便宜一个数量级,自托管选项作为闭源模型无法匹配的结构性成本优势位居其上。对于在下一季度选择生产堆栈的团队,并行运行 Claude 和 Kimi,将编码密集工作路由到 Anthropic、将代理编排工作路由到 K2.6,是理性的架构,直到能力差距关闭或扩大。Moonshot 正在做的更广泛赌注——代理平台胜过纯模型——与 Anthropic 在任务预算和/ultrareview上的做法、OpenAI 在 Codex 上的做法以及 Cursor 和 Devin 围绕构建的做法相呼应。不同之处在于 Moonshot 的平台是开放的,这改变了任何关心成本、控制或出处的人的部署数学。保持关于什么有效、什么失败以及原因的持久记录,在多模型堆栈中变得与模型选择本身同样重要,而这正是设计良好的AI-native second brain成为代理堆栈在其上运行的制度层的地方。Kimi K2.6 是本月的代理构建者发布。如何使用它取决于你是否能自托管、是否能接受署名条款,以及你的采购流程是否会通过中国来源模型。对于至少能对其中两个问题回答“是”的大多数团队,决定是 straightforward 的。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page