top of page

Supersonic Labs Julia 1 可在 CPU 上运行,但最严苛的测试揭示了其中的取舍

9月28日
讀畢需時 12 分鐘

Supersonic Labs 发布了 Julia 1,这是一款拥有 1.443 亿参数、可在 CPU 上运行并以 Apache 2.0 许可证公开权重的决策模型。Supersonic Labs Julia 1 的发布挑战了这样一种假设:每项语言任务都需要大型生成式模型或专用加速器。

Julia 1 不会撰写文章,也不会进行对话。它接收上下文、一个问题,以及两到 20 个提供的答案,随后选择一个答案,并返回各可选项的概率。

这种更窄的设计也带来了真正的张力。Supersonic Labs 报告称,该模型在多项分类任务上取得了有竞争力的结果,对硬件要求不高,并具备多语言基础。然而,Julia 1 在一项包含 72 个标签的银行业务测试中表现明显较差;在这种任务中,候选项缩减可能会在最终决策前就移除正确答案。

因此,相关的比较并非 Julia 1 与前沿聊天机器人的较量,而是一款可本地部署的紧凑型决策模型,与为结构化分类和路由构建的更大型或托管系统之间的比较。只有当模型在关键选项上仍能保持准确时,CPU 可用性才真正重要。

Supersonic Labs Julia 1 的发布究竟改变了什么

Julia 1 通过单一本地接口整合了多种有边界的语言决策,无需使用文本生成模型。

根据该公司的发布详情,Julia 1 可以处理三种输出形式。选择请求会选出一个候选项,评分请求会评估有序等级,而布尔请求则会判断一条陈述是否为真。

这些形式涵盖了常见的自动化问题。客户服务系统可以将消息路由至账单、物流或账户支持。另一类请求可以在有序量表上评定紧急程度。第三类请求则可以标记案件是否满足既定条件。

调用方提供可能答案的描述。Julia 1 会结合问题的上下文为这些选项评分,然后返回所选标识符及概率分布。这种方法避免要求生成式模型产出之后还需由软件解析的文本。

这一差异至关重要。聊天机器人可能生成解释、虚构新标签,或返回格式错误的输出。决策模型则在应用开发者选定的答案空间内运行。它的工作更接近分类或重排序,而非对话。

该模型在一次原生请求中可接受两个到 20 个选项。更大的标签集则需要一个路由器,将候选项分组、保留选中的选项,并对剩余候选短名单重新排序。该方法扩展了表面上的标签容量,但也引入了一个失效点。

Julia 1 包含 1.443 亿个参数,其全精度权重占用 550.5 MiB。发布的 Python 运行时支持 CPU 执行,Supersonic Labs 还提供了面向浏览器 WebGPU 使用的 ONNX 版本。

模型仓库包含权重、推理代码、配置文件、基准测试材料和安装说明。原生软件包要求 Python 3.11 或更高版本。训练流水线本身并未包含在内。

此次发布还提供了异常具体的来源信息。Supersonic Labs 使用 SHA-256 前缀标识被评估的检查点,公布了数据集修订版本,并提供了一个脚本,用于在 CPU 上复现其类型化决策测试。

这些材料提高了可审计性,但并不使报告结果具备独立性。公司创建了模型,选择了评估呈现方式,并发布了测量结果。外部用户仍需复现测试,并评估自己的工作负载。

Julia 1 改变的是部署问题,而非能力前沿。开发者如今拥有一款专为有边界决策构建的开放、相对小型模型。但这并不证明它可以取代每一种分类器、重排序器、托管决策服务或通用语言模型。

CPU 推理让小型决策在经济性上有所不同

该模型最有力的论点在于运营层面:一个有边界的决策可以留在普通硬件上,而不必变成一次远程生成式请求。

Supersonic Labs 在一台 Apple M4 电脑、一套 Intel Core i5-1235U 系统以及一台 Samsung SM-X510 平板电脑上测试了 Julia 1。这些测量涵盖不同的工作负载、运行时和输入规模,因此不应被视为受控的设备排行榜。

在 Apple M4 上,该公司报告称,使用四个 CPU 线程进行单次决策时,中位耗时为 33.15 毫秒。16 条的批处理达到了每秒 51.20 次决策。该运行结束时,进程占用了 370.6 MiB 内存。

Samsung 平板通过 ONNX Runtime 在 8 秒内处理了 40 次决策,相当于每秒 5 次决策,报告的延迟范围为 193 至 205 毫秒。内存映射权重文件时,进程的峰值常驻内存达到 393.1 MB。

一台 Intel Core i5-1235U 在类型化决策测试中记录到 294.81 毫秒的中位延迟。较小的 AG News 和情感试点任务速度更快,而包含 72 个标签的 Banking77 工作流中位耗时为 3,713.54 毫秒。

如此大的差异说明,“可在 CPU 上运行”只是起点。性能取决于输入长度、选项数量、批处理、分词方式,以及路由器是否必须缩减大量候选集。简单的四分类任务与包含 72 个标签的路由问题并不是等价的部署场景。

实际优势在于控制。公司可以将敏感文本保留在自有设备上,消除网络往返,并避免每次常规决策都依赖托管端点。本地执行还可以支持离线应用和可预测的容量规划。

这些优势最适用于重复性、范围狭窄的任务,例如工单路由、消息分类、文档分流、风险标记、情感标签和基于量规的评分。每项任务都提供受约束的答案列表,而不是要求模型生成不受限制的回复。

这种安排还可以简化下游代码。应用程序接收的是标识符和概率,而非文本。开发者仍需要阈值、回退规则和监控,但无需将自由形式的回答当作可靠的软件契约。

CPU 部署并不自动意味着总成本低。团队还必须考虑内存、并发、工程时间、模型加载、监控和人工审核。当流量增长或延迟目标收紧时,较慢的本地模型可能变得昂贵。

报告中的 Intel 银行业务延迟说明了这个问题。单次复杂路由决策接近四秒,在离线工作流中或许可行,但在交互式产品中会显得缓慢。要提高吞吐量,需要测试批处理、量化、更快的硬件或替代模型。

因此,Julia 1 的 CPU 推理对两种既有方法形成了压力。第一种是把只需一个有边界答案的任务交给通用语言模型;第二种是在隐私、离线访问或可预测运行更适合本地执行时,仍依赖托管分类器。

此次发布并未淘汰其中任何一种方法。当输出空间无法预先列出时,生成式模型仍然有用。托管系统可以提供更好的维护、扩展能力和模型更新。Julia 1 则让本地选项变得足够可信,值得纳入基准测试。

对于构建可搜索内部系统的团队而言,路由只是更大工作流中的一层。同样的部署原则也适用于工程团队如何整理私有文档,以便后续检索。

Julia 1 决策模型如何产生结果

Julia 1 通过调整多语言编码器来为提供的候选项评分,从而获得效率;但这种专门化也界定了它无法完成的任务。

该模型以 mmBERT-small 为基础,这是一种由 Johns Hopkins University 研究人员创建的多语言编码器。编码器会将文本转换为上下文化表征,供下游组件用于分类、检索或排序。

mmBERT-small 模型拥有约 1.4 亿个参数,并支持最长 8,192 个 token 的序列长度。其模型卡称,更广泛的 mmBERT 系列曾在超过 1,800 种语言上训练。

Supersonic Labs 增加了决策组件,用于比较上下文、问题和可用答案。一个两层头部为每个选项评分,softmax 操作则将这些分数转换为概率。模型随后选择得分最高的答案。

这一机制不同于下一个 token 的生成。Julia 1 不会逐词组织答案,而是评估已经存在的候选项。这使其输出更易受约束,但也意味着应用程序必须定义正确的选项。

设计不佳的标签仍然是严重风险。两个选项可能重叠、遗漏正确的处理方式,或依赖输入中缺失的信息。概率分布无法修复不完整的决策架构。

选项描述同样会影响结果。单独的“账单”所提供的上下文,少于“账单问题、重复扣费和付款争议”。生产环境评估必须保留线上应用将使用的相同措辞。

有序评分还带来了另一项担忧。Julia 1 返回的是从零开始的量规位置期望值,而非生成自然语言判断。开发者必须验证模型是否遵循预期顺序,以及相邻类别是否代表有意义的差异。

布尔模式也需要谨慎解读。为真所给出的概率并非证明,也不自动等同于经过校准的置信度。在一个数据集上有效的阈值,可能会在用户语言、类别普遍程度或运行条件改变时失效。

Supersonic Labs 在发布的准确率基准测试中,为 Julia 1 设置了合计 1,024 个 token 的限制。当前运行时可接受更长的输入,默认值为 8,192 个 token,但仓库将这一更长配置描述为经过冒烟测试,而非经过准确率验证。

这一差异避免了一个常见的推断错误:能在 8,192 个 token 下成功运行,并不能证明模型能够可靠地利用长上下文。团队应在不同输入长度下评估准确率,而不是假定架构上限就等于经验证的能力。

紧凑架构也继承了其基础编码器的优势与限制。mmBERT-small 提供广泛的多语言表征,但 Julia 1 并不是通用推理系统。Supersonic Labs 明确表示,外部知识和多步骤计算需要通过其他测试来处理。

这一边界让 Julia 1 比模糊的“小型 AI”标签更容易理解。它旨在从已描述的替代方案中作出选择,不应被当作研究助手、自主智能体、数学求解器或事实数据库。

这种聚焦可能是一项优势。许多业务流程并不需要生成文本,它们需要的是在已知队列、状态、行动或政策结果之间作出可靠选择。当任务确实符合这一接口时,专用模型可以降低计算和集成负担。

关键在于“何时”。一个频繁变更标签、依赖外部事实或需要解释的工作流,可能需要额外组件。Julia 1 可以承担一个决策环节,而无需成为整个应用程序。

Julia 1 CPU 基准测试揭示主要弱点

基准测试的结果喜忧参半:Julia 1 在多项小标签任务中表现良好,但在最困难的路由测试中明显落后于参考模型。

Supersonic Labs 报告称,在其 9 月 24 日的评估中,Julia 1 在 2,000 个类型化决策中答对了 1,463 个。这相当于 73.15% 的准确率,而提供的 Jev 参考值为 72.70%。

两者相差 0.45 个百分点。这个结果差距很小,不能证明其具有广泛领先优势。该测试还混合了多种决策类型,因此单一的总体百分比可能掩盖了不同类别中的强项与弱项。

Julia 1 在 600 道选择题中答对 428 题,在 600 道布尔题中答对 484 题,在 800 道有序评分题中答对 551 题。这些数字表明,汇总结果涵盖了不同的行为模式,而非单一、统一的分类任务。

底层的类型化决策数据集包含具有概率目标的结构化客户服务案例。其文档强调,除最佳答案准确率外,还应关注校准指标,因为实用的自动化取决于概率质量。

Supersonic Labs 还进行了三项各含 100 个样本的分类试验。据称,Julia 1 在四标签 AG News 任务中获得了 94% 的准确率,在六标签 DAIR Emotion 任务中获得了 86%。提供的 Jev 参考值分别为 91% 和 48%。

这些小规模试验令人鼓舞,尤其是情绪分类结果。不过,100 个样本无法证明广泛性能,公开基准材料也可能带来数据污染疑虑。Supersonic Labs 并未声称这些试验足以判定模型的通用质量。

Banking77 的结果提供了最有价值的压力测试。在从 72 个银行业务类别中选择时,Julia 1 正确分类了 100 个样本中的 64 个。提供的 Jev 参考值为 87%。

这 23 个百分点的差距与路由机制中已知的弱点一致。Julia 1 最多只能直接接受 20 个选项,因此系统必须在最终比较前先缩小 72 个标签的范围。如果正确类别在这一阶段被排除,最终评分器便无法将其找回。

CPU 复现结果记录到 Banking77 中答对 60 题,并有 3 次弃答。Supersonic Labs 将弃答计入这 100 个案例,而非将其排除。同一次 CPU 运行在 2,000 个类型化决策上达到了 72.55%。

这一结果的重要性不止于“CPU 模型”的简单标题。许多高价值业务任务都拥有庞大的分类体系。银行、保险公司、客服运营和合规团队可能维护数十甚至数百个彼此密切相关的类别。

一个在四个标签下表现良好的模型,在选项数量增加且语义相近时仍可能遇到困难。更难的任务同时考验语言理解和候选项管理能力。Julia 1 当前的路由器似乎是这一场景中的限制性组件。

参考比较同样需要放在具体语境中理解。公开的基准协议警告称,其自身的 300 样本试验并非通用排行榜。协议还指出,公开数据可能已出现在模型训练中,而每类样本量较小的结果仍不稳定。

Supersonic Labs 复用了该协议中的参考值,而不是在相同硬件和服务条件下进行一次新的、独立控制的正面对比。这些数字可提供方向,但不能确立决定性的排名。

仅凭准确率不足以支持自动化决策。概率校准衡量置信度分数是否与实际正确率相对应。选择性覆盖率则衡量系统在维持误差限制的前提下,能够接手多少工作。

Julia 1 返回完整的概率向量,因此可以进行这些分析。然而,发布材料更强调正确数量,而非校准、类别级行为或基于置信度的覆盖率。当系统需要决定哪些案例应交由人工复核时,这些缺失的维度至关重要。

该模型的多语言结果也存在类似局限。Supersonic Labs 报告称,在覆盖 52 个地区语言变体的 154,648 个 MASSIVE 样本中,Julia 1 正确分类了 110,573 个,相当于 71.50%。其中,美式英语为 86.75%,欧洲葡萄牙语为 86.25%。

该评估在 18 个场景中进行选择。它并不能证明模型在所有语言、领域或决策形式上都具有同等表现。尽管公司源自巴西,Supersonic Labs 还表示,巴西葡萄牙语评估仍是未来工作。

现有证据支持一个更谨慎的结论。Julia 1 可以在普通硬件上执行有用的结构化决策,尤其适用于答案集合较小且差异明显的场景。它尚未证明自己能在大型、密集的分类体系或具有重要后果的无监督决策中提供可靠表现。

开发者在发布后应关注什么

下一阶段应通过独立复现、改进大标签路由能力,以及真实部署中的证据来评判。

第一个信号是独立复现基准测试。Supersonic Labs 提供了权重、评估产物、哈希值和 CPU 复现脚本。外部研究人员现在可以测试已公布的数字是否成立,并补充校准或不确定性分析。

成功复现将增强外界对其发布流程的信心。结果出现差异不一定意味着模型无效,但会揭示其对软件版本、硬件、数据准备或评估选择的敏感性。

第二个信号是其在大规模标签集合上的表现。Banking77 暴露了一个具体弱点,而非抽象担忧。未来对路由器的改进应展示 Julia 1 是否能够保留正确候选项,同时维持实用的 CPU 延迟。

开发者应关注每个缩小范围阶段的召回率,而不只是最终准确率。如果正确答案经常在早期消失,改进最终决策头无法解决核心问题。路由器评估还应包含重叠标签和刻意不完整的答案列表。

第三个信号是真实工作流中的采用证据。一个生产案例应报告标签结构、输入长度、延迟分布、内存占用、人工复核策略和错误成本。仅凭下载量无法表明团队在测试后是否继续使用该模型。

Supersonic Labs 表示 Julia 2 正在开发中,将采用内部基础架构而非 mmBERT。这一计划值得关注,但仍属于未来主张。真正相关的测试是:新基础架构能否在不失去 Julia 1 低硬件需求优势的前提下提升决策质量。

ONNX 和 WebGPU 路径同样值得关注。浏览器执行可以支持私密、离线的决策,但兼容性会因设备和执行提供程序而异。该公司的平板电脑运行回退到了 CPU 算子,据称其中一条加速路径还产生了错误的 reshape 结果。

这一细节体现了负责任的信息披露,但也凸显了部署摩擦。“可在浏览器中运行”并不保证在不同浏览器和芯片上都具备一致的加速效果、内存表现或数值等价性。

评估该模型的团队应从自身的标签和失败成本开始。他们应将 Julia 1 与简单分类器、重排序器、现有托管服务,以及被限制在相同答案范围内的通用语言模型进行比较。

比较应保留完全相同的样本和标签描述,并衡量准确率、校准、弃答行为、p50 和 p95 延迟、峰值内存,以及可安全实现自动化的案例比例。

高风险决策需要额外保障。概率分数应为复核提供参考,而不能取代责任承担。团队应保留输入和输出轨迹,监控分布变化,并在没有任何提供答案适用时准备后备方案。

Supersonic Labs Julia 1 为更小型、专用的 AI 组件提出了可信的案例。其开放权重和 CPU 运行时降低了验证这一思路的门槛。其最薄弱的基准表现也使这次发布无法被简单叙述为一场胜利。

开发者面临的问题很具体:在你的实际决策中、你的延迟和错误限制下,一个受限的本地模型是否优于替代方案?在替换托管系统或通过 Julia 1 路由生产工作之前,先完成这项比较。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page