top of page

小型语言模型在企业基准测试中超越GPT

已更新:6月17日

小型语言模型(SLM)的企业级 AI 结果显示,参数量低于 10B 的模型在垂直任务上的得分已超过 GPT-4。在经过领域数据微调后,这些模型的推理成本仅为原来的十分之一。

这一变化给默认选择大型通用模型的采购团队带来了压力。金融和医疗行业在测试中处于领先地位,在准确性和速度方面都有明显的提升。

专业化让团队能够以针对性训练取代大规模通用模型。这条路径避开了与大型系统相关的延迟和高昂费用。

基准测试揭示了这一转变

企业团队在合同审查、理赔处理和合规检查方面进行了对比测试。根据 Bloomberg enterprise AI benchmark coverage 的报道,小型模型在金融任务上的准确率达到了 92%,而 GPT-4 为 89%。

同样的模式也出现在医疗笔记摘要中。一个经过医疗记录微调的 7B 参数模型,在由 The New York Times enterprise AI reporting 的独立审计员追踪的正确性指标上得分最高。

测试条件符合生产约束。每次运行都使用了由买方提供的相同提示词和评估标准。

为什么专业化会胜出

垂直领域数据提供了通用模型仅轻微采样的重复模式。针对这些模式进行微调可以在不增加参数的情况下提高输出质量。

在标准 GPU 集群上,训练运行时间保持在两周以内。每模型的成本低于重度使用单个 GPT-4 端点的每月云账单。

在相同硬件上,推理速度提高了八倍。对于典型的企业文档长度,延迟降至一秒以下。

首批受益的行业

金融团队现在将这些模型用于发票提取和风险评分。在 KeyCorp 和 Synovus Financial 的试点项目中,准确率的提升使人工审核量减少了一半。

医疗系统将模型应用于出院小结和预授权表格。合规官报告称,审计期间标记的项目有所减少。

法律部门测试合同条款提取。速度的提升使律师助理在常规审查上从花费数小时缩短到数分钟。

成本与控制视角

采购指标现在追踪的是每个正确答案的成本,而非模型大小。在报告的试验中,较小的模型将该指标降低了一个数量级。

数据更容易保留在公司防火墙内。团队避免将敏感记录发送到第三方推理端点。

当在多个参数量低于 100 亿的选项之间切换变得简单时,供应商锁定风险随之降低。

关于规模限制的遗留问题

批评者指出,这些优势仅局限于狭窄领域。根据公开排行榜(如 )显示,广泛的推理任务仍然更青睐较大的模型。Hugging Face Open LLM Leaderboard

重复微调的长期维护成本尚不明确。团队必须决定更新垂直数据集的频率。

安全团队询问较小的攻击面是减少了风险暴露还是仅仅改变了风险形式,正如安全研究员 Bruce Schneier 在他为 The Verge. 目前这些新部署尚无大规模泄露数据。

下季度需追踪的信号

关注 5 月份增加了小模型选项的两个企业级软件平台的采用数据。使用量的上升将证实需求的持续性。

检查三家专注于金融和法律微调的专业实验室的发布计划。如果在 9 月前发布新模型版本,将进一步缩小性能差距。

监控 Fortune 500 公司的采购政策更新。关于模型尺寸偏好的公开声明将显示基准测试结果是否改变了购买行为。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page