Ivo Sage 开源法律 AI 挑战封闭式法律模型的既有套路
Ivo 发布了法律 AI 公司首个专为长周期合同工作进行后训练的开放模型。Ivo Sage 开源法律 AI 的发布,向一个主要围绕专有模型、受控平台和严密保密的评估方法构建的市场发起挑战。
该公司于 2026 年 10 月 1 日在旧金山举办首届 Ivo Inscribe 客户大会期间推出 Sage。开发者可以下载其采用 MIT 许可证的适配器权重,查看已发布的评估结果,并针对自己的合同工作流调整模型。
这种开放性构成了核心张力。Ivo 并未宣称 Sage 胜过所有前沿模型,其严格的任务完成率数据也显示,模型仍有相当大的改进空间。相反,该公司认为,专业化训练、组织语境和透明测试,比单纯选择规模最大的封闭模型更重要。
这一举措给那些在不公开底层模型的情况下销售专有系统访问权限的法律 AI 厂商带来压力。它也为技术型法务团队提供了一个可测试的替代方案,尽管运行 Sage 所需的基础设施远多于下载一款普通桌面应用。
Ivo Sage 开源法律 AI 发布包含哪些内容
Ivo 已依据 MIT 许可证发布了一款专业模型、训练说明以及异常详尽的评估记录。
Ivo Sage 模型专为长周期、智能体式法律工作设计。长周期工作是指通过反复阅读文件、分析、使用工具、起草和修订,完成一项多步骤任务。
这一描述很重要,因为 Sage 并不是一个法律问答聊天机器人。它会读取源文件,并产出合同修订稿、协议草案和法律备忘录等交付物。在模型完成最终工作前,单项任务可能涉及数十次工具调用。
Ivo 并未从头训练基础模型。Sage 由应用于 DeepSeek V4 Flash 的 LoRA 适配器权重构成。LoRA,即低秩适配,通过训练一组相对较小的额外权重来改变模型的特定行为。
DeepSeek V4 Flash 是一款混合专家模型,总参数量为 2840 亿,活跃参数量为 130 亿。混合专家系统会针对每个 token 仅激活网络中的选定部分,相比使用全部参数可减少计算量。
Sage 适配器本身占用 12.2 GiB。Ivo 训练了前馈层和输出投影,同时保持注意力权重冻结。该模型在所报告的训练和评估过程中支持 262,144-token 的上下文窗口。
Ivo 表示,其利用 Legal Agent Benchmark 中的 1,040 项训练任务进行了强化学习。强化学习通过奖励在既定标准下得分良好的输出,来调整模型行为。
基准测试环境为 Sage 提供了六种工具,用于读取、写入、编辑、搜索和浏览文件。当模型停止使用工具,或达到规定的轮次及生成上限时,一个回合即告结束。
这一设置旨在衡量完成的法律工作,而非孤立的答案。一项合同任务可能要求定位条款、比对文件、执行指令、修订措辞,并保存可用的交付物。
Ivo 还发布了任务清单、评估记录、交付物、评审决定和训练记录。这些披露让研究人员能够审视排行榜最终数字之外的内容,尽管复现完整实验仍需要大量计算资源。
此次发布采用 MIT 许可证,通常允许在有限条件下进行商业使用、修改和再分发。不过,Sage 仍受其 DeepSeek 基础模型及相关组件各自条款的约束。
开放权重与完整开放系统之间的区别十分重要。Ivo 发布了训练完成的适配器、评估材料和使用说明,但并未发布一款任何律师都能立即运行的小型自包含应用。
该公司建议通过 SGLang 在多个图形处理器上部署 Sage。其示例配置采用八路张量并行,将模型执行任务分配至八个加速器。
这一要求限制了较小法务团队的即时采用。研究人员、法律科技厂商、大学以及拥有现有 AI 基础设施的企业,更有条件率先开展试验。
不过,此次发布改变了这些群体能够审查的内容。他们可以用同一模型测试内部工作手册,构建替代性智能体循环,衡量失败模式,并在无需等待 Ivo 的情况下提出改进方案。
这为围绕合同的专项实验建立了一个公共基础。它也为竞争对手和独立研究人员提供了一个具体对象,可据此检验 Ivo 的主张。
为什么专业化合同训练如今如此重要
Sage 测试了专注的后训练是否能在不隐藏证据的情况下,将一款能力出色的通用模型转变为更高效的合同智能体。
核心训练资源是Legal Agent Benchmark,其开发目的在于衡量多步骤法律工作。其任务涵盖一般法律实务和合同相关工作,而非简单的选择题。
Ivo 将可用任务划分为训练组和验证组。相关合同和源文件被保留在划分的同一侧,从而降低了几乎相同的材料同时出现在两个组别中的风险。
报告中的验证集包含 180 项保留任务。其中,125 项涉及一般法律工作,55 项聚焦合同。Ivo 为每项任务运行一个回合,并对每个回合进行了三次评审。
Sage 将总体标准通过率从基础模型的 82.4% 提升至 91.5%。标准通过率衡量的是所有任务中单项要求得到满足的比例。
更严格的结果则呈现出不那么令人满意的情况。Sage 仅在全部验证任务中的 15.6% 完成了每一项要求,而基础模型的这一比例为 7.2%。
在 55 项合同任务上,它的改进更为明显。后训练后,合同标准通过率从 70.1% 升至 91.3%。
然而,其全标准合同通过率仅达到 16.4%。这一数字意味着,按照 Ivo 的评估协议,超过五分之四的任务仍至少遗漏了一项必需元素。
这一差异对于解读此次发布至关重要。91.3% 的标准通过率,并不意味着 Sage 完美完成了 91.3% 的合同任务。
法律交付物可能因漏掉一次升级处理、使用错误条款或忽视一项指令而失败。因此,较高的平均分可以与完全可接受工作占比较低并存。
训练后,Sage 使用的步骤也更少。平均回合长度从 31.2 轮降至 25 轮,而采样 token 用量减少了 21%。
这些结果支持 Ivo 对其机制的论述。在测试环境中,专业化强化学习似乎在减少不必要模型活动的同时,改善了合同相关行为。
Ivo 还在未纳入训练的独立合同修订基准 RedlineBench 上评估了 Sage。报告显示,得分从 DeepSeek V4 Flash 的 30.8 上升至 Sage 的 45.7。
在 LegalBench 上的表现则几乎没有变化。Sage 在 161 项任务中的平均得分为 83.0,而其基础模型为 83.1。
这种稳定性很重要,因为专业化可能损害更广泛的能力。Ivo 的结果表明,其后训练提升了长周期合同工作流表现,同时并未在该基准上实质性削弱短篇法律推理能力。
这些证据仍由公司自行产出。Ivo 选择了配置、运行了竞品模型,并发布了报告。在买方将这些排名视为定论之前,仍有必要进行独立复现。
该基准还依赖模型评审。LLM 评审会依据评分标准对每份交付物评分,这种方式能扩大评估规模,但也将另一种模型引入了测量过程。
Ivo 试图通过三次评审和公开评估记录来降低这种不确定性。这些选择提高了可审查性,但不能替代合格律师对真实事项的审阅。
尽管如此,这一训练设计确实瞄准了通用模型一个容易识别的弱点。合同工作要求在多个步骤中持续关注文件、指令、例外情况和依赖关系。
通用聊天机器人可能生成颇具说服力的措辞,却忽略协议其他位置的一项条款。Sage 接受的训练是在一个结构化工作流中运作,在其中,书面交付物而非流畅的回答决定奖励。
这使得此次发布的意义超出了法律 AI 范畴。它支持了一种更广泛的转变:从选择通用模型,转向特定领域的后训练、工具设计、评估和组织语境。
开放权重给专有法律 AI 带来压力
Ivo 押注于:模型访问权的价值将低于围绕模型构建的语境、工作流和机构知识。
法律 AI 领导厂商通常围绕专有模型、私有集成和由供应商管理的基础设施构建受控产品。这种方式能够简化部署、支持、安全审查和问责。
但它也阻止客户直接审查底层模型。买方通常通过演示、试点项目、合同承诺和供应商提供的基准来评估完整服务。
Sage 提供了另一条路径。成熟的法务部门可以检查权重,复现部分评估,并利用自身获批的数据对适配器进行微调。
这并未消除对商业平台的需求,但改变了可防御价值所在的位置。
Ivo 联合创始人兼首席执行官 Min-Kyu Jung 认为,下一阶段的改进将来自工作语境,而非更大的模型。他举例提到文件、谈判手册以及法务团队既有的工作方法。
这一观点与 Ivo 的商业重点一致。其合同产品采用公司特定的立场和工作流,而非将每份协议都视为孤立的法律文本。
Sage 的发布将这一产品理念转化为一项公开实验。如果用户能够从可获得的权重中复现有用行为,封闭模型的访问权将成为较弱的竞争壁垒。
Harvey 则处于这一战略比较的另一端。它创建了 Ivo 用于 Sage 后训练的基准,但其商业优势集中于专有法律平台。
这种比较不应被简化为免费软件与付费软件之争。Harvey 和类似厂商提供了部署、集成、安全控制、支持和产品界面,而这些并非模型权重本身所能提供。
可下载的适配器也无法自动获取正确的工作手册、维护文件权限或保留审计轨迹。这些周边系统往往决定法律 AI 能否投入生产使用。
因此,Ivo 的发布是在模型层面向专有厂商施压,而非覆盖整个产品栈。模型变得更容易审查,而工作流执行仍将是商业竞争的战场。
此前已有开放法律模型,因此 Ivo 所谓“首个”的说法比乍听之下更为狭窄。Equall 于 2024 年推出了 SaulLM-7B,这是一款采用 MIT 许可证、专为法律文本打造的语言模型。
其他研究者也已发布法律编码器、推理模型、检索系统,以及面向特定司法辖区的语言模型。开放法律 AI 并非始于 Sage。
Ivo 将 Sage 描述为首个由法律 AI 公司发布、并针对长程合同工作进行后训练的开放模型。这一经过谨慎界定的说法,将代理式合同执行与通用法律语言建模区分开来。
这一差异确实有意义,但也应始终与该主张一并看待。Sage 的新颖之处在于结合了多步骤合同训练、可下载权重、宽松许可和公开轨迹。
此次发布也反映了 Ivo 的竞争定位。该公司主要聚焦企业内部法务团队的合同业务,而规模更大的竞争对手通常覆盖更广泛的律所和企业法律工作。
Ivo 在 2026 年早些时候宣布完成一轮重大融资,以扩展其合同智能业务。其融资公告称,产品可在 Microsoft Word 中运行,帮助律师审查条款、识别风险并提出修订建议。
发布 Sage 可以吸引原本可能忽略这家较小型专业供应商的开发者和研究人员。它还可能鼓励外部实验,从而发现新的用途、失效模式和评估方法。
这一决定也带来竞争风险。竞争对手可以下载相同的适配器,研究其训练方法,并将有用发现融入自身系统。
Ivo 似乎愿意承担这一风险,因为它相信模型本身将逐渐变得可替代。按照这一逻辑,客户上下文和产品执行力比私有权重更能形成持久差异化。
法务部门应将此视为可验证的命题,而非已经确定的行业结果。开放模型提供控制权和可检查性,而托管平台则可减轻技术和运营负担。
更值得关注的问题是,客户是否会开始要求每家供应商提供类似的透明度。公开评估可能促使供应商披露更严格的完成率、失败轨迹和任务层面的证据。
如果发生这种情况,Sage 最大的影响或许并非来自直接采用,而是改变成熟买家在信任 AI 合同系统之前希望看到的内容。
严格评分揭示法律判断鸿沟
Sage 提升了可量化的合同表现,但其结果也说明,为何法律 AI 仍需合格专业人士监督。
此次发布中最重要的数字并非 91.3% 的合同标准达成率,而是仅 16.4% 的全部合同标准成功完成率。
这一差距揭示了法律自动化的根本问题:系统可以满足大多数评分项,却仍可能产出律师无法在未经审查的情况下安全接受的交付成果。
遗漏的标准可能涉及格式或次要指令,也可能涉及升级处理决策、谈判立场,或影响商业风险敞口的措辞。
仅靠综合基准评分无法表达这些差异。法务团队需要失效分类体系,以区分无害遗漏与会造成实质后果的错误。
Sage 的预期用途声明也承认了这一边界。Ivo 表示,该模型产出的是供合格律师审查的法律工作,而非替代专业判断。
当合同工作流跨越多项行动时,这一警示就更加重要。每增加一次搜索、编辑或工具调用,都会增加一次出错或偏离的机会。
长上下文并不能保证持续且一致的关注。模型在技术上可以处理协议和支持文件,却仍可能无法将正确条款与正确的操作手册规则关联起来。
Ivo 在其会议上预览了第二项基准测试,用于考察这些判断失误。Ivo-micro1 Contract Bench 评估优先级判断、克制性、交易适应能力、升级处理以及操作手册合规性。
根据 Ivo 的初步发现,受测前沿模型在接受或不作修改的决策上有 82% 的时间判断正确。当它们需要提出反提案或拒绝措辞时,报告的成功率降至 46%。
该公司还称,模型仅有 23% 的时间会加入所需的新谈判要点;平均仅满足 23% 由专家定义的升级处理标准。
这些数据来自 Ivo 及其研究合作伙伴,而非独立出版物。该公司表示后续将发布公开结果集,因此外部人士目前尚无法完整审计每一项初步主张。
不过,这一模式仍指出了重要区别。合同审查不只是识别条款并生成修订建议,还涉及判断何时应保持沉默、坚持立场或升级交由人工处理。
Ivo 还报告了编辑风格上的另一项行为差异。律师有 64% 的修改直接在原文中进行,平均长度为 92 个字符。
据称,受测模型只有 14% 至 37% 的修改直接在原文中完成。其编辑平均长度在 207 至 369 个字符之间,显示出更强的整段重写倾向。
即使措辞看似合理,大范围重写也会造成实际问题。它会增加审查时间、扰动已谈定的表述,并让人更难准确理解究竟修改了什么。
交易特定上下文则暴露出另一项弱点。Ivo 表示,模型满足标准操作手册立场相关标准的比例为 51%,但当交易情况改变正确应对方式时,这一比例只有 38%。
这一下降支持了 Jung 关于上下文的观点。操作手册提供通用规则,但系统仍必须判断事实何时足以构成例外。
因此,考虑采用 Sage 的组织需要的不只是模型访问权限,还需要经过整理的文件、权限控制、任务专属指令、评估集、升级规则以及可追责的人工审查者。
它们还需要可靠的知识检索。合同代理只有在内部政策保持最新、可发现并与正确事项关联时,才能应用这些政策。
可检索的知识库说明了这一周边挑战。专业模型仍依赖治理良好的源材料,而不能完全依赖其训练参数。
部署还带来额外担忧。Sage 的 DeepSeek 血统即使在组织自行运行模型的基础设施上,也可能引发采购、司法辖区和供应链问题。
自行托管可将合同内容保留在运营方控制的基础设施中。然而,本地部署并不能自动解决访问控制、日志记录、模型治理或许可审查问题。
硬件要求构成另一道门槛。Sage 使用适配器权重,但底层基础模型仍足够庞大,实际提供服务需要相当可观的 GPU 容量。
因此,“免费”描述的是对权重的访问,而非总运营成本。团队仍需要计算基础设施、工程师、评估工作、安全审查和法律监督。
开放访问可以让这些成本更容易被调查,因为买家不再局限于供应商演示;但它也可能将更多实施责任转移给客户。
正确的结论既不是 Sage 已可用于无人监督的生产级法律工作,也不是其较低的严格评分使它无关紧要。此次发布为改进这一困难工作流提供了可量化的起点。
其透明度暴露了封闭供应商可能呈现得不那么清楚的局限。如果独立研究者能够复现这些提升并识别出可预测的失效边界,这种坦诚可能会增强信任。
三个信号将决定 Ivo 的押注是否奏效
独立复现、实际采用和竞争性披露,将决定 Sage 是改变法律 AI,还是仅停留在研究发布。
第一个信号是独立技术验证。研究人员需要利用公开发布的材料和可比基础设施,复现 Sage 所报告的提升。
复现测试不应只考察平均标准达成率,还应检验严格完成率、评审一致性、失败严重程度、工具使用稳定性以及对不同提示词的敏感性。
研究人员还应在相同条件下,将 Sage 与更新的开放和封闭模型进行比较。当基础模型、推理系统和代理框架发生变化时,基准结果可能很快过时。
最有力的验证将来自法律专家对盲测交付成果的审查。人工评估可以揭示基准改进是否转化为更清晰、更安全且更实用的工作成果。
第二个信号是 Ivo 之外的实质性采用。单凭下载量无法证明某个模型已经变得有用。
应关注法律科技供应商、大学、企业法务团队和研究实验室是否发布适配版本或评估结果。这些项目将证明 Sage 能够支持其原始环境之外的工作。
微调版本将提供另一项指标。团队可能会将 Sage 适配用于采购合同、雇佣协议、隐私附录或特定司法辖区的起草工作。
生产使用需要有关延迟、基础设施需求、错误处理和治理的证据。案例研究应解释完整工作流,而非将每一项改进都归功于模型。
负面证据与成功同样重要。如果团队发现服务需求或集成工作超过收益,专有平台将保持显著优势。
第三个信号是竞争法律 AI 公司如何回应。它们无需发布自己的权重,也能回应 Ivo 的挑战。
竞争对手可以发布任务层面的评估轨迹,允许客户控制测试,或支持在客户自行管理的基础设施中部署。它还可以在平均分数之外披露更严格的完成指标。
沉默并不能证明封闭系统表现不佳。然而,买家可能会日益追问:为何供应商无法提供与开放模型公开记录相当的证据。
新的 Ivo-micro1 基准尤其值得关注。公开结果将让研究人员审查有关过度让步、升级处理薄弱、大范围重写和交易适应不佳的主张。
这些行为比通用法律知识更接近专业判断。如果该基准能够可靠衡量它们,其重要性可能超过 Sage 本身。
此次发布还为 Ivo 更广泛的论点提供了清晰的证伪检验。如果可访问模型成为足够的基础,而上下文和工作流决定现实世界质量,那么 Sage 在战略上便是成功的。
如果专有基础模型保持了专业后训练无法弥合的持久领先优势,这一判断就会减弱;如果组织无法以经济或安全的方式运行 Sage,这一判断同样会减弱。
对法务团队而言,眼下的行动并不是替换现有系统,而是开发反映实际协议、政策、例外和升级规则的评估案例。
这些案例让买家能够基于相同证据比较开放和封闭系统,也能揭示供应商的宣传评分是否与组织内部真正重要的工作相符。
Ivo Sage 开源法律 AI 让技术团队能够检查模型,而不必仅凭产品演示照单全收。其严格结果也避免了轻易的乐观论调。
该发布表明,有针对性的后训练能够改善长合同工作流。与此同时,它也说明,可靠的端到端法律判断仍是一个尚未解决的问题。
这种组合使 Sage 值得关注。独立团队能否复现这些成果、发布有价值的适配版本,并推动专有供应商提高透明度?答案将决定开源法律模型会成为基础设施,还是仅仅停留在引人注目的实验阶段。



