top of page

Ivo Sageのオープンソース法務AI、クローズドな法務モデルの定石に挑む

19 分前
読了時間: 20分

Ivoは、長期的な契約業務向けに特化してポストトレーニングされた、法務AI企業として初のオープンモデルを公開した。Ivo Sageのオープンソース法務AIリリースは、主としてプロプライエタリなモデル、管理されたプラットフォーム、厳重に守られた評価手法を中心に構築されてきた市場に挑戦するものだ。

同社は2026年10月1日、サンフランシスコで開催した初の顧客会議「Ivo Inscribe」でSageを発表した。開発者はMITライセンスのアダプター重みをダウンロードし、公開済みの評価を精査し、自らの契約ワークフロー向けにモデルを適応できる。

このオープン性が中心的な緊張関係を生む。IvoはSageがあらゆる最先端モデルを上回るとは主張しておらず、厳格なタスク完了率は改善の余地が大きいことを示している。むしろ同社は、最大規模のクローズドモデルを選ぶこと以上に、専門的なトレーニング、組織的な文脈、透明性の高いテストが重要だと主張している。

この動きは、基盤モデルを公開せずプロプライエタリなシステムへのアクセスを販売する法務AIベンダーに圧力をかける。また、技術力を持つ法務チームに検証可能な代替手段を提供するが、Sageの運用には一般的なデスクトップアプリケーションをダウンロードするよりはるかに多くのインフラが必要となる。

Ivo Sageのオープンソース法務AIリリースに含まれるもの

Ivoは、特化型モデル、そのトレーニング説明、そして異例なほど詳細な評価記録をMITライセンスで公開した。

Ivo Sage modelは、長期的なエージェント型法務業務のために設計されている。長期的な業務とは、文書の反復的な読解、分析、ツール利用、起案、修正を通じて、複数ステップの案件を完遂することを指す。

この説明は重要だ。Sageは法務質問に答えるチャットボットではない。ソース文書を読み、契約書の修正案、契約書草案、法務メモなどの成果物を作成する。単一の案件でも、最終成果物を出力するまでに数十回のツール呼び出しが発生し得る。

Ivoは基盤モデルをゼロから訓練したわけではない。SageはDeepSeek V4 Flashに適用するLoRAアダプター重みで構成される。LoRA(low-rank adaptation)は、比較的少数の追加重みを訓練することで、選択したモデルの挙動を変更する手法だ。

DeepSeek V4 Flashは、総パラメータ数2,840億、アクティブパラメータ数130億のMixture-of-Expertsモデルである。Mixture-of-Expertsシステムは各トークンについてネットワークの選択された部分のみを有効化し、すべてのパラメータを使う場合と比べて計算量を抑える。

Sageアダプター自体の容量は12.2 GiBである。Ivoはアテンション重みを固定したまま、フィードフォワード層と出力プロジェクションを訓練した。同モデルは、報告されたトレーニングおよび評価プロセスにおいて262,144トークンのコンテキストウィンドウをサポートする。

Ivoによると、Legal Agent Benchmarkの1,040件のトレーニング案件を対象に強化学習を行った。強化学習は、定義済みの基準で高得点となる出力に報酬を与えることで、モデルの挙動を調整する。

ベンチマーク環境は、ファイルの読解、作成、編集、検索、ナビゲーションのためにSageへ6つのツールを提供した。モデルがツールの使用を停止するか、指定されたターン数または生成上限に達した時点でエピソードは終了する。

この設定は、単独の回答ではなく、完了した法務業務を測定しようとするものだ。契約案件では、条項の特定、文書比較、指示の適用、文言の修正、利用可能な成果物の保存が求められる場合がある。

Ivoはタスクリスト、評価トランスクリプト、成果物、判定者の決定、トレーニング記録も公開した。この開示により、研究者は最終的なリーダーボードの数値以上のものを精査できる。ただし、完全な実験を再現するには依然として相当な計算資源が必要だ。

リリースにはMITライセンスが使用されており、一般に、限定的な条件の下で商用利用、改変、再配布を認めている。ただし、Sageは依然としてDeepSeekのベースモデルおよび関連コンポーネントを規定する別個の条件に依存している。

オープンな重みと完全なオープンシステムの違いは重要だ。Ivoが公開したのは、訓練済みアダプター、評価資料、利用手順である。どの弁護士でも直ちに実行できる、小規模で自己完結したアプリケーションを公開したわけではない。

同社は複数のグラフィックスプロセッサ上でSGLangを介してSageをサービングすることを推奨している。サンプル構成では8-wayテンソル並列化を採用し、モデル実行を8台のアクセラレータに分割する。

この要件は、小規模な法務チームによる即時導入を制限する。既存のAIインフラを持つ研究機関、リーガルテクノロジーベンダー、大学、企業の方が、まず実験を行いやすい立場にある。

それでも、このリリースはそれらの組織が検証できる対象を変える。同じモデルを社内のプレイブックに対してテストし、代替的なエージェントループを構築し、失敗パターンを測定し、Ivoを待つことなく改善案を提案できる。

これは契約特化の実験に向けた公開基盤を生み出す。また、競合他社や独立研究者に対し、Ivoの主張を検証できる具体的な成果物を提供する。

なぜ今、特化型の契約トレーニングが重要なのか

Sageは、エビデンスを隠さずに、焦点を絞ったポストトレーニングによって有能な汎用モデルをより効率的な契約エージェントへ転換できるかを検証する。

中心的なトレーニング資源は、複数ステップの法務業務を測定するために開発されたLegal Agent Benchmarkだった。その案件は、単純な多肢選択問題ではなく、一般的な法務実務と契約関連タスクを対象としている。

Ivoは利用可能な案件をトレーニング群と検証群に分けた。関連する契約書とソース文書は同じ側の分割に維持され、ほぼ同一の資料が両グループに現れるリスクを低減した。

報告された検証セットには、ホールドアウトされた180件の案件が含まれていた。このうち125件は一般的な法務業務、55件は契約に焦点を当てたものだった。Ivoは各タスクについて1エピソードを実行し、各エピソードで3回の判定を行った。

Sageは、全体の基準通過率をベースモデルの82.4%から91.5%へ引き上げた。基準通過率とは、案件全体で満たされた個別要件の割合を測る指標である。

より厳格な結果は、あまり好ましくない状況を示している。Sageがすべての要件を満たしたのは、全検証タスクのわずか15.6%であり、ベースモデルの7.2%と比較される。

55件の契約案件では改善がより大きかった。契約の基準通過率は、ポストトレーニング後に70.1%から91.3%へ上昇した。

しかし、すべての基準を満たした契約案件の割合は16.4%にとどまった。この数値は、Ivoの評価プロトコルでは5件中4件以上の案件が依然として少なくとも1つの必須要素を欠いていたことを意味する。

この違いは、リリースを解釈するうえで不可欠だ。91.3%の基準通過率は、Sageが契約案件の91.3%を完璧に完了したことを意味しない。

法務成果物は、1つのエスカレーション漏れ、不正確な条項、見落とされた指示によって失敗し得る。そのため、高い平均値と、完全に受け入れ可能な業務の低い達成率は共存し得る。

Sageはトレーニング後、より少ないステップも使用した。平均エピソード長は31.2ターンから25ターンに低下し、サンプリングされたトークン使用量は21%減少した。

これらの結果はIvoのメカニズムに関する主張を支持する。特化型の強化学習は、テスト環境において不要なモデル活動を減らしながら、契約業務の挙動を改善したように見える。

Ivoは、トレーニングから除外された別の契約修正ベンチマークであるRedlineBenchでもSageを評価した。報告されたスコアは、DeepSeek V4 Flashの30.8からSageでは45.7へ上昇した。

LegalBenchでの性能はほぼ変化しなかった。Sageは161タスクで平均83.0を記録し、ベースモデルの83.1と比較される。

専門化はより広範な能力を損なう可能性があるため、この安定性は重要だ。Ivoの結果は、ポストトレーニングがこのベンチマークにおける短文形式の法務推論を実質的に低下させることなく、長期の契約ワークフローを改善したことを示唆している。

エビデンスは依然として企業が作成したものだ。Ivoは構成を選び、競合モデルを実行し、レポートを公開した。買い手がランキングを確定的なものとして扱う前には、独立した再現がなお必要である。

このベンチマークはモデル判定者にも依存している。LLM判定者は各成果物をルーブリックに照らして採点するため、評価をスケールできる一方で、測定プロセスに別のモデルが加わることになる。

Ivoは、3回の判定と公開された評価記録によって、この不確実性を低減しようとした。これらの選択は検証可能性を改善するが、実際の案件全体で有資格の弁護士がレビューすることの代わりにはならない。

それでも、このトレーニング設計は汎用モデルに見られる明確な弱点を標的にしている。契約業務では、多くのステップにわたり、文書、指示、例外、依存関係へ持続的に注意を向ける必要がある。

汎用チャットボットは、契約書内の別の条項を見落としながらも、もっともらしい文言を生成できる。Sageは、流暢な回答ではなく文書化された成果物が報酬を決める、構造化されたワークフロー内で動作するよう訓練されている。

この点で、今回のリリースは法務AIにとどまらず重要である。これは、汎用モデルの選定から、ドメイン特化のポストトレーニング、ツール設計、評価、組織的文脈へと移行する、より広範な変化を支持している。

オープンな重みがプロプライエタリな法務AIに圧力をかける

Ivoは、モデルへのアクセスよりも、モデルを取り巻く文脈、ワークフロー、制度的知識の方が価値を持つようになると見込んでいる。

法務AIの主要企業は一般に、プロプライエタリなモデル、非公開の統合、ベンダー管理のインフラを中心に、管理された製品を構築してきた。このアプローチは、導入、サポート、セキュリティレビュー、説明責任を簡素化できる。

一方で、顧客が基盤モデルを直接精査することは妨げられる。買い手は通常、デモ、パイロットプロジェクト、契約上の約束、ベンダー提供のベンチマークを通じて、完成したサービスを評価する。

Sageは異なる道筋を示す。高度な法務部門は、重みを精査し、評価の一部を再現し、自ら承認したデータを使ってアダプターをファインチューニングできる。

これは商用プラットフォームの必要性をなくすものではない。防御可能な価値が存在する場所を変えるのである。

Ivoの共同創業者兼最高経営責任者であるMin-Kyu Jungは、次の改善はより大きなモデルではなく、業務の文脈から生まれると主張している。その例には、文書、交渉プレイブック、法務チームが確立した運用方法が含まれる。

この見解はIvoの商業的な焦点と一致する。同社の契約製品は、すべての契約を孤立した法務文書として扱うのではなく、企業固有の方針とワークフローを適用する。

Sageのリリースは、この製品仮説を公開実験へと変える。利用者がアクセス可能な重みから有用な挙動を再現できれば、クローズドモデルへのアクセスは競争上の障壁として弱まる。

Harveyは、この戦略的比較の反対側に位置する。同社はIvoがSageのポストトレーニングに使用したベンチマークを作成したが、その商業的優位性はプロプライエタリな法務プラットフォームにある。

この比較を無料ソフトウェア対有料ソフトウェアへ単純化すべきではない。Harveyや同様のベンダーは、モデルの重みだけでは提供できない、導入支援、統合、セキュリティ管理、サポート、製品インターフェースを提供している。

ダウンロード可能なアダプターも、正しいプレイブックを自動で取得したり、文書の権限を管理したり、監査証跡を保持したりすることはできない。こうした周辺システムが、法務AIを本番運用へ導入できるかを左右する場合が多い。

したがってIvoのリリースは、製品スタック全体ではなくモデル層でプロプライエタリなベンダーに圧力をかける。モデルは精査しやすくなる一方で、ワークフロー実行は依然として商業的な競争領域であり続ける。

これまでに公開された法務モデルの存在も、Ivoの「初」という主張を、当初の印象より限定的なものにしている。Equallは2024年、法務テキスト向けに特化したMITライセンスの言語モデル、SaulLM-7Bを公開した。

ほかの研究者も、法務向けエンコーダー、推論モデル、検索システム、法域別の言語モデルを公開している。オープンなリーガルAIはSageから始まったわけではない。

IvoはSageを、法務AI企業が公開し、長期にわたる契約業務向けにポストトレーニングした最初のオープンモデルだと説明している。この慎重に定義された主張は、エージェント型の契約実行を、汎用的な法務言語モデリングと区別するものだ。

この区別には意味があるものの、その主張と切り離して考えるべきではない。Sageの新規性は、複数ステップの契約トレーニング、ダウンロード可能な重み、寛容なライセンス、公開されたトレースを組み合わせている点にある。

この公開は、Ivoの競争上の立ち位置も反映している。同社は主にインハウスチーム向けの契約業務に注力する一方、より大きな競合他社は、法律事務所や企業全体のより幅広い法務業務を対象とすることが多い。

Ivoは2026年初頭、契約インテリジェンス事業を拡大するため、大型の資金調達ラウンドを発表した。資金調達の発表では、Microsoft Word内で動作し、弁護士による条項レビュー、リスク特定、レッドライン提案を支援する製品について説明している。

Sageを公開することで、規模の小さい専門ベンダーを見過ごしがちな開発者や研究者を引き付けられる可能性がある。また、新たな用途、失敗パターン、評価手法を明らかにする外部からの実験を促すこともできる。

この決定には競争上のリスクもある。競合他社は同じアダプターをダウンロードし、そのトレーニング手法を研究して、自社システムに有用な知見を取り入れられる。

Ivoは、モデルそのものはいずれ代替可能になると考えているため、このリスクを受け入れる構えのようだ。この考え方では、顧客コンテキストと製品実行力が、非公開の重みよりも持続的な差別化を生み出す。

法務部門は、これを確定した業界の結論ではなく、検証可能な仮説として捉えるべきだ。オープンモデルは制御性と検証可能性を提供する一方、マネージドプラットフォームは技術面・運用面の負担を軽減できる。

より興味深いのは、顧客がすべてのベンダーに同等の透明性を求め始めるかどうかだ。公開評価は、プロバイダーに対し、より厳格な完了率、失敗トレース、タスクレベルの証拠を開示するよう圧力をかける可能性がある。

そうなれば、Sageの最大の影響は直接的な導入から生まれないかもしれない。AI契約システムを信頼する前に、洗練された買い手が何を期待するかを変えることから生じる可能性がある。

厳格なスコアが示す法的判断のギャップ

Sageは測定可能な契約パフォーマンスを改善するが、その結果は、法務AIに依然として有資格者による監督が必要な理由も示している。

今回の公開で最も重要な数値は、契約基準達成率91.3%ではない。すべての契約基準を成功裏に満たした割合が16.4%にとどまる点だ。

この差は、法務自動化における根本的な問題を捉えている。システムはルーブリック項目の大半を満たしていても、弁護士がレビューなしに安全に受け入れられる成果物を出せない場合がある。

欠けた基準は、書式や副次的な指示に関するものかもしれない。一方で、エスカレーション判断、交渉上の立場、商業上のリスクに影響する文言に関わる可能性もある。

集計されたベンチマークスコアだけでは、こうした違いを表現できない。法務チームには、無害な見落としと重大な結果をもたらす誤りを区別する失敗分類が必要だ。

Sageの想定利用に関する声明も、この境界を認めている。Ivoは、このモデルが専門的判断を置き換えるのではなく、有資格の弁護士によるレビューのための法務業務を生成するとしている。

契約ワークフローが多くのアクションにまたがる場合、この注意喚起はさらに重要になる。検索、編集、ツール呼び出しが一つ増えるたびに、誤りや逸脱の機会も増える。

長いコンテキストが一貫した注意を保証するわけではない。モデルは技術的には契約書と補助文書を処理できても、適切な条項と正しいプレイブック規則を結び付けられないことがある。

Ivoはカンファレンスで、こうした判断上の失敗を検証する2つ目のベンチマークを予告した。Ivo-micro1 Contract Benchは、優先順位付け、抑制、取引への適応、エスカレーション、プレイブック準拠を評価する。

Ivoの予備的な調査結果によると、テスト対象のフロンティアモデルは、受諾または変更不要の判断を82%の確率で正しく処理した。一方、文言への対案提示または拒否が必要な場合、報告された成功率は46%まで低下した。

同社はまた、モデルが必須の新たな交渉論点を追加できたのは23%に過ぎなかったと報告した。専門家が定義したエスカレーション基準についても、平均で23%しか満たさなかった。

これらの数値は、独立した出版物ではなく、Ivoとその研究パートナーによるものだ。同社は公開結果セットを後日提供するとしており、外部の人々はまだすべての予備的主張を十分に監査できない。

それでもこのパターンは重要な違いを示している。契約レビューは、単に条項を検出してレッドラインを作成する作業ではない。沈黙、抵抗、人によるエスカレーションのいずれが適切かを知ることも含まれる。

Ivoは、編集スタイルにも別の行動上の違いがあると報告した。弁護士は変更の64%をインラインで行い、平均文字数は92文字だった。

テスト対象のモデルは、変更のうちインラインで行ったのが14%から37%にとどまったとされる。編集の平均文字数は207文字から369文字で、文全体を書き換える傾向がより強いことを示唆している。

広範な書き換えは、文言が妥当に見える場合でも実務上の問題を生む。レビュー時間を増やし、交渉済みの文言を乱し、何が正確に変わったのかを理解しにくくする。

取引固有のコンテキストも別の弱点を生んだ。Ivoによれば、モデルは標準的なプレイブック上の立場に関する基準を51%満たしたが、取引によって正しい対応が変わる場合には38%にとどまった。

この低下は、コンテキストに関するJungの主張を裏付ける。プレイブックは一般的な規則を提供するが、システムは依然として、事実が例外を正当化するのはいつかを判断しなければならない。

したがって、Sageを検討する組織にはモデルへのアクセス以上のものが必要だ。精選された文書、権限管理、タスク固有の指示、評価セット、エスカレーション規則、責任を負う人間のレビュー担当者が求められる。

信頼できるナレッジ検索も必要となる。契約エージェントが社内方針を適用できるのは、その方針が最新で、発見可能で、適切な案件に紐付いている場合に限られる。

検索可能なナレッジベースは、この周辺的な課題を示している。専門モデルも、トレーニング済みパラメーターだけに完全に依存するのではなく、適切に統制されたソース資料に依存している。

導入には追加の懸念も伴う。SageのDeepSeek由来の系統は、組織が自前のインフラでモデルを実行する場合でも、調達、法域、サプライチェーンに関する疑問を引き起こし得る。

セルフホスティングは、契約コンテンツを運用者が管理するインフラ内に留める。しかし、ローカル導入によって、アクセス制御、ログ記録、モデルガバナンス、ライセンスレビューが自動的に解決するわけではない。

ハードウェア要件も別の障壁となる。Sageはアダプター重みを使用するが、基盤モデルは実用的なサービングに本格的なGPU容量を必要とするほど大きい。

したがって「無料」が示すのは重みへのアクセスであり、運用の総コストではない。チームには依然として、計算インフラ、エンジニア、評価作業、セキュリティレビュー、法的監督が必要だ。

オープンアクセスは、購入者がベンダーのデモンストレーションに限定されないため、こうしたコストを調査しやすくする。一方で、より多くの実装責任を顧客に移すことにもなる。

適切な結論は、Sageが監督なしの法務業務に本番投入可能だということでも、厳格なスコアが低いから無関係だということでもない。この公開は、難しいワークフローを改善するための測定可能な出発点を提供する。

その透明性は、クローズドなベンダーならより不明瞭に示すかもしれない限界を露わにしている。独立した研究者が改善を再現し、予測可能な失敗の境界を特定できれば、この率直さは信頼を強める可能性がある。

Ivoの賭けが成功するかを左右する3つのシグナル

独立した再現、実際の導入、競合他社による情報開示が、SageがリーガルAIを変えるのか、それとも研究公開のままなのかを決める。

最初のシグナルは、独立した技術検証だ。研究者は、公開された成果物と同等のインフラを用いて、Sageが報告した改善を再現する必要がある。

再現では、平均基準達成率以上のものを検証すべきだ。厳格な完了率、評価者の一貫性、失敗の深刻度、ツール利用の安定性、異なるプロンプトへの感度を調べる必要がある。

研究者はまた、同一条件下でSageを新しいオープンモデルおよびクローズドモデルと比較すべきだ。基盤モデル、推論システム、エージェントフレームワークが変化するにつれ、ベンチマーク結果は急速に古くなり得る。

最も強力な検証は、法務専門家がブラインド化された成果物をレビューすることによって得られる。人間による評価は、ベンチマーク上の改善が、より明確で安全かつ使いやすい業務へと結び付くかを明らかにできる。

2つ目のシグナルは、Ivoの外で意味のある導入が進むかどうかだ。ダウンロード数だけでは、モデルが有用になったかどうかは示せない。

法務テクノロジーベンダー、大学、企業法務チーム、研究機関が、適応事例や評価結果を公開するかを注視すべきだ。こうしたプロジェクトは、Sageが元の環境を超えた業務を支援できることを示すだろう。

ファインチューニングされた派生モデルも、別の指標になる。チームはSageを、調達契約、雇用契約、プライバシー条項、法域固有のドラフティング向けに適応させるかもしれない。

本番利用には、レイテンシー、インフラ要件、エラー処理、ガバナンスに関する証拠が必要になる。ケーススタディは、すべての改善をモデルの功績とするのではなく、完全なワークフローを説明すべきだ。

否定的な証拠は成功と同じくらい重要になる。チームがサービング要件や統合作業の負担が利点を上回ると判断すれば、プロプライエタリなプラットフォームは強い優位性を維持するだろう。

3つ目のシグナルは、競合する法務AI企業がどう反応するかだ。Ivoの挑戦に応じるために、彼らが自社の重みを公開する必要はない。

競合他社は、タスクレベルの評価トレースを公開したり、顧客が管理するテストを許可したり、顧客管理下のインフラ内での導入を支援したりできる。また、平均スコアと併せて、より厳格な完了指標を開示することもできる。

沈黙は、クローズドなシステムの性能が劣る証明にはならない。しかし購入者は、ベンダーがオープンモデルの公開記録に匹敵する証拠を提供できない理由を、ますます問うようになるかもしれない。

新たなIvo-micro1ベンチマークには、特に注意を払う価値がある。公開結果が出れば、研究者は過度な譲歩、不十分なエスカレーション、広範な書き換え、取引への不十分な適応に関する主張を検証できる。

こうした行動は、一般的な法務知識よりも専門的判断に近い位置にある。ベンチマークがそれらを信頼性高く測定できれば、Sage自体よりも大きな意味を持つ可能性がある。

今回の公開は、Ivoのより広い論旨に対する明確な反証テストも生み出す。アクセス可能なモデルが十分な基盤となり、コンテキストとワークフローが実世界での品質を決めるなら、Sageは戦略的に成功する。

専門的なポストトレーニングでは埋められない持続的な優位性をプロプライエタリな基盤モデルが維持するなら、この見方は弱まる。また、組織がSageを経済的または安全に運用できない場合も弱まる。

法務チームにとって、当面の行動は既存システムを置き換えることではない。実際の契約、方針、例外、エスカレーション規則を反映する評価ケースを開発することだ。

こうしたケースにより、購入者は同じ証拠に基づいてオープンシステムとクローズドシステムを比較できる。また、ベンダーの見出しとなるスコアが、組織内で重要な業務と一致するかどうかも明らかになる。

Ivo Sageのオープンソース法務AIは、技術チームに対し、製品デモンストレーションを額面どおりに受け入れるのではなく、検証できるモデルを提供する。その厳格な結果は、安易な勝利宣言も許さない。

今回のリリースは、焦点を絞ったポストトレーニングによって、長期にわたる契約ワークフローを改善できることを示している。同時に、信頼できるエンドツーエンドの法的判断は、依然として未解決の課題であることも明らかにしている。

この組み合わせこそが、Sageを注目に値する存在にしている。独立系チームはこの成果を再現し、有用な適応モデルを公開し、プロプライエタリなベンダーにより高い透明性を求めることになるのだろうか。その答えが、オープンな法務モデルがインフラとなるのか、それとも魅力的な実験にとどまるのかを左右する。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page