top of page

Pangram、AIコンテンツ検出の拡大に向けて900万ドルを調達

Pangramは900万ドルを調達した。新たなTechCrunchのコンテンツテストでは、同社の最新AI検出モデルが持つ可能性と限界の両方が明らかになった。ニューヨーク拠点のスタートアップは、テキスト向けのPangram 4を公開し、Pangram Imageも研究プレビューとして提供開始した。

この組み合わせにより、ありふれた資金調達の発表は、より大きな命題を試す場となる。生成モデルによって著作者を判断しにくくなるなか、Pangramは組織が合成メディアの分類に対価を支払うと見込んでいる。しかし、あらゆる分類結果は、学生、ライター、研究者、出版社、従業員に影響を及ぼし得る。

中心にある対立は、Pangramと単一の競合他社との争いではない。統計的検出と、ソフトウェアが著作者について決定的な判定を下せるという高まりつつある期待との対立である。Pangramは混合コンテンツの検出を改善したとしているが、独立した検証は、精度の高い分類器であってもすべての争いを決着させられない理由を示している。

GPTZero、Copyleaks、Originality.ai、Winston AIも同じ需要を追っている。OpenAI、Anthropic、Google、Metaなどの開発者によるモデルがより自然な出力を生み出すにつれ、これらの企業は同じく変化し続ける標的に向き合っている。Humanizerプログラムは、生成された素材を書き換えて出所を隠すことで、さらに別の層を加える。

Pangramの資金調達により、同社はこの競争をテキストから画像へと広げるための資源を得た。より困難な課題は、ソフトウェアが不確実で、基礎となるポリシーが異なり、誤りが現実的な結果を伴う場合に、検出結果をどう解釈すべきかを確立することだ。

Pangramの調達が検出への賭けを拡大

Pangramは単にテキストチェッカーを更新するのではなく、より広範な著作者検出プラットフォームに資金を投入している。

この900万ドルのラウンドはMenlo Venturesが主導した。元の資金調達レポートによると、Haystack、ScOp、Script Capital、Cadenzaも参加した。Pangramはこの資金調達を2つのモデルリリースと同時に発表しており、製品拡大を投資ストーリーの中核に据えている。

Pangram 4は同社の次世代テキスト分類器である。分類器とは、人間が書いた、AI支援を受けた、AIが生成したといったカテゴリに入力を割り当てるモデルだ。同社によると、Pangram 4は支援を受けた文章や、人間と機械が生成した文章が混在する文書の検出で99%を超える精度を実現している。

混合文書は、手を加えていないチャットボット出力よりも困難で一般的なケースであるため、この主張は重要だ。ライターは記事の下書きを作成し、モデルに複数の段落の修正を依頼したうえで、さらに結果を編集するかもしれない。二値のラベルでは、その過程を適切に表せない。

Pangramによると、新モデルはAI humanizerを通したコンテンツの特定にも優れている。こうしたサービスは、検出器が認識しにくくなるよう生成文を改変する。検出は、双方が相手の最新手法に適応する敵対的な競争となる。

画像プレビューは、この競争を言語の外側へと広げる。Pangramによると、Pangram Imageはピクセルレベルの分布、すなわち画像を構成する値に見られる統計的パターンを分析する。単一の生成器に紐づくウォーターマークチェッカーとは異なり、このモデルはさまざまな画像システムの出力を検出することを目的としている。

このプレビューでは、どの領域が合成物に見えるかを示すヒートマップも生成できる。この機能は、画面や印刷面にAI生成画像が含まれる実写写真など、合成ケースを対象としている。Pangramは研究プレビュー期間後に、より広範なリリースを計画している。

この拡大によりPangramが対応できる問題は大きくなる一方、検証の負担も増大する。テキスト、写真、イラスト、スクリーンショット、編集済みの合成物はそれぞれ異なる振る舞いをする。あるコンテンツ種別での性能は、別の種別での性能をほとんど示さない。

Pangramは、この拡大にあたり異例なほど高い公的注目を集めている。その結果はすでに書籍、ジャーナリズム、学術研究、オンライン投稿をめぐる議論に影響を与えてきた。この注目度は、結果がどのように生成されたかを検討する前に、ユーザーが色付きのスコアを証拠として扱う可能性があるため、各エラーをより重大なものにする。

したがって、この調達は2つの製品とガバナンス上の課題に資金を提供するものだ。Pangramは検出を改善すると同時に、モデル出力が確率に基づくシグナルであることを顧客に理解してもらわなければならない。それは、文書や画像がどのように作られたかを完全に記録したものではない。

この区別が、この物語の中心的な緊張を生む。検出性能の向上は信頼と導入を増やし得る。導入が広がれば、依然として不完全な結果に基づいて行われる重大な判断の数も増える。

TechCrunchのコンテンツテストが重要な理由

TechCrunchのコンテンツ実験は、有能なモデルであっても、文レベルの判断が通常の編集によって変動し得ることを示した。

記者のRebecca Bellanは、ChatGPTとClaudeが生成した記事でPangram 4をテストした。検出器は完全に生成された記事を容易に特定し、手作業で編集した後も通常はそれらを認識し続けた。チャットボットに検出回避を求めるプロンプトも、これらのテストではモデルを一貫して回避できなかった。

人間と機械の寄与を組み合わせると、結果はより複雑になった。Bellanは自身の記事の1本をChatGPTとClaudeに渡し、推敲を依頼した。PangramはAI支援スコア13%を返し、一部の変更された表現を特定したが、人間が書いた文の一部も支援ありと判定した。

元の記事は、モデル支援による改訂前には完全に人間によるものという結果を受けていた。この比較は、Pangramが文書内の実際の変化を検出したことを示唆する。しかし、ハイライトされた箇所は、その変化を生んだ編集と完全には対応していなかった。

2つ目の実験では、個人ニュースレターの文章を人間作成部分と生成部分に分割した。ChatGPTとClaudeには、続きの文章で著者の既存の文体を模倣するよう指示した。Pangramは概ね、元の部分と合成された続きの部分を区別した。

これらのテストは、統制されたベンチマークを構成するものではない。対象は少数の文書、プロンプト、モデル、編集パターンに限られていた。それでも、顧客が直面する実務的な問いを示している。すなわち、ハイライトされた文が証拠なのか、それともより広範なレビューを構成する一要素にすぎないのかという問題だ。

Pangramは、人間が作成した文書のうち約1万件に1件が誤ってAIと分類されるとしている。これは同社が提示した率であり、その意味はテスト対象の領域、文書の長さ、モデルバージョン、判定しきい値、実際の顧客入力の分布に依存する。

同社が公開している検出手法は、反復的な学習プロセスを説明している。Pangramは人間作成と合成の文書から始め、分類器が誤って処理する難しい事例を見つけ、それらを学習データに追加し、モデルを再学習させる。

Pangramは、このアプローチの一部をsynthetic mirroringと呼んでいる。人間作成の文書に対し、元のトピック、長さ、スタイル、トーンに一致する機械作成の対応文書を生成する。これは、分類器が表層的な題材やジャンルの違いに依存するのを防ぐことを目的としている。

この手法のもう一つの部分であるhard negative miningは、大規模な人間作成データセットから、モデルが誤ってフラグを付けた文書を探す。それらのエッジケースは、その後学習素材となる。目的は、類似の素材が顧客に届く前に、分類器に一般的ではない人間の文章について学習させることだ。

Pangramの以前の技術報告では、10のテキスト領域と8つの言語モデルにまたがる1,976件の文書を評価した。著者らは複数の比較システムより大幅に低いエラー率を報告したが、その報告書はPangramの創業者らが執筆している。

この論文はまた、hard negative mining後の領域加重偽陽性率が0.02%だったと報告している。結果は領域ごとに異なっており、単一の総合精度値ではすべての導入環境を説明できないことを裏付ける。

これが、TechCrunchのコンテンツテストがそのサンプル規模を超えて重要である理由だ。モデルが全体として高い性能を示すことと、特定の文を正しく説明できることの間にある解釈上の隔たりを浮き彫りにする。顧客が直面するのは、ベンチマーク平均ではなく個別の事例である。

真の競争は検出と確実性の間にある

Pangramは正しい判断の確率を高められるが、著作者を観測可能な事実に変えることはできない。

テキスト検出器は、文書の完全な編集履歴を復元するものではない。既知の人間作成サンプルと生成サンプルの統計的な差異を学習し、新しい素材がどちらのクラスにより適合するかを推定する。この仕組みは、絶対に誤らないものでなくても有用になり得る。

Pangramは、隠しウォーターマークやコピーされたメタデータに依存していないとしている。その代わり、同社の分類器は言語モデルが繰り返し行う文体上の選択を学習する。これにより、元の技術的メタデータを失ったコンテンツも含め、異なる生成器の出力を評価できる。

この柔軟性は、避けられない変化し続ける標的という問題を生む。モデル開発者は、学習データ、アラインメント手法、サンプリング挙動、文章スタイルを継続的に調整している。昨日の出力を対象に学習した検出器は、一度も見たことのないシステムやバージョンに一般化しなければならない。

Humanizerは別の方向からモデルに圧力をかける。その目的は、分類器が生成文と結び付けるシグナルを取り除くことにある。一部は、不自然な言い回しや文法上のばらつきを導入し、可読性を犠牲にして検出スコアを下げる。

Pangramの以前の研究は、ミラーリングされた事例と難しい人間作成文書が一般化を改善すると論じている。同社は、報告されたエラーに対するフィードバックループも維持している。こうした手法は、特に十分に代表的なデータがある場合、繰り返される誤りを減らし得る。

それでも、カテゴリ自体には議論の余地が残る。「AI-assisted」には、校正、書き換え、アイデア生成、翻訳、調査支援、大規模な再生成が含まれ得る。2つの機関が同じワークフローを観察しても、まったく異なるポリシーを適用する可能性がある。

出版社は文法修正を認めつつ、生成された文章を禁止するかもしれない。大学の授業ではブレインストーミングを許可しながら、学生に下書きの保持を求める可能性がある。雇用主は、事実を人間が検証する限り、モデル支援による文章作成を推奨するかもしれない。

検出器は、こうしたポリシー上の違いを解決できない。テキストがモデルによって生成または修正された素材に似ているかどうかを推定できるだけだ。したがって責任ある判断には、バージョン履歴、メモ、引用、インタビュー、作成者の説明など、追加の証拠が必要となる。

検出が日常的なコンテンツワークフローに入るにつれて、この制約はより重要になる。組織はすでに、メモ、文書、モデル生成の要約を組み合わせるAI knowledge basesを利用している。最終的な文章には、多くの人間と機械の寄与が反映され得る。

信頼できるプロベナンスは、それらの寄与を直接記録する。検出は、プロベナンスが失われた、あるいは提示されなかった後に、完成した成果物から逆向きに判断する。これはスクリーニングには価値を持つが、証明としては弱いことを意味する。

同じ問題は画像検出にも現れる。ピクセル分布は合成に関連するパターンを明らかにし得るが、リサイズ、圧縮、スクリーンショット、フィルター、物理的な再撮影によって、これらのパターンは変化し得る。検出された領域も、誰が生成したのか、あるいはその使用が規則に違反したのかを説明するものではない。

Pangramのクロスモデルアプローチは、作成時に認証情報やウォーターマークを付加するプロベナンス技術と対照をなす。検出は、多くの出所不明コンテンツを評価できる。付加されたプロベナンスは、ツールがそれを保持し検証する場合に限り、より強力な作成記録を提供できる。

これらのアプローチは相互に補完し合うべきだ。参加するシステムが記録を保持していれば、来歴情報は何がいつ起きたかを確立できる。記録がない場合には、検出が疑わしい素材を示すことができる。いずれの仕組みも、調査を普遍的に代替するものになってはならない。

したがってPangramの最も強力な商業的主張は、完璧な確実性ではない。人間が確認しなければならない素材の量を減らしつつ、より注意深い検討に値する事例を見つけることだ。これは劇的さでは劣る約束だが、より擁護しやすい。

精度の主張が重大な結果と交わるとき

機関が数百万件の文書をスキャンし、すべてのフラグを判定として扱う場合、低い誤り率であっても有害なミスを生む。

偽陽性の問題は理論上のものではない。偽陽性とは、人間が作成した作品が生成または支援されたものと判定されることだ。教育、出版、雇用、ジャーナリズムでは、このラベルが作者の反論前に処罰や評判上の損害を引き起こす可能性がある。

これまでの学術研究では、複数のGPT検出器が、英語を母語としない人々の文章を不均衡にフラグ付けしていたことが分かっている。bias studyでは、この問題を予測可能な単語選択や言語的変動性の低さと結び付けており、検出器の一部はこうしたパターンをモデル出力と関連付けていた。

Pangramは、自社のアーキテクチャと訓練プロセスによってそのバイアスを回避しているとしている。同社の技術報告書には英語学習者のサンプルが含まれ、ハードネガティブマイニング後、この領域での偽陽性率は0.01%だったと報告された。現行モデルと実際の組織環境をまたぐ独立した再現検証は、依然として不可欠だ。

Pangramに関する証拠は、旧世代の検出器に対する広範な批判よりも好意的だが、一様ではない。同社が引用する独立評価では、より長い文章において強い性能が報告されている。一方で、公の論争では不正確な結果や、そのラベルが何を意味するのかをめぐる見解の相違も明らかになった。

The Atlanticは、この矛盾をaccuracy investigationで記録した。同誌によると、Pangramは書籍、記事、学術作品、公文書に関する疑惑において影響力を持つようになっていた。

PangramのCEOであるMax Speroは、モデルの内部推論は解釈が難しいと認めた。また、このツールが最終的な裁定者となるべきではないとも述べている。この警告は、どの見出しの精度パーセンテージよりも注目に値する。

当事者が結果に異議を唱えなければならない場面では、解釈可能性が重要になる。ハイライトされた箇所は説明のように見えるかもしれないが、モデルが高いスコアを付与した場所を示しているだけの可能性がある。それが必ずしも、チャットボットから直接生じた表現を特定しているわけではない。

規模はこの問題をさらに難しくする。1万件に1件の偽陽性率は無視できるように聞こえる。しかし、1,000万件の人間作成文書に適用すれば、導入データがベンチマークと一致しているという前提のもとで、同じ率でも1,000件の誤ったフラグが生じる。

実際の入力がベンチマークと完全に一致することはほとんどない。そこには、珍しいジャンル、定型的な企業文書、大幅に編集された文章、翻訳文、法的テンプレート、科学用語、そしてテストサンプルよりはるかに短い文書が含まれる。

偽陰性も重要だ。偽陰性とは、生成コンテンツが人間作成と判定されることを指す。The Atlanticは、Pangramが生成サンプルのおよそ70件に1件を見逃したことを示唆するテストを紹介したが、他の評価ではより良い結果が報告されている。

攻撃者は公開検出器を繰り返し試すこともできる。スコアが下がるまで文章を改稿し、成功した版を配布できる。この適応的な行動は、通常サンプルを一度だけ評価するベンチマークテストとは異なる。

画像プレビューにも同様のリスクがある。TechCrunchの限定テストでは、検出器はいくつかの合成画像を認識し、実写写真内にあるAI画像も特定した。一方で、AI生成画像を撮影した写真の1枚を、人間によるコンテンツと誤判定した。

この失敗は、複合メディアの複雑さを示している。基となる合成画像自体は変わらなかったが、写真撮影によって周辺のピクセル統計が変化した。元ファイルで機能するシステムであっても、スクリーンショット、スキャン、ソーシャルプラットフォームによる再圧縮では異なる挙動を示す可能性がある。

顧客は、判断を自動化する前に、領域固有の検証を求めるべきだ。長文記事を審査する出版社と、短い回答を評価する教師ではリスク特性が異なる。ミームをスキャンするソーシャルプラットフォームが直面する変換は、元の画像ファイルを調べる報道機関のものとは異なる。

また、各判断を取り巻く証拠も保存すべきだ。スコア、モデルのバージョン、しきい値、ソースファイル、下書き履歴、レビュアーのメモは、結果が妥当だったかを明らかにし得る。検出器の結果を示す単一のスクリーンショットだけでは、その文脈を提供できない。

最も責任ある導入では、Pangramをトリアージに用いることになるだろう。高スコアはレビューの開始、対話の促進、または来歴情報の要求につながり得る。しかし、不正行為を自動的に立証すべきではない。

Pangram 4が競合と組織に与える圧力

Pangram 4は競合検出器の性能基準を引き上げる一方、顧客に対して、検出で実際に何を達成したいのかを定義するよう迫っている。

GPTZero、Copyleaks、Originality.ai、Winston AIはいずれも、生成素材と人間の作品を区別するためのツールを販売している。各製品は、対応言語、統合機能、文書分析、盗用検出機能、支援付きコンテンツへのアプローチで異なる。

Pangramの当面の差別化要因は、混合テキスト分類、ハードネガティブ訓練、クロスモデル検出にある。画像プレビューは別の製品カテゴリーを加えるものであり、競合各社と来歴情報プロバイダーは、重なり合う信頼・モデレーション予算をめぐって競争している。

資金調達は、モデル訓練、評価、統合、流通を支援できる。しかし、資本だけで持続的な優位性は生まれない。人間の文章と合成出力の両方が変化するなか、Pangramは代表性のあるデータを継続的に収集しなければならない。

データ品質は特に重要だ。多様で、ライセンスが適切に処理され、正確にラベル付けされた人間の文書で訓練すれば、偽陽性を減らせる。説得力のあるミラーを生成するには、最新のフロンティアモデルへのアクセスと、話題、文体、長さ、ジャンルに対する慎重な制御が必要になる。

競合も同様の手法を採用できる。より深い優位性は、運用上のフィードバック、すなわち実証済みの誤り、異議が申し立てられた判断、新たな生成器、実顧客から収集した敵対的事例から生まれるだろう。こうした事例は入手にコストがかかり、ラベル付けも難しい。

組織側にも圧力がかかっている。最も分かりやすいインターフェースを提供する検出器に、AI方針を外部委託することはできない。どの種類の支援で開示を求めるのか、また調査を正当化するにはどのような証拠が必要かを決めなければならない。

たとえば大学には、アイデア出し、編集、翻訳、コーディング支援、提出する文章について、それぞれ別のルールが必要だ。標準的な文章作成ソフトウェアに生成機能が含まれるようになると、一律の禁止を実施することは難しくなる。

出版社も関連する課題に直面する。捏造された報道や未開示の合成作品から読者を守りつつ、文法修正のすべてを不正として扱わないようにしなければならない。検出スコアはその判断に情報を与え得るが、編集記録のほうがなお多くを示す。

検索・ソーシャルプラットフォームには別のインセンティブがある。低価値の生成素材を大規模に減らす必要がある。しかし、個々の投稿を合成とラベル付けするプラットフォームは、正当なクリエイターがフラグ付けされるたびに公の論争を招くリスクがある。

Pangramのブラウザ拡張機能は、その緊張関係を可視化する。複数のサービス上の投稿にラベルを付け、人間とAI素材の表示バランスを推定するフィード健全性スコアを算出できる。このスコアは合成コンテンツの飽和を具体的に感じさせる一方、不透明な分類を過度に信頼するようユーザーを促す可能性もある。

これらの製品を評価する組織は、検出器ではなく自らの判断から始めるべきだ。防ぎたい損害、許容可能な誤り率、エスカレーション手順、行動を取る前に必要な証拠を定義する必要がある。

スクリーニングと執行には、別々のしきい値も必要だ。広いスクリーニングしきい値は、レビュー対象となる疑わしい素材をより多く見つけられる。執行のしきい値には、誤った告発のコストがより高いため、より強力な裏付け証拠が求められるべきだ。

この区別は、Pangramと競合各社に有用な導入への道を開く。検出器は調査の優先順位付け、集計傾向の監視、コンテンツコレクションが変化しているかの検証に利用できる。単一の結果が成績、雇用、出版、アクセスを直接左右するようになると、リスクは高まる。

したがってPangram 4は、生の精度だけで競争するわけではない。顧客は、自社コンテンツ全体でのキャリブレーション、透明性、監査可能性、モデル更新の実務、性能を比較することになる。不確実性を最も適切に扱う企業は、最も大きな見出し数字を掲げる企業より価値が高い可能性がある。

TechCrunchのコンテンツレポート後に注目すべき点

3つのシグナルによって、Pangramの拡大が検出能力を強化するのか、それとも異議を唱えられる分類の数を単に増やすだけなのかが分かる。

第1のシグナルは、Pangram 4の独立テストだ。評価者は、現行モデル、人間が編集した出力、humanizer、短い文章、翻訳文、専門領域をテストすべきである。結果では、偽陽性と偽陰性を分けて報告すべきだ。

領域別の結果は、統合された1つの精度指標より重要だ。長い学術論文での高い性能は、ソーシャル投稿、法的文書、ニュース原稿、学生の回答でも同等の性能を保証しない。公開テストセットと再現可能な手法があれば、Pangramの主張はより強固になる。

独立テストではキャリブレーションも検証すべきだ。適切にキャリブレーションされた80%のスコアは、比較可能な事例全体で同程度の正しい分類率に対応するべきである。キャリブレーションがなければ、精密に見えるパーセンテージはモデルが持つ以上の確実性を伝えかねない。

第2のシグナルは、Pangram Imageの広範なリリースだ。重要な証拠は、きれいな生成器出力ではなく、編集・再圧縮されたメディアに関わるものとなる。スクリーンショット、トリミング、フィルター、コラージュ、印刷画像、画面を撮影した写真をすべて含めるべきだ。

顧客は、Pangramが変換ごとに別々の性能指標を公表するかを注視すべきである。有用なヒートマップは、害のない処理で画像が変わっても安定しているべきだ。ハイライト領域が予測不能に動くなら、レビュアーは結果を解釈するのに苦労する。

クロスモデルの一般化も同様に重要になる。新しい画像生成器は頻繁に登場し、既存システムにも更新が加わる。独立研究者が、訓練から除外されたモデルに対する検出を示せれば、Pangramの主張はより強くなる。

第3のシグナルは、組織が検出を方針にどう組み込むかだ。学校、出版社、科学組織、雇用主は、スコアがレビューを引き起こすのか処罰を引き起こすのかを明示すべきである。また、意味のある異議申し立てプロセスも提供すべきだ。

生成された作品と支援された作品の区別には、明確な扱いが必要だ。校正は認めるが生成された段落は禁止する方針では、広範な支援付きコンテンツのスコアだけに依存できない。レビュアーには、下書き、バージョン履歴、執筆プロセスに関する説明が必要になる。

組織の行動は、別のベンチマークよりも早くPangramの実際の影響を明らかにする。顧客がこれを調査の手掛かりとして使うなら、検出能力の向上はコンテンツガバナンスを強化できる。制裁を自動化するなら、たとえまれな誤りでも公の議論を支配することになる。

読者も、オンライン上の告発に同じ注意を払うべきだ。検出器の結果は疑問を裏付けることはできても、完成した文書に至るすべての過程を再構築することはできない。著者性が重要な場合は、元ファイルを保存し、下書きを維持し、ソースノートを保管しておくべきだ。

AIを活用するナレッジワーカーにとって、明確な個人記録は実用的な保護手段となる。構造化された第二の脳は、洗練された文書が完成する前のメモ、情報源、途中段階の思考を保存できる。そうした記録は、分類器が文章だけから推測できない文脈を提供する。

Pangramによる900万ドルの資金調達は、著者性の検証が商業カテゴリーになりつつあることを示している。Pangram 4とPangram Imageは、このカテゴリーがメディア全般へいかに急速に拡大しているかも示している。

TechCrunchのコンテンツ実験は、全面的な信頼や完全な否定よりも有益な結論を残している。Pangramは、人間が見落としがちな合成コンテンツのパターンを見つけられるように見える。ただし、その出力には依然として解釈、裏付け、そして公正なプロセスが必要だ。

生成コンテンツがより容易に作成できるようになるにつれ、検出技術は引き続き魅力的であり続けるだろう。購入者にとっての問いは、必要としているのがスクリーニングシステムなのか、それとも自動判定者なのかということだ。Pangramの次回の独立評価、画像モデルのリリース、顧客向けポリシーが、市場がどちらの役割を選ぶのかを示すだろう。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page