Decoy FontはAIからテキストを隠すが、その空間周波数トリックには有効期限がある
- Martin Chen

- 7月17日
- 読了時間: 22分
更新日:7月20日
AIシステムが各文字に読み取り可能な識別情報は1つしかないと想定しているにもかかわらず、Decoy Fontを使えば、誰でも1つのインストール可能な書体に2つのメッセージを埋め込めるようになった。前景には鮮明なおとり文字が表示される。その背後にあるぼやけた形状には、より低い空間周波数で意図した文字が組み込まれている。Mixfontによると、現在のマルチモーダルモデルはおとりを回答し、人間なら後ろに下がったり目を細めたりして見つけられるメッセージを見落とすことが多いという。
この対立により、Decoy Fontは単なる風変わりなタイポグラフィプロジェクトを超えた存在となる。よく知られた錯視を、人間とマシンビジョンの間にある敵対的インターフェースへと変換するからだ。このフォントは、AIシステムがどの視覚スケールを信頼するかを問い、そのスケールで妥当に見える誤った答えを提示する。
この実験は、厳然たる限界も明らかにしている。Decoy FontがAIからテキストを隠せるのは、モデルが脆弱な読み取りプロセスに従う場合に限られる。サイズ変更、ぼかし、画像の前処理、仕組みを踏まえたプロンプト、基になるテキストへのアクセスによって、隠されたレイヤーが露見する可能性がある。この成果は有用な実証であり、スクレイピングへの抑止策となる可能性もあるが、暗号化ではない。
Decoy Fontはすべての文字を視覚的な論争に変える
重要な変化は、風変わりなフォントがOCRを混乱させられることではなく、標準的なフォントファイルが各グリフ内に競合する読み方を符号化できることにある。
MixfontはDecoy Fontを、各文字におとりを表示するダウンロード可能なTrueTypeフォント、すなわちTTFとして説明している。ユーザーはそれをインストールし、通常のテキストを入力して、基になる文字を別のアプリケーションへコピーできる。また、Mixfontのブラウザ用プレイグラウンドを使って、隠しメッセージとおとりメッセージを組み合わせ、その結果を画像として書き出すこともできる。
一般的な書体では、保存された各文字が1つの可視グリフに対応する。Decoy Fontは、その基本的なソフトウェア上の関係を維持しながら、レンダリングされたグリフを知覚的に曖昧なものにする。一方の構成要素には、細く明瞭に定義された輪郭が含まれる。もう一方は、別の文字を表す、より幅広くぼやけた塊を使用する。
画像を間近で見る人は、先に細い輪郭に気づく傾向がある。ディスプレイから遠ざかると細部の一部が失われ、幅広い背景形状が優勢になる。目を細めることでも、高周波の細部が抑えられるため、同様の効果が生じる。
これにより、アニメーション、インタラクティブなコード、カスタム画像処理アプリケーションを使わずに、2通りの読み方が生まれる。同じレンダリング領域が、近くでは一方の文字列を、遠くからは別の文字列を伝えられる。隠されたフレーズは実際に入力された文字に結び付いたままで、目に見えるおとりはより鮮明なレイヤーを占める。
Mixfontは、生成した画像を高度なマルチモーダルシステムでテストし、モデルが前景のおとりを読み取ることを確認したと述べている。同社のページには、システムが意図したメッセージではなく「BINGE SHOWS」と回答したとされる例が掲載されている。これらのスクリーンショットが記録しているのは個別の試行であり、モデル、設定、前処理手法を横断した統制ベンチマークではない。
この違いは重要だ。デモンストレーションは、特定の条件下で障害モードが存在することを証明する。しかし、人間と機械の知覚の間に安定した境界があることまでは立証しない。画像解像度、圧縮、フォントサイズ、コントラスト、プロンプトの文言、モデルの更新は、いずれも結果を変え得る。
このプロジェクトは、Mixfontが以前に行ったGhost Font実験の流れをくむもので、Ghost Fontはドットの一貫した動きの中に文字を隠す。意図したメッセージを明確に含む単一フレームが存在しないため、Ghost Fontには動画が必要となる。Decoy Fontはその依存関係を取り除き、錯視を静的でインストール可能なフォント内に収めている。
この変化により、新しい実験は配布しやすくなった。デザイナーは使い慣れたグラフィックアプリケーションでTTFを適用できる。クリエイターはアニメーションを制作せずに、ソーシャルメディア用画像を書き出せる。開発者は、テキストをビジョンモデルへ入力する際と同じスクリーンショットのワークフローを使って、結果をテストできる。
また、ストレステストの範囲も広がる。Ghost Fontが問うのは、モデルが複数のフレームにまたがる動きを統合できるかどうかだ。Decoy Fontが問うのは、モデルが1枚の画像を複数の視覚スケールで調べられるかどうかである。どちらも、メディア内で利用可能な情報と、認識パイプラインによって選択される情報との不一致を利用している。
この実験が登場したのは、マルチモーダルアシスタントがスクリーンショット、文書、インターフェース、ソーシャル投稿を読み取る一般的なツールとなった時期だ。その利便性は、ピクセルを素早くテキストへ変換することに依存している。Decoy Fontは、最も明白に抽出された文字列だけが存在する唯一の文字列だという想定に異議を唱える。
Decoy Fontが空間周波数を利用して1枚の画像を分割する仕組み
Decoy Fontが機能するのは、文字の大まかなシルエットと細かな縁が、視覚情報の異なる帯域を占めるためだ。
空間周波数とは、画像内で明るさや色がどれほど速く変化するかを表す。高い空間周波数は、細い縁、小さなディテール、急激な変化を表す。低い空間周波数は、幅広い形状、緩やかな陰影、大きなコントラスト領域を表す。
Decoy Fontは、この2つの帯域に異なる文字を割り当てる。おとりは細い輪郭によって高周波レイヤーを占める。隠された文字は、ぼやけた太い形状によって低周波レイヤーを占める。両方が同じ位置に表示されるが、どちらのレイヤーが知覚を支配するかは閲覧条件によって決まる。
この仕組みは、ハイブリッド画像の研究に由来する。広く引用されている2006年の論文で、Aude Oliva、Antonio Torralba、Philippe Schynsは、見る距離によって解釈が変わる画像について説明した。彼らのハイブリッド画像研究では、ある画像の低周波成分と別の画像の高周波成分を組み合わせている。
よく知られたEinsteinとMarilyn Monroeの錯視が、この原理を示している。近距離ではEinsteinの顔の細かな特徴が優勢になる。距離が離れると、その細部は識別しにくくなり、Monroeの大まかな顔の構造がより明瞭になる。
Decoy Fontは、顔をグリフに置き換えている。その置き換えは単純に見えるが、文字にはより厳しい制約がある。実用的なグリフは、ほかのグリフと並んでも認識でき、文字間隔を維持し、一般的なレンダリングシステムに耐えなければならない。また、それぞれのおとりには、明確に異なる低周波形状を収めるのに十分な内部空間が必要となる。
この結果は、秘密性ではなくスケールに依存している。変換を制御する秘密鍵は存在しない。意図した文字は、すでにピクセル内に存在している。見る人は、視覚信号の実効解像度を変えることで、その文字を明らかにする。
ダウンサンプリングを使えば、この効果を計算処理で再現できる。画像が小さくなると、細い輪郭は鮮明さを失う一方で、幅広い形状は残る。ぼかしフィルターでも高周波の輪郭を除去し、低周波の塊を残せる。サムネイルを見るだけでも、どちらのメッセージが優勢に見えるかが変化する可能性がある。
これにより、同じフォントがあるAIリクエストでは通用し、別のリクエストでは失敗する理由を説明できる。あるビジョンパイプラインは、認識前にアップロードされた画像のサイズを変更するかもしれない。別のパイプラインはテキストを切り抜いて拡大するかもしれない。さらに別のものは、異なる解像度で複数回のOCR処理を実行するかもしれない。いずれの判断も、2つのメッセージ間のバランスを変える。
従来の光学文字認識、すなわちOCRは、テキスト画像を機械可読な文字列へ変換する。現代のマルチモーダルモデルは、しばしば視覚エンコーダーと言語モデルを組み合わせ、レイアウトを解釈してスクリーンショットに関する質問に回答できるようにしている。その推論能力が加わっても、複数スケールでの注意深い検査が保証されるわけではない。
モデルは、誤ったレイヤーを抽出した後でも、流暢な答えを生成できる。言語モデリングによってエラーの説得力が増すことさえある。システムが、不確かな形状の集まりよりも一貫したフレーズを優先するからだ。巧妙に選ばれたおとりは、視覚的な選択と、言語面での自信の両方を悪用する。
この手法は、白い背景上に白いテキストを隠したり、メタデータに指示を配置したりする手法とは異なる。Decoy Fontの2つのメッセージは、どちらもレンダリングされた画像に見える特徴である。その曖昧さは、画像の外部に保存された情報ではなく、知覚から生じる。
また、暗号技術とも異なる。暗号化は、権限のない観察者が鍵なしでは復元できないように情報を変換する。Decoy Fontでは、意図した文字を視覚的に復元できる状態のままにし、さらに観察者へ手掛かりを与えている。すべてのグリフが、異例の二重構造を持っているからだ。
この違いが、この実験の真の価値を決定づける。Decoy Fontは、人々がすでに理解している形式を使って、マシンビジョンの死角を示す。TTFとして利用しやすいため、この概念は簡単にテストされ、複製され、最終的には攻略され得る。
AIリーダーが誤ったメッセージを受け入れる理由
Decoy Fontは、視覚認識が確信に満ちた言語回答へ変わる地点でAIシステムに圧力をかける。
通常、マルチモーダルアシスタントは、単一の従来型OCRエンジンを実行するだけではない。画像のサイズを変更し、パッチに分割し、視覚的特徴を符号化し、テキストを特定し、言語的な文脈を使って最終的な文字列を推測する場合がある。正確なパイプラインは製品ごとに異なり、その一部は公開されていない。
Decoy Fontは、すべての段階を打ち破る必要はない。別の段階が幅広い隠し形状を調べる前に、システムがおとりの輪郭を優先すればよい。モデルがもっともらしいフレーズを生成すると、その後の推論が最初の解釈を補強する可能性がある。
したがって、この攻撃は通常の視覚ノイズというより、標的型の敵対的テキストに似ている。研究者のCongzheng SongとVitaly Shmatikovは2018年、慎重に修正されたテキスト画像によって、OCRに攻撃者が選んだ単語を出力させられることを示した。彼らのOCR攻撃研究では、人間には別の読み方を保ちながら、認識される単語を変化させる例が生成された。
この研究は、標的型エラーが重要である理由も明らかにした。無作為な意味不明の文字列は、認識が失敗したことを知らせる。流暢だが誤ったフレーズは、同じような疑念を引き起こさずに、下流の分類器、データベース、検索システム、自動意思決定を通過する可能性がある。
Decoy Fontは、ほとんど見えない数学的摂動ではなく、競合する文字全体を提示する。その欺瞞は、仕組みを理解すれば明白になる。しかし、特にユーザーが自然な文章を形成するおとりの単語を選んだ場合、誤った読み方は意味的な整合性を保ち得る。
あるクリエイターが、隠しレイヤーには「DRAFT RESULTS」、輪郭レイヤーには「DINNER PLANS」と書かれた画像を投稿する場合を考えてみよう。後ろに下がって見ることを知っている人なら、意図したフレーズを復元できる。自動インデクサーは無害なおとりを保存し、機密性の高い用語ではその画像を見つけにくくする可能性がある。
反対のシナリオでは、セキュリティ上の懸念が生じる。遠くから見る人には問題なく見える文書でも、自動ワークフローが鮮明な細部から異なる指示を抽出する可能性がある。スクリーンショットのOCRを信頼するシステムは、その後、おとりに基づいて文書を要約、分類、転送するかもしれない。
基になるテキストは、さらに複雑な問題をもたらす。Decoy Fontは実在するフォントであるため、実際には入力された文字と視覚的に強調された文字が異なる場合がある。文書からテキストをコピーすると、符号化された文字が直接露出し、視覚的な謎解きを迂回できる。ドキュメントオブジェクトモデルを読み取るブラウザスクレイパーには、そもそもOCRが必要ない。
つまり、このフォントが主に標的とするのはピクセルベースの読み取りだ。スクリーンショット、フラット化されたグラフィック、画像のみの投稿、視覚的な文書処理パイプラインに対しては、より効果を発揮する可能性がある。エージェントがHTMLを調べ、PDFテキストを抽出し、アクセシビリティラベルを照会し、元の文書にアクセスできる場合には、ほとんど保護にならない。
画像のみを扱うワークフローであっても、高性能なエージェントには複数の選択肢があります。複数の切り抜きを要求したり、色を反転したり、画像をぼかしたり、低解像度のコピーを調べたり、コーディングツールに周波数帯域を分析させたりできます。ハイブリッド画像について明示的に言及するプロンプトは、隠されたレイヤーへ注意を向けさせることができます。
Mixfontもこの限界を認めています。プロジェクトの説明には、コーディング能力を備えたエージェントは最初に見える文字の先を見通すことができ、事情を踏まえたプロンプトによって隠された文字を明らかにできると記されています。その主張は、基本的な認識を妨げるというものであり、AIを確実に排除するというものではありません。
この注意点が、有用な実験とプライバシー製品を分けます。今日観察された視覚認識の失敗も、通知されないモデル更新後には消える可能性があります。また、アプリケーションが画像の前処理を変更すると、同じモデルでも異なる挙動を示すことがあります。
現在の証拠には、多数のフォントサイズ、隠し文字と囮文字の組み合わせ、解像度、圧縮レベルを含む公開テストコーパスが欠けています。また、オープンなOCRエンジンや商用ビジョンモデルを横断した再現可能な測定もありません。こうした統制条件がなければ、Decoy Fontの信頼できる成功率を算出することはできません。
それでも、この失敗には診断上の価値があります。流暢なマルチモーダル回答が、知覚スケールに関する不確実性を覆い隠し得ることを示しているからです。1つのメッセージしか報告しないモデルは、その自信に満ちた表現から受ける印象ほど注意深く観察していない可能性があります。
Decoy FontはAIからテキストを隠すが、徹底して調べるシステムからは隠せない
このフォントは、自動読み取りに対する速度抑制策として捉えるのが最適です。観察者が複数のスケールを検証すると、防御効果が失われるためです。
最も単純な対策は画像変換です。システムはサイズの異なる複数の画像を作成し、強度を段階的に上げながらぼかしを適用し、それぞれの出力に対して認識を実行できます。抽出された文字列が変化する場合、その画像に唯一の正しい文字起こしを割り当てるのではなく、曖昧なものとしてフラグを付けるべきです。
周波数フィルタリングは、より直接的な対策となります。ローパスフィルターは細かな輪郭を抑え、全体的な形を維持します。ハイパスフィルターはエッジを強調し、緩やかな濃淡を除去します。両方の出力にOCRを実行すれば、Decoy Fontが意図的に組み合わせた2つのチャンネルを明らかにできます。
これは、新たな基盤モデルを必要とする仮説上の防御策ではありません。画像ライブラリはすでに、サイズ変更、ガウシアンぼかし、エッジ抽出、フーリエ解析をサポートしています。コード実行権限を持つエージェントは、通常とは異なるグリフ構造を検出した後、これらの処理を自動的に実行できます。
このフォントは公開もされています。防御側はサンプルをダウンロードし、文字の組み合わせを生成して、評価データや訓練データに含めることができます。意図的に難しい入力をモデルに提示する敵対的訓練によって、認識システムはマルチスケール間の不一致を警告信号として扱えるようになります。
OCR防御に関する研究は、単一の対策に過度な信頼を置くべきでない理由を示しています。SongとShmatikovは、OCRは任意の文字列を認識しなければならないため、出力空間が非常に広大であると指摘しました。また、視覚的類似性が意味的類似性を意味するわけではないことも明らかにしました。わずかな変更によって、ある単語が反対の意味を持つ別の単語に変わることがあります。
視覚的OCR防御に関する2025年の研究では、敵対的フォント、色の歪み、アニメーションによる干渉、動的ぼかしが調査されました。この幅広い分野は、人には読める一方で自動抽出を困難にするテキストへの関心が続いていることを裏付けています。
しかし、あるOCR設定への耐性が、すべての機械読み取りシステムへの耐性を証明するわけではありません。モデルごとに入力サイズや使用する特徴が異なります。あるパイプラインで効果が持続しても、別のパイプラインが画像のサイズ変更や鮮鋭化を行えば、その効果は消える可能性があります。
人間の読み手にも個人差があります。距離、ディスプレイ密度、視力、コントラスト感度、照明、フォントサイズによって、どのレイヤーが見えるかは変わります。デザイナーには明白に見える隠しメッセージでも、別の人には判読できない可能性があります。
このばらつきは、アクセシビリティ上の問題を生みます。ロービジョンのユーザー、コントラスト感度に差がある人、スクリーンリーダーのユーザーには、意図したメッセージが伝わらない可能性があります。画像に正確な代替テキストを含めれば、自動システムもその代替テキストを読めます。代替テキストを省略すれば、一部の人が情報へアクセスできなくなります。
World Wide Web Consortiumは、意味のある言葉を伝える画像に同等のテキストを提供することを推奨しています。その画像内テキストに関するガイダンスでも、画像を使わずに表現できる場合は実際のテキストを使用することが推奨されています。Decoy Fontの目的は、こうした慣行と真っ向から対立します。
したがって、Mixfontが可能性のある用途として挙げているとはいえ、CAPTCHAへの応用にはリスクがあります。微妙な周波数知覚に依存する視覚的チャレンジは、正当なユーザーを排除しかねません。W3CのCAPTCHAに関するアクセシビリティ解説は、一般的なロボット判定テストが、視覚、聴覚、認知に障害のある人々をも阻む可能性があると警告しています。
懸念はアクセシビリティにとどまりません。囮フォントは防御的な難読化に利用できますが、文書処理システムの操作にも使えます。人間と機械で読み取り結果が異なる請求書、方針通知、契約書は、完全性に関するリスクをもたらします。
組織は、このフォントを機密情報を安全に配布する手段と見なすべきではありません。漏えいによって損害が生じる情報には、アクセス制御、安全な保存、暗号化が必要です。視覚的錯覚では、コピーを無効化したり、受信者を認証したり、人手による文字起こしを防いだりすることはできません。
個人的な調査や機密性の高いノートでは、元資料を管理された個人知識システム内に保持する方が安全です。視覚的な難読化はその境界を補強できますが、それ自体を境界にしてはなりません。
セキュリティ上の教訓は双方向に当てはまります。作成者は、AIの失敗が永続すると考えるべきではありません。AI製品チームは、もっともらしいOCR文字起こしが、人に見えるすべてを反映していると考えるべきではありません。
真の圧力がかかるのはマルチモーダルAIの評価
Decoy Fontが最も重要なのはベンチマークのアイデアとしてです。抽出したテキストに基づいて行動する前に、AIシステムが曖昧さを認識できるかどうかを試せるためです。
ほとんどの公開評価では、モデルが期待された回答を返すかどうかが問われます。Decoy Fontは、より難しい要件を提示します。モデルは、画像が異なるスケールで2つの回答を示していることに気づかなければなりません。どちらか一方の文字列を何の留保もなく報告するのは、不完全な読み取りです。
より強力な評価では、隠し文字と囮文字の組み合わせからなるバランスの取れたコーパスを生成します。文字の組み合わせ、フレーズの長さ、ポイントサイズ、画像寸法、色、コントラスト、圧縮、背景テクスチャを変化させます。また、フォントのラスタライズによってピクセルが変化するため、異なるオペレーティングシステムのスクリーンショットもテストします。
そのうえで研究者は、3つの結果を測定できます。第一に、システムは意図された低周波メッセージを復元できるか。第二に、高周波の囮を復元できるか。第三に、画像には異論の余地がない単一の文字列が含まれているかのように装うのではなく、両者の矛盾を明示的に報告できるかです。
最も多くを物語るのは、3つ目の指標です。「輪郭には1つのフレーズが見え、細部を減らすと別のフレーズが見えます」と述べるアシスタントは、どちらかのレイヤーを自信満々に選ぶアシスタントより安全に振る舞っています。認識精度だけでは、このキャリブレーションの問題を捉えられません。
ベンチマークには、一般ユーザーが利用できる変換を含めるべきです。元画像と、サムネイル、ぼかしたコピー、拡大した切り抜き、グレースケール版、印刷後のスキャン画像を比較できます。各変換によって、Mixfontのプレイグラウンド外でも効果がどれほど安定して持続するかが明らかになります。
マルチモーダルアシスタントと並べて、オープンなOCRシステムも比較対象に含めるべきです。その結果は、言語推論と視覚的抽出を切り分けるのに役立ちます。従来型のOCRエンジンが囮を読み取り、視覚言語モデルが両方のレイヤーを見つけるのであれば、推論システムが有用な分析を加えていることになります。両者が同じように失敗する場合、前処理が共通の弱点である可能性があります。
人間を対象としたテストも同様に重要です。最初の試行では、参加者に目を細めたり後ろへ下がったりするよう指示すべきではありません。その後、研究者は、発見率、判読性、読解速度、さまざまな閲覧条件でのエラー率を検証できます。アクセシビリティに関わる人々も、後回しにせず参加者に含めるべきです。
このような研究を行えば、Decoy Fontを恒久的な対AIシールドとして提示するのではなく、他の敵対的評価と同じ位置づけに置くことができます。その最大の貢献は、マルチスケール間の不一致を明快かつ直感的に示すことかもしれません。
このプロジェクトは、スクリーンショットをアクションへ変換するアプリケーションにも圧力をかけます。ミームを読み取るアシスタントの影響は限定的です。しかし、ボタンのラベル、発注書、方針画像を読み取るエージェントは、誤ったテキストに基づいてワークフローを開始する可能性があります。
製品チームは、認識と承認を分離することで対応できます。画像から抽出されたテキストは、特に支払い、データ変更、外部へのメッセージ送信を引き起こす場合、信頼できない入力として扱うべきです。複数回の認識処理と人間による確認によって、リスクを軽減できます。
検索プラットフォームも同様の課題に直面します。視覚的に曖昧な画像が一般化すれば、1つの文字起こしだけをインデックス化すると、内容を誤って表現する可能性があります。代替となる読み取り結果や曖昧さスコアを保存する方が誠実ですが、ランキングやモデレーションは複雑になります。
コンテンツモデレーターも両方のレイヤーを考慮する必要があります。無害な囮によって、禁止された内容が自動フィルターから隠される可能性があります。逆に、攻撃的な囮によって、無害な隠しメッセージに誤ったモデレーションラベルが付けられる可能性もあります。
こうしたリスクは、Decoy Font自体が危険であることを意味しません。視覚言語モデルが、テキスト抽出は客観的であると当然のように仮定する、より大きなシステム内で動作していることを示しています。このフォントは、その隠れた前提を可視化します。
したがって、その圧力は評価設計者、エージェント開発者、アクセシビリティ評価者、セキュリティチームにかかります。各グループは、人と機械が画像内の言葉について一致しない場合にどう対処するかを決める必要があります。
この仕掛けが長続きするかを示す3つのシグナル
Decoy Fontの将来は、再現可能なテスト、自動化されたマルチスケール復元、そして許容できない負担を伴わずに人が読めることを示す証拠にかかっています。
最初のシグナルは、再現可能なベンチマークです。Mixfontまたは独立した研究者が、画像セット、プロンプト、前処理設定、モデルのバージョン、期待される読み取り結果を公開する必要があります。現在の複数のシステムが、さまざまな条件下でも引き続き囮を選択するなら、意味のある盲点が存在するという主張は強まります。
解像度やプロンプトをわずかに変えただけで結果が崩れるなら、結論は逆になります。このフォントは魅力的な視覚的デモンストレーションではあり続けますが、AIによるスクレイピングから保護できるという主張は弱まります。成功例のスクリーンショットを集めることよりも、再現性の方が重要です。
2つ目のシグナルは、主要なアシスタントによる自動復元です。モデルがDecoy Fontについて知らされていなくても、疑わしいテキストを自律的にサイズ変更、ぼかし、フィルタリングするようになるかに注目してください。両方のメッセージを報告するシステムは、作成者がどちらのメッセージを意図したか判断できなくても、事実上この欺瞞を無効化しています。
この対応は、モデル訓練によってもエージェントツールによっても実現できます。周辺システムが基本的な画像解析処理を開始できるのであれば、ビジョンモデルがあらゆる錯視を内部化する必要はありません。ツールの利用は、静的な視覚防御の寿命を短くする可能性があります。
3つ目のシグナルは、人間のユーザビリティデータです。Decoy Fontは、さまざまなデバイス、年齢、視覚条件、閲覧距離でテストする必要があります。意図された読み手が、繰り返しヒントを受けたり、極端に大きなテキストや理想的な表示条件を必要としたりするなら、この形式は日常的なコミュニケーションには不向きなままでしょう。
開発者がCAPTCHA、認証、または公開情報での利用を検討する場合、アクセシビリティ性能は特に重要になります。人々を締め出すことでAIの処理も遅らせる手法は、有用な人間の優位性を維持したことにはなりません。単に障害の所在を移しただけです。
これらの兆候から導かれるのは、控えめな結論です。Decoy Fontは、報告されている一部の条件下でAIからテキストを隠します。それは、確立された知覚研究を巧みに応用することで実現されています。しかし、永続性のある非公開チャネルを生み出すものではありません。
だからといって、この実験が取るに足らないわけではありません。クリエイターには、スクリーンショットリーダーの限界を探る具体的な手段を提供します。研究者には、理解しやすい敵対的テストを提供します。またAIユーザーに対しては、自信に満ちた文字起こしであっても、画像の完全な意味ではなく、その画像から抽出された一つのサンプルにすぎない可能性があることを思い出させます。
このフォントは、公開されても差し支えない情報に限って試してください。元の画像を、サイズ変更やぼかし処理を施したコピーと比較し、複数の認識システムでテストしてください。何より重要なのは、システムが一度だけ自分の望むメッセージを推測できるかではなく、曖昧さを認識できるかを問うことです。
もはや有用な問いは、Decoy Fontが今日AIを欺けるかどうかではありません。曖昧な視覚テキストが検索、モデレーション、または自律的な行動に到達する前に、AI開発者が最初に読み取れたレイヤーを疑うようシステムを訓練するかどうかです。


