top of page

ウェールズのウェールズ語AI戦略が浮き彫りにする、データと日常利用の隔たり

ウェールズ政府は2024年、6年間にわたる技術計画を締めくくるにあたり、異例の主張を掲げた。ウェールズ語はAI時代に向け、より十分な準備が整ったというものだ。Wired-Govを通じて配信されたGoogle Newsの記事は、この主張を再びテクノロジーニュースの話題へと戻した。記録には音声認識、合成音声、機械翻訳、そしてOpenAIやMicrosoftとの取り組みが含まれる。

しかし真の試金石は、ウェールズが有用な言語コンポーネントに資金を投じられるかどうかではない。そうしたコンポーネントが、日々の言語選択を左右するAI製品、職場、学校、公共サービスに届くかどうかだ。オープンデータセットは重要だが、会議中にコーパスを使うことはできず、データセットに申請書の作成を頼むこともできない。

この違いは、ウェールズ政府と大手テクノロジー企業の双方に圧力をかける。ウェールズは、公的資金で整備したインフラを測定可能な普及へと転換しなければならない。OpenAI、Microsoft、その他のプラットフォーム運営企業は、モデルやインターフェースの変化に伴っても、ウェールズ語サポートが信頼できる状態を維持することを示す必要がある。

Google Newsの見出しが実際に要約していること

この見出しが示しているのは政策の移行であり、新たなAI製品や単一の2025年リリースではない。

その背景にあるのは、2018年から2024年まで実施されたウェールズ語テクノロジー行動計画だ。目的は、音声インターフェース、翻訳システム、会話型ソフトウェアを含む、より多くのデジタル環境でウェールズ語を使えるようにすることだった。

ウェールズ政府は2024年2月20日、最終技術報告書を公表した。この文書は当初のプログラムを終了し、開始以降に完了した取り組みを検証している。

計画は、相互に関連する3つの分野に重点を置いた。音声技術、コンピューター支援翻訳、会話型人工知能だ。これらを合わせると、現代のソフトウェア内で言語を機能させるために必要な技術的基盤の大部分を構成する。

音声技術には、録音またはライブの音声をテキストに変換する自動音声認識が含まれる。また、文書から音声を生成するテキスト読み上げシステムも含まれる。

コンピューター支援翻訳は、専門翻訳者に用語集、翻訳メモリー、自動提案を提供する。会話型AIには、チャットボットや、大規模言語モデル(LLM)が含まれ、これらは語の並びの可能性を予測して言語を生成する。

政府によれば、このプログラムはウェールズ語の音声テキスト変換技術、専門的な機械翻訳、合成音声の開発に寄与した。一部の合成音声は、発話能力を失った人々のために設計された。

プログラムは、開発者が再利用できるデジタル資源も支援した。この点が重要なのは、より小規模な言語には、英語、スペイン語、中国語ほどの商業的なデータ投資が集まりにくいためだ。

Google Newsでの提示は、この話をウェールズのテクノロジーとAI全般に関する広範な総括のように見せる可能性がある。しかし、その根底にある政策はより限定的で具体的だ。対象は、ウェールズで展開されるすべてのAI企業、データセンター、デジタル政策ではなく、ウェールズ語のための技術である。

この違いは、この主張を評価する読者にとって重要だ。ウェールズは、OpenAI、Google、Anthropicのシステムと競合する国産の基盤モデルを発表したわけではない。そうしたシステム内でウェールズ語を機能させるための言語資産とパートナーシップに投資したのである。

2024年2月までに、このアプローチはいくつかの目に見える統合を生み出していた。ウェールズ当局者は、GPT-4によるウェールズ語の処理を改善するためのOpenAIとの取り組みを強調した。また、Teams内の通訳機能に関するMicrosoftとの協力にも言及した。

Microsoft Teamsには、予定された会議で人間の通訳者が別の言語で通訳を提供できる機能が導入された。これは自動機械翻訳ではない。ソフトウェアが独立した音声チャンネルを提供するため、参加者は通訳された言語を選択できる。

この違いは、同政策の実務的な性格を示している。ウェールズは、AIモデルがすべてのバイリンガル会議の問題を解決するのを待たなかった。組織がすぐに利用できる、人間主導のサービスを支援するために既存プラットフォームと協力した。

当時の教育・ウェールズ語担当大臣ジェレミー・マイルズは、特別な要請をしなくても、人々がより多くの技術的な場面でウェールズ語を使えるようにすることが目標だと述べた。これは単にウェールズ語のインターフェースを公開するより高い基準である。

ベンダーが言語機能を一覧に載せれば、その機能は存在する。しかし、実用的な言語体験は、入力、出力、検索、文字起こし、翻訳、サポートにまたがって機能する。さらに、利用頻度の低い選択肢を静かに弱体化させかねない製品アップデートにも耐えなければならない。

したがって2024年の報告書は、作業の終わりではなく、一つの資金供給枠組みの終わりを示した。次の段階では、技術供給を日常的な需要へ結びつける必要がある。

ウェールズは生成AIが主役になる前にAIの材料を整備した

ウェールズの最も強力な判断は、チャットボットによってこの取り組みの商業的な緊急性が高まる前に、再利用可能な言語インフラへ投資したことだ。

言語システムの訓練と評価には、テキスト、音声、辞書、アノテーション、標準化された用語が必要となる。開発者には、これらの資料を処理・再配布する許可も必要だ。互換性のないライセンスに閉じ込められた有用なコレクションは、オープンな研究プロジェクトも商用製品も支えられない。

ウェールズ語は、小規模言語のAIに共通する課題を抱えている。活発なコミュニティ、公的機関、放送事業者、学校、そして相当量の文書資料が存在する。しかし、機械可読な資源は、オープンウェブから収集された英語データセットと比べると依然として小さい。

この不均衡が影響するのは、流暢な会話だけではない。モデルは、ウェールズ語の綴り、地域的な言語パターン、専門用語、固有名詞、コードスイッチング、音声の処理に苦戦する可能性がある。ウェールズ語で入力されたプロンプトに対して英語で返答することもある。

政府の対応は、データを共有インフラとして扱うことだった。公的資金による資源は、多くの場合、再利用を認めるライセンスの下で公開された。これにより、大学、独立開発者、大手ベンダーは共通の出発点を得られる。

この戦略は、生成AIの重要な特徴を予見していた。言語の立ち位置は、開発者がモデルを訓練または評価する際に、クリーンで合法的かつ代表性のあるデータを見つけられるかどうかに部分的に左右される。

ウェールズ政府の2025年の技術アップデートは、当初の計画終了後もデータ収集が続いたことを示している。2025年8月までに、政府は4つの名称付きコレクションにわたり、ウェールズ語音声の訓練データが249時間分に達したと報告した。

これらのコレクションには、Common Voiceの124時間、Bangor Transcription Bankの45時間、Cymenプロジェクトの40時間、Paldaruoの40時間が含まれる。録音品質と話者の多様性が価値に影響するため、音声時間は単純に同等とは見なせない。

このアップデートでは、より細かなデータ作業についても説明している。貢献者は、200を超える追加の文で単語の文法的役割をタグ付けした。さらに、ナレッジリンクの用途に向けて400の文中エンティティにアノテーションを付与した。

固有表現アノテーションは、テキスト内の人物、場所、組織、その他の意味のある項目を識別する。ナレッジリンクは、それらの項目を構造化された記録に結び付け、システムが地名と一般的な単語を区別できるようにする。

ウェールズ当局者はまた、Wikidataを通じて1万件を超えるウェールズ語の名称を共有したと報告した。関連プロジェクトでは、建物名向けに11,264件のウェールズ語ラベルを作成した。

これらの数字は、主要な英語モデルの背後にあるコーパスと比べれば小規模だ。その価値は、特異性、ライセンス、人による検証から生じる。慎重にラベル付けされた資料は、巨大で緩やかに収集されたデータセットが隠してしまう失敗を検証できる。

音声データにも同様のトレードオフがある。時間数が多いほど一般には有利だが、カバレッジも重要である。限られた話者群で訓練されたシステムは、年齢層、アクセント、録音環境、地域的な変種をまたぐと性能が低下する可能性がある。

だからこそ、オープンなインフラは一時的なチャットボットのデモよりも強力な長期資産であり続ける。一つのモデルリリースは時代遅れになるが、適切に保守されたデータセットは何世代もの製品を改善できる。

ウェールズは、言語技術に焦点を当てるカタルーニャ政府のプロジェクトAINAとも資料を共有した。この協力により、ウェールズ語は、英語中心の開発への依存を減らそうとする欧州の言語コミュニティによる広範な取り組みの一部に位置付けられる。

カタルーニャ語とバスク語は有用な参照点を提供する。いずれも公的な言語資源、研究パートナーシップ、導入に投資してきた。この比較は、制度がデータと調達を連携させれば、小規模言語でも技術市場に影響を与えられることを示している。

ただし、この比較は規模の問題も浮き彫りにする。優れた公的データセットであっても、世界的に優勢な言語で利用可能な資料に比べれば小さい。ウェールズは、収集だけでその隔たりを埋めることはできない。

同国の影響力は、ウェールズ語資源を再利用しやすくし、大手ベンダーが無視しにくいものにすることから生まれる。公的調達、評価基準、パートナーシップは、小規模なデータセットを製品要件へ変えられる。

Google Newsの見出しは完了したプロジェクトを表面化させられるが、それらが利用者の行動を変えたかどうかは示せない。それを判断するには、製品と職場からの証拠が必要だ。

主な争点はインフラと日常利用の対立だ

ウェールズは技術的な構成要素を生み出せることを証明したが、それらが日常的なウェールズ語の使用を一貫して増やすことはまだ証明していない。

ウェールズ政府は、当初の行動計画を見直した後に3つの優先事項を定めた。第一は、特に職場において、テクノロジーを活用して日常的なウェールズ語使用を増やすことだ。

第二は、言語技術を開発者と利用者の双方に届けることだ。第三は、データ共有などの取り組みを通じ、ウェールズ語AIと音声技術を改善することである。

当時の財務・ウェールズ語担当内閣書記、マーク・ドレイクフォードは、2025年1月7日の技術に関する声明でこれらの優先事項を説明した。この時期は重要であり、政策の軸足を資源構築から流通と普及へ移したためだ。

開発者はオープンな音声データセットを見つけても、それを統合するためのエンジニアリング予算が不足している可能性がある。公的機関は、名目上はウェールズ語をサポートするソフトウェアを購入しても、重要な段階で英語がデフォルトになっている場合がある。

ツールが遅延を生じさせたり、特別な設定を必要としたりすれば、働く人々はウェールズ語のツールを避けることもある。技術的に正しい機能でも、確立されたワークフローを妨げれば失敗しかねない。

これが本稿の中心的な対立軸である。言語インフラと、言語の使用だ。政府の最も強い証拠はインフラ側にある。公共的な成果は、もう一方の側にかかっている。

職場の会議を考えてみよう。Teamsの通訳機能は、独立した言語音声をサポートすることで一つの障壁を取り除く。しかし組織にはなお、通訳者、会議手順、十分に理解した参加者、そして機能を設定する管理者が必要だ。

音声認識を考えてみよう。モデルは統制された評価では高い性能を示しても、複数の話者、背景雑音、専門用語、またはウェールズ語と英語が切り替わる会話では苦戦する可能性がある。

生成AIを考えてみよう。チャットボットは流暢なウェールズ語を生成できても、事実誤認や不自然な用語を持ち込むことがある。流暢さだけでは、教育、医療、法務、行政サービスにおける信頼性は確立されない。

政府とOpenAIの提携は、恒久的な保証ではなく、アクセスと影響力として捉えるのが最も適切だ。ベンダーが学習データ、安全性システム、検索ツール、ユーザーインターフェースを更新すれば、モデルの挙動は変化する。

OpenAIによるGPT-4の取り組みは、ウェールズの政策立案者に有力な一つのシステムへ関与する経路を与えた。しかし、精度、方言カバレッジ、安全性、一貫性の面で、その後のすべてのモデルを比較する公開ベンチマークを生み出したわけではない。

Microsoftとの協力にも同じ緊張関係がある。Teamsの通訳機能は価値ある導入事例である一方、Copilotにおけるウェールズ語処理の改善は異なる技術レイヤーに対応する。どちらも、すべてのMicrosoftワークフローを初期設定でバイリンガルにするものではない。

AI機能がワープロ、メール、検索、カスタマーサービス、OSに組み込まれるにつれ、課題はさらに大きくなる。各インターフェースは、ウェールズ語対応が完全である場合も、部分的である場合も、まったくない場合もある新たな場所となる。

ユーザーがこれらのレイヤーを個別に評価することはほとんどない。彼らが体験するのは、一続きの壊れたプロセスだ。音声入力がウェールズ語を認識しても、アシスタントが英語で返答すれば、タスク全体が未対応だと感じられる。

だからこそ、データセットの整備と同じくらい、提供・配布の状況も可視化されるべきだ。ウェールズには、実際の利用、タスク完了率、エラー率、ユーザー満足度に関する証拠が必要である。

公的機関は、調達契約でバイリンガル技術の要件を公開することで支援できる。ベンダーに対し、どの機能がウェールズ語をサポートし、その対応をどのように検証しているのかを開示させることができる。

また、評価用の資料も共有できる。再利用可能なベンチマークがあれば、学校、行政機関、研究者、サプライヤーは、同じ言語タスクに対してシステムを比較できる。

有用な記録が会議、文書、メモに分散している場合、ナレッジワーカーも関連する問題に直面する。personal knowledge base は文脈を保持できるが、検索がウェールズ語と英語の資料の両方で等しく機能するかどうかは、依然として言語サポートに左右される。

このため、ウェールズ語の技術政策はウェールズの外でも重要である。小規模言語への対応は、AIプラットフォームが多言語ユーザーに一つの支配的言語を強いることなくサービスを提供できるかを試す指標となる。

ベンダーがウェールズ語向けの検索、音声、生成を解決すれば、デジタル資源が限られた他の言語にも転用できる手法を開発することになる。解決できなければ、AIの導入は既存の言語格差を強化しかねない。

進捗の数値だけでは証明できないこと

利用可能な証拠は活動と資産を示しているが、信頼性や導入状況を包括的に測る公開指標にはまだなっていない。

2025年8月に報告された249時間分の音声は、具体的な基準値を提供する。しかし、商用システムが実際の公共サービス環境でウェールズ語をどれほど正確に文字起こしできるかは示していない。

名称、ラベル、アノテーションの件数は、有用な拡張を示している。しかし、何人の開発者がデータをダウンロードしたのか、どの製品がそれを組み込んだのか、あるいはユーザーが結果の改善を認識したのかは分からない。

これは、この取り組みを軽視する理由ではない。インフラプログラムは間接的に価値を生むことが多い。問題は、次の資金拠出や調達の判断が迫ったとき、その間接的な価値を擁護しにくくなることだ。

公開ベンチマークは、その隔たりの一部を埋められる可能性がある。文字起こしの精度、翻訳品質、事実に基づく応答の品質、コードスイッチング、地域差をテストできる。

テストには、高リスクのタスクと日常的なタスクの両方を含めるべきだ。医療予約にはカジュアルなメッセージの下書きとは異なるリスクがあるが、どちらも言語ツールへの信頼を形作る。

評価には人間のレビュアーも必要になる。自動指標はモデル出力を参照解と比較できるが、複数のウェールズ語訳が正しい場合もある。母語話者が意味、語調、自然さを判断しなければならない。

プライバシーも別の制約となる。公共サービス、学校、職場から収集された音声データには、機微な情報が含まれる可能性がある。オープンライセンスが価値を持つのは、収集が同意とデータ保護を尊重する場合に限られる。

代表性も重要である。データセットは法的に再利用可能であっても、特定のアクセント、年齢層、コミュニティ、言語能力を十分に代表していない場合がある。それを学習したシステムは、こうした格差を再現しうる。

生成AIシステムには別の懸念がある。モデルはもっともらしいが根拠のない情報を生成する、いわゆるハルシネーションを起こすことがある。また、自信に満ちた口調を保ったまま、専門用語を誤訳することもある。

こうしたリスクにより、公共サービスでは人間による監督が不可欠となる。ウェールズ語対応は、英語のツールに適用される基準を引き下げる理由になってはならない。

政府の2025年AI概要は、ウェールズの公共部門における導入は倫理的で、信頼に足るものであり、包摂的かつ利用しやすいものであるべきだとしている。これらの原則は方向性を示すが、導入に影響を与えるかどうかは運用上の統制にかかっている。

ウェールズはその後、2025年11月に公表したnational AI planを通じ、より広範な政策枠組みを整備した。同計画は、経済成長、教育、公平な提供、信頼を軸に課題を整理している。

この広範な計画は連携を強める一方で、証拠を要する約束の数も増やす。言語技術はいま、医療、教育、行政、スキル、インフラ、経済開発と並ぶ位置づけにある。

リスクは、ウェールズ語対応が責任者のいない横断的原則になることだ。すべてのプログラムが言語を考慮しなければならないとき、結果を公表するプログラムが一つもなくなる可能性がある。

独立した検証はすでにこの問題を明確にしている。2026年のSenedd委員会報告書は、証人らがウェールズを少数言語技術プログラムの中では比較的先進的だと見ていたと述べた。

同じ証拠はウェールズ語をカタルーニャ語とバスク語に比較し、勢いを維持する必要性を強調している。この留保は重要だ。プラットフォームの開発サイクルは、ほとんどの公共政策サイクルより速く進むからである。

2024年に公開されたデータセットは、何年も利用可能な状態を保てる。商用AIインターフェースは、1年のうちに何度も変わりうる。正式な発表がなくても、対応は改善する場合も後退する場合もある。

したがって政府は、4種類の測定を区別すべきである。

第一に、資産指標はコーパス、録音、音声、用語、アノテーションを数える。第二に、統合指標は、それらの資産を利用する製品とサービスを追跡する。

第三に、性能指標は精度とタスク完了を測定する。第四に、導入指標は、人々が仕事や日常活動で実際にウェールズ語を選んでいるかを示す。

現在の公開情報は、第一のカテゴリーで最も充実している。Teamsやその他の提携は、第二のカテゴリーの証拠を提供している。第三と第四のカテゴリーは、公表記録から評価するのがなお難しい。

この限界は、準備状況に関する主張にも当てはまる。ウェールズは、2018年時点より多くの資源、関係性、制度的経験を持つため、より整っている。

準備ができていることは、同等性を意味しない。ウェールズ語ユーザーが英語ユーザーと同じ機能範囲、精度、更新スケジュールを得られることを意味するわけではない。

したがって、最も安全な結論は見出しよりも限定的だ。ウェールズは信頼できる基盤と、再現可能な提携モデルを構築した。次の段階では、製品規模で成果を実証しなければならない。

戦略が機能しているかを示す3つのシグナル

次に意味のある証拠となるのは、独立したテスト、目に見える製品統合、持続的なユーザー導入である。

第一のシグナルは、ウェールズ語AIに関する継続的な公開ベンチマークだ。開示されたタスク、代表性のある話者、人間による評価を用いて、主要モデルと音声システムを比較すべきである。

ベンチマークは性能低下を可視化する。モデルの更新によってウェールズ語の性能が弱まれば、研究者や購入者は逸話に頼らず、その変化を特定できる。

また、調達も改善する。公的機関は、文字起こし、翻訳、アクセシビリティ、生成応答に関する最低要件を定められる。

こうしたテストが実施され、ベンダーが参加すれば、ウェールズが資産創出から説明責任ある導入へ移行したという主張は強まる。そうでなければ、進捗に関する主張は比較しにくいままだ。

第二のシグナルは、主流製品の中でより広く統合されることだ。Teamsの通訳機能は、ウェールズ語のニーズを組織がすでに利用しているソフトウェアと結びつけるため、有用な先例となる。

同じ基準を、会議要約、文書アシスタント、検索、音声インターフェース、カスタマーサービスシステムにも適用すべきだ。対応は、孤立した一つの機能ではなく、タスク全体をカバーする必要がある。

製品ドキュメントは、ウェールズ語がどこで機能し、どこで機能せず、どの品質管理が適用されるのかを明記すべきである。目立たない部分対応は非現実的な期待を生み、失敗後のユーザー離れを招く。

新たな統合は、グローバルプラットフォームに対する影響力を示すため、ウェールズのアプローチを強化する。対応する統合のないデータセットの長い一覧は、現行戦略の説得力を弱めるだろう。

第三のシグナルは、測定可能な日常利用だ。政府の政策は、とりわけ職場でのウェールズ語の実用的利用を増やすことを目指している。この成果には、ダウンロード数や機能の提供を超えるものが必要だ。

有用な指標には、通訳を利用するバイリンガル会議の割合、ウェールズ語音声入力の利用量、公的機関での導入、言語間でのタスク完了率などが含まれうる。

調査では、人々がなぜ英語に戻るのかも尋ねるべきだ。理由には、精度、習慣、同僚の好み、インターフェースの初期設定、トレーニング、用語不足などがあるかもしれない。

こうした知見は、広範な満足度スコアよりも効果的に支出の指針となる。技術的な修正では職場文化の問題を解決できず、啓発キャンペーンでは不正確な文字起こしを直せない。

利用の拡大は、公的デジタルインフラが言語行動に影響を与えられるという結論を強める。ツールが増えても利用が伸びなければ、政策が供給に過度に重点を置いてきたことを示すだろう。

Google Newsの記事は、見過ごされてきた技術プログラムをより広いAIの議論に持ち込むという点で価値がある。しかし、集約記事は6年にわたる政策の記録を、証拠が示す以上に断定的に聞こえる見出しへと圧縮している。

ウェールズはかなりの基礎的な取り組みを行ってきた。現在の生成AIブームより前に着手し、再利用可能な資源を公開し、大手ベンダーとの関係を築いた。

より難しい段階が到来している。政府関係者は、急速に変化するシステムをテストしながらデータセットを最新に保たなければならない。ベンダーは、ウェールズ語対応を可視化し、一貫性を持たせ、測定可能にしなければならない。

開発者と企業の購入担当者は、言語オプションを完全なものとして扱う前に、直接的な質問をすべきだ。どのタスクがテストされ、どの話者が代表され、モデル更新後には何が起きるのか。

ナレッジワーカーも、洗練されたデモではなく、実際のバイリンガルワークフローを比較すべきだ。会議、検索、文字起こし、下書き、検索・取得を、人々が実際に使う言語パターンでテストする必要がある。

次のウェールズAI更新では、次の3つのシグナルに注目したい。公開ベンチマーク、完全な製品統合、導入データだ。これらは、戦略が日々のテクノロジー利用を変えているのか、それとも利用可能な資源の一覧を主に拡充しているだけなのかを明らかにする。

これがGoogle Newsの見出しの背景にある問いである。ウェールズはウェールズ語AIに必要な材料の多くを揃えた。今度は、人々が完成した体験に頼れることを示さなければならない。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page