英国内務省が計画する「顔画像年齢推定AI」—そもそも何か

英国の内務省は、難民申請者の中から成人が子どもになりすまして難民認定を受けるケースに対処するため、AI技術を用いた顔画像年齢推定(Facial Age Estimation、以下FAE)システムの導入を計画しています。2027年からの本格運用を予定しており、移民判定官が18歳以上・以下の判断を下す際の補助ツールとして機能させる想定です。

内務省は「人間の判断に取って代わるものではなく、支援するツール」と説明していますが、この主張が大きな疑問を招いています。

最大の問題は、FAEシステムが最も精度を必要とする16~18歳の境界付近で、むしろ最も不正確だという矛盾にあります。

人権団体が指摘する3つの致命的な問題

1. 技術自体に組み込まれたバイアス

2024年6月19日に公開された公開書簡で、アムネスティ・インターナショナル、ヒューマン・ライツ・ウォッチ、Liberty、電子フロンティア財団(EFF)など62の人権団体は、FAE技術について「バイアスが深く根付いており、差別が構造化されている」と指摘しています。

特に問題視されているのが、女性と有色人種に対する高い誤判定率です。内務省自身の指導文書でも、技術の性能が民族や肌色によって変動することを認めており、この点が最大の矛盾を生み出しています。

難民申請者は大多数が有色人種であるにもかかわらず、内務省がこのテクノロジーの信頼性を確認していない点は、正直なところ疑問を感じざるを得ません。

2. 精度的に使用に耐えない—特に重大な境界付近で

内務省が公表した数値によると、最高性能のシステムであっても、16~18歳の年齢区間で約2.5年の誤差幅があるとのこと。つまり、14歳の子どもが19歳と判定される可能性が存在する、ということです。

人権団体はこの点について、以下のように述べています。

FAEシステムは、内務省が判定を必要とする「最も重要な16~18歳の境界」においてこそ、最も不正確である。

さらに、実際の難民申請者である子どもたちは、長距離の移動、栄養不良、睡眠不足、トラウマなどの影響で、実年齢より老けて見える傾向があります。これらの要因を考慮すれば、システムの精度はさらに低下する可能性が高いと考えられます。

3. トレーニングデータの透明性と倫理的問題

人権団体は、FAE開発・テストに使用された画像やデータセットの詳細情報の公開を強く求めています。特に指摘されているのが、以下の点です。

  • トレーニングデータの出所と取得方法が不明確
  • 難民申請者を含む子どもたちの画像が、同意なく使用されている可能性
  • 法的に適切な同意を得ることが可能だったのか疑問

内務省は詳細な検証結果、方法論、影響評価(Equality Impact Assessment、Data Protection Impact Assessment)をいまだ公開していません。人権団体は、21日間の回答期限を設定し、テスト方法、訓練データ、セーフガード、異議申し立てメカニズムなどについての明確な説明を求めています。

背景にある「AI倫理と透明性」の課題

このニュースは、単なる英国の政策問題ではなく、グローバルなAI倫理の課題を露呈させています。

開発者や技術者の視点からすれば、教教えられる点は多いです。まず、AIシステムが「実行不可能な決定を支援できるツール」に見えても、その信頼性が実証されていなければ、運用してはならないという原則です。

また、Signal のプレジデント Meredith Whittaker は最近のインタビューで、「AIシステムは友人ではなく、意識的な存在ではない」と述べていますが、同じ警告は法的判断を支援するAIにもあてはまります。

システムが「平均化された過去のデータに基づく推測」であることを忘れて、それを真実のように扱うことは、特に難民認定という人生に関わる決定では許されません。

項目 内務省の主張 人権団体の指摘
役割 判定官の判断を「支援」する 実質的には判断を代替する恐れ
精度 利用可能な水準 16~18歳で±2.5年の誤差
バイアス 適切に対処済み 女性・有色人種で大きな誤差
データ透明性 詳細は検討中 同意・倫理的問題が未解決
対象者の特性 考慮 栄養不良・トラウマで外見が変わる

今後、何が問われるのか

この問題の根本は、政府がAI技術の導入を急ぐあまり、その信頼性と倫理的妥当性の検証を後回しにしているという点にあります。内務省は21日の回答期限を設定されましたが、それまでに詳細な検証結果や影響評価を公開するかどうかが、今後の展開を左右するでしょう。

エンジニアの方々にとって教訓となるのは、「ビジネスや行政の都合で導入ありきになるAIほど危険なものはない」ということです。精度が不十分なシステムを「補助ツール」という名目で運用すれば、最終的には人間の判断を歪める可能性が高いからです。