年齢の進行に合わせて多様性を考慮した非EU/英国顔画像データセットの構築
コンピューター ビジョン モデルの公平性と堅牢性を強化するための、1,205 人の参加者による時間的に分離された顔画像コーパス。
プロジェクト概観
安全性、パーソナライゼーション、アイデンティティ体験のための顔中心の AI を構築している世界的なテクノロジー企業は、バイアスを減らし、年齢、環境、アクセサリにわたるモデルの復元力を向上させるために、時間的に区切られた写真を含む非 EU/英国データセットを求めていました。
クライアントはShaipと提携し、各参加者が最近の写真と古い写真を提供する大規模な顔画像コーパスの収集、キュレーション、検証を行いました。その目的は、EU/英国以外の国からの出所を厳格に規定し、性別と年齢のバランスの取れた割り当てを実現しながら、自然な年齢進行を符号化することでした。
主要統計
一般
1,205(EU/英国以外、男女比50/50 ±10~15%)
年齢構成
40% (10–29), 40% (30–49), 20% (50+) ±10–15% の許容範囲
カバレッジ
南アジア/東南アジア、北アフリカおよび北東アフリカ、シンガポール、南アメリカ
タイムライン
19週間
チャレンジ
地理的制限
旅行起源の EU/UK のイメージを避けながら、非 EU/UK 人口のみから調達します。
大規模なバランスの取れた割り当て
性別や年齢の許容範囲が厳密な 1,205 名の参加者に達しました。
時間的に隔てられた証拠
すべての ID に、年齢層に合わせて最近の写真と過去の写真の両方が含まれていることを確認します。
運用品質
スループットを低下させることなく、画像/顔の最小サイズ、種類、重複の制限を適用します。
解決策
1. 国別パネルと原産地管理
当社は対象地域全体に国レベルの調達チームを設置し、パートナー企業に原産地規則に関する研修を実施しました(EU/英国以外の地域のみ)。メタデータ(年、場所マーカー)と提出者の証明書を用いて、写真の原産地リスクをスクリーニングし、品質管理前にEU/英国からの漏洩を削減しました。これは、下流工程の処理能力を保護するためにリスクチェックを前倒しで行うという、Shaip社の実績ある手法を反映したものです。
2. 年齢進行キャプチャデザイン
「20枚の画像を提出してください」と指示するのではなく、参加者が以下の手順を踏めるよう、 2段階の提出フローを設計しました。
- トラックA(最新): 過去2年間の写真。
- トラックB(ヒストリー): 古い写真は、提出時の参加者の年齢層に合わせて配置されます (例: 2~10/15/20 歳の期間)。
ポータルでは、過度に指定することなく多様性を促進するために、例(屋内/屋外、角度、アクセサリ)を使用してユーザーを促しました。
3. 多様性オーケストレーションとクォータガードレール
リアルタイムの割り当てダッシュボードは、性別、年齢層、地域別の登録状況を監視し、各層が計画された上限に達すると登録受付を一時停止しました。これにより、サイクル後半でのやり直し作業が回避され、バランスの取れた代表性を維持するために、以前の生体認証データセットで使用された、層別登録と登録停止というShaipの標準的なアプローチが反映されています。
4. 品質パイプライン(人間による介入 + 自動事前チェック)
- 自動ゲート: 顔検出 + 最小サイズのしきい値、基本的なぼかし/ノイズ チェック、重複の可能性を早期に検出するための同日クラスタリング。
- 人間のQA層: 画像レベルのレビュー担当者が検証 主題の排他性 (主な参加者のみ) シーン/アングルの多様性, 美化フィルターなしCQA監査員は受入れ前にバッチを抜き取り検査する。これは 多層QA Shaip が公開した生体認証データ プログラムを反映しています。
5. コンプライアンスと同意
20歳以上の登録は署名済みの同意書が必要です。20歳未満の場合は、保護者の同意書がある場合のみ登録を受け付けます。同意の有無はメタデータに記録し、審査員のチェックリストを適格性および同意に関する項目に合わせることで、監査可能性を確保しました。
6. メタデータとトレーサビリティ
参加者および画像レベルのメタデータ(IDリンク、人口統計情報、国籍/居住地、撮影年、提出日など)と標準化されたフィールド名を提供することで、後続のラベリングと評価を簡素化しました。これは、生体認証データセットに対する豊富なメタデータタグ付けに関するShaipのベストプラクティスに準拠しています。
7. リスク規模縮小のための段階的な導入
8つのバッチからなる計画は、まず10人の参加者によるキャリブレーションセットから始まり、その後、段階的に規模を拡大していきました。第1バッチ後のクライアントからのフィードバックに基づいて評価基準を微調整し、その後、予測可能な段階的な増加によって、約19週間で1,205人の参加者に達しました。
プロジェクト範囲
| 次元 | 私たちが提供したもの |
|---|---|
| 人口 | 性別と年齢層のバランスが取れた、EU/英国以外の参加者 1,205 名。 |
| コンテンツ | 参加者 1 人あたり 20 枚以上の画像: 年齢の進行を表す最近の画像と過去の画像、さまざまなシーン、角度、アクセサリ。 |
| 品質オペレーション | 自動化された事前チェック + 人間による多層 QA (重複制御、主題の排他性、フィルターの拒否)。 |
| コンプライアンス | 非 EU/英国起源検証、同意ガバナンスおよび適格性検証。 |
| トレーサビリティと下流の ML 評価のための参加者 + 画像属性。 | |
| 出荷 | 8 段階のバッチ。キャリブレーションから始まり、最終ターゲットまで安定した状態で配信されます。 |
アウトカム
- バランスのとれた、監査準備の整ったコーパス: 人口統計上の割り当ては許容範囲内で満たされ、準拠したトレーニングのために、すべての画像で非 EU/英国由来が強制されました。
- モデル準備の変動性: 時間的に分離された画像、多様な環境/角度、アクセサリの範囲により、堅牢性のテストとバイアス分析がサポートされます。
- 運用の予測可能性: キャリブレーションの最初のロールアウトと割り当てガードレールにより、やり直し作業が削減され、1,205 人の参加者という目標の達成までのタイムラインが確保されました。
- 下流効率: 豊富なメタデータと一貫したファイル衛生により、Shaip の生体認証データセット プレイブックに従って、注釈とベンチマークの構築までのパスが短縮されました。
Shaipは、複雑な非EU/英国顔認識データセットの要件を、バランスの取れた監査対応可能なコーパスへと変換しました。彼らの年齢進行設計と階層化された品質保証により、当社の履歴書チームは、スケジュールリスクを負うことなく、信頼できるクリーンで多様なデータを得ることができました。