インド諸語音声データ収集事例研究:ヒンディー語、テルグ語、英語で合計300時間
同社のAI搭載型音声処理多言語音声スイートのトレーニングのために、高品質な音声データ収集、文字起こし、および注釈サービスを提供した。
プロジェクト概要:インド言語ローカライゼーションプラットフォーム向け音声データ
クライアントは、デジタル世界における言語の壁を克服するテクノロジーを開発しています。同社の言語サービスプラットフォームを通じて、アプリやポータルのコンテンツを複数の言語でリアルタイムに配信できます。この言語プラットフォームは、アプリやポータルの静的コンテンツと動的コンテンツを複数の言語でリアルタイムに配信します。
同社は、モバイルブランド、チップセットメーカー、消費者向けインターネット企業、銀行や金融機関、教育機関、政府機関、エンターテイメント企業など、多岐にわたる顧客に対し、言語ローカライズサービスを提供しています。
主な成果:3言語で合計300時間の学習時間を確保
音声データの収集、文字起こし、注釈付け
300可能時間
の番号
言語
3(100時間×3言語)
言語の書き起こしと注釈
インド英語、ヒンディー語、テルグ語
プロジェクト
タイムライン
12·ウィークス
課題:人口統計的に多様な会話音声の収集
質の高い言語学者やデータアノテーターの不足、そして厳しい納期は、対話型AIの発展と普及におけるボトルネックとなってきた。言語学者の確保、大量のデータセットの書き起こしとアノテーションを、AI機能の構築に必要な品質で行うことは非常に時間とコストのかかる作業であり、様々な分野の熟練した人材が必要となる。
クライアントの重要な要件は次のとおりです。
- 音声収集のための質の高い言語専門家へのアクセス: インド英語、ヒンディー語、テルグ語などの言語について、多様な背景を持つ専門言語学者から300時間分の音声データを収集する。
- 複雑な音声の文字起こしと注釈付け(最低精度90%):
- 音声ファイル全体を文字起こしし、ためらい、間投詞、言い間違い、その他の発話癖など、話されたすべての単語をそのまま記録しました。
- 方言の発音、誤った発音の単語、非標準的な用法、句読点などに関する厳格な転写ガイドラインにもかかわらず、エラーのない出力を提供しました。
- データ配信: 12週間以内に、3言語に対応した高品質で多様な音声ファイルと、それに対応する文字起こしデータ(JSON形式)を納品する。
解決策:ドメイン特化型の音声収集、文字起こし、および注釈付け
当社は会話型AIに関する深い理解に基づき、専門の言語学者と注釈者のチームによるデータ収集、文字起こし、注釈付けを支援し、クライアントのAI搭載多言語音声スイートのトレーニングを行いました。
多数のベンダーを評価した結果、クライアントは、厳しい納期の中で、費用対効果が高く、かつ必要な品質で対話型AIプロジェクトを完了させる当社の専門知識を評価し、Shaipを選定しました。クライアントのチームは、Shaipの堅牢かつ包括的なプロジェクト遂行能力にも感銘を受けました。
| 言語 | 時間数 | 台本なしの一般的な会話(50%) | 台本なしのコールセンター会話(30%) | オンラインのスクレイピングされたメディアコンテンツ(20%) |
|---|---|---|---|---|
| ヒンディー語 | 100 | 50 | 30 | 20 |
| 英語 | 100 | 50 | 30 | 20 |
| テルグ語 | 100 | 50 | 30 | 20 |
| トータル | 300 | 150 | 90 | 60 |
- 追加の音声収集要件
- 周波数:サンプリングレート – 16 kHz
- フォーマット: WAV
- 所要時間 – 一般的な所要時間(5~30分) – 会話
- 音声分野 – 金融サービス、通信、小売
- 人口統計的多様性 – 性別:1:1の比率、年齢範囲:18~60歳、各スピーカーを識別するためにスピーカーIDを取得します
- 音声の分割、文字起こし、注釈に関するガイドラインに従う
2.1 セグメンテーション- 30秒を超える個々のファイルに対して、15秒ごとのセグメント(ミリ秒単位のタイムスタンプ付き)を作成します。
- セグメントの音の種類 – 音声、喃語、音楽、ノイズ、重なり
- セグメントラベル付け – 開始時間、終了時間、セグメントID、音量レベル、主要な音の種類、
言語コード、話者ID
2.2 文字起こしと注釈- 音声ファイル全体を文字起こしし、ためらい、フィラーワード、言い間違い、その他の言語的癖(記号、文字など)を含め、話されたすべての単語をそのまま記録しました。
- 方言の発音、誤った発音の単語、非標準的な用法、句読点、大文字、略語、短縮形、数字、頭字語、流暢でない聞き取れない発話、非ターゲット言語など、厳格な転写ガイドラインにもかかわらず、エラーのない出力を提供しました。
言語、その他。
- データ配信
すべてのWAV音声ファイルと文字起こしファイルは、12週間以内に含まれた固有の話者属性に応じてJSON形式で納品されました。
成果:実用レベルの多言語音声スイート
専門の言語学者による高品質な注釈付き音声データのおかげで、クライアントはAIを活用した音声処理多言語音声スイートを、インド英語、ヒンディー語、テルグ語の3言語で規定時間内に正確にトレーニングすることができました。
最高水準のトレーニングデータセットを活用することで、クライアントは、現実世界の課題を解決するための、インテリジェントで堅牢な音声認識、言語翻訳、および多言語対応キーパッドサービスを提供することができました。
Shaip社の堅牢なプロジェクト遂行能力、専門言語学者から必要な音声データを収集、文字起こし、注釈付けする専門知識に感銘を受けました。複数の品質チェック、厳格な納期遵守、そしてコストパフォーマンスの高さは他社に引けを取りません。