| + | アフリカ系アメリカ人の言語 | 8kHz | コールセンター | 211 |
| 短い説明 | アフリカ系アメリカ人の口語コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:612名、男性:1242名、不明:12名 |
|
| + | | 16kHz | Podcast | 154 |
| 短い説明 | アフリカ系アメリカ人の日常言語メディアのデータ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:151名、男性:150名、不明:10名 |
|
| + | アフリカーンス語 | 8kHz | 一般的な会話 | 368 |
| 短い説明 | アフリカーンス語の一般的な会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(目安) - 15~60分、アフリカで話されているアフリカーンス語。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:502名、男性:390名、不明:2名 |
|
| + | | 16kHz | Podcast | 658 |
| 短い説明 | アフリカーンス語メディアファイル | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:750名、男性:1278名、不明:52名 |
|
| + | アラビア語 | 8kHz | 一般的な会話 | 292 |
| 短い説明 | アラビア語一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)は約15~60分、湾岸諸国のアラビア語。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:171名、男性:534名、不明:1名 |
|
| + | | 48kHz | スクリプト化された独白 | 1,947 |
| 短い説明 | アラビア語の台本付きモノローグ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 838 男性 1209 不明 78 |
|
| + | アッサム語(開発中) | | コールセンター | 60 |
| 短い説明 | アッサム語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | アッサム語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | アッサム語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | ベンガル語(開発中) | | コールセンター | 60 |
| 短い説明 | ベンガル語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | ベンガル語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | ベンガル語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | ボストン英語 | 8kHz | コールセンター | 177 |
| 短い説明 | ボストンのコールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:605名、男性:711名、不明:0名 |
|
| + | | 8kHz | 一般的な会話 | 32 |
| 短い説明 | ボストン総合病院の会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:53名、男性:83名、不明:0名 |
|
| + | | 16kHz | Podcast | 93 |
| 短い説明 | ボストン・メディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:43名、男性:181名、不明:2名 |
|
| + | カナダのフランス語 | 48kHz | スクリプト化された独白 | 1,222 |
| 短い説明 | カナダのフランス語 | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 974 男性 631 不明 1 |
|
| + | 中国語英語 | 8kHz | コールセンター | 169 |
| 短い説明 | 中国のコールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:1790人、男性:523人、不明:13人 |
|
| + | | 16kHz | Podcast | 249 |
| 短い説明 | 中国メディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:126人、男性:346人、不明:6人 |
|
| + | 中国語(簡体字) | 48kHz | スクリプト化された独白 | 2,762 |
| 短い説明 | 中国語(簡体字) | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1920 男性 1535 不明 270 |
|
| + | 中国語(繁体字) | 48kHz | スクリプト化された独白 | 1,028 |
| 短い説明 | 中国語(繁体字) | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1069 男性 262 不明 3 |
|
| + | デンマーク語 | 8kHz | 一般的な会話 | 372 |
| 短い説明 | デンマーク語一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:311人、男性:417人、不明:0人 |
|
| + | | 16kHz | Podcast | 664 |
| 短い説明 | デンマークのメディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性:369人、男性:864人、不明:27人 |
|
| + | | 48kHz | スクリプト化された独白 | 2,579 |
| 短い説明 | デンマーク語の台本付きモノローグ | | データセットの説明 | デンマーク語の単一発話録音は、5秒から30秒の範囲に収まる傾向がある。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1551 男性 1233 不明 42 |
|
| + | イングリッシュディープサウス | 8kHz | コールセンター | 151 |
| 短い説明 | 英語圏南部のコールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性221、男性1004、不明7 |
|
| + | | 8kHz | 一般的な会話 | 56 |
| 短い説明 | 英語圏南部一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性99人、男性31人、不明0人 |
|
| + | | 16kHz | Podcast | 266 |
| 短い説明 | 英語 Deep South Media 音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性204人、男性356人、不明21人 |
|
| + | ドイツ語 | 8kHz | コールセンター | 64 |
| 短い説明 | ドイツのコールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | デスクトップ | | WER(%) | | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 478 男性 1440 不明 0 |
|
| + | | 8kHz | IVR | 200 |
| 短い説明 | ドイツのIVRデータ | | データセットの説明 | 人間と機械の対話。音声合成(TTS)による音声ガイダンス(例:「どのようなご用件でしょうか?」)に続いて、人間の自然な応答が続くIVRタイプのフロー。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | デスクトップ | | WER(%) | | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 10115 男性 8750 不明 0 |
|
| + | グジャラート語(開発中) | | コールセンター | 60 |
| 短い説明 | グジャラート語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | グジャラート語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | グジャラート語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | ヘブライ語 | 8kHz | 一般的な会話 | 399 |
| 短い説明 | ヘブライ語一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(目安) - 15~60分、イスラエルでのヘブライ語会話。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性414、男性399、不明1 |
|
| + | | 16kHz | Podcast | 427 |
| 短い説明 | ヘブライ語メディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性361、男性513、不明13 |
|
| + | ヒンディー語 | 16kHz | Podcast | 219 |
| 短い説明 | ヒンディー語メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性83、男性309、不明0 |
|
| + | | 48kHz | スクリプト化された独白 | 2,867 |
| 短い説明 | ヒンディー語の台本付きモノローグ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1977 男性 1864 不明 147 |
|
| + | ヒングリッシュ | 8kHz | コールセンター | 208 |
| 短い説明 | ヒングリッシュ コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性822人、男性1262人、不明0人 |
|
| + | | 16kHz | Podcast | 216 |
| 短い説明 | ヒングリッシュ メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性75人、男性380人、不明0人 |
|
| + | ヒスパニック英語 | 8kHz | コールセンター | 212 |
| 短い説明 | ヒスパニック系コールセンターのデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性822、男性1262、不明0 |
|
| + | | 16kHz | Podcast | 155 |
| 短い説明 | ヒスパニックコールメディア音声 | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性140、男性219、不明5 |
|
| + | インドネシア語 | 8kHz | 一般的な会話 | 496 |
| 短い説明 | インドネシア語一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(目安) - 15~60分、インドネシア語 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性524、男性454、不明2 |
|
| + | | 16kHz | Podcast | 643 |
| 短い説明 | インドネシアのメディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性746、男性1507、不明129 |
|
| + | アイリッシュ | 8kHz | 一般的な会話 | 192 |
| 短い説明 | アイルランド一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性213、男性153、不明0 |
|
| + | 日本語 | 48kHz | スクリプト化された独白 | 2,335 |
| 短い説明 | 日本語の台本付きモノローグ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1460 男性 1221 不明 194 |
|
| + | カンナダ語版(開発中) | | コールセンター | 60 |
| 短い説明 | カンナダ語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | カンナダ語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | カンナダ語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | 韓国語 | 8kHz | コールセンター | 107 |
| 短い説明 | 韓国のコールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性1086名、男性210名、不明4名 |
|
| + | | 16kHz | Podcast | 204 |
| 短い説明 | 韓国メディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性70人、男性303人、不明25人 |
|
| + | | 48kHz | スクリプト化された独白 | 1,955 |
| 短い説明 | 韓国語の台本付きモノローグ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1195 男性 1134 不明 122 |
|
| + | マレー語 | 8kHz | 一般的な会話 | 266 |
| 短い説明 | マレー語一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)は約15~60分、マレーシアのマレー語。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性316人、男性176人、不明0人 |
|
| + | | 16kHz | Podcast | 344 |
| 短い説明 | マレー語メディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性236人、男性626人、不明47人 |
|
| + | マラヤーラム語(開発中) | | コールセンター | 60 |
| 短い説明 | マラヤーラム語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | マラヤーラム語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | マラヤーラム語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | マラーティー語(開発中) | | コールセンター | 60 |
| 短い説明 | マラーティー語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | マラーティー語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | マラーティー語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | スペイン語(メキシコ) | 48kHz | スクリプト化された独白 | 1,492 |
| 短い説明 | メキシコスペイン語の台本付きモノローグ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1016 男性 1069 不明 95 |
|
| + | オランダ語 | 48kHz | スクリプト化された独白 | 1,205 |
| 短い説明 | オランダ語の台本付きモノローグ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1285 男性 531 不明 3 |
|
| + | ニューヨーク英語 | 8kHz | コールセンター | 103 |
| 短い説明 | ニューヨーク英語コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性610人、男性532人、不明0人 |
|
| + | | 8kHz | 一般的な会話 | 107 |
| 短い説明 | ニューヨーク英語一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性118、男性114、不明0 |
|
| + | | 16kHz | Podcast | 140 |
| 短い説明 | ニューヨーク・イングリッシュ・メディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性66、男性230、不明11 |
|
| + | ニュージーランド英語 | 8kHz | 一般的な会話 | 148 |
| 短い説明 | ニュージーランド英語一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性167名、男性121名、不明4名 |
|
| + | | 16kHz | Podcast | 400 |
| 短い説明 | ニュージーランド英語メディア音声 | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性367名、男性678名、不明26名 |
|
| + | オリヤ語版(開発中) | | コールセンター | 60 |
| 短い説明 | オリヤー語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | オリヤー語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | オリヤ語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | ポーランド語 | 16kHz | Podcast | 269 |
| 短い説明 | ポーランド語メディア音声 | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 173 男性 354 不明 6 |
|
| + | ポーランド語(ポーランド) | 48kHz | スクリプト化された独白 | 1,482 |
| 短い説明 | ポーランド語 - 台本付きモノローグ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1324 男性 701 不明 24 |
|
| + | パンジャブ語(開発中) | | コールセンター | 60 |
| 短い説明 | パンジャブ語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | パンジャブ語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | パンジャブ語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | ロシア語 | 48kHz | スクリプト化された独白 | 2,398 |
| 短い説明 | ロシア語の台本付きモノローグ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1689 男性 1937 不明 214 |
|
| + | スコットランド語 (英語訛り) | 8kHz | 一般的な会話 | 292 |
| 短い説明 | スコットランド一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性285、男性260、不明3 |
|
| + | シンガポール英語 | 8kHz | コールセンター | 218 |
| 短い説明 | シンガポールのコールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 2139 、男性 884 、不明 21 |
|
| + | | 16kHz | Podcast | 247 |
| 短い説明 | シンガポールメディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性160、男性455、不明37 |
|
| + | 南アフリカ英語 | 8kHz | コールセンター | 261 |
| 短い説明 | 南アフリカ英語コールセンターのデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性1274、男性935、不明1 |
|
| + | | 16kHz | Podcast | 251 |
| 短い説明 | 南アフリカ英語メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性235、男性432、不明36 |
|
| + | スワヒリ語 | 8kHz | コールセンター | 230 |
| 短い説明 | スワヒリ語コールセンターのデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性611、男性833、不明0 |
|
| + | | 16kHz | Podcast | 265 |
| 短い説明 | スワヒリ語メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性118、男性493、不明25 |
|
| + | スウェーデン語 | 8kHz | コールセンター | 250 |
| 短い説明 | スウェーデンのコールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性1581人、男性727人、不明2人 |
|
| + | | 16kHz | Podcast | 278 |
| 短い説明 | スウェーデンメディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性195人、男性500人、不明21人 |
|
| + | タミル語版(開発中) | | コールセンター | 60 |
| 短い説明 | タミル語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 100 |
| 短い説明 | タミル語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 40 |
| 短い説明 | タミル語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | テルグ語 | 8kHz | 一般的な会話 | 553 |
| 短い説明 | テルグ語一般会話データ | | データセットの説明 | 台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 574 、男性 564 、不明 0 |
|
| + | | 16kHz | Podcast | 648 |
| 短い説明 | テルグ語メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性207、男性963、不明2 |
|
| + | テルグ語版(開発中) | | コールセンター | 30 |
| 短い説明 | テルグ語(開発中)コールセンターデータ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | 一般的な会話 | 50 |
| 短い説明 | テルグ語(開発中)一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | | | Podcast | 20 |
| 短い説明 | テルグ語(開発中)メディア音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | |
|
| + | タイ語 | 8kHz | 一般的な会話 | 183 |
| 短い説明 | タイ語の日常会話 | | データセットの説明 | 台本なしの二人の電話での会話。音声の長さ(範囲)は約15~60分。友人同士で使われるくだけた表現。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性338、男性96、不明8 |
|
| + | | 16kHz | Podcast | 173 |
| 短い説明 | タイメディアの音声 | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性143、男性502、不明26 |
|
| + | トルコトルコ | 48kHz | スクリプト化された独白 | 2,027 |
| 短い説明 | トルコトルコ | | データセットの説明 | 単一発話の録音は、通常5秒から30秒の範囲に収まる。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性 1561 男性 1241 不明 31 |
|
| + | ベトナム語 | 8kHz | 一般的な会話 | 295 |
| 短い説明 | ベトナム語一般会話データ | | データセットの説明 | 台本なしの合成電話会話。「エージェント」と「顧客」の間。音声の長さ(範囲)は約5~15分。北部(例:ハノイ)、中部、南部(例:ホーチミン市)。 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性400、男性380、不明2 |
|
| + | | 16kHz | Podcast | 257 |
| 短い説明 | ベトナムメディアの音声データ | | データセットの説明 | ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。 | | 音声チャンネル | Mono | | レコーディングプラットフォーム | ウェブソーシング | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性249、男性200、不明45 |
|
| + | ウェールズ語 (英語アクセント) | 8kHz | 一般的な会話 | 278 |
| 短い説明 | ウェールズ語一般会話データ | | データセットの説明 | 台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、 | | 音声チャンネル | デュアル | | レコーディングプラットフォーム | デスクトップ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 女性270、男性324、不明0 |
|
| + | イギリス英語 | 16kHz | ワードを起こす | 200スピーカー |
| 短い説明 | ウェイクワードUK英語 | | データセットの説明 | キーワードデータの収集
- 200スピーカー
- スピーカーごとに 4 つの固有のキーフレーズ
- 固有のキーフレーズごとに 25 ~ 30 の繰り返しキーフレーズの録音
- 一意のキーフレーズごとに 25 ~ 30 個のオーディオ ファイル
- 話者ごとに合計 120 の録音された発話
| | 音声チャンネル | 1チャンネル | | レコーディングプラットフォーム | モバイルアプリ | | WER(%) | 5.0 | | オーディオ形式 | wavファイル | | 音声文字変換フォーマット | .json | | Use Case | ASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング | | スピーカーの数 | 性別:男性50%、女性50%、±10%。 |
|