AI 向けの最も信頼できる音声データ収集サービス

音声および音声データ収集サービスを使用して、高品質の会話データを使用してNLPモデル、VA、TTSプロトタイプなどをトレーニングします

音声データ収集
事業国
0 +
の時間
音声データ
0 +
プロジェクト
0 +
言語 (100 以上の方言)
0 +

8 / 16 / 44 / 48 kHz

サンプリングレート

プロフェッショナルオーディオ/音声データ収集サービス

任意の主題。 任意のシナリオ。

Shaip の専門分野は、さまざまな AI/ML 要件に合わせて設計された高品質の音声データセットの作成です。幅広い言語を提供し、さまざまな設定で録音することで、データセットを包括的かつ適応性のあるものにしています。私たちは、可能な限り短時間で、最大量のカスタム音声データをモデルに取り込むことに重点を置いています。当社と協力することで、次のことが期待できます。 

スピーチコレクション
  • 精度向上のため、厳選された高品質の多言語オーディオ/音声データ
  • 多様なシナリオ設定をターゲットとする、可能な限り最高レベルのドメイン特異性
  • 多様な人口統計と業種に合わせてMLモデルをスケーリングする
  • 録音環境: スタジオ品質、 バックグラウンドノイズを最小限に抑えたクリアなオ​​ーディオを特徴とし、 自然環境、録音には環境音を組み込んで現実世界の状況を模倣します。

Tsunaguの専門領域

音声データを調整してよりスマートな NLP モデルを実現

Shaipは、100以上の言語でエンドツーエンドの音声/音声データ収集サービスを提供し、音声対応テクノロジーが世界中の多様なオーディエンスに対応できるようにします。 私たちはあらゆる範囲と規模のプロジェクトに取り組むことができます。 既存の既製のオーディオデータセットのライセンス供与から、カスタムオーディオデータ収集の管理、オーディオの文字起こしと注釈まで。 音声データ収集プロジェクトの規模に関係なく、方言、トーン、言語を対象とする高品質のNLPデータセットを構築するために、ニーズに合わせて音声収集サービスをカスタマイズできます。 音声対応のインテリジェントなセットアップのために、幅広い音声データセットと音声データ収集リソースから選択してください。

独白スピーチ

モノローグの台本と自発的なスピーチ

単一の話者からの音声を処理することに重点を置いています。スクリプト化されたプロンプトを利用して単一チャンネルのオーディオ ファイルにフィードし、その個人に特有のユニークな発話パターン、トーン、ニュアンスを確実にキャプチャします。

対話スピーチ

台本に沿った対話と自発的なスピーチ

2 人の対話。デュアルチャネル ファイルと文字起こしされたリソースを介して多言語で公開され、現実世界の会話や対話を再現します。

多者間の会話

グループ/複数パーティ
会話

複数人でのディスカッション、グループのダイナミクス、重複、さまざまな口調をキャプチャして、音声モデルを正確にトレーニングします。

ウェイクワード発話コレクション

ウェイクワード/キーフレーズ/発話コレクション

高度な自然言語処理と理解のために、多様で豊富な本物の発話を使用して、キー フレーズ、ウェイク ワード、または同様の意味を持つ発話を識別するように AI をトレーニングします。

音響音声

音響データ
収集

より広い音響範囲をカバーしながら、レストラン、オフィス、家庭など、さまざまな環境や言語からのスタジオ品質のオーディオ データを専門的に録音できます。

自動音声認識

自動音声認識(ASR)

さまざまな人口統計からの最先端の多様な音声/音声データセットにアクセスできるようにすることで、自動音声認識(ASR)システムの精度を向上させます。

自然言語の発話

多言語スピーチ/オーディオトレーニングデータ

世界中の当社の熟練した言語専門家が、さまざまな言語や方言の多言語音声/音声データを提供します。この取り組みは、グローバルなコミュニケーションを促進し、言語の壁を越え、より包括的で効果的な AI ソリューションに貢献します。

デジタル仮想アシスタント

テキストを音声に変換する
(TTS)

当社のグローバル従業員の支援を受けてテキスト読み上げ (TTS) 多言語モデルを構築します。従業員は 150 以上の言語と方言の音声データの収集を支援し、車載制御からチャットボットや学習ソリューションに至るまで AI モデルを高度な機能で強化します。高品質の音声データ。

コールセンターの録音

センターに電話
会話

スペイン語、ドイツ語、アメリカ英語、ベンガル語、日本語、中国語、ヒンディー語などの多数の言語をサポートする、エージェントとクライアント間の本物のやりとり。

導入事例

3 言語にわたる 8 時間を超えるデータを含む会話型 AI データセット

インドの言語向けの多言語プラットフォームの構築を検討していたこのクライアントは、Shaip と提携して、インドの複数の言語で大規模なデータセットを収集、セグメント化、転記しました。これは、クライアントの革新的な新しいプラットフォームを強化できる効果的な音声モデルの開発に役立ちます。

問題: 8つのインドの言語で収集された3,000時間以上の音声データを、自動音声認識の開発のためにセグメント化および文字起こしする。

解決策:データ収集、セグメンテーション、文字起こしを行い、メタデータ付きのJSONファイルを納品しました。クライアントの音声技術プロジェクトのために、8つのインド言語で3000時間分の音声データを大規模に収集しました。

音声データ収集の事例

信頼できる音声データ収集パートナーとしてShaipを選択する理由

のワークプ

のワークプ

専任の訓練を受けたチーム:

  • データ作成、ラベリング、QAのための30,000人以上の協力者
  • 資格のあるプロジェクト管理チーム
  • 経験豊富な製品開発チーム
  • タレントプールソーシング&オンボーディングチーム
プロセス

プロセス

最高のプロセス効率が保証されます:

  • 堅牢な6シックスシグマステージゲートプロセス
  • シックスシグマ黒帯の専任チーム–主要なプロセス所有者と品質コンプライアンス
  • 継続的改善とフィードバックループ
Platform

Platform

特許取得済みのプラットフォームには次のような利点があります。

  • Webベースのエンドツーエンドプラットフォーム
  • 非の打ちどころのない品質
  • より速いTAT
  • シームレスな配信

既成のスピーチ/オーディオデータセット

言語データセットサンプリング速度データセットのタイプ合計オーディオ時間
+アフリカ系アメリカ人の言語8kHzコールセンター211
短い説明アフリカ系アメリカ人の口語コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:612名、男性:1242名、不明:12名
+16kHzPodcast154
短い説明アフリカ系アメリカ人の日常言語メディアのデータ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:151名、男性:150名、不明:10名
+アフリカーンス語8kHz一般的な会話368
短い説明アフリカーンス語の一般的な会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(目安) - 15~60分、アフリカで話されているアフリカーンス語。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:502名、男性:390名、不明:2名
+16kHzPodcast658
短い説明アフリカーンス語メディアファイル
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:750名、男性:1278名、不明:52名
+アラビア語8kHz一般的な会話292
短い説明アラビア語一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)は約15~60分、湾岸諸国のアラビア語。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:171名、男性:534名、不明:1名
+48kHzスクリプト化された独白1,947
短い説明アラビア語の台本付きモノローグ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 838 男性 1209 不明 78
+アッサム語(開発中) コールセンター60
短い説明アッサム語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明アッサム語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明アッサム語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+ベンガル語(開発中) コールセンター60
短い説明ベンガル語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明ベンガル語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明ベンガル語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+ボストン英語8kHzコールセンター177
短い説明ボストンのコールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:605名、男性:711名、不明:0名
+8kHz一般的な会話32
短い説明ボストン総合病院の会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:53名、男性:83名、不明:0名
+16kHzPodcast93
短い説明ボストン・メディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:43名、男性:181名、不明:2名
+カナダのフランス語48kHzスクリプト化された独白1,222
短い説明カナダのフランス語
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 974 男性 631 不明 1
+中国語英語8kHzコールセンター169
短い説明中国のコールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:1790人、男性:523人、不明:13人
+16kHzPodcast249
短い説明中国メディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:126人、男性:346人、不明:6人
+中国語(簡体字)48kHzスクリプト化された独白2,762
短い説明中国語(簡体字)
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1920 男性 1535 不明 270
+中国語(繁体字)48kHzスクリプト化された独白1,028
短い説明中国語(繁体字)
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1069 男性 262 不明 3
+デンマーク語8kHz一般的な会話372
短い説明デンマーク語一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:311人、男性:417人、不明:0人
+16kHzPodcast664
短い説明デンマークのメディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性:369人、男性:864人、不明:27人
+48kHzスクリプト化された独白2,579
短い説明デンマーク語の台本付きモノローグ
データセットの説明デンマーク語の単一発話録音は、5秒から30秒の範囲に収まる傾向がある。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1551 男性 1233 不明 42
+イングリッシュディープサウス8kHzコールセンター151
短い説明英語圏南部のコールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性221、男性1004、不明7
+8kHz一般的な会話56
短い説明英語圏南部一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性99人、男性31人、不明0人
+16kHzPodcast266
短い説明英語 Deep South Media 音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性204人、男性356人、不明21人
+ドイツ語8kHzコールセンター64
短い説明ドイツのコールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルMono
レコーディングプラットフォームデスクトップ
WER(%)
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 478 男性 1440 不明 0
+8kHz IVR200
短い説明ドイツのIVRデータ
データセットの説明人間と機械の対話。音声合成(TTS)による音声ガイダンス(例:「どのようなご用件でしょうか?」)に続いて、人間の自然な応答が続くIVRタイプのフロー。
音声チャンネルMono
レコーディングプラットフォームデスクトップ
WER(%)
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 10115 男性 8750 不明 0
+グジャラート語(開発中) コールセンター60
短い説明グジャラート語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明グジャラート語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明グジャラート語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+ヘブライ語8kHz一般的な会話399
短い説明ヘブライ語一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(目安) - 15~60分、イスラエルでのヘブライ語会話。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性414、男性399、不明1
+16kHzPodcast427
短い説明ヘブライ語メディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性361、男性513、不明13
+ヒンディー語16kHzPodcast219
短い説明ヒンディー語メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性83、男性309、不明0
+48kHzスクリプト化された独白2,867
短い説明ヒンディー語の台本付きモノローグ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1977 男性 1864 不明 147
+ヒングリッシュ8kHzコールセンター208
短い説明ヒングリッシュ コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性822人、男性1262人、不明0人
+16kHzPodcast216
短い説明ヒングリッシュ メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性75人、男性380人、不明0人
+ヒスパニック英語8kHzコールセンター212
短い説明ヒスパニック系コールセンターのデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性822、男性1262、不明0
+16kHzPodcast155
短い説明ヒスパニックコールメディア音声
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性140、男性219、不明5
+インドネシア語8kHz一般的な会話496
短い説明インドネシア語一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(目安) - 15~60分、インドネシア語
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性524、男性454、不明2
+16kHzPodcast643
短い説明インドネシアのメディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性746、男性1507、不明129
+アイリッシュ8kHz一般的な会話192
短い説明アイルランド一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性213、男性153、不明0
+日本語48kHzスクリプト化された独白2,335
短い説明日本語の台本付きモノローグ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1460 男性 1221 不明 194
+カンナダ語版(開発中) コールセンター60
短い説明カンナダ語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明カンナダ語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明カンナダ語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+韓国語8kHzコールセンター107
短い説明韓国のコールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性1086名、男性210名、不明4名
+16kHzPodcast204
短い説明韓国メディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性70人、男性303人、不明25人
+48kHzスクリプト化された独白1,955
短い説明韓国語の台本付きモノローグ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1195 男性 1134 不明 122
+マレー語8kHz一般的な会話266
短い説明マレー語一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)は約15~60分、マレーシアのマレー語。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性316人、男性176人、不明0人
+16kHzPodcast344
短い説明マレー語メディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性236人、男性626人、不明47人
+マラヤーラム語(開発中) コールセンター60
短い説明マラヤーラム語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明マラヤーラム語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明マラヤーラム語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+マラーティー語(開発中) コールセンター60
短い説明マラーティー語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明マラーティー語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明マラーティー語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+スペイン語(メキシコ)48kHzスクリプト化された独白1,492
短い説明メキシコスペイン語の台本付きモノローグ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1016 男性 1069 不明 95
+オランダ語48kHzスクリプト化された独白1,205
短い説明オランダ語の台本付きモノローグ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1285 男性 531 不明 3
+ニューヨーク英語8kHzコールセンター103
短い説明ニューヨーク英語コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性610人、男性532人、不明0人
+8kHz一般的な会話107
短い説明ニューヨーク英語一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性118、男性114、不明0
+16kHzPodcast140
短い説明ニューヨーク・イングリッシュ・メディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性66、男性230、不明11
+ニュージーランド英語 8kHz一般的な会話148
短い説明ニュージーランド英語一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性167名、男性121名、不明4名
+16kHzPodcast400
短い説明ニュージーランド英語メディア音声
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性367名、男性678名、不明26名
+オリヤ語版(開発中) コールセンター60
短い説明オリヤー語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明オリヤー語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明オリヤ語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+ポーランド語16kHzPodcast269
短い説明ポーランド語メディア音声
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 173 男性 354 不明 6
+ポーランド語(ポーランド)48kHzスクリプト化された独白1,482
短い説明ポーランド語 - 台本付きモノローグ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1324 男性 701 不明 24
+パンジャブ語(開発中) コールセンター60
短い説明パンジャブ語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明パンジャブ語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明パンジャブ語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+ロシア語48kHzスクリプト化された独白2,398
短い説明ロシア語の台本付きモノローグ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1689 男性 1937 不明 214
+スコットランド語 (英語訛り)8kHz一般的な会話292
短い説明スコットランド一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性285、男性260、不明3
+シンガポール英語8kHzコールセンター218
短い説明シンガポールのコールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 2139 、男性 884 、不明 21
+16kHzPodcast247
短い説明シンガポールメディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性160、男性455、不明37
+南アフリカ英語8kHzコールセンター261
短い説明南アフリカ英語コールセンターのデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性1274、男性935、不明1
+16kHzPodcast251
短い説明南アフリカ英語メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性235、男性432、不明36
+スワヒリ語8kHzコールセンター230
短い説明スワヒリ語コールセンターのデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性611、男性833、不明0
+16kHzPodcast265
短い説明スワヒリ語メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性118、男性493、不明25
+スウェーデン語8kHzコールセンター250
短い説明スウェーデンのコールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性1581人、男性727人、不明2人
+16kHzPodcast278
短い説明スウェーデンメディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性195人、男性500人、不明21人
+タミル語版(開発中) コールセンター60
短い説明タミル語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話100
短い説明タミル語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast40
短い説明タミル語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+テルグ語8kHz一般的な会話553
短い説明テルグ語一般会話データ
データセットの説明台本なしの2人による電話での会話。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 574 、男性 564 、不明 0
+16kHzPodcast648
短い説明テルグ語メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性207、男性963、不明2
+テルグ語版(開発中) コールセンター30
短い説明テルグ語(開発中)コールセンターデータ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+一般的な会話50
短い説明テルグ語(開発中)一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+Podcast20
短い説明テルグ語(開発中)メディア音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネル
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数
+タイ語8kHz一般的な会話183
短い説明タイ語の日常会話
データセットの説明台本なしの二人の電話での会話。音声の長さ(範囲)は約15~60分。友人同士で使われるくだけた表現。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性338、男性96、不明8
+16kHzPodcast173
短い説明タイメディアの音声
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性143、男性502、不明26
+トルコトルコ48kHzスクリプト化された独白2,027
短い説明トルコトルコ
データセットの説明単一発話の録音は、通常5秒から30秒の範囲に収まる。
音声チャンネルMono
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性 1561 男性 1241 不明 31
+ベトナム語8kHz一般的な会話295
短い説明ベトナム語一般会話データ
データセットの説明台本なしの合成電話会話。「エージェント」と「顧客」の間。音声の長さ(範囲)は約5~15分。北部(例:ハノイ)、中部、南部(例:ホーチミン市)。
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性400、男性380、不明2
+16kHzPodcast257
短い説明ベトナムメディアの音声データ
データセットの説明ライセンス可能なパブリックドメインの音声/動画ファイル(インタビュー、ポッドキャストなど) - 1~5人。音声の長さ(範囲)はおよそ15~60分。
音声チャンネルMono
レコーディングプラットフォームウェブソーシング
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性249、男性200、不明45
+ウェールズ語 (英語アクセント)8kHz一般的な会話278
短い説明ウェールズ語一般会話データ
データセットの説明台本なしの合成電話会話、「エージェント」と「顧客」の間、音声の長さ(範囲)約5~15分、
音声チャンネルデュアル
レコーディングプラットフォームデスクトップ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数女性270、男性324、不明0
+イギリス英語16kHzワードを起こす200スピーカー
短い説明ウェイクワードUK英語
データセットの説明キーワードデータの収集
  • 200スピーカー
  • スピーカーごとに 4 つの固有のキーフレーズ
  • 固有のキーフレーズごとに 25 ~ 30 の繰り返しキーフレーズの録音
  • 一意のキーフレーズごとに 25 ~ 30 個のオーディオ ファイル
  • 話者ごとに合計 120 の録音された発話
音声チャンネル1チャンネル
レコーディングプラットフォームモバイルアプリ
WER(%)5.0
オーディオ形式wavファイル
音声文字変換フォーマット.json
Use CaseASR、仮想アシスタント、チャットボット、会話型AI、音声分析、TTS、言語モデリング
スピーカーの数性別:男性50%、女性50%、±10%。

提供されるサービス

エキスパートのテキストデータ収集は、包括的なAIセットアップのためのすべてのハンズオンデッキではありません。 Shaipでは、次のサービスを検討して、モデルを通常よりもはるかに普及させることもできます。

テキストデータ収集

テキストデータ収集サービス

Shaipコグニティブデータ収集サービスの真の価値は、非構造化データ内で見つかった重要な情報のロックを解除するための鍵を組織に提供することです。

画像データ収集

画像データ収集サービス

コンピュータビジョンモデルがすべての画像を正確に識別し、将来の次世代AIモデルをシームレスにトレーニングできるようにします

映像データ収集

ビデオデータ収集サービス

次に、オブジェクト、個人、抑止力、およびその他の視覚要素を完全に識別するためにモデルをトレーニングするために、NLPとともにコンピュータービジョンに焦点を合わせます。

注目のクライアント

チームが世界をリードするAI製品を構築できるようにします。

シャイプにお問い合わせください

独自のオーディオデータセットを構築したいですか?

社内の音声データ収集の専門家に連絡して、要件に最適なオーディオリポジトリを設定します

  • このフィールドは、検証目的のためであり、不変のままにする必要があります。
  • 登録することで、Shaipに同意します プライバシーポリシー (NAIST) と 利用規約 ShaipからB2Bマーケティングコミュニケーションを受け取ることに同意します。

ML モデルの音声データ収集とは、話し言葉の音声録音を収集するプロセスを指します。 このコレクションは、機械学習アルゴリズム、特に人間の声の理解と処理を中心としたアルゴリズムのトレーニングと洗練に役立ちます。

自動音声認識 (ASR) 用の音声データを収集することを目的とする場合は、必要な言語、アクセント、音声の種類など、プロジェクト固有のニーズを定義することから始める必要があります。 これらのパラメータを設定した後、ユーザーのプライバシーを尊重するために必要な権限をすべて取得していることを確認してください。 次に、適切な録音デバイスまたはソフトウェアを使用して、クリアなオ​​ーディオ サンプルをキャプチャします。 各録音には、その転写またはその他の関連メタデータを使用して細心の注意を払って注釈を付け、簡単にアクセスできるように体系的に保存する必要があります。

機械学習における音声データセットは、話し言葉の認識、文字起こし、解釈に合わせたモデルのトレーニング、テスト、検証にとって極めて重要です。 このようなデータセットは、音声アシスタントや文字起こしサービスから音声生体認証に至るまで、無数のアプリケーションへの道を開きます。

多様な言語やアクセントから正確なデータを収集するには、希望する言語的背景を持つネイティブ スピーカーとの協力が不可欠です。 幅広い人口統計上のニュアンスをカバーする、多様で代表的なサンプルを目指します。 音声の一貫性を確保するために、統一された環境で標準化された録音機器を使用します。 そして重要なのは、特定の言語とアクセントを示す詳細な文字起こしとメタデータで各データ部分に注釈を付けることです。