音声データセット

ヒンディー語データセット

हिंदीडेटासेट

AIおよびASRモデル向けの高品質なヒンディー語コールセンター、一般会話、ポッドキャストデータセット

ヒンディー語データセット

概要

  • 言語ヒンディー語
  • データセットの種類コールセンター、一般会話、ポッドキャスト、台本付きモノローグ、TTS
  • India

詳細説明

2人による15分から60分までの台本のない電話会話に加え、同じ時間帯の1人から5人までの参加者によるインタビューやポッドキャストなど、ライセンス可能なパブリックドメインの音声・動画ファイルもご利用いただけます。さらに、単一発話の録音は通常5秒から30秒で、台本付きの独白データもご利用いただけます。

データセットのハイライト

  • 言語ヒンディー語
  • サンプリング速度16 kHz / 24 kHz / 48 kHz / 8 kHz
  • 合計時間52642:16:44
  • スピーカー6,111件以上
  • チャネルデュアル/モノラル
  • 期間範囲15~60分

適用例

  • ASR(自動音声認識)
  • バーチャルアシスタントとチャットボット
  • 会話型AI
  • 音声分析
  • TTS (テキスト読み上げ)
  • 言語モデル

サンプルデータセットの仕様

データセットのタイプセンターに電話センターに電話センターに電話センターに電話一般的な会話メディアデータスクリプト化された独白スクリプト化された独白
サンプリング・レート8kHz8kHz16kHz16kHz8kHz16kHz48kHz24kHz
スピーカー2スピーカー2スピーカー2スピーカー2スピーカー2スピーカー複数のスピーカーシングルスピーカーシングルスピーカー
チャネルデュアルMonoMonoデュアルデュアルMonoMonoMono
合計時間70:45:5120,000:00:0029:17:20400:27:1047:48:40227:57:432,866:00:0029,000:00:00
講演者総数要求に応じて要求に応じて26112002244383,988要求に応じて

主なメリット

  • 多様性と代表性包括的で実践的なAIに関する幅広い講演者による解説。
  • 高品質のオーディオモデルの性能を確実に引き出すために、クリアでバランスの取れた録音を実現します。
  • AI/ML対応準備完了シームレスな統合のために、構造化され、注釈が付けられています。
  • 柔軟かつ拡張性のあるサービス設計お客様のニーズに合わせて、複数の期間、講演者、分野をご用意しています。

注目のクライアント

世界中の主要なAIチームや企業から信頼されています。

  • Microsoft
  • Amazon Webサービス
  • グーグル

探しているものが見つかりませんか?

新しい既製のデータセットがすべてのデータ タイプにわたって収集されています

オーディオ/スピーチトレーニングデータ収集の心配を手放すために今すぐお問い合わせください

  • このフィールドは、検証目的のためであり、不変のままにする必要があります。
  • 登録することで、Shaipに同意します プライバシーポリシー (NAIST) と 利用規約 ShaipからB2Bマーケティングコミュニケーションを受け取ることに同意します。