音声データセット

中国のデータセット

简体中文データ集

AIおよび音声モデル向けの高品質中国語データセット

中国のデータセット

概要

  • 言語中国語
  • データセットの種類コールセンター、ポッドキャスト、台本付きモノローグ、歌唱音声

詳細説明

このデータセットには、台本のない合成エージェントと顧客の電話での会話(5〜15分)、自然な人間同士の電話での会話(15〜60分)、および書き起こし付きの歌の音声が含まれており、音声および言語技術のトレーニングと評価のための多様な音声データを提供します。

データセットのハイライト

  • 言語中国語
  • サンプリング速度16kHz/48kHz/8kHz
  • 合計時間4970:30:18
  • スピーカー10,196件以上
  • チャネルモノラル/デュアル
  • 期間範囲5~60分

適用例

  • ASR(自動音声認識)
  • バーチャルアシスタントとチャットボット
  • 会話型AI
  • 音声分析
  • TTS (テキスト読み上げ)
  • 言語モデル

サンプルデータセットの仕様

データセットのタイプ音楽スクリプト化された独白メディアデータスクリプト化された独白センターに電話メディアデータ
サンプリング・レート48kHz48kHz16kHz48kHz8kHz16kHz
スピーカーシングルスピーカーシングルスピーカー複数のスピーカーシングルスピーカー2スピーカー複数のスピーカー
チャネルMonoMonoMonoMonoデュアルMono
合計時間06:11:321,499:00:00306:04:582,761:00:00152:18:33245:55:15
講演者総数101,8052,1303,7252,058468

主なメリット

  • 多様性と代表性包括的で実践的なAIに関する幅広い講演者による解説。
  • 高品質のオーディオモデルの性能を確実に引き出すために、クリアでバランスの取れた録音を実現します。
  • AI/ML対応準備完了シームレスな統合のために、構造化され、注釈が付けられています。
  • 柔軟かつ拡張性のあるサービス設計お客様のニーズに合わせて、複数の期間、講演者、分野をご用意しています。

注目のクライアント

世界中の主要なAIチームや企業から信頼されています。

  • Microsoft
  • Amazon Webサービス
  • グーグル

探しているものが見つかりませんか?

新しい既製のデータセットがすべてのデータ タイプにわたって収集されています

オーディオ/スピーチトレーニングデータ収集の心配を手放すために今すぐお問い合わせください

  • このフィールドは、検証目的のためであり、不変のままにする必要があります。
  • 登録することで、Shaipに同意します プライバシーポリシー (NAIST) と 利用規約 ShaipからB2Bマーケティングコミュニケーションを受け取ることに同意します。