多言語のデジタルアシスタントをトレーニングするために、22k時間以上の音声データが収集および転記されました。
米国ケンタッキー州ルイビル、2022年8月1日: Shaipは、2万2千時間以上の音声データを持つアメリカの多国籍コンピュータ技術企業が、世界中の13以上の言語で多言語対応デジタルアシスタントをトレーニングできるように支援しました。
7kHzの周波数のさまざまな録音環境で、年齢、性別、教育、方言ごとに話者の健全な組み合わせを確保しながら、30秒以下の16万を超える発話が収集され、文字起こしされ、XNUMXか月未満で配信されました。
ShaipのCEOであるヴァツァル・ギヤ氏は、 「Shaipは対話型AIプロジェクトのリーダー企業です。当社は、フォーチュン500企業を含む多くの企業が求める自然言語処理(NLP)データのニーズに対応してきました。当社はクライアントと共通のビジョンを共有し、将来的に重要な課題を解決する最高水準のデータを用いて、ソリューションの改善を支援してきました。」と述べています。
彼はさらに、「発話トレーニングの必要性は、すべての顧客がスクリプト形式で音声アシスタントと対話したり質問したりするときに同じ単語やフレーズを使用するわけではないという事実から生じます。 そのため、特定の音声アプリケーションを自発的な音声データでトレーニングする必要があります。 例:「最寄りの病院はどこにありますか?」 「近くの病院を探す」または「近くに病院はありますか?」 すべて同じ検索意図を示していますが、言い回しが異なります。 Shaipは、実際のシナリオで人々が音声アシスタントと対話する方法で、発話を識別して明確にするのに役立ちます。」
Shaipの作業範囲には、音声認識用の大量のオーディオトレーニングデータの取得、複数の言語でのオーディオ録音の転写、メタデータを含む対応するJSONファイルの配信が含まれますが、これらに限定されません。 Shaipは、複雑なプロジェクトのMLモデルのトレーニングに必要なレベルの品質を維持しながら、大規模な発話を収集できます。
Shaipについて
ケンタッキー州ルイビルに本社を置くShaipは、最も高度なAI課題の解決を目指す企業向けに設計された、完全マネージド型のデータプラットフォームです。よりスマートで、より速く、より優れた成果を実現します。Shaipは、データ収集、ライセンス取得、ラベル付け、文字起こし、匿名化など、AIトレーニングデータのあらゆる側面をサポートし、人材、プラットフォーム、プロセスをシームレスに拡張することで、企業のAIおよび機械学習モデルの開発を支援します。データサイエンスチームとリーダーの業務をより効率的にする方法については、www.shaip.comをご覧ください。
メディア連絡先
アヌバブサラフ
シニアマネージャー–マーケティング
866-426-9412
マーケティング@shaip.com
12806 Townepark Way、Louisville、KY 40243-2311
出典: Shaip