機械学習のための医療およびヘルスケアデータセット
Shaip医療データカタログには何が含まれていますか?
Shaip医療データカタログは、HIPAA(医療情報保護法)に準拠した、すぐに利用できる匿名化医療トレーニングデータライブラリです。31の医療専門分野を網羅し、257,977時間分の医師による音声録音、文字起こしされた医療記録、電子カルテ、マルチモーダルデータセットなどが含まれています。各データセットは商用AIトレーニング用にライセンスされており、セーフハーバーまたは専門家による匿名化処理が施されています。
医師の口述音声データ
医療に関する当社の匿名化されたデータセットには、臨床現場での医師と患者の出会いに基づいて患者の臨床状態とケア計画を医師が説明した 31 の専門分野にわたる音声ファイルが含まれています。
既製の医師の口述オーディオファイル:
- 医療音声モデルのトレーニングに用いる、257,977の専門分野から集めた31時間分の実際の医師によるディクテーション音声データセット
- 電話ディクテーション(54.3%)、デジタルレコーダー(24.9%)、スピーチマイク(5.4%)、スマートフォン(2.7%)、不明(12.7%)などのさまざまなデバイスからキャプチャされたディクテーションオーディオ
- HIPAAに準拠したセーフハーバーガイドラインに準拠したPII編集済みオーディオおよびトランスクリプト
転写された医療記録
医療記録の転写とは、医師と患者の会話、医療報告書、医療評価の転写を指します。これは、患者の病歴を将来の診察に備えて記録するのに役立つだけでなく、医師にとっての参考資料としても機能します。患者の現在の状態を評価し、適切な治療を提案するのに役立ちます。
既製の転写された医療記録:
- ヘルスケアスピーチモデルをトレーニングするための257,977の専門分野からの31時間の実世界の医師の口述の転写
- 手術報告書、退院要約、診察記録、入院記録、ED記録、臨床記録、放射線報告などのさまざまな作業タイプからの転記された医療記録。
- HIPAAに準拠したセーフハーバーガイドラインに準拠したPII編集済みオーディオおよびトランスクリプト
電子健康記録(EHR)
電子健康記録またはEHRは、患者の病歴、診断、処方箋、治療計画、ワクチン接種または免疫化の日付、アレルギー、放射線画像(CTスキャン、MRI、X線)、および臨床検査などを含む医療記録です。
既製の電子健康記録(EHR):
- 5.1の専門分野の31万以上のレコードと医師のオーディオファイル
- 臨床NLPおよびその他のドキュメントAIモデルをトレーニングするための実際のゴールドスタンダードの医療記録
- MRN(匿名化)、入院日、退院日、滞在日数、性別、患者クラス、支払人、財務クラス、州、退院処分、年齢、DRG、DRGの説明、$償還、AMLOS、GMLOS、リスクなどのメタデータ情報死亡率、病気の重症度、グルーパー、病院の郵便番号など。
- 米国のさまざまな州および地域の医療記録-北東(46%)、南(9%)、中西部(3%)、西(28%)、その他(14%)
- 対象となるすべての患者クラスに属する医療記録-入院患者、外来患者(臨床、リハビリ、定期的、外科的デイケア)、緊急事態。
- 10歳未満(7.9%)、11〜20歳(5.7%)、21〜30歳(10.9%)、31〜40歳(11.7%)、41〜50歳(10.4%)のすべての患者年齢グループに属する医療記録)、51〜60歳(13.8%)、61〜70歳(16.1%)、71〜80歳(13.3%)、81〜90歳(7.8%)、90歳以上(2.4%)
- 患者の性比は46%(男性)と54%(女性)
- HIPAAに準拠したセーフハーバーガイドラインに準拠したPII編集済みドキュメント
購入者が ライセンス Shaip 縫い合わせるのではなく。
Shaip Medical Data Catalogが存在する理由は、ほとんどの医療AIチームが、単一のモデルをトレーニングする前に、準拠したトレーニングデータの収集に9~12ヶ月もの時間を費やしているからです。これらの時間が節約されることで、何が変わるのかを以下に説明します。
ほとんどのチームが太刀打ちできないカタログ規模。
Shaipのカタログには、257,977時間分の医師の音声録音、31の医療専門分野からの文字起こし、あらゆる年齢層の患者を網羅する電子カルテ記録が含まれており、購入者は多数のオープンデータセットをつなぎ合わせることなく、モデルのトレーニングと評価を行うことができます。
コンプライアンスは開始条件であり、機能ではない。
Shaipの医療データセットはすべて、デフォルトでHIPAAセーフハーバー準拠の匿名化処理が施されており、ご要望に応じて専門家による判定、GDPRに準拠した処理、および対象事業体向けのBAA対応機能が備わっています。購入者は事後的にコンプライアンス対応を行う必要はありません。
医療従事者としての訓練を受けた専門家であって、一般的なクラウドワーカーではない。
Shaip医療カタログにおける注釈付け、文字起こし、および品質保証は、医療従事者資格を持つ専門家によって行われます。Shaipのワークフローには、臨床精度基準に合わせて調整された多層的な品質保証とヒューマン・イン・ザ・ループ検証が含まれています。
既製品は本日、特注品はご要望に応じてご提供いたします。
購入者は、ベンダーを変更したり、コンプライアンス審査を再実行したりすることなく、既存のShaipデータセットをすぐにライセンス取得したり、特定の人口統計、地域、言語、および形式に合わせたカスタムコレクションを依頼したりできます。
データチームが既に活動している場所で利用可能です。
Shaipの匿名化された電子カルテ(EHR)および医師の音声入力データセットは、 Databricks Marketplaceで入手可能です。データおよび機械学習チームが既に利用しているJSON、CSV、WAV形式で提供されます。購入契約前にサンプルデータセットを入手できます。
セキュリティ&コンプライアンス
探しているものが見つかりませんか?
新しい既製の医療データセットがすべてのデータタイプで収集されています
ヘルスケアトレーニングデータ収集の心配を手放すために今すぐお問い合わせください
よくある質問(FAQ)
1. 医療データセットとは何ですか?
医療データセットとは、AI/MLモデルのトレーニング、評価、改善に使用される医療データのことです。これには、医師の音声入力データ、文字起こしされた医療記録、電子カルテ、合成された医師と患者の対話、関連するテキスト、音声、構造化された臨床データを組み合わせたマルチモーダル医療データセットなどが含まれます。
2. Shaip医療データカタログには何が含まれていますか?
Shaip医療データカタログには、医師の音声入力データ、文字起こしされた医療記録、電子カルテ、合成された医師と患者の対話、および患者または診察レベルでテキスト、音声、構造化された臨床データをリンクするマルチモーダルデータセットが含まれています。31の医療専門分野にわたる257,977時間分の医師の音声入力データが収録されており、商用AIトレーニングに利用可能です。
3. Shaipの医療データセットはHIPAAに準拠していますか?
はい。Shaipの医療データセットは、HIPAAセーフハーバーに基づき、デフォルトで匿名化されており、HIPAAプライバシールールで規定されている18種類の識別子が削除されます。統計的認証が必要な場合は、専門家による匿名化も利用可能で、Shaipは対象事業体向けのBAA(事業提携契約)に対応しています。
4. Shaipの医療データセットは、GDPRやその他の医療データ要件に対応できますか?
はい。Shaipの医療データセットは、プロジェクトの範囲、地域、データタイプ、契約要件に応じて、HIPAA、GDPR、およびその他の適用される医療データ要件をサポートするように準備できます。
5. 医療データセットは既製品として購入できますか、それとも収集する必要がありますか?
どちらのオプションも利用可能です。Shaipは、商用AIトレーニング向けに、Shaip医療データカタログを通じて既製の医療データセットを提供しています。プロジェクトで特定の言語、人口統計、専門分野、治療法、または臨床環境が必要な場合は、Shaipは同じコンプライアンス基準に基づいてカスタム医療データ収集を実施することも可能です。
6. Shaipの医療データセットはカスタマイズ可能ですか?
はい。Shaipは、専門分野、患者の年齢層、性別、地域、言語、モダリティ、臨床現場、フォーマット、データ量、プロジェクト要件などに基づいて、医療データセットをカスタマイズできます。カスタムデータセットは作業範囲記述書に基づいて作成され、適用される匿名化およびコンプライアンス基準に準拠します。
7. ライセンスを取得する前にサンプルデータセットを見ることはできますか?
はい。ShaipはNDA(秘密保持契約)に基づき代表的なサンプルデータセットを提供しており、AIチームはライセンス取得前にフォーマット、品質、対象人口統計、モデル適合性を評価できます。サンプルへのアクセスは通常、標準ライセンスまたはカスタムコレクションの契約前の最初のステップとなります。
8. Shaipはどのような形式で医療データセットを提供しますか?
Shaipは、構造化レコード用のJSON、CSV、FHIRなどのAI対応フォーマット、音声用のWAVファイルとそれに付随する文字起こし、音声および言語データセット用の文字起こしファイルなど、医療データセットをAI対応形式で提供します。マルチモーダルデータセットには、テキスト、音声、構造化臨床レコードをリンクするマニフェストファイルが含まれる場合があります。
9. Shaipはどのようにして医療データセットの品質を保証しているのですか?
Shaipは、専門家によるレビュー、ドメインスペシャリストによる注釈付け、検証ワークフロー、構造化された品質保証チェックを通じて、医療データセットの品質を保証します。これらのプロセスは、医療AI開発における正確性、信頼性、およびモデルの準備状況を確保するのに役立ちます。
10. Shaipの医療データセットは、大規模なAI/MLプロジェクトに対応できる拡張性がありますか?
はい。Shaipの医療データセットは、小規模なパイロットプロジェクトからエンタープライズ規模のAI/MLプロジェクトまで、あらゆる規模のプロジェクトに対応可能です。大量の医療記録、構造化された臨床データ、文字起こしデータ、あるいは数十万時間にも及ぶ医師の音声録音データを必要とするプロジェクトにも対応できます。
11. Shaipの医療データセットは、既存のAIモデルやワークフローに統合できますか?
はい。Shaipは、JSON、CSV、FHIR、WAV、トランスクリプトファイルなど、すぐに使用できる形式で医療データセットを提供します。これらの形式は、既存のAI、ML、NLP、音声認識、ヘルスケアLLM、マルチモーダルモデル開発ワークフローへの統合をサポートします。
12. Shaipの医療データセットを受け取るまでにはどれくらい時間がかかりますか?
既製の医療データセットは、通常、サンプルレビュー、契約締結、ライセンス取得完了後、数日以内に納品可能です。カスタム収集の納期は、プロジェクトの範囲、データセットのサイズ、モダリティ、コンプライアンス要件、複雑さによって異なり、作業範囲記述書に明記されます。
13. 医療データセットの費用はいくらですか?
医療データセットの費用は、データセットの種類、モダリティ、容量、カスタマイズ要件、ライセンス条件、納期、コンプライアンス要件によって異なります。チームは「お問い合わせ」フォームから要件を共有することで、個別の見積もりを受け取ることができます。
14. 医療データセットは、医療分野におけるAI/MLにとってなぜ重要なのでしょうか?
質の高い医療データセットは、正確で信頼性が高く、臨床的に有用な医療AIモデルを訓練するために不可欠です。これらは、医療文書作成、臨床自然言語処理、音声認識、要約、意思決定支援、自動化、患者ケアワークフロー、および医療データインテリジェンスの向上に役立ちます。