AIおよび機械学習プロジェクト向け匿名化電子医療記録(EHR)データセット

商用ライセンスを取得し、HIPAA(医療情報に関する法律)に準拠した電子カルテデータ。臨床AI、自然言語処理、予測モデリングにすぐに活用できます。

電子医療記録 (ehr) データ

EHRデータとは何か?そして、なぜAIにとって重要なのか?

AI/ML の EHR データセット

電子健康記録(EHR)は、病院、外来診療所、専門医の診療所、検査機関など、医療提供者がケアの全過程にわたって管理する、長期的なデジタル患者記録です。単一の医療提供者によるスナップショットである電子医療記録(EMR)とは異なり、EHRデータは患者の治療過程全体を網羅し、複数の医療現場におけるやり取りを記録します。

Shaipの匿名化された電子カルテデータカタログは、これら両方を網羅しており、医療AI開発のあらゆる分野において、コンプライアンスに準拠した単一の情報源をチームに提供します。

EHRデータセットには、AI開発にとって重要な2種類のデータが含まれています。構造化データ(人口統計情報、ICD-10診断コード、DRGコード、投薬リスト、検査値、バイタルサイン)と非構造化データ(臨床記録、退院サマリー、放射線レポート、医師の口述記録)です。EHR情報の約80%は非構造化データであり、臨床NLPモデルのトレーニングにおける主要な燃料となっています。

ヘルスケアAIに適した電子カルテ(EHR)データを見つける

最高水準のトレーニングデータで、機械学習モデルを最適化しましょう。Shaipは、AIおよび機械学習チーム向けに特別に設計された、市販の匿名化電子カルテ(EHR)データセットを提供しています。当社の既製EHRデータカタログは、20以上の医療専門分野にわたる構造化された研究用患者記録を提供します。診断、処方箋、検査結果、放射線レポート、予防接種履歴、臨床メモなど、すべてHIPAAセーフハーバーおよびGDPR基準に準拠した完全な匿名化処理が施されています。

臨床意思決定支援システムの構築、医師の診療記録に基づく自然言語処理モデルのトレーニング、疾患予測アルゴリズムの開発、あるいは医療自動化ツールの強化など、どのようなAIプロジェクトにおいても、ShaipのEHRデータセットは、プロジェクトに必要な深度、多様性、そしてコンプライアンスの保証を提供します。ライセンス取得、カスタムコホートの選択、サンプルダウンロードはすぐに可能です。

既製の電子健康記録(EHR):

  • 5.1の専門分野の31万以上のレコードと医師のオーディオファイル
  • 臨床NLPおよびその他のドキュメントAIモデルをトレーニングするための実際のゴールドスタンダードの医療記録
  • MRN(匿名化)、入院日、退院日、滞在日数、性別、患者クラス、支払人、財務クラス、州、退院処分、年齢、DRG、DRGの説明、$償還、AMLOS、GMLOS、リスクなどのメタデータ情報死亡率、病気の重症度、グルーパー、病院の郵便番号など。
  • 米国のさまざまな州および地域の医療記録-北東(46%)、南(9%)、中西部(3%)、西(28%)、その他(14%)
  • 対象となるすべての患者クラスに属する医療記録-入院患者、外来患者(臨床、リハビリ、定期的、外科的デイケア)、緊急事態。
  • 10歳未満(7.9%)、11〜20歳(5.7%)、21〜30歳(10.9%)、31〜40歳(11.7%)、41〜50歳(10.4%)のすべての患者年齢グループに属する医療記録)、51〜60歳(13.8%)、61〜70歳(16.1%)、71〜80歳(13.3%)、81〜90歳(7.8%)、90歳以上(2.4%)
  • 患者の性比は46%(男性)と54%(女性)
  • HIPAAに準拠したセーフハーバーガイドラインに準拠したPII編集済みドキュメント
場所別のEHRデータ
所在地 テキスト文書
北東 4,473,573
サウス 1,801,716
中西部 781,701
ウェスト 1,509,109
主要な診断カテゴリー別のEHRデータ
主な診断カテゴリー テキスト文書
アルコール/薬物使用およびアルコール/薬物誘発性の器質的精神障害48,717
すべてを含む合計(MDCカテゴリがある場合とない場合)8,566,687
払い戻しのないケースが生成されました(MDCは指定されていません)790,697
外来症例(MDCは指定されていません)1,980,606
3Mなどの特殊ハタを使用した場合(MDCは指定されていません)1,619,682
MDCとの合計4,175,702
アルコール/薬物の使用または誘発された精神障害48,717
バーンズ444
3,549
男性の生殖システム9,230
ヒト免疫不全ウイルス感染症12,422
骨髄増殖性疾患および障害、低分化新生物15,620
健康状態およびその他の医療サービスとの接触に影響を与える要因21,294
女性の生殖システム17,010
耳、鼻、口、喉22,987
複数の重大な外傷27,902
循環系589,730
血液、造血器官、免疫疾患48,990
薬物の怪我、中毒および毒性作用64,097
皮膚、皮下組織および乳房89,577
肝胆道系および膵臓127,172
内分泌、栄養および代謝性疾患および障害142,808
周産期に発生する状態の新生児およびその他の新生児163,605
妊娠、出産、産褥165,303
腎臓と尿路209,561
精神疾患および精神障害282,501
神経系316,243
消化器系346,369
筋骨格系と結合組織329,344
呼吸器系561,983
感染症および寄生虫症559,244

テキスト、オーディオ、ビデオ、画像など、あらゆる種類のデータライセンスを扱っています。 データセットは、MLの医療データセットで構成されています:医師の口述データセット、医師の臨床ノート、医療会話データセット、医療転写データセット、医師と患者の会話、医療テキストデータ、医療画像– CTスキャン、MRI、ウルトラサウンド(収集された基本カスタム要件) 。

AI/MLにおけるEHRデータセットの実世界応用

  • 病気の予測と診断: 糖尿病、がん、心血管疾患などの病気を予測する AI モデルをトレーニングします。
  • 臨床決定支援構造化された電子カルテデータを使用して、診断推奨事項を提示し、薬物相互作用を警告し、治療計画を支援するモデルをトレーニングする。
  • 個別化医療: 人口統計データと診断データを活用して、個人に合わせた治療計画を推奨します。
  • ヘルスケアの自動化: EHR データセットでトレーニングされた NLP ベースのツールを使用して、予約のスケジュール設定や請求などの管理タスクを自動化します。
  • 予測型ヘルスケアモデリング — 患者の長期記録、DRGコード、および疾患重症度スコアを使用して、リスク層別化モデルと疾患予測モデルを構築する。 
  • リアルワールドエビデンス(RWE)研究 ― 患者コホート全体にわたる電子カルテのアウトカムデータを分析することにより、市販後のエビデンスと医薬品安全性監視に関する知見を生成する。
  • 臨床記録のための自然言語処理 注釈付き電子カルテのトレーニングデータを使用して、非構造化された医師のメモや退院サマリーからエンティティ、状態、および手順を抽出する。

EHR データセットに Shaip を選択する理由

専門家の労働力

熟練した専門家が正確で高品質なデータ注釈を保証します。

企業コンプライアンス

HIPAA および GDPR に準拠した完全に匿名化されたデータセット。

競争力のある価格設定

品質を損なうことなくコスト効率の高いソリューションを提供します。

バイアスフリーデータ

厳格なプロトコルによりバイアスが排除され、信頼性の高い AI 結果が保証されます。

高速かつ正確

合理化されたプロセスにより、多様で高品質なデータの迅速な配信が保証されます。

可用性と配信

データ、サービス、ソリューションの高いネットワーク稼働時間とオンタイム配信。

大規模に実証済み

Googleや大手ヘルスケアAI企業から信頼されています。品質管理はシックスシグマブラックベルトのプロセスと医療専門家によるレビューによって行われています。

商業的に利用可能

Shaipの既製EHRカタログは、ライセンス取得済みで、個人情報が匿名化されており、本日よりDatabricks Marketplaceからダウンロードまたはアクセス可能です。

完全なライフサイクルサポート

生データに注釈が必要ですか?Shaipは、匿名化、臨床NERラベリング、データ拡張を単一のパートナーから提供します。

シャイプにお問い合わせください

探しているものが見つかりませんか?

新しい既製の医療データセットがすべてのデータタイプで収集されています 

ヘルスケアトレーニングデータ収集の心配を手放すために今すぐお問い合わせください

  • このフィールドは、検証目的のためであり、不変のままにする必要があります。
  • 登録することで、Shaipに同意します プライバシーポリシー (NAIST) と 利用規約 ShaipからB2Bマーケティングコミュニケーションを受け取ることに同意します。

EHR データセットは、病気の予測、臨床上の意思決定、個別化された治療のための AI モデルのトレーニングに使用されます。

EHR データは、臨床意思決定サポート、病気予測、個別治療計画、ヘルスケア自動化のための AI モデルのトレーニングに使用されます。

はい、すべての EHR データは、個人を特定できる情報 (PII) を削除し、プライバシー規制に準拠するために匿名化されています。

EHR データには、患者の人口統計、病歴、診断、治療計画、臨床検査結果、放射線画像(CT、MRI、X 線など)、処方箋、予防接種記録などの詳細が含まれます。

はい、データは HIPAA、GDPR、その他の世界的なプライバシー標準に準拠しており、安全で倫理的な使用が保証されます。

はい、データセットは、特定の医療専門分野、地域、患者の人口統計、またはプロジェクト要件に基づいてカスタマイズできます。

はい、データセットは標準形式(JSON、CSV など)で提供されるため、AI および ML ワークフローに簡単に統合できます。

データは、正確性、一貫性、信頼性を確保するために、厳格な検証と品質チェックを受けます。

費用はデータ量、カスタマイズ、プロジェクトの範囲などの要因によって異なります。最適なお見積りをご希望の場合は、「お問い合わせ」フォームにご要望をご記入ください。

納品スケジュールはプロジェクトの規模と複雑さによって異なりますが、合意された期限に間に合うように設計されています。

EHR データセットにより、AI システムはより優れた診断、予測的洞察、パーソナライズされた治療を提供できるようになり、患者の治療成果と医療の効率が向上します。

はい、Shaip は専門分野、年齢層、地域、またはプロジェクトの要件に基づいてカスタマイズされた EHR データセットを提供します。

電子カルテ(EMR)には単一の医療提供者からの臨床データが含まれますが、電子健康記録(EHR)は複数の医療提供者、医療機関、および期間にわたる医療プロセス全体を網羅します。Shaipは、EHRとEMRの両方のデータセットを提供しており、複雑なAIトレーニング要件に対応するため、複数の医療提供者による長期記録も利用可能です。

すべての記録は、HIPAAプライバシールールのセーフハーバー方式を用いて匿名化され、氏名、生年月日、住所、医療記録番号を含む18項目の個人健康情報(PHI)識別子がすべて削除されます。匿名化された医療記録番号(MRN)フィールドは、データセット内での記​​録連結のために保持され、再識別リスクなしに縦断的分析が可能になります。