Avidentifierade elektroniska patientjournaler (EHR)-datauppsättningar för AI- och ML-projekt

Kommersiellt licensierade, HIPAA-kompatibla elektroniska patientjournaldata – redo för klinisk AI, NLP och prediktiv modellering.

Data från elektroniska journaler (ehr).

Vad är elektroniska patientjournaler och varför är det viktigt för AI?

EHR-dataset i AI/ML

Elektroniska patientjournaler (EHR) är longitudinella, digitala patientjournaler som upprätthålls av vårdgivare över hela vårdkedjan – sjukhus, öppenvårdsmottagningar, specialistmottagningar och laboratorier. Till skillnad från elektroniska patientjournaler (EMR), som är ögonblicksbilder från en enda vårdgivare, omfattar EHR-data hela patientens resa och fångar interaktioner mellan flera vårdmiljöer.

Shaips katalog över avidentifierade elektroniska patientjournaler täcker båda – vilket ger ditt team en enda, regelefterlevnadsklar källa för hela spektrumet av AI-utveckling inom hälso- och sjukvård.

EHR-datamängder innehåller två kritiska datatyper för AI-utveckling: strukturerad data (demografi, ICD-10-diagnoskoder, DRG-koder, medicinlistor, laboratorievärden, vitala tecken) och ostrukturerad data (kliniska anteckningar, utskrivningssammanfattningar, röntgenrapporter, läkares diktering). Cirka 80 % av EHR-informationen är ostrukturerad, vilket gör den till det primära bränslet för klinisk NLP-modellträning.

Hitta rätt EHR-data (Electronic Health Records) för din AI för din sjukvård

Förbättra era maskininlärningsmodeller med klassledande träningsdata. Shaip erbjuder kommersiellt tillgängliga, avidentifierade elektroniska patientjournaler (EHR) som är specifikt utformade för AI- och maskininlärningsteam. Vår färdiga EHR-datakatalog tillhandahåller strukturerade, forskningsklara patientjournaler över över 20 medicinska specialiteter – som täcker diagnoser, recept, laboratorieresultat, radiologirapporter, vaccinationshistorik och kliniska anteckningar – allt helt avidentifierat enligt HIPAA Safe Harbor- och GDPR-standarder.

Oavsett om du bygger kliniska beslutsstödssystem, tränar NLP-modeller på läkarjournaler, utvecklar algoritmer för sjukdomsförutsägelse eller driver verktyg för automatisering av hälso- och sjukvård, ger Shaips EHR-dataset dig det djup, den mångfald och den efterlevnadssäkring som ditt AI-projekt kräver. Tillgängliga för omedelbar licensiering, anpassat kohortval eller nedladdning av exempel.

Off-the-shelf Electronic Health Records (EHR):

  • 5.1M + registrerar och läkarens ljudfiler i 31 specialiteter
  • Verkliga journaler med guldstandard för att träna Clinical NLP och andra Document AI-modeller
  • Metadatainformation som MRN (Anonymiserad), Antagningsdatum, Utskrivningsdatum, Vistelsedagars längd, Kön, Patientklass, Betalare, Finansiell Klass, Stat, Utskrivningsdisposition, Ålder, DRG, DRG Beskrivning, $-ersättning, AMLOS, GMLOS, Risk för dödlighet, sjukdomens svårighetsgrad, Grouper, sjukhusets postnummer, etc.
  • Medicinska journaler från olika delstater och regioner i USA - North East (46%), South (9%), Mellanvästern (3%), West (28%), Övriga (14%)
  • Medicinska journaler som tillhör alla patientklasser som omfattas - slutenvård, öppenvård (klinisk, rehab, återkommande, kirurgisk dagvård), akut.
  • Medicinska journaler tillhörande alla patientåldersgrupper <10 år (7.9%), 11-20 år (5.7%), 21-30 år (10.9%), 31-40 år (11.7%), 41-50 år (10.4% ), 51-60 år (13.8%), 61-70 år (16.1%), 71-80 år (13.3%), 81-90 år (7.8%), 90+ år (2.4%)
  • Patienternas könsförhållande på 46 % (man) och 54 % (kvinna)
  • PII-redigerade dokument som följer Safe Harbor-riktlinjerna i enlighet med HIPAA
EHR-data efter plats
Plats Textdokument
Nordost 4,473,573
Söder 1,801,716
Mellanväst 781,701
väster 1,509,109
EHR-data efter större diagnoskategori
Huvuddiagnoskategori Textdokument
Användning av alkohol / droger och organiska psykiska störningar orsakade av alkohol / droger48,717
Totalt inklusive allt (ärenden med och utan MDC-kategori)8,566,687
Fall utan ersättning genereras (MDC anges inte)790,697
Öppenvårdsfall (MDC ej specificerat)1,980,606
Fodral som använder en specialgrupp som 3M (MDC ej specificerad)1,619,682
Totalt med MDC4,175,702
Alkohol/droganvändning eller inducerade psykiska störningar48,717
Burns444
Ögat3,549
Manligt reproduktionssystem9,230
Infektioner av humant immunbristvirus12,422
Myeloproliferativa sjukdomar och störningar, dåligt differentierade tumörer15,620
Faktorer som påverkar hälsostatus och andra kontakter med hälsovårdstjänster21,294
Fortplantningssystem för kvinnor17,010
Öra, näsa, mun och hals22,987
Flera betydande traumer27,902
Cirkulationssystemet589,730
Blod, blodbildande organ och immunologiska sjukdomar48,990
Skador, förgiftningar och toxiska effekter av droger64,097
Hud, subkutan vävnad och bröst89,577
Lever och gallvägar127,172
Endokrina, näringsmässiga och metabola sjukdomar och störningar142,808
Nyfödda och andra nyfödda med tillstånd som härrör från den perinatala perioden163,605
Graviditet, förlossning och Puerperium165,303
Njurar och urinvägar209,561
Psykiska sjukdomar och störningar282,501
Nervsystem316,243
Matsmältningssystemet346,369
Muskuloskeletala systemet och bindväv329,344
ANDNINGSVÄGAR561,983
Smittsamma och parasitära sjukdomar559,244

Vi hanterar alla typer av datalicenser, dvs. text, ljud, video eller bild. Datauppsättningarna består av medicinska datauppsättningar för ML: Läkardikteringsdatauppsättning, läkares kliniska anteckningar, medicinska konversationsdatauppsättningar, medicinska transkriptionsdatauppsättningar, läkare-patientsamtal, medicinska textdata, medicinska bilder – CT-skanning, MRI, ultraljud (insamlade grund anpassade krav) .

Verkliga tillämpningar av EHR-datauppsättningar inom AI/ML

  • Sjukdomsprediktion och diagnosTräna AI-modeller för att förutsäga sjukdomar som diabetes, cancer och hjärt-kärlsjukdomar.
  • Kliniskt beslutsstödTräna modeller för att identifiera diagnosrekommendationer, flagga läkemedelsinteraktioner och assistera vid behandlingsplanering med hjälp av strukturerad elektronisk patientjournal.
  • Personlig medicinAnvänd demografiska data och diagnosdata för att rekommendera personliga behandlingsplaner.
  • Hälso- och sjukvårdsautomationAutomatisera administrativa uppgifter som mötesbokning eller fakturering med NLP-drivna verktyg som är tränade på elektroniska patientjournaler.
  • Prediktiv hälsovårdsmodellering — Bygga riskstratifierings- och sjukdomsförutsägelsemodeller med hjälp av longitudinella patientjournaler, DRG-koder och sjukdomssvårighetsgradspoäng. 
  • Studier av verkliga bevis (RWE) — Generera bevis efter marknadsföring och insikter om läkemedelsövervakning genom att analysera EHR-utfallsdata från olika patientkohorter.
  • NLP för kliniska anteckningar — Extrahera enheter, tillstånd och procedurer från ostrukturerade läkaranteckningar och utskrivningssammanfattningar med hjälp av kommenterade elektroniska patientjournaler (EHR) utbildningsdata.

Varför välja Shaip för EHR-datauppsättningar?

Expert arbetskraft

Skickliga yrkesmän säkerställer noggrann och högkvalitativ dataannotering.

Regelefterlevnad

Helt avidentifierade datamängder som följer HIPAA och GDPR.

konkurrenskraftig prissättning

Kostnadseffektiva lösningar levererade utan att kompromissa med kvaliteten.

Biasfri data

Strikta protokoll eliminerar partiskhet och säkerställer tillförlitliga AI-resultat.

Snabb och exakt

Strömlinjeformade processer säkerställer snabb leverans av mångsidig, högkvalitativ data.

Tillgänglighet & leverans

Hög nätverksupptid och leverans i tid av data, tjänster och lösningar.

Bevisad i stor skala

Betrott av Google och ledande AI-företag inom hälso- och sjukvård. Kvalitetskontrollerad genom 6 Sigma Black Belt-processer och medicinsk expertgranskning.

Kommersiellt redo

Shaips färdiga EHR-katalog är licensierad, avidentifierad och redo att laddas ner eller nås via Databricks Marketplace idag.

Fullständig livscykelstöd

Behöver du annoteringar ovanpå rådata? Shaip tillhandahåller avidentifiering, klinisk NER-märkning och datautökning från en enda partner.

Shaip kontakta oss

Hittar du inte det du letar efter?

Nya medicinska datauppsättningar från hyllan samlas in för alla datatyper 

Kontakta oss nu för att släppa dina bekymmer för insamling av data för hälsoträning

  • Detta fält är för validering och bör lämnas oförändrad.
  • Genom att registrera mig godkänner jag Shaip Integritetspolicy och Användarvillkor och ge mitt samtycke till att ta emot B2B marknadsföringskommunikation från Shaip.

EHR-datamängder används för att träna AI-modeller för sjukdomsförutsägelse, kliniskt beslutsfattande och personliga behandlingar.

EHR-data används för att träna AI-modeller för kliniskt beslutsstöd, sjukdomsförutsägelse, personlig behandlingsplanering och automatisering av hälso- och sjukvården.

Ja, all EHR-data avidentifieras för att ta bort personligt identifierbar information (PII) och följa integritetsreglerna.

EHR-data innehåller detaljer som patientdemografi, sjukdomshistoria, diagnoser, behandlingsplaner, laboratorietestresultat, röntgenbilder (t.ex. datortomografi, magnetkameraundersökning, röntgen), recept och vaccinationsjournaler.

Ja, informationen följer HIPAA, GDPR och andra globala integritetsstandarder för att säkerställa säker och etisk användning.

Ja, datamängder kan skräddarsys baserat på specifika medicinska specialiteter, regioner, patientdemografi eller projektkrav.

Ja, datamängderna tillhandahålls i standardformat (t.ex. JSON, CSV) för enkel integration i AI- och ML-arbetsflöden.

Data genomgår rigorösa validerings- och kvalitetskontroller för att säkerställa noggrannhet, konsekvens och tillförlitlighet.

Kostnaderna beror på faktorer som datavolym, anpassning och projektets omfattning. Vi ber dig att fylla i formuläret "Kontakta oss" med dina önskemål för att få den bästa offerten.

Leveranstider varierar beroende på projektets storlek och komplexitet men är utformade för att uppfylla överenskomna deadlines.

EHR-datauppsättningar gör det möjligt för AI-system att ge bättre diagnostik, prediktiva insikter och personlig behandling, vilket förbättrar patientresultat och vårdeffektivitet.

Ja, Shaip erbjuder skräddarsydda EHR-datauppsättningar baserade på specialitet, åldersgrupp, geografi eller projektkrav.

Elektroniska patientjournaler (EMR) innehåller kliniska data från en enda vårdgivare; elektroniska patientjournaler (EHR) spänner över hela vårdprocessen över flera vårdgivare, miljöer och tidsperioder. Shaip tillhandahåller både EHR- och EMR-datasetvarianter, med longitudinella journaler från flera vårdgivare tillgängliga för komplexa AI-utbildningskrav.

Alla register avidentifieras med hjälp av HIPAA:s Safe Harbor-metod – där alla 18 PHI-identifierare, inklusive namn, födelsedatum, adress och journalnummer, tas bort. Det anonymiserade MRN-fältet behålls för registerkoppling inom datasetet, vilket möjliggör longitudinell analys utan risk för återidentifiering.