કેસ સ્ટડી: મેડિકલ ડેટાસેટ લાઇસન્સિંગ
પ્રિસિઝન ડેટા ક્યુરેશન અને એનોટેશન તાલીમ દ્વારા બાળરોગ અને OB-GYN સંભાળમાં પરિવર્તન
તબીબી ડેટાની શક્તિને અનલોક કરવી: વ્યાપક ડેટા ક્યુરેશન, ડી-ઓળખ, ICD-10 CM, અને સુપિરિયર AI મોડેલ તાલીમ માટે ટીકા.
પ્રોજેક્ટ ઓવરવ્યૂ
અદ્યતન NLP મોડેલોને તાલીમ આપવા માટે ઉચ્ચ-ગુણવત્તાવાળા, ઓળખ ન કરાયેલા તબીબી ડેટાસેટ્સનું ક્યુરેટ અને એનોટેટ કરવા માટે શેપે એક અગ્રણી આરોગ્યસંભાળ AI કંપની સાથે ભાગીદારી કરી. આ પ્રોજેક્ટ બાળરોગ અને OB-GYN વિશેષતાઓ પર ધ્યાન કેન્દ્રિત કરે છે, એક મજબૂત API ફ્રેમવર્ક દ્વારા ICD-10 CM કોડ્સ સાથે એનોટેટ કરેલા આઉટપેશન્ટ રેકોર્ડ્સ પહોંચાડે છે.
ડેટાસેટ વાસ્તવિક દુનિયાના આરોગ્યસંભાળ દસ્તાવેજીકરણ પર AI તાલીમને સરળ બનાવવા માટે રચાયેલ છે, જે ક્લિનિકલ વર્ણનોને સમજવામાં મોડેલ ક્ષમતામાં વધારો કરે છે.
કી આંકડા
૭૫૦ પાના / ~૩૦૦ આઉટપેશન્ટ રેકોર્ડ્સ
૩૭૫ પાના બાળરોગ
૩૭૫ પાના OB-GYN
ICD-10 CM 2023 મેડિકલ કોડ એનોટેશન
પરિયોજના દર્શન
| ડેટાસેટ પ્રકાર | વિશેષતા | વોલ્યુમ | મેટાડેટા કેપ્ચર કર્યો | નોંધો |
|---|---|---|---|---|
| તબીબી નોંધો | બાળરોગ | ૩૭૫ પાનાં (~૧૫૦ રેકોર્ડ) |
ફાઇલનું નામ, વિશેષતા, દસ્તાવેજ પ્રકાર, દર્દી વર્ગ (બહારના દર્દીઓ) |
આકારણી / યોજના વિભાગોનો સમાવેશ થાય છે |
| OB-GYN | ૩૭૫ પાનાં (~૧૫૦ રેકોર્ડ) | |||
| ટીકાઓ | ICD-10 CM (2023) | સંપૂર્ણ ડેટાસેટ | API દ્વારા કોડ મેપિંગ | કોડર્સ દ્વારા કોડ માન્યતા અવકાશની બહાર છે |
પડકારો
આ પ્રોજેક્ટમાં ઘણા મહત્વપૂર્ણ પડકારો હતા જેના માટે કાળજીપૂર્વક આયોજન અને અમલીકરણની જરૂર હતી:
૧. વિશેષતા-વિશિષ્ટ ડેટા સંગ્રહ
બાળરોગ અને પ્રસૂતિ-સ્ત્રીરોગ વિશેષતાઓમાંથી ઉચ્ચ-ગુણવત્તાવાળા આઉટપેશન્ટ રેકોર્ડ્સ મેળવવાનું પડકારજનક હતું. દરેક દસ્તાવેજમાં સચોટ ટીકાઓને સમર્થન આપવા માટે મૂલ્યાંકન અને યોજના જેવા મુખ્ય ક્લિનિકલ વિભાગોનો સમાવેશ કરવો જરૂરી હતો.
2. વ્યાપક PHI ઓળખ રદ કરવી
HIPAA પાલન માટે તબીબી સંદર્ભ જાળવી રાખીને તમામ વ્યક્તિગત રીતે ઓળખી શકાય તેવી માહિતી (PII) ને સંપૂર્ણપણે દૂર કરવી જરૂરી હતી. કોઈપણ ગોપનીયતા ભંગને રોકવા માટે આ માટે વિગતવાર સમીક્ષાઓની જરૂર હતી.
3. જટિલ ICD-10 CM એનોટેશન
વિવિધ વર્ણનાત્મક શૈલીઓ અને તબીબી પરિભાષાને કારણે API દ્વારા ચોક્કસ ICD-10 CM (2023) કોડ્સ લાગુ કરવાનું જટિલ હતું. વિશ્વસનીય AI મોડેલ તાલીમ સુનિશ્ચિત કરવા માટે કોડિંગમાં સુસંગતતા અને ચોકસાઈ મહત્વપૂર્ણ હતી.
૪. મેટાડેટા ચોકસાઈ અને સુસંગતતા
વિશેષતા, દસ્તાવેજ પ્રકાર અને દર્દી વર્ગ જેવા મેટાડેટાને વિસંગતતા વિના કેપ્ચર અને માન્ય કરવા ખૂબ જ મહત્વપૂર્ણ હતા. કોઈપણ મેળ ખાતી ન હોય તો મોડેલ તાલીમ અને ડેટા ઉપયોગીતાને અસર થઈ શકે છે.
૫. કડક આઉટપેશન્ટ ફિલ્ટરિંગ
ખાતરી કરવી કે બધા રેકોર્ડ્સ કડક રીતે બહારના દર્દીઓમાં જટિલતા ઉમેરે છે, કારણ કે ઘણા ક્લિનિકલ દસ્તાવેજોમાં મિશ્ર દર્દી વર્ગો અથવા અપૂર્ણ વિભાગો હોઈ શકે છે.
૬. ગુણવત્તા ખાતરી અને ચોકસાઈ ધોરણો
90% ચોકસાઈ થ્રેશોલ્ડને પૂર્ણ કરવા માટે ડુપ્લિકેટ્સ દૂર કરવા, વિશેષતા સંરેખણને માન્ય કરવા અને ઓળખ રદ કરવાની ખાતરી કરવા માટે બહુ-સ્તરીય સમીક્ષાઓની જરૂર હતી - જ્યારે જરૂર પડે ત્યારે ફરીથી કાર્ય કરવાની જોગવાઈઓ સાથે.
ઉકેલ
વ્યાપક ડેટા લાઇસન્સિંગ અને ટીકા
- લાઇસન્સ પ્રાપ્ત બાળરોગ અને OB-GYN આઉટપેશન્ટ રેકોર્ડ્સ
- મહત્વપૂર્ણ વિભાગોનો સમાવેશ સુનિશ્ચિત: મુખ્ય ફરિયાદ, ઇતિહાસ, ROS, આકારણી, યોજના
- API-આધારિત ICD-10 CM એનોટેશન (2023 સંસ્કરણ)
ઓળખ રદ કરવી અને પાલન
- PHI ને પ્લેસહોલ્ડર (PERSON_NAME, DATE, LOCATION, વગેરે) થી બદલ્યું.
- આરોગ્યસંભાળ ડેટા ગોપનીયતા ધોરણોનું પાલન સુનિશ્ચિત કરવું
મેટાડેટા ટેગિંગ
- ફાઇલ દીઠ વિગતવાર મેટાડેટા કેપ્ચર કર્યો:
-
- ફાઇલ નામ
- વિશેષતા (બાળરોગ અથવા OB-GYN)
- દસ્તાવેજ પ્રકાર (ફોલો-અપ, H&P, પરામર્શ)
- દર્દી વર્ગ (ફક્ત બહારના દર્દીઓ માટે)
ગુણવત્તા નિયંત્રણ
- આ સાથે સખત ગુણવત્તા મૂલ્યાંકન:
- કોઈ ડુપ્લિકેટ રેકોર્ડ નથી
- સ્પેશિયાલિટી મેચ માન્યતા
- ફક્ત બહારના દર્દીઓ માટે તપાસ
- મેટાડેટા સુસંગતતા તપાસ
- 90% ચોકસાઈ થ્રેશોલ્ડથી નીચેના રેકોર્ડની ફેરબદલી અથવા સુધારો
પરિણામ
શેપે એક સંરચિત, ટીકાયુક્ત તબીબી નોંધોનો ડેટાસેટ પહોંચાડ્યો જેણે ક્લાયન્ટને આ કરવાની મંજૂરી આપી:
- સચોટ ICD-10 CM કોડ આગાહી માટે AI મોડેલ્સને તાલીમ આપો
- વાસ્તવિક દુનિયાના આરોગ્યસંભાળના દૃશ્યોમાં NLP ક્ષમતાઓમાં વધારો
- ગોપનીયતા અને નિયમનકારી ધોરણોનું પાલન જાળવો
- બાળરોગ અને OB-GYN ડોમેન્સમાં હેલ્થકેર AI મોડેલ્સનું સ્તરીકરણ કરો
ડેટાસેટ ક્યુરેશન અને એનોટેશન માટે શેપનો માળખાગત અભિગમ અમારી અપેક્ષાઓ કરતાં વધુ સારો હતો. ચોકસાઈ, ઓળખાણ રદ કરવા અને મેટાડેટા ચોકસાઇએ અમારી AI મોડેલ તાલીમ પાઇપલાઇનને નોંધપાત્ર રીતે મજબૂત બનાવી છે.