કેસ સ્ટડી: ઓટોમેટિક સ્પીચ રેકગ્નિશન
૮,૦૦૦ થી વધુ ઓડિયો કલાક એકત્રિત, ૮૦૦ કલાક બહુભાષી અવાજ ટેકનોલોજી માટે ટ્રાન્સક્રાઇબ કર્યા
પરિચય
ભારતને એક એવા પ્લેટફોર્મની જરૂર હતી જે ભારતીય ભાષાઓમાં ડિજિટલ સેવાઓ પૂરી પાડવા માટે બહુભાષી ડેટાસેટ્સ અને AI-આધારિત ભાષા ટેકનોલોજી સોલ્યુશન્સ બનાવવા પર ધ્યાન કેન્દ્રિત કરે. આ પહેલ શરૂ કરવા માટે, ધ ક્લાયન્ટે બહુભાષી ભાષણ મોડેલ બનાવવા માટે ભારતીય ભાષા એકત્રિત કરવા અને તેનું ટ્રાન્સક્રાઇબ કરવા માટે Shaip સાથે ભાગીદારી કરી.
વોલ્યુમ
પડકારો
ભારતીય ભાષાઓ માટે સ્પીચ ટેકનોલોજી સ્પીચ રોડમેપમાં ક્લાયન્ટને મદદ કરવા માટે, ટીમને AI મોડેલ બનાવવા માટે મોટા પ્રમાણમાં તાલીમ ડેટા મેળવવા, વિભાજીત કરવા અને ટ્રાન્સક્રાઇબ કરવાની જરૂર હતી. ક્લાયન્ટની મહત્વપૂર્ણ જરૂરિયાતો આ હતી:
માહિતી સંગ્રહ
- ભારતના દૂરના સ્થળોએથી 8000 કલાકનો તાલીમ ડેટા મેળવો
- 20-70 વર્ષના વય જૂથોમાંથી સ્વયંભૂ ભાષણ એકત્રિત કરવા માટે સપ્લાયર
- ઉંમર, લિંગ, શિક્ષણ અને બોલીઓ દ્વારા વક્તાઓનું વૈવિધ્યસભર મિશ્રણ સુનિશ્ચિત કરો.
- દરેક ઓડિયો રેકોર્ડિંગ ઓછામાં ઓછું ૧૬ કિલોહર્ટ્ઝનું હોવું જોઈએ અને ૧૬ બિટ્સ/સેમ્પલ હોવું જોઈએ.
ડેટા ટ્રાન્સક્રિપ્શન
અક્ષરો અને વિશેષ પ્રતીકો, જોડણી અને વ્યાકરણ, મૂડીકરણ, સંક્ષેપ, સંકોચન, વ્યક્તિગત બોલાતા અક્ષરો, સંખ્યાઓ, વિરામચિહ્નો, સંક્ષિપ્ત શબ્દો અને શરૂઆત, અસ્પષ્ટ વાણી, અસ્પષ્ટ વાણી, બિન-લક્ષ્ય ભાષાઓ, બિન-વાણીની આસપાસ વિગતવાર ટ્રાન્સક્રિપ્શન માર્ગદર્શિકા અનુસરો.
ગુણવત્તા તપાસ અને પ્રતિસાદ
બધા રેકોર્ડિંગ્સ ગુણવત્તા મૂલ્યાંકન અને માન્યતામાંથી પસાર થશે, ફક્ત માન્ય ભાષણ રેકોર્ડિંગ્સ જ વિતરિત કરવામાં આવશે.
ઉકેલ
વાતચીતના AI ની અમારી ઊંડી સમજણ સાથે, અમે ભારતના દૂરના ભાગોમાંથી ઓડિયો ડેટાનો મોટો સંગ્રહ બનાવવા માટે નિષ્ણાત કલેક્ટર્સ, ભાષાશાસ્ત્રીઓ અને ટીકાકારોની ટીમ સાથે ક્લાયન્ટને ઓડિયો ડેટા એકત્રિત કરવામાં, ટ્રાન્સક્રાઇબ કરવામાં મદદ કરી.
શૈપના કાર્યક્ષેત્રમાં મોટા પ્રમાણમાં ઑડિઓ તાલીમ ડેટા મેળવવા, ડેટાનું ટ્રાન્સક્રિપ્શન કરવા અને મેટાડેટા ધરાવતી અનુરૂપ JSON ફાઇલો પહોંચાડવાનો સમાવેશ થાય છે પરંતુ તે પૂરતો મર્યાદિત નહોતો [સ્પીકર્સ અને ટ્રાન્સક્રિબર્સ બંને માટે]. દરેક વક્તા માટે, મેટાડેટામાં એક અનામી સ્પીકર ID, ઉપકરણ વિગતો, લિંગ, ઉંમર અને શિક્ષણ જેવી વસ્તી વિષયક માહિતી, તેમનો પિનકોડ, સામાજિક-આર્થિક સ્થિતિ, બોલાતી ભાષાઓ અને તેમના જીવનકાળના રોકાણના સમયગાળાનો રેકોર્ડ શામેલ છે. દરેક ટ્રાન્સક્રિબર માટે, ડેટામાં એક અનામી ટ્રાન્સક્રિબર ID, વક્તાઓ જેવી જ વસ્તી વિષયક વિગતો, તેમના ટ્રાન્સક્રિપ્શન અનુભવનો સમયગાળો અને તેઓ વાંચી, લખી અને બોલી શકે તેવી ભાષાઓનું સંપૂર્ણ વિભાજન શામેલ છે.
શૈપે ૮૦૦૦ કલાકનો ઑડિયો ડેટા / સ્વયંભૂ ભાષણનો સ્કેલ પર એકત્રિત કર્યો અને જટિલ પ્રોજેક્ટ્સ માટે ભાષણ ટેકનોલોજીને તાલીમ આપવા માટે જરૂરી ગુણવત્તાના ઇચ્છિત સ્તરને જાળવી રાખીને ૮૦૦ કલાકનું ટ્રાન્સક્રિપ્ટ કર્યું. દરેક સહભાગી પાસેથી સ્પષ્ટ સંમતિ ફોર્મ લેવામાં આવ્યું હતું. એકત્રિત કરાયેલ / સ્વયંભૂ ભાષણ યુનિવર્સિટી દ્વારા પૂરી પાડવામાં આવેલી છબીઓ પર આધારિત હતું. ૩૫૦૦ છબીઓમાંથી, ૧૦૦૦ સામાન્ય છે અને ૨૫૦૦ જિલ્લા-વિશિષ્ટ સંસ્કૃતિ, તહેવારો વગેરે સાથે સંબંધિત છે. છબીઓ ટ્રેન સ્ટેશન, બજારો, હવામાન અને વધુ જેવા વિવિધ ક્ષેત્રોનું નિરૂપણ કરે છે.
માહિતી સંગ્રહ
| રાજ્ય | જીલ્લાઓ | ઑડિયો કલાકો | ટ્રાન્સક્રિપ્શન (કલાક) |
|---|---|---|---|
| બિહાર | સારણ, પૂર્વ ચંપારણ, ગોપાલગંજ, સીતામઢી, સમસ્તીપુર, દરભંગા, મધેપુરા, ભાગલપુર, ગયા, કિશનગંજ, વૈશાલી, લખીસરાય, સહરસા, સુપૌલ, અરરિયા, બેગુસરાય, જહાનાબાદ, પૂર્ણિયા, મુઝફ્ફરપુર, જમુઈ | 2000 | 200 |
| ઉત્તર પ્રદેશ | દેવરિયા, વારાણસી, ગોરખપુર, ગાઝીપુર, મુઝફ્ફરનગર, એટાહ, હમીરપુર, જ્યોતિબા ફૂલે નગર, બુદૌન, જાલૌન | 1000 | 100 |
| રાજસ્થાન | નાગૌર, ચુરુ | 200 | 20 |
| ઉત્તરાખંડ | તેહરી ગઢવાલ, ઉત્તરકાશી | 200 | 20 |
| છત્તીસગઢ | બિલાસપુર, રાયગઢ, કબીરધામ, સરગુજા, કોરબા, જશપુર, રાજનાંદગાંવ, બલરામપુર, બસ્તર, સુકમા | 1000 | 100 |
| પશ્ચિમ બંગાળ | પશ્ચિમ મેદિનીપુર, માલદા, જલપાઈગુડી, પુરુલિયા, કોલકાતા, ઝારગ્રામ, ઉત્તર 24 પરગણા, દક્ષિણ દિવસાજપુર | 800 | 80 |
| ઝારખંડ | સાહેબગંજ, જામતારા | 200 | 20 |
| આંધ્ર પ્રદેશ | ગુંટુર, ચિત્તૂર, વિશાખાપટ્ટનમ, કૃષ્ણા, અનંતપુર, શ્રીકાકુલમ | 600 | 60 |
| તેલંગણા | કરીમનગર, નાલગોંડા | 200 | 20 |
| ગોવા | ઉત્તર અને દક્ષિણ ગોવા | 100 | 10 |
| કર્ણાટક | દક્ષિણ કન્નડ, ગુલબર્ગા, ધારવાડ, બેલ્લારી, મૈસુર, શિમોગા, બીજાપુર, બેલગામ, રાયચુર, ચામરાજનગર | 1000 | 100 |
| મહારાષ્ટ્ર | સિંધુદુર્ગ, ધુલે, નાગપુર, પુણે, ઔરંગાબાદ, ચંદ્રપુર, સોલાપુર | 700 | 70 |
| કુલ | 8000 | 800 | |
સામાન્ય દિશાનિર્દેશો
બંધારણમાં
- ૧૬ કિલોહર્ટ્ઝ પર ઓડિયો, ૧૬ બિટ્સ/નમૂના.
- સિંગલ ચેનલ.
- ટ્રાન્સકોડિંગ વિના કાચો ઑડિઓ.
શૈલી
- સ્વયંભૂ ભાષણ.
- યુનિવર્સિટી દ્વારા પૂરી પાડવામાં આવેલી છબીઓ પર આધારિત વાક્યો. 3500 છબીઓમાંથી, 1000 સામાન્ય છે અને 2500 જિલ્લા-વિશિષ્ટ સંસ્કૃતિ, તહેવારો વગેરે સાથે સંબંધિત છે. છબીઓ ટ્રેન સ્ટેશન, બજારો, હવામાન અને વધુ જેવા વિવિધ ક્ષેત્રોનું નિરૂપણ કરે છે.
રેકોર્ડિંગ પૃષ્ઠભૂમિ
- શાંત, પડઘા-મુક્ત વાતાવરણમાં રેકોર્ડ થયેલ.
- રેકોર્ડિંગ દરમિયાન સ્માર્ટફોનમાં કોઈ ખલેલ (વાઇબ્રેશન કે સૂચનાઓ) નહીં.
- ક્લિપિંગ અથવા દૂરના ક્ષેત્રની અસરો જેવી કોઈ વિકૃતિઓ નથી.
- ફોનમાંથી આવતા કંપનો અસ્વીકાર્ય છે; જો અવાજ સ્પષ્ટ હોય તો બાહ્ય કંપનો સહન કરી શકાય છે.
સ્પીકર સ્પષ્ટીકરણ
- જિલ્લા દીઠ સંતુલિત લિંગ વિતરણ સાથે વય શ્રેણી 20-70 વર્ષ સુધીની છે.
- દરેક જિલ્લામાં ઓછામાં ઓછા 400 મૂળ બોલનારા હોવા જોઈએ.
- વક્તાઓએ તેમની માતૃભાષા/બોલીનો ઉપયોગ કરવો જોઈએ.
- બધા સહભાગીઓ માટે સંમતિ ફોર્મ ફરજિયાત છે.
ગુણવત્તા તપાસ અને મહત્વપૂર્ણ ગુણવત્તા ખાતરી
QA પ્રક્રિયા ઑડિઓ રેકોર્ડિંગ્સ અને ટ્રાન્સક્રિપ્શન માટે ગુણવત્તા ખાતરીને પ્રાથમિકતા આપે છે. ઑડિઓ ધોરણો ચોક્કસ મૌન, સેગમેન્ટ અવધિ, સિંગલ-સ્પીકર સ્પષ્ટતા અને ઉંમર અને સામાજિક-આર્થિક સ્થિતિ સહિત વિગતવાર મેટાડેટા પર ધ્યાન કેન્દ્રિત કરે છે. ટ્રાન્સક્રિપ્શન માપદંડ ટેગ ચોકસાઈ, શબ્દની સત્યતા અને સાચી સેગમેન્ટ વિગતો પર ભાર મૂકે છે. સ્વીકૃતિ બેન્ચમાર્ક સૂચવે છે કે જો ઑડિઓ બેચનો 20% થી વધુ આ ધોરણોમાં નિષ્ફળ જાય છે, તો તે નકારવામાં આવે છે. 20% થી ઓછી વિસંગતતાઓ માટે, સમાન પ્રોફાઇલ્સ સાથે રિપ્લેસમેન્ટ રેકોર્ડિંગ્સ જરૂરી છે.
ડેટા ટ્રાન્સક્રિપ્શન
ટ્રાન્સક્રિપ્શન માર્ગદર્શિકા ચોકસાઈ અને શબ્દશઃ ટ્રાન્સક્રિપ્શન પર ભાર મૂકે છે જ્યારે શબ્દો સ્પષ્ટ અને સમજી શકાય તેવા હોય; અસ્પષ્ટ શબ્દોને મુદ્દાના આધારે [અસમજ] અથવા [અશ્રાવ્ય] તરીકે ચિહ્નિત કરવામાં આવે છે. લાંબા ઑડિઓમાં વાક્યની સીમાઓ ચિહ્નિત થયેલ છે , અને વ્યાકરણની ભૂલોના કોઈ પણ પ્રકારનો અનુવાદ અથવા સુધારણાની મંજૂરી નથી. વર્બેટિમ ટ્રાન્સક્રિપ્શન ભૂલો, અશિષ્ટ શબ્દો અને પુનરાવર્તનોને આવરી લે છે પરંતુ ખોટા શરૂઆત, ફિલર અવાજો અને સ્ટટર્સને બાકાત રાખે છે. પૃષ્ઠભૂમિ અને અગ્રભૂમિના અવાજો વર્ણનાત્મક ટૅગ્સ સાથે ટ્રાન્સક્રિપ્શન કરવામાં આવે છે, જ્યારે યોગ્ય નામો, શીર્ષકો અને સંખ્યાઓ ચોક્કસ ટ્રાન્સક્રિપ્શન નિયમોનું પાલન કરે છે. દરેક વાક્ય માટે સ્પીકર લેબલ્સનો ઉપયોગ કરવામાં આવે છે, અને અપૂર્ણ વાક્યો સાથે સૂચવવામાં આવે છે.
પ્રોજેક્ટ વર્કફ્લો
વર્કફ્લો ઓડિયો ટ્રાન્સક્રિપ્શન પ્રક્રિયાનું વર્ણન કરે છે. તે સહભાગીઓને ઓનબોર્ડિંગ અને તાલીમ આપવાથી શરૂ થાય છે. તેઓ એક એપ્લિકેશનનો ઉપયોગ કરીને ઓડિયો રેકોર્ડ કરે છે, જે QA પ્લેટફોર્મ પર અપલોડ કરવામાં આવે છે. આ ઓડિયો ગુણવત્તા તપાસ અને સ્વચાલિત વિભાજનમાંથી પસાર થાય છે. પછી ટેક ટીમ ટ્રાન્સક્રિપ્શન માટે સેગમેન્ટ્સ તૈયાર કરે છે. મેન્યુઅલ ટ્રાન્સક્રિપ્શન પછી, ગુણવત્તા ખાતરી પગલું છે. ટ્રાન્સક્રિપ્શન ક્લાયન્ટને પહોંચાડવામાં આવે છે, અને જો સ્વીકારવામાં આવે છે, તો ડિલિવરી પૂર્ણ માનવામાં આવે છે. જો નહીં, તો ક્લાયન્ટ પ્રતિસાદના આધારે સુધારા કરવામાં આવે છે.
પરિણામ
નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી ઉચ્ચ-ગુણવત્તાવાળા ઑડિઓ ડેટા અમારા ક્લાયન્ટને નિર્ધારિત સમયમાં વિવિધ ભારતીય ભાષાઓમાં વિવિધ બોલીઓ સાથે બહુભાષી વાણી ઓળખ મોડેલોને સચોટ રીતે તાલીમ આપવા અને બનાવવા માટે સક્ષમ બનાવશે. વાણી ઓળખ મોડેલોનો ઉપયોગ આ માટે થઈ શકે છે:
- નાગરિકોને તેમની પોતાની માતૃભાષામાં પહેલ સાથે જોડીને ડિજિટલ સમાવેશ માટે ભાષા અવરોધ દૂર કરો.
- ડિજિટલ ગવર્નન્સને પ્રોત્સાહન આપે છે
- ભારતીય ભાષાઓમાં સેવાઓ અને ઉત્પાદનો માટે ઇકોસિસ્ટમ બનાવશે કેટાલિસ્ટ
- જાહેર હિતના ક્ષેત્રોમાં, ખાસ કરીને શાસન અને નીતિના ક્ષેત્રમાં વધુ સ્થાનિક ડિજિટલ સામગ્રી
વાતચીતના AI ક્ષેત્રમાં શૈપની કુશળતાથી અમે આશ્ચર્યચકિત છીએ. ઓછામાં ઓછું કહીએ તો, 80 વિવિધ જિલ્લાઓમાં 8000 કલાકના ઑડિઓ ડેટા અને 800 કલાકના ટ્રાન્સક્રિપ્શનનું સંચાલન કરવાનું કાર્ય ખૂબ જ મહત્વપૂર્ણ હતું. આ ક્ષેત્રની જટિલ વિગતો અને ઘોંઘાટની શૈપની ઊંડી સમજણને કારણે જ આવા પડકારજનક પ્રોજેક્ટનું સફળ અમલ શક્ય બન્યું. ઉચ્ચ ગુણવત્તાની ખાતરી કરતી વખતે આ વિશાળ માત્રામાં ડેટાની જટિલતાઓને સરળતાથી સંચાલિત કરવાની અને નેવિગેટ કરવાની તેમની ક્ષમતા ખરેખર પ્રશંસનીય છે.