કેસ સ્ટડી: વાતચીત AI

3 ભારતીય ભાષાઓમાં ASR બનાવવા માટે 8 હજાર કલાકથી વધુનો ડેટા એકત્રિત, વિભાજિત અને ટ્રાન્સક્રાઇબ કરવામાં આવ્યો

વાતચીત એ.આઈ

સરકાર ભાષિની પ્રોજેક્ટ દ્વારા નાગરિકોને તેમની પોતાની માતૃભાષામાં ઇન્ટરનેટ અને ડિજિટલ સેવાઓની સરળ ઍક્સેસ આપવાનો ઉદ્દેશ્ય ધરાવે છે.

ભાશિની, ભારતનું AI-સંચાલિત ભાષા અનુવાદ પ્લેટફોર્મ, ડિજિટલ ઇન્ડિયા પહેલનો એક મહત્વપૂર્ણ ભાગ છે.

MSME, સ્ટાર્ટઅપ્સ અને સ્વતંત્ર ઇનોવેટર્સને આર્ટિફિશિયલ ઇન્ટેલિજન્સ (AI) અને નેચરલ લેંગ્વેજ પ્રોસેસિંગ (NLP) ટૂલ્સ પૂરા પાડવા માટે રચાયેલ, ભાષિની પ્લેટફોર્મ જાહેર સંસાધન તરીકે સેવા આપે છે. તેનો ધ્યેય ભારતીય નાગરિકોને તેમની માતૃભાષામાં દેશની ડિજિટલ પહેલ સાથે વાર્તાલાપ કરવા સક્ષમ બનાવીને ડિજિટલ સમાવેશને પ્રોત્સાહન આપવાનો છે.

વધુમાં, તેનો ઉદ્દેશ્ય ભારતીય ભાષાઓમાં ઇન્ટરનેટ સામગ્રીની ઉપલબ્ધતાને નોંધપાત્ર રીતે વિસ્તૃત કરવાનો છે. આ ખાસ કરીને શાસન અને નીતિ, વિજ્ઞાન અને ટેકનોલોજી વગેરે જેવા જાહેર હિતના ક્ષેત્રો પર કેન્દ્રિત છે. પરિણામે, આ નાગરિકોને તેમની પોતાની ભાષામાં ઇન્ટરનેટનો ઉપયોગ કરવા માટે પ્રોત્સાહિત કરશે, તેમની સક્રિય ભાગીદારીને પ્રોત્સાહન આપશે.

વાસ્તવિક દુનિયાનું સમાધાન

ડેટા સાથે સ્થાનિકીકરણની શક્તિનો ઉપયોગ કરવો

ભારતને એક એવા પ્લેટફોર્મની જરૂર હતી જે ભારતીય ભાષાઓમાં ડિજિટલ સેવાઓ પૂરી પાડવા માટે બહુભાષી ડેટાસેટ્સ અને AI-આધારિત ભાષા ટેકનોલોજી સોલ્યુશન્સ બનાવવા પર ધ્યાન કેન્દ્રિત કરે. આ પહેલ શરૂ કરવા માટે, ઇન્ડિયન ઇન્સ્ટિટ્યૂટ ઑફ ટેકનોલોજી, મદ્રાસ (IIT મદ્રાસ) એ બહુભાષી ભાષણ મોડેલ બનાવવા માટે ભારતીય ભાષા ડેટાસેટ્સ એકત્રિત કરવા, વિભાજિત કરવા અને ટ્રાન્સક્રાઇબ કરવા માટે Shaip સાથે ભાગીદારી કરી.

પડકારો

ભારતીય ભાષાઓ માટે સ્પીચ ટેકનોલોજી સ્પીચ રોડમેપમાં ક્લાયન્ટને મદદ કરવા માટે, ટીમને AI મોડેલ બનાવવા માટે મોટા પ્રમાણમાં તાલીમ ડેટા મેળવવા, વિભાજીત કરવા અને ટ્રાન્સક્રાઇબ કરવાની જરૂર હતી. ક્લાયન્ટની મહત્વપૂર્ણ જરૂરિયાતો આ હતી:

માહિતી સંગ્રહ

  • 3000 ભારતીય ભાષાઓમાં 8 કલાકનો તાલીમ ડેટા મેળવો, જેમાં દરેક ભાષામાં 4 બોલીઓ હશે.
  • દરેક ભાષા માટે, સપ્લાયર એક્સટેમ્પોર સ્પીચ એકત્રિત કરશે અને
    ૧૮-૬૦ વર્ષના વય જૂથો માટે વાતચીત ભાષણ
  • ઉંમર, લિંગ, શિક્ષણ અને બોલીઓ દ્વારા વક્તાઓનું વૈવિધ્યસભર મિશ્રણ સુનિશ્ચિત કરો
  • સ્પષ્ટીકરણો અનુસાર રેકોર્ડિંગ વાતાવરણના વૈવિધ્યસભર મિશ્રણની ખાતરી કરો.
  • દરેક ઓડિયો રેકોર્ડિંગ ઓછામાં ઓછું 16kHz હોવું જોઈએ પરંતુ પ્રાધાન્યમાં 44kHz હોવું જોઈએ.

ડેટા સેગ્મેન્ટેશન

  • વાતચીતમાં દરેક વક્તા, ધ્વનિનો પ્રકાર (ભાષણ, બડબડાટ, સંગીત, અવાજ), વારા, ઉચ્ચારણ અને શબ્દસમૂહો માટે 15 સેકન્ડના સ્પીચ સેગમેન્ટ બનાવો અને ઑડિયોને મિલિસેકન્ડમાં ટાઇમસ્ટેમ્પ કરો.
  • શરૂઆતમાં અને અંતે 200-400 મિલિસેકન્ડ પેડિંગ સાથે તેના લક્ષિત ધ્વનિ સંકેત માટે દરેક સેગમેન્ટ બનાવો.
  • બધા સેગમેન્ટ્સ માટે, નીચેના ઑબ્જેક્ટ્સ ભરવા આવશ્યક છે જેમ કે, શરૂઆતનો સમય, સમાપ્તિ સમય, સેગમેન્ટ ID, લાઉડનેસ લેવલ, સાઉન્ડ પ્રકાર, ભાષા કોડ, સ્પીકર ID, વગેરે.

ડેટા ટ્રાન્સક્રિપ્શન

  • અક્ષરો અને વિશેષ પ્રતીકો, જોડણી અને વ્યાકરણ, મૂડીકરણ, સંક્ષેપ, સંકોચન, વ્યક્તિગત બોલાતા અક્ષરો, સંખ્યાઓ, વિરામચિહ્નો, સંક્ષિપ્ત શબ્દો, અસ્પષ્ટ, વાણી, અસ્પષ્ટ વાણી, લક્ષ્ય વિનાની ભાષાઓ, અસ્પષ્ટ વાણી વગેરેની આસપાસ વિગતવાર ટ્રાન્સક્રિપ્શન માર્ગદર્શિકા અનુસરો.

ગુણવત્તા તપાસ અને પ્રતિસાદ

  • બધા રેકોર્ડિંગ્સ ગુણવત્તા મૂલ્યાંકન અને માન્યતામાંથી પસાર થશે, ફક્ત માન્ય ભાષણ જ પહોંચાડવામાં આવશે.

ઉકેલ

વાતચીતના AI ની અમારી ઊંડી સમજણ સાથે, અમે ક્લાયન્ટને 8 ભારતીય ભાષાઓમાં ઓડિયો ડેટાસેટનો મોટો સંગ્રહ બનાવવા માટે નિષ્ણાત કલેક્ટર્સ, ભાષાશાસ્ત્રીઓ અને ટીકાકારોની ટીમ સાથે ડેટા એકત્રિત, વિભાજિત અને ટ્રાન્સક્રાઇબ કરવામાં મદદ કરી.

શેપના કાર્યક્ષેત્રમાં મોટા પ્રમાણમાં ઓડિયો તાલીમ ડેટા મેળવવા, ઓડિયો રેકોર્ડિંગ્સને અનેક ભાગોમાં વિભાજીત કરવા, ડેટાનું ટ્રાન્સક્રિપ્શન કરવા અને મેટાડેટા ધરાવતી અનુરૂપ JSON ફાઇલો પહોંચાડવાનો સમાવેશ થાય છે [સ્પીકર આઈડી, ઉંમર, લિંગ, ભાષા, બોલી, માતૃભાષા, લાયકાત, વ્યવસાય, ડોમેન, ફાઇલ ફોર્મેટ, આવર્તન, ચેનલ, ઓડિયોનો પ્રકાર, બોલનારાઓની સંખ્યા, વિદેશી ભાષાઓની સંખ્યા, વપરાયેલ સેટઅપ, નેરોબેન્ડ અથવા વાઈડબેન્ડ ઓડિયો, વગેરે].

જટિલ પ્રોજેક્ટ્સ માટે સ્પીચ ટેકનોલોજી તાલીમ આપવા માટે જરૂરી ગુણવત્તાના ઇચ્છિત સ્તરને જાળવી રાખીને, શેપે 3000 કલાકનો ઓડિયો ડેટા સ્કેલ પર એકત્રિત કર્યો. દરેક સહભાગી પાસેથી સ્પષ્ટ સંમતિ ફોર્મ લેવામાં આવ્યું હતું.

1. માહિતી સંગ્રહ

2. ડેટા સેગ્મેન્ટેશન

  • એકત્રિત કરવામાં આવેલા ઓડિયો ડેટાને 15 સેકન્ડના ભાષણ વિભાગોમાં વિભાજિત કરવામાં આવ્યો હતો અને દરેક વક્તા, અવાજનો પ્રકાર, વારા, ઉચ્ચારણ અને વાતચીતમાં શબ્દસમૂહો માટે મિલિસેકન્ડમાં સમયરેખા આપવામાં આવી હતી.
  • ધ્વનિ સંકેતની શરૂઆતમાં અને અંતે 200-400 મિલિસેકન્ડ પેડિંગ સાથે તેના લક્ષિત ધ્વનિ સંકેત માટે દરેક સેગમેન્ટ બનાવ્યું.
  • બધા સેગમેન્ટ્સ માટે, નીચેના ઑબ્જેક્ટ્સ હાજર અને ભરેલા હતા જેમ કે, શરૂઆતનો સમય, સમાપ્તિ સમય, સેગમેન્ટ ID, લાઉડનેસ લેવલ (મોટેથી, સામાન્ય, શાંત), પ્રાથમિક ધ્વનિ પ્રકાર (વાણી, બડબડાટ, સંગીત, અવાજ, ઓવરલેપ), ભાષા કોડ સ્પીકર ID, ટ્રાન્સક્રિપ્શન વગેરે.

૩. ગુણવત્તા તપાસ અને પ્રતિસાદ

  • બધા રેકોર્ડિંગ્સનું ગુણવત્તા માટે મૂલ્યાંકન કરવામાં આવ્યું હતું અને ફક્ત 90% WER અને 90% TER સાથે માન્ય સ્પીચ રેકોર્ડિંગ્સ જ વિતરિત કરવામાં આવ્યા હતા.
  • ગુણવત્તા ચેકલિસ્ટ અનુસરવામાં આવી:
    » સેગમેન્ટ લંબાઈની મહત્તમ 15 સેકન્ડ
    » ચોક્કસ ડોમેનમાંથી ટ્રાન્સક્રિપ્શન, જેમ કે: હવામાન, વિવિધ પ્રકારના સમાચાર, આરોગ્ય, કૃષિ, શિક્ષણ, નોકરીઓ અથવા નાણાં
    » ઓછો પૃષ્ઠભૂમિ અવાજ
    » કોઈ ઓડિયો ક્લિપ બંધ નથી - કોઈ વિકૃતિ નથી
    » ટ્રાન્સક્રિપ્શન માટે ઑડિઓ સેગ્મેન્ટેશનને ઠીક કરો

4. ડેટા ટ્રાન્સક્રિપ્શન

બધા બોલાયેલા શબ્દો, જેમાં ખચકાટ, ફિલર શબ્દો, ખોટી શરૂઆત અને અન્ય મૌખિક યુક્તિઓનો સમાવેશ થાય છે, તે ટ્રાંસ્ક્રિપ્શનમાં સચોટ રીતે કેપ્ચર કરવામાં આવ્યા હતા. અમે મોટા અને નાના અક્ષરો, જોડણી, મોટા અક્ષરો, સંક્ષેપ, સંકોચન, સંખ્યાઓ,
વિરામચિહ્નો, સંક્ષિપ્ત શબ્દો, અસ્પષ્ટ વાણી, બિન-વાણી અવાજો વગેરે. વધુમાં સંગ્રહ અને ટ્રાન્સક્રિપ્શન માટે અનુસરવામાં આવેલ કાર્યપ્રવાહ નીચે મુજબ છે:

પરિણામ

નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી ઉચ્ચ-ગુણવત્તાવાળા ઑડિઓ ડેટા ઇન્ડિયન ઇન્સ્ટિટ્યૂટ ઑફ ટેકનોલોજી - મદ્રાસને નિર્ધારિત સમયમાં વિવિધ બોલીઓ સાથે 8 ભારતીય ભાષાઓમાં બહુભાષી વાણી ઓળખ મોડેલોને સચોટ રીતે તાલીમ આપવા અને બનાવવા માટે સક્ષમ બનાવશે. વાણી ઓળખ મોડેલોનો ઉપયોગ આ માટે થઈ શકે છે:

  • નાગરિકોને તેમની પોતાની માતૃભાષામાં પહેલ સાથે જોડીને ડિજિટલ સમાવેશ માટે ભાષા અવરોધ દૂર કરો.
  • ડિજિટલ ગવર્નન્સને પ્રોત્સાહન આપે છે
  • ભારતીય ભાષાઓમાં સેવાઓ અને ઉત્પાદનો માટે ઇકોસિસ્ટમ બનાવશે કેટાલિસ્ટ
  • જાહેર હિતના ક્ષેત્રોમાં, ખાસ કરીને શાસન અને નીતિના ક્ષેત્રમાં વધુ સ્થાનિક ડિજિટલ સામગ્રી
ભાવ ચિહ્ન

વાતચીતના AI ક્ષેત્રમાં શૈપની કુશળતાથી અમે પ્રભાવિત થયા. કડક સમયરેખા અને માર્ગદર્શિકામાં 8 ભાષાઓમાં નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી જરૂરી તાલીમ ડેટા સોર્સિંગ, સેગમેન્ટિંગ, ટ્રાન્સક્રાઇબિંગ અને ડિલિવર કરવામાં તેમની એકંદર પ્રોજેક્ટ અમલીકરણ ક્ષમતા; અને ગુણવત્તાના સ્વીકાર્ય ધોરણને જાળવી રાખ્યા.

★★★★★
ભાવ ચિહ્ન

તમારી આગામી AI પહેલમાં અમે કેવી રીતે મદદ કરી શકીએ તે અમને જણાવો.