ભારત જેવા સાંસ્કૃતિક રીતે વૈવિધ્યસભર અને ભાષાકીય રીતે સમૃદ્ધ દેશમાં, સમાવિષ્ટ AI નું નિર્માણ પ્રતિનિધિ, ઉચ્ચ-ગુણવત્તાવાળા ડેટાસેટ્સ એકત્રિત કરવાથી શરૂ થાય છે. પ્રોજેક્ટ વાણી પાછળનો આ જ વિઝન છે - ARTPARK , IISc બેંગલુરુ અને Google દ્વારા સંચાલિત એક મોટા પાયે, ઓપન-સોર્સ પહેલ , જેનો ઉદ્દેશ્ય દરેક ભારતીય ભાષા અને બોલીને અવાજ આપવાનો છે.
મહત્વાકાંક્ષી ધ્યેય? ભારતના ૭૭૩ જિલ્લાઓમાં ૧૦ લાખ લોકો પાસેથી ૧,૫૦,૦૦૦+ કલાકના ભાષણ અને ૧૫,૦૦૦+ કલાકના ટ્રાન્સક્રિપ્શન એકત્રિત કરવાનો.
આ રાષ્ટ્રીય મિશનના મુખ્ય વિક્રેતાઓમાંના એક તરીકે, શેપે સ્વયંસ્ફુરિત ભાષણ ડેટા, ટ્રાન્સક્રિપ્શન અને મેટાડેટા સંગ્રહને ક્યુરેટ કરવામાં મુખ્ય ભૂમિકા ભજવી હતી - વાસ્તવિક ભારતનું ખરેખર પ્રતિનિધિત્વ કરતી સમાન વૉઇસ ટેકનોલોજી માટે પાયો નાખ્યો હતો.
પ્રોજેક્ટ વાણી પાછળનું વિઝન
પ્રોજેક્ટ વાણી ભારતમાં સૌથી મોટો મલ્ટિમોડલ, બહુભાષી, ઓપન-સોર્સ ડેટાસેટ બનાવીને AI સમાવેશના અંતરને દૂર કરવા માટે રચાયેલ છે . આ ડેટા મૂળ ભારતીય ભાષાઓમાં સચોટ વાણી ઓળખ, અનુવાદ અને જનરેટિવ AI સિસ્ટમ્સ વિકસાવવા માટે પાયાનો છે - જેમાંથી ઘણી વૈશ્વિક ટેક ઇકોસિસ્ટમમાં ઓછી રજૂઆત પામે છે.
લાંબા ગાળાના દ્રષ્ટિકોણનો હેતુ નીચેના ક્ષેત્રોમાં અસરકારક એપ્લિકેશનોને શક્તિ આપવાનો છે:
- સ્વાસ્થ્ય કાળજી - અવાજ આધારિત ટેલિમેડિસિન
- શિક્ષણ - સ્થાનિક ભાષા શીખવાના પ્લેટફોર્મ
- શાસન - નાગરિક સેવાઓ માટે વાતચીત ઇન્ટરફેસ
- ઉપલ્બધતા - દિવ્યાંગ વપરાશકર્તાઓ માટે વૉઇસ ટૂલ્સ
- આપત્તિ પ્રતિભાવ - સ્થાનિક બોલીઓમાં રીઅલ-ટાઇમ વાતચીત
પ્રોજેક્ટ વાણી માટે ભારતનો સૌથી મોટો ઓપન-સોર્સ સ્પીચ ડેટાસેટ બનાવવામાં શેપે કેવી રીતે મદદ કરી
શેપને 8,000 કલાકના સ્વયંભૂ ભાષણ અને 800 કલાકના મેન્યુઅલી ચકાસાયેલ ટ્રાન્સક્રિપ્શનના સંગ્રહની જવાબદારી સોંપવામાં આવી હતી . અમારી જવાબદારી સ્પીકર્સનું ઓનબોર્ડિંગ, ઓડિયો કેપ્ચર, મેટાડેટા ટેગિંગ, ટ્રાન્સક્રિપ્શન કોઓર્ડિનેશન અને ગુણવત્તા નિયંત્રણ સુધી ફેલાયેલી હતી.
૮,૦૦૦ કલાકનો સ્વયંભૂ ઓડિયો ડેટા
જિલ્લા દીઠ 400+ મૂળ બોલનારાઓના રેકોર્ડિંગ્સ , વિવિધ વય જૂથો, લિંગ અને બોલીઓનું પ્રતિનિધિત્વ કરે છે.
૮૦ જિલ્લાઓ, આવરી લેવામાં આવ્યા છે
કુદરતી, સંદર્ભિત ભાષણ સુનિશ્ચિત કરવા માટે છબી-આધારિત સંકેત
અમારા અભિગમને અનન્ય બનાવનાર કારણો અહીં છે:
જિલ્લા-સ્તરીય વિવિધતા
અમે બિહાર, ઉત્તર પ્રદેશ, કર્ણાટક, પશ્ચિમ બંગાળ અને મહારાષ્ટ્ર જેવા રાજ્યોમાં ફેલાયેલા 80 જિલ્લાઓમાંથી રેકોર્ડિંગ્સ મેળવ્યા. દરેક જિલ્લાએ 100 કલાકનો ઓડિયો ડેટા આપ્યો, જેનાથી પ્રાદેશિક સંતુલન સુનિશ્ચિત થયું. અમે મૂળ બોલનારાઓને જોડ્યા, મુખ્ય પ્રવાહના AI ડેટાસેટ્સમાં ઘણીવાર અવગણવામાં આવતા પ્રાદેશિક ઉચ્ચારો અને બોલીઓનું પ્રતિનિધિત્વ સુનિશ્ચિત કર્યું.
ભાષાકીય અને વસ્તી વિષયક પ્રતિનિધિત્વ
અમે બિહાર, ઉત્તર પ્રદેશ, કર્ણાટક, પશ્ચિમ બંગાળ અને મહારાષ્ટ્ર જેવા રાજ્યોમાં ફેલાયેલા 80 જિલ્લાઓમાંથી રેકોર્ડિંગ્સ મેળવ્યા. દરેક જિલ્લાએ 100 કલાકનો ઓડિયો ડેટા આપ્યો, જેનાથી પ્રાદેશિક સંતુલન સુનિશ્ચિત થયું. અમે મૂળ બોલનારાઓને જોડ્યા, મુખ્ય પ્રવાહના AI ડેટાસેટ્સમાં ઘણીવાર અવગણવામાં આવતા પ્રાદેશિક ઉચ્ચારો અને બોલીઓનું પ્રતિનિધિત્વ સુનિશ્ચિત કર્યું.
છબી-પ્રોમ્પ્ટેડ સ્પીચ
સ્વયંભૂ અને કુદરતી શબ્દભંડોળને ઉત્તેજીત કરવા માટે, સહભાગીઓને પ્રતિ સત્ર 45-90 છબીઓ બતાવવામાં આવી હતી અને તેમનું વર્ણન કરવાનું કહેવામાં આવ્યું હતું. સહભાગીઓને તેમની માતૃભાષામાં કુદરતી, સ્વયંભૂ પ્રતિભાવો મેળવવા માટે સાંસ્કૃતિક પ્રતીકોથી લઈને રોજિંદા વસ્તુઓ સુધીની વિવિધ છબીઓનો ઉપયોગ કરવા માટે પ્રોત્સાહિત કરવામાં આવ્યા હતા. આનાથી ખાતરી થઈ કે રેકોર્ડિંગ્સ વાસ્તવિક દુનિયા, સંદર્ભિત ભાષણને પ્રતિબિંબિત કરે છે - જે અદ્યતન NLP સિસ્ટમોને તાલીમ આપવા માટે જરૂરી છે.
ઉચ્ચ-ગુણવત્તાવાળા ટ્રાન્સક્રિપ્શન ધોરણો
ફક્ત 10% ભાષણ ડેટાનું ટ્રાન્સક્રાઇબિંગ કરવામાં આવ્યું હતું - જે 800 કલાક જેટલું હતું. સ્થાનિક ભાષાશાસ્ત્રીઓ દ્વારા વક્તાના 20-50 કિમી ત્રિજ્યામાં ટ્રાન્સક્રિપ્શન કરવામાં આવ્યા હતા, જેનાથી બોલીઓ અને સૂક્ષ્મતા સાથે પરિચિતતા સુનિશ્ચિત થઈ. બીજા સ્તરની તપાસથી <5% શબ્દ ભૂલ દર (WER) સુનિશ્ચિત થયો.
સખત ગુણવત્તા ખાતરી
ઑડિઓ ડેટાએ ઉચ્ચ સ્તરનું પાલન કરવું પડ્યું: કોઈ પૃષ્ઠભૂમિ અવાજ, પડઘા, ફોનના વાઇબ્રેશન અથવા વિકૃતિઓ નહીં. ઑડિઓ શાંત, પડઘા-મુક્ત વાતાવરણમાં રેકોર્ડ કરવામાં આવ્યો હતો. વાણી સ્પષ્ટતા, અવાજ સ્તર, મેટાડેટા ચોકસાઈ અને સ્પીકર ચકાસણી માટે માર્ગદર્શિકાને પૂર્ણ કરવા માટે ફાઇલોની સખત સમીક્ષા કરવામાં આવી હતી. બધી ફાઇલોમાં મેટાડેટા ટેગિંગ સચોટ હોવું જરૂરી હતું, અને સ્પીકર અને સ્થાન ગોઠવણી માટે તમામ રેકોર્ડિંગ્સની તપાસ કરવામાં આવી હતી.
અમે ઉકેલેલા પડકારો
- દૂરસ્થ લોજિસ્ટિક્સ - ૮૦ જિલ્લાઓમાં ટીમોનું સંચાલન
- વક્તાની વિવિધતા - દૂરસ્થ સ્થળોએ 32,000+ ચકાસાયેલ સ્પીકર્સને ઓનબોર્ડિંગ
- સાંસ્કૃતિક સંવેદનશીલતા - સ્થાનિક રિવાજો અને બોલીઓનો આદર કરવો
- માહિતી સંકલિતતા - ગુણવત્તા અને પાલનના ધોરણોનું પાલન
- ગુણવત્તા નિયંત્રણ - બહુવિધ ભાષાકીય અને સાંસ્કૃતિક સંદર્ભોમાં
અમારી સફળતા ઝીણવટભરી આયોજન, ટેકનોલોજી-આધારિત માન્યતા અને દરેક પ્રદેશની સાંસ્કૃતિક ઘોંઘાટને સમજતી સ્થાનિક ટીમો સાથેની ભાગીદારી પર આધારિત હતી.
અસર અને એપ્લિકેશન્સ
શૈપના યોગદાનથી પ્રોજેક્ટ વાણીની પ્રગતિમાં વધારો થયો છે એટલું જ નહીં, પરંતુ ભારતમાં સમાવિષ્ટ AI માટે પાયો પણ નાખ્યો છે. ક્યુરેટેડ સ્પીચ ડેટાસેટનો ઉપયોગ પહેલાથી જ AI મોડેલો બનાવવા અને તેને ફાઇન-ટ્યુન કરવા માટે થઈ રહ્યો છે:
- સ્થાનિક ભાષામાં વ voiceઇસ સહાયકો
- પ્રાદેશિક અનુવાદ એન્જિનો
- દૃષ્ટિહીન લોકો માટે સુલભ સંદેશાવ્યવહાર સાધનો
- ગ્રામીણ વિદ્યાર્થીઓ માટે AI-સંચાલિત એડટેક પ્લેટફોર્મ
- ગ્રામીણ ટેલિમેડિસિન
- અવાજ આધારિત નાગરિક સેવાઓ
- રીઅલ-ટાઇમ અનુવાદ અને ટ્રાન્સક્રિપ્શન
ઉપસંહાર
પ્રોજેક્ટ વાણી એ સમાવિષ્ટ, સુલભ AI તરફ એક સાહસિક પગલું છે - અને શીપને પાયાની ભૂમિકા ભજવવા બદલ સન્માનિત કરવામાં આવે છે. પ્રોજેક્ટ વાણી પર શીપનું કાર્ય વિવિધતા અને પ્રતિનિધિત્વમાં મૂળ નૈતિક, સમાવિષ્ટ AI સિસ્ટમ્સ બનાવવા માટેની અમારી પ્રતિબદ્ધતાને પુનઃપુષ્ટિ કરે છે. 8,000 કલાકથી વધુ ભાષણ એકત્રિત કરીને અને 800 કલાક ટ્રાન્સક્રિપ્ટ કરીને, અમને ભારતના સૌથી દૂરંદેશી ડિજિટલ સમાવેશ પ્રોજેક્ટ્સમાંના એકમાં ભાગ ભજવવાનો ગર્વ છે.
પ્રોજેક્ટ વાણી ૧,૫૦,૦૦૦+ કલાકના ડેટાના તેના મોટા લક્ષ્ય તરફ આગળ વધી રહી છે, ત્યારે અમે એઆઈ નવીનતાના આગામી સીમાડાને ટેકો આપવા માટે તૈયાર છીએ જે દરેક ભારતીય માટે અને તેના માટે બોલે છે.
વાસ્તવિક દુનિયાને સમજે તેવી AI બનાવવા માટે અમારી સાથે ભાગીદારી કરવા માંગો છો? www.shaip.com