કેસ સ્ટડી: ઉચ્ચારણ સંગ્રહ
૧૩ ભાષાઓમાં બહુભાષી ડિજિટલ સહાયકો બનાવવા માટે ૭ મિલિયનથી વધુ ઉચ્ચારણો પહોંચાડ્યા.
વાસ્તવિક દુનિયાનું સમાધાન
ડેટા જે વૈશ્વિક વાતચીતોને શક્તિ આપે છે
ઉચ્ચારણ તાલીમની જરૂરિયાત ઊભી થાય છે કારણ કે બધા ગ્રાહકો સ્ક્રિપ્ટેડ ફોર્મેટમાં તેમના વૉઇસ સહાયકો સાથે વાતચીત કરતી વખતે અથવા પ્રશ્નો પૂછતી વખતે ચોક્કસ શબ્દો અથવા શબ્દસમૂહોનો ઉપયોગ કરતા નથી. એટલા માટે ચોક્કસ વૉઇસ એપ્લિકેશનોને સ્વયંભૂ વાણી ડેટા પર તાલીમ આપવી આવશ્યક છે. દા.ત., "સૌથી નજીકની હોસ્પિટલ ક્યાં આવેલી છે?" "મારી નજીક હોસ્પિટલ શોધો" અથવા "નજીકમાં કોઈ હોસ્પિટલ છે?" બધા એક જ શોધ હેતુ દર્શાવે છે પરંતુ અલગ રીતે ઉચ્ચારવામાં આવે છે.
સમસ્યા
વિશ્વવ્યાપી ભાષાઓ માટે ક્લાયન્ટ્સના ડિજિટલ આસિસ્ટન્ટના સ્પીચ રોડમેપને અમલમાં મૂકવા માટે, ટીમને સ્પીચ રેકગ્નિશન AI મોડેલ માટે મોટા પ્રમાણમાં તાલીમ ડેટા મેળવવાની જરૂર હતી. ક્લાયન્ટની મહત્વપૂર્ણ જરૂરિયાતો આ હતી:
- ૧૩ વૈશ્વિક ભાષાઓમાં વાણી ઓળખ સેવાઓ માટે મોટા પ્રમાણમાં તાલીમ ડેટા (૩-૩૦ સેકન્ડથી વધુ નહીં તેવા સિંગલ સ્પીકર ઉચ્ચારણ સંકેતો) મેળવો.
- દરેક ભાષા માટે, સપ્લાયર સ્પીકર્સ માટે રેકોર્ડ કરવા માટે ટેક્સ્ટ પ્રોમ્પ્ટ જનરેટ કરશે (સિવાય કે
ક્લાયન્ટ સપ્લાય) અને પરિણામી ઑડિઓનું ટ્રાન્સક્રાઇબ કરો. - સંબંધિત JSON ફાઇલો સાથે રેકોર્ડ કરેલા ઉચ્ચારણોનો ઑડિઓ ડેટા અને ટ્રાન્સક્રિપ્શન પ્રદાન કરો.
બધા રેકોર્ડિંગ્સ માટે મેટાડેટા ધરાવતો. - ઉંમર, લિંગ, શિક્ષણ અને બોલી દ્વારા વક્તાઓનું વૈવિધ્યસભર મિશ્રણ સુનિશ્ચિત કરો
- સ્પષ્ટીકરણો અનુસાર રેકોર્ડિંગ વાતાવરણના વૈવિધ્યસભર મિશ્રણની ખાતરી કરો.
- દરેક ઓડિયો રેકોર્ડિંગ ઓછામાં ઓછું 16kHz હોવું જોઈએ પરંતુ પ્રાધાન્યમાં 44kHz હોવું જોઈએ.
"ઘણા વિક્રેતાઓનું મૂલ્યાંકન કર્યા પછી, ક્લાયન્ટે વાતચીતના AI પ્રોજેક્ટ્સમાં તેમની કુશળતાને કારણે Shaip ને પસંદ કર્યું. અમે Shaip ની પ્રોજેક્ટ અમલીકરણ ક્ષમતા, કડક સમયમર્યાદામાં અને જરૂરી ગુણવત્તા સાથે 13 ભાષાઓમાં નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી જરૂરી ઉચ્ચારણો સ્ત્રોત, ટ્રાન્સક્રાઇબ અને પહોંચાડવાની તેમની કુશળતાથી પ્રભાવિત થયા હતા."
ઉકેલ
વાતચીતાત્મક AI ની અમારી ઊંડી સમજણ સાથે, અમે ક્લાયન્ટને તેમના AI-સંચાલિત સ્પીચ પ્રોસેસિંગ બહુભાષી વૉઇસ સ્યુટને તાલીમ આપવા માટે નિષ્ણાત ભાષાશાસ્ત્રીઓ અને ટીકાકારોની ટીમ સાથે ડેટા એકત્રિત, ટ્રાન્સક્રાઇબ અને ટીકા કરવામાં મદદ કરી.
શેપના કાર્યક્ષેત્રમાં વાણી ઓળખ માટે મોટા પ્રમાણમાં ઑડિઓ તાલીમ ડેટા મેળવવા, અમારા ટાયર 1 અને ટાયર 2 ભાષા રોડમેપ પરની બધી ભાષાઓ માટે બહુવિધ ભાષાઓમાં ઑડિઓ રેકોર્ડિંગ્સનું ટ્રાન્સક્રિપ્શન અને મેટાડેટા ધરાવતી અનુરૂપ JSON ફાઇલો પહોંચાડવાનો સમાવેશ થાય છે, પરંતુ તે મર્યાદિત ન હતો. શેપે જટિલ પ્રોજેક્ટ્સ માટે ML મોડેલ્સને તાલીમ આપવા માટે જરૂરી ગુણવત્તાના ઇચ્છિત સ્તરને જાળવી રાખીને સ્કેલ પર 3-30 સેકન્ડના ઉચ્ચારણો એકત્રિત કર્યા.
- ઓડિયો એકત્રિત, ટ્રાન્સક્રાઇબ અને ટીકા: 22,250 કલાક
- સમર્થિત ભાષાઓ: ૧૩ (ડેનિશ, કોરિયન, સાઉદી અરેબિયન અરબી, ડચ, મુખ્ય ભૂમિ અને તાઇવાન ચાઇનીઝ, ફ્રેન્ચ કેનેડિયન, મેક્સીકન સ્પેનિશ, ટર્કિશ, હિન્દી, પોલિશ, જાપાનીઝ, રશિયન)
- ઉચ્ચારણોની સંખ્યા: 7M +
- સમયરેખા: 7-8 મહિના
૧૬ કિલોહર્ટ્ઝ પર ઓડિયો ઉચ્ચારણો એકત્રિત કરતી વખતે, અમે વિવિધ રેકોર્ડિંગ વાતાવરણમાં વય, લિંગ, શિક્ષણ અને બોલીઓ દ્વારા વક્તાઓનું સ્વસ્થ મિશ્રણ સુનિશ્ચિત કર્યું.
પરિણામ
નિષ્ણાત ભાષાશાસ્ત્રીઓ દ્વારા આપવામાં આવેલા ઉચ્ચ-ગુણવત્તાવાળા ઉચ્ચારણ ઑડિઓ ડેટાએ ક્લાયન્ટને 13 ગ્લોબલ ટાયર 1 અને 2 ભાષાઓમાં તેમના બહુભાષી વાણી ઓળખ મોડેલને સચોટ રીતે તાલીમ આપવા માટે સક્ષમ બનાવ્યું. ગોલ્ડ-સ્ટાન્ડર્ડ તાલીમ ડેટાસેટ્સ સાથે, ક્લાયન્ટ ભવિષ્યની વાસ્તવિક દુનિયાની સમસ્યાઓ ઉકેલવા માટે બુદ્ધિશાળી અને મજબૂત ડિજિટલ સહાય પ્રદાન કરી શકે છે.
અમારી કુશળતા
ભલામણ કરેલ સંસાધનો
ખરીદનારની માર્ગદર્શિકા
ખરીદનાર માર્ગદર્શિકા: વાતચીત AI
તમે જે ચેટબોટ સાથે વાતચીત કરી છે તે એક અદ્યતન વાતચીત AI સિસ્ટમ પર ચાલે છે જે તાલીમ પામેલ, પરીક્ષણ કરાયેલ અને ટનબંધ વાણી ઓળખ ડેટાસેટ્સનો ઉપયોગ કરીને બનાવવામાં આવેલ છે.
બ્લોગ
વાતચીતની સ્થિતિ AI 2025
કન્વર્ઝનલ એઆઈ 2025 ઇન્ફોગ્રાફિક્સ કન્વર્ઝનલ એઆઈ શું છે, તેના વિકાસ, પ્રકારો, પ્રદેશ દ્વારા કન્વર્ઝનલ એઆઈ માર્કેટ, ઉપયોગના કેસો, પડકારો વગેરે વિશે વાત કરે છે.
બ્લોગ
સિરી અને એલેક્સા તમે શું કહી રહ્યા છો તે કેવી રીતે સમજે છે?
વોઇસ આસિસ્ટન્ટ્સ આ કૂલ, મુખ્યત્વે સ્ત્રી અવાજો હોઈ શકે છે જે નજીકના રેસ્ટોરન્ટ અથવા મોલનો સૌથી ટૂંકો રસ્તો શોધવાની તમારી વિનંતીઓનો જવાબ આપે છે.
