કેસ સ્ટડી: ઉચ્ચારણ સંગ્રહ

૧૩ ભાષાઓમાં બહુભાષી ડિજિટલ સહાયકો બનાવવા માટે ૭ મિલિયનથી વધુ ઉચ્ચારણો પહોંચાડ્યા.

ઉચ્ચારણ સંગ્રહ

વાસ્તવિક દુનિયાનું સમાધાન

ડેટા જે વૈશ્વિક વાતચીતોને શક્તિ આપે છે

ઉચ્ચારણ તાલીમની જરૂરિયાત ઊભી થાય છે કારણ કે બધા ગ્રાહકો સ્ક્રિપ્ટેડ ફોર્મેટમાં તેમના વૉઇસ સહાયકો સાથે વાતચીત કરતી વખતે અથવા પ્રશ્નો પૂછતી વખતે ચોક્કસ શબ્દો અથવા શબ્દસમૂહોનો ઉપયોગ કરતા નથી. એટલા માટે ચોક્કસ વૉઇસ એપ્લિકેશનોને સ્વયંભૂ વાણી ડેટા પર તાલીમ આપવી આવશ્યક છે. દા.ત., "સૌથી નજીકની હોસ્પિટલ ક્યાં આવેલી છે?" "મારી નજીક હોસ્પિટલ શોધો" અથવા "નજીકમાં કોઈ હોસ્પિટલ છે?" બધા એક જ શોધ હેતુ દર્શાવે છે પરંતુ અલગ રીતે ઉચ્ચારવામાં આવે છે.

ઉચ્ચારણ સંગ્રહ ૧

સમસ્યા

વિશ્વવ્યાપી ભાષાઓ માટે ક્લાયન્ટ્સના ડિજિટલ આસિસ્ટન્ટના સ્પીચ રોડમેપને અમલમાં મૂકવા માટે, ટીમને સ્પીચ રેકગ્નિશન AI મોડેલ માટે મોટા પ્રમાણમાં તાલીમ ડેટા મેળવવાની જરૂર હતી. ક્લાયન્ટની મહત્વપૂર્ણ જરૂરિયાતો આ હતી:

  • ૧૩ વૈશ્વિક ભાષાઓમાં વાણી ઓળખ સેવાઓ માટે મોટા પ્રમાણમાં તાલીમ ડેટા (૩-૩૦ સેકન્ડથી વધુ નહીં તેવા સિંગલ સ્પીકર ઉચ્ચારણ સંકેતો) મેળવો.
  • દરેક ભાષા માટે, સપ્લાયર સ્પીકર્સ માટે રેકોર્ડ કરવા માટે ટેક્સ્ટ પ્રોમ્પ્ટ જનરેટ કરશે (સિવાય કે
    ક્લાયન્ટ સપ્લાય) અને પરિણામી ઑડિઓનું ટ્રાન્સક્રાઇબ કરો.
  • સંબંધિત JSON ફાઇલો સાથે રેકોર્ડ કરેલા ઉચ્ચારણોનો ઑડિઓ ડેટા અને ટ્રાન્સક્રિપ્શન પ્રદાન કરો.
    બધા રેકોર્ડિંગ્સ માટે મેટાડેટા ધરાવતો.
  • ઉંમર, લિંગ, શિક્ષણ અને બોલી દ્વારા વક્તાઓનું વૈવિધ્યસભર મિશ્રણ સુનિશ્ચિત કરો
  • સ્પષ્ટીકરણો અનુસાર રેકોર્ડિંગ વાતાવરણના વૈવિધ્યસભર મિશ્રણની ખાતરી કરો.
  • દરેક ઓડિયો રેકોર્ડિંગ ઓછામાં ઓછું 16kHz હોવું જોઈએ પરંતુ પ્રાધાન્યમાં 44kHz હોવું જોઈએ.

"ઘણા વિક્રેતાઓનું મૂલ્યાંકન કર્યા પછી, ક્લાયન્ટે વાતચીતના AI પ્રોજેક્ટ્સમાં તેમની કુશળતાને કારણે Shaip ને પસંદ કર્યું. અમે Shaip ની પ્રોજેક્ટ અમલીકરણ ક્ષમતા, કડક સમયમર્યાદામાં અને જરૂરી ગુણવત્તા સાથે 13 ભાષાઓમાં નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી જરૂરી ઉચ્ચારણો સ્ત્રોત, ટ્રાન્સક્રાઇબ અને પહોંચાડવાની તેમની કુશળતાથી પ્રભાવિત થયા હતા."

ઉકેલ

વાતચીતાત્મક AI ની અમારી ઊંડી સમજણ સાથે, અમે ક્લાયન્ટને તેમના AI-સંચાલિત સ્પીચ પ્રોસેસિંગ બહુભાષી વૉઇસ સ્યુટને તાલીમ આપવા માટે નિષ્ણાત ભાષાશાસ્ત્રીઓ અને ટીકાકારોની ટીમ સાથે ડેટા એકત્રિત, ટ્રાન્સક્રાઇબ અને ટીકા કરવામાં મદદ કરી.

શેપના કાર્યક્ષેત્રમાં વાણી ઓળખ માટે મોટા પ્રમાણમાં ઑડિઓ તાલીમ ડેટા મેળવવા, અમારા ટાયર 1 અને ટાયર 2 ભાષા રોડમેપ પરની બધી ભાષાઓ માટે બહુવિધ ભાષાઓમાં ઑડિઓ રેકોર્ડિંગ્સનું ટ્રાન્સક્રિપ્શન અને મેટાડેટા ધરાવતી અનુરૂપ JSON ફાઇલો પહોંચાડવાનો સમાવેશ થાય છે, પરંતુ તે મર્યાદિત ન હતો. શેપે જટિલ પ્રોજેક્ટ્સ માટે ML મોડેલ્સને તાલીમ આપવા માટે જરૂરી ગુણવત્તાના ઇચ્છિત સ્તરને જાળવી રાખીને સ્કેલ પર 3-30 સેકન્ડના ઉચ્ચારણો એકત્રિત કર્યા.

  • ઓડિયો એકત્રિત, ટ્રાન્સક્રાઇબ અને ટીકા: 22,250 કલાક
  • સમર્થિત ભાષાઓ: ૧૩ (ડેનિશ, કોરિયન, સાઉદી અરેબિયન અરબી, ડચ, મુખ્ય ભૂમિ અને તાઇવાન ચાઇનીઝ, ફ્રેન્ચ કેનેડિયન, મેક્સીકન સ્પેનિશ, ટર્કિશ, હિન્દી, પોલિશ, જાપાનીઝ, રશિયન)
  • ઉચ્ચારણોની સંખ્યા: 7M +
  • સમયરેખા: 7-8 મહિના

એઆઈ-સંચાલિત સ્પીચ પ્રોસેસિંગ બહુભાષી વૉઇસ સ્યુટ

૧૬ કિલોહર્ટ્ઝ પર ઓડિયો ઉચ્ચારણો એકત્રિત કરતી વખતે, અમે વિવિધ રેકોર્ડિંગ વાતાવરણમાં વય, લિંગ, શિક્ષણ અને બોલીઓ દ્વારા વક્તાઓનું સ્વસ્થ મિશ્રણ સુનિશ્ચિત કર્યું.

પરિણામ

નિષ્ણાત ભાષાશાસ્ત્રીઓ દ્વારા આપવામાં આવેલા ઉચ્ચ-ગુણવત્તાવાળા ઉચ્ચારણ ઑડિઓ ડેટાએ ક્લાયન્ટને 13 ગ્લોબલ ટાયર 1 અને 2 ભાષાઓમાં તેમના બહુભાષી વાણી ઓળખ મોડેલને સચોટ રીતે તાલીમ આપવા માટે સક્ષમ બનાવ્યું. ગોલ્ડ-સ્ટાન્ડર્ડ તાલીમ ડેટાસેટ્સ સાથે, ક્લાયન્ટ ભવિષ્યની વાસ્તવિક દુનિયાની સમસ્યાઓ ઉકેલવા માટે બુદ્ધિશાળી અને મજબૂત ડિજિટલ સહાય પ્રદાન કરી શકે છે.

ઉચ્ચ-ગુણવત્તાવાળા ઉચ્ચારણ ઑડિઓ ડેટા

અમારી કુશળતા

ભાષણના કલાકો એકત્રિત
0 +
વોઇસ ડેટા કલેક્ટર્સની ટીમ
0
PII સુસંગત
0 %
કૂલ નંબર
0 +
ડેટા સ્વીકૃતિ અને ચોકસાઈ
> 0
ફોર્ચ્યુન 500 ગ્રાહકો
0 +

તમારી આગામી AI પહેલમાં અમે કેવી રીતે મદદ કરી શકીએ તે અમને જણાવો.