ભારતીય ભાષા ભાષણ ડેટા સંગ્રહ કેસ સ્ટડી: હિન્દી, તેલુગુ અને અંગ્રેજીમાં 300 કલાક
તેમના AI-સંચાલિત સ્પીચ પ્રોસેસિંગ બહુભાષી વૉઇસ સ્યુટને તાલીમ આપવા માટે ઉચ્ચ-ગુણવત્તાવાળા ઑડિઓ ડેટા સંગ્રહ, ટ્રાન્સક્રિપ્શન અને એનોટેશન સેવાઓ પ્રદાન કરી.
પ્રોજેક્ટ ઝાંખી: ભારતીય ભાષા સ્થાનિકીકરણ પ્લેટફોર્મ માટે ભાષણ ડેટા
ક્લાયન્ટ એવી ટેકનોલોજીઓનું નિર્માણ કરે છે જે ડિજિટલ દુનિયામાં ભાષાના વિભાજનને દૂર કરે છે. એપ્સ અને પોર્ટલમાંથી સામગ્રી તેમના લેંગ્વેજ-એઝ-એ-સર્વિસ પ્લેટફોર્મ દ્વારા રીઅલ-ટાઇમમાં બહુવિધ ભાષાઓમાં વિતરિત કરી શકાય છે. લેંગ્વેજ પ્લેટફોર્મ રીઅલ-ટાઇમમાં બહુવિધ ભાષાઓમાં એપ્લિકેશન્સ અને પોર્ટલમાંથી સ્થિર અને ગતિશીલ સામગ્રી પહોંચાડે છે.
તેઓ મોબાઇલ બ્રાન્ડ્સ, ચિપસેટ ઉત્પાદકો, ગ્રાહક ઇન્ટરનેટ, બેંકો અને નાણાકીય સંસ્થાઓ, શિક્ષણ સરકારો, મનોરંજન અને વધુ જેવા અનેક ગ્રાહકોને ભાષા સ્થાનિકીકરણ પહોંચાડે છે.
મુખ્ય પરિણામો: 3 ભાષાઓમાં 300 કલાક એકત્રિત
ઓડિયો ડેટા એકત્રિત, ટ્રાન્સક્રાઇબ અને ટીકા કરેલ
300 કલાક
ની સંખ્યા
ભાષા
૬ (૨૦૦ કલાક x ૬ ભાષાઓ)
ટ્રાન્સક્રાઇબ કરેલી અને ટીકા કરેલી ભાષાઓ
ભારતીય અંગ્રેજી, હિન્દી, તેલુગુ
પ્રોજેક્ટ
સમયરેખા
12 વીક્સ
પડકાર: વસ્તી વિષયક રીતે વૈવિધ્યસભર વાતચીત ભાષણનો સ્ત્રોત
ગુણવત્તાયુક્ત ભાષાશાસ્ત્રીઓ, નિષ્ણાત ડેટા એનોટેટર્સ અને કડક સમયરેખાઓનો અભાવ વાતચીતાત્મક AI ની પ્રગતિ અને અપનાવવામાં અવરોધ રહ્યો છે. ભાષાશાસ્ત્રીઓને સોર્સ કરવા, જરૂરી ગુણવત્તા સાથે મોટા જથ્થામાં ડેટાસેટનું ટ્રાન્સક્રિપ્શન અને ટીકા કરવી, જે AI ક્ષમતાઓ બનાવવા માટે પૂરતી છે, તે સમય માંગી લે તેવું અને ખર્ચાળ કાર્ય છે જેને વિવિધ ક્ષેત્રોમાંથી કુશળ સંસાધનોની જરૂર પડે છે.
ક્લાયન્ટની મહત્વપૂર્ણ જરૂરિયાતો આ હતી:
- ઑડિઓ સંગ્રહ માટે ગુણવત્તાયુક્ત ભાષાશાસ્ત્રીઓની ઍક્સેસ: વસ્તી વિષયક વિવિધતા ધરાવતા નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી ભારતીય અંગ્રેજી, હિન્દી અને તેલુગુ જેવી ભાષાઓ માટે 300 કલાકનો ઑડિયો એકત્રિત કરો.
- ૯૦% ની ન્યૂનતમ ચોકસાઈ સાથે જટિલ ઓડિયો ટ્રાન્સક્રિપ્શન અને ટીકા:
- બધી ઑડિઓ ફાઇલોનું ટ્રાન્સક્રાઇબ કર્યું, બધા શબ્દો બોલ્યા મુજબ કેપ્ચર કર્યા - જેમાં ખચકાટ, ફિલર શબ્દો, ખોટી શરૂઆત અને અન્ય મૌખિક યુક્તિઓનો સમાવેશ થાય છે.
- બોલી ઉચ્ચારણો, ખોટા ઉચ્ચારણવાળા શબ્દો, બિન-માનક ઉપયોગ અને વિરામચિહ્નો સાથે સંકળાયેલ કડક ટ્રાન્સક્રિપ્શન માર્ગદર્શિકા હોવા છતાં ભૂલ-મુક્ત આઉટપુટ પ્રદાન કર્યું.
- ડેટા ડિલિવરી: ૧૨ અઠવાડિયાની સમયમર્યાદામાં ૩ ભાષાઓ માટે ઉચ્ચ-ગુણવત્તાવાળી અને વૈવિધ્યસભર ઑડિઓ ફાઇલોની ડિલિવરી, અનુરૂપ ટ્રાન્સક્રિપ્ટ્સ (JSON ફોર્મેટ) સાથે.
ઉકેલ: ડોમેન-વિશિષ્ટ ઑડિઓ સંગ્રહ, ટ્રાન્સક્રિપ્શન અને ટીકા
વાતચીતાત્મક AI ની અમારી ઊંડી સમજણ સાથે, અમે ક્લાયન્ટને તેમના AI-સંચાલિત બહુભાષી વૉઇસ સ્યુટને તાલીમ આપવા માટે નિષ્ણાત ભાષાશાસ્ત્રીઓ અને ટીકાકારોની ટીમ દ્વારા ડેટા એકત્રિત, ટ્રાન્સક્રાઇબ અને ટીકા કરવામાં મદદ કરી.
ઘણા વિક્રેતાઓનું મૂલ્યાંકન કર્યા પછી, ક્લાયન્ટે કડક સમયમર્યાદામાં, ખર્ચ-અસરકારક રીતે અને જરૂરી ગુણવત્તા સાથે વાતચીતના AI પ્રોજેક્ટ્સ પૂર્ણ કરવાની અમારી કુશળતાને કારણે Shaip પસંદ કર્યું. તેમની ટીમ Shaip ની મજબૂત અને વ્યાપક પ્રોજેક્ટ અમલીકરણ ક્ષમતાથી પણ પ્રભાવિત થઈ.
| ભાષા | કલાકોની સંખ્યા | અનસ્ક્રિપ્ટેડ સામાન્ય વાતચીત (૫૦%) | અનસ્ક્રિપ્ટેડ કોલ સેન્ટર વાતચીત (30%) | ઓનલાઈન સ્ક્રેપ્ડ મીડિયા કન્ટેન્ટ (૨૦%) |
|---|---|---|---|---|
| હિન્દી | 100 | 50 | 30 | 20 |
| અંગ્રેજી | 100 | 50 | 30 | 20 |
| ટેલિગુ | 100 | 50 | 30 | 20 |
| કુલ | 300 | 150 | 90 | 60 |
- વધારાની ઑડિઓ સંગ્રહ આવશ્યકતાઓ
- આવર્તન: નમૂના લેવાનો દર - 16 kHz
- ફોર્મેટ: WAV
- સમયગાળો - સામાન્ય સમયગાળો (૫-૩૦ મિનિટ) - વાતચીત
- સ્પીચ ડોમેન - BFSI, ટેલિકોમ અને રિટેલ
- વસ્તી વિષયક વિવિધતા - લિંગ: 1:1 ગુણોત્તર, વય શ્રેણી: 18-60, દરેક અનન્ય વક્તાને ઓળખવા માટે સ્પીકર ID કેપ્ચર કરો.
- ઑડિઓ સેગમેન્ટેશન, ટ્રાન્સક્રિપ્શન અને એનોટેશન માર્ગદર્શિકા અનુસરવામાં આવી
૨.૧ વિભાજન- ૩૦ સેકન્ડથી મોટી વ્યક્તિગત ફાઇલો માટે ૧૫ સેકન્ડના સેગમેન્ટ્સ બનાવો (મિલિસેકન્ડમાં ટાઇમસ્ટેમ્પ્ડ).
- સેગમેન્ટ ધ્વનિ પ્રકારો - વાણી, બડબડાટ, સંગીત, અવાજ, ઓવરલેપ
- સેગમેન્ટ લેબલિંગ - શરૂઆતનો સમય, સમાપ્તિ સમય, સેગમેન્ટ ID, અવાજનું સ્તર, પ્રાથમિક ધ્વનિ પ્રકાર,
ભાષા કોડ, વક્તા ID
૨.૨ ટ્રાન્સક્રિપ્શન અને ટીકા- બધી ઓડિયો ફાઇલોનું ટ્રાન્સક્રાઇબ કર્યું, બધા શબ્દો બોલ્યા મુજબ કેપ્ચર કર્યા - જેમાં ખચકાટ, ફિલર શબ્દો, ખોટી શરૂઆત અને અન્ય મૌખિક યુક્તિઓ જેમ કે પ્રતીકો, અક્ષરોનો સમાવેશ થાય છે.
- બોલી ઉચ્ચારણ, ખોટા ઉચ્ચારણવાળા શબ્દો, બિન-માનક ઉપયોગ, વિરામચિહ્નો, કેપિટલાઇઝેશન, સંક્ષેપ, સંકોચન, સંખ્યાઓ, સંક્ષિપ્ત શબ્દો, અસ્પષ્ટ અને અસ્પષ્ટ વાણી, બિન-લક્ષ્ય સાથે સંકળાયેલ કડક ટ્રાન્સક્રિપ્શન માર્ગદર્શિકા હોવા છતાં ભૂલ-મુક્ત આઉટપુટ પ્રદાન કર્યું.
ભાષાઓ, અને વધુ.
- ડેટા ડિલિવરી
બધી WAV ઑડિઓ અને ટ્રાન્સક્રિપ્ટ ફાઇલો 12 અઠવાડિયાની અંદર સમાવિષ્ટ અનન્ય સ્પીકરના વસ્તી વિષયક ડેટા અનુસાર JSON ફોર્મેટમાં વિતરિત કરવામાં આવી હતી.
પરિણામ: ઉત્પાદન માટે તૈયાર બહુભાષી વૉઇસ સ્યુટ
નિષ્ણાત ભાષાશાસ્ત્રીઓ દ્વારા આપવામાં આવેલા ઉચ્ચ-ગુણવત્તાવાળા એનોટેટેડ ઓડિયો ડેટાથી ક્લાયન્ટને તેમના AI-સંચાલિત સ્પીચ પ્રોસેસિંગ બહુભાષી વોઇસ સ્યુટને 3 ભાષાઓ એટલે કે ભારતીય અંગ્રેજી, હિન્દી અને તેલુગુમાં નિર્ધારિત સમયમાં સચોટ રીતે તાલીમ આપવાની શક્તિ મળી.
સુવર્ણ-માનક તાલીમ ડેટાસેટ્સ સાથે, ક્લાયન્ટ વાસ્તવિક દુનિયાની સમસ્યાઓ ઉકેલવા માટે બુદ્ધિશાળી અને મજબૂત સ્પીચ-ટુ-ટેક્સ્ટ, ભાષા અનુવાદ અને બહુભાષી કીપેડ સેવાઓ પ્રદાન કરવામાં સક્ષમ હતા.
અમે શેપની મજબૂત પ્રોજેક્ટ અમલીકરણ ક્ષમતા, નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી જરૂરી ઑડિઓ ડેટાને સ્રોત, ટ્રાન્સક્રાઇબ અને એનોટેટ કરવાની તેમની કુશળતાથી પ્રભાવિત થયા છીએ. બહુવિધ ગુણવત્તા ચકાસણી, કડક સમયરેખાનું પાલન અને ખર્ચ મૂલ્ય નેતૃત્વ જે તેઓ પ્રદાન કરે છે તે અનોખું છે.