ભારતીય ભાષા ભાષણ ડેટા સંગ્રહ કેસ સ્ટડી: હિન્દી, તેલુગુ અને અંગ્રેજીમાં 300 કલાક

તેમના AI-સંચાલિત સ્પીચ પ્રોસેસિંગ બહુભાષી વૉઇસ સ્યુટને તાલીમ આપવા માટે ઉચ્ચ-ગુણવત્તાવાળા ઑડિઓ ડેટા સંગ્રહ, ટ્રાન્સક્રિપ્શન અને એનોટેશન સેવાઓ પ્રદાન કરી.

ભારતીય ભાષાઓ માટે બહુભાષી વાતચીત AI

પ્રોજેક્ટ ઝાંખી: ભારતીય ભાષા સ્થાનિકીકરણ પ્લેટફોર્મ માટે ભાષણ ડેટા

ક્લાયન્ટ એવી ટેકનોલોજીઓનું નિર્માણ કરે છે જે ડિજિટલ દુનિયામાં ભાષાના વિભાજનને દૂર કરે છે. એપ્સ અને પોર્ટલમાંથી સામગ્રી તેમના લેંગ્વેજ-એઝ-એ-સર્વિસ પ્લેટફોર્મ દ્વારા રીઅલ-ટાઇમમાં બહુવિધ ભાષાઓમાં વિતરિત કરી શકાય છે. લેંગ્વેજ પ્લેટફોર્મ રીઅલ-ટાઇમમાં બહુવિધ ભાષાઓમાં એપ્લિકેશન્સ અને પોર્ટલમાંથી સ્થિર અને ગતિશીલ સામગ્રી પહોંચાડે છે.

તેઓ મોબાઇલ બ્રાન્ડ્સ, ચિપસેટ ઉત્પાદકો, ગ્રાહક ઇન્ટરનેટ, બેંકો અને નાણાકીય સંસ્થાઓ, શિક્ષણ સરકારો, મનોરંજન અને વધુ જેવા અનેક ગ્રાહકોને ભાષા સ્થાનિકીકરણ પહોંચાડે છે.

વાતચીત એ.આઈ

મુખ્ય પરિણામો: 3 ભાષાઓમાં 300 કલાક એકત્રિત

ઓડિયો ડેટા એકત્રિત, ટ્રાન્સક્રાઇબ અને ટીકા કરેલ

300 કલાક

ની સંખ્યા
ભાષા

૬ (૨૦૦ કલાક x ૬ ભાષાઓ)

ટ્રાન્સક્રાઇબ કરેલી અને ટીકા કરેલી ભાષાઓ

ભારતીય અંગ્રેજી, હિન્દી, તેલુગુ

પ્રોજેક્ટ
સમયરેખા

12 વીક્સ

પડકાર: વસ્તી વિષયક રીતે વૈવિધ્યસભર વાતચીત ભાષણનો સ્ત્રોત

ગુણવત્તાયુક્ત ભાષાશાસ્ત્રીઓ, નિષ્ણાત ડેટા એનોટેટર્સ અને કડક સમયરેખાઓનો અભાવ વાતચીતાત્મક AI ની પ્રગતિ અને અપનાવવામાં અવરોધ રહ્યો છે. ભાષાશાસ્ત્રીઓને સોર્સ કરવા, જરૂરી ગુણવત્તા સાથે મોટા જથ્થામાં ડેટાસેટનું ટ્રાન્સક્રિપ્શન અને ટીકા કરવી, જે AI ક્ષમતાઓ બનાવવા માટે પૂરતી છે, તે સમય માંગી લે તેવું અને ખર્ચાળ કાર્ય છે જેને વિવિધ ક્ષેત્રોમાંથી કુશળ સંસાધનોની જરૂર પડે છે.

ક્લાયન્ટની મહત્વપૂર્ણ જરૂરિયાતો આ હતી:

  1. ઑડિઓ સંગ્રહ માટે ગુણવત્તાયુક્ત ભાષાશાસ્ત્રીઓની ઍક્સેસ: વસ્તી વિષયક વિવિધતા ધરાવતા નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી ભારતીય અંગ્રેજી, હિન્દી અને તેલુગુ જેવી ભાષાઓ માટે 300 કલાકનો ઑડિયો એકત્રિત કરો.
  2. ૯૦% ની ન્યૂનતમ ચોકસાઈ સાથે જટિલ ઓડિયો ટ્રાન્સક્રિપ્શન અને ટીકા:
    • બધી ઑડિઓ ફાઇલોનું ટ્રાન્સક્રાઇબ કર્યું, બધા શબ્દો બોલ્યા મુજબ કેપ્ચર કર્યા - જેમાં ખચકાટ, ફિલર શબ્દો, ખોટી શરૂઆત અને અન્ય મૌખિક યુક્તિઓનો સમાવેશ થાય છે.
    • બોલી ઉચ્ચારણો, ખોટા ઉચ્ચારણવાળા શબ્દો, બિન-માનક ઉપયોગ અને વિરામચિહ્નો સાથે સંકળાયેલ કડક ટ્રાન્સક્રિપ્શન માર્ગદર્શિકા હોવા છતાં ભૂલ-મુક્ત આઉટપુટ પ્રદાન કર્યું.
  3. ડેટા ડિલિવરી: ૧૨ અઠવાડિયાની સમયમર્યાદામાં ૩ ભાષાઓ માટે ઉચ્ચ-ગુણવત્તાવાળી અને વૈવિધ્યસભર ઑડિઓ ફાઇલોની ડિલિવરી, અનુરૂપ ટ્રાન્સક્રિપ્ટ્સ (JSON ફોર્મેટ) સાથે.

ઉકેલ: ડોમેન-વિશિષ્ટ ઑડિઓ સંગ્રહ, ટ્રાન્સક્રિપ્શન અને ટીકા

વાતચીતાત્મક AI ની અમારી ઊંડી સમજણ સાથે, અમે ક્લાયન્ટને તેમના AI-સંચાલિત બહુભાષી વૉઇસ સ્યુટને તાલીમ આપવા માટે નિષ્ણાત ભાષાશાસ્ત્રીઓ અને ટીકાકારોની ટીમ દ્વારા ડેટા એકત્રિત, ટ્રાન્સક્રાઇબ અને ટીકા કરવામાં મદદ કરી.

ઘણા વિક્રેતાઓનું મૂલ્યાંકન કર્યા પછી, ક્લાયન્ટે કડક સમયમર્યાદામાં, ખર્ચ-અસરકારક રીતે અને જરૂરી ગુણવત્તા સાથે વાતચીતના AI પ્રોજેક્ટ્સ પૂર્ણ કરવાની અમારી કુશળતાને કારણે Shaip પસંદ કર્યું. તેમની ટીમ Shaip ની મજબૂત અને વ્યાપક પ્રોજેક્ટ અમલીકરણ ક્ષમતાથી પણ પ્રભાવિત થઈ.

ભાષા કલાકોની સંખ્યા અનસ્ક્રિપ્ટેડ સામાન્ય વાતચીત (૫૦%) અનસ્ક્રિપ્ટેડ કોલ સેન્ટર વાતચીત (30%) ઓનલાઈન સ્ક્રેપ્ડ મીડિયા કન્ટેન્ટ (૨૦%)
હિન્દી 100 50 30 20
અંગ્રેજી 100 50 30 20
ટેલિગુ 100 50 30 20
કુલ 300 150 90 60
  1. વધારાની ઑડિઓ સંગ્રહ આવશ્યકતાઓ
    • આવર્તન: નમૂના લેવાનો દર - 16 kHz
    • ફોર્મેટ: WAV
    • સમયગાળો - સામાન્ય સમયગાળો (૫-૩૦ મિનિટ) - વાતચીત
    • સ્પીચ ડોમેન - BFSI, ટેલિકોમ અને રિટેલ
    • વસ્તી વિષયક વિવિધતા - લિંગ: 1:1 ગુણોત્તર, વય શ્રેણી: 18-60, દરેક અનન્ય વક્તાને ઓળખવા માટે સ્પીકર ID કેપ્ચર કરો.
  2. ઑડિઓ સેગમેન્ટેશન, ટ્રાન્સક્રિપ્શન અને એનોટેશન માર્ગદર્શિકા અનુસરવામાં આવી

    ૨.૧ વિભાજન
    • ૩૦ સેકન્ડથી મોટી વ્યક્તિગત ફાઇલો માટે ૧૫ સેકન્ડના સેગમેન્ટ્સ બનાવો (મિલિસેકન્ડમાં ટાઇમસ્ટેમ્પ્ડ).
    • સેગમેન્ટ ધ્વનિ પ્રકારો - વાણી, બડબડાટ, સંગીત, અવાજ, ઓવરલેપ
    • સેગમેન્ટ લેબલિંગ - શરૂઆતનો સમય, સમાપ્તિ સમય, સેગમેન્ટ ID, અવાજનું સ્તર, પ્રાથમિક ધ્વનિ પ્રકાર,
      ભાષા કોડ, વક્તા ID


    ૨.૨ ટ્રાન્સક્રિપ્શન અને ટીકા

    • બધી ઓડિયો ફાઇલોનું ટ્રાન્સક્રાઇબ કર્યું, બધા શબ્દો બોલ્યા મુજબ કેપ્ચર કર્યા - જેમાં ખચકાટ, ફિલર શબ્દો, ખોટી શરૂઆત અને અન્ય મૌખિક યુક્તિઓ જેમ કે પ્રતીકો, અક્ષરોનો સમાવેશ થાય છે.
    • બોલી ઉચ્ચારણ, ખોટા ઉચ્ચારણવાળા શબ્દો, બિન-માનક ઉપયોગ, વિરામચિહ્નો, કેપિટલાઇઝેશન, સંક્ષેપ, સંકોચન, સંખ્યાઓ, સંક્ષિપ્ત શબ્દો, અસ્પષ્ટ અને અસ્પષ્ટ વાણી, બિન-લક્ષ્ય સાથે સંકળાયેલ કડક ટ્રાન્સક્રિપ્શન માર્ગદર્શિકા હોવા છતાં ભૂલ-મુક્ત આઉટપુટ પ્રદાન કર્યું.
      ભાષાઓ, અને વધુ.
  3. ડેટા ડિલિવરી
    બધી WAV ઑડિઓ અને ટ્રાન્સક્રિપ્ટ ફાઇલો 12 અઠવાડિયાની અંદર સમાવિષ્ટ અનન્ય સ્પીકરના વસ્તી વિષયક ડેટા અનુસાર JSON ફોર્મેટમાં વિતરિત કરવામાં આવી હતી.

પરિણામ: ઉત્પાદન માટે તૈયાર બહુભાષી વૉઇસ સ્યુટ

નિષ્ણાત ભાષાશાસ્ત્રીઓ દ્વારા આપવામાં આવેલા ઉચ્ચ-ગુણવત્તાવાળા એનોટેટેડ ઓડિયો ડેટાથી ક્લાયન્ટને તેમના AI-સંચાલિત સ્પીચ પ્રોસેસિંગ બહુભાષી વોઇસ સ્યુટને 3 ભાષાઓ એટલે કે ભારતીય અંગ્રેજી, હિન્દી અને તેલુગુમાં નિર્ધારિત સમયમાં સચોટ રીતે તાલીમ આપવાની શક્તિ મળી.

સુવર્ણ-માનક તાલીમ ડેટાસેટ્સ સાથે, ક્લાયન્ટ વાસ્તવિક દુનિયાની સમસ્યાઓ ઉકેલવા માટે બુદ્ધિશાળી અને મજબૂત સ્પીચ-ટુ-ટેક્સ્ટ, ભાષા અનુવાદ અને બહુભાષી કીપેડ સેવાઓ પ્રદાન કરવામાં સક્ષમ હતા.

ભાવ ચિહ્ન

અમે શેપની મજબૂત પ્રોજેક્ટ અમલીકરણ ક્ષમતા, નિષ્ણાત ભાષાશાસ્ત્રીઓ પાસેથી જરૂરી ઑડિઓ ડેટાને સ્રોત, ટ્રાન્સક્રાઇબ અને એનોટેટ કરવાની તેમની કુશળતાથી પ્રભાવિત થયા છીએ. બહુવિધ ગુણવત્તા ચકાસણી, કડક સમયરેખાનું પાલન અને ખર્ચ મૂલ્ય નેતૃત્વ જે તેઓ પ્રદાન કરે છે તે અનોખું છે.

★★★★★
ભાવ ચિહ્ન