એક અહંકાર કેન્દ્રિત ડેટાસેટ એ પ્રથમ વ્યક્તિના વિડિયો અને સેન્સર રેકોર્ડિંગ્સનો એક સંરચિત સંગ્રહ છે - જે માથા, છાતી અથવા કાંડા પર લગાવેલા કેમેરાથી કેદ કરવામાં આવે છે - જેનો ઉપયોગ રોબોટિક્સ અને એમ્બોડ્ડ AI સિસ્ટમ્સને લોકો કેવી રીતે જુએ છે, હલનચલન કરે છે અને કાર્ય કરે છે તેની તાલીમ આપવા માટે થાય છે. તે રોબોટના ઓનબોર્ડ કેમેરા ઓપરેશન દરમિયાન શું જોશે તેની સૌથી નજીકની મેચ છે, તેથી જ તે વિઝન-લેંગ્વેજ-એક્શન (VLA) મોડેલ તાલીમ માટે પાયારૂપ બની ગયું છે.
ફક્ત લેબ ફૂટેજ પર તાલીમ પામેલો રોબોટ ઘણીવાર લેબ છોડતા પહેલા જ દિવસે ક્રેશ થઈ જાય છે. તેનું કારણ ભાગ્યે જ મોડેલ હોય છે. તે ડેટા હોય છે.
મોટાભાગના તાલીમ વિડિઓ ટ્રાઇપોડ અથવા છત કેમેરાથી શૂટ કરવામાં આવે છે. આ પ્રકારના ફૂટેજ રૂમ બતાવે છે, પણ કામ નહીં. હાથ નહીં. વસ્તુ નહીં. રોબોટનો ઓનબોર્ડ કેમેરા ખરેખર કપ ઉપાડતી વખતે અથવા ડ્રોઅર ખોલતી વખતે જે ચોક્કસ ખૂણો જોશે તે નહીં. તે ગેપ એ છે જેને એક અહંકારી ડેટાસેટ બંધ કરવા માટે બનાવવામાં આવે છે.
આ માર્ગદર્શિકામાં અહંકાર કેન્દ્રિત ડેટાસેટ શું છે, શા માટે ફર્સ્ટ-પર્સન ડેટા આધુનિક રોબોટિક્સનો પાયો બન્યો છે અને એમ્બોડેડ AI છે, સારો ડેટા ખરેખર કેવો દેખાય છે અને લાઇસન્સ આપતા પહેલા કે કમિશનિંગ કરતા પહેલા ટીમોએ શું જોવું જોઈએ તે સમજાવવામાં આવ્યું છે.
અહંકારકેન્દ્રિત ડેટાસેટ શું છે?
એક અહંકાર કેન્દ્રિત ડેટાસેટ એ પ્રથમ વ્યક્તિના દૃષ્ટિકોણથી કેપ્ચર કરાયેલ વિડિઓ અને સેન્સર ડેટાનો એક સંરચિત સંગ્રહ છે. કેમેરા કાર્ય કરી રહેલા વ્યક્તિના માથા, છાતી અથવા કાંડા પર બેસે છે - ક્યારેક રોબોટ પર પણ - તેથી રેકોર્ડિંગ વિશ્વને બરાબર તે રીતે બતાવે છે જે રીતે અભિનેતા તેને જુએ છે.
"અહંકાર કેન્દ્રિત" નો અર્થ ફક્ત સ્વમાંથી થાય છે . ત્રીજા વ્યક્તિનો કેમેરા રૂમમાં શું થઈ રહ્યું છે તે બતાવે છે. અહંકાર કેન્દ્રિત કેમેરા બતાવે છે કે અભિનેતાના હાથ, આંખો અને સાધનો શું કરી રહ્યા છે જ્યારે તે થઈ રહ્યું છે. તે તફાવત નાનો લાગે છે. રોબોટિક્સ ટીમો માટે, તે બધું જ છે.
મોટાભાગના આધુનિક સ્વકેન્દ્રિત ડેટાસેટ્સ વિડિઓને વધારાના સંકેતો - ઊંડાઈ, ગતિ, ઑડિઓ અને ક્યારેક આંખ કે હાથ ટ્રેકિંગ - સાથે જોડે છે જેથી એક જ ક્ષણનો એકસાથે અનેક ખૂણાઓથી અભ્યાસ કરી શકાય.
[આ પણ વાંચો: રોબોટ તાલીમ ડેટા વ્યૂહરચના ]
રોબોટિક્સ અને એમ્બોઇડેડ AI માટે સ્વાર્થી ડેટા શા માટે મહત્વપૂર્ણ છે?
વાસ્તવિક દુનિયામાં રોબોટ્સ થોડા કારણોસર નિષ્ફળ જાય છે. ખોટો દૃષ્ટિકોણ ટોચની નજીક છે.

પ્રથમ-વ્યક્તિ ડેટા પર તાલીમ આપવાથી તે અનુવાદ પગલું દૂર થાય છે. મોડેલ એ જ દૃષ્ટિકોણથી શીખે છે જેનો તે પછીથી ઉપયોગ કરશે. તાજેતરના રોબોટ-લર્નિંગ સંશોધન દર્શાવે છે કે પ્રથમ-વ્યક્તિ ડેટા પર તાલીમ આપવામાં આવેલી નીતિઓ કાર્યના પ્રકાર પર આધાર રાખીને, મેનીપ્યુલેશન કાર્યોમાં 15-30% દ્વારા ત્રીજા-વ્યક્તિ-પ્રશિક્ષિત નીતિઓ કરતાં વધુ સારી કામગીરી બજાવી શકે છે. તેનો લાભ કાર્યમાં જ દેખાય છે: સ્વચ્છ પકડ, વધુ સારી હાથ-આંખનો સમય, ક્લટર માટે સ્માર્ટ પ્રતિભાવો અને આંશિક દૃશ્યો.
આ જ કારણ છે કે પ્રથમ-વ્યક્તિ ડેટા ભૌતિક AI સિસ્ટમ્સ અને વિઝન-લેંગ્વેજ-એક્શન મોડેલ્સની નવી લહેરના કેન્દ્રમાં બેસે છે - એવી સિસ્ટમ્સ જે દ્રશ્ય ઇનપુટ અને મૌખિક અથવા લેખિત સૂચના લે છે, પછી ભૌતિક વિશ્વમાં વાસ્તવિક ક્રિયા આઉટપુટ કરે છે.
ઉચ્ચ-ગુણવત્તાવાળા અહંકાર કેન્દ્રિત ડેટાસેટની અંદર
એકલા કાચો વિડિઓ પૂરતો નથી. ઉચ્ચ-ગુણવત્તાવાળા સ્વાર્થી ડેટા સંગ્રહ પ્રથમ-વ્યક્તિ વિડિઓને અન્ય ઘણા સંકેતો સાથે જોડે છે:
- સિંક્રનાઇઝ્ડ વિડિઓ સારા રિઝોલ્યુશનમાં, ઘણીવાર એક કરતાં વધુ ખૂણાથી (માથું, છાતી અથવા કાંડા)
- ઊંડાઈ ડેટા જે મોડેલને સમજવામાં મદદ કરે છે કે કોઈ વસ્તુ કેટલી દૂર છે, ફક્ત તે ફ્રેમમાં ક્યાં દેખાય છે તે જ નહીં
- મોશન સેન્સર (IMU) ડેટા જે માથા અને શરીરની ગતિવિધિઓને ફ્રેમ-દર-ફ્રેમ ટ્રેક કરે છે
- ઓડિયો — જેમાં આશ્ચર્યજનક રીતે સંદર્ભ હોય છે, જેમ કે બોર્ડ પર છરી અથવા નજીકમાં બોલતી વ્યક્તિ
- હાથ અથવા આંખ ટ્રેકિંગ ધ્યાન અને પકડ મહત્વપૂર્ણ હોય તેવા કાર્યો માટે
ખાસ વાત એ છે કે આ બધું મિલિસેકન્ડ સુધી લાઇનમાં હોવું જોઈએ. જો ઊંડાઈનો પ્રવાહ વિડિઓથી એક ક્વાર્ટર-સેકન્ડ પાછળ જાય, તો મોડેલ ખોટું કારણ-અને-અસર શીખે છે. સારી રીતે કેલિબ્રેટેડ કેપ્ચરની ટોચ પર સોલિડ અહંકાર કેન્દ્રિત ડેટા એનોટેશન એ છે જે કાચા રેકોર્ડિંગ્સને તાલીમ-તૈયાર ડેટામાં ફેરવે છે.
લેબ ફૂટેજ વિરુદ્ધ વાસ્તવિક દુનિયાના કેપ્ચર
તે એક અલગ પ્રકારની તાલીમ સમસ્યાનું ચિત્રણ કરવામાં મદદ કરે છે.
કલ્પના કરો કે કોઈને ઉપરથી લીધેલા ડ્રોન ફૂટેજ બતાવીને બાઇક ચલાવવાનું શીખવવામાં આવે છે. તેઓ બાઇક, રસ્તો અને રસ્તો જોશે. તેઓ હેન્ડલબારમાં ધ્રુજારી, ખૂણા પર આંખો કેવી રીતે આગળ જુએ છે, અથવા વળાંક લેતા પહેલા શરીર કેવી રીતે બદલાય છે તે જોશે નહીં. તેઓ તકનીકી રીતે જાણતા હશે કે બાઇકિંગ કેવું દેખાય છે . તેઓ જાણતા નહીં હોય કે તે કેવી રીતે કરવું.
લેબ ડેટામાં પણ સ્કેલ પર સમાન સમસ્યા છે. સ્વચ્છ લાઇટિંગ, સ્વચ્છ ટેબલ પર એક વસ્તુ, ક્લિપ દીઠ એક કાર્ય - તે વ્યવસ્થિત છે, પરંતુ તે એવી દુનિયા નથી જેમાં રોબોટ મોકલે છે. લેબ ફૂટેજ પર તાલીમ પામેલા મોડેલો ઘણીવાર પહેલા દિવસે કામ કરે છે અને ત્રીસ દિવસે અલગ પડી જાય છે, જ્યારે લાઇટિંગ ઝબકતી હોય છે, બે લોકો રસ્તાઓ પાર કરે છે, અથવા ત્રણ SKU એક જ શેલ્ફ પર બેસે છે.
વાસ્તવિક દુનિયાના અહંકાર કેન્દ્રિત કેપ્ચરથી ઘોંઘાટ પાછો આવે છે. તે ઘોંઘાટ જ મોડેલોને જમાવટ પછી પકડી રાખે છે.
[આ પણ વાંચો: VLA મોડેલો સ્વાર્થી વિડિઓનો ઉપયોગ કેવી રીતે કરે છે ]
અહંકારકેન્દ્રિત ડેટાસેટ સ્ટેકના ચાર સ્તરો
વિવિધ સમસ્યાઓ માટે અલગ અલગ ડેટા સ્તરોની જરૂર પડે છે. એક કાર્ય માટે બનાવેલ ડેટાસેટ ભાગ્યે જ બીજા કાર્યને સારી રીતે આવરી લે છે. મોટાભાગની ભૌતિક AI ટીમો સંપૂર્ણ એમ્બોઇડેડ AI ડેટાસેટ બનાવવા માટે જે સ્તરોને એકસાથે સ્ટેક કરે છે તેના વિશે વિચારવાની અહીં એક સરળ રીત છે:
| સ્તર બદલવા માટે | તે શું કેપ્ચર કરે છે | તે શું તાલીમ આપે છે |
|---|---|---|
| માનવ સમજણ | રોજિંદા વાતાવરણમાં વાસ્તવિક માનવ પ્રવૃત્તિ | પાયાની ધારણા — લોકો કેવી રીતે હલનચલન કરે છે, વસ્તુઓ પકડી રાખે છે, કાર્યો કેવી રીતે બદલાય છે |
| કાર્ય અમલ | મેનિપ્યુલેશન ડેટા: ટ્રેજેક્ટોરીઝ, ગ્રિપ્સ, સંયુક્ત સ્થિતિઓ | રોબોટ ગતિ નિયંત્રણ અને કૌશલ્ય પુનરાવર્તન |
| સૂચના અનુસરણ | દ્રષ્ટિ + મૌખિક અથવા લેખિત સૂચનાઓ + ક્રિયાઓ | વિઝન-લેંગ્વેજ-એક્શન મોડેલ્સ જે સૂચનાને વાસ્તવિક ક્રિયામાં ફેરવે છે |
| વર્કફ્લો પૂર્ણ | અપવાદ હેન્ડલિંગ સાથે લાંબો, બહુ-પગલાંનો કાર્ય ડેટા | લાંબા ગાળાના તર્ક અને કંઈક ખોટું થાય ત્યારે પુનઃપ્રાપ્તિ |
મોટાભાગની પ્રોડક્શન ટીમો એક કરતાં વધુ સ્તરોમાંથી કામ કરે છે. ઉદાહરણ તરીકે, એક માનવીય પદાર્થ જેને ડીશવોશર લોડ કરવાની જરૂર હોય છે, તે ઓછામાં ઓછા ત્રણ સ્તરોમાંથી કામ કરે છે: માનવ પ્રદર્શન, સૂક્ષ્મ મેનીપ્યુલેશન અને પગલું-દર-પગલાં કાર્ય માળખું.
જ્યાં સ્વાર્થી ડેટા વાસ્તવિક માંગને આગળ ધપાવે છે

આ પ્રકારનો તફાવત વિવિધ ઉદ્યોગોમાં દેખાઈ રહ્યો છે, અને તેથી જ કેટલાક ચોક્કસ સ્થળોએ પ્રથમ વ્યક્તિ તાલીમ ડેટાની માંગ વધી રહી છે:
- હ્યુમનોઇડ અને હોમ રોબોટ્સ. રસોઈ બનાવવી, સફાઈ કરવી, કરિયાણાનો સામાન મૂકવો. જે કાર્યો રોબોટને જોયા વિના સરળ લાગે છે, તે અજમાવી જુઓ.
- સ્વાયત્ત ગતિશીલતા. ડ્રાઇવિંગ, કેબિનમાં વર્તન, છેલ્લા માઇલ ડિલિવરી. પ્રથમ વ્યક્તિ કેપ્ચર સિમ્યુલેશન અને વાસ્તવિક શેરીઓ વચ્ચેનું અંતર ઘટાડે છે.
- ઔદ્યોગિક અહંકાર કેન્દ્રિત ડેટાસેટ્સ. ફેક્ટરીના માળ, એસેમ્બલી લાઇન, તેલ અને ગેસ સાઇટ્સ - સલામતી શોધ, એર્ગોનોમિક ટ્રેકિંગ અને કાર્યકર-સહાયક રોબોટિક્સને તાલીમ આપવા માટે વપરાય છે.
- સર્જિકલ ફર્સ્ટ-પર્સન વિડિઓ ડેટા. સહાયક મોડેલો અને તબીબી AR સિસ્ટમોને તાલીમ આપવા માટે ઉપયોગમાં લેવાતા સર્જનો દ્વારા પહેરવામાં આવતા હેડ-માઉન્ટેડ કેમેરામાંથી પ્રક્રિયા કેપ્ચર.
- છૂટક ગ્રાહક વર્તન અહંકાર કેન્દ્રિત ડેટા. વાસ્તવિક દુકાનોમાં ખરીદદારોના પહેરી શકાય તેવા ફૂટેજ, જેનો ઉપયોગ શેલ્ફ પર ધ્યાન, નેવિગેશન અને નિર્ણય લેવાની ક્ષમતાનો અભ્યાસ કરવા માટે થાય છે.
વિવિધ ઉદ્યોગો, સમાન મૂળભૂત જરૂરિયાત: ડેટા જે કામ જેવો દેખાય છે, પ્રયોગશાળા જેવો નહીં.
એક અહંકારી ડેટાસેટ મોડેલને શું તૈયાર કરે છે?
તમે ઇન-હાઉસ બનાવી રહ્યા હોવ કે સ્વાર્થી ડેટા પ્રદાતાઓનું મૂલ્યાંકન કરી રહ્યા હોવ, પાંચ બાબતો સંશોધન-ગ્રેડ ડેટાને ઉત્પાદનમાં ટકી રહેલા ડેટાથી અલગ કરે છે:

- અહંકાર કેન્દ્રિત ડેટા એનોટેશન ઊંડાઈ. ફક્ત બાઉન્ડિંગ બોક્સ જ નહીં. હાથના પોઝ, ઑબ્જેક્ટ સ્ટેટ્સ, એક્શન સ્ટેપ્સ અને ઇન્ટેન્ટ - બધું જ યોગ્ય ફ્રેમમાં ગોઠવાયેલ છે.
- સેન્સર કેલિબ્રેશન. વિડિયો, ડેપ્થ, ઑડિઓ અને ગતિ વચ્ચે સમય-સમન્વય જેથી મોડેલ પાંચ વહેતા પ્રવાહોને નહીં, પણ એક સુસંગત ક્ષણ જુએ.
- એજ-કેસ કવરેજ. ઓછો પ્રકાશ, અવરોધ, ભીડવાળા દ્રશ્યો, દુર્લભ ઘટનાઓ. એવા કિસ્સાઓ જ્યાં લેબ ડેટા શાંતિથી ખાલી જગ્યા છોડી દે છે. ડેટા ભાગીદારોનું મૂલ્યાંકન કરતી વખતે ઉદ્યોગ ખરીદનાર સર્વેક્ષણો સતત એનોટેશન ગુણવત્તા અને એજ-કેસ કવરેજને ટોચના બે માપદંડ તરીકે ક્રમ આપે છે.
- સંમતિ અને પાલન. પ્રથમ વ્યક્તિનો વિડિઓ વ્યાખ્યા દ્વારા સંવેદનશીલ છે. ડેટાસેટ્સને દસ્તાવેજીકૃત સહભાગીની સંમતિ, જ્યાં જરૂર હોય ત્યાં ચહેરાની ઓળખ રદ કરવાની અને GDPR અને HIPAA જેવા ફ્રેમવર્ક સાથે સંરેખણની જરૂર પડે છે. ISO 27001 અને SOC 2 પ્રકાર II જેવા વિક્રેતા નિયંત્રણો એન્ટરપ્રાઇઝ કાનૂની ટીમો અપેક્ષા રાખે છે તે પ્રક્રિયાગત સ્તર ઉમેરે છે.
- વાસ્તવિક તૈયારી. વાસ્તવિક દુનિયાના ફૂટેજ જે કૃત્રિમ ડેટા સાથે સ્વચ્છ રીતે જોડાય છે, જેથી ટીમો મોડેલોને વિશ્વસનીય બનાવતી ગ્રાઉન્ડિંગ ગુમાવ્યા વિના તાલીમનું સ્તર બદલી શકે.
ગુણવત્તાયુક્ત ડેટા સંગ્રહ એ એવો ભાગ છે જેને પછીથી ઠીક કરવો સૌથી મુશ્કેલ હોય છે. તેને સ્રોત પર જ મેળવો, અને બાકીની પાઇપલાઇન સરળ બની જાય છે.
કી ટેકવેઝ
- એક અહંકાર કેન્દ્રિત ડેટાસેટ એ પ્રથમ વ્યક્તિનો વિડિઓ અને સેન્સર ડેટા છે — અભિનેતાના પોતાના દ્રષ્ટિકોણથી કેદ કરાયેલ — રોબોટિક્સને તાલીમ આપવા અને AI મોડેલ્સને મૂર્તિમંત બનાવવા માટે ઉપયોગમાં લેવાય છે જે રીતે તેઓ વાસ્તવમાં જમાવટમાં વિશ્વને જોશે.
- પ્રથમ વ્યક્તિનો ડેટા દ્રષ્ટિ-ક્રિયા વચ્ચેનો તફાવત બંધ કરે છે જેના કારણે પ્રયોગશાળા-પ્રશિક્ષિત રોબોટ્સ વાસ્તવિક શિફ્ટમાં નિષ્ફળ જાય છે.
- ગુણવત્તાયુક્ત અહંકાર કેન્દ્રિત ડેટા બહુવિધ મોડલ છે — વિડિઓ, ઊંડાઈ, ઑડિઓ, ગતિ અને ટ્રેકિંગ — મિલિસેકન્ડમાં સિંક્રનાઇઝ થાય છે.
- ઉત્પાદન-તૈયાર એટલે ટીકા કરતાં વધુ — તેનો અર્થ એ છે કે એજ-કેસ કવરેજ, વાસ્તવિક દુનિયાના વાતાવરણ, સિમ-ટુ-રીઅલ તૈયારી અને દસ્તાવેજીકૃત અનુપાલન ટ્રેઇલ.
શેપ કેવી રીતે મદદ કરી શકે છે
જો તમારી ટીમ "શું આપણને સ્વાર્થી ડેટાની જરૂર છે" ના તબક્કામાંથી પસાર થઈ ગઈ હોય અને "આપણે ખરેખર તે કેવી રીતે મેળવી શકીએ" માં હોય, તો ત્યાં શેપ ફિટ બેસે છે.
અમે ભૌતિક AI પ્રોગ્રામ્સ પાછળ સંપૂર્ણ ડેટા પાઇપલાઇન ચલાવીએ છીએ - વાસ્તવિક વાતાવરણમાં પ્રથમ-વ્યક્તિ કેપ્ચર, VLA-ગ્રેડ એનોટેશન, કૃત્રિમ ડેટા, RLHF અને એક જોડાણ હેઠળ મૂલ્યાંકન બેન્ચમાર્ક. કેટલીક સ્પષ્ટતાઓ:
- વાસ્તવિક દુનિયાનું કેપ્ચર, લેબ ફૂટેજ નહીં. રસોડા, વેરહાઉસ, ફેક્ટરીઓ, આરોગ્યસંભાળ સુવિધાઓ અને સ્ટોર્સમાં હેડ-માઉન્ટેડ કેમેરા, સ્માર્ટ ચશ્મા અને પહેરવાલાયક વસ્તુઓ.
- મલ્ટી-સેન્સર સિંક્રનાઇઝેશન. વિડિઓ, IMU, LiDAR, ઑડિઓ અને ઊંડાઈ — મિલિસેકન્ડમાં માપાંકિત અને સમય-સંરેખિત.
- VLA તાલીમ માટે બનાવેલ ટીકા. વસ્તુઓ, ક્રિયાઓ, હાથ-વસ્તુ ક્રિયાપ્રતિક્રિયાઓ, ઉદ્દેશ્ય અને અવકાશી સંદર્ભ.
- સિમ-ટુ-રીઅલ સપોર્ટ. સિન્થેટિક જનરેશન અને Real2Sim પાઇપલાઇન્સ જે વાસ્તવિક ગ્રાઉન્ડિંગ ગુમાવ્યા વિના કવરેજને વિસ્તૃત કરે છે.
- પહેલા દિવસથી જ પાલન. ISO 27001, SOC 2 પ્રકાર II, HIPAA-તૈયાર, અને GDPR — સંમતિ-પ્રથમ સંગ્રહ અને ઓડિટ-તૈયાર ડેટા ઉત્પત્તિ સાથે.
જો તે તમારા ભૌતિક AI પ્રોગ્રામ ક્યાં જઈ રહ્યો છે તે દર્શાવે છે, તો અમને પાયલોટ પ્રોજેક્ટનો સમાવેશ કરવામાં ખુશી થશે.
ઉપસંહાર
એક અહંકાર કેન્દ્રિત ડેટાસેટ ફક્ત પ્રથમ વ્યક્તિનો વિડિઓ નથી. તે મશીનોને લોકો જે રીતે જુએ છે અને કાર્ય કરે છે તે શીખવવાની એક સંરચિત રીત છે. રોબોટિક્સ અને એમ્બોલ્ડ AI ટીમો માટે, તે એક મોડેલ જે સારી રીતે પ્રદર્શન કરે છે અને જે મોકલે છે તે વચ્ચેનો તફાવત છે. ધ્યેય હ્યુમનૉઇડ્સ, સ્વાયત્તતા, અથવા સ્માર્ટ ફેક્ટરીઓ હોય, રોબોટિક્સ અને AI વિકાસ માટેનો અહંકાર કેન્દ્રિત ડેટા દરેક ગંભીર એમ્બોલ્ડ AI ડેટાસેટ વ્યૂહરચનાનો મુખ્ય સ્તર બની રહ્યો છે - વૈકલ્પિક નહીં. જે ટીમો તેને યોગ્ય રીતે કરે છે તે તે છે જે ડેટા - સંગ્રહ, ટીકા, માન્યતા અને પાલન - ને સિસ્ટમના મુખ્ય ભાગ તરીકે ગણે છે, તેના પહેલા એક પગલું નહીં.
સરળ શબ્દોમાં કહીએ તો અહંકારકેન્દ્રિત ડેટાસેટ શું છે?
તે પ્રથમ વ્યક્તિના દૃષ્ટિકોણથી કેપ્ચર કરાયેલ વિડિઓ અને સેન્સર રેકોર્ડિંગ્સનો એક સંરચિત સમૂહ છે - સામાન્ય રીતે માથા, છાતી અથવા કાંડા પર પહેરવામાં આવતા કેમેરામાંથી - જેનો ઉપયોગ લોકો કાર્યો કેવી રીતે જુએ છે અને કરે છે તે અંગે AI સિસ્ટમોને તાલીમ આપવા માટે થાય છે.
રોબોટિક્સ ટીમોને નિયમિત ત્રીજા વ્યક્તિના વિડિયોને બદલે સ્વાર્થી ડેટાની જરૂર કેમ છે?
ત્રીજા વ્યક્તિનો વિડિયો દૃશ્યને નજીકના લોકોના દૃષ્ટિકોણથી બતાવે છે. રોબોટ્સ પોતાના દ્રષ્ટિકોણથી કાર્ય કરે છે. પ્રથમ વ્યક્તિના ડેટા પર તાલીમ મોડેલ શું શીખે છે અને રોબોટ ખરેખર કામ પર શું જુએ છે તે વચ્ચેનું અંતર ઘટાડે છે, મેનિપ્યુલેશન કાર્યોમાં 15-30% ની દસ્તાવેજીકૃત ચોકસાઈનો લાભ મળે છે.
સ્વકેન્દ્રિત ડેટા મેળવવા માટે સામાન્ય રીતે કયા સેન્સરનો ઉપયોગ થાય છે?
RGB કેમેરા, ડેપ્થ સેન્સર, મોશન (IMU) સેન્સર અને ઑડિઓ. ઘણા સેટઅપમાં હાથ અથવા આંખ ટ્રેકિંગ પણ ઉમેરવામાં આવે છે. ઓટોનોમસ રોબોટિક્સ માટે, LiDAR ક્યારેક અવકાશી મેપિંગ માટે સ્તરીય હોય છે.
વિઝન-લેંગ્વેજ-એક્શન (VLA) તાલીમમાં અહંકાર કેન્દ્રિત ડેટા કેવી રીતે ફિટ થાય છે?
VLA મોડેલો દ્રશ્ય ઇનપુટ અને ભાષા સૂચના લે છે, પછી ક્રિયા આઉટપુટ કરે છે. અહંકાર કેન્દ્રિત ડેટા તેમને મેળ ખાતા દૃશ્ય, સૂચના અને પરિણામ ત્રિપુટી આપે છે જે તેમને તે મેપિંગને વિશ્વસનીય રીતે શીખવા માટે જરૂરી છે.
સંશોધન-ગ્રેડના અહંકારકેન્દ્રિત ડેટાસેટને ડિપ્લોયમેન્ટ-ગ્રેડ ડેટાસેટથી શું અલગ પાડે છે?
ત્રણ બાબતો: કડક ટીકા ગુણવત્તા, પ્રયોગશાળાઓ કરતાં વાસ્તવિક દુનિયાના વાતાવરણમાં વ્યાપક પર્યાવરણીય કવરેજ, અને સંમતિ, ગોપનીયતા અને ઓડિટ-તૈયાર ડેટા ઉત્પત્તિને આવરી લેતું દસ્તાવેજીકૃત અનુપાલન ટ્રેઇલ.