એલએલએમ બેન્ચમાર્કિંગ

એલએલએમ બેન્ચમાર્કિંગ, પુનઃકલ્પના: માનવીય નિર્ણયને પાછો સ્થાપિત કરો

જો તમે ફક્ત ઓટોમેટેડ સ્કોર્સ જુઓ છો, તો મોટાભાગના LLMs સારા લાગે છે - જ્યાં સુધી તેઓ કંઈક સૂક્ષ્મ રીતે ખોટું, જોખમી અથવા અપ્રમાણિક લખતા નથી. સ્ટેટિક બેન્ચમાર્ક શું માપે છે અને તમારા વપરાશકર્તાઓને ખરેખર શું જોઈએ છે તે વચ્ચેનો આ તફાવત છે. આ માર્ગદર્શિકામાં, અમે બતાવીએ છીએ કે માનવ નિર્ણય (HITL) ને ઓટોમેશન સાથે કેવી રીતે મિશ્રિત કરવો જેથી તમારું LLM બેન્ચમાર્કિંગ સત્યતા, સલામતી અને ડોમેન ફિટને પ્રતિબિંબિત કરે - ફક્ત ટોકન-સ્તરની ચોકસાઈ જ નહીં.

LLM બેન્ચમાર્કિંગ ખરેખર શું માપે છે

સ્વયંસંચાલિત મેટ્રિક્સ અને લીડરબોર્ડ્સ ઝડપી અને પુનરાવર્તિત છે. બહુવિધ-પસંદગીના કાર્યો પર ચોકસાઈ, ટેક્સ્ટ સમાનતા માટે BLEU/ROUGE અને ભાષા મોડેલિંગ માટે ગૂંચવણ દિશાત્મક સંકેતો આપે છે. પરંતુ તેઓ ઘણીવાર તર્ક સાંકળો, તથ્યલક્ષી ગ્રાઉન્ડિંગ અને નીતિ પાલન ચૂકી જાય છે - ખાસ કરીને ઉચ્ચ-દાવના સંદર્ભોમાં. એટલા માટે આધુનિક કાર્યક્રમો બહુ-મેટ્રિક, પારદર્શક રિપોર્ટિંગ અને દૃશ્ય વાસ્તવિકતા પર ભાર મૂકે છે.

ઓટોમેટેડ મેટ્રિક્સ અને સ્ટેટિક ટેસ્ટ સેટ્સ

ક્લાસિક મેટ્રિક્સને સ્પીડોમીટર તરીકે વિચારો - સરળ હાઇવે પર તમે કેટલી ઝડપથી જઈ રહ્યા છો તે કહેવા માટે ઉત્તમ. પરંતુ તે તમને કહેતા નથી કે વરસાદમાં બ્રેક્સ કામ કરે છે કે નહીં. બ્લુ/રૂજ/ગૂંચવણ તુલનાત્મકતામાં મદદ કરે છે, પરંતુ તેમને યાદ રાખવા અથવા સપાટી-સ્તર મેચ દ્વારા રમી શકાય છે.

જ્યાં તેઓ ઓછા પડે છે

વાસ્તવિક વપરાશકર્તાઓ અસ્પષ્ટતા, ડોમેન શબ્દભંડોળ, વિરોધાભાસી ધ્યેયો અને બદલાતા નિયમો લાવે છે. સ્ટેટિક ટેસ્ટ સેટ ભાગ્યે જ તેને પકડે છે. પરિણામે, સંપૂર્ણપણે સ્વચાલિત બેન્ચમાર્ક જટિલ એન્ટરપ્રાઇઝ કાર્યો માટે મોડેલ તૈયારીને વધારે પડતો અંદાજ આપે છે. HELM/AIR-Bench જેવા સમુદાય પ્રયાસો વધુ પરિમાણો (મજબૂતાઈ, સલામતી, જાહેરાત) ને આવરી લઈને અને પારદર્શક, વિકસિત સ્યુટ્સ પ્રકાશિત કરીને આને સંબોધે છે.

LLM બેન્ચમાર્ક્સમાં માનવ મૂલ્યાંકન માટેનો કેસ

કેટલાક ગુણો માનવીય રીતે હઠીલા રહે છે: સ્વર, મદદરૂપતા, સૂક્ષ્મ શુદ્ધતા, સાંસ્કૃતિક યોગ્યતા અને જોખમ. માનવ મૂલ્યાંકનકર્તાઓ - યોગ્ય રીતે પ્રશિક્ષિત અને માપાંકિત - આ માટે આપણી પાસે શ્રેષ્ઠ સાધનો છે. યુક્તિ એ છે કે તેમનો પસંદગીયુક્ત અને વ્યવસ્થિત ઉપયોગ કરવામાં આવે , જેથી ખર્ચ વ્યવસ્થાપિત રહે જ્યારે ગુણવત્તા ઊંચી રહે.

માણસોને ક્યારે સામેલ કરવા

માણસોને ક્યારે સામેલ કરવા

  • અસ્પષ્ટતા: સૂચનાઓ બહુવિધ બુદ્ધિગમ્ય જવાબો સ્વીકારે છે.
  • ઉચ્ચ જોખમ: આરોગ્યસંભાળ, નાણાકીય, કાનૂની, સલામતી-મહત્વપૂર્ણ સહાય.
  • ડોમેન સૂક્ષ્મતા: ઉદ્યોગ શબ્દભંડોળ, વિશિષ્ટ તર્ક.
  • મતભેદના સંકેતો: સ્વચાલિત સ્કોર્સ વિરોધાભાસી હોય છે અથવા વ્યાપકપણે બદલાય છે.

ડિઝાઇનિંગ રૂબ્રિક્સ અને કેલિબ્રેશન (સરળ ઉદાહરણ)

શુદ્ધતા , ગ્રાઉન્ડનેસ અને નીતિ સંરેખણ માટે 1-5 સ્કેલથી શરૂઆત કરો . પ્રતિ સ્કોર 2-3 એનોટેટેડ ઉદાહરણો આપો. ટૂંકા કેલિબ્રેશન રાઉન્ડ ચલાવો : રેટર શેર કરેલ બેચનો સ્કોર કરે છે, પછી સુસંગતતાને કડક બનાવવા માટે તર્કની તુલના કરે છે. ઇન્ટર-રેટર કરારને ટ્રેક કરો અને બોર્ડરલાઇન કેસો માટે નિર્ણયની જરૂર છે.

પદ્ધતિઓ: LLM-as-a-Judge થી True HITL સુધી

LLM-as-a-Judge (એક મોડેલનો ઉપયોગ કરીને બીજા મોડેલને ગ્રેડ આપવો) ટ્રાયજ માટે ઉપયોગી છે : તે ઝડપી, સસ્તું છે અને સીધી તપાસ માટે સારી રીતે કામ કરે છે. પરંતુ તે સમાન બ્લાઇન્ડ સ્પોટ શેર કરી શકે છે - ભ્રમ, બનાવટી સહસંબંધ અથવા "ગ્રેડ ફુગાવો". તેનો ઉપયોગ માનવ સમીક્ષા માટે કેસોને પ્રાથમિકતા આપવા માટે કરો , તેને બદલવા માટે નહીં.

એક વ્યવહારુ હાઇબ્રિડ પાઇપલાઇન

એક વ્યવહારુ હાઇબ્રિડ પાઇપલાઇન

  1. સ્વચાલિત પ્રી-સ્ક્રીન: સ્પષ્ટ પાસ/નિષ્ફળતાઓને ફિલ્ટર કરવા માટે ટાસ્ક મેટ્રિક્સ, બેઝિક ગાર્ડરેલ્સ અને LLM-as-judge ચલાવો.
  2. સક્રિય પસંદગી: માનવ સમીક્ષા માટે વિરોધાભાસી સંકેતો અથવા ઉચ્ચ અનિશ્ચિતતા ધરાવતા નમૂનાઓ પસંદ કરો.
  3. નિષ્ણાત માનવ ટીકા: તાલીમ પામેલા રેટિંગર્સ (અથવા ડોમેન નિષ્ણાતો) સ્પષ્ટ રૂબ્રિક્સ સામે સ્કોર કરે છે; મતભેદોનો નિર્ણય લે છે.
  4. ગુણવત્તા ખાતરી: ઇન્ટર-રેટર વિશ્વસનીયતાનું નિરીક્ષણ કરો; ઓડિટ લોગ અને તર્ક જાળવો. હેન્ડ-ઓન ​​નોટબુક્સ (દા.ત., HITL વર્કફ્લો) આ લૂપને સ્કેલ કરતા પહેલા તેને પ્રોટોટાઇપ કરવાનું સરળ બનાવે છે.

સરખામણી કોષ્ટક: ઓટોમેટેડ વિરુદ્ધ LLM-as-Judge vs HITL

અભિગમ શક્તિ નબળાઇઓ શ્રેષ્ઠ ઉપયોગ
સ્વચાલિત મેટ્રિક્સ ઝડપી, પુનઃઉત્પાદનક્ષમ, સસ્તું સૂક્ષ્મતા/તર્કનો અભાવ, ઓવરફિટ કરવું સહેલું બેઝલાઇન અને રીગ્રેશન તપાસ
ન્યાયાધીશ તરીકે એલએલએમ ભીંગડા ટ્રાયેજ, સપાટીના મુદ્દાઓ શેર મોડેલ પૂર્વગ્રહ; ઓડિટ-ગ્રેડ નહીં માનવ સમીક્ષાઓને પ્રાથમિકતા આપો
HITL (નિષ્ણાત રેટિંગ આપનારાઓ) સૂક્ષ્મતા કેપ્ચર કરે છે, ઓડિટ માટે તૈયાર છે ટ્રાયજ વિના ધીમું, મોંઘું ઉચ્ચ જોખમી કાર્યો, નીતિ/સુરક્ષા દરવાજા

ટિપ: કવરેજ + વિશ્વસનીયતા માટે ત્રણેયને ભેગા કરો.

સલામતી અને જોખમના માપદંડો અલગ છે

નિયમનકારો અને માનક સંસ્થાઓ એવા મૂલ્યાંકનની અપેક્ષા રાખે છે જે જોખમોનું દસ્તાવેજીકરણ કરે, વાસ્તવિક દૃશ્યોનું પરીક્ષણ કરે અને દેખરેખ દર્શાવે. NIST AI RMF (2024 GenAI પ્રોફાઇલ) એક વહેંચાયેલ શબ્દભંડોળ અને પ્રથાઓ પ્રદાન કરે છે; NIST GenAI મૂલ્યાંકન કાર્યક્રમ ડોમેન-વિશિષ્ટ પરીક્ષણોને ઉભા કરી રહ્યો છે; અને HELM/AIR-Bench બહુ-મેટ્રિક, પારદર્શક પરિણામોને પ્રકાશિત કરે છે. તમારા શાસન વર્ણનને એન્કર કરવા માટે આનો ઉપયોગ કરો.

સલામતી ઓડિટ માટે શું એકત્રિત કરવું

સલામતી ઓડિટ માટે શું એકત્રિત કરવું

  • મૂલ્યાંકન પ્રોટોકોલ્સ, રૂબ્રિક્સ, અને ટીકાકાર તાલીમ સામગ્રી
  • ડેટા વંશ અને દૂષણ તપાસ
  • ઇન્ટર-રેટર આંકડા અને નિર્ણય નોંધો
  • સંસ્કરણિત બેન્ચમાર્ક પરિણામો અને રીગ્રેશન ઇતિહાસ

એલએલએમ સોલ્યુશન્સ

મીની-સ્ટોરી: બેંકિંગ કેવાયસીમાં ખોટા હકારાત્મક પાસાઓ દૂર કરવા

એક બેંકની KYC વિશ્લેષક ટીમે પાલન ચેતવણીઓનો સારાંશ આપવા માટે બે મોડેલનું પરીક્ષણ કર્યું. સ્વચાલિત સ્કોર્સ સમાન હતા. HITL પાસ દરમિયાન, રેટિંગ કરનારાઓએ નોંધ્યું કે મોડેલ A વારંવાર નકારાત્મક ક્વોલિફાયર ("કોઈ પૂર્વ પ્રતિબંધો") છોડી દે છે, જેનાથી અર્થ બદલાઈ જાય છે. નિર્ણય પછી, બેંકે મોડેલ B પસંદ કર્યું અને પ્રોમ્પ્ટ અપડેટ કર્યા. એક અઠવાડિયામાં ખોટા પોઝિટિવમાં 18% ઘટાડો થયો, જેનાથી વિશ્લેષકોને વાસ્તવિક તપાસ માટે મુક્તિ મળી. (પાઠ: સ્વચાલિત સ્કોર્સ એક સૂક્ષ્મ, ઉચ્ચ-અસરવાળી ભૂલ ચૂકી ગયા; HITL એ તેને પકડી લીધો.)

જ્યાં શેપ મદદ કરે છે

અસ્પષ્ટ/ઉચ્ચ-જોખમવાળા કાર્યો પર માનવ મૂલ્યાંકન સાથે સ્વચાલિત મેટ્રિક્સનું મિશ્રણ કરો; દસ્તાવેજ રૂબ્રિક્સ, રેટર કેલિબ્રેશન અને ઓડિટબિલિટી માટે નિર્ણય. રિપોર્ટ્સને તમારા માટે મહત્વપૂર્ણ NIST RMF વિભાગો સાથે સંરેખિત કરો.

માનવીઓ સૂક્ષ્મતા - સ્વર, સંદર્ભ, સૂક્ષ્મ શુદ્ધતા અને નીતિ સંરેખણ - ને કેદ કરે છે જે સ્વયંસંચાલિત સ્કોર ચૂકી જાય છે. જ્યાં અનિશ્ચિતતા ઊંચી હોય અથવા દાવ વાસ્તવિક હોય ત્યાં તેનો ઉપયોગ કરો.

ના. તે જરૂરી છે પણ અપૂરતા છે. સલામતી માટે દૃશ્ય-વાસ્તવિક પરીક્ષણો, સ્પષ્ટ જોખમ/દુરુપયોગના કિસ્સાઓ અને માનવ દેખરેખની જરૂર છે; NIST GenAI અને HELM/AIR-Bench દિશા જુઓ.

ટ્રાયએજ અને સ્કેલ માટે ઉત્તમ છે, પરંતુ તે મોડેલ પૂર્વગ્રહો શેર કરે છે. જટિલ કાર્યો પર માનવ સમીક્ષાને બદલવાને બદલે, તેને પ્રાથમિકતા આપવા માટે તેનો ઉપયોગ કરો.

HELM/AIR-Bench (સુરક્ષા/મજબૂતાઈ) જેવા સમુદાય કેન્દ્રો અને તમારા જોખમોને અનુરૂપ કોઈપણ ડોમેન-વિશિષ્ટ સ્યુટ્સનું નિરીક્ષણ કરો. દૂષણ ટાળવા માટે સેટને તાજા રાખો.

આ લેખ ગમ્યો? વધુ અપડેટ્સ માટે LinkedIn પર Shaip ને ફોલો કરો.

સામાજિક શેર