ଉତ୍ସ: ଇଲେକ୍ଟ୍ରୋନିକ୍ ନ୍ୟୁଜ୍, ସାମ୍ବାଦିକ ଲି ୱନ୍-ଜି
“କ୍ଲେଭି, from scratch ନିଜସ୍ୱ ମଡେଲ୍ରେ GAIA 79.07%...3,090ଟି ମଡେଲ୍ ମଧ୍ୟରେ ଶୀର୍ଷ 2.5%” ଶୀର୍ଷକ ଲେଖାର ସମ୍ପୂର୍ଣ୍ଣ ଉଦ୍ଧୃତି
ପ୍ରକାଶନ ତାରିଖ: 2026-04-07
ଲିଙ୍କ: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm ନିଜସ୍ୱ ମଡେଲ୍ ଷ୍ଟାକ୍ର 5ଟି ଏଜେଣ୍ଟ୍ ସମସ୍ତେ 70ରୁ ଅଧିକ ପଏଣ୍ଟ୍
ତଥ୍ୟ ହାନିକୁ ବିଚାରକୁ ନେଲେ 98%+ ସଠିକତା, ମଣିଷଙ୍କ (92%) ଠାରୁ ଅଧିକ
AI ଷ୍ଟାର୍ଟଅପ୍ 'କ୍ଲେଭି' from scratch ନିଜସ୍ୱ ମଡେଲ୍ ବ୍ୟବହାର କରି ବିଶ୍ୱସ୍ତରୀୟ AI ଏଜେଣ୍ଟ୍ ବେଞ୍ଚମାର୍କ 'GAIA'ରେ 79.07% ସଠିକତା ରେକର୍ଡ କରିଛି ଏବଂ ମୋଟ 3,090ଟି ପଞ୍ଜୀକୃତ ମଡେଲ୍ ମଧ୍ୟରେ ଶୀର୍ଷ 2.5% ମଧ୍ୟରେ ସ୍ଥାନ ପାଇଛି।
ଶିଳ୍ପ କ୍ଷେତ୍ରର ବ୍ୟାଖ୍ୟା ଅନୁଯାୟୀ, AI ବେଞ୍ଚମାର୍କ ବଜାରରେ GAIAକୁ 'ବ୍ୟବହାରିକ AI ଏଜେଣ୍ଟ୍'ର କ୍ଷମତାକୁ ବିଶ୍ୱସନୀୟ ଭାବରେ ପ୍ରତିଫଳିତ କରୁଥିବା ବୋଲି ମନେ କରାଯାଏ। Meta AI, HuggingFace ଏବଂ ପ୍ୟାରିସ୍-ସାକ୍ଲେ ବିଶ୍ୱବିଦ୍ୟାଳୟ ମିଳିତ ଭାବେ ବିକଶିତ କରିଥିବା ଏହି ବେଞ୍ଚମାର୍କ ପ୍ରଥମେ 2023 ନଭେମ୍ବରରେ ପ୍ରକାଶିତ ହୋଇଥିଲା।
GAIAକୁ ଅନ୍ୟାନ୍ୟ ବେଞ୍ଚମାର୍କଠାରୁ ଭିନ୍ନ କରୁଥିବା ମୁଖ୍ୟ ଦିଗ ତିନୋଟି। ପ୍ରଥମତଃ, ସଠିକ୍ ଉତ୍ତର ଗୋପନୀୟ ଥିବାରୁ ଅତ୍ୟଧିକ ଫିଟିଂ ସମ୍ଭବ ନୁହେଁ। ଦ୍ୱିତୀୟତଃ, ଏଥିରେ ମଲ୍ଟି-ଷ୍ଟେପ୍ ଏବଂ ମଲ୍ଟିମୋଡାଲ୍ ଜଟିଳ ଯୁକ୍ତି ଆବଶ୍ୟକ ହୋଇଥିବାରୁ କେବଳ ସରଳ ପ୍ୟାଟର୍ନ୍ ମ୍ୟାଚିଂ ଦ୍ୱାରା ଉଚ୍ଚ ସ୍କୋର୍ କରିବା ସମ୍ଭବ ନୁହେଁ। ତୃତୀୟତଃ, HuggingFaceର ଅଧିକୃତ ଲିଡରବୋର୍ଡ୍ ମାଧ୍ୟମରେ ବିଶ୍ୱର 3,090ରୁ ଅଧିକ ମଡେଲ୍ ସମାନ ସର୍ତ୍ତରେ ପ୍ରତିଯୋଗିତା କରନ୍ତି।
ଟେଷ୍ଟ ସେଟ୍ରେ ମୋଟ 301ଟି ପ୍ରଶ୍ନ ରହିଛି। Level 1ରେ ଗୋଟିଏ ଟୁଲ୍ ବ୍ୟବହାର ଏବଂ ସରଳ ଯୁକ୍ତି, Level 2ରେ ଏକାଧିକ ଟୁଲ୍ର ସମନ୍ୱୟ ଏବଂ ମଧ୍ୟମ ସ୍ତରର ଯୁକ୍ତି, ଏବଂ Level 3ରେ 5 କିମ୍ବା ତାଠାରୁ ଅଧିକ ପଦକ୍ଷେପର ଏଜେଣ୍ଟ୍ ଯୋଜନା ଓ କାର୍ଯ୍ୟନ୍ୱୟନ ଆବଶ୍ୟକ ହେଉଥିବା ସର୍ବାଧିକ କଠିନ ପ୍ରଶ୍ନ ରହିଛି। ବେଞ୍ଚମାର୍କ ପ୍ରକାଶ ସମୟରେ GPT ମଡେଲ୍ (ପ୍ଲଗଇନ୍ ସହିତ) ଆଧାରରେ ଏହା ପ୍ରାୟ 15%ରେ ସୀମିତ ଥିଲା, କିନ୍ତୁ ବର୍ତ୍ତମାନ ଶୀର୍ଷସ୍ଥାନୀୟ ଦଳଗୁଡ଼ିକ ଏହାକୁ 70–80% ସ୍ତରକୁ ନେଇଆସିଛନ୍ତି।
ଏହା ମଧ୍ୟରେ, କ୍ଲେଭି ଜୋର ଦେଇ କହିଛି ଯେ ଏହି ସଫଳତାରେ ପ୍ରଯୁକ୍ତିଗତ ଭାବେ ସବୁଠାରୁ ଧ୍ୟାନ ଦେବାଯୋଗ୍ୟ ଦିଗ ହେଉଛି GPT, Claude, Gemini ଆଦି ବାହ୍ୟ LLM API ଆଦୌ ବ୍ୟବହାର କରାଯାଇନାହିଁ। କ୍ଲେଭି from scratch ପ୍ରଣାଳୀରେ ନିଜେ ବିକଶିତ କରିଥିବା ଦୁଇଟି ମଡେଲ୍ ବ୍ୟବହାର କରିଛି, ଯାହା ଏହାର ବିଶେଷତା।
cip-5.5-agent ଏକ ଏଜେଣ୍ଟିକ୍ AI ମଡେଲ୍, ଯାହା ଜଟିଳ କାର୍ଯ୍ୟଗୁଡ଼ିକୁ ସ୍ୱୟଂଚାଳିତ ଭାବେ ଯୋଜନା (planning) କରିବା, କାର୍ଯ୍ୟାନ୍ୱୟନ (execution) କରିବା ଏବଂ ଯାଞ୍ଚ (verification) କରୁଥିବା ଏଜେଣ୍ଟ ପାଇପଲାଇନ୍ର ମୁଖ୍ୟ ମସ୍ତିଷ୍କ ଭାବେ କାର୍ଯ୍ୟ କରେ। cip-5.5-mm ହେଉଛି ଭଏସ୍, ଇମେଜ୍, ଭିଡିଓ ଆଦି ବିଭିନ୍ନ ଫାଇଲ୍ ଫର୍ମାଟ୍ ବୁଝିବା ଏବଂ ତାହା ଉପରେ ତର୍କ କରିବାରେ ସକ୍ଷମ ଏକ ଉଚ୍ଚ-କ୍ଷମତାସମ୍ପନ୍ନ ସାଧାରଣ-ଉଦ୍ଦେଶ୍ୟ ମଲ୍ଟିମୋଡାଲ୍ ମଡେଲ୍। GAIA ପ୍ରଶ୍ନଗୁଡ଼ିକର ଏକ ବଡ଼ ଅଂଶରେ PDF, ଇମେଜ୍, ଅଡିଓ ଫାଇଲ୍ ଭଳି ଟେକ୍ସଟ୍ବିହୀନ ଇନ୍ପୁଟ୍ ସାମିଲ ଥିବାରୁ, ଏହି ମଲ୍ଟିମୋଡାଲ୍ କ୍ଷମତା ଉଚ୍ଚ ସ୍କୋରର ମୁଖ୍ୟ କାରଣ ହୋଇଥିଲା।
କ୍ଲେଭି ଏହି ଦୁଇଟି ନିଜସ୍ୱ ମଡେଲ୍କୁ ଆଧାର କରି GAIAରେ 5ଟି ଭିନ୍ନ ଏଜେଣ୍ଟ ବିନ୍ୟାସ ପ୍ରତିଯୋଗିତାରେ ଉପସ୍ଥାପନ କରିଥିଲା ଏବଂ ସମସ୍ତେ 70ରୁ ଅଧିକ ସ୍କୋର ହାସଲ କରିଥିଲେ।
ପ୍ରତିଷ୍ଠାନର ବ୍ୟାଖ୍ୟା ଅନୁସାରେ, କ୍ଲେଭିର ଆଭ୍ୟନ୍ତରୀଣ ପରବର୍ତ୍ତୀ ସମୀକ୍ଷାରେ ଏକ ଆକର୍ଷଣୀୟ ଫଳାଫଳ ଚିହ୍ନଟ ହୋଇଥିଲା। ମୋଟ 301ଟି ପ୍ରଶ୍ନ ମଧ୍ୟରୁ କେତେକ ପ୍ରଶ୍ନର ସଠିକ୍ ଉତ୍ତର ପାଇଁ ଆବଶ୍ୟକ ପ୍ରମାଣ ବର୍ତ୍ତମାନ ସାର୍ବଜନୀନ ୱେବ୍ରେ ଉପଲବ୍ଧ ନାହିଁ। ପୂର୍ବରୁ ଅନଲାଇନ୍ କିମ୍ବା ସର୍ଚ୍ଚ ଇଞ୍ଜିନ୍ରେ ଯାଞ୍ଚ କରିହେଉଥିବା ସୂଚନା ମିଟାଯାଇଥିବା କିମ୍ବା ପରିବର୍ତ୍ତିତ ହୋଇଥିବାରୁ ଆଉ ପ୍ରବେଶଯୋଗ୍ୟ ନଥିବା ଘଟଣା ଏଥିରେ ସାମିଲ। ବର୍ତ୍ତମାନ ମଣିଷ ସାର୍ବଜନୀନ ଭାବେ ଯାଞ୍ଚ କରିପାରୁଥିବା ସୂଚନାର ସୀମା ମଧ୍ୟରେ ପୁନଃମୂଲ୍ୟାୟନ କରାଯିବାବେଳେ, କ୍ଲେଭିର ସଠିକତା ହାର 98%ରୁ ଅଧିକ ଦେଖାଯାଇଥିଲା। ଏହା ମଣିଷମାନଙ୍କର ହାରାହାରି 92%କୁ ଇତିମଧ୍ୟରେ ଅତିକ୍ରମ କରିଥିବା ଏକ ପରିସଂଖ୍ୟାନ।
କ୍ଲେଭିର ଜଣେ ସମ୍ପର୍କିତ ବ୍ୟକ୍ତି କହିଛନ୍ତି, “କ୍ଲେଭି ବାହ୍ୟ ମଡେଲ୍ ମିଶ୍ରଣ ବିନା, from scratch ନିଜସ୍ୱ ମଡେଲ୍ ଏବଂ ନିଜସ୍ୱ AI ଏଜେଣ୍ଟ ସମାଧାନ ମାଧ୍ୟମରେ 5ଟି ଏଜେଣ୍ଟରେ 70+ ସ୍କୋର ହାସଲ କରି ସାର୍ବଜନୀନ ବେଞ୍ଚମାର୍କରେ ଶୀର୍ଷ 2.5%ରେ ପ୍ରବେଶ କରିଛି। ଭବିଷ୍ୟତରେ ନିଜସ୍ୱ ମଡେଲ୍ ଏବଂ ଏଜେଣ୍ଟ ସମାଧାନର ଉନ୍ନତି ମାଧ୍ୟମରେ ଅଧିକୃତ ସ୍କୋରରେ ମଧ୍ୟ ଆହୁରି ଉନ୍ନତି ସମ୍ଭବ ବୋଲି ଆଶା କରାଯାଉଛି। ଏହି ସଫଳତାର ଗଭୀର ଗୁରୁତ୍ୱ ରହିଛି, କାରଣ ଏହା ବିଶ୍ୱସ୍ତରୀୟ ସାର୍ବଜନୀନ ବେଞ୍ଚମାର୍କରେ ପ୍ରକୃତ ମାପ ମାଧ୍ୟମରେ ‘ପ୍ରମାଣିତ ବିଶ୍ୱସନୀୟତା’ ପ୍ରଦର୍ଶନ କରେ, ଦେଶୀୟ AI ବିକାଶକାରୀଙ୍କ from scratch ନିଜସ୍ୱ ମଡେଲ୍-ଆଧାରିତ ସଫଳତା, ବାହ୍ୟ ମଡେଲ୍ ମିଶ୍ରଣ ନୁହେଁ ବରଂ ସ୍ୱାଧୀନ ମଡେଲ୍ ଷ୍ଟାକ୍ର ଫଳାଫଳ, ଏବଂ କେତେକ ପ୍ରଶ୍ନର ସୂଚନା ହଜିଯାଇଥିବାକୁ ବିଚାରକୁ ନେଲେ ସ୍କୋରଠାରୁ ଅଧିକ ବ୍ୟାଖ୍ୟାତ୍ମକ ମୂଲ୍ୟ ରହିଛି।”
