ସ୍ରୋତ: ଡିଜିଟାଲ ଟାଇମ୍ସ, ସାମ୍ବାଦିକ ଗୁ ବୋନ-ଗ୍ୟୁ
“AI ଷ୍ଟାର୍ଟଅପ୍ CLEVI, GAIAର ଶୀର୍ଷ 2.5%ରେ ପ୍ରବେଶ… ପ୍ରମାଣିତ ବିଶ୍ୱସନୀୟତା ପ୍ରଦର୍ଶନ” ଶୀର୍ଷକ ଲେଖାର ସମ୍ପୂର୍ଣ୍ଣ ଉଦ୍ଧୃତି
ପ୍ରକାଶନ ତାରିଖ 2026-04-08
ଲିଙ୍କ: https://n.news.naver.com/article/029/0003020511?sid=105
ଦକ୍ଷିଣ କୋରିଆର AI ଷ୍ଟାର୍ଟଅପ୍ ‘CLEVI (Clevi)’ from scratch ଭାବେ ନିର୍ମିତ ନିଜସ୍ୱ ମଡେଲ୍ ଏବଂ ନିଜସ୍ୱ ଏଜେଣ୍ଟ ସମାଧାନ ବିକଶିତ କରିଛି। ଏହା ଦାବି କରିଛି ଯେ, ଦକ୍ଷିଣ କୋରିଆରେ ପ୍ରଥମ ଥର ପାଇଁ GAIA ବେଞ୍ଚମାର୍କରେ ପଞ୍ଜୀକୃତ ମୋଟ 3,090ଟି ମଡେଲ୍ ମଧ୍ୟରୁ ଶୀର୍ଷ 2.5%ରେ ପ୍ରବେଶ କରିଛି।
ଶିଳ୍ପ ମହଳର ବ୍ୟାଖ୍ୟା ଅନୁଯାୟୀ, Meta AI ଦ୍ୱାରା ପରିକଳ୍ପିତ ଏବଂ Hugging Face ଦ୍ୱାରା ପରିଚାଳିତ GAIA, AIକୁ ‘କେବଳ ଗୋଟିଏ କାମ ଭଲ ଭାବେ କରିବାର କ୍ଷମତା’ ନୁହେଁ, ବରଂ ‘ବିଭିନ୍ନ କ୍ଷମତାକୁ ସମନ୍ୱୟ କରି ବାସ୍ତବ ସମସ୍ୟା ସମାଧାନ କରିବାର କ୍ଷମତା’ ବିଷୟରେ ପରୀକ୍ଷା କରେ। ୱେବ୍ରୁ ସୂଚନା ଖୋଜିବା, PDF ଭିତରେ ଥିବା ସାରଣୀ ପଢ଼ିବା, ଚିତ୍ର ବିଶ୍ଳେଷଣ କରିବା, କୋଡ୍ ଚଲାଇ ଗଣନା କରିବା ଏବଂ ସେହି ଫଳାଫଳକୁ ସମନ୍ୱୟ କରି ଗୋଟିଏ ସଠିକ୍ ଉତ୍ତର ଦେବାକୁ ପଡ଼େ। 301ଟି ଗୋପନୀୟ ପ୍ରଶ୍ନ, ତିନିଟି କଠିନତା ସ୍ତର ଏବଂ ଉତ୍ତର ଗୋପନୀୟ ରଖିବାର ନୀତି ଅନୁସାରେ, ଏହା ଓଭରଫିଟିଂ କିମ୍ବା ଚିଟିଂକୁ ଅସମ୍ଭବ କରୁଥିବା ଏକ ଗଠନ।
ଏହି ପରୀକ୍ଷାରେ ଉଚ୍ଚ ସ୍କୋର ପାଇବା ପାଇଁ ଦୁଇଟି ଜିନିଷ ଆବଶ୍ୟକ। ପ୍ରଥମଟି ହେଉଛି ଭିତ୍ତିସ୍ଥ ଭାଷା ମଡେଲ୍ର ତର୍କ କରିବାର କ୍ଷମତା, ଏବଂ ଦ୍ୱିତୀୟଟି ହେଉଛି ସେହି ମଡେଲ୍କୁ ବାସ୍ତବ ଜଗତର ଉପକରଣଗୁଡ଼ିକ ସହିତ ସଂଯୋଗ କରି ସ୍ୱୟଂଚାଳିତ ଭାବେ କାମ କରାଇବାକୁ ସକ୍ଷମ ଏଜେଣ୍ଟ ସମାଧାନ। ମଡେଲ୍ ଯେତେ ଭଲ ହେଉନା କାହିଁକି, ଏଜେଣ୍ଟ ଦୁର୍ବଳ ହେଲେ Level 3 ସମାଧାନ କରିହେବ ନାହିଁ; ଏବଂ ଏଜେଣ୍ଟ ଯେତେ ସୁକ୍ଷ୍ମ ହେଉନା କାହିଁକି, ମଡେଲ୍ର ତର୍କ କ୍ଷମତା ଅପର୍ଯ୍ୟାପ୍ତ ହେଲେ ମଧ୍ୟବର୍ତ୍ତୀ ପର୍ଯ୍ୟାୟରୁ ଭୁଲ୍ ଉତ୍ତର ପ୍ରସାରିତ ହୁଏ।
GAIA ଲିଡରବୋର୍ଡର ବର୍ତ୍ତମାନ ଗଠନକୁ ଦେଖିଲେ ଏକ ଆକର୍ଷଣୀୟ ପ୍ରତିରୂପ ଦେଖାଯାଏ। ଶୀର୍ଷସ୍ଥାନରେ ଥିବା ଅଧିକାଂଶ ଏଜେଣ୍ଟ GPT, Claude, Gemini ଆଦି ବିଭିନ୍ନ ବିଗ୍ ଟେକ୍ ମଡେଲ୍କୁ ସମନ୍ୱୟ କରୁଥିବା ‘ମଲ୍ଟି-ମଡେଲ୍ ମିକ୍ସ’ କୌଶଳ ଗ୍ରହଣ କରିଛନ୍ତି। ପ୍ରତ୍ୟେକ ମଡେଲ୍ର ଶକ୍ତିକୁ ମିଶାଇବା ଏବଂ ସୂଚନା ହ୍ରାସ ଆଦି କାରଣରୁ ସ୍କୋର କମିବାକୁ ପ୍ରତିରୋଧ କରିବା ପାଇଁ ଏହା ଏକ ଯୁକ୍ତିସଙ୍ଗତ ପଦ୍ଧତି।
ଅନ୍ୟପକ୍ଷରେ, CLEVI ସେହି ଧାରାରେ ଯୋଗ ଦେଇନାହିଁ। from scratch ପଦ୍ଧତିରେ ବିକଶିତ cip-5.5-agent (ଏଜେଣ୍ଟିକ୍ AI) ଜଟିଳ କାର୍ଯ୍ୟର ଯୋଜନା, କାର୍ଯ୍ୟାନ୍ୱୟନ ଏବଂ ଯାଞ୍ଚକୁ ସ୍ୱୟଂଚାଳିତ ଭାବେ କରେ, ଏବଂ cip-5.5-mm (ଉଚ୍ଚ-କ୍ଷମତାସମ୍ପନ୍ନ ସାଧାରଣ-ଉଦ୍ଦେଶ୍ୟ ମଲ୍ଟିମୋଡାଲ୍) ଅଡିଓ, ଚିତ୍ର, ଭିଡିଓ ଆଦି ବିଭିନ୍ନ ଫାଇଲ୍ ଫର୍ମାଟ୍କୁ ବୁଝି ତର୍କ କରେ। ଏହି ଦୁଇଟି ମଡେଲ୍ ମଧ୍ୟ CLEVI ଭିତରେ ସ୍ୱତନ୍ତ୍ର ଭାବେ ବିକଶିତ ହୋଇଛି ଏବଂ କୌଣସି ବାହ୍ୟ LLM API ବ୍ୟବହାର କରାଯାଇନାହିଁ।
ଏହି ସ୍ୱତନ୍ତ୍ର ମଡେଲ୍ ଷ୍ଟାକ୍ ସହିତ GAIAରେ 5ଟି ଏଜେଣ୍ଟକୁ ପ୍ରତିଯୋଗିତାରେ ଅଂଶଗ୍ରହଣ କରାଇ, ସମସ୍ତେ 70ରୁ ଅଧିକ ସ୍କୋର ହାସଲ କରିଥିଲେ। ସର୍ବୋଚ୍ଚ 79.07%ରୁ 70.76% ପର୍ଯ୍ୟନ୍ତ ସ୍କୋର ମିଳିବା ଏକକ ଫଳାଫଳର ସୌଭାଗ୍ୟ ନୁହେଁ, ବରଂ ସମଗ୍ର ଷ୍ଟାକ୍ର ସ୍ଥିରତା ପ୍ରମାଣିତ ହୋଇଛି।
କମ୍ପାନୀର ବ୍ୟାଖ୍ୟା ଅନୁସାରେ, ଆଧିକାରିକ 79.07% ସ୍କୋର ପଛରେ ଆଉ ଏକ ସଂଖ୍ୟା ରହିଛି। CLEVIର ଆଭ୍ୟନ୍ତରୀଣ ପରବର୍ତ୍ତୀ ସମୀକ୍ଷାରେ 301ଟି ପ୍ରଶ୍ନ ମଧ୍ୟରୁ ଅନେକ ପ୍ରଶ୍ନର ସଠିକ୍ ଉତ୍ତରର ପ୍ରମାଣ ବର୍ତ୍ତମାନ ସାର୍ବଜନୀନ ୱେବ୍ରେ ଉପଲବ୍ଧ ନଥିବା ଚିହ୍ନଟ ହୋଇଛି। ବର୍ତ୍ତମାନ ମଧ୍ୟ ୱେବ୍ରେ ସଠିକ୍ ଉତ୍ତର ଉପଲବ୍ଧ ଥିବା ପ୍ରଶ୍ନଗୁଡ଼ିକୁ ଆଧାର କରି ପୁନଃମୂଲ୍ୟାୟନ କରାଯାଇଥିବାବେଳେ, CLEVIର ସଠିକତା ହାର 98%ରୁ ଅଧିକ ଥିଲା। ଏହା ମାନବ ହାରାହାରି (92%)କୁ ଇତିମଧ୍ୟରେ ଅତିକ୍ରମ କରିଥିବା ସଂଖ୍ୟା।
ନିଶ୍ଚିତଭାବେ, ଅନ୍ୟ କମ୍ପାନୀର ଶକ୍ତିଶାଳୀ ସାଧାରଣ ମଡେଲ୍ଗୁଡ଼ିକୁ ମିଶ୍ରଣ କରାଯାଇଥାନ୍ତା, ତେବେ ଆଧିକାରିକ ସ୍କୋରକୁ ଆହୁରି ବଢ଼ାଯାଇପାରିଥାନ୍ତା। କିନ୍ତୁ CLEVI ଇଚ୍ଛାକୃତ ଭାବରେ ସେହି କୌଶଳ ଗ୍ରହଣ କରିନଥିଲା। କାରଣ, ଏହି ବେଞ୍ଚମାର୍କର ଲକ୍ଷ୍ୟ ସର୍ବୋଚ୍ଚ ସ୍କୋର ପାଇଁ ପ୍ରତିଯୋଗିତା କରିବା ନୁହେଁ, ବରଂ from scratch ନିର୍ମିତ ନିଜସ୍ୱ ମଡେଲ୍ ବିଶ୍ୱ ମଞ୍ଚରେ ପ୍ରତିଯୋଗିତା କରିବାଯୋଗ୍ୟ ସ୍ତରକୁ ପହଞ୍ଚିଛି କି ନାହିଁ ତାହା ଯାଞ୍ଚ କରିବା।
GAIA ଲିଡରବୋର୍ଡରେ ନାମ ଉଠିବାର ବଡ଼ ମହତ୍ତ୍ୱ ହେଉଛି, ଏହା ତୃତୀୟ ପକ୍ଷର ସ୍ୱାଧୀନ ମୂଲ୍ୟାୟନ ଦ୍ୱାରା ପ୍ରଦତ୍ତ ପ୍ରମାଣିତ ବିଶ୍ୱସନୀୟତା ହାସଲ କରିଛି। ଏହା ନିବେଶ ଆକର୍ଷଣ, ବିଦେଶ ବିସ୍ତାର ଏବଂ B2B ବିକ୍ରୟର ପ୍ରତ୍ୟେକ ପର୍ଯ୍ୟାୟରେ ବ୍ୟବହାରଯୋଗ୍ୟ ଏକ ବସ୍ତୁନିଷ୍ଠ ପ୍ରମାଣ।
CLEVIର ଜଣେ ସମ୍ପର୍କିତ ବ୍ୟକ୍ତି କହିଥିଲେ, “ଆଧିକାରିକ ଭାବେ ଭୁଲ୍ ହୋଇଥିବା 63ଟି ଉତ୍ତର ମଧ୍ୟରୁ ଅନେକ ଆଉଟପୁଟ୍ ଫର୍ମାଟ୍ର ଅସଙ୍ଗତି, ଭିଜୁଆଲ୍ ସାମଗ୍ରୀର ବ୍ୟାଖ୍ୟାର ତ୍ରୁଟି ଏବଂ ସୂଚନା ହରାଇଯିବା କାରଣରୁ ଉତ୍ତର ଦେବା ଅସମ୍ଭବ ଥିବା ପ୍ରଶ୍ନଗୁଡ଼ିକରୁ ଉତ୍ପନ୍ନ ହୋଇଛି। ଏହା ଯୁକ୍ତିସଙ୍ଗତ ଚିନ୍ତନର ମୌଳିକ ସୀମାବଦ୍ଧତା ଅପେକ୍ଷା ପୋଷ୍ଟ-ପ୍ରୋସେସିଂର ସଠିକତା ଏବଂ ବାହ୍ୟ ସୂଚନାର ଉପଲବ୍ଧତା ସହିତ ଜଡିତ ସମସ୍ୟା। ଏହା ନିଜସ୍ୱ ମଡେଲ୍ ହୋଇଥିବାରୁ CLEVI ନିଜେ ଏହାକୁ ଉନ୍ନତ କରିପାରିବ। ଏହାହିଁ from scratch ନିର୍ମିତ ନିଜସ୍ୱ ମଡେଲ୍ର ଗଠନାତ୍ମକ ସୁବିଧା। CLEVIର ଏହି ସଫଳତା କୋରିଆ AI ଶିଳ୍ପକୁ ପ୍ରଶ୍ନ କରେ: “ଆମେ ଆଉ କେତେଦିନ ‘ଧାର କରାଯାଇଥିବା ମସ୍ତିଷ୍କ’ ଉପରେ ନିର୍ଭର କରିବୁ?” CLEVI from scratch ନିର୍ମାଣର ଅଧିକ କଠିନ ପଥ ବାଛିଛି ଏବଂ ବିଶ୍ୱ ମଞ୍ଚରେ ଏହାର ଉତ୍ତର ପ୍ରମାଣ କରିବାକୁ ଚାହୁଁଛି।”
