ಮೂಲ: ಎಲೆಕ್ಟ್ರಾನಿಕ್ ನ್ಯೂಸ್, ವರದಿಗಾರ ಲೀ ವನ್-ಜಿ
“CLEVI, from scratch ಸ್ವಂತ ಮಾದರಿಯೊಂದಿಗೆ GAIAಯಲ್ಲಿ 79.07%... 3,090 ಮಾದರಿಗಳಲ್ಲಿ ಅಗ್ರ 2.5%” ಲೇಖನದ ಸಂಪೂರ್ಣ ಪಠ್ಯವನ್ನು ಉಲ್ಲೇಖಿಸಲಾಗಿದೆ
ಪ್ರಕಟಣೆ ದಿನಾಂಕ: 2026-04-07
ಲಿಂಕ್: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm ಸ್ವತಂತ್ರ ಮಾದರಿ ಸ್ಟ್ಯಾಕ್ನ 5 ಏಜೆಂಟ್ಗಳು ಎಲ್ಲವೂ 70ಕ್ಕೂ ಹೆಚ್ಚು ಅಂಕಗಳನ್ನು ಗಳಿಸಿವೆ
ಮಾಹಿತಿ ನಷ್ಟವನ್ನು ಪರಿಗಣಿಸಿದಾಗ 98%+ ನಿಖರತೆ, ಮಾನವರನ್ನು (92%) ಮೀರಿಸಿದೆ
AI ಸ್ಟಾರ್ಟ್ಅಪ್ 'CLEVI' from scratch ಸ್ವಂತ ಮಾದರಿಯನ್ನು ಬಳಸಿಕೊಂಡು ಜಾಗತಿಕ AI ಏಜೆಂಟ್ ಬೆಂಚ್ಮಾರ್ಕ್ 'GAIA'ಯಲ್ಲಿ 79.07% ನಿಖರತೆಯನ್ನು ದಾಖಲಿಸಿದ್ದು, ಒಟ್ಟು 3,090 ನೋಂದಾಯಿತ ಮಾದರಿಗಳಲ್ಲಿ ಅಗ್ರ 2.5% ಒಳಗೆ ಸ್ಥಾನ ಪಡೆದಿದೆ.
ಉದ್ಯಮದ ವಿವರಣೆಗಳ ಪ್ರಕಾರ, AI ಬೆಂಚ್ಮಾರ್ಕ್ ಮಾರುಕಟ್ಟೆಯಲ್ಲಿ GAIA 'ಪ್ರಾಯೋಗಿಕ AI ಏಜೆಂಟ್ಗಳ' ಸಾಮರ್ಥ್ಯವನ್ನು ನಿಷ್ಠೆಯಿಂದ ಪ್ರತಿಬಿಂಬಿಸುತ್ತದೆ ಎಂದು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಾಗಿದೆ. Meta AI, HuggingFace ಮತ್ತು ಪ್ಯಾರಿಸ್-ಸಕ್ಲೇ ವಿಶ್ವವಿದ್ಯಾಲಯಗಳು ಜಂಟಿಯಾಗಿ ಅಭಿವೃದ್ಧಿಪಡಿಸಿದ ಈ ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು 2023ರ ನವೆಂಬರ್ನಲ್ಲಿ ಮೊದಲ ಬಾರಿಗೆ ಬಹಿರಂಗಪಡಿಸಲಾಯಿತು.
GAIAಯನ್ನು ಇತರ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಿಂದ ವಿಭಿನ್ನಗೊಳಿಸುವ ಮೂರು ಪ್ರಮುಖ ಅಂಶಗಳಿವೆ. ಮೊದಲನೆಯದಾಗಿ, ಉತ್ತರಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸದ ಕಾರಣ ಓವರ್ಫಿಟ್ಟಿಂಗ್ ಅಸಾಧ್ಯ. ಎರಡನೆಯದಾಗಿ, ಬಹುಹಂತದ·ಬಹುಮಾದರಿ ಸಂಕೀರ್ಣ ತಾರ್ಕಿಕತೆಯ ಅಗತ್ಯವಿರುವುದರಿಂದ ಸರಳ ಪ್ಯಾಟರ್ನ್ ಮ್ಯಾಚಿಂಗ್ ಮೂಲಕ ಹೆಚ್ಚಿನ ಅಂಕಗಳನ್ನು ಗಳಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಮೂರನೆಯದಾಗಿ, HuggingFace ಅಧಿಕೃತ ಲೀಡರ್ಬೋರ್ಡ್ ಮೂಲಕ ವಿಶ್ವದಾದ್ಯಂತ 3,090ಕ್ಕೂ ಹೆಚ್ಚು ಮಾದರಿಗಳು ಒಂದೇ ಪರಿಸ್ಥಿತಿಗಳಲ್ಲಿ ಸ್ಪರ್ಧಿಸುತ್ತವೆ.
ಟೆಸ್ಟ್ಸೆಟ್ ಒಟ್ಟು 301 ಪ್ರಶ್ನೆಗಳನ್ನು ಒಳಗೊಂಡಿದೆ. Level 1ರಲ್ಲಿ ಒಂದೇ ಉಪಕರಣದ ಬಳಕೆ ಮತ್ತು ಸರಳ ತಾರ್ಕಿಕತೆ, Level 2ರಲ್ಲಿ ಬಹು ಉಪಕರಣಗಳ ಸಂಯೋಜನೆ ಮತ್ತು ಮಧ್ಯಮ ಮಟ್ಟದ ತಾರ್ಕಿಕತೆ, Level 3ರಲ್ಲಿ ಐದು ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚಿನ ಹಂತಗಳ ಏಜೆಂಟ್ ಯೋಜನೆ ಮತ್ತು ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆ ಅಗತ್ಯವಿರುವ ಅತ್ಯಂತ ಕಠಿಣ ಪ್ರಶ್ನೆಗಳಿವೆ. ಬೆಂಚ್ಮಾರ್ಕ್ ಪ್ರಕಟವಾದಾಗ GPT ಮಾದರಿಗಳ (ಪ್ಲಗಿನ್ಗಳೊಂದಿಗೆ) ಆಧಾರದ ಮೇಲೆ ಇದು ಸುಮಾರು 15%ಕ್ಕೆ ಸೀಮಿತವಾಗಿತ್ತು; ಪ್ರಸ್ತುತ ಅಗ್ರ ತಂಡಗಳು ಅದನ್ನು 70–80% ಮಟ್ಟಕ್ಕೆ ಏರಿಸಿವೆ.
ಇವುಗಳಲ್ಲಿ, ಈ ಸಾಧನೆಯ ತಾಂತ್ರಿಕವಾಗಿ ಅತ್ಯಂತ ಗಮನಾರ್ಹ ಅಂಶವೆಂದರೆ GPT, Claude, Gemini ಮುಂತಾದ ಬಾಹ್ಯ LLM APIಗಳನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಬಳಸಲಾಗಿಲ್ಲ ಎಂದು CLEVI ಒತ್ತಿಹೇಳಿದೆ. from scratch ವಿಧಾನದಲ್ಲಿ ಸ್ವತಂತ್ರವಾಗಿ ಅಭಿವೃದ್ಧಿಪಡಿಸಿದ ಎರಡು ಮಾದರಿಗಳನ್ನು ಬಳಸಿರುವುದು CLEVIಯ ವೈಶಿಷ್ಟ್ಯವಾಗಿದೆ.
cip-5.5-agent ಒಂದು ಏಜೆಂಟಿಕ್ AI ಮಾದರಿಯಾಗಿದ್ದು, ಸಂಕೀರ್ಣ ಕಾರ್ಯಗಳನ್ನು ಸ್ವಾಯತ್ತವಾಗಿ ಯೋಜಿಸುವ(planning)·ಕಾರ್ಯಗತಗೊಳಿಸುವ(execution)·ಪರಿಶೀಲಿಸುವ(verification) ಏಜೆಂಟ್ ಪೈಪ್ಲೈನ್ನ ಪ್ರಮುಖ ಮೆದುಳಿನಂತೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. cip-5.5-mm ಧ್ವನಿ·ಚಿತ್ರ·ವೀಡಿಯೊ ಸೇರಿದಂತೆ ವಿವಿಧ ಫೈಲ್ ಸ್ವರೂಪಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಂಡು ತಾರ್ಕಿಕ ನಿರ್ಣಯ ಮಾಡುವ ಉನ್ನತ ಕಾರ್ಯಕ್ಷಮತೆಯ ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ಮಲ್ಟಿಮೋಡಲ್ ಮಾದರಿಯಾಗಿದೆ. GAIA ಪ್ರಶ್ನೆಗಳ ಬಹುಪಾಲು PDF, ಚಿತ್ರ, ಆಡಿಯೊ ಫೈಲ್ಗಳಂತಹ ಪಠ್ಯೇತರ ಇನ್ಪುಟ್ಗಳನ್ನು ಒಳಗೊಂಡಿರುವುದರಿಂದ, ಈ ಮಲ್ಟಿಮೋಡಲ್ ಸಾಮರ್ಥ್ಯವು ಉನ್ನತ ಅಂಕಗಳ ಪ್ರಮುಖ ಕಾರಣವಾಯಿತು.
CLEVI ಈ ಎರಡು ಸ್ವಂತ ಮಾದರಿಗಳನ್ನು ಆಧರಿಸಿ 5 ವಿಭಿನ್ನ ಏಜೆಂಟ್ ಸಂರಚನೆಗಳೊಂದಿಗೆ GAIAಯಲ್ಲಿ ಭಾಗವಹಿಸಿತು, ಮತ್ತು ಎಲ್ಲವೂ 70ಕ್ಕಿಂತ ಹೆಚ್ಚಿನ ಅಂಕಗಳನ್ನು ದಾಖಲಿಸಿದವು.
ಕಂಪನಿಯ ವಿವರಣೆಯ ಪ್ರಕಾರ, CLEVIಯ ಆಂತರಿಕ ನಂತರದ ಪರಿಶೀಲನೆಯಲ್ಲಿ ಆಸಕ್ತಿದಾಯಕ ಫಲಿತಾಂಶವೊಂದು ದೃಢಪಟ್ಟಿತು. ಒಟ್ಟು 301 ಪ್ರಶ್ನೆಗಳಲ್ಲಿ ಕೆಲವು ಪ್ರಶ್ನೆಗಳಿಗೆ ಸರಿಯಾದ ಉತ್ತರದ ಆಧಾರವು ಪ್ರಸ್ತುತ ಸಾರ್ವಜನಿಕ ವೆಬ್ನಲ್ಲಿ ಕಳೆದುಹೋಗಿತ್ತು. ಹಿಂದೆ ಆನ್ಲೈನ್ನಲ್ಲಿ ಅಥವಾ ಹುಡುಕಾಟ ಎಂಜಿನ್ಗಳ ಮೂಲಕ ಪರಿಶೀಲಿಸಬಹುದಾಗಿದ್ದ ಮಾಹಿತಿಯನ್ನು ಅಳಿಸಲಾಗಿದ್ದ ಅಥವಾ ಬದಲಾಯಿಸಲಾಗಿದ್ದರಿಂದ, ಅದು ಇನ್ನು ಮುಂದೆ ಪ್ರವೇಶಿಸಲಾಗದ ಸಂದರ್ಭಗಳಿವು. ಪ್ರಸ್ತುತ ಮಾನವರು ಸಾರ್ವಜನಿಕವಾಗಿ ಪರಿಶೀಲಿಸಬಹುದಾದ ಮಾಹಿತಿಯ ವ್ಯಾಪ್ತಿಯಲ್ಲಿ ಮರುಮೌಲ್ಯಮಾಪನ ಮಾಡಿದಾಗ, CLEVIಯ ಸರಿಯಾದ ಉತ್ತರದ ಪ್ರಮಾಣವು 98%ಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ ಕಂಡುಬಂದಿತು. ಇದು ಮಾನವ ಸರಾಸರಿಯಾದ 92% ಅನ್ನು ಈಗಾಗಲೇ ಮೀರಿದ ಪ್ರಮಾಣವಾಗಿದೆ.
CLEVIಯ ಪ್ರತಿನಿಧಿಯೊಬ್ಬರು ಹೀಗೆ ವಿವರಿಸಿದರು: “CLEVI ಯಾವುದೇ ಬಾಹ್ಯ ಮಾದರಿಗಳ ಮಿಶ್ರಣವಿಲ್ಲದೆ, from scratch ಸ್ವಂತ ಮಾದರಿಗಳು ಮತ್ತು ಸ್ವಂತ AI ಏಜೆಂಟ್ ಪರಿಹಾರಗಳ ಮೂಲಕವೇ 5 ಏಜೆಂಟ್ಗಳೂ 70+ ಅಂಕಗಳನ್ನು ದಾಖಲಿಸಿ, ಸಾರ್ವಜನಿಕ ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ ಅಗ್ರ 2.5%ಗೆ ಪ್ರವೇಶಿಸಿದೆ. ಭವಿಷ್ಯದಲ್ಲಿ ಸ್ವಂತ ಮಾದರಿ ಮತ್ತು ಏಜೆಂಟ್ ಪರಿಹಾರಗಳನ್ನು ಸುಧಾರಿಸುವ ಮೂಲಕ ಅಧಿಕೃತ ಅಂಕಗಳಲ್ಲಿಯೂ ಮತ್ತಷ್ಟು ಸುಧಾರಣೆ ಸಾಧ್ಯವೆಂದು ತೋರುತ್ತದೆ. ಈ ಸಾಧನೆಯ ಮಹತ್ವವೆಂದರೆ, ಇದು ಜಾಗತಿಕ ಸಾರ್ವಜನಿಕ ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ ನೈಜವಾಗಿ ಅಳೆಯಲ್ಪಟ್ಟು 'ಪರಿಶೀಲಿತ ನಂಬಿಕೆ'ಯನ್ನು ತೋರಿಸುತ್ತದೆ; ದೇಶೀಯ AI ಅಭಿವೃದ್ಧಿ ಸಂಸ್ಥೆಯ from scratch ಸ್ವಂತ ಮಾದರಿ ಆಧಾರಿತ ಸಾಧನೆಯಾಗಿದೆ; ಬಾಹ್ಯ ಮಾದರಿಗಳ ಮಿಶ್ರಣವಲ್ಲದೆ ಸ್ವತಂತ್ರ ಮಾದರಿ ಸ್ಟ್ಯಾಕ್ನ ಫಲಿತಾಂಶವಾಗಿದೆ; ಮತ್ತು ಕೆಲವು ಪ್ರಶ್ನೆಗಳ ಮಾಹಿತಿಯ ನಷ್ಟವನ್ನು ಪರಿಗಣಿಸಿದಾಗ, ಅಂಕಗಳಿಗಿಂತಲೂ ಹೆಚ್ಚಿನ ವ್ಯಾಖ್ಯಾನಾತ್ಮಕ ಮೌಲ್ಯವನ್ನು ಹೊಂದಿದೆ.”
