ਸਰੋਤ: ਡਿਜੀਟਲ ਟਾਈਮਜ਼, ਰਿਪੋਰਟਰ ਗੁ ਬੋਨ-ਗਿਊ
“AI ਸਟਾਰਟਅੱਪ ਕਲੇਵੀ, GAIA ਦੇ ਸਿਖਰਲੇ 2.5% ਵਿੱਚ ਦਾਖ਼ਲ… ਪ੍ਰਮਾਣਿਤ ਭਰੋਸੇਯੋਗਤਾ ਦਰਸਾਈ” ਲੇਖ ਦਾ ਪੂਰਾ ਹਵਾਲਾ
ਪ੍ਰਕਾਸ਼ਨ ਮਿਤੀ 2026-04-08
ਲਿੰਕ : https://n.news.naver.com/article/029/0003020511?sid=105
ਘਰੇਲੂ AI ਸਟਾਰਟਅੱਪ ‘ਕਲੇਵੀ(Clevi)’ ਨੇ from scratch ਤਿਆਰ ਕੀਤੇ ਆਪਣੇ ਮਾਡਲ ਅਤੇ ਆਪਣੇ ਏਜੰਟ ਹੱਲ ਬਣਾਏ ਹਨ ਅਤੇ ਦੱਸਿਆ ਹੈ ਕਿ ਉਹ ਘਰੇਲੂ ਪੱਧਰ ’ਤੇ ਪਹਿਲੀ ਵਾਰ GAIA ਬੈਂਚਮਾਰਕ ਵਿੱਚ ਕੁੱਲ 3,090 ਰਜਿਸਟਰਡ ਮਾਡਲਾਂ ਦੇ ਆਧਾਰ ’ਤੇ ਸਿਖਰਲੇ 2.5% ਵਿੱਚ ਦਾਖ਼ਲ ਹੋਇਆ ਹੈ।
ਉਦਯੋਗ ਦੀ ਵਿਆਖਿਆ ਅਨੁਸਾਰ, ਮੈਟਾ AI ਵੱਲੋਂ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਅਤੇ ਹੱਗਿੰਗ ਫੇਸ ਵੱਲੋਂ ਸੰਚਾਲਿਤ GAIA, AI ਤੋਂ ‘ਸਿਰਫ਼ ਇੱਕ ਕੰਮ ਚੰਗੀ ਤਰ੍ਹਾਂ ਕਰਨ ਦੀ ਯੋਗਤਾ’ ਨਹੀਂ, ਸਗੋਂ ‘ਕਈ ਯੋਗਤਾਵਾਂ ਨੂੰ ਜੋੜ ਕੇ ਅਸਲ ਸਮੱਸਿਆ ਹੱਲ ਕਰਨ ਦੀ ਯੋਗਤਾ’ ਬਾਰੇ ਪੁੱਛਦਾ ਹੈ। ਇਸ ਨੂੰ ਵੈੱਬ ’ਤੇ ਜਾਣਕਾਰੀ ਲੱਭਣੀ, PDF ਵਿੱਚ ਮੌਜੂਦ ਸਾਰਣੀ ਪੜ੍ਹਨੀ, ਚਿੱਤਰ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਨਾ, ਕੋਡ ਚਲਾ ਕੇ ਗਣਨਾ ਕਰਨੀ ਅਤੇ ਨਤੀਜਿਆਂ ਨੂੰ ਜੋੜ ਕੇ ਇੱਕ ਸਹੀ ਜਵਾਬ ਦੇਣਾ ਪੈਂਦਾ ਹੈ। 301 ਗੁਪਤ ਪ੍ਰਸ਼ਨ, ਮੁਸ਼ਕਲ ਦੇ ਤਿੰਨ ਪੱਧਰ ਅਤੇ ਜਵਾਬ ਗੁਪਤ ਰੱਖਣ ਦੇ ਸਿਧਾਂਤ ਕਾਰਨ ਇਹ ਢਾਂਚਾ ਓਵਰਫਿਟਿੰਗ ਜਾਂ ਚੀਟਿੰਗ ਨੂੰ ਅਸੰਭਵ ਬਣਾਉਂਦਾ ਹੈ।
ਇਸ ਪ੍ਰੀਖਿਆ ਵਿੱਚ ਉੱਚ ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਦੋ ਚੀਜ਼ਾਂ ਲੋੜੀਂਦੀਆਂ ਹਨ। ਪਹਿਲੀ, ਆਧਾਰਭੂਤ ਭਾਸ਼ਾ ਮਾਡਲ ਦੀ ਤਰਕ-ਸਮਰੱਥਾ ਅਤੇ ਦੂਜੀ, ਉਸ ਮਾਡਲ ਨੂੰ ਅਸਲ ਦੁਨੀਆ ਦੇ ਸਾਧਨਾਂ ਨਾਲ ਜੋੜ ਕੇ ਖੁਦਮੁਖਤਿਆਰ ਢੰਗ ਨਾਲ ਕੰਮ ਕਰਵਾਉਣ ਵਾਲਾ ਏਜੰਟ ਹੱਲ। ਮਾਡਲ ਕਿੰਨਾ ਵੀ ਵਧੀਆ ਹੋਵੇ, ਜੇ ਏਜੰਟ ਕਮਜ਼ੋਰ ਹੈ ਤਾਂ Level 3 ਹੱਲ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ; ਅਤੇ ਏਜੰਟ ਕਿੰਨਾ ਵੀ ਸੁਧਰਿਆ ਹੋਵੇ, ਜੇ ਮਾਡਲ ਦੀ ਤਰਕ-ਸਮਰੱਥਾ ਨਾਕਾਫ਼ੀ ਹੈ ਤਾਂ ਵਿਚਕਾਰਲੇ ਪੜਾਅ ’ਤੇ ਗਲਤ ਜਵਾਬ ਅੱਗੇ ਫੈਲ ਜਾਂਦਾ ਹੈ।
GAIA ਲੀਡਰਬੋਰਡ ਦੀ ਮੌਜੂਦਾ ਬਣਤਰ ਨੂੰ ਦੇਖਣ ’ਤੇ ਇੱਕ ਦਿਲਚਸਪ ਰੁਝਾਨ ਨਜ਼ਰ ਆਉਂਦਾ ਹੈ। ਸਿਖਰਲੇ ਏਜੰਟਾਂ ਵਿੱਚੋਂ ਬਹੁਤੇ GPT, Claude, Gemini ਆਦਿ ਕਈ ਬਿਗ ਟੈਕ ਮਾਡਲਾਂ ਨੂੰ ਜੋੜਨ ਵਾਲੀ ‘ਮਲਟੀ-ਮਾਡਲ ਮਿਕਸ’ ਰਣਨੀਤੀ ਅਪਣਾ ਰਹੇ ਹਨ। ਇਹ ਹਰ ਮਾਡਲ ਦੀਆਂ ਖੂਬੀਆਂ ਨੂੰ ਜੋੜਨ ਅਤੇ ਜਾਣਕਾਰੀ ਗੁਆਚਣ ਆਦਿ ਕਾਰਨਾਂ ਨਾਲ ਅੰਕ ਘਟਣ ਤੋਂ ਬਚਾਅ ਕਰਨ ਲਈ ਇੱਕ ਤਰਕਸੰਗਤ ਪਹੁੰਚ ਹੈ।
ਇਸ ਦੇ ਉਲਟ, ਕਲੇਵੀ ਇਸ ਕਤਾਰ ਵਿੱਚ ਸ਼ਾਮਲ ਨਹੀਂ ਹੋਇਆ। from scratch ਢੰਗ ਨਾਲ ਵਿਕਸਿਤ cip-5.5-agent(ਏਜੈਂਟਿਕ AI) ਜਟਿਲ ਕੰਮਾਂ ਦੀ ਯੋਜਨਾ, ਕਾਰਜਾਨਵੈਨ ਅਤੇ ਪੁਸ਼ਟੀ ਖੁਦਮੁਖਤਿਆਰ ਢੰਗ ਨਾਲ ਕਰਦਾ ਹੈ, ਜਦਕਿ cip-5.5-mm(ਉੱਚ-ਕਾਰਗੁਜ਼ਾਰੀ ਵਾਲਾ ਸਾਰਵਭੌਮ ਮਲਟੀਮੋਡਲ) ਆਵਾਜ਼, ਚਿੱਤਰ, ਵੀਡੀਓ ਆਦਿ ਵੱਖ-ਵੱਖ ਫ਼ਾਈਲ ਫਾਰਮੈਟਾਂ ਨੂੰ ਸਮਝਦਾ ਅਤੇ ਤਰਕ ਕਰਦਾ ਹੈ। ਇਹ ਦੋਵੇਂ ਮਾਡਲ ਕਲੇਵੀ ਦੇ ਅੰਦਰ ਸੁਤੰਤਰ ਤੌਰ ’ਤੇ ਵਿਕਸਿਤ ਕੀਤੇ ਗਏ ਹਨ ਅਤੇ ਬਾਹਰੀ LLM API ਦੀ ਬਿਲਕੁਲ ਵਰਤੋਂ ਨਹੀਂ ਕੀਤੀ ਗਈ।
ਅਤੇ ਇਸ ਆਪਣੇ ਮਾਡਲ ਸਟੈਕ ਨਾਲ GAIA ਵਿੱਚ 5 ਏਜੰਟਾਂ ਨੂੰ ਮੁਕਾਬਲੇ ਵਿੱਚ ਉਤਾਰ ਕੇ, ਸਾਰਿਆਂ ਨੇ 70 ਤੋਂ ਵੱਧ ਅੰਕ ਹਾਸਲ ਕੀਤੇ। ਸਭ ਤੋਂ ਵੱਧ 79.07% ਤੋਂ ਲੈ ਕੇ 70.76% ਤੱਕ ਦੇ ਨਤੀਜਿਆਂ ਨੇ ਸਾਬਤ ਕੀਤਾ ਕਿ ਇਹ ਕਿਸੇ ਇੱਕ ਨਤੀਜੇ ਦੀ ਕਿਸਮਤ ਨਹੀਂ, ਸਗੋਂ ਪੂਰੇ ਸਟੈਕ ਦੀ ਸਥਿਰਤਾ ਹੈ।
ਕੰਪਨੀ ਦੇ ਸਪਸ਼ਟੀਕਰਨ ਅਨੁਸਾਰ, ਅਧਿਕਾਰਤ 79.07% ਸਕੋਰ ਦੇ ਪਿੱਛੇ ਇੱਕ ਹੋਰ ਅੰਕੜਾ ਵੀ ਹੈ। CLEVI ਦੀ ਅੰਦਰੂਨੀ ਪੋਸਟ-ਰਿਵਿਊ ਵਿੱਚ ਪਤਾ ਲੱਗਾ ਕਿ 301 ਪ੍ਰਸ਼ਨਾਂ ਵਿੱਚੋਂ ਕਾਫ਼ੀ ਗਿਣਤੀ ਵਿੱਚ ਅਜਿਹੇ ਪ੍ਰਸ਼ਨ ਸਨ ਜਿਨ੍ਹਾਂ ਦੇ ਸਹੀ ਉੱਤਰ ਦੇ ਸਬੂਤ ਮੌਜੂਦਾ ਜਨਤਕ ਵੈੱਬ 'ਤੇ ਉਪਲਬਧ ਨਹੀਂ ਰਹੇ। ਜਦੋਂ ਸਿਰਫ਼ ਉਨ੍ਹਾਂ ਪ੍ਰਸ਼ਨਾਂ ਦੇ ਆਧਾਰ 'ਤੇ ਮੁੜ ਮੁਲਾਂਕਣ ਕੀਤਾ ਗਿਆ ਜਿਨ੍ਹਾਂ ਦੇ ਸਹੀ ਉੱਤਰ ਅਜੇ ਵੀ ਵੈੱਬ 'ਤੇ ਮੌਜੂਦ ਹਨ, ਤਾਂ CLEVI ਦੀ ਸਹੀ ਉੱਤਰ ਦਰ 98% ਤੋਂ ਵੱਧ ਰਹੀ। ਇਹ ਮਨੁੱਖੀ ਔਸਤ (92%) ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਵੱਧ ਹੈ।
ਬੇਸ਼ੱਕ, ਜੇ ਕਿਸੇ ਹੋਰ ਕੰਪਨੀ ਦੇ ਸ਼ਕਤੀਸ਼ਾਲੀ ਆਮ-ਉਦੇਸ਼ੀ ਮਾਡਲਾਂ ਨੂੰ ਮਿਲਾਇਆ ਜਾਂਦਾ, ਤਾਂ ਅਧਿਕਾਰਤ ਸਕੋਰ ਨੂੰ ਹੋਰ ਵੀ ਵਧਾਇਆ ਜਾ ਸਕਦਾ ਸੀ। ਪਰ CLEVI ਨੇ ਜਾਣਬੁੱਝ ਕੇ ਇਹ ਰਣਨੀਤੀ ਨਹੀਂ ਅਪਣਾਈ। ਇਸ ਬੈਂਚਮਾਰਕ ਦਾ ਉਦੇਸ਼ ਸਭ ਤੋਂ ਵੱਧ ਸਕੋਰ ਲਈ ਮੁਕਾਬਲਾ ਕਰਨਾ ਨਹੀਂ ਸੀ, ਸਗੋਂ ਇਹ ਜਾਂਚਣਾ ਸੀ ਕਿ from scratch ਤਿਆਰ ਕੀਤਾ ਆਪਣਾ ਮਾਡਲ ਗਲੋਬਲ ਮੰਚ 'ਤੇ ਮੁਕਾਬਲਾ ਕਰਨ ਯੋਗ ਪੱਧਰ ਤੱਕ ਪਹੁੰਚਿਆ ਹੈ ਜਾਂ ਨਹੀਂ।
GAIA ਲੀਡਰਬੋਰਡ 'ਤੇ ਨਾਮ ਦਰਜ ਹੋਣ ਦਾ ਵੱਡਾ ਮਹੱਤਵ ਇਸ ਗੱਲ ਵਿੱਚ ਹੈ ਕਿ ਇਸ ਨਾਲ ਤੀਜੀ ਧਿਰ ਵੱਲੋਂ ਕੀਤੇ ਸੁਤੰਤਰ ਮੁਲਾਂਕਣ ਤੋਂ ਪ੍ਰਮਾਣਿਤ ਭਰੋਸੇਯੋਗਤਾ ਮਿਲਦੀ ਹੈ। ਇਹ ਨਿਵੇਸ਼ ਪ੍ਰਾਪਤੀ, ਵਿਦੇਸ਼ੀ ਵਿਸਥਾਰ ਅਤੇ B2B ਵਿਕਰੀ—ਹਰ ਪੜਾਅ ਵਿੱਚ ਵਰਤਿਆ ਜਾ ਸਕਣ ਵਾਲਾ ਵਸਤੁਨਿਸ਼ਠ ਸਬੂਤ ਬਣਦਾ ਹੈ।
CLEVI ਦੇ ਇੱਕ ਅਧਿਕਾਰੀ ਨੇ ਕਿਹਾ, “ਅਧਿਕਾਰਤ ਤੌਰ 'ਤੇ ਗਲਤ 63 ਉੱਤਰਾਂ ਵਿੱਚੋਂ ਕਾਫ਼ੀ ਹਿੱਸਾ ਆਉਟਪੁੱਟ ਫਾਰਮੈਟ ਵਿੱਚ ਅਸੰਗਤਤਾ, ਦ੍ਰਿਸ਼ ਸਮੱਗਰੀ ਦੀ ਵਿਆਖਿਆ ਵਿੱਚ ਗਲਤੀ ਅਤੇ ਜਾਣਕਾਰੀ ਦੇ ਲੁਪਤ ਹੋਣ ਕਾਰਨ ਉੱਤਰ ਨਾ ਦੇ ਸਕਣ ਵਾਲੇ ਪ੍ਰਸ਼ਨਾਂ ਤੋਂ ਪੈਦਾ ਹੋਇਆ। ਇਹ ਤਰਕਸੰਗਤ ਸੋਚ ਦੀ ਮੂਲਭੂਤ ਸੀਮਾ ਨਾਲੋਂ ਵੱਧ ਪੋਸਟ-ਪ੍ਰੋਸੈਸਿੰਗ ਦੀ ਸਟੀਕਤਾ ਅਤੇ ਬਾਹਰੀ ਜਾਣਕਾਰੀ ਦੀ ਉਪਲਬਧਤਾ ਨਾਲ ਜੁੜੀ ਸਮੱਸਿਆ ਹੈ। ਕਿਉਂਕਿ ਇਹ ਆਪਣਾ ਮਾਡਲ ਹੈ, ਇਸ ਲਈ CLEVI ਖੁਦ ਇਸ ਵਿੱਚ ਸੁਧਾਰ ਕਰ ਸਕਦਾ ਹੈ। ਇਹੀ from scratch ਆਪਣੇ ਮਾਡਲ ਦਾ ਢਾਂਚਾਗਤ ਫਾਇਦਾ ਹੈ। CLEVI ਦੀ ਇਹ ਉਪਲਬਧੀ ਕੋਰੀਆਈ AI ਉਦਯੋਗ ਸਾਹਮਣੇ ਇਹ ਸਵਾਲ ਰੱਖਦੀ ਹੈ: “ਅਸੀਂ ਹੋਰ ਕਿੰਨੇ ਸਮੇਂ ਤੱਕ ‘ਉਧਾਰ ਲਏ ਦਿਮਾਗ’ 'ਤੇ ਨਿਰਭਰ ਰਹਾਂਗੇ?” CLEVI ਨੇ from scratch ਦਾ ਹੋਰ ਔਖਾ ਰਸਤਾ ਚੁਣਿਆ ਹੈ ਅਤੇ ਵਿਸ਼ਵ ਮੰਚ 'ਤੇ ਇਸ ਦਾ ਜਵਾਬ ਸਾਬਤ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹੈ,” ਉਨ੍ਹਾਂ ਨੇ ਕਿਹਾ।
