TRACES statik məlumat dəstlərindən və cavab açarlarından kənara çıxaraq, süni intellektin real dünya elmi mühitlərində naviqasiya edə biləcəyini, rəylərə uyğunlaşacağını və təsdiqlənə bilən kəşflər edəcəyini sınaqdan keçirir. 2026-cı il avqustun 19-da REDWOOD CITY, Kaliforniya ştatında Apodex süni intellektin ən çətin problemlərindən birində: cavabın hələ məlum olmadığı real dünya problemləri üzərində işləmək qabiliyyətini qiymətləndirmək üçün nəzərdə tutulmuş yeni bir meyar olan TRACES -i təqdim etdi. Əksər süni intellekt meyarları cavab açarı ilə başlayır. Onlar modelin müəyyən edilmiş bilikləri əldə edə biləcəyini, əvvəlcədən müəyyən edilmiş problemi həll edə biləcəyini, düzgün kod yaza biləcəyini və ya məlum nəticəni təkrarlaya biləcəyini ölçürlər. Elmi kəşf fərqlidir. Tədqiqatçılar tez-tez cavabı bilmədən, bəzən isə ilkin fərziyyələrinin düzgün olub-olmadığını bilmədən başlayırlar. Tərəqqi, geniş sübut bazalarını axtarmağı, ixtisaslaşmış alətlərdən istifadə etməyi, rəqabət aparan fərziyyələri saxlamağı, təcrübələr aparmağı, uğursuzluqdan öyrənməyi və təsdiqlənməyə tab gətirə biləcək bir nəticəyə çatmazdan əvvəl sorğu xəttini dəfələrlə nəzərdən keçirməyi tələb edə bilər. Bəzi elmi problemlərdə son cavab aylar və ya illər sonra məlum olmaya bilər. TRACES bu dünya üçün nəzərdə tutulmuşdur. Meyarı gizli cavabları olan statik bir məlumat dəsti kimi qəbul etmək əvəzinə, TRACES real dünya problemlərini süni intellekt sistemlərinin müşahidə edə, hərəkət edə, alətlərdən istifadə edə, rəylərdən öyrənə və təsdiqlənə bilən nəticələrə doğru işləyə biləcəyi icra edilə bilən mühitlərə çevirir. Belə süni intellekt sistemlərinin icra edilə bilən mühitlərlə qarşılıqlı əlaqəsi də altı TRACES qabiliyyəti üzrə qiymətləndirilir ki, bu da kəşfedici süni intellekti qiymətləndirmək məqsədi ilə xüsusi olaraq hazırlanmış yeni qiymətləndirmə metrikalarıdır. Birlikdə, bu real dünya problemləri, icra edilə bilən mühitlər və qiymətləndirmə çərçivələri TRACES meyarını təşkil edir. Kəşf və qiymətləndirməyə rəhbərlik edən Apodex -in aparıcı alimi Dr. Sheng Wang dedi: “ TRACES kəşfedici süni intellektdəki tərəqqini qiymətləndirmək üçün xüsusi olaraq hazırlanmış bir meyarıdır. O, yüksək dəyərli real dünya problemlərini araşdırmaq, icra edilə bilən mühitlər qurmaq üçün lazım olan alətləri və məlumatları toplamaq və yalnız nəticələri deyil, həm də kəşf prosesini qiymətləndirən yeni bir qiymətləndirmə sistemi hazırlamaq üçün mürəkkəb səyləri bir araya gətirir. İnanırıq ki, TRACES kəşfedici süni intellektin inkişafında mühüm bir mərhələni təmsil edir.” Statik Meyarlardan Kənara: İcra Edilə Bilən Mühitlərə Doğru TRACES süni intellekt qiymətləndirməsinin fərqli bir konsepsiyası ətrafında qurulmuşdur. Modelə bir sual təqdim etmək və yalnız son cavabını qiymətləndirmək əvəzinə, TRACES mühiti süni intellekt sisteminə işləmək üçün bir mühit verir. Problemdən asılı olaraq, bu mühitə elmi ədəbiyyat, strukturlaşdırılmış məlumat dəstləri, kod icrası, ixtisaslaşmış elmi alətlər, simulyatorlar, qatlama mühərrikləri, eksperimental rəylər və ya digər interfeyslər daxil ola bilər. Sistem nə edəcəyinə qərar verməli, baş verənləri şərh etməli, yanaşmasını yeniləməli və təsdiqlənə bilən nəticəyə doğru işləməyə davam etməlidir. Tam trayektoriya daha sonra son nəticə ilə birlikdə qiymətləndirilə bilər. TRACES : Kəşf üçün Altı Qabiliyyət Kəşfedici süni intellekt açıq, yüksək dəyərli suallara cavab verməyi hədəfləyir ki, onların bir çoxunda nəticə rəyi olmaya bilər. Buna görə də, belə sistemlərin prosesini qiymətləndirmək və yoxlamaq, kəşfedici süni intellektin uğuru üçün vacibdir. Bu məqsədlə, bu mühitlər daxilində TRACES Apodex -in uzunmüddətli, təsdiqlənə bilən problem həlli üçün fundamental hesab etdiyi altı qabiliyyəti qiymətləndirir: T — Alətlər: xarici alətləri seçmək, çağırmaq və düzgün şərh etmək R — Təmir: rəy gəldikdən sonra öz səhvlərini tapmaq və düzəltmək A — Alternativlər: rəqabət aparan fərziyyələri irəli sürmək və sübutlar toplandıqca onları saxlamaq və ya atmaq C — Uyğunluq: uzun bir iş zəncirində vəziyyəti, məhdudiyyətləri və məntiqi toxunulmaz saxlamaq E — Sübut: hər bir nəticəni müşahidə, məlumat, təcrübə və ya istinadla əsaslandırmaq S — Əhatə dairəsi: nəticənin hansı şərtlər altında etibarlı olduğunu və harada tətbiq edilmədiyini bildirmək. Apodex -də süni intellekt tədqiqatçısı Brian Wang dedi: “ TRACES prosesinin yoxlanılması meyarı unikal edən şeydir. Elmi kəşfdə cavab yüzlərlə mühakimənin sonunda bir sətirdir — növbəti nəyi sınamaq, sübut nə vaxt kifayətdir, fərziyyədən nə vaxt imtina etmək. Qabiliyyət oradadır və yalnız son sətri qiymətləndirmək demək olar ki, hər şeyi atır. Bizim TRACES yoxlayıcımız prosesin keyfiyyətini sistematik olaraq qiymətləndirir ki, bu da uzunmüddətli, açıq kəşfedici işlər üçün süni intellekt sistemlərini qiymətləndirmək və təkmilləşdirmək üçün vacibdir.” Birlikdə, bu ölçülər süni intellektin düzgün son cavabı verib-vermədiyindən daha çoxunu qiymətləndirir. Onlar sistemin ora necə çatdığını qiymətləndirirlər. Sistem səhv alətdən istifadə edibsə, ziddiyyətli sübutları nəzərə almayıbsa, alternativ izahatları nəzərdən keçirməyibsə və ya sübutlarının dəstəklədiyindən daha geniş bir iddia irəli sürübsə, elmi cəhətdən ağlabatan cavab kifayət deyil. Məqsəd həm nəticəni, həm də prosesi — sistemin nəyi kəşf etdiyini və getdiyi yolun nəticəni dəstəkləyib-dəstəkləmədiyini qiymətləndirməkdir. Yalnız Cavabı Yox, Yolu Yoxlamaq TRACES -də süni intellekt sistemləri həm nəticə, həm də proses yoxlayıcıları tərəfindən qiymətləndirilir. Nəticə yoxlayıcısı təqdimatı gizli həqiqətə qarşı qiymətləndirir; proses qiymətləndirməsi nəticənin qazanılıb-qazanılmadığını — onu istehsal edən yolun növbəti problemdə də etibarlı olub-olmadığını soruşur. Hər ikisi vacibdir, lakin kəşfedici süni intellekt üçün prosesin yoxlanılması, altı fundamental TRACES qabiliyyəti üzrə təqdimatları qiymətləndirərək, daha vacibdir. TRACES hər bir ümumi qabiliyyəti müxtəlif mühitlər üçün konkretləşdirir. Məsələn, sübut etibarlılığı (E) müxtəlif formalarda ola bilər: həll edici daha sonra fiziki dünyada sınaqdan keçiriləcək bir namizəd təklif etməli olduqda, təklifin iddia edilən ağlabatanlıqdan daha çox, həll edicinin məhdud rəy büdcəsi daxilində həqiqətən işlətdiyi bir proqnoza əsaslanıb-əsaslanmadığını soruşur; çatdırılacaq məhsul auditdən keçməli olan bir hesabat olduqda, hər bir rəqəmin təsvir etdiyi populyasiya üzərində həqiqətən icra edilmiş bir prosedurdan qaynaqlanıb-qaynaqlanmadığını soruşur. TRACES qabiliyyətlərini problemə xas atomik bacarıqlara və ya alt rubrikalara ayıraraq, TRACES yoxlanılması hədəflənmiş proses qiymətləndirməsi və diaqnostik rəy təklif edir. Qiymətləndiricilər sərbəst formalı bir bal təyin etmirlər — onlar müşahidə olunan sübutları hər bir qiymətləndirmə zolağının açıq yazılı təsvirləri ilə uyğunlaşdırırlar və hər bir tapıntı qeydə alınmış trayektoriyadakı xüsusi addımlara əsaslanır. Daha sonra müstəqil bir model nəticəni nəzərdən keçirir və fikir ayrılığı yenidən qiymətləndirməyə və son qərar qəbul etməyə səbəb olur. Proses yoxlayıcımızın etibarlılığını təmin etmək üçün proses yoxlanılması və gizli nəticələr arasında kalibrasiyalar və yoxlama-təmir dövrələri də həyata keçirilir. Süni İntellektin Bildiklərindən Kənara: Nəyi Kəşf Edə Biləcəyini Ölçmək Süni intellekt elmə daha dərindən daxil olduqca, bilmək və kəşf etmək arasındakı fərq getdikcə daha vacib olur. Bir model bəşəriyyətin bir xəstəlik haqqında artıq bildiklərini ümumiləşdirə bilər və yenə də yeni bir terapevtik imkanı müəyyən edə bilməz. O, nəşr olunmuş zülal elmini başa düşə bilər və yenə də sınaqdan keçirildikdə işləyən bioloji bir namizəd dizayn edə bilməz. O, yeni sübutlarla qarşılaşdıqda dağılan zərif bir elmi izahat verə bilər. Kəşf cavab açarının bitdiyi yerdə başlayır. TRACES Apodex -in süni intellekti bu sərhəddə qiymətləndirmək cəhdidir. Apodex haqqında Apodex Kəşfedici Süni İntellekt qurur: təlim paylanmasında artıq mövcud olan materiallardan çıxışlar yaratmaq əvəzinə, məlum biliklərdən naməlum şeyləri kəşf edən süni intellekt. Əsasında şirkətin real dünya problemləri üçün qurulmuş Öz-Özünü İnkişaf Etdirən Həll Edicisi dayanır: heç bir məlumat dəstində cavabı olmayan suallar, hər bir əsaslandırma addımının audit edilə biləcəyi və hər bir təkmilləşdirmənin təsdiqlənmiş kəşf yolu ilə qazanıldığı sistem. Apodex -in qurucu tezisi ondan ibarətdir ki, miqyas və məlumat təkbaşına nümunə uyğunluğundan həqiqi kəşfə keçid baryerini keçə bilməz. Bunu keçmək üçün neyroelm, informasiya nəzəriyyəsi, fizika və formal yoxlamadan yeni ideyalar — və onları həyata keçirə biləcək qədər iti insanlar tələb olunur. Apodex tədqiqat, mühəndislik və açıq mənbə töhfələri üzrə işə qəbul edir. Daha çox məlumat üçün www.apodex.com saytına daxil olun. İştirak və Giriş TRACES iştirak üçün açıqdır və Apodex həm qiymətləndirmək üçün həll edici sistemlər, həm də qurmaq üçün yeni problemlər axtarır. Həll edici sistem — bir model, bir qoşqu, bir agent dövrəsi və ya hər üçünü quran komandalar onu https://discovery.apodex.com/submit-solver.html vasitəsilə meyarımızda, o cümlədən TRACES qabiliyyətləri üzrə qiymətləndirmə üçün təqdim edə bilərlər. Təqdim edən komandadan heç bir inteqrasiya işi tələb olunmur: hər bir sistem eyni sabit epizod interfeysi vasitəsilə daxil olur və Apodex bu işi təqdim edən şəxslə əməkdaşlıq edərək həyata keçirir. Öz sahələrindən əhəmiyyətli bir problemi olan tədqiqatçılar və təşkilatlar — süni intellekt sisteminin hücum edə biləcəyinə inandıqları bir problemi https://discovery.apodex.com/submit-problem.html vasitəsilə təklif edə bilərlər və Apodex həm nəticə, həm də proses yoxlayıcıları ilə onu icra edilə bilən bir mühitə çevirmək üçün onlarla işləyəcək. Daha çox məlumat üçün 16 sektorda 561 sənayenin araşdırılmasından toplanmış 423 yüksək dəyərli problemin arxasındakı problem axtarışı prosesi, mühit və epizod dizaynı, proses metriki və tam nəticələr daxil olmaqla tam çərçivə aşağıdakı texniki hesabatda və veb saytlarda sənədləşdirilmişdir: TRACES və onun mühitlərini araşdırın TRACES texniki sənədini arXiv -də oxuyun Media Əlaqə TEAM LEWIS : [email protected] MƏNBƏ Apodex