Bu ilki 450 milyard dollarlıq süni intellekt infrastrukturunun əksər hissəsi heç vaxt faydalı iş görmür. RidgeScope telemetriya məlumatlarına əsaslanaraq dəqiqələr ərzində səbəbləri diaqnoz edir: heç bir alətə ehtiyac yoxdur. SUNNYVALE, Kaliforniya, 20 iyul 2026 /PRNewswire/ -- ApexData Inc. bu gün RidgeScope -un ümumi satışa çıxarıldığını elan etdi. Bu, GPU təliminin telemetriyasını oxuyan və nəyin, niyə uğursuz olduğunu və bununla bağlı nə ediləcəyini müəyyən edən süni intellektlə işləyən diaqnostik platformadır. Bu, hiperskalatorların bu il süni intellekt infrastrukturuna təxminən 450 milyard dollar xərclədiyi bir vaxta təsadüf edir. Bu rəqəmin arxasında sənayenin MFU boşluğu adlandırdığı – alınan hesablama gücü ilə istifadə olunan hesablama gücü arasındakı çatışmazlıq dayanır. Model FLOPs istifadəsi, GPU -nun nəzəri hesablama gücünün modeli irəli aparan hissəsi, adətən 30-40 faiz arasında dəyişir; donanma tədqiqatları ortalamaları 20 faizə yaxın ölçür. GPU hesablama gücünə xərclənən hər dolların yarıdan çoxu yavaş çiplərə, məlumat boru kəmərlərinin çatışmazlığına, rabitə dayanmalarına, avadanlıq qüsurlarına və heç bir şey öyrənmədən təmiz başa çatan işlərə itirilir. Təxminən 3.26 dollar GPU-saat üçün, 128-GPU H100 klasteri tələb əsasında gündə təxminən 10,000 dollar , ildə isə təxminən 3.65 milyon dollar a başa gəlir. 20 faiz MFU ilə eyni avadanlıq yaxşı tənzimlənmiş işin çatdığı 40 faiz səviyyəsində verəcəyi təlim işinin yarısını görür: illik hesabın təxminən 1.8 milyon dolları daha yaxşı mühəndisliklə bərpa edilə bilməyən heç bir şey almır. Boşluğu 20-dən 40 faizə qədər bağlamaq, əlavə bir GPU almadan eyni avadanlığın məhsuldar çıxışını ikiqat artırır. ApexData -nın həmtəsisçisi və baş icraçı direktoru Evgeny Potapov dedi: “Sənaye GPU -ları tam məhsuldar aktivlər kimi maliyyələşdirir, lakin əksər klasterlər spesifikasiya vərəqinin vəd etdiyinin yarısından azını təmin edir. Bu, yalnız neocloud problemi deyil. Bu, modelləri təlim edən hər bir təşkilata aiddir. Görə bilmədiyiniz bir boşluğu bağlaya bilməzsiniz və bu gün demək olar ki, heç kim bunu görmür.” Hər serverdəki yüngül bir agent hər təlim işi üçün 12,000-dən çox siqnal toplayır: GPU davranışı, qarşılıqlı əlaqə trafiki, iş jurnalları və planlaşdırıcı qeydləri. Bir süni intellekt mühərriki 20-dən çox məlum uğursuzluq nümunəsinə qarşı sübutları qiymətləndirir, hər birini daxil edir və ya xaric edir. Hər bir iş bir qərarla başa çatır: məlumat nəyi göstərir, nəyi nəzərdə tutur və nəyi qərar verə bilməz, hər bir iddia onun arxasındakı ölçmə ilə bağlıdır. “ GPU israfı səssizdir. Bir yavaş çip 127 sağlam çipi aşağı çəkir, bir iş irəliləyişini o qədər tez-tez saxlayır ki, heç bir irəliləyiş əldə etmir, başqa bir iş bahalı avadanlıqda heç nə hesablamadan dayanır və hər bir idarə paneli yaşıl qalır,” ApexData -nın həmtəsisçisi və texniki direktoru Andrey Shamakhov dedi. “Biz uğursuzluğu adlandırırıq, sübutları göstəririk və onun nəyə başa gəldiyini deyirik. Məlumat bir şeyə cavab verə bilmədikdə isə, qərar təxmin etmək əvəzinə bunu bildirir.” GPU bulud operatorları üçün RidgeScope hər bir dəstək biletinin arxasındakı sualı həll edir: müştəri kodu yoxsa klaster avadanlığı. RidgeScope Hugging Face Transformers, Megatron-LM, PyTorch Lightning və Keras/TensorFlow -u tanıyır. Əksər komandalar üçün təlim məlumatları şirkətin ən dəyərli intellektual mülkiyyətidir. RidgeScope yalnız sistem telemetriyasını və planlaşdırıcı metadata-nı oxuyur – heç vaxt məlumat dəstlərini, mənbə kodunu və ya model çəkilərini oxumur – və tamamilə müştərinin öz şəbəkəsində işləyə bilər: yerində və ya hava boşluğunda, yerli LLM modelləri, hər kirayəçi üçün izolyasiya, SSO/SAML və GDPR - və PCI DSS -səviyyəli şifrələmə ilə. Bu gün ümumi satışda olan RidgeScope Slurm və Kubernetes -də dəqiqələr ərzində quraşdırılır və 30 dəqiqə ərzində ilk qərarı qaytarır. İctimai Uğursuzluq Kataloqu və Sübut İndeksi hər bir uğursuzluq rejimini və qərarın istinad edə biləcəyi hər bir siqnalı sadalayır. Nümayişlər canlı olaraq https://ridgescope.ai ünvanında keçirilir. ApexData haqqında: ApexData Inc. (Sunnyvale, Kaliforniya) DevOps və paylanmış sistemlər təcrübəsindən istifadə edərək ML təlimi və infrastrukturu üçün süni intellektlə işləyən müşahidə imkanları yaradır. Media Əlaqə: Andrei Surkov +14083298998 [email protected] MƏNBƏ ApexData Inc