ElevenLabs süni intellektin səs qatını, yəni mətni insan səsinə çevirən modelləri qurur. Əksər insanlar bununla müştəri xidmətləri ilə danışarkən, çox vaxt fərqinə varmadan qarşılaşırlar. Məsələn, Klarna ABŞ -da 35 milyon müştərisi üçün ilkin telefon dəstəyini bu sistem üzərində idarə edir. Deutsche Telekom , Cisco , Adobe və artan sayda hökumətlər də eyni şeyi edir. ElevenLabs həmçinin platformasını audiokitablar, dublyaj və musiqi üçün istifadə edən yaradıcılara da satış edir. Bu sahədə tək deyil. Əslində, o, getdikcə daha çox müştərilərlə, o cümlədən səs məhsulunu ElevenLabs üzərində öyrətmiş və indi onunla rəqabət aparan Decagon adlı danışıq süni intellekt platforması ilə qarşılaşır. Lakin onun investorları çox narahat görünmürlər. İllik təkrarlanan gəlirinin 600 milyon dollar olduğunu bildirən şirkətin, cəmi dörd yaşı olmasına baxmayaraq, investorları tərəfindən 22 milyard dollar dəyərində qiymətləndirildiyi bildirilir. Daha çox məlumat əldə etmək üçün mən ElevenLabs -ın həmtəsisçisi və CEO-su Mati Staniszewski ilə Toronto da, əvvəllər Elevate kimi tanınan yerli sahibkarlıq konfransı olan Nrth -də müsahibə apardım. Qısa müddətdə bir sıra mövzuları əhatə etdik, o cümlədən müəssisələrin müştərilərə süni intellektlə danışdıqlarını bildirməli olub-olmaması (o, bildirməli olduqlarını düşünür) və şirkətin ümumi marjalarını müzakirə edə bilib-bilməməsi. Təəccüblü deyil ki, Staniszewski onları ətraflı müzakirə edə bilməyəcəyini bildirdi, lakin şirkətin bazar payını genişləndirmək deməkdirsə, marjaların daha da sıxılmasına etiraz etmədiyini açıqladı. Söhbətimiz qısaldılmış və yüngülcə redaktə edilmiş şəkildə aşağıdadır. Tam söhbəti buradan oxuya bilərsiniz. Keçən il TechCrunch Disrupt -da bizə qoşulmuşdunuz və orada səs modellərinin bir neçə il ərzində əmtəəyə çevriləcəyini söyləmişdiniz. İndi bu proqnozu necə qiymətləndirərdiniz? Hələ görüləsi çox iş var və yalnız model səviyyəsində əldə edilə bilən keyfiyyət fərqi hələ də əhəmiyyətlidir. Əgər daha uzun müddətə, yəqin ki, üç, beş il sonraya düşünsək, bu fərqlər daha kiçik olacaq. Etmək istədiyimiz və ilk edənlərdən olmaq istədiyimiz şey, danışıq süni intellekti üçün Turing testini keçməkdir. Zəkanı birləşdirmək lazımdır, lakin həm də emosional zəkaya ehtiyacınız var. Digər tərəfin emosiyalarını başa düşmək, yavaşlamaq və ya sürətlə danışmaq bacarığına sahib olmaq lazımdır. Bu hələ edilməyib. Biznesin neçə faizi indi müəssisədir? Biz indi 600 milyon dollar illik təkrarlanan gəlirə sahibik. Əlli beş faizdən çoxu klassik müəssisədir, qalan 45% -in böyük bir hissəsi isə kiçik və orta bizneslər, tərtibatçılar, qurucular, yaradıcılardır. Süni intellekt sahəsindəki hər kəs kimi, siz də getdikcə müştərilərinizlə rəqabət aparırsınız. Decagon səs məhsulunu sizin üzərinizdə öyrətdi və indi sorğuları öz modelləri vasitəsilə idarə edir. Xətlər daha da bulanıqlaşır. Model şirkətləri, platforma şirkətləri, tətbiq şirkətləri haqqında düşündükdə, əvvəllər birinin harada başlayıb harada bitdiyi çox aydın bölünmələr var idi. Bu gün bu xətt daha bulanıqdır. Anthropic -in vəziyyətində, model şirkəti olan bir şey qəti şəkildə platforma və getdikcə geniş bir tətbiqlər dəsti halına gəlir. Düşünürəm ki, bu davam edəcək. Müştəriləriniz ElevenLabs -da seçimlər menyusundan “mühakimə qatını” seçə bilərlər. Sərhəd laboratoriya modellərinin açıq çəkili modellərə qarşı istifadəsi baxımından nə görürsünüz? Bu, ikili seçimdən daha azdır. Müştəri təcrübəsində, əgər zəng edirsinizsə və bu, sadəcə məlumat xarakterlidirsə, heç bir əməliyyat icra etmirsinizsə – bir çox açıq mənbəli modellərdən istifadə edə bilərsiniz, çünki bilik bazanız yaxşı təcrübənin nə olduğunu müəyyən edir. Lakin əgər bu, maliyyə xidmətləridirsə, autentifikasiya olunmaq, əməliyyat haqqında məlumat, bəlkə də geri ödəmə istəyirsiniz. Səhvə yer yoxdur. Burada sərhəd modelləri hələ də lider olacaq. Bu açıq çəkili modellərin bəziləri Çin modelləridir. ABŞ hökuməti müştəridir. Avropa hökumətləri müştəridir. Bu söhbətlər necədir? Fərqlidir. Hər bir tətbiqdə istifadə etdiyimiz modellər və səslər vəziyyətdən asılı olacaq. Əgər Polşa hökuməti və ya Braziliya hökuməti ilə işləyiriksə, onların öz tələbləri var. Bu, açıq çəkili model, qapalı mənbəli model, onların özlərinin incə tənzimlənmiş modeli ola bilər. [ Polşa da] bu, səhiyyə işidir. İctimai səhiyyə sistemində randevu alan xəstələr var və 18% heç vaxt gəlmir. Tətbiq, zəng edib xatırladan agentlərdir. Onların bilikləri üzərində optimallaşdırılmış bir sıra modelləri var idi və biz məlumatların yerləşməsini qoruyaraq inteqrasiya edirik. Müəssisələr bir insanın deyil, bir agentlə danışdıqda bunu açıqlamalıdırmı? Düşünürəm ki, hazırda açıqlama olmalıdır. Hazırda insanlar buna öyrəşməyib və ümumi nümunə odur ki, o zəngdə aldadıldığınızı hiss etmək istəmirsiniz. Lakin beş ildən sonra, hər kəsin öz adından işləyən agenti olduqda, zəng edib bir agent gözləyəcəksiniz. O zaman düşünürəm ki, cəmiyyət olaraq dəyişəcəyik. Bunu etməyin yaxşı yolları var – əgər bir insan üçün 30 dəqiqə gözləmə müddəti varsa, müştəriyə seçim təklif edin. Demək olar ki, bütün hallarda, onlar agenti seçirlər və sonra təcrübənin nə qədər yaxşı olduğuna təəccüblənirlər. Modellər və nəticələr üçün ödədiyiniz xərcləri nəzərə alsaq, ümumi marjalarınız nə qədərdir? Qeyri-müəyyən cavab verəcəyəm. Tədqiqat elementimiz olduğunu nəzərə alsaq, modelləri son dərəcə ağıllı yollarla incə tənzimləyə və məhdudlaşdıra bilirik. Lakin hər hansı bir qənaəti müştəriyə ötürə bilsək, bunu edirik. Ən böyük şey hələ də dəyəri sübut etmək və müştəri ilə birlikdə olmaqdır. Beləliklə, əgər biz investisiya edib bu dəyəri sübut edə bilsək, növbəti beş ildə dəyər yarandıqca birlikdə faydalanmaq üçün marjaların aşağı düşməsinə etiraz etmirik. Milyonlarla saat müştəri xidməti zəngləriniz var. Onlar üzərində təlim keçirsinizmi? Təlim məlumatlarınızın nə qədər hissəsi sintetikdir? Bəzi şirkətlərdə modelləri birlikdə yaratdıq. Onlar öz istifadə halları üçün xüsusi bir model istəyirdilər. Əks halda, təlimin böyük hissəsi məlumatların həcmi deyil, məlumatların annotasiyası idi. Daxili olaraq minlərlə insan müqavilə əsasında bizə nəyin deyildiyini, insanların nə vaxt danışdığını, necə danışdığını, hansı emosiyaların istifadə olunduğunu annotasiya etməyə kömək edir. Aksentləri dəqiq aşkar edə bilmək üçün səs məşqçilərini cəlb etməli olduq. 2028 -ci ildə IPO üçün hazırlaşdığınız bildirilir. Bunu təsdiq edə bilərsinizmi? Zamanın sınağından çıxacaq bir şirkət yaratmaq istərdik. Növbəti illərdə bunu edə bilmək üçün təməli hazırlayırıq. Lakin bunu edib-etməyəcəyimiz zamandan və yerdən asılı olacaq. 'İllər' çox qeyri-müəyyəndir. [Gülür.] Səhnə arxası: Sərhəd laboratoriyaları yavaşlamalıdırmı? Hər kəs sürəti tənzimləmək üçün birlikdə işləməyə hazırdır. Bunun ictimaiyyətə açıqlanmalı olub-olmaması və media müzakirələrinin və ya tənzimləmənin nə qədərini əhatə etməsi başqa bir mövzudur. Lakin bəli, texnologiyanı tətbiq edərkən hamımız lazımi tədbirləri görməliyik. Biz mətn modellərini və modellərin zəka tərəfini təlim etmirik, bu da mübahisənin əsas açarıdır. ElevenLabs Hugging Face kimi ifşa oluna bilərmi? Biz bir addım irəliyik, çünki agentlərin zəkasının özünü təkrarlayan və ya təkrarlanan hissələrini tətbiq etmirik. Texnologiyamız agentlərə daha çox agent yaratmağa imkan vermir. Hər bir müştəri KYC prosesindən keçir. Kibertəhlükəsizlik riski geniş dünya üçün qəti şəkildə bir riskdir, lakin bizdə yaxşı bir sıra tədbirlər mövcuddur.