Sarvam AI şirkəti çoxdilli səs tətbiqləri üçün nəzərdə tutulmuş yeni avtomatik nitq tanıma (ASR) modeli olan Saaras V4 -ü təqdim edib. İngilis dili ilə yanaşı, o, 22 Hind dilini də dəstəkləyir və kod-qarışıq nitq, regional ləhcələr, dialekt fərqləri və səs-küylü audionu idarə etmək üçün qurulub. Model Sarvam AI -ın Hindistanda , xüsusilə Hind dillərində səsli süni intellektin istifadəsini genişləndirmək təşəbbüsünün bir hissəsidir. Benqaluru -da yerləşən şirkət 24 avqust tarixində “Saaras V4-ü təqdim edirik” başlıqlı məhsul yeniləməsində Saaras V4 -ü elan edib. Sarvam AI bildirib ki, Saaras V4 nitq emalının beş növünü dəstəkləyir: transkripsiya, tərcümə, transliterasiya, sözbəsöz və kod-qarışıq mətn. O, həmçinin aşağı gecikməli axını dəstəkləyir, ilk tokenə qədər bildirilən vaxt 150 millisaniyədən azdır ki, bu da onu real-vaxt səs tətbiqləri üçün uyğun edir. Sarvam AI -a görə, Saaras V4 Hind dilləri üçün qurulub və 3 milyard parametrlik hibrid vəziyyət-fəza dil modelini audio kodlayıcı ilə birləşdirir. Şirkət bildirib ki, model fon səs-küyü, kod dəyişdirmə və dialekt fərqləri daxil olmaqla real dünya audio şərtləri üçün nəzərdə tutulub. Təsdiqlənmiş IndicVoices məlumatlarına əsasən, model bütün 22 dildə 5,22%, ən çox danışılan 10 Hind dilində isə 2,9% dil identifikasiyası səhv dərəcəsi qeydə alıb. Bir modeldə beş çıxış rejimi olan Saaras V4 ayrı-ayrı post-emal sistemlərinə ehtiyac olmadan eyni danışıq materialının bir neçə versiyasını istehsal edə bilər. Rejimlər sözbəsöz, transkripsiya, kodqarışıq, translit və tərcümədir. Sözbəsöz orijinal skriptin dəqiq sözlərini qoruyur, transkripsiya rejimi isə rəqəmləri və tarixləri standartlaşdıracaq. Kodqarışıq ingilis sözlərini ingilis dilində saxlayır, translit nitqi Roma əlifbasına çevirir və sonra ingilis dilinə tərcümə edir. Sarvam AI -a görə, bu, çoxsaylı transkripsiya və dil emalı sistemlərindən istifadənin mürəkkəbliyini və səhv potensialını sadələşdirə və minimuma endirə bilər. İngilis və Hind etalonlarında performans Şirkət Saaras V4 -ü görüşlər, podkastlar, maliyyə zəngləri, media, Hind ingilis dili və beynəlxalq ləhcələr üzrə yeddi ingilis nitq etalonunda sınaqdan keçirib. Sarvam AI -a görə, model bu məlumat dəstlərində ən aşağı orta Söz Səhv Dərəcəsinə ( WER ) nail olub. Hind dili üçün sınaqlar Vistaar etalonunda 10 dildə , həm WER , həm də LLM-WER istifadə edilərək aparılıb. Sonuncu, mənalı transkripsiya səhvlərini formatlaşdırma və ya yazılış fərqlərindən ayırmaq üçün semantik yoxlama əlavə edir. Axın və tərtibatçı girişi Saaras V4 həmçinin real-vaxt WebSocket axını və uzun formalı audio emal xüsusiyyətlərinə malikdir. Sarvam AI -a görə, çoxdəqiqəlik qeydlərin emalı cəmi bir saniyə çəkəcək. Model Sarvam AI API -da mövcuddur və Python və Node.js SDK -ları vasitəsilə istifadə edilə bilər. Bundan əlavə, şirkət bildirir ki, o, Vercel AI SDK , LiveKit Agents və Pipecat Agents ilə inteqrasiyalara malikdir. Sarvam AI bildirib ki, API daha qısa fayllar üçün sinxron transkripsiya, 2 saata qədər qeydlər üçün toplu emal və canlı tətbiqlər üçün axın transkripsiyası təklif edir.