Professor Anoop Namboodiri Kompüter Vizyonunda ümumi tədqiqat tendensiyaları və xüsusilə IIITH-də baş verənlərin perspektivlərini təqdim edir, onların Edge-də irəliləyişlərə necə kömək etdiyini izah edir.
Kənarda Kompüter Görməsi yeni bir inkişaf kimi səslənə bilər, lakin həqiqət budur ki, bu, onilliklər ərzində mövcuddur. Bizim təbii qəbul etdiyimiz bəzi tətbiqlərə fabriklərdə qüsurların aşkarlanması, barmaq izi və ya üz tanınması ilə mobil telefonun kilidinin açılması, hava limanlarında rentgen aparatları, QR kodları və ödənişli keçidlərdə nömrə nişanının tanınması daxildir. Kənarda süni intellekt sayəsində indi biz kənarda avtonom naviqasiya və daxili kameraya malik Amazon Echo kimi ev avtomatlaşdırma cihazları kimi daha güclü tətbiqlərə sahibik. Təkmilləşdirilmiş AI alqoritmləri ilə daha yeni və daha güclü istifadə halları işə salınır.
Kompüter Vizyonunun özü süni intellektin qabaqcıl inkişafında mühüm rol oynamışdır. Buna misal olaraq CNN, Gen AI və multimodal təməl modelləri göstərmək olar. Gələcəkdə, AGI sistemləri həyat qabiliyyətli olduqda, kompüter görmə və dünyanın 3D anlayışının burada mühüm rol oynayacağına əmin ola bilərik. Burada biz süni intellektni cihazların kənarına sövq edən son tendensiyalara diqqət yetiririk.
Kompüter Vizyonu, AI və Edge
Computer Vision, şəkillər və/və ya videolar şəklində ola biləcək böyük həcmdə vizual məlumatların işlənməsini əhatə edir. Bütün bu məlumatları mənalandırmaq üçün kənarda əhəmiyyətli miqdarda emal edə bilməyimiz vacibdir. Beləliklə, kompüter görmə kənarda emaldan əhəmiyyətli dərəcədə faydalana biləcək bir sahədir. Vision, AI və kənar arasında qarşılıqlı əlaqəyə baxmağın 3 yolu var:
- Vision-da hansı yeniliklər AI-ni kənarda qoymağa imkan verə bilər?
- Süni intellektdə hansı irəliləyişlər bizə Kompüter Vizyonunu kənara çıxarmağa kömək edə bilər?
- Kənar cihazlarda hansı təkmilləşdirmələr bizə AI və Vision-dan istifadə etməyə imkan verəcək?
Vizyonda Yeniliklər
Kompüter görmə qabiliyyəti maşına dünyaya bizim ona baxdığımız kimi baxmağa, yəni dünyanı qavramağa imkan verir. Ancaq bu gün sahədə olduğumuzu başa düşmək üçün nə ilə başladığımızı görmək faydalıdır. Fotokameranın ilk əcdadı çoxdan təsadüfən kəşf edilmiş və bir çox qədim abidələrdə tapıla bilən sancaq deşikli kameradır. Bu, mahiyyətcə obyektivsiz “kamera” və ya bir divarda kiçik bir deşik olan qaranlıq otaqdır. İnsan gözünü ilk dəfə bu “kamera qaranlıq” ilə müqayisə edən Leonardo Da Vinçi olmuşdur və o, əsrlər boyu insan görmə qabiliyyətini izah etmək üçün bir model kimi istifadə edilmişdir. Bu mərhələdən etibarən linza və güzgüləri özündə birləşdirən kameralar, təsvirlərin gümüş lövhəyə yazılması, rəngli və xrom plyonkaların inkişafı və nəhayət, fotoşəkillərin rəqəmsallaşdırılması ilə kompüterlə görmə mümkün oldu.
Rəqəmsal kameralar əsrin əvvəlində populyarlaşdıqca, onlar bizə sensorlardakı məlumatları şəkil kimi saxlamazdan əvvəl emal etməyə imkan verdilər. Bu, həmçinin görüntüləmə boru kəmərində əhəmiyyətli bir dəyişikliyə səbəb oldu, çünki sensorlardan alınan məlumatların əldə etmək üçün emal oluna biləcəyi müddətcə son görüntüyə yaxın olması lazım deyil. Bu sahəyə Hesablama Fotoqrafiyası deyilir. Bunun sadə nümunələrinə obyektin 3D formasını çəkmək üçün strukturlaşdırılmış işıq nümunələrinin proyeksiyası daxildir, bu da sonradan incə dənəli tanınmada istifadə oluna bilər (məsələn, Əl Həndəsəsinə əsaslanan şəxsin autentifikasiyası).

Stereo Vision
Daha mürəkkəb problem panoramik stereo görüntünün çəkilməsidir. yəni başımızı bir nöqtədən çevirdiyimiz zaman sol və sağ gözün görünüşlərini çəkmək üçün. Stereo cütün fırlanması yalnız statik səhnələrdə işləyəcək və bir dairədə kamera dəstindən istifadə əhəmiyyətli tıxanmalara səbəb olacaq. Google və FB tərəfindən təklif edilən həllərdən biri radial olaraq xaricə baxan daha böyük dairədə kameralar dəstindən istifadə etmək və sol və sağ göz görünüşlərini birləşdirmək üçün bu şəkillərin hissələrini istifadə etmək idi. Bununla belə, tələb olunan emal vahid stereo çərçivə yaratmaq üçün hesablama klasterində dəqiqələr səviyyəsində idi.
IIITH-də yeniliklər
IIITH-də biz fırlanan stereo kamera cütlüyünə mümkün qədər yaxın bir yerdən müvafiq işıq şüalarını çəkmək üçün katadioptriklərdən (linzaların və güzgülərin qarışığından) istifadə edən bir həll üzərində işlədik. Kompüter görmə sahəsindəki bu yenilik bizə emalı əhəmiyyətli dərəcədə azaltmağa imkan verir və biz indi stereo təsvir kompozisiyasını kənara köçürə və bunu 30 FPS-də edə bilərik. Optika əsaslı həll, həmçinin çox kameralı həllər üçün xas olan hər hansı kor nöqtələrdən qaçmağa imkan verir.

3D Yenidənqurma
Kenar prosessorlarının imkanlarında irəliləyişlərlə biz indi kənarda yığcam dərin öyrənmə modellərini işlədə bilərik. Bu, bizə dərinliyin qiymətləndirilməsi, semantik seqmentasiya və kənarda naviqasiya kimi əlavə funksiyalar əlavə etməyə imkan verəcəkdir. Hesablama intensivliyi olan tapşırıqların server əsaslı işlənməsi ilə yanaşı yüksək məlumat tələb edən kənar emalı da birləşdirə bilərsiniz. Bu halda belə bir emal nümunəsi dünyanın çoxsaylı şəkillərdən 3D rekonstruksiyası ola bilər.
Dərin Öyrənmə Modellərinin Təkmilləşdirilməsi
Görmə qabiliyyətinin kənara miqrasiyasına töhfə verən ikinci amil effektiv dərin öyrənmə modellərinin təkmilləşdirilməsidir. Səmərəliliyi artırmağın mümkün yollarından biri şəbəkənin bütün (və ya çox) parametrlərini daha az bitlə (kvantlaşdırma) təmsil etməkdir. Laboratoriyamızda bu istiqamətdə görülən işlərdən bəzilərinə parametr dəyərlərinin paylanmasını nəzərə alan binar kvantlaşdırmanın təkmilləşdirilməsi və binarlaşdırma və budamanı vahid çərçivədə birləşdirən və bütün şəbəkəni optimallaşdıran üçlü kvantlaşdırma daxildir.
Genişləndirici Qrafiklərdən istifadə
Budama strategiyalarının əksəriyyəti budana bilən çəkiləri müəyyən etmək üçün tam ölçülü şəbəkənin təlimini əhatə edir. Daha kiçik çəkilər çıxarıldıqdan sonra budanmış şəbəkə daha da öyrədilir. İstənilən budama səviyyəsinə çatana qədər və ya səhv dərəcəsi icazə verilən maksimum həddə çatana qədər bu proses təkrarlanır. Belə təlimin çatışmazlığı ondan ibarətdir ki, o, çox hesablama tələb edir və yalnız xüsusi yüksək səviyyəli serverlərdə edilə bilər. Biz şəbəkəni əvvəlcədən budamağa və sonra təlim prosesinin daha səmərəli olmasına çalışdıq. Bunun üçün biz qrafik nəzəriyyəsindən genişləndirici qrafiklər konsepsiyasını gətirməli olduq. Nəzəri kompüter elmindən əldə edilən bilikləri süni intellektlə birləşdirir ki, bu da öz növbəsində kənarda tətbiq oluna bilən kompüter görmə qabiliyyətini yaxşılaşdırır.
Biz həmçinin kənarda dərin öyrənmə modellərinin performansının modelləşdirilməsi üzərində müəyyən işlər görmüşük. Bu, performans hədəfini nəzərə alaraq müəyyən bir modelin maksimum parametrlərinin sayını proqnozlaşdırmağa imkan verir. Bu, verilmiş kənar aparatda işlədilə bilən ən yaxşı modelləri müəyyən etməyə, onları öyrətməyə və əldə edilən dəqiqlikləri müqayisə etməyə imkan verir.
Biometrik məlumatların qorunması
Edge-computing-də kompüter görməsinin başqa bir maraqlı cəhəti, bu cihazların indi yaxınlıqdakı insanları aşkar edə və tanıya bilməsidir. Bu, həm məxfilik, həm də təhlükəsizlik problemləri yaradır. Bununla belə, kənarda hesablama qabiliyyətinin olması biometrik alqoritmlərin təhlükəsizliyini və məxfiliyini yaxşılaşdırmaq üçün təhlükəsiz çoxtərəfli hesablama üsullarını tətbiq etməyə imkan verir. Bu kontekstdə kənarda tətbiq oluna bilən digər imkanlara biometrik saxtakarlıq aşkarlanması daxildir.
Edge Cihaz Məsuliyyətinin Təhlili
Biz həmçinin kənardakı fiziki təsvir dəyişikliklərini modelləşdirən avtomatik kodlaşdırıcı şəbəkə yaratdıq. Daha sonra biz bu modeldən kənar cihazların zəifliklərini təhlil etmək üçün, xüsusən təqdimat hücumları (PA) məqsədilə istifadə edirik. Əslində biz göstərdik ki, PA aşkarlanmasından yan keçmək mümkündür. Belə bir modelin köməyi ilə təpəyə dırmaşmaq və ya gradient hücumu etmək və 80%-dən çox müvəffəqiyyət dərəcəsi ilə təqdimat hücumlarının aşkarlanması sistemlərinin əksəriyyətini aldatmaq olar.
xülasə
Görə bilərik ki, kompüter görmə, süni intellekt və kənar hesablama sahələri bir-biri ilə çox bağlıdır və bir sahədəki təkmilləşdirmələr digərlərinə qarşılıqlı faydalı şəkildə təsir edə bilər. Bu simbiotik böyümə həm də kənarda müxtəlif tətbiqlərə imkan verir. Nəticədə paylanmış hesablama və öyrənmə modeli yaxın gələcəkdə son dərəcə vacib olacaqdır.
Bu məqalə əvvəlcə jurnalın iyun sayında dərc edilmişdir TechForward Dispatch

Anoop Namboodiri IIIT Hyderabad-da Vizual İnformasiya Texnologiyaları Mərkəzinin (CVIT) müəllim üzvüdür. Computer Vision, Machine Learning və Biometrika sahələrində işləyir. Onun Hesablama Fotoqrafiyası üzərindəki işi tək sensorla stereo panoramik videoların çəkilməsi üçün öz növünün ilk həlli ilə nəticələndi. Anoop həmçinin Aadhaar layihəsi ilə yaxından işləmiş və onlar üçün bir neçə biometrik həllər hazırlamışdır.
