Rozhovor s Wangom Yaonanom, akademikom Čínskej inžinierskej akadémie: Umelá inteligencia robí strojové videnie inteligentným

May 07, 2024 Zanechajte správu

Vďaka vývoju umelej inteligencie poháňanej veľkým jazykovým modelom, výskum a aplikácia grafickej ikonografie otvorili novú príležitosť, ktorá podporuje vývoj veľkého jazykového modelu na veľký model vízie." 30. decembra 2023 pri príležitosti Silvestra a Nového roka sa Wang Yaonan, akademik Čínskej inžinierskej akadémie a riaditeľ Národného inžinierskeho výskumného centra pre technológiu vizuálneho vnímania a riadenia robotov, podelil o najnovšie trendy vo vývoji inteligencie strojového videnia na 19. konferencii mladých vedcov Čínskej spoločnosti grafickej grafiky.

 

V exkluzívnom rozhovore s reportérom Nandu Wang Yaonan povedal, že umelá inteligencia robí strojové videnie inteligentným a vyššia aritmetická sila môže podporiť tréning veľkých vizuálnych modelov. Inteligentnejšie modely veľkého videnia však potrebujú aj vyššie aritmetické úrovne, lepšie architektúry modelov a efektívnejšie algoritmy učenia.

 

Túto konferenciu organizuje Čínska spoločnosť obrazovej grafiky, laboratórium Pazhou, Technická univerzita v Južnej Číne, Univerzita Sun Yat-sen a Pracovný výbor pre mládež Čínskej spoločnosti obrazovej grafiky.

 

Rozprávanie o trendoch v odvetví

 

Od vizuálneho počítania po vizuálnu inteligenciu

 

Yao-Nan Wang: Čínsky výskum strojového videnia má takmer 40-ročnú históriu, spočiatku začal štúdiom senzorov, to znamená: konvertovaním svetelných informácií na obrazové informácie. Ďalšou vecou, ​​​​ktorú treba urobiť, je spracovanie vízie, vrátane vylepšenia získaného obrazu, aby bol jasnejší.

 

Keď máme jasný obraz, musíme z neho získať cieľ, ktorý nás zaujíma. Napríklad v oblasti jazdy bez vodiča potrebuje strojové videnie rozpoznať ciele na obrázku, aby odpovedalo na otázku, kto je človek a kto auto.

 

Toto sú tri hlavné oblasti strojového videnia. Zredukujem to na: zobrazenie, spracovanie a pochopenie.

 

Strojové videnie sa v minulosti posunulo od vizuálnej výpočtovej techniky k súčasnej vizuálnej inteligencii. Vizuálne výpočty v kombinácii s umelou inteligenciou zlepšili úroveň poznania a zlepšili schopnosť porozumieť zložitým prostrediam a celé odvetvie vizuálnej inteligencie zaznamenalo za posledný rok rýchly rozvoj.

 

Smerom vývoja inteligencie strojového videnia je vykonávanie širokej škály aplikácií aplikovaných na priemyselnú kontrolu, inteligentnú výrobu a satelitné diaľkové snímanie a ďalšie oblasti.

 

Keď hovoríme o strojovom videní, musíme hovoriť o jeho aplikácii, vývoji technológie riadenej aplikáciou. Čínska spoločnosť pre obrazovú grafiku má 30 špeciálnych výborov, ktoré sa zameriavajú najmä na grafické obrázky na vykonávanie výskumu, ktoré slúžia národnému hospodárstvu. Tieto technológie majú širokú škálu aplikačných scenárov, vrátane priemyslu, poľnohospodárstva, geografických informačných systémov, diaľkového prieskumu Zeme, pôdnych zdrojov atď.

 

Človek môže vidieť svet pri narodení a porozumieť svetu potom a 80 % informácií získava zrakom. Strojové videnie má simulovať ľudské oko a nakoniec dosiahnuť úroveň ľudského oka av niektorých aspektoch prekročiť ľudské oko, vidieť ďalej, vidieť jasnejšie.

 

Hovorte o modeli veľkej vízie

 

Veľký vizuálny model bude čoraz inteligentnejší

 

Yao-Nan Wang: Big Language Model je dátovo riadená AI, ktorá využíva poznatky z kníh, jazyka a textu ako dáta na trénovanie modelu neurónovej siete, ktorý dokáže uvažovať a odpovedať na základe toho, čo sa naučil.

 

Údaje pre veľký vizuálny model na druhej strane pochádzajú hlavne z rôznych obrázkov vrátane vizuálnych údajov generovaných ľuďmi a prírodou. Napríklad veľký lekársky vizuálny model spočíva v tom, že sa do veľkého modelu vložia obrázky ľudských orgánov a lézií ako vizuálne údaje a potom sa trénuje, aby ich získal, aby mohol čítať fotografie z CT ako lekár a mohol dosiahnuť efekt zdôvodnenie stavu pacienta po fotografovaní, keď pacient príde k lekárovi.

 

Súčasný vizuálny model nemá taký istý ako ľudský mozog, ako si predstavujeme, medzera je stále veľmi veľká. S nárastom učebných údajov a úpravou parametrov modelu sa model bude zväčšovať a zväčšovať a stále viac vedomostí a jeho inteligencia bude stále vyššia a inteligentnejšia.

 

Potrebujeme zvýšiť úroveň aritmetickej sily a zrýchliť rýchlosť výpočtov, aby sme mohli rýchlejšie zostavovať modely; navrhnúť lepšie architektúry modelov vrátane lepšej interpretovateľnosti a bezpečnejších a kontrolovateľnejších; a na výskum efektívnejších algoritmov učenia.

 

V skutočnosti vizuálne makromodelovanie nie je v posledných rokoch novinkou, vyvíjalo sa krok za krokom. V 80. rokoch s rozvojom umelej inteligencie ľudia začali študovať neurónové siete. Ide len o to, že za posledných pár rokov sa aritmetické a algoritmické schopnosti zvýšili, takže ľudia sa môžu pokúsiť postaviť veľké modely, čím vznikli veľké jazykové modely a veľké vizuálne modely. V minulosti, keď nebola dostatočná aritmetická sila, ľudia nevyrábali také veľké modely.

 

Hovoríme o výhľade na rok 2024

 

Dúfame, že podnikanie bude rásť z Guangzhou do celej krajiny a sveta.

 

Yaonan Wang: Národné centrum inžinierskeho výskumu univerzity Hunan pre technológiu vizuálneho vnímania a riadenia robotov sa v roku 2022 presťahovalo do Guangzhou Zengcheng, ktoré sa nachádza v oblasti Guangdong-Hong Kong-Macao Greater Bay Area, a založilo HU Guangdong-Hong Kong-Macao Greater Bay Inštitút výskumu inovácií v oblasti (Guangzhou Zengcheng).

 

Ústav sa zameriava na výskum a aplikáciu inteligentného videnia pre stroje, vrátane špeciálnych operačných robotov v oblasti inteligentnej výroby, medicíny a farmácie, ako aj zovšeobecnených veľkých modelov videnia. Tieto výskumy sa napríklad aplikujú vo výrobnom priemysle, ktorý môže nahradiť veľký počet pracovníkov a dokončiť kontrolu kvality výrobkov, najmä v priemysle 3C a špičkových dielov. V súčasnosti inštitút vyvinul softvérové ​​a hardvérové ​​systémy, ktorých hlavnou funkciou je posilniť digitálnu a inteligentnú transformáciu podnikov Guangdong a podporovať rozvoj výrobného priemyslu.

 

Okrem toho ústav vykonáva aj inteligentné strojové videnie a riadiace systémy, ktoré sa používajú najmä pri výrobe špičkových inteligentných zariadení, ako je priemyselný internetový softvér, ktorý má veľmi veľké množstvo algoritmov.

 

Guangdong je popredím reformy a otvárania sa a hlavným ekonomickým bojiskom s kompletným priemyselným reťazcom a dodávateľským reťazcom a mnohými výrobnými podnikmi, do usporiadania Guangdong sme prišli najprv kvôli dopytu na trhu. Okrem toho, naše výskumné centrum má niekoľko výskumných a vývojových tímov v Guangdongu, ktoré priniesli veľa projektov, transformáciu vedeckých a technologických úspechov.

 

V prvej polovici roku 2023 sme sa stretli s určitými výzvami, najmä v oblasti dodávok dielov a komponentov. 2024, verím, že tieto problémy budú vyriešené a priemyselný reťazec, dodávateľský reťazec a možnosti výskumu a vývoja odvetvia umelej inteligencie v Guangdongu sa zlepšia. Na veľkom domácom trhu sa otvoria nové trate. V živej atmosfére, kde každý preberá iniciatívu, koná a inovuje, možno všetky výzvy vyriešiť.

 

Som presvedčený o rozvoji priemyslu AI v Guangdongu. Za posledných 30 rokov sme vynaložili veľa úsilia na to, aby sme boli sebestační vo vede a technike, a nazhromaždili sme množstvo výsledkov vedeckého výskumu. Guangdong je najväčšia ekonomická provincia v Číne.

 

Oblasť umelej inteligencie a robotiky, ktorej sa venujeme, sa chytila ​​dobrej príležitosti, ktorá sa za posledné dva roky explozívne rozrástla, priniesla mnohé nové trhy a vtiahla nové priemyselné dráhy. V budúcnosti bude čoraz viac inteligentných terminálov, čo povedie aj k rozvoju priemyslu výrobných zariadení a zariadení. Dúfam, že v roku 2024 náš výskumný ústav v Zengcheng, Guangzhou, bude môcť preniesť naše podnikanie do celej krajiny a sveta.