Intervija ar Ķīnas Inženieru akadēmijas akadēmiķi Vanu Jaonanu: mākslīgais intelekts padara mašīnas redzi inteliģentu

May 07, 2024 Atstāj ziņu

Pateicoties mākslīgā intelekta attīstībai, ko virza lielās valodas modelis, grafiskās ikonogrāfijas izpēte un pielietošana ir pavērusi jaunu iespēju, kas veicina lielās valodas modeļa izstrādi uz lielo redzējumu modeli." 2023. gada 30. decembrī plkst. Jaunā gada vakarā un Jaungada dienā Van Jaonana, Ķīnas Inženieru akadēmijas akadēmiķis un Nacionālā inženierzinātņu pētniecības centra direktors robotu vizuālās uztveres un kontroles tehnoloģiju jomā, dalījās ar jaunākajām tendencēm mašīnredzes intelekta attīstībā. Ķīnas Grafikas grafikas biedrības 19. jauno zinātnieku konferencē.

 

Ekskluzīvā intervijā Nandu reportierim Vans Jaonans sacīja, ka mākslīgais intelekts padara mašīnredzi inteliģentu, un lielāka aritmētiskā jauda var atbalstīt lielu vizuālo modeļu apmācību. Tomēr viedākiem lielās redzes modeļiem ir nepieciešami arī augstāki aritmētiskie līmeņi, labākas modeļu arhitektūras un efektīvāki mācīšanās algoritmi.

 

Šo konferenci organizē Ķīnas attēlu grafikas biedrība, Pazhou laboratorija, Dienvidķīnas Tehnoloģiju universitāte, Sun Yat-sen University un Ķīnas attēlu grafikas biedrības Jaunatnes darba komiteja.

 

Runājot par nozares tendencēm

 

No vizuālās skaitļošanas līdz vizuālajam intelektam

 

Yao-Nan Wang: Ķīnas mašīnredzes pētījumiem ir gandrīz 40 gadu vēsture, sākotnēji sākot ar sensoru izpēti, tas ir, lai gaismas informāciju pārvērstu attēla informācijā. Nākamais, kas jādara, ir redzes apstrāde, tostarp iegūtā attēla uzlabošana, lai tā būtu skaidrāka.

 

Pēc skaidra attēla mums ir jāiegūst mūs interesējošais mērķis no attēla. Piemēram, bez vadītāja braukšanas jomā mašīnredzei ir nepieciešams noteikt attēlā redzamos mērķus, lai atbildētu uz jautājumu, kurš ir cilvēks un kurš ir automašīna.

 

Tās ir trīs galvenās mašīnredzes jomas. Es runāju par attēlveidošanu, apstrādi un izpratni.

 

Mašīnredze ir pārgājusi no vizuālās skaitļošanas pagātnē uz vizuālo inteliģenci mūsdienās. Vizuālā skaitļošana apvienojumā ar mākslīgo intelektu ir uzlabojusi izziņas līmeni un uzlabojusi spēju izprast sarežģītas vides, un visa vizuālā intelekta nozare pēdējā gada laikā ir piedzīvojusi strauju attīstību.

 

Mašīnredzes inteliģences attīstības virziens ir veikt plašu pielietojumu klāstu, ko izmanto rūpnieciskajā pārbaudē, viedajā ražošanā un satelītu attālajā uzraudzībā un citās jomās.

 

Runājot par mašīnredzību, ir jārunā par tās pielietojumu, lietojumprogrammu virzītu tehnoloģiju attīstību. Ķīnas attēlu grafikas biedrībai ir 30 īpašas komitejas, kas galvenokārt koncentrējas uz grafiskajiem attēliem, lai veiktu pētījumus un kalpotu valsts ekonomikai. Šīm tehnoloģijām ir plašs pielietojuma scenāriju klāsts, tostarp rūpniecība, lauksaimniecība, ģeogrāfiskās informācijas sistēmas, attālā uzrāde, zemes resursi un tā tālāk.

 

Cilvēks var redzēt pasauli dzimšanas brīdī un saprast pasauli pēc tam, un 80% informācijas iegūst redze. Mašīnredze ir simulēt cilvēka aci un galu galā sasniegt cilvēka acs līmeni un dažos aspektos pārsniegt cilvēka aci, lai redzētu tālāk, redzētu skaidrāk.

 

Runājiet par lielās redzes modeli

 

Lielais vizuālais modelis kļūs arvien inteliģentāks

 

Yao-Nan Wang: Big Language Model ir uz datiem balstīts AI, kas izmanto zināšanas no grāmatām, valodu un tekstu kā datus, lai apmācītu neironu tīkla modeli, kas var pamatot un atbildēt, pamatojoties uz apgūto.

 

Savukārt grandiozā vizuālā modeļa dati galvenokārt nāk no dažādiem attēliem, tostarp no cilvēka un dabas radītajiem vizuālajiem datiem. Piemēram, lielajam medicīniskajam vizuālajam modelim ir jāievada cilvēka orgānu un bojājumu attēli kā vizuāli dati lielajā modelī un pēc tam jāapmāca to iegūt, lai tas varētu lasīt CT fotoattēlus kā ārsts un sasniegtu efektu. pacienta stāvokļa argumentācija pēc fotogrāfiju uzņemšanas, kad pacients ierodas pie ārsta.

 

Pašreizējam vizuālajam modelim nav tādas pašas kā cilvēka smadzenes, kā mēs iedomājamies, atšķirība joprojām ir ļoti liela. Palielinoties mācību datiem un pielāgojoties modeļa parametriem, modelis kļūs arvien lielāks un arvien vairāk zināšanu, un tā intelekta līmenis kļūs arvien augstāks un gudrāks.

 

Mums ir jāpalielina aritmētiskās jaudas līmenis un jāpaātrina skaitļošanas ātrums, lai varētu ātrāk izveidot modeļus; izstrādāt labākas modeļu arhitektūras, tostarp vairāk interpretējamības un drošākas un vadāmākas; un izpētīt efektīvākus mācību algoritmus.

 

Faktiski vizuālā makromodelēšana pēdējos gados nav nekas jauns, tā ir izstrādāta soli pa solim. Astoņdesmitajos gados, attīstoties mākslīgajam intelektam, cilvēki sāka pētīt neironu tīklus. Vienkārši pēdējos gados ir palielinājušās aritmētiskās un algoritmiskās iespējas, lai cilvēki varētu mēģināt izveidot lielus modeļus, radot lielus valodu modeļus un lielus vizuālos modeļus. Agrāk, kad nebija pietiekami daudz aritmētiskās jaudas, cilvēki netaisīja tik lielus modeļus.

 

Runājot par 2024. gada perspektīvām

 

Mēs ceram, ka bizness pieaugs no Guandžou uz visu valsti un pasauli.

 

Yaonan Wang: Hunaņas Universitātes Nacionālais robotu vizuālās uztveres un kontroles tehnoloģiju inženierzinātņu pētniecības centrs 2022. gadā ir pārcēlies uz Guandžou Zengcheng, kas atrodas Guandunas-Honkongas-Makao Lielā līča apgabalā, un nodibināja HU Guandunas-Honkongas-Makao Lielo līci. Teritorijas inovāciju pētniecības institūts (Guangzhou Zengcheng).

 

Institūts koncentrējas uz viedās redzes izpēti un pielietojumu mašīnām, tostarp īpašiem darbības robotiem viedās ražošanas, medicīnas un farmācijas jomā, kā arī vispārinātiem lielas redzes modeļiem. Piemēram, šie pētījumi tiek piemēroti apstrādes rūpniecībai, kas var aizstāt lielu skaitu strādnieku un pabeigt produktu kvalitātes pārbaudi, īpaši 3C un augstākās klases detaļu rūpniecībā. Pašlaik institūts ir izstrādājis programmatūras un aparatūras sistēmas, kuru galvenā funkcija ir nodrošināt Guandunas uzņēmumu digitālo un inteliģento pārveidi un veicināt ražošanas nozares attīstību.

 

Turklāt institūts veic arī inteliģentas mašīnredzes un vadības sistēmas, kuras galvenokārt izmanto augstākās klases viedo iekārtu ražošanā, piemēram, industriālā interneta programmatūra, kurai ir ļoti liels algoritmu skaits.

 

Guanduna ir reformu un atvēršanas priekšgalā un galvenais ekonomikas kaujas lauks ar pilnu rūpniecisko ķēdi un piegādes ķēdi, kā arī daudziem ražošanas uzņēmumiem, mēs nonācām Guandunas izkārtojumā, pirmkārt, tirgus pieprasījuma dēļ. Turklāt mūsu pētniecības centrs ir vairākas pētniecības un attīstības komanda Guangdong ir izkrauti daudz projektu, zinātnisko un tehnoloģisko sasniegumu transformāciju.

 

2023. gada pirmajā pusē mēs saskārāmies ar dažām problēmām, galvenokārt detaļu un komponentu piegādē. 2024. gadā, es uzskatu, ka šīs problēmas tiks atrisinātas, un tiks uzlabota Guandunas AI nozares rūpnieciskā ķēde, piegādes ķēde un pētniecības un attīstības iespējas. Lielajā vietējā tirgū tiks atvērtas jaunas trases. Spilgtā atmosfērā, ikvienam uzņemoties iniciatīvu, darbojoties un ieviešot jauninājumus, visas problēmas var atrisināt.

 

Esmu pārliecināts par AI nozares attīstību Guandunas pilsētā. Pēdējo 30 gadu laikā esam pielikuši daudz pūļu, lai zinātnē un tehnoloģijās būtu pašpaļāvīgi, un uzkrājuši daudz zinātnisko pētījumu rezultātu. Guanduna ir lielākā ekonomiskā province Ķīnā.

 

Mākslīgā intelekta un robotikas joma, ar kuru mēs nodarbojamies, ir panākusi labu iespēju, kas pēdējo divu gadu laikā ir strauji pieaugusi, ienesot daudz jaunu tirgu un ievelkot jaunas industriālās sliedes. Nākotnē būs arvien vairāk viedo termināļu, kas arī veicinās ražošanas telpu un iekārtu nozares attīstību. Es ceru, ka 2024. gadā mūsu pētniecības institūts Zengcheng, Guandžou spēs izplatīt mūsu biznesu visā valstī un pasaulē.