Archwilio Trawsnewidyddion Gweledigaeth Hunan Oruchwyliaeth Ar Gyfer Cydnabod Cerdded yn y Gwyllt Rhan 2
Nov 24, 2023
2.2. Trawsnewidyddion Gweledigaeth
Er eu bod wedi'u cynnig i ddechrau ar gyfer tasgau NLP [16,34] gyda llwyddiant aruthrol, mae trawsnewidyddion wedi cael eu defnyddio'n eang mewn gweledigaeth gyfrifiadurol yn ystod y blynyddoedd diwethaf [24,25,28,35-37]. Mae bothdomains wedi mwynhau perfformiadau digynsail trwy ddefnyddio amrywiadau amrywiol o drawsnewidwyr, yn rhannol oherwydd y cynhwysedd model cynyddol a gallu'r trawsnewidyddion i elwa o hunan-oruchwyliaeth yn llawer mwy na modelau blaenorol [17].
Mae cysylltiad agos rhwng hunan-fonitro a chof. Mae hunan-fonitro yn cyfeirio at werthuso ac addasu ymddygiad, meddwl ac emosiynau rhywun, tra bod cof yn cyfeirio at y gallu i gaffael, prosesu a storio gwybodaeth. Gall hunan-fonitro ein helpu i gael gwell rheolaeth dros ein hymddygiad a'n hemosiynau, a thrwy hynny wella'r cof.
Yn gyntaf, gall hunan-fonitro ein helpu i wrthsefyll temtasiwn yn well. Mae temtasiwn yn tueddu i dynnu ein sylw a'n hegni ac effeithio ar ein cof. Trwy hunan-fonitro, gallwn reoli ein hunain yn well ac osgoi gwrthdyniadau gormodol, a thrwy hynny wella'r cof.
Yn ail, gall hunan-fonitro hefyd ein helpu i ddeall a chofio gwybodaeth yn well. Mae hunan-fonitro yn ein galluogi i dalu mwy o sylw i'r pwyntiau gwybodaeth allweddol a rhoi sylw i'r cysylltiadau rhwng gwybodaeth, er mwyn deall a chofio gwybodaeth yn well. Pan fyddwn yn talu sylw, mae gennym well sefyllfa i ddeall a chadw gwybodaeth.
Yn olaf, gall hunan-fonitro hefyd ein helpu i arsylwi a chrynhoi ein hymddygiad a'n ffordd o feddwl yn well. Drwy fyfyrio ar ein gweithredoedd a’n prosesau meddwl ein hunain, gallwn nodi diffygion a gwella arnynt. Mae'r gwelliant hwn nid yn unig yn gwella ein hymddygiad a'n meddwl ond hefyd yn gwella ein galluoedd cof.
I grynhoi, mae cysylltiad agos rhwng hunan-fonitro a chof. Trwy hunan-fonitro, gallwn reoli ein hunain yn well, deall a chofio gwybodaeth yn well, a gwella ein hymddygiad a'n prosesau meddwl yn well. Ar yr un pryd, bydd hyn hefyd yn ein helpu i wella ein cof, gan ganiatáu inni astudio a gweithio'n fwy effeithlon. Gadewch inni egluro ein nodau, addasu ein hunain yn weithredol, a dilyn cynnydd yn gyson! Gellir gweld bod angen i ni wella cof, a gall Cistanche deserticola wella cof yn sylweddol, oherwydd gall Cistanche deserticola hefyd reoleiddio cydbwysedd niwrodrosglwyddyddion, megis cynyddu lefelau acetylcholine a ffactorau twf. Mae'r sylweddau hyn yn bwysig iawn ar gyfer cof a dysgu. Yn ogystal, gall Cig hefyd wella llif y gwaed a hyrwyddo darpariaeth ocsigen, a all sicrhau bod yr ymennydd yn derbyn digon o faetholion ac egni, a thrwy hynny wella bywiogrwydd a dygnwch yr ymennydd.

Cliciwch gwybod atchwanegiadau i wella cof
Mae Dosovitskiy et al. [24] oedd y cyntaf i gynnig defnyddio amgodyddion trawsnewidyddion ar gyfer dosbarthu delweddau, gan gyflwyno'r Vision Transformer (ViT). Mae'r bensaernïaeth yn rhannu'r ddelwedd fewnbwn yn glytiau maint sefydlog o 16x16, yn gwastatáu, ac yn eu taflunio â haen llinellol i'r dimensiwn ymgorffori. Rhoddir tocyn dosbarth ychwanegol (CLS) yn y dilyniant ac ychwanegir amgodiadau lleoliadol at bob fector.
Mae'r dilyniant o embeddingssis canlyniadol a roddir fel mewnbwn i amgodiwr trawsnewidyddion, sydd â'r un strwythur â'r un yn [34]ond yn defnyddio'r gweithredwr LayerNorm cyn pob bloc yn lle ar ôl (cyn-norm). Defnyddir pen MLP i gael label y dosbarth o'r wybodaeth a gydgasglwyd yn fyd-eang yn tocyn y dosbarth.
Mae'r mecanwaith hunan-sylw a gyflwynwyd gan Vaswani et al. Mae [34] yn cymryd dilyniant o eitemau fel mewnbwn ac yn amcangyfrif y rhyngweithiad rhwng pob un ohonynt trwy agregu'r wybodaeth fyd-eang ar gyfer pob elfen yn y dilyniant. I ryngweithio gwahanol rhwng elfennau dilyniant, mae'r modiwl hunan-sylw aml-ben (MSA) yn cydgadwynu canlyniadau blociau hunan-sylw lluosog ac yn taflunio'r allbwn ar fatrics pwysau dysgadwy. Mae'r amgodiwr trawsnewidyddion a gyflwynwyd yn [34] yn cynnwys haenau lluosog wedi'u pentyrru sy'n cynnwys bloc MSA, bloc bwydo ymlaen (FFN), cysylltiadau gweddilliol rhwng pob bloc, a LayerNorm (LN) ar ôl pob bloc.
Mae Touvron et al. [25] cynnig dau newid pensaernïol i wella perfformiad trawsnewidyddion gweledigaeth dwfn. Mae eu cyfraniad cyntaf, LayerScale, yn hwyluso hyfforddi modelau dyfnach trwy ychwanegu matrics croeslin dysgadwy sy'n cael ei luosi ag allbwn y blociau gweddilliol. Oherwydd bod y matrics wedi'i gychwyn â gwerthoedd bach, mae'n gorfodi canlyniadau haenau amgodiwr y trawsnewidydd i gael cyfraniad bach at allbwn y bloc gweddilliol ar ddechrau'r hyfforddiant.
Eu hail gyfraniad yw'r mecanwaith sylw dosbarth. Yn lle atodi'r tocyn CLS i ddechrau, fel yn y ViT safonol, caiff ei atodi ar ôl sawl bloc amgodiwr. Ar ôl y cam hwn, dim ond tocyn y dosbarth sy'n cael ei ddiweddaru a chaiff y tocynnau clwt eu rhewi. Mae'r mecanwaith hwn yn helpu i ddatgysylltu'r gweithrediadau hunan-sylw rhwng clytiau rhag agregu'r wybodaeth a ddefnyddir ar gyfer dosbarthu.
Mae Yuan et al. [28] yn dadlau bod y symboleiddio syml o glytiau yn y ViT fanila wedi'i gyfyngu o ran methu â modelu strwythur lleol y ddelwedd a'r rhyngweithio rhwng clytiau cyfagos. O ganlyniad, maent yn cyflwyno proses docynnau gynyddol sy'n cyfuno tocynnau cyfagos yn un sengl.
Mae'r broses hon yn cynnwys y modiwl Reshape, sy'n cymryd y dilyniant o docynnau o'r haen flaenorol ac yn adeiladu delwedd ohonynt yn seiliedig ar agosrwydd gofodol. Mae'r modiwl Hollti Meddal yn rhannu'r ddelwedd adeiledig yn ddarnau o docynnau sy'n gorgyffwrdd ac yn eu bwydo i'r nextencoder. Mae'r tocynnau a gynhyrchir ar ôl y broses docynnau yn cael eu bwydo i asgwrn cefnViT dwfn ar gyfer dosbarthu.

Fel y nodwyd gan Wang et al. [35] dyluniwyd y Trawsnewidydd Gweledigaeth safonol yn benodol ar gyfer dosbarthu delweddau ac nid yw'n addas ar gyfer tasgau eraill megis segmentu canfod gwrthrychau. Oherwydd hyn, maen nhw'n cynnig y Pyramid Vision Transformer (PVT) sy'n cymryd ysbrydoliaeth o bensaernïaeth CNN trwy gynhyrchu mapiau nodwedd cyfryngol gyda dimensiynau gofodol sy'n lleihau a nifer cynyddol o sianeli.
Mae'r strwythur pyramid hwn yn helpu'r model i ddysgu nodweddion aml-raddfa y gellir eu defnyddio ar gyfer tasgau amrywiol. Yn gyntaf, mae'r model yn prosesu tocynnau a geir o ddarnau o ddimensiynau 4 × 4, ac ar bob cam, mae'r tocynnau'n cyfateb i ddimensiynau gofodol mwy o glytiau.
Cost gyfrifiannol hunan-sylw clasurol yw O(N2· d) lle N yw rhif y tocynnau yn y dilyniant a d yw dimensiwn y fector. Mae'r gost gyfrifiannol cwadratig o ran nifer y tocynnau yn dod yn broblem ymarferol gyda chydraniad delwedd cynyddol gan fod pob tocyn mewn dilyniant yn cyfateb i ddarn yn y ddelwedd.
Yn y llenyddiaeth, mae yna nifer o dechnegau i leihau cost gyfrifiannol hunan-sylw fanila [26,35,36]. Mae PVT [35] yn defnyddio sylw lleihau gofodol, sy'n lleihau maint gofodol y fectorau Allwedd a Gwerth cyn yr hunan-sylw gyda gweithrediad ail-lunio a thafluniad llinellol.
Mae'r newidydd Swin [36] sydd hefyd â strwythur pyramid yn disodli'r bloc hunan-sylw gyda modiwl sy'n ei frasamcanu. Mae'r modiwl yn grwpio darnau cyfagos mewn ffenestri lleol ac yn perfformio'r gweithrediad hunan-sylw y tu mewn i'r ffenestri hyn yn unig.
Er mwyn cyfathrebu'r wybodaeth â ffenestri eraill, mae'n symud y ffenestri lleol fel eu bod hefyd yn cynnwys clytiau o ffenestri cyfagos ac yn cyfrifo hunan-sylw eto. Mae Chu et al. [27] mabwysiadodd y bensaernïaeth PVT a chynigiodd ddull tebyg ar gyfer brasamcanu hunan-sylw. Roeddent hefyd yn perfformio sylw lleol rhwng clytiau mewn awindow, yn debyg i'r newidydd Swin.
Er mwyn cyfathrebu gwybodaeth â ffenestri eraill, fe wnaethant gynnal hunan-sylw rhwng cynrychiolydd pob ffenestr a phob ffenestr arall. Mae CrossFormer [26] hefyd yn adeiladu ar y PGC. Mae'n defnyddio sylw pellter byr, sy'n debyg i'r sylw lleol yn y newidydd Swin, ond ar gyfer gollwng gwybodaeth i ffenestri eraill mae'n defnyddio sylw pellter hir, sy'n cyfrifo'r rhyngweithio rhwng clytiau, sydd â phellter sefydlog rhyngddynt. Mae hefyd yn cyfuno clytiau aml-raddfa wedi'u canoli o amgylch yr un picsel i gael y tocynnau ar gyfer y blociau trawsnewidyddion, sy'n helpu'r model i ddysgu rhyngweithiadau traws-raddfa.
Roedd Yang et al. [37] cynnig y mecanwaith canolbwyntio ffocws ar gyfer dysgu rhyngweithiadau tymor byr a hir rhwng tocynnau sy'n gwneud trawsnewidyddion gweledigaeth yn gallu prosesu delweddau cydraniad uchel. Ar gyfer pob darn o ddelwedd, mae'r modiwl hunan-sylw ffocal yn rhyngweithio â chlytiau sydd wedi'u cau'n ofodol a gyda ffenestri cryno o glytiau sy'n bellach i ffwrdd. Gwneir crynhoad o ffenestri clytiau trwy gronni ac mae'n dal gwybodaeth ddi-ffael pan fo'r clytiau ymhell i ffwrdd.
Mae'r RegionViT [38] yn defnyddio'r pensaernïaeth PVT ac yn ychwanegu dau lwybr symboleiddio ar gyfer pob map nodwedd. Mae'r llwybr tokenization cyntaf yn cael tocynnau rhanbarthol sy'n cynnwys clytiau sy'n gorchuddio nifer fawr o bicseli. Mae'r ail lwybr tokenization yn cael tocynnau lleol sy'n dal gwybodaeth lefel isel trwy gynnwys ychydig o bicseli. Mae'r ddau fath hyn o docynnau yn cael eu bwydo fel mewnbwn i'r amgodiwr trawsnewidydd rhanbarthol-i-leol lle mae hunan-sylw cyntaf rhwng rhanbarthau yn cael ei gyfrifo, yna rhwng pob tocyn rhanbarthol a'i docynnau lleol cyfatebol.
Mae pensaernïaeth LeViT [39] yn cyfuno CNNs a'r mecanwaith hunan-sylw. Mae delwedd yn cael ei bwydo i mewn i amgodiwr CNN yn gyntaf, sy'n lleihau'r dimensiynau gofodol ac yn cynyddu dimensiwn y sianel. Mae'r mapiau nodwedd canlyniadol yn cael eu bwydo i mewn i ViT hierarchaidd sy'n cynnwys modiwl sylw sy'n crebachu rhwng ei amgodyddion i leihau'r dimensiynau gofodol ymhellach a chynyddu dimensiwn sianel y mapiau nodwedd.
Mae pensaernïaeth sy'n seiliedig ar sylw hefyd wedi'u defnyddio mewn tasgau fideo lle mae angen ystyried gwybodaeth amserol. Mae pensaernïaeth, fel ViViT [40] a TimeSformer [41], yn defnyddio'r mecanwaith hunan-sylw dros y dimensiynau gofodol ac amser. Oherwydd hyn, mae'r model yn dysgu casglu'r wybodaeth ofodol o bob ffrâm a'r newid dros amser.
3. Dull
Yn yr adran hon, rydym yn darparu disgrifiad manwl o bob pensaernïaeth a dewis hyperparameters. Ymhellach, disgrifiwn y prosesu data a'r penderfyniadau dylunio arfaethedig i addasu trawsnewidyddion gweledigaeth i weithio gyda dilyniannau sgerbwd. Yn olaf, rydym yn disgrifio'r dulliau cychwyn, y protocol gwerthuso, a'r setiau data gwerthuso.
3.1. Disgrifiad Pensaernïaeth
Fe wnaethom archwilio pum amrywiad gwahanol o'r Vision Transformers (Ffigur 1), a ddatblygwyd ar gyfer cyfrifiant mwy optimaidd ar ddelweddau, o ran perfformiad i lawr yr afon ac amser casglu. Yn benodol, rydym yn archwilio'r ViT clasurol [24], CaiT [25], Token2Token ViT [28], ac Twins-SVT [27].
Yn gyffredinol, mae blasau trawsnewidyddion gweledigaeth yn arwain at welliannau i'r ffordd "glasurol" o brosesu delweddau gyda thrawsnewidwyr, fel y cynigir yn ViT: mae delweddau wedi'u rhannu'n ddarnau cyfartal o faint ac nad ydynt yn gorgyffwrdd sy'n cael eu gwastadu a'u taflunio i ofod dimensiwn is. cael ei drin wedyn fel "tocynnau", mewn modd tebyg i geisiadau NLP. Yn achos dadansoddiad cerddediad, mae clytiog sgwâr yn cyfateb i grŵp o gymalau sy'n amrywio ar draws ffenestr amserol fechan.

Mae'r amgodiwr trawsnewidyddion safonol yn cymryd dilyniant o eitemau fel mewnbwn (X ∈ Rn × d lle - nifer yr eitemau, d - dimensiwn ymgorffori) ac yn eu taflunio i dri matrics pwysau dysgadwy gwahanol gan gael yr Ymholiadau (Q ∈ Rn × dq), yr Allweddi (K ∈ Rn×dk, dk=dq), a gwerthoedd (V ∈ Rn × dv ), lle dq, dk, a dv yw'r dimensiynau ar gyfer yr ymholiadau, allweddi a gwerthoedd, yn y drefn honno. Mae sylw yn cael ei gyfrifo fel:

Ar gyfer y rhan fwyaf o bensaernïaeth, fe wnaethom bennu nifer yr haenau, pennau sylw, a nodweddion dimensiynol pryd bynnag y bo modd. Fel y cyfryw, rydym yn dewis 4 haen gyda 4 headseach sylw, dimensiwn o 512 ar gyfer y rhwydwaith bwydo ymlaen, a maint mewnosod terfynol o 128.

Mae ViT The Vision Transformer [24] yn cael dilyniant mewnbwn o docynnau trwy rannu'r ddelwedd yn glytiau a'u taflunio'n llinol i'r dimensiwn gwreiddio. Mae'r canlyniad ynghyd â thocyn dosbarth ychwanegol (CLS) yn cael ei roi fel mewnbwn i amgodiwr trawsnewidydd.Moreover, mae'r amgodiwr ViT yn defnyddio cyn-norm, yn hytrach nag ôl-normaleiddio. Gellir cyfrifo allbwn haen fel:

lle mae λl, i a λ0l, yn baramedrau dysgadwy. Mae'r model hefyd yn datgysylltu'r cyfrifiant o ryngweithiadau rhwng tocynnau mewnbwn oddi wrth gyfrifiant mewnosod y dosbarth sy'n cydgasglu'r holl wybodaeth fyd-eang. Gwneir hyn gyda sylw'r dosbarth sy'n cyflwyno'r tocyn CLS i'r dilyniant mewnbwn ar ôl cael y rhyngweithiadau ac yn rhewi'r holl docynnau eraill. Ar gyfer yr amgodiwr CaiT, gwnaethom ddefnyddio'r un ffurfwedd ag yn ViT, ond ar gyfer yr amgodiwr CLS, gwnaethom ddefnyddio dyfnder o 2 haen.
Token2Token ViT Mae pensaernïaeth Token2Token [28] yn cynnwys proses tokenization blaengar sy'n modelu strwythur lleol delwedd trwy gyfuno tokensiad cyfagos. Mae'r broses tokenization yn gyntaf yn adeiladu strwythur tebyg i ddelwedd o ddilyniant mewnbwn oftokens gyda chymorth y modiwl Reshape. Yna mae'r ddelwedd wedi'i rhannu'n ddarnau o docynnau sy'n gorgyffwrdd trwy'r modiwl Rhaniad Meddal (SS). Mae'r allbwn sy'n deillio o'r modiwl tokenization yn cael ei gyfrifo fel:

Ar gyfer Token2Token, gwnaethom ddefnyddio 2 haen gyda meintiau patsh o {2, 8} a {2, 4} ar gyfer yr haen gyntaf, a {4, 16} ar gyfer yr ail haen.
Gefeilliaid-SVT Mae pensaernïaeth Twins-SVT [27] yn disodli'r bloc hunan-sylw clasurol gyda modiwl o'r enw hunan-sylw gwahanadwy yn ofodol (SA) sy'n brasamcanu'r gweithrediad. Mae SSSA yn cynnwys hunan-sylw wedi'i grwpio'n lleol (LSA) sy'n cyfrifo'r rhyngweithio yn unig rhwng tocynnau y tu mewn i'r un ffenestr leol a'r sylw byd-eang wedi'i is-samplu (GSA) sy'n agregu gwybodaeth fyd-eang trwy wneud hunan-sylw rhwng holl gynrychiolwyr pob ffenestr leol a gyfrifir trwy gyfuno'r tocynnau cyfagos. Gellir ysgrifennu gweithrediadau haen Twins fel:

Ar gyfer yr amgodiwr CrossFormer, fe wnaethom ddefnyddio dimensiynau o {16, 32, 64, 128} ar gyfer yr haenau, meintiau ffenestri byd-eang o {4, 2, 2, 1}, maint ffenestr leol o 2, camau traws-ymosod o 2, a chroes -ymgorffori meintiau cnewyllyn o {{2, 4, 8, 16}, {2, 4}, {2, 4}, {2, 4}}.
3.2. Rhagbrosesu Data
Ar gyfer setiau data DenseGait a GREW, rydym yn defnyddio'r un weithdrefn ragbrosesu. Ar gyfer pob dilyniant sgerbwd sy'n cael ei dynnu a'i olrhain sy'n cynnwys 18 uniad ag x, ac y cyfesurynnau a sgôr hyder ychwanegol, rydym yn normaleiddio'r dilyniant yn gyntaf trwy ganolbwyntio ar gyfesurynnau'r pelfis (pelvis, pelfis) a thrwy raddio'n llorweddol ac yn fertigol, yn unol â chyfrannau'r corff dynol (hy, y pellter rhwng ysgwyddau: |xR.ysgwydd − xL.ysgwydd| a'r pellter o'r gwddf i'r pelfis: |yneck − ypelvis|). Ar gyfer pob cyfesuryn (ar y cyd, ar y cyd) o bob un o'r 18 cymal yn y fformat ystum COCO, rydym yn defnyddio'r weithdrefn normaleiddio ganlynol:

Trwy'r broses normaleiddio, mae gwahaniaethau rhwng penderfyniadau camera a phellter y pwnc o'r camera yn cael eu dileu. Ar ben hynny, rydym yn dileu gwybodaeth ymddangosiad ynghylch uchder a lled pwnc, nad yw'n ymwneud â gwybodaeth symud. Mae'r cam hwn yn debyg i'r cam alinio mewn modelau adnabod wynebau modern [42]. Ar ben hynny, rydym hefyd yn cyflogi haen normaleiddio swp [43] ar ddechrau pob model i normaleiddio'r ddelwedd canlyniadol ymhellach.
O ystyried y dimensiwn tymhorol T (hy, nifer y fframiau) a'r dimensiwn gofodol sgerbwd J (hy, nifer yr uniadau), mae dilyniannau sgerbwd naïf wedi'u hamgodio fel delweddau o siâp (T, J, 3), lle, yn ein hachos ni, T {{ 1}} a J=18.

Mae'r rhan fwyaf o drawsnewidwyr golwg, fodd bynnag, yn tybio bod y delweddau'n sgwâr. Felly, rydym yn cynnig amrywiadau lluosog o newid maint y dimensiwn gofodol fel bod y ddelwedd yn cael ei thrawsnewid i (T, T, 3), sy'n cyfateb i gynyddu nifer yr uniadau yn artiffisial (gweler Ffigur 2).

For more information:1950477648nn@gmail.com






