Anatomija BERT modela: Kako dvosmerni transformatori menjaju obradu prirodnog jezika
BERT predstavlja prekretnicu u razvoju veštačke inteligencije zahvaljujući svom dvosmernom pristupu analizi teksta. Ovaj članak detaljno objašnjava njegovu arhitekturu, matematičke osnove i ključne razlike u odnosu na savremene autoregresivne modele. Čitaoci će dobiti duboko razumevanje načina na ko
BERT se razlikuje od modernih LLM-ova po tome što analizira tekst dvosmerno bez kauzalne maske, koristeći zadatke poput maskiranog jezičkog modeliranja kako bi dublje razumeo kontekst pre finog podešavanja za specifične primene.
Izaberi iznos ili skeniraj kod bez iznosa pa ga upiši u banci. Novac ide direktno na račun autora (GoSimple), Trek ne uzima ništa i nije posrednik u plaćanju.
Na telefonu: preuzmi kod, pa ga u aplikaciji banke učitaj iz galerije.
Temeljna razlika između dvosmernog pristupa i autoregresivnih modela
Savremeni jezički modeli, koji pokreću većinu današnjih sistema generativne veštačke inteligencije, funkcionišu na principu verovatnoće i autoregresije. To znači da su obučeni da predviđaju sledeću reč na osnovu prethodnog konteksta. Da bi se to postiglo, koristi se takozvana kauzalna maska u sloju pažnje, koja sprečava model da vidi reči koje dolaze nakon trenutne pozicije. Model na taj način analizira tekst isključivo sleva nadesno, što je idealno za generisanje novog sadržaja.
Sa druge strane, BERT koristi potpuno drugačiji pristup jer ne poseduje kauzalnu masku. Svaki token u rečenici može istovremeno da komunicira sa svim ostalim tokenima, bez obzira na to da li se oni nalaze ispred ili iza njega. Ova dvosmerna pažnja omogućava modelu da sagleda celokupan kontekst rečenice odjednom. Zbog toga je BERT izuzetno efikasan u zadacima koji zahtevaju duboko razumevanje teksta, kao što su klasifikacija, pretraga i pronalaženje odgovora na pitanja.
Razlika se najbolje vidi na primeru popunjavanja praznina u rečenici. Dok bi autoregresivni model morao da nagađa reč samo na osnovu onoga što je napisano pre nje, BERT analizira i reči pre i reči posle praznine. Ova sposobnost rekonstrukcije konteksta sa obe strane čini ga superiornim u analizi semantike, ali ga ujedno čini neprikladnim za klasično generisanje dugih tekstova gde je potrebno predviđati reč po reč u hodu.
Arhitektonske varijacije i tehnički parametri BERT-a
Kada je predstavljen 2018. godine, BERT je ponuđen u dve osnovne konfiguracije: BERT Base i BERT Large. Obe verzije se oslanjaju na enkoderski deo originalne Transformer arhitekture, ali se značajno razlikuju po kapacitetu i broju parametara. BERT Base se sastoji od 12 enkoderskih slojeva, poseduje 12 glava pažnje i skrivenu dimenziju od 768 elemenata. Ukupan broj parametara ove verzije iznosi oko 110 miliona, što je za današnje standarde skroman, ali izuzetno optimizovan broj.
Za zahtevnije zadatke kreiran je BERT Large, koji duplira broj slojeva na 24 i koristi 16 glava pažnje. Dimenzija skrivenog sloja kod ove verzije iznosi 1024, dok se ukupan broj parametara penje na približno 340 miliona. Precizna merenja težina pokazuju da BERT Base zapravo ima 109,48 miliona parametara, dok BERT Large sadrži 335,14 miliona. Obe konfiguracije koriste WordPiece tokenizator sa rečnikom koji sadrži 30.522 jedinstvena tokena za verzije modela koje ne razlikuju velika i mala slova.
Dimenzija glave pažnje u oba modela iznosi tačno 64, što se dobija deljenjem ukupne dimenzije modela sa brojem glava pažnje. Na primer, kod baznog modela taj odnos je 768 podeljeno sa 12, dok je kod veće verzije 1024 podeljeno sa 16. Skriveni sloj unutar mreže sa direktnim širenjem signala uvek je četiri puta veći od osnovne dimenzije modela, što iznosi 3072 za BERT Base i 4096 za BERT Large. Ovi parametri obezbeđuju stabilan protok informacija kroz sve slojeve mreže.
Mehanizam maskiranog jezičkog modeliranja
Glavni zadatak na kojem se BERT obučava naziva se maskirano jezičko modeliranje (MLM). Ovaj proces se može uporediti sa testovima u kojima učenici popunjavaju praznine u rečenicama kako bi dokazali razumevanje gramatike i vokabulara. Tokom obuke, model dobija rečenicu u kojoj su određene reči namerno sakrivene i zamenjene specijalnim tokenom za maskiranje. Cilj modela je da na osnovu preostalih reči sa leve i desne strane tačno predvidi koja se reč nalazila na maskiranom mestu.
U praksi, BERT nasumično bira 15 procenata tokena iz ulaznog teksta za proces modifikacije. Od izabranih tokena, 80 procenata se zaista zamenjuje specijalnim tokenom [MASK]. Međutim, da model ne bi naučio da obraća pažnju samo na mesta gde vidi ovaj token, preostalih 20 procenata se deli na dva dela: 10 procenata se zamenjuje potpuno nasumičnom rečju iz rečnika, dok se preostalih 10 procenata ostavlja nepromenjeno. Na ovaj način model se primorava da pažljivo analizira svaku reč u rečenici.
Tokom obuke, funkcija gubitka se računa isključivo za pozicije koje su bile izabrane za maskiranje. Izlazni sloj modela generiše raspodelu verovatnoće za svih 30.522 reči iz rečnika za svaku maskiranu poziciju. Gubitak se računa kao negativni logoritam verovatnoće koju je model dodelio tačnoj reči. Ako model sa visokom sigurnošću predvidi tačnu reč, gubitak je blizu nule, dok netačna predviđanja rezultiraju visokim gubitkom koji kroz povratnu propagaciju menja težine modela radi poboljšanja budućih predviđanja.
Tokenizacija i transformacija teksta u vektorski prostor
Računari ne mogu direktno da razumeju reči kao tekstualne karaktere, već zahtevaju njihovu konverziju u numeričke vrednosti. Prvi korak u ovom procesu je tokenizacija, gde se ulazna rečenica deli na manje delove zvane tokeni. BERT koristi WordPiece algoritam koji reči deli na podreči ukoliko se cela reč ne nalazi u njegovom rečniku. Na primer, uobičajene reči ostaju celovite, dok se složenije ili ređe reči dele na manje morfeme sa posebnim oznakama koje ukazuju na nastavak reči.
Nakon što se tekst podeli na tokene, svakom od njih se dodeljuje jedinstveni identifikacioni broj iz rečnika. Ovi brojevi se zatim pretvaraju u vektore visoke dimenzionalnosti kroz proces koji se naziva ugrađivanje reči (embeddings). Svaki identifikacioni broj se može posmatrati kao indeks koji bira odgovarajući red u velikoj matrici ugrađivanja. U slučaju modela BERT Base, ova matrica sadrži 30.522 reda i 768 kolona, što znači da se svaka reč predstavlja kao vektor sa 768 numeričkih koordinata.
Suština ovih vektora je u tome što oni uspevaju da kodiraju semantičko značenje reči u višedimenzionalnom prostoru. Reči koje imaju slično značenje ili se koriste u sličnim kontekstima biće pozicionirane blizu jedna druge u ovom prostoru. Bliskost se meri kosinusnom sličnošću između vektora, gde vrednosti bliske jedinici označavaju visoku semantičku povezanost. Kroz proces obuke, model uči da grupiše srodne pojmove, omogućavajući računaru da prepozna da su reči poput radost i sreća suštinski povezane.
Integracija pozicionih i segmentnih informacija
Jedan od glavnih izazova kod mehanizma pažnje u Transformer arhitekturi jeste to što on ne poseduje urođeni osećaj za redosled reči. Za razliku od starijih rekurentnih neuronskih mreža koje procesuiraju reč po reč sekvencijalno, Transformer analizira sve tokene istovremeno. Bez dodatnih informacija, rečenica o psu koji je ujeo čoveka i čoveku koji je ujeo psa imale bi potpuno isti prikaz za model. Zbog toga je neophodno uvesti pozicione vektore koji modelu govore gde se tačno koja reč nalazi u sekvenci.
Pozicioni vektori imaju istu dimenziju kao i vektori reči (768 za BERT Base) i jednostavno se sabiraju sa njima pre ulaska u prvi sloj enkodera. Pored pozicionih, BERT koristi i segmentne vektore. Ovi vektori su ključni za zadatke koji uključuju analizu parova rečenica, kao što je predviđanje sledeće rečenice (NSP). Segmentni vektori označavaju kojoj rečenici pripada određeni token, omogućavajući modelu da razlikuje granice između dva različita tekstualna segmenta unutar istog ulaza.
Sabiranjem vektora reči, pozicionih vektora i segmentnih vektora dobija se konačna matrica koja ulazi u slojeve pažnje. Ova matrica nosi sveobuhvatne informacije: šta reč znači, gde se nalazi u rečenici i kojoj rečenici u paru pripada. Svi ovi podaci se zatim normalizuju kako bi se osigurala stabilnost obuke i sprečilo preveliko odstupanje vrednosti kroz duboke slojeve neuronske mreže, što je standardna procedura u modernom dubokom učenju.
Finije podešavanje i praktična primena u poslovanju
Snaga BERT modela leži u tome što se faza predobuke obavlja na ogromnim količinama neoznačenog teksta, nakon čega se model može lako prilagoditi za specifične poslovne zadatke. Ovaj proces se naziva fino podešavanje (fine-tuning). Umesto da se model obučava ispočetka, što zahteva ogromne računarske resurse i vreme, na vrh preobučenog BERT-a dodaje se samo jedan jednostavan izlazni sloj prilagođen konkretnom zadatku, poput klasifikacije dokumenata ili analize sentimenta.
Tokom finog podešavanja, svi parametri modela se blago menjaju na osnovu manjeg, označenog skupa podataka specifičnog za datu industriju. Na primer, kompanija može uzeti preobučeni BERT i sa minimalno resursa ga obučiti da prepoznaje pravne termine u ugovorima ili da automatski kategorizuje upite korisnika u korisničkoj podršci. Zbog svoje dvosmerne prirode, BERT izuzetno precizno prepoznaje nijanse u tonu i kontekstu, što ga čini idealnim za analizu složenih poslovnih dokumenata.
Iako su moderni generativni modeli preuzeli primat u kreiranju sadržaja, BERT i njegovi derivati ostaju zlatni standard za analitičke zadatke u industriji. Njegova efikasnost, manja veličina u poređenju sa modelima od više milijardi parametara i mogućnost lokalnog pokretanja na standardnom hardveru čine ga izuzetno ekonomičnim rešenjem za mnoga preduzeća. Razumevanje njegove unutrašnje arhitekture i načina obrade informacija ključno je za svakog inženjera i donosioca odluka u oblasti veštačke inteligencije.
Izvor: Towards AI · Fotografija: Pexels / Freepik (ilustracija)