Rečnik veštačke inteligencije: sve reči koje ćeš čuti

Veštačka inteligencija od nule

Lekcija 1 · Rečnik svih reči koje ćeš čuti

Postoji način da se o veštačkoj inteligenciji priča satima a da se ništa ne kaže. Reči kao model, trening, token i parametri padaju u razgovor kao da su svima jasne, pa svako klima glavom i priča se dalje. Ova lekcija postoji da bi se to prekinulo na samom početku.

Ovde nema nijedne formule i nijedne linije koda. Svaki pojam dobija objašnjenje običnim rečima i po jednu sliku uz koju se pamti. Sve što sledi u kursu samo popunjava ove pojmove sadržajem — ali kutije u glavi treba da postoje pre nego što se pune.

Ne moraš ovo da naučiš napamet. Vrati se ovamo kad god neki termin zapne u kasnijim lekcijama.

I. Tri reči koje se stalno mešaju

Veštačka inteligencija

Najširi pojam od sva tri. Obuhvata svaki pokušaj da se mašina natera na ponašanje koje kod čoveka zovemo inteligentnim — prepoznavanje lica, igranje šaha, prevođenje, vožnju automobila.

Važno je odmah reći da to nije nova ideja niti jedna jedina tehnika. Prvih tridesetak godina oblasti, inteligencija se pokušavala napisati rukom: programer bi u kod uneo hiljade pravila oblika „ako je ovo, onda ono". Taj pristup je davao rezultate u uskim, urednim svetovima poput šaha, a padao je čim bi izašao u stvarni svet. Zašto je pao i šta ga je zamenilo, tema je sledeće lekcije.

Mašinsko učenje

Pristup unutar veštačke inteligencije u kome pravila niko ne piše. Umesto toga se mašini pokaže mnogo primera, pa ona sama izvuče pravilnost.

Razlika je suštinska. Da bi program prepoznao mačku klasičnim putem, neko bi morao rečima da opiše mačku — brkovi, šiljate uši, krzno — i svaki taj opis bi propao na prvoj mački iz neobičnog ugla. U mašinskom učenju se sistemu pokaže sto hiljada slika mačaka i sto hiljada slika koje to nisu, i pusti se da sam pronađe šta ih razlikuje. Rezultat najčešće ne ume da se objasni rečima, ali radi.

Duboko učenje

Jedna posebna tehnika unutar mašinskog učenja — ona koja koristi neuronske mreže sa mnogo slojeva. Reč duboko se odnosi isključivo na broj slojeva, ne na dubinu razumevanja.

Odnos je, dakle, kao kod tri kruga jedan u drugom: duboko učenje je vrsta mašinskog učenja, a mašinsko učenje je vrsta veštačke inteligencije. Sve o čemu se danas priča — jezički modeli, generisanje slika, prepoznavanje govora — nalazi se u najmanjem, unutrašnjem krugu.

II. Od čega je model napravljen

Podaci

Primeri iz kojih se uči. Za prepoznavanje mačaka to su slike, za predviđanje cene stana tabela prodatih stanova, za jezički model ogromna količina teksta.

Kvalitet podataka je gotovo uvek važniji od izbora tehnike. Model ne može da nauči ono čega u podacima nema, a vrlo pouzdano nauči ono što u njima ne bi trebalo da bude — greške, pristrasnosti, slučajne pravilnosti. Postoji stara rečenica koja ovo sažima: đubre unutra, đubre napolje.

Obeležja

Pojedinačne osobine jednog primera, one koje model gleda. Kod stana su to kvadratura, sprat, godina gradnje i deo grada; kod slike su to vrednosti piksela.

Nekada je biranje dobrih obeležja bio glavni posao stručnjaka i najveći deo uspeha. Jedan od najvažnijih obrta u celoj oblasti jeste to što duboke mreže same pronalaze korisna obeležja u sirovim podacima. Toj promeni je posvećena šesta lekcija.

Model

Ono što ostane posle učenja. Najkorisnije ga je zamisliti kao mašinu sa mnogo ručica: na jednu stranu ulazi pitanje, na drugu izlazi odgovor, a položaj ručica određuje kakav će odgovor biti.

U praksi je model prosto fajl pun brojeva. Nema u njemu nikakve logike, nikakvog spiska pravila koji bi čovek mogao da pročita — samo brojevi i pravilo kako se oni množe i sabiraju sa ulazom. To što iz gomile brojeva izlazi smislen prevod ili tačna dijagnoza jeste ono što celu stvar čini istovremeno moćnom i teškom za razumevanje.

Parametri

Upravo te ručice — brojevi koje model podešava dok uči. Sinonim koji ćeš često sresti je težine, jer svaki od tih brojeva određuje koliko jak uticaj neki ulaz ima na izlaz.

Broj parametara je najčešće citirana mera veličine modela. Jednostavan model koji predviđa cenu stana ima ih nekoliko. Mreža za prepoznavanje slika ima ih milione. Veliki jezički modeli danas se mere stotinama milijardi. To nije mera pameti nego kapaciteta — koliko pravilnosti model uopšte može da smesti u sebe.

Arhitektura

Raspored ručica, pre nego što ijedna bude podešena. Koliko ih ima, kako su povezane, kojim redom informacija prolazi kroz njih.

Arhitekturu bira čovek, a vrednosti parametara pronalazi trening. Zato ime arhitekture govori mnogo o tome za šta je model sposoban: konvoluciona mreža je napravljena tako da joj odgovaraju slike, a transformer tako da mu odgovara tekst.

III. Kako model uči

Trening

Postupak nalaženja dobrih vrednosti za sve parametre. Ide u krug, i taj krug je isti bez obzira na to da li model prepoznaje cifre ili piše pesme: model pogodi odgovor, uporedi ga sa tačnim, izmeri koliko je promašio, malo pomeri ručice u smeru koji smanjuje promašaj, pa ponovo.

Ponavljanjem tog kruga milionima puta, model postepeno prestaje da promašuje. Nema tu ni razumevanja ni namere — samo neuporedivo strpljivo podešavanje.

Funkcija greške

Pravilo koje promašaj pretvara u jedan jedini broj. Veliki broj znači loš odgovor, mali broj dobar. Čućeš i naziv funkcija gubitka, jer se na engleskom kaže loss.

Ovo je najpotcenjeniji pojam u celoj oblasti. Funkcija greške je jedino merilo koje model ima — ona doslovno definiše šta za njega znači „dobro". Ako je loše postavljena, model će je savršeno zadovoljiti i pritom raditi nešto sasvim drugo od onoga što si želeo. Većina neuspelih projekata ne pada zato što je model slab, nego zato što je meren pogrešnim aršinom.

Gradijentni spust

Postupak kojim se ručice pomeraju u pravom smeru. Zamisli da si na planini u gustoj magli i da treba da siđeš u dolinu. Vrh ne vidiš, dolinu ne vidiš, ali pod nogama osećaš nagib. Napraviš korak nizbrdo, pa opet opipaš, pa opet korak.

Dolina je najmanja greška, a nagib pod nogama je ono što se u matematici zove gradijent. Uz to ide i korak učenja — veličina jednog koraka. Presitni koraci znače da se silazak vuče beskonačno; prekrupni znače preskakanje doline i skakutanje s jedne strane na drugu. Ceo taj postupak razrađuje treća lekcija.

Epoha

Jedan potpun prolazak kroz sve podatke za učenje. Trening obično traje mnogo epoha — model iste primere vidi iznova i iznova, i svaki put ih malo bolje uklopi.

Preprilagođavanje

Kvar u koji model najlakše upada: umesto da nauči pravilnost, on zapamti same primere.

To je đak koji je zbirku zadataka naučio napamet. Na svakom zadatku iz zbirke ima peticu, a na kontrolnom sa istim gradivom i drugim brojevima pada. Model je tada savršen na podacima koje je video, a beskoristan na novima — što je jedino što je ikada bilo važno. Sposobnost da se radi i na neviđenim primerima zove se generalizacija i ona je pravi cilj svakog treninga.

Inferencija

Korišćenje već istreniranog modela. Ručice se više ne pomeraju, ulaz prolazi kroz mašinu i izlazi odgovor.

Razlika u ceni je ogromna i objašnjava dosta toga o ovoj industriji. Trening velikog modela traje nedeljama i košta koliko i ozbiljna zgrada, ali se radi jednom. Inferencija traje delić sekunde i košta zanemarljivo — ali se dešava milijardu puta dnevno, pa se na kraju i tu skupi.

IV. Reči iz sveta jezičkih modela

Token

Komadić teksta na koji model deli ono što čita. Nije slovo, a nije ni cela reč — obično je negde između, veličine sloga ili čestog dela reči.

Model nikada ne vidi rečenicu onako kako je ti vidiš. Vidi niz komada, i svaki od njih je za njega prosto jedan broj iz spiska. Odatle dolazi i jedna poznata čudnovatost: jezički model ume da napiše dobar esej, a pogreši kad ga pitaš koliko slova ima neka reč. Slova mu nisu ni bila prikazana.

Ugnežđivanje

Pretvaranje tokena u niz brojeva koji nosi značenje. Na engleskom embedding, i taj se oblik često koristi i kod nas.

Zamisli ogromnu mapu na kojoj svaka reč ima svoje mesto. Reči sličnog značenja završe blizu jedna druge — pas i mačka u istom kraju, pas i kišobran daleko. Značenje time postaje položaj, a poređenje značenja postaje merenje rastojanja.

Ta mapa je jedan od najlepših rezultata u oblasti, jer je niko nije nacrtao — nastala je sama, iz statistike o tome koje se reči pojavljuju u sličnom društvu. Šesta lekcija se bavi njome.

Transformer i pažnja

Arhitektura na kojoj počiva praktično sve što se danas zove veštačkom inteligencijom, i mehanizam koji je čini posebnom.

Ideja pažnje je da svaka reč u rečenici pogleda sve ostale i sama odluči koje su joj bitne. U rečenici „konobar je doneo račun jer ga je gost tražio", reč ga mora nekako da se veže za račun, a ne za konobara. Pažnja je postupak kojim model to sam razrešava, i to za sve reči istovremeno. Sedma lekcija razlaže kako.

Predtreniranje i fino podešavanje

Dve faze u pravljenju velikog modela. U prvoj model guta ogromne količine teksta i uči jednu jedinu stvar: da pogodi šta sledi. U drugoj se, na mnogo manjem i pažljivo napravljenom skupu primera, uči kako da bude koristan sagovornik.

Poređenje koje dobro stoji jeste opšte obrazovanje pa zanat. Prva faza daje širinu i traje mesecima, druga daje ponašanje i traje danima. Model posle prve faze zna zapanjujuće mnogo a jedva se s njim razgovara; ono što korisnik vidi kao ličnost asistenta gotovo celo dolazi iz druge faze.

Kontekstni prozor

Koliko teksta model može da drži pred sobom dok odgovara. Sve unutar prozora vidi odjednom; sve što ispadne, nestaje bez traga.

Vredi razbiti čestu zabludu: to nije pamćenje. Model između dva razgovora ne pamti ništa, a ni unutar razgovora ne pamti u ljudskom smislu — prosto mu se ceo dotadašnji tekst svaki put iznova daje na uvid.

Halucinacija

Kada model samouvereno izmisli nešto netačno — citat koji ne postoji, propis koji nikada nije donet, izvor sa uverljivim naslovom i izmišljenim autorom.

Ovo nije kvar koji se može zakrpiti nego posledica onoga što model radi. On bira verovatan nastavak teksta, a izmišljen citat je jezički savršeno verovatan — izgleda tačno onako kako citati inače izgledaju. Model nema odvojenu proveru istine kroz koju bi to palo. Osmoj lekciji je ovo glavna tema.

Šta iz ovoga treba poneti

Ako od cele lekcije ostane samo jedna rečenica, neka bude ova: model je mašina sa mnogo ručica, trening je postupak njihovog podešavanja, a funkcija greške je jedino merilo po kome se podešavaju.

Sve ostalo u kursu su detalji te slike. Neuronske mreže su poseban raspored ručica. Ugnežđivanja su poseban način da se ulaz predstavi brojevima. Transformer je arhitektura koja se pokazala izuzetno dobrom za jezik. Halucinacije su ono što se dešava kada je merilo bilo „zvuči verovatno" umesto „jeste tačno".

Sledeća lekcija se vraća korak unazad i objašnjava zašto se uopšte otišlo ovim putem — šta se sve pokušavalo pre mašinskog učenja i zašto je propalo.

SLEDEĆA LEKCIJA

2. Zašto je učenje iz podataka pobedilo pisanje pravila

Simbolički pristup, dve zime veštačke inteligencije, i trenutak u kome je oblast promenila smer.

Tekst je pisan uz pomoć jezičkog modela Claude Opus 5 kompanije Anthropic. Sadržaj, struktura i konačna redakcija su autorski.

Comments

Popular posts from this blog

Velika debata i ploča na kojoj piše VAR!

Aristotel: zašto stvari padaju

Henrijeta Livit — zvezde koje mere daljinu