Šta dalje: knjige, kursevi i radovi

Veštačka inteligencija od nule

Dodatak · Šta dalje

Kurs je dao sliku celine. Odavde se ide u dubinu, i pravac zavisi od toga šta te je najviše zanimalo — širi kontekst, unutrašnjost mehanizma, pravljenje sopstvenih stvari, ili matematički temelji.

Spisak je namerno kratak. Bolje je pročitati tri stvari do kraja nego imati listu od trideset.

Linkove ne navodim jer prebrzo trunu. Sve navedeno se nalazi pretragom po naslovu i autoru, a uz besplatno dostupne naslove to piše.

I. Šira slika, bez matematike

Melanie Mitchell — Artificial Intelligence: A Guide for Thinking Humans
Najbolji jedan naslov ako želiš da produbiš ono što je ovaj kurs samo skicirao. Autorka je istraživač koja piše trezveno, bez oduševljenja i bez straha, i posebno je dobra u objašnjavanju zašto sistemi otkazuju baš tamo gde otkazuju.

Brian Christian — The Alignment Problem
Cela knjiga o onome što je u osmoj lekciji stalo u jedan odeljak: šta se dešava kada sistem savršeno ispuni merilo koje mu je zadato. Vodi kroz stvarne slučajeve, hronološki, od jednostavnih klasifikatora do današnjih modela.

Cathy O'Neil — Weapons of Math Destruction
O algoritmima koji odlučuju o kreditima, zaposlenju i kaznama. Starija je i namerno oštra, ali nijedan tekst bolje ne pokazuje kako izbor merila postaje odluka o tuđem životu.

Stuart Russell — Human Compatible
Autor je koautor najkorišćenijeg univerzitetskog udžbenika iz oblasti, pa piše sa težinom. Zastupa jasnu tezu o tome kako bi trebalo graditi ove sisteme; vredi je pročitati i ako se sa njom ne slažeš.

II. Da se vidi kako radi

3Blue1Brown — serijal o neuronskim mrežama  besplatno, video
Četiri epizode koje pokrivaju petu lekciju ovog kursa, ali animirano. Ako ti je propagacija unazad ostala maglovita, ovo je najbrži put do jasnoće. Isti autor ima i noviji serijal o transformerima i pažnji.

Distill  besplatno, arhiva
Časopis koji je objavljivao interaktivne prikaze onoga što se dešava unutar mreža. Više ne izlazi, ali arhiva stoji i tekstovi o tome šta slojevi vide ostaju nenadmašeni.

III. Da se gradi

Andrej Karpathy — Neural Networks: Zero to Hero  besplatno, video
Ovo je najprirodniji nastavak baš ovog kursa. Serijal gradi sve od nule, do sopstvenog malog jezičkog modela, uživo pisanim kodom i uz objašnjenje svake odluke. Zahteva strpljenje i pauziranje, i vredi svakog minuta.

fast.ai — Practical Deep Learning for Coders  besplatno
Suprotan redosled od uobičajenog: prvo se napravi nešto što radi, pa se ulazi u to zašto radi. Ako te teorija zamara a hoćeš rezultat, ovo je pravi izbor.

Aurélien Géron — Hands-On Machine Learning
Debela praktična knjiga koja pokriva sve od klasičnih metoda do mreža, sa kodom. Najbolja je kao priručnik pored tastature, a ne kao štivo za čitanje s kraja na kraj.

IV. Temelji

Za sve u ovom odeljku potrebni su linearna algebra, verovatnoća i izvodi na nivou prve godine tehničkog fakulteta.

Simon Prince — Understanding Deep Learning  besplatno
Najnovija od ozbiljnih knjiga i verovatno najbolji izbor za početak. Pokriva i transformere i difuzione modele, sa dobrim ilustracijama i bez suvišne matematičke pompe.

Goodfellow, Bengio i Courville — Deep Learning  besplatno
Klasik oblasti. Napisan pre transformera, pa mu poslednji deo nedostaje, ali prvih nekoliko stotina strana o temeljima nije zastarelo.

Hastie, Tibshirani i Friedman — The Elements of Statistical Learning  besplatno
Statistička strana priče, pre neuronskih mreža. Sve o preprilagođavanju, regularizaciji i evaluaciji je tu izloženo temeljitije nego igde. Isti autori imaju i pristupačniju verziju za one kojima je original pretežak.

Sutton i Barto — Reinforcement Learning: An Introduction  besplatno
Jedina knjiga koja ti treba za učenje potkrepljivanjem, one treće vrste učenja iz druge lekcije koju kurs jedva da je dodirnuo.

Jurafsky i Martin — Speech and Language Processing  besplatno, radna verzija
Standardni udžbenik za obradu jezika, koji autori redovno dopunjavaju novim poglavljima o velikim modelima.

V. Radovi u originalu

Naučni radovi su čitljiviji nego što ljudi očekuju, naročito ovi. Svi su besplatno dostupni.

Attention Is All You Need (2017)
Rad koji je uveo transformer. Kratak je i, pošto si prošao sedmu lekciju, prati se bez muke.

ImageNet Classification with Deep Convolutional Neural Networks (2012)
Rad iza prelomne 2012. godine iz druge lekcije. Zanimljivo je videti koliko je toga tada bilo improvizacija koja je uspela.

Deep Residual Learning for Image Recognition (2015)
Preskočne veze iz pete lekcije, i razlog zašto su mreže odjednom mogle da imaju stotine slojeva.

Efficient Estimation of Word Representations in Vector Space (2013)
Rad koji je ugnežđivanja iz šeste lekcije uveo u širu upotrebu, zajedno sa slavnim analogijama.

Scaling Laws for Neural Language Models (2020)
Grafici zbog kojih su u oblast otišle milijarde. Vidi ih u originalu.

Rich Sutton — The Bitter Lesson (2019)
Esej od jedne strane, o tome kako ljudsko znanje uneto rukom skoro uvek izgubi od metoda koje se dobro skaliraju. Pomenut na kraju druge lekcije. Pročitaj ga danas.

On the Dangers of Stochastic Parrots (2021)
Najuticajnija kritika velikih jezičkih modela, oko koje se i danas vodi rasprava. Namerno je stavljam odmah uz rad o zakonima skaliranja — dva teksta koja gledaju istu stvar iz suprotnih uglova.

VI. Kako pratiti oblast

Novi radovi se objavljuju na arXiv-u, u odeljcima za mašinsko učenje i računarsku lingvistiku. Količina je nesavladiva i najveći deo je šum.

Umesto pokušaja da se sve isprati, korisniji je jedan navika: kada naiđeš na tvrdnju koja te zanima, potraži rad iza nje i pročitaj bar sažetak i odeljak o ograničenjima. Autori tamo obično pošteno kažu šta njihov rezultat ne pokazuje — a to je upravo ono što u prepričavanju ispadne prvo.

I još jedno pravilo, izvedeno iz osme lekcije: kada čitaš da je neki model postigao rekordan rezultat na nekom testu, pitaj se kojim je testom mereno i da li je test mogao biti u trening podacima. Ta dva pitanja rasteraju veliku većinu naslova.

POVRATAK NA KURS

Pregled svih osam lekcija i dodataka je na hub stranici kursa.

Ako ti neki naslov nedostaje na ovom spisku, predloži ga u komentaru — stranica se dopunjava.

Tekst je pisan uz pomoć jezičkog modela Claude Opus 5 kompanije Anthropic. Sadržaj, struktura i konačna redakcija su autorski.

Comments

Popular posts from this blog

Velika debata i ploča na kojoj piše VAR!

Aristotel: zašto stvari padaju

Henrijeta Livit — zvezde koje mere daljinu