prof. S. Osowski, K. Siwek • Politechnika Warszawska • Przemyslowe zastosowania SSN
Pierwszy matematyczny model neuronu (1943). Sumator wagowy + blok nieliniowy z progowa (skokowa) funkcja aktywacji.
Co to znaczy: Neuron mnozy kazde wejscie xj przez jego wage wij, sumuje wszystko i dodaje bias wi0. Funkcja f patrzy tylko na znak sumy: gdy > 0 → wyjscie = 1 (neuron „odpala”), w przeciwnym razie 0.
Struktura jak McCulloch-Pitts, ale funkcja aktywacji jest ciagla i rozniczkowalna — umozliwia uczenie gradientowe.
Co to znaczy: Gladkie funkcje aktywacji. Unipolarna daje wynik w przedziale (0,1), bipolarna (tanh) w (−1,1). Parametr b to stromosc — im wieksze b, tym bardziej przypomina skok.
Co to znaczy: Pochodne sigmoid, potrzebne do uczenia gradientowego. Sztuczka: liczy sie je wprost z wartosci samej funkcji f (bez liczenia od zera). Sa najwieksze w srodku (u=0), maleja na krancach.
Sigmoida ma stan nasycenia hamujacy uczenie w sieciach glebokich. ReLU (Rectified Linear Unit) eliminuje nasycenie:
Co to znaczy: ReLU przepuszcza wartosci dodatnie bez zmian, a ujemne scina do zera. Pochodna to po prostu 1 (dla x>0) albo 0 (dla x≤0) — szybka i nie „nasyca sie” jak sigmoida.
Co to znaczy: Im dalej wektor x lezy od centrum c (odleglosc miedzy nimi), tym mniejsza odpowiedz. σ to szerokosc dzwonu (duze σ = szeroki zasieg). Maksimum (=1) wypada dokladnie w centrum.
Zwyciezca = neuron o najwiekszym \(u_i=\mathbf{w}_i^T\mathbf{x}\) (przy znormalizowanych danych — najblizszy wektorowi \(x\)). Regula WTA (Grossberg):
Co to znaczy: Uczenie zwyciezcy: jego wagi przesuwaja sie o maly krok η w strone aktualnego wektora x. Z kazda iteracja centrum neuronu „dociaga sie” do danych, ktore wygrywa.
W WTA tylko zwyciezca aktualizuje wagi; w WTM takze sasiedztwo (slabiej z odlegloscia).
Waga rosnie, gdy obie komorki sa jednoczesnie pobudzone (uczenie korelacyjne):
Co to znaczy: Waga rosnie, gdy oba neurony sa aktywne jednoczesnie (iloczyn yi·yj duzy). Zasada Hebba: „neurony, ktore odpalaja razem, lacza sie”. η to tempo uczenia.
Co to znaczy: Sygnal przechodzi przez dwie warstwy: ukryta f(suma wejsc) i wyjsciowa f(suma sygnalow z ukrytej). Zlozenie dwoch nieliniowosci daje uniwersalny aproksymator. Gorny indeks (1)/(2) to numer warstwy.
Co to znaczy: Blad sieci = suma kwadratow roznic miedzy wyjsciem y a wartoscia zadana d, po wszystkich p probkach i M wyjsciach. Uczenie polega na minimalizowaniu tej liczby.
Algorytm wyznaczania gradientu funkcji celu po wszystkich wagach — wykorzystuje graf dolaczony \(\hat G\) (graf \(G\) z odwroconymi kierunkami galezi, pobudzany roznica \(y_i-d_i\)).
Co to znaczy: Kazda skladowa gradientu liczy sie jako iloczyn dwoch sygnalow: vj z sieci „w przod” i v̂i z sieci „wstecznej” (graf dolaczony). To istota wstecznej propagacji.
Z rozwiniecia Taylora: \(E(w+p)=E(w)+g^Tp+\tfrac12 p^THp\). Minimum: \(g=0\) i hesjan \(H\) dodatnio okreslony.
Co to znaczy: Nowe wagi = krok w strone −gradientu (η·g) plus „rozped” α·(poprzednia zmiana wag). Moment przyspiesza i pomaga przeskoczyc plytkie minimum lokalne. α ∈ [0,1].
Co to znaczy: Kierunek poprawy to gradient g przemnozony przez odwrotnosc hesjanu H (informacja o krzywiznie). Trafia do minimum w mniejszej liczbie krokow, ale liczenie H−1 jest kosztowne.
Co to znaczy: Blad² rozklada sie na obciazenie² (bias — model za prosty) plus wariancje (czulosc na konkretny zbior uczacy). Zmniejszenie jednego zwykle zwieksza drugie — to kompromis.
Male obciazenie okupione wieksza wariancja (kompromis bias-variance). Bias ≈ blad uczenia, wariancja ≈ blad testowania.
Co to znaczy: Roznica srednich obu klas |cA−cB| podzielona przez sume ich rozrzutow (σA+σB). Duza wartosc = cecha dobrze rozdziela klasy (centra daleko, malo rozmyte).
Co to znaczy: Wyjscie to wazona suma K funkcji radialnych — kazda „czuje” okolice swojego centrum ci — plus bias w0. Warstwa wyjsciowa jest liniowa. Liczba funkcji K < liczba danych p.
Parametry dzielone na dwie niezalezne grupy (algorytm hybrydowy):
Co to znaczy: Skoro wyjscie jest liniowe, wagi w wylicza sie jednym rownaniem G·w = d. Macierz G jest prostokatna, wiec uzywamy pseudoinwersji G+ (liczonej stabilnie przez rozklad SVD) — bez iteracji.
Co to znaczy: Minimalizujemy ½‖w‖² (czyli maksymalizujemy margines) plus kare C·Σξ za bledy. Ograniczenie wymusza, by punkty lezaly po wlasciwej stronie z marginesem; ξ ≥ 0 to „luz” na pomylki.
Co to znaczy: Ta sama optymalizacja, ale wylacznie po mnoznikach α. K(xi,xj) to jadro (iloczyn w przestrzeni cech). Warunki: 0 ≤ α ≤ C oraz Σαidi = 0. Punkty z α > 0 to wektory nosne.
| Jadro | Wzor | Siec |
|---|---|---|
| liniowe | \(x^Tx_i+\gamma\) | liniowa |
| wielomianowe | \((x^Tx_i+\gamma)^q\) | wielomianowa |
| gaussowskie | \(e^{-\gamma\lVert x-x_i\rVert^2}\) | RBF |
Co to znaczy: Po lewej: rozmiar obrazu po konwolucji — W (wejscie), F (filtr), P (padding), S (krok). Po prawej: softmax zamienia surowe wyjscia na prawdopodobienstwa klas (sumuja sie do 1).
Co to znaczy: Blad rekonstrukcji: roznica miedzy wejsciem x a tym, co dekoder g odtworzyl z kodu h(x). Siec uczy sie odtwarzac wejscie przez waskie gardlo, wiec musi wylapac najwazniejsze cechy.
Koduje rozklad (\(\mu,\sigma\)) w przestrzeni ukrytej i probkuje → generacja obrazow. Kara KL do \(N(0,1)\).
Generator G vs dyskryminator D — gra min-max. Augmentacja danych, wykrywanie podrobek.
Co to znaczy: Gra dwoch sieci: dyskryminator D maksymalizuje trafnosc (odroznia prawdziwe X od podrobionych G(z)), generator G minimalizuje — uczy sie oszukiwac D. E[·] to wartosc oczekiwana (srednia).
Co to znaczy: Wektor wejsciowy = biezace wejscia x ORAZ sygnaly warstwy ukrytej z poprzedniego kroku v(k−1). Ta „pamiec kontekstu” pozwala modelowac zaleznosci w czasie (sekwencje).
Co to znaczy: Stan komorki ct = nowa informacja (y2·y3) plus zachowana czesc starej pamieci (ct−1·y1, gdzie y1 to bramka zapomnienia). Wyjscie ht = bramka wyjsciowa y4 razy tanh(ct).
Co to znaczy: MAE = srednia z bezwzglednych roznic |d−y| (prosty sredni blad). RMSE = pierwiastek ze sredniej kwadratow bledow, mocniej karze duze pomylki. Im mniejsze, tym lepsza regresja.
Wyselekcjonowane, sprawdzone materialy. Najpierw po polsku, potem swiatowe klasyki z najlepsza wizualizacja (3Blue1Brown ma polskie napisy).
Najczestsze pulapki testowe — do powtorki na ostatnia chwile.
Kliknij karte, by zobaczyc odpowiedz.
Dwie wersje testu z poprzednich lat. Test B jest w formacie zgodnym z kolokwium (wielokrotny wybor — moze byc >1 poprawna odpowiedz).