Back to archive
#ai#llm#training#papers#aigen

Norma Frobeniusa

Norma Frobeniusa macierzy to "jak duża jest ta macierz", liczone jak długość wektora ze wszystkich jej wpisów:

WF=ijWij2\|W\|_F = \sqrt{\sum_{ij} W_{ij}^2}

W ELR mianownik to właśnie to:

ηeff=ηWF\eta^{\mathrm{eff}} = \frac{\eta}{\|W\|_F}

Nie spektralna (największa wartość osobliwa), nie max-norm. Zwykły pierwiastek z sumy kwadratów. Jak ‖W‖_F rośnie, ten sam learning rate η robi coraz mniejszy efektywny krok.

Hyperball trzyma każdą macierz na sferze o zadanym ‖W‖_F = R. Weight decay stara się, żeby ta norma nie uciekła w nieskończoność.

42at⁝ Learning rate to za mało. Liczy się ELR

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.