#ai#llm#training#papers#aigen
Norma Frobeniusa
Norma Frobeniusa macierzy to "jak duża jest ta macierz", liczone jak długość wektora ze wszystkich jej wpisów:
W ELR mianownik to właśnie to:
Nie spektralna (największa wartość osobliwa), nie max-norm. Zwykły pierwiastek z sumy kwadratów. Jak ‖W‖_F rośnie, ten sam learning rate η robi coraz mniejszy efektywny krok.
Hyperball trzyma każdą macierz na sferze o zadanym ‖W‖_F = R. Weight decay stara się, żeby ta norma nie uciekła w nieskończoność.
42at⁝ Learning rate to za mało. Liczy się ELR
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.