> Тег: #rl
заметок: 5
-
SFT Memorizes - RL Generalizes
00-Theory/07-Post-Training/SFT запоминает - RL обобщает
-
Data and Environment Matter More Than the Algorithm
00-Theory/07-Post-Training/Данные и среда важнее алгоритма
-
SFT First, Then RL
00-Theory/07-Post-Training/Сначала SFT потом RL
-
Reward for Process and Reward for Outcome
00-Theory/07-Post-Training/Награда за процесс и награда за результат
-
KL - mode-seeking vs mass-covering
00-Theory/07-Post-Training/KL - mode-seeking против mass-covering