3 ms·Reinforcement learning, I'd assume. Presumably RLHF (Reinforcement Learning from Human Feedback).by Ancapistani 2mo agoReinforcement learning, I'd assume. Presumably RLHF (Reinforcement Learning from Human Feedback).