2 ms·Analyzing OpenAI's Reinforcement Fine-Tuning: Less Data, Better Results4 points by kcorbitt 2y ago