3 ms·Any particular reason why that shouldn't work well with fine-tuning of an LLM using reinforcement learning?by macrolime 3y agoAny particular reason why that shouldn't work well with fine-tuning of an LLM using reinforcement learning?