3 ms·Muon Is Scalable for LLM Training5 points by renonce 2y agoyorwba 2y agoFor people who want to know more about the Muon optimizer: https://kellerjordan.github.io/posts/muon/ https://kellerjordan.github.io/posts/muon/