5 ms·Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf]6 points by virde 2y agodeleted 2y ago[deleted]