DAPO: ByteDance und Tsinghua machen RL-Training für LLMs effizienter
Mit dem Open-Source-System DAPO versprechen ByteDance und die Tsinghua-Universität einen Meilenstein für das Reinforcement Learning von Sprachmodellen – bei halbiertem Rechenaufwand.