SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning Paper • 2607.14777 • Published 6 days ago • 93
UniVR: Thinking in Visual Space for Unified Visual Reasoning Paper • 2607.12800 • Published 8 days ago • 30
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning Paper • 2606.29526 • Published 24 days ago • 168