Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning Paper • 2609.03430 • Published 4 days ago • 161
Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 4 days ago • 77
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning Paper • 2608.09888 • Published 28 days ago • 772
Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement Paper • 2608.31046 • Published 7 days ago • 141
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills Paper • 2609.02749 • Published 5 days ago • 521
ipfipfipf/Qwen3.5-9B-sdpo-react-mathcodesearch-grpo-arm-e-step29 Text Generation • 9B • Updated 5 days ago • 217
ipfipfipf/Qwen3.5-9B-sdpo-react-mathcodesearch-grpo-arm-e-step29 Text Generation • 9B • Updated 5 days ago • 217
UserBench: An Interactive Gym Environment for User-Centric Agents Paper • 2507.22034 • Published Jul 29, 2025 • 31
ipfipfipf/Qwen3.5-4B-sdpo-react-mathcodesearch-sdpo-arm-e Image-Text-to-Text • 4B • Updated 14 days ago • 42
ipfipfipf/Qwen3.5-4B-sdpo-react-mathcodesearch-sdpo-arm-e Image-Text-to-Text • 4B • Updated 14 days ago • 42
ipfipfipf/Qwen3.5-4B-sdpo-react-mathcodesearch-sdpo-arm-a Image-Text-to-Text • 4B • Updated 15 days ago • 42
ipfipfipf/Qwen3.5-4B-sdpo-react-mathcodesearch-sdpo-arm-a Image-Text-to-Text • 4B • Updated 15 days ago • 42
ipfipfipf/Qwen3.5-4B-sdpo-react-mathcodesearch-grpo-arm-e Image-Text-to-Text • 4B • Updated 15 days ago • 43
ipfipfipf/Qwen3.5-4B-sdpo-react-mathcodesearch-grpo-arm-e Image-Text-to-Text • 4B • Updated 15 days ago • 43
ipfipfipf/Qwen3.5-9B-sdpo-react-mathcodesearch-rlsd-arm-e Image-Text-to-Text • 9B • Updated 17 days ago • 37
ipfipfipf/Qwen3.5-9B-sdpo-react-mathcodesearch-rlsd-arm-a Image-Text-to-Text • 9B • Updated 17 days ago • 33
ipfipfipf/Qwen3.5-9B-sdpo-react-mathcodesearch-rlsd-arm-a Image-Text-to-Text • 9B • Updated 17 days ago • 33