zyx
zyx221
ยท
AI & ML interests
None yet
Recent Activity
upvoted a paper 16 days ago
TTPO: Test-Time Policy Optimization upvoted a paper about 2 months ago
Pass the Baton: Trajectory-Relayed On-Policy Distillation upvoted a paper about 2 months ago
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement LearningOrganizations
None yet