T2W-Qwen3.5-9B Training Checkpoints Collection Public full-rank Hugging Face exports from the T2W Qwen3.5-9B reinforcement-learning checkpoint series. • 0 items • Updated 18 days ago
From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation Paper • 2601.05787 • Published Jan 9 • 1
BEPA Collection Collection of models and datas for the paper "From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation" • 5 items • Updated Jan 12
BEPA Collection Collection of models and datas for the paper "From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation" • 5 items • Updated Jan 12