Pelly
Pellypp
ยท
AI & ML interests
None yet
Recent Activity
liked a model about 16 hours ago
baidu/Unlimited-OCR upvoted a paper about 1 month ago
Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning upvoted a paper about 1 month ago
STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy StabilityOrganizations
None yet