arxiv:2607.25675
chenjiangwang
jwchen2001
AI & ML interests
None yet
Recent Activity
upvoted a paper about 1 month ago
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation upvoted a paper about 1 month ago
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization upvoted a paper about 1 month ago
DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text SpaceOrganizations
None yet