YuyaoGe's Website
YuyaoGe's Website
About
Coverage
Highlight Papers
Experience
Posts
Projects
Gallery
Light
Dark
Automatic
Home
Tags
Reinforcement Learning
Reinforcement Learning
Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
Reinforcement learning (RL) has shown great promise in enhancing LLM reasoning, but current approaches mainly focus on single domains …
Baolong Bi
,
Shenghua Liu
,
Yiwei Wang
,
Siqian Tong
,
Lingrui Mei
,
Yuyao Ge
,
Yilong Xu
,
Jiafeng Guo
,
Xueqi Cheng
Cite
PDF
arXiv
ICML
Ask KIMI
Cite
×