Two papers accepted to EMNLP 2026
Conference on Empirical Methods in Natural Language Processing.PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs
Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, and Ruohui Huang
Counterfactual Constraint-Conditioned On-Policy Distillation for Multi-Constraint Instruction Following
Yanzhao Zheng, Yuanqiang Yu, Tianze Xu, Chao Ma, Zhentao Zhang, Jihuai Zhu, Baohua Dong, Hangcheng Zhu, and Ruohui Huang



