About

I am an Applied Research Scientist at Alibaba Group, where I work on LLM agent systems. My current research focuses on LLM post-training, agent memory, and reliable long-horizon task execution. Previously, at Huawei, I contributed to MindSpore, a deep learning framework; MindRLHF, a large-scale RLHF training framework; and the MetaERP agent, which streamlines invoice reconciliation and validation for accountants.

I received my M.Sc. in Computer Science and Technology from Tianjin University under Prof. Jianye Hao. My early research focused primarily on deep reinforcement learning, transfer learning, and multi-task reinforcement learning.

Outside of research, I enjoy photography, solving Rubik’s cubes, and traveling.

Key Events

Two papers accepted to EMNLP 2026

Conference on Empirical Methods in Natural Language Processing.

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, and Ruohui Huang

Counterfactual Constraint-Conditioned On-Policy Distillation for Multi-Constraint Instruction Following

Yanzhao Zheng, Yuanqiang Yu, Tianze Xu, Chao Ma, Zhentao Zhang, Jihuai Zhu, Baohua Dong, Hangcheng Zhu, and Ruohui Huang

Three papers accepted to COLM 2026

Conference on Language Modeling.

SkillRouter: Skill Routing for LLM Agents at Scale

Yanzhao Zheng, Zhentao Zhang, Chao Ma, Yuanqiang Yu, Jihuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, and Gang Yu

ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents

Yong Wu, Yanzhao Zheng, Tianze Xu, Zhentao Zhang, Yuanqiang Yu, Jihuai Zhu, Chao Ma, Binbin Lin, Baohua Dong, Hangcheng Zhu, Ruohui Huang, and Gang Yu

Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks

Tianze Xu, Yanzhao Zheng, Pengrui Lu, Lyumanshan Ye, Yong Wu, Zhentao Zhang, Yuanqiang Yu, Chao Ma, Jihuai Zhu, Pengfei Liu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, and Gang Yu

One paper accepted to ICANN 2023

International Conference on Artificial Neural Networks.

Limited Information Opponent Modeling

Yongliang Lv, Yuanqiang Yu, Yan Zheng, Jianye Hao, Yongming Wen, and Yue Yu

One paper accepted to IJCNN 2023

International Joint Conference on Neural Networks.

T3S: Improving Multi-Task Reinforcement Learning with Task-Specific Feature Selector and Scheduler

Yuanqiang Yu, Tianpei Yang, Yongliang Lv, Yan Zheng, Jianye Hao

One paper accepted to AAMAS 2023

Autonomous Agents and Multi-Agent Systems.

Accelerating Deep Reinforcement Learning via Knowledge-Guided Policy Network

Yuanqiang Yu, Peng Zhang, Kai Zhao, Yan Zheng, Jianye Hao

Received First Prize in the Huawei Cup

18th China Post-Graduate Mathematical Contest in Modeling.

Received First Prize in CUMCM

China Undergraduate Mathematical Contest in Modeling.

Received the Outstanding Winner Award in ICM

Interdisciplinary Contest in Modeling.