Portrait of Zhuo Li

Researcher · Ant Group

Zhuo Li

Data-centric ML · Probabilistic Methods · Representation Learning · RLHF · Coding Agent

About

I am a Researcher at Ant Group, currently working on Agentic RL and Coding Agents. My research focuses on enabling LLM-based agents to learn from interaction, diagnose their own failures, and continuously improve their capabilities in real-world environments. Previously, I worked on foundation model pre-training and large language model alignment, including post-training and preference alignment. I received my PhD from The Chinese University of Hong Kong, Shenzhen in 2026, advised by Dr. Xiang Wan and Prof. Tsung-Hui Chang.

I am always open to research collaborations and discussions! Please drop me with an email.

News

Selected updates

  • One paper accepted at EMNLP 2026

  • One paper accepted at ICML 2026Oral

  • Three papers accepted at ACL 2026

  • One paper accepted at ICLR 2026

Earlier updates
  • One paper accepted at AAAI 2026

  • One paper accepted at NeurIPS 2025

  • Two papers accepted at EMNLP 2025

  • One paper accepted at TMLR

  • One paper accepted at ACM Multimedia 2025Oral

  • One paper accepted at TMLR

  • One paper accepted at ACL 2025Oral

  • One paper accepted at IEEE TCSVT

  • One paper accepted at NAACL 2025

* Equal contribution. † Tech lead / Corresponding author

  1. VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

    Lyuke Wang, Zhuo Li†, Guangxu Zhu

    EMNLP 2026Code
  2. Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

    Zhibin Duan, Guowei Rong, Zhuo Li, Bo Chen, Mingyuan Zhou, Dandan Guo

    ICML 2026OralCode
  3. MARCH: Multi-Agent Reinforced Check for Hallucination

    Zhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou, Hao Li, Shujie Hu, Yu Qin, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

    ACL 2026Code
  4. Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance

    Zhuo Li, Pengyu Cheng, Zhechao Yu, Feifei Tong, Anningzhe Gao, Tsung-Hui Chang, Xiang Wan, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

    ICLR 2026Code
  5. APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport

    Zhuo Li, Yuege Feng, Dandan Guo, Jinpeng Hu, Anningzhe Gao, Xiang Wan

    EMNLP 2025Code
  6. RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

    Yuhao Du*, Zhuo Li*, Pengyu Cheng*, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

    TMLRCode

All Publications

Grouped by research theme

LLM Alignment, Reward Modeling & Data Curation
  1. Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

    Zhibin Duan, Guowei Rong, Zhuo Li, Bo Chen, Mingyuan Zhou, Dandan Guo

    ICML 2026OralCode
  2. MARCH: Multi-Agent Reinforced Check for Hallucination

    Zhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou, Hao Li, Shujie Hu, Yu Qin, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

    ACL 2026Code
  3. Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance

    Zhuo Li, Pengyu Cheng, Zhechao Yu, Feifei Tong, Anningzhe Gao, Tsung-Hui Chang, Xiang Wan, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

    ICLR 2026Code
  4. APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport

    Zhuo Li, Yuege Feng, Dandan Guo, Jinpeng Hu, Anningzhe Gao, Xiang Wan

    EMNLP 2025Code
  5. RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

    Yuhao Du*, Zhuo Li*, Pengyu Cheng*, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

    TMLRCode
  6. Add-One-In: Incremental Sample Selection for Large Language Models via a Choice-Based Greedy Paradigm

    Zhuo Li, Yuhao Du, Xiaoqi Jiao, Steven Y. Guo, Yuege Geng, Xiang Wan, Anningzhe Gao, Jinpeng Hu

    EMNLP 2025Code
Prompting, Safety & Task-Specific NLP
  1. Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment

    Haozhong Wang*, Zhuo Li*, Yibo Yang, He Zhao, Hongyuan Zha, Dandan Guo

    ACL 2026Code
  2. Atoxia: Red-teaming Large Language Models with Target Toxic Answers

    Yuhao Du*, Zhuo Li*, Pengyu Cheng, Xiang Wan, Anningzhe Gao

    NAACL 2025
  3. Self-Instructed Derived Prompt Generation Meets In-Context Learning

    Zhuo Li*, Yuhao Du*, Jinpeng Hu, Xiang Wan, Anningzhe Gao

    ACL 2025Oral
  4. A Simple yet Effective Subsequence-Enhanced Approach for Cross-Domain NER

    Jinpeng Hu, Dandan Guo, Yang Liu, Zhuo Li, Zhihong Chen, Xiang Wan, Tsung-Hui Chang

    AAAI 2023Oral
  5. Graph Enhanced Contrastive Learning for Radiology Findings Summarization

    Jinpeng Hu*, Zhuo Li*, Zhihong Chen, Zhen Li, Xiang Wan, Tsung-Hui Chang

    ACL 2022Code
Benchmarks & Healthcare-Centric LLMs
  1. Psyche-R1: Towards Reliable Psychological LLMs

    Chongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li, Xun Yang, Meng Wang

    ACL 2026Code
  2. Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark

    Jinpeng Hu, Hongchang Shi, Chongyuan Dai, Zhuo Li, Peipei Song, Meng Wang

    ACM Multimedia 2025Code
  3. AgentMental: An Interactive Multi-Agent Framework for Explainable and Adaptive Mental Health Assessment

    Jinpeng Hu, Ao Wang, Qianqian Xie, Hui Ma, Zhuo Li, Dan Guo

    AAAI 2026
Learning with Limited or Imbalanced Data
  1. Synthesizing Minority Samples for Long-tailed Classification via Distribution Matching

    Zhuo Li, He Zhao, Zhen Li, Dandan Guo, Xiang Wan, Hongyuan Zha

    TMLR 2025Code
  2. Prototype-oriented Clean Subset Extraction for Noisy Long-tailed Classification

    Zhuo Li, He Zhao, Anningzhe Gao, Dandan Guo, Tsung-Hui Chang, Xiang Wan

    IEEE TCSVT 2025Code
  3. Enhancing Minority Classes by Mixing: An Adaptive Optimal Transport Approach for Long-tailed Classification

    Jintong Gao, He Zhao, Zhuo Li, Dandan Guo

    NeurIPS 2023Code
  4. Learning to Re-weight Examples with Optimal Transport for Imbalanced Classification

    Dandan Guo, Zhuo Li, Meixi Zheng, He Zhao, Mingyuan Zhou, Hongyuan Zha

    NeurIPS 2022Code
  5. Diverse Condensed Data Generation via Class Preserving Distribution Matching

    Dandan Guo, Zhuo Li, He Zhao, Mingyuan Zhou, Hongyuan Zha

    TMLR
Other Publications
  1. Rotary Position Embedding-Based Transformer Hawkes Process for Event-Type Big Data

    Shan Dai, Anningzhe Gao, Zhuo Li, Yuhao Du

    IEEE Big Data
  2. Intermediate Domain Alignment and Morphology Analogy for Patent-Product Image Retrieval

    Haifan Gong, Xuanye Zhang, Ruifei Zhang, Yun Su, Zhuo Li, Yuhao Du, Xiang Wan, Anningzhe Gao, Haofeng Li

    NeurIPS 2025Code
  3. Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases

    Zhihao Yuan*, Xu Yan*, Zhuo Li*, Xuhao Li, Yao Guo, Shuguang Cui, Zhen Li

    IEEE TNNLS 2024Project
  4. Cognitive-Visual Fusion for Target Classification in Rapid SAR Image Series Visual Presentation

    Wending Zhou*, Zhuo Li*, Xiang Wan, Ruimao Zhang, Liangcheng Qu, Zhen Li, Kuiying Yin

    Radar 2021

Experience

  1. 2026 — Present

    Researcher · Ant Group

    Agentic RL and Coding Agent

  2. Jul 2025 — Feb 2026

    Research Intern · Qwen, Alibaba

    Reward hacking and RLHF · Mentor: Pengyu Cheng

  3. Apr — Jun 2025

    Research Intern · Noah's Ark Lab, Huawei

    Data mixture for MLLM pre-training · Mentor: Lu Hou

  4. Dec 2024 — Mar 2025

    Research Intern · LIGHT STUDIO, Tencent

    LLM-based machine translation · Mentor: Xiaoqi Jiao