Xue LI (李雪)

Xue LI

Alibaba Group

Hangzhou, China

youli.lx@alibaba-inc.com

GitHub · DBLP

I am a researcher at Alibaba Group, working on the AI inference platform. My current research focuses on large-scale LLM serving systems, including GPU pooling, disaggregated architectures, request scheduling, and inference engine optimizations. I am also the maintainer of ServeGen (a framework for generating realistic LLM serving workloads), a co-creator and PPMC member of Apache GraphAr (a standardized graph storage format), and a developer of GraphScope (a one-stop large-scale graph processing system).

I received my Ph.D. degree from the MADSys Group at Tsinghua University in 2020, under the guidance of Professor Yongwei Wu.

Selected Publications

2026

Batched in Back: Characterizing and Optimizing Offline LLM Inference in Production with ACDC.Corresponding Author
Leping Yang, Xue Li, Kun Qian, Erci Xu, Mingzhen Han, Haoran Zhu, Tao He, Zuolong Yin, Ennan Zhai, Wenyuan Yu, Jingren Zhou, Guangtao Xue.
ACM SIGOPS Symposium on Operating Systems Principles (SOSP '26).

ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production.Corresponding Author
Yuxing Xiang, Xue Li, Kun Qian, Yan Zhang, Wenyuan Yu, Ennan Zhai, Xin Jin, Jingren Zhou.
USENIX Symposium on Networked Systems Design and Implementation (NSDI '26).

Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services.Best Paper Nomination
Haoyu Chen, Xue Li, Kun Qian, Yu Guan, Jin Zhao, Xin Wang.
ACM/IEEE Design Automation Conference (DAC '26).

STAR: Decode-Phase Rescheduling for LLM Inference.
Zhibin Wang, Zetao Hong, Xue Li, Zibo Wang, Shipeng Li, Qingkai Meng, Qing Wang, Chengying Huan, Rong Gu, Sheng Zhong, Chen Tian.
ACM International Symposium on High-Performance Parallel and Distributed Computing (HPDC '26).

StriaTrace: Efficient Tracing and Diagnosis for Online LLM Inference.
Haonan Wu, Yanqing Chen, Kun Qian, Xue Li, Erci Xu, Ennan Zhai, Wenyuan Yu, Jingren Zhou.
USENIX Symposium on Operating Systems Design and Implementation (OSDI '26).

Come Hell or Still Water: Alleviating Tail Latency in Cloud Block Store.
Chaolei Hu, Kun Qian, Erci Xu, Yifan Shen, Haoran Zhang, Xue Li, Yuesheng Gu, Shu Ma, Lingjun Zhu, Fengyuan Ren, Ennan Zhai.
USENIX Symposium on Networked Systems Design and Implementation (NSDI '26).

CoDec: Prefix-Shared Decoding Kernel for LLMs.
Zhibin Wang, Rui Ning, Chao Fang, Zhonghui Zhang, Xi Lin, Shaobo Ma, Mo Zhou, Xue Li, Zhongfeng Wang, Chengying Huan, Rong Gu, Kun Yang, Guihai Chen, Sheng Zhong, Chen Tian.
ACM SIGMOD International Conference on Management of Data (SIGMOD '26).

2025

GraphAr: An Efficient Storage Scheme for Graph Data in Data Lakes.First Author
Xue Li, Weibin Zeng, Zhibin Wang, Diwen Zhu, Jingbo Xu, Wenyuan Yu, Jingren Zhou.
International Conference on Very Large Data Bases (VLDB '25).

Aegaeon: Effective GPU Pooling for Concurrent LLM Serving on the Market.Corresponding Author
Yuxing Xiang, Xue Li, Kun Qian, Yufan Yang, Diwen Zhu, Wenyuan Yu, Ennan Zhai, Xuanzhe Liu, Xin Jin, Jingren Zhou.
ACM SIGOPS Symposium on Operating Systems Principles (SOSP '25).

Swift Unfolding of Communities: GPU-Accelerated Louvain Algorithm.
Zhibin Wang, Xi Lin, Xinxin Liu, Xue Li, Pinhuan Wang, Ziheng Meng, Hang Liu, Chen Tian, Sheng Zhong.
ACM SIGPLAN Symposium on Principles and Practice of Parallel Programming (PPoPP '25).

Revisiting Graph Analytics Benchmark.
Lingkai Meng, Yu Shao, Long Yuan, Longbin Lai, Peng Cheng, Xue Li, Wenyuan Yu, Wenjie Zhang, Xuemin Lin, Jingren Zhou.
ACM SIGMOD International Conference on Management of Data (SIGMOD '25).

Evolution of Aegis: Fault Diagnosis for AI Model Training Service in Production.
Jianbo Dong, Kun Qian, Pengcheng Zhang, Zhilong Zheng, Liang Chen, Fei Feng, Yichi Xu, Yikai Zhu, Gang Lu, Xue Li, Zhihui Ren, Zhicheng Wang, Bin Luo, Peng Zhang, Yang Liu, Yanqing Chen, Yu Guan, Weicheng Wang, Chaojie Yang, Yang Zhang, Man Yuan, Hanyu Zhao, Yong Li, Zihan Zhao, Shan Li, Xianlong Zeng, Zhiping Yao, Binzhang Fu, Ennan Zhai, Wei Lin, Chao Wang, Dennis Cai.
USENIX Symposium on Networked Systems Design and Implementation (NSDI '25).

SkeletonHunter: Diagnosing and Localizing Network Failures in Containerized Large Model Training.
Wei Liu, Kun Qian, Zhenhua Li, Tianyin Xu, Yunhao Liu, Weicheng Wang, Yun Zhang, Jiakang Li, Shuhong Zhu, Xue Li, Hongfei Xu, Fei Feng, Ennan Zhai.
ACM SIGCOMM Conference (SIGCOMM '25).

A Survey of Distributed Graph Algorithms on Massive Graphs.
Lingkai Meng, Yu Shao, Long Yuan, Longbin Lai, Peng Cheng, Xue Li, Wenyuan Yu, Wenjie Zhang, Xuemin Lin, Jingren Zhou.
ACM Computing Surveys, 57(2), 2025.

2024

Near-Lossless Gradient Compression for Data-Parallel Distributed DNN Training.First Author
Xue Li, Cheng Guo, Kun Qian, Menghao Zhang, Mengyu Yang, Mingwei Xu.
ACM Symposium on Cloud Computing (SoCC '24).

GraphScope Flex: LEGO-like Graph Computing Stack.
Tao He, Shuxian Hu, Longbin Lai, Dongze Li, Neng Li, Xue Li, Lexiao Liu, Xiaojian Luo, Bingqing Lyu, Ke Meng, Sijie Shen, Li Su, Lei Wang, Jingbo Xu, Wenyuan Yu, Weibin Zeng, Lei Zhang, Siyuan Zhang, Jingren Zhou, Xiaoli Zhou, Diwen Zhu. (authors in alphabetical order)
ACM SIGMOD International Conference on Management of Data (SIGMOD '24).

2023

FLASH: A Framework for Programming Distributed Graph Processing Algorithms.First Author
Xue Li, Ke Meng, Lu Qin, Longbin Lai, Wenyuan Yu, Zhengping Qian, Xuemin Lin, Jingren Zhou.
IEEE International Conference on Data Engineering (ICDE '23).

Efficient Multi-GPU Graph Processing with Remote Work Stealing.
Ke Meng, Liang Geng, Xue Li, Qian Tao, Wenyuan Yu, Jingren Zhou.
IEEE International Conference on Data Engineering (ICDE '23).

SMOG: Accelerating Subgraph Matching on GPUs.🏆 Graph Challenge Champion
Zhibin Wang, Ziheng Meng, Xue Li, Xi Lin, Long Zheng, Chen Tian, Sheng Zhong.
IEEE High Performance Extreme Computing Conference (HPEC '23).

2021 and Earlier

GraphScope: A Unified Engine For Big Graph Processing.
Wenfei Fan, Tao He, Longbin Lai, Xue Li, Yong Li, Zhao Li, Zhengping Qian, Chao Tian, Lei Wang, Jingbo Xu, Youyang Yao, Qiang Yin, Wenyuan Yu, Kai Zeng, Kun Zhao, Jingren Zhou, Diwen Zhu, Rong Zhu. (authors in alphabetical order)
International Conference on Very Large Data Bases (VLDB '21).

GraphScope: A One-Stop Large Graph Processing System.
Jingbo Xu, Zhanning Bai, Wenfei Fan, Longbin Lai, Xue Li, Zhao Li, Zhengping Qian, Lei Wang, Yanyan Wang, Wenyuan Yu, Jingren Zhou.
International Conference on Very Large Data Bases (VLDB '21).

3-D Partitioning for Large-Scale Graph Processing.First Author
Xue Li, Mingxing Zhang, Kang Chen, Yongwei Wu, Xuehai Qian, Weimin Zheng.
IEEE Transactions on Computers, 70(1), 2021.

ReGraph: A Graph Processing Framework that Alternately Shrinks and Repartitions the Graph.First Author
Xue Li, Mingxing Zhang, Kang Chen, Yongwei Wu.
ACM International Conference on Supercomputing (ICS '18).

Exploring the Hidden Dimension in Graph Processing.
Mingxing Zhang, Yongwei Wu, Kang Chen, Xuehai Qian, Xue Li, Weimin Zheng.
USENIX Symposium on Operating Systems Design and Implementation (OSDI '16).