Tianle Xu

AI Infra · LLM Inference & Systems Optimization

Fudan University · Shanghai / 复旦大学

/ now

Currently developing and maintaining LLM inference engines for Cambricon MLUs.

My work spans vLLM and SGLang model enablement, scheduling and cache systems, plus CUDA / Triton / BangC kernel optimization.

ENGINEInference engines

vLLM_MLU · SGLang_MLU

SYSTEMSystems optimization

Scheduling · Cache · MTP

KERNELKernel development

Triton · CUDA · BangC

/ work

/ notes