并行运算与推理 AI Infra 实习生
研发与维护寒武纪 MLU 大模型推理引擎 vLLM_MLU、SGLang_MLU,覆盖模型与特性适配、调度与 Cache、算子优化、精度测试及问题定位。
查看工作与结果
- 适配并优化 Qwen3.5 及后续模型、KimiK 系列模型,支持 Prefix Caching、Chunked Prefill、All-to-All 等特性;完成调度策略优化、Cache 管理模块重构及 PyTorch 到 MLU 原生后端迁移。
- 使用 Torch Profiler 分析调度路径与性能火焰图,通过 GenCase 获取核心算子形状;修复性能回退、重复输出与精度异常,并完成长文本、多模态、Agent 场景的精度测试与错误分析。
- 负责 SGLang_MLU 上 Qwen3.5 的模型与特性使能:完成 GDN 线性注意力路由、调度与 Triton 算子开发,并集成验证 MTP 投机解码以降低端到端生成延迟。
- 调研 Beam Search 多候选生成并实现基础版本;参与 TransformerEngine 训练 Infra 的 BangC 算子开发与问题修复。