/ writing

博客

69 篇技术笔记,覆盖 AI Infra、LLM 算法、CS336、关键概念和工程复盘。

Kimi · zh

[Kimi-2] Kimi Linear:用 KDA 重写长上下文注意力

从 Delta Rule、逐通道遗忘与 DPLR 转移出发,推导 Kimi Delta Attention,拆解 3:1 KDA/MLA 混合架构、chunkwise kernel、公平对照实验,以及 1M 上下文下的质量与吞吐取舍。

Kimi · Kimi Linear · Linear Attention · Kimi Delta Attention · Gated DeltaNet

AI Infra · zh

[Infra-14] vLLM-Omni:从 Token 调度走向异构生成 Runtime

从 Stage、AsyncOmniEngine、Orchestrator、StageRuntime 和 OmniConnector 出发,理解 vLLM-Omni 如何统一 AR、Diffusion、Encoder 与音频 Decoder,并分析异构流水、两级调度、解耦部署和源码学习路径。

Infra · vLLM · vLLM-Omni · Multimodal · Scheduler

AI Infra · zh

[Infra-13] vLLM 如何修复 Mamba Prefix Cache Poisoning

解析 vLLM PR #51113:Hybrid GDN/Mamba 模型在 MTP/EAGLE、并发 chunked prefill 与 prefix caching 共同作用下,为什么会把不完整 recurrent state 注册成完整 cache block,以及 scheduler 如何重新建立物理状态与缓存元数据的一致性。

Infra · vLLM · Mamba · GDN · Prefix Caching

Kimi · zh

[Kimi-1] Kimi k1.5 技术报告:用 128K 长 CoT 扩展强化学习

系统解读 Kimi k1.5:从可验证 RL prompt、Long-CoT SFT、在线 mirror descent 策略优化,到长度惩罚、partial rollout、训推混合部署、多模态训练与 long2short。

Kimi · Reinforcement Learning · Long CoT · Test-Time Compute · Multimodal LLM

DeepSeek · zh

[DeepSeek-6] DSpark:把投机解码从草稿模型推进到服务调度

系统拆解 DSpark 的半自回归草稿模型、Markov/RNN sequential head、置信度头、STS 校准、硬件感知 prefix scheduler、训练目标、DeepSpec 实现与 DeepSeek-V4 线上部署取舍。

DeepSeek · DSpark · Speculative Decoding · LLM Inference · Serving System

LLM算法 · zh

[LLM算法-3] 标准 MHA:从多头计算到 KV Cache

从张量形状和完整公式出发,拆解标准 Multi-Head Attention 的 Q、K、V 投影、多头计算与输出拼接,并分析 Prefill、Decode、KV Cache,以及 MHA、GQA、MQA 的核心差异。

LLM · Transformer · Attention · MHA · KV Cache

杂谈 · zh

杂谈:MLA、Linear Attention 与长上下文记忆路线

从 KV Cache、历史可寻址性和推理基础设施出发,比较 GQA、MLA、Linear Attention 与 Sparse Attention,并讨论混合记忆架构为何正在成为主流。

LLM · Attention · MLA · Linear Attention · KV Cache

LLM算法 · zh

[LLM算法-2] Gated DeltaNet:让线性注意力学会覆盖与遗忘

从线性注意力的固定状态出发,推导 Delta Rule 的误差驱动写入与 Gated DeltaNet 的全局衰减,解释其并行训练、递归推理、记忆容量,以及与 Transformer、Mamba 的关系。

LLM · Gated DeltaNet · Linear Attention · Delta Rule · State Space Model

DeepSeek · zh

[DeepSeek-4] DeepEP:MoE 专家并行中的 Token 交通系统

从 MoE Dispatch 与 Combine 的路由语义出发,系统拆解 DeepEP V2 的 Rank 级去重、ElasticBuffer、EPHandle、Direct/Hybrid 通信、FP8 传输、SM/QP 资源模型与通信计算重叠。

DeepSeek · DeepEP · Mixture of Experts · Expert Parallelism · NCCL

DeepSeek · zh

[DeepSeek-3] FlashMLA:把 MLA 的 KV Cache 优势变成 GPU 吞吐

从 Weight Absorption、576/512 数据布局和 Paged KV Cache 出发,系统拆解 FlashMLA 的 Split-KV、Online Softmax、Seesaw Scheduling、稀疏 Attention、FP8 KV Cache 与 Crossover。

DeepSeek · FlashMLA · MLA · CUDA · Attention Kernel

Skills · zh

[Skills-02] 先把问题问对:Grilling 与 Domain Modeling

提炼 grilling、grill-me、grill-with-docs 与 domain-modeling:如何区分事实和决策,逐步消除需求歧义,并留下可复用的领域语言。

Skill · Requirements · Domain Modeling · DDD · AI Agent

什么是系列 · zh

什么是 Beam Search(束搜索)?

从序列联合概率出发,系统解释 Beam Search 的扩展、打分与剪枝过程,以及束宽、长度归一化、终止条件和推理成本之间的取舍。

LLM · Decoding · Inference · Beam Search · Sequence Generation

AI Infra · zh

[Infra-12] RL Infra:支撑大模型强化学习后训练的分布式工厂

从 rollout、环境、奖励、轨迹、训练和权重同步构成的闭环出发,理解 RL Infra 的系统边界、核心难点、部署形态、主流框架,以及 vLLM、MoE 和 MLU 推理经验如何迁移到 RL 系统。

Infra · Reinforcement Learning · RLHF · GRPO · vLLM

什么是系列 · zh

什么是编译器 Pass?

从计算图和 IR 出发,理解编译器 Pass 如何分析、匹配并改写程序,以及算子融合、Lowering、Pattern Rewrite 和 Kernel 之间的关系。

Compiler · Pass · IR · Graph Optimization · AI Infra

AI Infra · zh

[Infra-10] All-to-All 优化:从 MoE Token 路由到通算重叠

从 All-to-All 通信语义与 MoE dispatch/combine 数据流出发,系统分析不均匀路由、小消息、拓扑、重排和长尾瓶颈,并梳理分层通信、kernel 融合、通算重叠、Expert 放置与 profiling 方法。

Infra · All-to-All · MoE · Expert Parallel · Distributed Systems

AI Infra · zh

[Infra-8] MTP

从训练目标、DeepSeek-V3 的 sequential MTP modules 和 vLLM speculative decoding 出发,解释 MTP 如何增加监督信号、提出 bonus token,并接入验证、KV Cache 提交与 serving 调度链路。

Infra · LLM Serving · Speculative Decoding · MTP · KV Cache

MLC chentianqi · zh

[MLC-07] 计算图优化与模式改写

陈天奇 MLC 课程第七讲学习笔记:理解 Relax AST、访问者模式、算子模式匹配、Linear + ReLU 融合,以及图优化如何衔接到 TensorIR calls。

MLC · Graph Optimization · Relax · Operator Fusion · Compiler Pass

MLC chentianqi · zh

[MLC-06] GPU 硬件加速与张量化

陈天奇 MLC 课程第六讲学习笔记:从 thread block、local/shared memory tiling 到硬件专业化和 tensorization,理解张量程序如何映射到 GPU。

MLC · GPU · CUDA · Tensorization · Shared Memory

MLC chentianqi · zh

[MLC-05] 与机器学习框架的整合

陈天奇 MLC 课程第五讲学习笔记:通过 TE、BlockBuilder 与 PyTorch FX 将现有框架模型导入 IRModule,并理解导入边界与高层算子翻译。

MLC · PyTorch FX · Tensor Expression · BlockBuilder · IRModule

MLC chentianqi · zh

[MLC-04] 自动化程序优化与 Meta-Schedule

陈天奇 MLC 课程第四讲学习笔记:把手工 schedule 变换变成搜索空间,理解 stochastic schedule、候选测量与 Meta-Schedule 的优化闭环。

MLC · Meta-Schedule · Auto Tuning · Search · TensorIR

AI Infra · zh

[Infra-6] xLLM:从推理引擎到集群服务系统

理解 xLLM 在大模型 Infra 中的位置:它不是一个模型,而是一套面向多类 AI 加速器的推理引擎与集群服务系统;重点拆解 Service-Engine 解耦、PD/EPD 分离、全局 KV Cache、动态调度和 MoE 优化。

Infra · xLLM · LLM Serving · Distributed Inference · KV Cache

LLM算法 · zh

[LLM算法-1] 从比较信号理解 PPO、DPO 与 GRPO

从策略梯度与 KL 正则化出发,推导 PPO、DPO、GRPO 的目标函数,厘清 Critic、Reward、Old Policy 与 Reference Policy 的角色,并分析三者的适用场景和常见误区。

LLM · Post-training · PPO · DPO · GRPO

MLC chentianqi · zh

[MLC-03] 端到端模型执行与 Relax

陈天奇 MLC 课程第三讲学习笔记:用 Relax 计算图、call_tir、dataflow block 和参数绑定把单个 TensorIR 函数组织成可构建的端到端模型。

MLC · Relax · IRModule · call_tir · Runtime

MLC chentianqi · zh

[MLC-02] 张量程序抽象与 TensorIR

陈天奇 MLC 课程第二讲学习笔记:理解元张量函数、循环嵌套、缓冲区、block axis 与 TensorIR schedule 为什么是可优化程序的基础。

MLC · TensorIR · Schedule · Tiling · Tensor Program

AI Infra · zh

[Infra-5] k8s和infra

从大模型服务的部署、调度、扩缩容和故障恢复出发,解释 K8s 在 AI Infra 里的位置,以及它和 Docker、Ray、Slurm、vLLM 等系统的关系。

Infra · Kubernetes · K8s · LLM Serving · GPU

MLC chentianqi · zh

[MLC-01] 机器学习编译概述

陈天奇 MLC 课程第一讲学习笔记:从开发形式到部署形式,理解机器学习编译的目标、张量函数与抽象/实现边界。

MLC · Compiler · Deployment · Tensor Function · TVM

什么是系列 · zh

什么是N-Gram Model

从语言模型的链式法则出发,解释 N-Gram 如何用最近 N-1 个 token 的频次预测下一个 token,以及数据稀疏、平滑、回退、插值和它与 Transformer 的关系。

NLP · Language Model · N-Gram · Transformer · Data

杂谈 · zh

杂谈:为什么对比算力时不要开启 Prefix Caching

从 prefill、TTFT、有效计算量和 benchmark 公平性出发,讨论 prefix caching 为什么会把硬件算力测试变成缓存命中率与 serving 策略测试。

LLM · Inference · Benchmark · Prefix Caching · KV Cache

杂谈 · zh

谈谈Reasoning

从模型训练、reasoning token、vLLM serving、PD 分离和线上压测几个角度,解释 reasoning 到底改变了什么,又没有改变什么。

LLM · Reasoning · Inference · vLLM · Serving

什么是系列 · zh

什么是Checkpoints

从大模型训练和推理两个视角解释 Checkpoint:它保存什么、为什么能断点续训、和模型权重及 .safetensors 的关系,以及它在 vLLM 部署中的角色。

LLM · Checkpoint · Safetensors · Training · Inference

AI Infra · zh

[Infra-4] PD分离

从 Prefill 和 Decode 的资源特征出发,系统梳理 PD 分离为什么重要、到底分离了什么、如何影响 TTFT 与 TPOT,以及 KV Cache 传输为什么会成为新的系统核心。

Infra · Distributed Inference · vLLM · KV Cache · LLM

什么是系列 · zh

什么是CUDA Graph

从 GPU 任务提交开销出发,解释 CUDA Graph 如何把稳定的 CUDA 执行流捕获成可重复 replay 的图,以及它在 PyTorch 和大模型推理中的价值与限制。

CUDA · GPU · PyTorch · LLM · Inference

什么是系列 · zh

什么是Linear Attention

从标准 Attention 的二次复杂度出发,解释 Linear Attention 如何用 kernel feature map 和递推状态降低长上下文成本,以及 Gamma、Delta、Gate、Conv 等增强方法在解决什么问题。

LLM · Attention · Linear Attention · Inference · Long Context

什么是系列 · bilingual

什么是muP?

从最大更新参数化的直觉出发,梳理 muP 解决的问题、和 NTK/SP 的区别、Transformer 里的关键改动,以及它为什么能支持小模型调参迁移到大模型。

Deep Learning · LLM · Training · muP · Scaling

AI Infra · zh

[Infra-3] 分布式训练和分布式推理

从目标、计算流程、显存结构、通信模式、性能指标和调度逻辑出发,系统区分分布式训练与分布式推理,并结合 vLLM 多机多卡场景总结分析重点。

Infra · Distributed Training · Distributed Inference · vLLM · LLM

什么是系列 · zh

什么是 skill?

从 AI Agent 的工作流角度理解 Skill:它不是重新训练模型,而是把任务流程、规则、脚本和资源封装成可复用的能力单元。

AI Agent · Codex · Skill · Workflow · LLM

AI Infra · zh

[Infra-2] NCCL

以多卡训练和大模型推理为背景,系统梳理 NCCL 的位置、核心概念、常见 collective、单机与多机通信路径,以及性能调优和排查思路。

Infra · NCCL · Distributed Systems · vLLM · GPU

CS336 · zh

[CS336-17] Policy Gradient 与 GRPO 细节

整理 CS336 第十七讲:policy gradient、baseline、advantage、GRPO group normalization、KL penalty 和 reward 处理细节。

CS336 · Policy Gradient · GRPO

CS336 · zh

[CS336-16] 可验证奖励强化学习

整理 CS336 第十六讲:从 RLHF 到 RLVR,PPO、DPO、GRPO、可验证 reward 和 reasoning model 训练。

CS336 · RLVR · GRPO

CS336 · zh

[CS336-15] RLHF 与 Alignment

整理 CS336 第十五讲:SFT、instruction data、preference data、RLHF、PPO、DPO 和 alignment 数据风格。

CS336 · Alignment · RLHF · SFT

CS336 · zh

[CS336-14] 数据过滤与去重

整理 CS336 第十四讲:KenLM、fastText、DSIR、语言过滤、毒性过滤、Bloom filter、MinHash 和近重复去重。

CS336 · Data Filtering · Dedup

CS336 · zh

[CS336-13] 数据概览

整理 CS336 第十三讲:pretraining、mid-training、post-training 数据,web data pipeline、版权许可和 instruction data。

CS336 · Data · Pretraining

CS336 · zh

[CS336-12] 评测

整理 CS336 第十二讲:benchmark、开放式评测、LM-as-a-judge、安全评测、污染检测和评测质量。

CS336 · Evaluation · Benchmarks

CS336 · zh

[CS336-11] Scaling 实践细节

整理 CS336 第十一讲:muP、WSD learning rate、MiniCPM、DeepSeek、LLaMA 3 等 scaling 实践 recipe。

CS336 · Scaling · muP

CS336 · zh

[CS336-10] 推理系统

整理 CS336 第十讲:prefill、decode、KV cache、GQA、MLA、speculative decoding、PagedAttention 和动态推理 workload。

CS336 · Inference · KV Cache

CS336 · zh

[CS336-09] Scaling Laws 基础

整理 CS336 第九讲:data scaling、model scaling、Chinchilla、compute-optimal training 和小规模实验外推。

CS336 · Scaling Laws · Chinchilla

CS336 · zh

[CS336-08] 分布式训练代码

整理 CS336 第八讲:用 torch.distributed 和 NCCL 把 broadcast、all-reduce、reduce-scatter 等通信原语落到代码。

CS336 · torch.distributed · NCCL

CS336 · zh

[CS336-07] 并行训练基础

整理 CS336 第七讲:collective communication、data parallel、ZeRO、tensor parallel、pipeline parallel 和拓扑约束。

CS336 · Parallelism · ZeRO

CS336 · zh

[CS336-06] Kernels 与 Triton

整理 CS336 第六讲:benchmark、profiling、GPU execution model、Triton kernel、tiling 和 kernel fusion。

CS336 · Triton · Kernels

CS336 · zh

[CS336-05] GPU 基础

整理 CS336 第五讲:GPU 执行模型、memory hierarchy、arithmetic intensity、operator fusion、tiling 和 FlashAttention 直觉。

CS336 · GPU · CUDA · FlashAttention

CS336 · zh

[CS336-04] Mixture of Experts

整理 CS336 第四讲:MoE 的稀疏激活、top-k routing、load balancing、shared experts 和系统复杂度。

CS336 · MoE · Routing

CS336 · zh

[CS336-03] 架构与超参数

整理 CS336 第三讲:现代 Transformer 架构里的 pre-norm、RMSNorm、SwiGLU、RoPE、attention 变体和超参数取舍。

CS336 · Architecture · Transformer

CS336 · zh

[CS336-02] PyTorch 与资源核算

整理 CS336 第二讲:PyTorch 背后的显存、FLOPs、dtype、MFU 和训练资源核算方法。

CS336 · PyTorch · FLOPs · Memory

CS336 · zh

[CS336-01] 课程总览与 Tokenization

整理 CS336 第一讲:课程目标、效率视角、BPE tokenizer,以及从字符串到 token 序列的语言模型入口。

CS336 · Overview · Tokenization