[Kimi-2] Kimi Linear:用 KDA 重写长上下文注意力
从 Delta Rule、逐通道遗忘与 DPLR 转移出发,推导 Kimi Delta Attention,拆解 3:1 KDA/MLA 混合架构、chunkwise kernel、公平对照实验,以及 1M 上下文下的质量与吞吐取舍。
/ writing
69 篇技术笔记,覆盖 AI Infra、LLM 算法、CS336、关键概念和工程复盘。
从 Delta Rule、逐通道遗忘与 DPLR 转移出发,推导 Kimi Delta Attention,拆解 3:1 KDA/MLA 混合架构、chunkwise kernel、公平对照实验,以及 1M 上下文下的质量与吞吐取舍。
从 Stage、AsyncOmniEngine、Orchestrator、StageRuntime 和 OmniConnector 出发,理解 vLLM-Omni 如何统一 AR、Diffusion、Encoder 与音频 Decoder,并分析异构流水、两级调度、解耦部署和源码学习路径。
解析 vLLM PR #51113:Hybrid GDN/Mamba 模型在 MTP/EAGLE、并发 chunked prefill 与 prefix caching 共同作用下,为什么会把不完整 recurrent state 注册成完整 cache block,以及 scheduler 如何重新建立物理状态与缓存元数据的一致性。
系统解读 Kimi k1.5:从可验证 RL prompt、Long-CoT SFT、在线 mirror descent 策略优化,到长度惩罚、partial rollout、训推混合部署、多模态训练与 long2short。
系统整理 DeepSeek-V4 preview 技术报告:从 1.6T/284B MoE、CSA+HCA 混合注意力、mHC、Muon、32T token 预训练,到 specialist+OPD 后训练、FP4 QAT、KV Cache 管理、百万上下文评测与局限。
系统拆解 DSpark 的半自回归草稿模型、Markov/RNN sequential head、置信度头、STS 校准、硬件感知 prefix scheduler、训练目标、DeepSpec 实现与 DeepSeek-V4 线上部署取舍。
从张量形状和完整公式出发,拆解标准 Multi-Head Attention 的 Q、K、V 投影、多头计算与输出拼接,并分析 Prefill、Decode、KV Cache,以及 MHA、GQA、MQA 的核心差异。
从 KV Cache、历史可寻址性和推理基础设施出发,比较 GQA、MLA、Linear Attention 与 Sparse Attention,并讨论混合记忆架构为何正在成为主流。
从线性注意力的固定状态出发,推导 Delta Rule 的误差驱动写入与 Gated DeltaNet 的全局衰减,解释其并行训练、递归推理、记忆容量,以及与 Transformer、Mamba 的关系。
提炼 design-an-interface、qa、request-refactor-plan 与 ubiquitous-language,并分析它们为何被更通用的 flow 吸收。
提炼 4 个 misc 与 2 个 personal skill:危险 Git 拦截、pre-commit、测试迁移、练习脚手架、文章编辑和 Obsidian 管理。
从 MoE Dispatch 与 Combine 的路由语义出发,系统拆解 DeepEP V2 的 Rank 级去重、ElasticBuffer、EPHandle、Direct/Hybrid 通信、FP8 传输、SM/QP 资源模型与通信计算重叠。
提炼 handoff、teach 以及 7 个实验性 skill:如何跨会话保留状态、组织持续教学、批量访谈和分阶段写作。
提炼 codebase-design、improve-codebase-architecture、research、triage 与 setup-ts-deep-modules,关注接口深度、知识来源和可领取工作。
提炼 prototype、tdd、implement、diagnosing-bugs、code-review 与 resolving-merge-conflicts,建立从试验到交付的可靠反馈环。
从 Weight Absorption、576/512 数据布局和 Paged KV Cache 出发,系统拆解 FlashMLA 的 Split-KV、Online Softmax、Seesaw Scheduling、稀疏 Attention、FP8 KV Cache 与 Crossover。
提炼 to-spec、to-tickets、wayfinder 和 to-questionnaire:怎样把决策固化成规格、纵向切片、依赖图与异步问卷。
系统解析 DeepSeek-R1 与 R1-Zero:从 GRPO、结果奖励、两轮 SFT 与两轮 RL,到推理时计算、蒸馏、RL Infra、训练成本、失败经验和能力边界。
提炼 grilling、grill-me、grill-with-docs 与 domain-modeling:如何区分事实和决策,逐步消除需求歧义,并留下可复用的领域语言。
系统拆解 DeepSeek-V3 的 MLA、DeepSeekMoE、无辅助损失负载均衡、MTP、FP8 与 DualPipe,并分析 14.8T token 训练、128K 上下文、部署方案、评测结果和 557.6 万美元成本口径。
从 mattpocock/skills 的 41 个技能中提炼整体设计:主流程、入口、路由器、项目初始化,以及怎样写出可预测的 Skill。
从序列联合概率出发,系统解释 Beam Search 的扩展、打分与剪枝过程,以及束宽、长度归一化、终止条件和推理成本之间的取舍。
从 rollout、环境、奖励、轨迹、训练和权重同步构成的闭环出发,理解 RL Infra 的系统边界、核心难点、部署形态、主流框架,以及 vLLM、MoE 和 MLU 推理经验如何迁移到 RL 系统。
从计算图和 IR 出发,理解编译器 Pass 如何分析、匹配并改写程序,以及算子融合、Lowering、Pattern Rewrite 和 Kernel 之间的关系。
从地址公式出发理解 stride:它如何支撑零拷贝 view、约束 Kernel 寻址与合并访存,并进一步影响 Attention、Paged KV Cache、量化、通信打包、torch.compile 和线上正确性。
从 All-to-All 通信语义与 MoE dispatch/combine 数据流出发,系统分析不均匀路由、小消息、拓扑、重排和长尾瓶颈,并梳理分层通信、kernel 融合、通算重叠、Expert 放置与 profiling 方法。
从 prefix 匹配、RadixTree、异步 transfer graph 到 Redis + Mooncake 的分布式复用,理解 FlexKV 如何扩展 KV Cache 的生命周期,以及它与 vLLM 原生 KV 管理的边界。
从训练目标、DeepSeek-V3 的 sequential MTP modules 和 vLLM speculative decoding 出发,解释 MTP 如何增加监督信号、提出 bonus token,并接入验证、KV Cache 提交与 serving 调度链路。
陈天奇 MLC 课程第七讲学习笔记:理解 Relax AST、访问者模式、算子模式匹配、Linear + ReLU 融合,以及图优化如何衔接到 TensorIR calls。
陈天奇 MLC 课程第六讲学习笔记:从 thread block、local/shared memory tiling 到硬件专业化和 tensorization,理解张量程序如何映射到 GPU。
陈天奇 MLC 课程第五讲学习笔记:通过 TE、BlockBuilder 与 PyTorch FX 将现有框架模型导入 IRModule,并理解导入边界与高层算子翻译。
陈天奇 MLC 课程第四讲学习笔记:把手工 schedule 变换变成搜索空间,理解 stochastic schedule、候选测量与 Meta-Schedule 的优化闭环。
理解 xLLM 在大模型 Infra 中的位置:它不是一个模型,而是一套面向多类 AI 加速器的推理引擎与集群服务系统;重点拆解 Service-Engine 解耦、PD/EPD 分离、全局 KV Cache、动态调度和 MoE 优化。
用统一坐标系梳理大模型推理中的 DP、TP、PP、SP、CP、EP 与 PD 分离:它们分别切分什么、哪些可以组合、MoE 与 KV Cache 会带来哪些实际耦合。
从策略梯度与 KL 正则化出发,推导 PPO、DPO、GRPO 的目标函数,厘清 Critic、Reward、Old Policy 与 Reference Policy 的角色,并分析三者的适用场景和常见误区。
陈天奇 MLC 课程第三讲学习笔记:用 Relax 计算图、call_tir、dataflow block 和参数绑定把单个 TensorIR 函数组织成可构建的端到端模型。
陈天奇 MLC 课程第二讲学习笔记:理解元张量函数、循环嵌套、缓冲区、block axis 与 TensorIR schedule 为什么是可优化程序的基础。
从大模型服务的部署、调度、扩缩容和故障恢复出发,解释 K8s 在 AI Infra 里的位置,以及它和 Docker、Ray、Slurm、vLLM 等系统的关系。
陈天奇 MLC 课程第一讲学习笔记:从开发形式到部署形式,理解机器学习编译的目标、张量函数与抽象/实现边界。
从语言模型的链式法则出发,解释 N-Gram 如何用最近 N-1 个 token 的频次预测下一个 token,以及数据稀疏、平滑、回退、插值和它与 Transformer 的关系。
从 prefill、TTFT、有效计算量和 benchmark 公平性出发,讨论 prefix caching 为什么会把硬件算力测试变成缓存命中率与 serving 策略测试。
从模型训练、reasoning token、vLLM serving、PD 分离和线上压测几个角度,解释 reasoning 到底改变了什么,又没有改变什么。
从大模型训练和推理两个视角解释 Checkpoint:它保存什么、为什么能断点续训、和模型权重及 .safetensors 的关系,以及它在 vLLM 部署中的角色。
从 Prefill 和 Decode 的资源特征出发,系统梳理 PD 分离为什么重要、到底分离了什么、如何影响 TTFT 与 TPOT,以及 KV Cache 传输为什么会成为新的系统核心。
从 GPU 任务提交开销出发,解释 CUDA Graph 如何把稳定的 CUDA 执行流捕获成可重复 replay 的图,以及它在 PyTorch 和大模型推理中的价值与限制。
从标准 Attention 的二次复杂度出发,解释 Linear Attention 如何用 kernel feature map 和递推状态降低长上下文成本,以及 Gamma、Delta、Gate、Conv 等增强方法在解决什么问题。
从最大更新参数化的直觉出发,梳理 muP 解决的问题、和 NTK/SP 的区别、Transformer 里的关键改动,以及它为什么能支持小模型调参迁移到大模型。
从目标、计算流程、显存结构、通信模式、性能指标和调度逻辑出发,系统区分分布式训练与分布式推理,并结合 vLLM 多机多卡场景总结分析重点。
从 AI Agent 的工作流角度理解 Skill:它不是重新训练模型,而是把任务流程、规则、脚本和资源封装成可复用的能力单元。
以多卡训练和大模型推理为背景,系统梳理 NCCL 的位置、核心概念、常见 collective、单机与多机通信路径,以及性能调优和排查思路。
系统梳理链路带宽、注入带宽、对分带宽、algbw、busbw 及其在 PCIe、Ring、NVSwitch、Fat-tree 等拓扑中的计算与分析方法。
从简历装不下自己开始,到用 Next.js、MDX、Tailwind 和 GitHub Pages 搭建一个更动态的个人展示载体。
整理 CS336 第十七讲:policy gradient、baseline、advantage、GRPO group normalization、KL penalty 和 reward 处理细节。
整理 CS336 第十六讲:从 RLHF 到 RLVR,PPO、DPO、GRPO、可验证 reward 和 reasoning model 训练。
整理 CS336 第十五讲:SFT、instruction data、preference data、RLHF、PPO、DPO 和 alignment 数据风格。
整理 CS336 第十四讲:KenLM、fastText、DSIR、语言过滤、毒性过滤、Bloom filter、MinHash 和近重复去重。
整理 CS336 第十三讲:pretraining、mid-training、post-training 数据,web data pipeline、版权许可和 instruction data。
整理 CS336 第十二讲:benchmark、开放式评测、LM-as-a-judge、安全评测、污染检测和评测质量。
整理 CS336 第十一讲:muP、WSD learning rate、MiniCPM、DeepSeek、LLaMA 3 等 scaling 实践 recipe。
整理 CS336 第十讲:prefill、decode、KV cache、GQA、MLA、speculative decoding、PagedAttention 和动态推理 workload。
整理 CS336 第九讲:data scaling、model scaling、Chinchilla、compute-optimal training 和小规模实验外推。
整理 CS336 第八讲:用 torch.distributed 和 NCCL 把 broadcast、all-reduce、reduce-scatter 等通信原语落到代码。
整理 CS336 第七讲:collective communication、data parallel、ZeRO、tensor parallel、pipeline parallel 和拓扑约束。
整理 CS336 第六讲:benchmark、profiling、GPU execution model、Triton kernel、tiling 和 kernel fusion。
整理 CS336 第五讲:GPU 执行模型、memory hierarchy、arithmetic intensity、operator fusion、tiling 和 FlashAttention 直觉。
整理 CS336 第四讲:MoE 的稀疏激活、top-k routing、load balancing、shared experts 和系统复杂度。
整理 CS336 第三讲:现代 Transformer 架构里的 pre-norm、RMSNorm、SwiGLU、RoPE、attention 变体和超参数取舍。
整理 CS336 第二讲:PyTorch 背后的显存、FLOPs、dtype、MFU 和训练资源核算方法。
整理 CS336 第一讲:课程目标、效率视角、BPE tokenizer,以及从字符串到 token 序列的语言模型入口。