Knowledge Compiler

林哲远@context-lab18 篇文章15 个概念4 个领域

AI 系统工程师,持续记录大模型从结构原理到推理系统的工程脉络。

20 条关系 · 3 条路径

领域筛选

全部领域15
推理系统6
注意力机制4
长上下文3
模型基础2

阅读路径

理解 LLM 的骨架入门

从模型整体进入 Transformer、Attention 与位置表示。

6 个概念
高吞吐推理工程进阶

沿着服务、缓存、调度与优化理解推理系统。

6 个概念
走向长上下文高级

从窗口边界进入位置外推、缓存成本与检索互补。

3 个概念
推理系统6模型基础2注意力机制4长上下文3
100%
注意力机制长上下文推理系统模型基础AttentionAttention上下文检索上下文检索上下文窗口上下文窗口连续批处理连续批处理FlashAttentionFlashAttention推理服务推理服务KV CacheKV Cache大语言模型大语言模型长上下文长上下文PagedAttentionPagedAttention位置编码位置编码量化量化RoPERoPETransformerTransformervLLMvLLM

推理系统 · 基础 · 置信度 88%

推理服务

别名:Inference Serving

概念摘要

围绕吞吐、延迟、显存和公平性组织模型推理的服务系统。

观点演变6
2023年1月
大模型生成为什么越来越慢
推理服务中的自回归解码必须逐 token 执行,生成阶段常常受显存带宽而非算力限制。
2023年7月
推理服务的三个核心指标
推理服务需要同时观察吞吐、首 token 延迟和逐 token 延迟。
2023年8月
Continuous Batching:让 GPU 不等人
连续批处理允许推理服务在旧请求结束后立刻补入新请求,而不必等待整批完成。
2023年12月
vLLM 架构导读:从请求到 Token
vLLM 是推理服务的一种工程实现,它把 Continuous Batching、KV Cache 与 PagedAttention 串成完整执行链。
2024年9月
量化如何改变推理系统的瓶颈
量化用更低精度表示权重或激活,会直接改变推理服务的显存与带宽瓶颈。
2025年1月
搭建一条可解释的大模型阅读路径
理解 LLM 可以从大语言模型的目标开始,再进入 Transformer 与 Attention 的结构。
关系网络3
vLLM 延伸而来延伸
连续批处理 的前置前置
量化 相关相关
原文证据6
大模型生成为什么越来越慢查看原文 →
推理服务中的自回归解码必须逐 token 执行,生成阶段常常受显存带宽而非算力限制。
推理服务的三个核心指标查看原文 →
推理服务需要同时观察吞吐、首 token 延迟和逐 token 延迟。
Continuous Batching:让 GPU 不等人查看原文 →
连续批处理允许推理服务在旧请求结束后立刻补入新请求,而不必等待整批完成。
vLLM 架构导读:从请求到 Token查看原文 →
vLLM 是推理服务的一种工程实现,它把 Continuous Batching、KV Cache 与 PagedAttention 串成完整执行链。
量化如何改变推理系统的瓶颈查看原文 →
量化用更低精度表示权重或激活,会直接改变推理服务的显存与带宽瓶颈。
搭建一条可解释的大模型阅读路径查看原文 →
掌握模型计算后,再学习推理服务如何处理延迟、吞吐和显存。

推理系统 · 基础 · 置信度 88%

推理服务

别名:Inference Serving

概念摘要

围绕吞吐、延迟、显存和公平性组织模型推理的服务系统。

观点演变6
2023年1月
大模型生成为什么越来越慢
推理服务中的自回归解码必须逐 token 执行,生成阶段常常受显存带宽而非算力限制。
2023年7月
推理服务的三个核心指标
推理服务需要同时观察吞吐、首 token 延迟和逐 token 延迟。
2023年8月
Continuous Batching:让 GPU 不等人
连续批处理允许推理服务在旧请求结束后立刻补入新请求,而不必等待整批完成。
2023年12月
vLLM 架构导读:从请求到 Token
vLLM 是推理服务的一种工程实现,它把 Continuous Batching、KV Cache 与 PagedAttention 串成完整执行链。
2024年9月
量化如何改变推理系统的瓶颈
量化用更低精度表示权重或激活,会直接改变推理服务的显存与带宽瓶颈。
2025年1月
搭建一条可解释的大模型阅读路径
理解 LLM 可以从大语言模型的目标开始,再进入 Transformer 与 Attention 的结构。
关系网络3
vLLM 延伸而来延伸
连续批处理 的前置前置
量化 相关相关
原文证据6
大模型生成为什么越来越慢查看原文 →
推理服务中的自回归解码必须逐 token 执行,生成阶段常常受显存带宽而非算力限制。
推理服务的三个核心指标查看原文 →
推理服务需要同时观察吞吐、首 token 延迟和逐 token 延迟。
Continuous Batching:让 GPU 不等人查看原文 →
连续批处理允许推理服务在旧请求结束后立刻补入新请求,而不必等待整批完成。
vLLM 架构导读:从请求到 Token查看原文 →
vLLM 是推理服务的一种工程实现,它把 Continuous Batching、KV Cache 与 PagedAttention 串成完整执行链。
量化如何改变推理系统的瓶颈查看原文 →
量化用更低精度表示权重或激活,会直接改变推理服务的显存与带宽瓶颈。
搭建一条可解释的大模型阅读路径查看原文 →
掌握模型计算后,再学习推理服务如何处理延迟、吞吐和显存。