跳转到内容
← AI 人物志
训练与推理

Woosuk Kwon

vLLM · PagedAttention

Woosuk Kwon 是机器学习系统研究者,也是 PagedAttention 论文的第一作者和 vLLM 的主要创建者之一。他关注语言模型推理服务中的显存管理与吞吐。

模型逐步生成文本时,会为已经处理过的 token 保留键和值,也就是 KV cache。不同请求的长度不断变化,朴素分配容易浪费显存。PagedAttention 借鉴分页思想,将缓存分成可管理的块,减少碎片并支持更灵活的共享。

vLLM 将这类机制与请求调度等服务能力结合起来,提高多请求场景下的资源利用率。吞吐改善不等于所有单次请求都会更快,实际效果还需要结合并发、输出长度和硬件评估。