传统预分配
请求A
请求B
请求C
请求D
浪费
已释放
GPU 显存 — 物理布局 (连续分配)
为什么不能分散分配?— 无 Block Table 做地址翻译,attention kernel 要求 K/V 在连续内存中
—
利用率
利用率
—
活跃请求
活跃请求
—
浪费
浪费
—
已释放
已释放
PagedAttention
请求A
请求B
请求C
请求D
空闲Block
逻辑视图 — 选中请求看到的"连续地址空间" (类比虚拟地址)
Block Table 翻译 — 逻辑 block → 物理 block (类比页表)
物理视图 — GPU 显存实际布局 (仅最后一个 block 可能有 internal fragmentation)
—
Block 利用率
Block 利用率
—
活跃请求
活跃请求
—
空闲 Block
空闲 Block