权重只存一份,KV 是每个 token 存一份,token 够多 kv 向量越大
目录
- 权重只存一份,KV 是每个 token 存一份,token 够多 kv 向量越大
- 一、先看两者怎么随长度变化
- 二、算出来的结果
- 三、为什么必然如此(本质)
- 四、现代大模型呢
一、先看两者怎么随长度变化
- 模型权重:固定一份,和输入多长完全无关→ GPT-2 small 恒为0.23 GB
- KV Cache:每来 1 个 token 就新增一份K/V,随序列长度线性累积→ 36 KB/token
二、算出来的结果
- 临界长度 ≈ 6700 token:上下文到约6.7K时,KV Cache 就追平整个模型权重
- 10万 token ÷ 6700 ≈ 15 倍→ 这就是"十几倍"的来源
三、为什么必然如此(本质)
两者都含"层数",一除层数约掉:
临界长度 = 权重总参数 每token存的KV个数 = 1.24 亿 2 ( K , V ) ×