news 2026/9/25 18:54:06

为什么现在聚焦 kv cache;分清楚:kv权重 和 kv向量

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
为什么现在聚焦 kv cache;分清楚:kv权重 和 kv向量

权重只存一份,KV 是每个 token 存一份,token 够多 kv 向量越大

目录

  • 权重只存一份,KV 是每个 token 存一份,token 够多 kv 向量越大
    • 一、先看两者怎么随长度变化
    • 二、算出来的结果
    • 三、为什么必然如此(本质)
    • 四、现代大模型呢

一、先看两者怎么随长度变化

  • 模型权重:固定一份,和输入多长完全无关→ GPT-2 small 恒为0.23 GB
  • KV Cache:每来 1 个 token 就新增一份K/V,随序列长度线性累积→ 36 KB/token

二、算出来的结果

  • 临界长度 ≈ 6700 token:上下文到约6.7K时,KV Cache 就追平整个模型权重
  • 10万 token ÷ 6700 ≈ 15 倍→ 这就是"十几倍"的来源

三、为什么必然如此(本质)

两者都含"层数",一除层数约掉:

临界长度 = 权重总参数 每token存的KV个数 = 1.24 亿 2 ( K , V ) ×

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/25 18:51:22

G Hub宏失效的解决方法

都是用了5年了的罗技老用户了,虽然lgHub挺好用的,但是还是偶尔会出现一些小问题。比如找不到 lg设备,设备自定义宏失效,自启动失效,lgHub卡在加载动画进不去的问题。这里只说鼠标宏无法触发,常见原因多源于…

作者头像 李华
网站建设 2026/9/25 18:44:14

Atlas 300V 24G部署YOLO全流程:从ONNX转换到推理优化实战

Atlas这个词,搞AI的人这几年应该都不陌生。只要你在硬件选型阶段多看了几眼推理加速卡,大概率会碰到华为昇腾的Atlas系列。老实说,我最早接触Atlas是朋友让我帮他看一块二手卡,说是“300V 24G”,第一反应这尺寸是不是类…

作者头像 李华
网站建设 2026/9/25 18:41:26

Atlas 300V推理卡实战:YOLO模型部署与调优全指南

先说结论:Atlas 300V 不是那种传统意义上一听名字就懂的“显卡”,它是华为昇腾生态里的一款AI推理加速卡,专门干“模型算完”这件事。你拿它跑YOLO做目标检测,正好撞在它的强项上。我前面帮团队选型、部署、调优这套东西折腾了小两…

作者头像 李华
网站建设 2026/9/25 18:39:41

芯参谋(17):并口PPI NAND Flash 软件设计规范

1. 目的与范围 本规范规定 PPI NAND(Parallel Peripheral Interface NAND,即传统 并行接口裸 NAND)软件层的设计约束与推荐实现,目标是: 正确实现 CLE / ALE / CE# / WE# / RE# / R/B#(及可选 DQS&#x…

作者头像 李华
网站建设 2026/9/25 18:33:02

HotSpot方法区本质:klass对象与Class镜像的绑定关系

前几天帮一个准备跳槽的朋友对面试题,在“方法区到底存了什么”这个问题上卡了很久。他能背出“类的元数据、运行时常量池、静态变量”,但当我追问“这个元数据在 HotSpot 里具体长什么样?你代码里拿到的 Xxx.class 对象,和方法区…

作者头像 李华