news 2026/8/29 7:30:41

哈希表全解析

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
哈希表全解析

🔍 哈希表全解析:让“找东西”快如闪电的秘密武器!

想象一下:你在100万人的名单里找“张三”。
普通列表要查100万次,二分查找也要20次——
但哈希表?1次命中!

这背后,是一套精妙的“地址翻译系统”:哈希函数 + 冲突处理策略
今天,我们就用真实例子 + 逐步演示 + 关键公式,彻底讲透哈希表的每一个细节!


一、基本概念

🎯 哈希函数

将关键字key映射为存储地址的函数 。理想情况下,无需比较即可直接定位。

⚠️ 冲突与同义词

  • 冲突:不同关键字映射到同一地址。

  • 同义词:发生冲突的关键字互称同义词。

💡 例:H(key) = key % 7→ H(15)=1, H(22)=1 → 冲突!


二、哈希函数构造6法(附例子)


三、冲突处理4大技术

统一设定

  • 关键字序列:47, 7, 29, 11, 16, 92, 22, 8, 3

  • 哈希函数:(地址0~10)

  • 初始哈希地址:

key

H

47

3

7

7

29

7 ❗

11

0

16

5

92

4

22

0 ❗

8

8

3

3 ❗


1. 开放定址法(Open Addressing)

所有元素必须存放在主表中,冲突时在表内探测新位置。

(1)线性探测:挨家挨户问
  • 规则

✅ 插入结果:

地址

0

1

2

3

4

5

6

7

8

9

10

元素

11

22

47

92

16

3

7

29

8

🔍 查找8:H=8 → 29≠8 → 9 → 找到(2次)
⚠️ 缺点:一次聚集严重。


(2)二次探测:跳跃式找房
  • 规则,顺序:+1, -1, +4, -4...

✅ 插入关键步骤:

  • 3(H=3):+1→4(占),-1→2(空) → 存入2

✅ 最终表:

地址

0

1

2

3

4

5

6

7

8

9

10

元素

11

22

3

47

92

16

7

29

8

✅ 优势:减少聚集,分布更均匀。


(3)伪随机探测:按“神秘清单”找房
  • 规则预设一个伪随机序列
    探测地址:

📌 常见做法:用线性同余生成器产生固定序列,如,种子固定 → 序列可重现

我们预设随机偏移序列:R = [3, 5, 2, 7, 1, 4, 6, 8, 9]

🔧 逐个插入(只看冲突项):
  • 29(H=7)

    • 7 被7占用 → 试 (7+3)%11 = 10 → 空 →存入10

  • 22(H=0)

    • 0 被11占用 → 试 (0+3)%11=3(47占)

    • 试 (0+5)%11=5(16占)

    • 试 (0+2)%11=2 → 空 →存入2

  • 3(H=3)

    • 3(47占)→ +3→6(空?是!)→存入6

注:8 的 H=8,此时仍为空(29已去10),所以8直接存入8。

最终表

地址

0

1

2

3

4

5

6

7

8

9

10

元素

11

22

47

92

16

3

7

8

29

🔍 查找29:H=7 → 7≠29 → 试10 → 找到(2次)
✅ 优势:探测路径看似随机,有效打破聚集;
⚠️ 缺点:需额外存储/生成随机序列,实现稍复杂。


2. 再哈希法(Double Hashing)

  • 规则

✅ 最终表:

地址

0

1

2

3

4

5

6

7

8

9

10

元素

11

3

8

47

92

16

22

7

29

✅ 优势:探测步长由 key 决定,几乎无聚集


3. 链地址法(Chaining)

每个地址挂一个链表。

✅ 最终结构:

0: 22 → 11 3: 3 → 47 4: 92 5: 16 7: 29 → 7 8: 8

✅ 优势:无聚集、删除简单、支持 α > 1 ——工业界首选


4. 公共溢出区(Public Overflow Area)

规则:主表只存“第一个来的”; 后续冲突者按插入顺序进入溢出区; 溢出区是线性数组,不按哈希地址分配位置!

🔧 结果: ✅ 主表:

地址

0

3

4

5

7

8

元素

11

47

92

16

7

8

✅ 溢出区(按插入顺序!):

序号

key

原始 H

0

29

7

1

22

0

2

3

3

🔍查找 3:H=3 → 主表[3]=47 ≠ 3
遍历溢出区:29(H=7)→22(H=0)→3(H=3 ✔) → 找到(3次)

一共进行四次比较

🚨重点澄清:溢出区是时间顺序队列,不是按 H 分组!
仅适合冲突极少的场景(α < 0.1),否则退化为 O(n)

四、查找与插入算法(开放定址伪代码)

// 线性探测示例 SearchHash(HT, key): addr = key % m while HT[addr] ≠ key and HT[addr] ≠ EMPTY: addr = (addr + 1) % m return (HT[addr] == key) ? addr : NOT_FOUND

五、性能分析

装填因子 α = n / m

ASL 公式(查找成功):

  • 线性探测:

  • 二次/再哈希:

  • 链地址:

α=0.8 时:线性探测 ASL≈3.0,链地址≈1.4


六、结论与选型建议

方法

推荐场景

链地址法

通用首选(HashMap、dict)

再哈希法

高性能、内存受限

线性探测

小数据、静态表

二次/伪随机探测

需避免聚集的开放定址场景

公共溢出区

冲突极少

✅ 默认选择:除留余数法 + 链地址法


💡 结语

从线性探测到链地址,从伪随机到再哈希——哈希表的每一种策略,都是对“冲突”这一现实问题的智慧回应。

掌握它们,你就能在工程与面试中游刃有余!


📚 动手画一遍9个关键字的插入过程,胜过十遍阅读!
👉 觉得有用?点赞+转发!
❓ 你在项目中用哪种方法?欢迎留言!


版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/21 13:30:07

开源模型部署成本对比:DeepSeek-R1与阿里云百炼平台费用分析

开源模型部署成本对比&#xff1a;DeepSeek-R1与阿里云百炼平台费用分析 1. 背景与目标 你是否也在为大模型的部署成本头疼&#xff1f;一边是开源模型本地部署的技术自由&#xff0c;另一边是云平台开箱即用的便捷体验。到底哪种方式更划算&#xff1f; 本文将聚焦 DeepSee…

作者头像 李华
网站建设 2026/8/29 5:54:01

Qwen1.5-0.5B轻量化优势:适合中小团队的部署实战

Qwen1.5-0.5B轻量化优势&#xff1a;适合中小团队的部署实战 1. 轻量级模型为何成为中小团队首选 在AI技术快速落地的今天&#xff0c;越来越多的中小企业和初创团队希望将大语言模型&#xff08;LLM&#xff09;集成到自己的产品中。然而&#xff0c;动辄数十亿甚至上百亿参…

作者头像 李华
网站建设 2026/8/21 13:30:06

IQuest-Coder-V1指令模型测评:日常编码辅助效率提升指南

IQuest-Coder-V1指令模型测评&#xff1a;日常编码辅助效率提升指南 在当前快速迭代的软件开发环境中&#xff0c;开发者对智能编码助手的需求已从“能写代码”升级为“懂上下文、会推理、能协作”。IQuest-Coder-V1-40B-Instruct 正是在这一背景下推出的新型代码大语言模型&a…

作者头像 李华
网站建设 2026/8/21 13:30:11

通义千问3-14B部署教程:Kubernetes集群部署最佳实践

通义千问3-14B部署教程&#xff1a;Kubernetes集群部署最佳实践 1. 引言&#xff1a;为什么选择Qwen3-14B做生产级部署&#xff1f; 如果你正在寻找一个性能接近30B级别、但资源消耗控制在单卡甚至消费级显卡可承载范围的大模型&#xff0c;那么通义千问3-14B&#xff08;Qwe…

作者头像 李华
网站建设 2026/8/25 3:43:24

Z-Image-Turbo GPU利用率提升秘籍:参数调优与资源分配实战

Z-Image-Turbo GPU利用率提升秘籍&#xff1a;参数调优与资源分配实战 Z-Image-Turbo 是一款基于深度学习的图像生成模型&#xff0c;具备高效推理和高质量输出能力。其核心优势之一在于可通过 UI 界面进行直观操作&#xff0c;极大降低了使用门槛。本文将围绕如何在实际部署中…

作者头像 李华