news 2026/8/13 7:34:05

大型语言模型的 MOE 和 MOA

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
大型语言模型的 MOE 和 MOA

原文:towardsdatascience.com/moe-moa-for-large-language-models-c1cafeffd6a5?source=collection_archive---------8-----------------------#2024-07-16

寻求专家小组的建议

https://medium.com/@rahulvir?source=post_page---byline--c1cafeffd6a5--------------------------------https://towardsdatascience.com/?source=post_page---byline--c1cafeffd6a5-------------------------------- Rahul Vir

·发表于 Towards Data Science ·阅读时间:4 分钟·2024 年 7 月 16 日

https://github.com/OpenDocCN/towardsdatascience-blog-zh-2024/raw/master/docs/img/16d3e9edea3d8545cbef99ac81077d6d.png

图片由作者提供(AI 生成 leonardo.ai)

大型语言模型(LLMs)无疑已经掀起了科技行业的风暴。它们的迅猛崛起得益于来自维基百科、网页、书籍、大量研究论文,以及我们喜爱的社交媒体平台的用户内容的大型数据集。这些数据和计算资源密集型的模型一直在热切地整合来自音频和视频库的多模态数据,并且已经使用了成千上万的英伟达 GPU,进行数月的训练,以打造最先进的(SOTA)模型。这一切让我们不禁思考,这种指数级增长是否能够持续下去。

这些大型语言模型面临的挑战是多方面的,但让我们在此探讨其中的一些。

在我们开始过于担心未来之前,先来看一下 AI 研究人员如何不懈努力以确保持续进展。Mixture-of-Experts(MoE)和 Mixture-of-Agents(MoA)的创新表明,希望就在眼前。

首次引入于 2017 年,Mixture-of-Experts技术表明,多个专家和一个能够选择稀疏专家的门控网络能够以更低的计算成本产生显著改善的结果。门控决策使得可以关闭网络的大部分部分,从而启用条件计算,并且专门化提高了语言建模和机器翻译任务的性能。

https://github.com/OpenDocCN/towardsdatascience-blog-zh-2024/raw/master/docs/img/076aab63ab3201d9a51a7913193f052f.png

来源:来自极大规模神经网络的 MoE 层

上图展示了 Mixture-of-Experts 层如何被集成到一个递归神经网络中。门控层仅激活两个专家来处理任务,并随后将它们的输出合并。

尽管这一点已经在一些选定的基准上得到了验证,但条件计算为我们提供了一个途径,可以在不依赖日益增大的模型规模的情况下看到持续的改进。

受到 MOE 的启发,Mixture-of-Agents技术利用多个 LLM 来改善结果。问题通过多个 LLMs(即代理)进行处理,这些代理在每个阶段增强结果,作者已经证明,与更大的 SOTA 模型相比,这种方法能够用更小的模型产生更好的结果。

https://github.com/OpenDocCN/towardsdatascience-blog-zh-2024/raw/master/docs/img/e010a39fddb47fcbc620ad668c47e232.png

来源:Mixture-of-Agents 增强了大语言模型的能力 | 许可

该图展示了 4 个 Mixture-of-Agents 层,每个层中有 3 个代理。为每一层选择合适的 LLMs 非常重要,以确保适当的协作并产生高质量的响应。(来源)

MOA 依赖于这样一个事实:LLMs 之间的协作能产生更好的输出,因为它们能够结合其他模型的响应。LLMs 的角色分为生成多样输出的提议者和可以将其结合起来生成高质量响应的聚合器。多阶段方法可能会增加“首次令牌时间”(TTFT),因此需要开发缓解方法使其适用于广泛的应用。

MOE 和 MOA 具有相似的基础元素,但表现不同。MOE 基于选择一组专家来完成任务的概念,门控网络的任务是选择合适的专家集。MOA 则依赖于团队在前一团队工作的基础上进行建设,并在每个阶段改进结果。

MOE 和 MOA 的创新开辟了一条创新路径,在这条路径上,专门化的组件或模型的组合通过合作和信息交流,能够持续提供更好的结果,即使在模型参数和训练数据集的线性扩展不再简单时。

尽管我们只有回顾时才能知道大语言模型(LLM)创新是否能持久,但我一直在关注该领域的研究以获取见解。从各大高校和研究机构的成果来看,我对未来的进展非常看好。我确实感到,我们正处于新能力和新应用的“热身”阶段,这些将彻底改变我们的生活。我们不知道它们是什么,但可以相当确定,未来的日子不会让我们失望。

“我们往往高估技术在短期内的影响,而低估它在长期内的影响。” - 阿马拉定律

参考文献

[1] Wang, J., Wang, J., Athiwaratkun, B., Zhang, C., & Zou, J. (2024). 代理混合体增强大语言模型能力。arXiv [预印本]。arxiv.org/abs/2406.04692

[2] Shazeer, N., Mirhoseini, A., Maziarz, K., Davis, A., Le, Q., Hinton, G., & Dean, J. (2017). 极其庞大的神经网络:稀疏门控专家混合层。arXiv 预印本 arXiv:1701.06538.

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/11 13:16:08

Waymo融资160亿美元:估值1260亿美元 红杉与DST领投

雷递网 乐天 2月3日自动驾驶出租车先驱Waymo宣布筹集160亿美元,投后估值达到1260亿美元。当前,Waymo正在打造覆盖全球的自动驾驶车队,而其他财力雄厚的竞争对手,例如特斯拉和亚马逊,则正努力追赶。除Alphabet作为主要投…

作者头像 李华
网站建设 2026/8/11 13:11:35

LeakCanary 使用经验分享

文章目录 1. 集成配置 基本依赖配置 自定义配置 2. 使用经验总结 2.1 检测时机 2.2 常见泄漏场景识别 3. 实际项目经验 3.1 误报处理 3.2 自定义排除规则 4. 最佳实践 4.1 版本管理 4.2 性能考虑 4.3 团队协作 5. 高级配置技巧 5.1 自定义 Heap Dumper 5.2 监听检测结果 6. 常见…

作者头像 李华
网站建设 2026/8/10 21:30:09

【软考每日一练030】软件维护:逆向工程与再工程的区别与联系

【软考每日一练030】软件维护:逆向工程与再工程的区别与联系 一、 题目回顾 6. ( ) 是在逆向工程所获取信息的基础上修改或重构已有的系统,产生系统的一个新版本。 A. 逆向分析 (Reverse Analysis) B. 重组 (Restructuring) C. 设计恢复 (Design Reco…

作者头像 李华
网站建设 2026/8/13 6:07:50

解读大数据领域HDFS的元数据管理

深入解读大数据领域HDFS的元数据管理 摘要/引言 问题陈述 在大数据存储与处理的场景中,Hadoop分布式文件系统(HDFS)作为重要的数据存储基石,面临着如何高效管理海量元数据的挑战。元数据记录着文件系统的关键信息,如文…

作者头像 李华
网站建设 2026/8/10 21:30:09

Spark代码规范指南:写出高性能Spark应用的最佳实践

Spark代码规范指南:写出高性能Spark应用的最佳实践 一、引言:为什么你的Spark应用跑得慢? 你是否遇到过这样的场景? 写了一个Spark应用,本地测试没问题,上线后却跑了几个小时还没结束;明明给…

作者头像 李华