news 2026/9/25 13:00:29

从零手搓大模型(八)国产开源模型Qwen3

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从零手搓大模型(八)国产开源模型Qwen3

Qwen3 From Scratch 教程:贴近现代国产开源模型的结构

这个博客很适合想理解 Qwen 系列、国产开源模型、现代 LLM 工程结构的人。

一句话理解:

Qwen3 在 Llama 风格 decoder-only 架构上,加入了 Qwen 自己的配置、QK norm、GQA、RoPE、MoE 变体和 KV cache 推理优化。

1. Qwen3 和 GPT 主线有什么关系

主线章节的 GPT 是教学版:

LayerNorm learned positional embedding MHA GELU FFN

Qwen3 更接近现代 LLM:

RMSNorm RoPE GQA SwiGLU FFN 可选 QK norm 可选 MoE KV cache 推理

所以这个 bonus 是从“会写 GPT”到“看懂现代开源模型”的重要过渡。

2. Qwen3Model 的整体结构

standalone-qwen3.ipynb里的核心模型是:

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/25 12:57:43

ComfyUI 3.2整合包实战:MiniMax H3视频生成工作流部署与参数调优

如果你最近在折腾AI绘画和视频生成,应该已经注意到秋叶的ComfyUI整合包更新到了3.2版本。这一版最让人关注的变化,是把底层运行时换成了Python 3.13加新版Torch分支,并且把MiniMax H3的视频生成链路直接内置到了工作流体系里。我从下载、安装…

作者头像 李华
网站建设 2026/9/25 12:56:30

【关注可白嫖源码】--课程设计+毕业设计+springboot高校学科竞赛管理系统[编号:project18952]((案例分析)

本文仅展示核心实现逻辑与部分代码片段,完整项目源码、配套文档、数据库脚本内容较多,篇幅有限无法全部放出。 有需要完整资源的同学,可以在评论区留言【资料或领源码】,我会一 一回复站内私信,发送完整文件摘 要本系…

作者头像 李华
网站建设 2026/9/25 12:54:52

Claude写代码实战:从接入到提PR的工程化指南

1. 从“补全代码”到“交付功能”:重新理解 Claude 写代码这件事很多人第一次听说“用 Claude 写全部代码”,脑子里浮现的画面是:打开一个聊天窗口,敲一句“帮我写个登录页面”,然后复制粘贴。这种用法确实存在&#x…

作者头像 李华
网站建设 2026/9/25 12:41:18

AI漫剧全流程实战指南:从分镜结构化到DaVinci精修

1. 这不是“AI一键成片”,而是一条能亲手拧紧每颗螺丝的漫剧产线最近在几个内容创作群和独立动画人小圈子聊得最多的一件事,就是“AI漫剧”这个词突然从技术论坛跳进了甲方brief里。上周有位做儿童IP孵化的朋友发来一段30秒样片,主角是只穿背…

作者头像 李华
网站建设 2026/9/25 12:41:16

Atlas 300V 24G边缘卡部署YOLO实战:视频解析与AI推理的融合

Atlas这个型号,最近在搞AI边缘部署的圈子里讨论热度确实高。尤其是“Atlas 300V 24G”这张卡,很多人第一眼看到规格都会愣一下——24G显存,这参数放在独立显卡里也算大容量了,但它到底是不是传统意义上那种“运算加速卡”&#xf…

作者头像 李华