news 2026/9/6 23:27:05

Awesome-Chinese-LLM 实战:3 步从选中文底座模型到垂直领域微调

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Awesome-Chinese-LLM 实战:3 步从选中文底座模型到垂直领域微调

Awesome-Chinese-LLM 实战:3 步从选中文底座模型到垂直领域微调

【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM

Awesome-Chinese-LLM 是收录 100 多个开源中文大模型资源的资料库,面向可私有化部署的小规模模型,覆盖底座模型、垂直领域微调模型、数据集与训练教程。这篇文章用「看图 → 选底座 → 跑部署」三步,讲清资源地图怎么读、底座怎么选、第一个模型怎么落地。

中文大模型资源地图:左侧是各底座模型家族,右侧是它们的微调模型,一张图看清算谱

🧭 中文大模型资源地图怎么读:核心资产一表看懂

底座模型和垂直领域微调模型有什么区别

很多人第一次看会被 Base 和 Chat 这类词绕晕。底座模型(Base)是预训练出来的大模型,是所有二次微调的地基;垂直领域微调模型则是拿底座模型加上医疗、法律、金融等领域数据再训练出来的产物。读这个项目时先分清这两个角色,后面章节就好理解了。

资源类型它是什么去哪里找
底座模型预训练大模型,一切二次微调的地基「模型」章节,分文本与多模态两块
垂直领域微调模型基于底座用领域数据再微调的模型「应用」章节,按医疗、法律、金融分节
数据集预训练、SFT(监督微调)、偏好三类中文语料「数据集」章节,三类各占一节
训练 / 部署框架做微调和推理部署的工具README 第 4、5 节

数据集、框架和教程都放在哪

模型章节之后,README 还依次整理了数据集、训练微调框架(如 DeepSpeed Chat、ChatGLM Efficient Tuning)、推理部署框架(如 vLLM),以及 LLM 评测、提示工程、实战教程等内容。「想自己训一个模型」需要的每一步资料都能在这里找到,不用到处翻帖子。

🧩 新手场景:两个真实用法搭领域中文大模型

搭法律问答助手:3 分钟定位法律大模型

想象你要给律所内部工具加一个法律咨询问答能力。不用自己从头训,直接翻到「应用 - 法律」小节:獬豸、LaWGPT、LexiLaw、Lawyer LLaMA、韩非、ChatLaw 等法律大模型都列在这里,每个模型用了什么底座、哪些微调数据都写清楚了。这张行业思维导图的文本版在 doc/Legal.md,可以打开对照看。

中文法律大模型思维导图:逐个标注各模型的底座、训练数据与算力配置

搭金融问答机器人:从底座到聚宝盆

另一个常见需求是金融问答,比如解读财报或分析政策文件。去「应用 - 金融」小节:从 7B 级的聚宝盆(Cornucopia)到千亿级的轩辕,FinGPT、DISC-FinLLM 也列了各自的训练数据与推理框架,按显卡预算挑一个即可。对应的思维导图文本版是 doc/Financial.md。

中文金融大模型思维导图:覆盖聚宝盆、轩辕、FinGPT 等模型的底座与数据配置

🔧 实战 3 步:从克隆仓库到第一次部署

第一步:克隆仓库并看底座模型概览表

先把资源库拉到本地,执行git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM,然后打开 README.md 顶部的「常见底座模型细节概览」表。这张表列了各底座的参数大小、训练 token 数、最大上下文长度和是否可商用,是选模型的第一手依据。

第二步:选底座并找到配套的微调模型和数据

按显存挑一个:ChatGLM、Qwen、Baichuan 这类 6B-7B 级模型量化后消费级显卡就能跑,13B 以上要多留显存。定了底座后再回「应用」章节查两件事:这个底座派生出哪些垂直模型(例如 ChatGLM 系列下的医疗、法律模型),以及有哪些现成数据集可用(如 Huatuo-26M 医疗问答、COIG 指令语料)。

第三步:选微调框架并跑通推理部署

想自己微调的话,从 README 第 4 节挑工具,比如 ChatGLM Efficient Tuning 和 LLaMA Efficient Tuning,都支持 LoRA、QLoRA 这类低成本微调模式。只想用现成模型的话,第 5 节列了 vLLM 等推理部署框架,「LLM 实战教程」小节还有现成的部署示例可以直接照做。

📌 中文大模型底座选型常见问题

选型前必看的 5 个核对项

  • 先看显存再看能力:概览表里的参数大小是硬约束,7B 级用 4bit 量化通常就能跑,13B 以上建议预留更大显存。
  • 核对商用授权:表格中「是否可商用」只是粗筛,真要做产品还是回模型原始许可协议确认一遍。
  • 分清 Base 与 Chat 版本:Base 面向继续预训练和微调,Chat 面向直接对话,做领域微调时从 Base 出发效果更好。
  • 长上下文很吃显存:32K、200K 是模型训练上限,不是免费午餐,实际输入越长占显存越多,首部署先用默认长度试。
  • 数据要和场景对口:COIG 这类 SFT 语料适合通用指令微调,Huatuo-26M 是医疗对话数据,别混着用于通用闲聊。

📎 延伸阅读:数据集、行业导图与教程

接下来可以看的资源

  • doc/LLM.md:中文大模型资源思维导图文本版,每个底座和微调模型的谱系关系写得比较细
  • doc/Medical.md:医疗领域思维导图文本版,适合核对医疗模型的训练数据与底座选择
  • src/:医疗、法律、金融等 4 张行业思维导图原图都放在这个目录里

到这里,你手里已经有一条完整路线:看图找模型、看表核参数、看授权定商用、挑框架做部署。这个资料库还在持续更新,以后遇到新需求,先回表里查一遍有没有现成的开源模型,能帮你省下不少重复造轮子的时间。

【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 23:21:42

10分钟看会Hindsight记忆可视化

10分钟看会Hindsight记忆可视化 【免费下载链接】hindsight Hindsight: Agent Memory That Learns 项目地址: https://gitcode.com/GitHub_Trending/hindsight2/hindsight Hindsight 自带控制面板,用 Constellation 星座图、Tree 知识页和记忆表格三个视图&a…

作者头像 李华