news 2026/10/7 16:56:45

day49

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
day49

@浙大疏锦行

1. 预训练的概念
核心定义:先在大规模通用数据集上训练一个基础模型(学习通用特征,如边缘、纹理、形状),再将这个模型的参数迁移到目标任务中,进行微调(Fine-tuning)或直接使用。
本质:利用 “通用数据的特征迁移”,解决目标任务数据量少、训练成本高的问题,是迁移学习的核心方式之一。
作用:大幅降低目标任务的训练时间;提升小数据集任务的模型性能;避免从零训练模型的过拟合风险。

2.经典的预训练模型

3.预训练的策略
(1)冻结预训练层(仅微调头部):
操作:冻结预训练模型的大部分层(仅保留参数不更新),只修改模型的 “分类头”,仅训练分类头。
适用场景:目标任务数据量少、预训练模型特征足够通用。
(2)全量微调(Fine-tuning):
操作:解冻预训练模型的部分 / 全部层,让所有层的参数随目标任务更新。
适用场景:目标任务数据量充足,需要模型适配任务的专属特征。
(3)特征提取(Feature Extraction):
操作:直接用预训练模型的输出作为目标任务的特征,不更新预训练模型参数,仅训练新的分类器。
适用场景:目标任务与预训练任务高度相似,预训练特征可直接复用。

用预训练 ResNet18 完成 CIFAR10 分类

在CIFAR10 对比不同预训练模型(以 MobileNetV2 为例)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/7 5:45:58

Qwen2.5-7B数学能力提升:解题步骤生成实战教程

Qwen2.5-7B数学能力提升:解题步骤生成实战教程 1. 引言:为什么需要大模型来解决数学问题? 1.1 数学推理的挑战与AI的突破 传统上,数学问题求解依赖于精确的逻辑推导和符号运算,这对机器提出了极高的语义理解与结构化…

作者头像 李华
网站建设 2026/10/7 5:46:28

Qwen2.5-7B与Mixtral对比:稀疏模型vs密集模型部署效率分析

Qwen2.5-7B与Mixtral对比:稀疏模型vs密集模型部署效率分析 1. 背景与选型动机 随着大语言模型(LLM)在实际业务场景中的广泛应用,模型部署的推理效率、显存占用和吞吐能力成为工程落地的关键瓶颈。当前主流的大模型架构中&#xf…

作者头像 李华
网站建设 2026/10/7 5:47:10

Qwen2.5-7B快速上手指南:新手开发者部署入门必看

Qwen2.5-7B快速上手指南:新手开发者部署入门必看 1. 引言:为什么选择Qwen2.5-7B? 1.1 大模型时代的新选择 随着大语言模型(LLM)在自然语言理解、代码生成、多轮对话等场景的广泛应用,越来越多开发者希望快…

作者头像 李华
网站建设 2026/10/7 5:47:28

Qwen2.5-7B游戏NPC对话系统:角色扮演部署实战教程

Qwen2.5-7B游戏NPC对话系统:角色扮演部署实战教程 在现代游戏开发中,智能NPC(非玩家角色)已成为提升沉浸感和交互体验的关键要素。传统脚本式对话已难以满足玩家对自然、动态、个性化互动的需求。随着大语言模型技术的成熟&#…

作者头像 李华
网站建设 2026/10/7 5:48:10

Qwen2.5-7B物流行业案例:运单信息提取系统部署实操

Qwen2.5-7B物流行业案例:运单信息提取系统部署实操 1. 引言:大模型在物流行业的落地需求 1.1 物流行业数字化转型的痛点 随着电商和跨境物流的快速发展,每日产生的运单数据呈指数级增长。传统的人工录入方式不仅效率低下,还容易…

作者头像 李华
网站建设 2026/10/7 3:05:21

Qwen2.5-7B客服系统:意图识别与多轮对话优化

Qwen2.5-7B客服系统:意图识别与多轮对话优化 1. 背景与技术选型 在智能客服系统的构建中,意图识别和多轮对话管理是决定用户体验的核心环节。传统基于规则或小模型的方案在语义理解深度、上下文连贯性和响应灵活性方面存在明显瓶颈。随着大语言模型&…

作者头像 李华