这次我们使用unsloth框架来微调模型,将模型微调成一个垂直领域的模型
先说问题
This environment is externally managed ╰─> To install Python packages system-wide, try apt install python3-xyz, where xyz is the package you are trying to install.从 Python 3.11 开始,一些 Debian/Ubuntu 系统默认启用保护机制——目的是保护系统级的 Python 环境
这个问题主要是 系统不再允许使用 pip 直接安装全局包
我们需要用虚拟环境安装
sudo apt update sudo apt install python3-venv根目录执行 python3 -m venv .venv然后再根目录会生成一个.venv/ 的文件夹
安装时指定环境目录
.venv/bin/pip3 install 包名 .venv/bin/python3 脚本.py 于是安装就变成了 .venv/bin/pip3 install unsloth也可以使用激活python环境来安装,这样就不用指定目录,但是记得安装完要关闭环境
source .venv/bin/activate pip3 install 包名 python3 脚本.py deactivate安装CPU版PyTorch
官方安装 一般比较慢 pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu 国内镜像安装 pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu -i https://pypi.tuna.tsinghua.edu.cn/simple 如果需要指定特殊版本 pip3 install torch==2.4.0+cpu torchvision==0.19.0+cpu torchaudio==2.4.0 --index-url https://download.pytorch.org/whl/cpu验证CPU安装成功
python3 -c "import torch; print(f'Version: {torch.__version__}'); print(f'CUDA Available: {torch.cuda.is_available()}'); print(f'CUDA Build: {torch.version.cuda}'); x = torch.rand(2,2); print(f'Device: {x.device}')" 大概输出 Version: 2.4.0+cpu CUDA Available: False CUDA Build: None Device: cpu 如果出现的是 PyTorch Version: 2.14.1+cu130 这个cu130意思是CUDA 13.0 的 GPU 加速版本 需要重新安装CPU版本的PyTorch安装unsloth
pip3 install --upgrade pip pip3 install unsloth unsloth_zoo如果设备没有GPU,使用CPU进行微调,则会出现以下问题
raise NotImplementedError("Unsloth cannot find any torch accelerator? You need a GPU.") NotImplementedError: Unsloth cannot find any torch accelerator? You need a GPU.只使用CPU进行微调,需要这样安装unsloth
pip3 install --upgrade pip apt-get update && apt-get install -y git pip3 install "unsloth[colab-new] @ git+https://github.com/unslothai/unsloth.git" -U pip3 install bitsandbytes==0.44.0 --force-reinstall 如果安装不成功,使用以下方法 pip3 install --upgrade pip git clone https://github.com/unslothai/unsloth.git cd unsloth pip3 install ".[colab-new]" --no-deps pip3 install ".[cpu]" pip3 install trl==0.12.2 peft==0.13.2 accelerate==1.2.1 bitsandbytes==0.44.0bitsandbytes在CPU模式下必须使用0.44.2或更低版本
高版本(如0.45+)移除了CPU支持,会导致ImportError: cannot import name 'MatmulLtState'如遇此错,请降级
强制重装 pip3 install bitsandbytes==0.44.0 --force-reinstall如果依然出现这个错误,需要重装CPU版本的PyTorch,说明安装时候是GPU版本
raise NotImplementedError("Unsloth cannot find any torch accelerator? You need a GPU.") NotImplementedError: Unsloth cannot find any torch accelerator? You need a GPU.验证安装成功
python3 -m unsloth能看到版本和欢迎信息就说明核心部分已经就绪
微调
#引入依赖 from unsloth import FastLanguageModel, is_bfloat16_supported from transformers import TrainingArguments from trl import SFTTrainer from datasets import load_dataset #加载模型 max_seq_length = 8192 # 模型处理文本的最大长度 model, tokenizer = FastLanguageModel.from_pretrained( model_name = "ckpts/qwen-1.5b", max_seq_length = max_seq_length, dtype=None, # 自动检测合适的类型 load_in_4bit = True, # device_map="balanced" # 多卡训练时均衡分布模型权重,默认为sequential )垂直领域举例
娱乐运势模型
# 定义训练数据格式化字符串模板 train_prompt_style="""请遵循指令回答用户问题。 在回答之前,请仔细思考问题,并创建一个逻辑连贯的思考过程,以确保回答准确无误。 ### 指令: 你是一位精通八字算命、紫微斗数、风水、易经卦象、塔罗牌占卜、星象、面相手相和运势预测等方面的算命大师。 请回答以下算命问题。 ### 问题: {} ### 回答: <think>{}</think> {} """ # 加载数据集 dataset = load_dataset("data/fortune-telling", split="train") def formatting_data(examples): questions = examples["Question"] cots = examples["Complex_CoT"] responses = examples["Response"] texts = [] for q, c, r in zip(questions, cots, responses): text = train_prompt_style.format(q, c, r) + tokenizer.eos_token texts.append(text) return {"text": texts} dataset = dataset.map(formatting_data, batched=True) 添加 LoRA 权重 model = FastLanguageModel.get_peft_model( model, r = 16, # Rank of the LoRA matrix target_modules = ["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj",], # Layers to apply LoRA to lora_alpha = 16, # LoRA alpha value lora_dropout = 0, # Supports any, but = 0 is optimized,防止过拟合,0 表示不drop任何参数 bias = "none", # Supports any, but = "none" is optimized use_gradient_checkpointing = "unsloth", # True or "unsloth" for very long context random_state = 3407, use_rslora = False, # We support rank stabilized LoRA loftq_config = None, # And LoftQ ) #定义 trainer trainer = SFTTrainer( model = model, tokenizer = tokenizer, train_dataset = dataset, dataset_text_field = "text", max_seq_length = max_seq_length, dataset_num_proc = 2, packing = False, # Can make training 5x faster for short sequences. args = TrainingArguments( per_device_train_batch_size = 2, # 每个GPU上的batch size gradient_accumulation_steps = 4, # 梯度累积步数 warmup_steps = 10, # max_steps = 200, # 最大训练步数 num_train_epochs=3, # 训练轮数 和 max_steps 二选一 learning_rate = 2e-4, # 学习率,默认值是 2.0e-5 fp16 = not is_bfloat16_supported(), bf16 = is_bfloat16_supported(), logging_steps = 2, output_dir = "outputs", optim = "adamw_8bit", seed = 3407, ), ) #开始训练 train_stats = trainer.train() #模型保存 model.save_pretrained("ckpts/lora_model") tokenizer.save_pretrained("ckpts/lora_model") #注:这里只会保存 LoRA 权重,在adapter_config.json会指定原始模型位置Unsloth 会根据加载的模型和设备情况自动选择 GPU 数量。
默认device_map="sequential",只有当单卡显存不够时,才占用其他卡
如果device_map="balanced",会占用所有卡,并均衡分布模型权重
# 模型测试 # 加载模型 model, tokenizer = FastLanguageModel.from_pretrained( model_name = "ckpts/lora_model", max_seq_length = max_seq_length, load_in_4bit = True, ) FastLanguageModel.for_inference(model) question = '1995年七月初十生,今年是2025年,了解未来五年的运势' inputs = tokenizer([prompt_style.format(question)], return_tensors='pt', max_length=max_seq_length).to("cuda") outputs = model.generate(inputs['input_ids'], attention_mask=inputs['attention_mask'], max_length=max_seq_length, use_cache=True) answer = tokenizer.batch_decode(outputs, skip_special_tokens=True)[0] print(answer)如果单卡放不下模型权重,会报错,因为模型权重切分了,但 inputs 并没有切分
这篇文章写的有点复杂,而且由于只是用CPU进行微调,所以在匹配上会出现各种各样的问题
如果大家有任何问题,欢迎留言讨论