一、LLM 是什么
LLM(Large Language Model,大语言模型)是基于 Transformer 架构、在海量文本上预训练的超大规模神经网络,通过"预测下一个词"学习语言规律,具备理解、生成、推理等通用语言能力。典型代表:GPT、Claude、GLM、DeepSeek 等。
二、与传统机器学习模型的主要区别
| 维度 | 传统机器学习模型 | LLM |
|---|---|---|
| 架构 | 决策树、SVM、CNN/RNN 等 | Transformer(自注意力机制) |
| 训练方式 | 针对单一任务,用标注数据训练 | 海量无标注文本预训练 + 指令微调 |
| 任务范围 | 专一(一个模型一个任务) | 通用(一个模型多任务) |
| 数据需求 | 需大量标注数据 | 预训练无需标注,微调少量即可 |
| 参数规模 | 通常较小(万~亿级) | 极大(数十亿~万亿级) |
| 使用方式 | 需针对每个任务单独训练 | 零样本/少样本,提示词即可驱动 |
| 输入输出 | 固定格式(如特征向量→标签) | 自然语言输入→自然语言输出 |
| 泛化能力 | 限于训练分布内 | 跨任务、跨领域泛化强 |
| 可解释性 | 相对较高(如树结构可解释) | 较低(黑盒,难追溯推理过程) |
| 部署成本 | 低 | 高(需大量算力) |
| 更新方式 | 重新训练 | 提示词调整 / 微调 / RAG |
三、核心差异详解
1. 通用性 vs 专用性
- 传统 ML:一个模型只做一件事——垃圾邮件分类器只能分类邮件,换任务就得重新训练。
- LLM:一个模型能翻译、写代码、问答、总结——通过提示词切换任务,无需重训。
2. 数据依赖
- 传统 ML:强依赖人工标注数据,标注成本高。
- LLM:预训练用无标注文本,下游任务只需少量示例(few-shot)甚至零示例(zero-shot)。
3. 使用门槛
- 传统 ML:需特征工程、模型选择、调参、训练部署,门槛高。
- LLM:写好提示词即可使用,门槛大幅降低。
4. 推理与涌现
- 传统 ML:能力限于训练时学到的模式,无"涌现"。
- LLM:规模到一定程度后出现推理、规划等涌现能力,能处理训练时未见过的任务。
四、各自适用场景
| 场景 | 推荐方案 |
|---|---|
| 结构化数据分类/回归(如风控、推荐) | 传统 ML(更高效、可解释) |
| 图像/语音等特定领域 | 专用模型(CNN/ASR) |
| 自然语言理解与生成 | LLM |
| 多任务、零样本场景 | LLM |
| 强可解释性要求 | 传统 ML |
| 实时性要求高、资源受限 | 传统 ML(轻量) |
五、总结
传统 ML 是"专才"——一个模型解决一个特定任务,需标注数据、特征工程,高效可解释但通用性弱。
LLM 是"通才"——一个模型应对多种任务,靠预训练获得通用语言能力,提示词驱动、泛化强,但成本高、可解释性弱。
两者并非替代关系,而是互补:结构化数据、强可解释、低延迟场景用传统 ML;自然语言、多任务、零样本场景用 LLM;实际系统中常组合使用(如 LLM 做意图理解 + 传统 ML 做精准预测)。