导读:很多同学学深度学习,第一步就卡死在"没有 GPU"。本文记录我的真实搭建全过程:torch CPU 版能干什么、什么必须上云 GPU、AutoDL 怎么用"无卡模式"把成本压到几十块——以及一份让"本机/云端"环境一致的锁版本经验。
一、我的处境:本机真的没有 GPU
- 上班/在校环境:机器没有 NVIDIA 独显(
nvidia-smi直接不存在,torch 只能装 CPU 版); - 白天没法碰大计算,只有晚上和周末的时间窗口。
结论先说:没有 GPU 也能学深度学习——写代码、调 demo、跑小模型、验证思路全在本机 CPU 搞定;训练大模型和 TensorRT 才需要上云。别让"没卡"成为不开始的借口。
二、方案 A:本机 CPU——能做什么、不能做什么
安装:Python 3.12 +torchCPU 版 +opencv-python / scikit-image / torchvision / matplotlib / numpy等,一份requirements.txt(约 110 个包)锁死版本。
实测能跑:
- 完整训练链路验证:CIFAR-10 上的 SmallCNN,约61% 准确率、18s/epoch——全流程(数据→训练→评估)畅通;
- 图像处理/算法原型开发(OpenCV/skimage 全在 CPU 上飞快);
- ONNX 导出与 CPU 推理;
- 推理/评测脚本(我写的融合 10 指标评测脚本 CPU 完全够跑)。
跑不了:
- 大模型训练(ResNet 级都要等很久);
- TensorRT——它是 NVIDIA 的加速推理框架,必须有 NVIDIA GPU。
三、方案 B:AutoDL 云 GPU——怎么把成本压到几十块
省钱核心:无卡模式(~0.1 元/时)
所有"不烧算力"的活——传代码、装环境、下载数据——都先在无卡模式下做完,再切 GPU 计费跑训练。这一步能省掉 95% 的云费用。
推荐配置(2026 行情,以官网为准)
| GPU | 显存 | 大致价格 | 适合 |
|---|---|---|---|
| 无卡模式 | — | ~0.1 元/时 | 传代码/装环境/下载数据 |
| RTX 3090 | 24G | ~1.5-2 元/时 | 性价比首选(小模型绰绰有余) |
| RTX 4090 | 24G | ~2.5-3.5 元/时 | 更快,训练时间减半 |
租赁流程(7 步)
- 注册 autodl.com(手机号 + 实名);
- 充值 100 元(用不完可退);
- 创建实例:3090 + 镜像「PyTorch 2.x + Python 3.10 + CUDA 12.1」;
- 无卡模式开机:上传代码、装依赖(requirements_cloud.txt)、下载数据集(有学术加速);
- 切计费模式开跑训练;
- 训练挂后台(
nohup python train.py &); - 跑完立即关机——不跑就关,按量计费。
预算参考:9 月任务打包一次租(TensorRT demo + 几版模型训练,约 20-40 GPU 小时),总花费50-150 元。
四、双方案分工表
| 任务 | 放哪跑 |
|---|---|
| 写代码、调试、改 bug | 本机 CPU |
| 数据下载、预处理 | AutoDL 无卡模式(学术加速) |
| 小模型验证(CIFAR 级) | 本机 CPU |
| 正式训练 | AutoDL 3090/4090 |
| TensorRT 部署 | AutoDL(需 NVIDIA GPU) |
| 评测/指标计算 | 本机 CPU |
五、环境一致性经验(重要)
本机一套requirements.txt(110 包),云端一套requirements_cloud.txt(108 包,不含 torch——因为云镜像自带 CUDA 版 torch,装了反而冲突)。
两份锁版清单保证「本机能跑 → 云上也能跑」,避免最常见的"本机好好的,一上云就炸"。
结尾
我的下一步:在云 GPU 上复现 DenseFuse 训练 + 跑通 TensorRT demo,然后统一评测——欢迎关注,后续会把踩坑和结果继续写成文章。
环境:Python 3.12 / torch CPU 版(本机);AutoDL(云 GPU)。本文所有软件配置均可用公开渠道复现。