🔥

我花 300 块租了张显卡,把大模型部署踩了 8 个坑

备课「AI 基础设施运维」这块,我不想纸上谈兵,自己花 300 块按量租了张显卡,从开机到把一个开源大模型跑起来对外提供服务,全程踩坑记录如下。300 块买这些教训,值。

坑 1:显存先算账,后开机

7B 模型半精度,光权重就 14GB,我第一台租的是 16GB 显存的卡——权重加上 KV Cache 直接爆。租卡之前先算:权重大小 + 推理时的缓存开销,留 20% 余量。

坑 2:驱动和 CUDA 版本错配

镜像里 CUDA 12.4,推理框架要 12.1+,启动就报符号找不到。教训:先定框架版本,再选镜像,别反过来。

坑 3:模型下载慢到怀疑人生

官方源拉 14GB 权重,龟速。换国内镜像源,40 分钟变 4 分钟。这条不值钱,但新手真会在这干等一晚上。

坑 4:vLLM 启动参数抄不得

vllm serve Qwen2.5-7B-Instruct --max-model-len 4096 --gpu-memory-utilization 0.85

--max-model-len 不设,默认拉满上下文,显存直接打爆;设太小,长文本被截断。每个参数都要知道它动了什么,这是运维和「会跑 Demo」的分水岭。

坑 5:服务起来了,外面访问不到

端口监听了,防火墙没放;防火墙放了,云平台安全组没开。三层各管各的。排查口诀:进程 → 本机防火墙 → 平台安全组,一层层来。

坑 6:并发一上来,延迟炸了

单请求飞快,十个并发排队到天荒地老。这才理解为什么生产上要谈吞吐、批处理、量化——「能跑」和「能用」之间隔着整个运维岗。

坑 7:忘关机,账单教我做人

按量付费,测试完没释放,睡一觉两杯咖啡钱没了。现在我所有实验环境都设定时自动释放。这习惯在任何云上都值钱。

坑 8:没有监控,出问题全靠感觉

第二次部署我加了 GPU 监控:显存占用、利用率、温度。看着曲线才知道瓶颈在显存带宽不在算力。没有监控的运维是盲人摸象,GPU 集群上这句话放大十倍。

为什么说这些坑值钱

这 8 个坑,对应的全是真实岗位能力:容量规划、环境管理、网络排查、性能压测、成本控制、监控告警。传统运维的那套方法论,在 AI 基础设施上一个不少,只是对象从 CPU 服务器换成了 GPU 集群

这也是为什么我说:AI 不会取代运维,但会取代不懂 GPU 的运维。下一篇展开讲这句话。

🗺️
领《零基础转运维完整路线图》

高清版 + 每阶段时间表 + 检验清单。加微信回复「路线图」免费领。

免费获取

📖 相关阅读