系列:《LLM技术全景:从Token到部署》工程实践篇第6篇
承接:第37篇《大模型服务化架构》| 预告:第39篇《本地部署实战(一):Ollama/LM Studio快速入门》
摘要
- 核心问题:服务跑起来只是第一天的事。上线之后,成本为何突然翻倍?模型更新后效果为何悄悄回归?线上幻觉率怎么量化?——没有监控体系,这些问题的答案只有"用户投诉"。
- 主要贡献:给出 LLMOps 的完整实践框架——可观测性三支柱(指标/日志/Trace)、在线评估闭环、成本与延迟监控、版本管理与回滚。
- 阅读收获:
- 理解 LLM 监控与传统 APM 的本质差异:输出非确定、质量难量化、成本与 Token 强绑定;
- 掌握"日志采样 → 离线评估 → 回归检测 → 回滚"的在线评估闭环;
- 拿到一套可落地的监控指标表与告警阈值参考。
一、背景与动机
第 37 篇我们把服务化四支柱(网关、缓存、队列、计量)搭好,系统已经"能跑、能省钱、能计费"。但生产环境的真正考验在第