MLOps & LLMOps 工程与部署
本章节涵盖大语言模型的本地私有化部署、生产级推理加速与模型量化压缩。面向小白拆分为 3 篇教程:
- 1. Ollama 与本地大模型私有化部署:大模型界的 Docker,一键部署与兼容 API 调用。
- 2. vLLM 推理加速与高并发服务:PagedAttention 虚拟内存管理与高吞吐 HTTP 服务。
- 3. 模型量化 (GGUF/AWQ) 与服务监控:从 FP16 到 INT4 压缩与 TTFT/TPS 监控指标。
本章节涵盖大语言模型的本地私有化部署、生产级推理加速与模型量化压缩。面向小白拆分为 3 篇教程: