vLLM 工作坊

从单点加速到系统最优:大模型推理的全栈优化实践

具体日期、时间与会场确认后将在此补充。

活动简介

本工作坊结合混元大模型推理与 GPU 研发实践,介绍以服务目标为导向的全栈优化方法。从目标与瓶颈分析、算子级优化延伸到计算、访存、通信和调度协同,重点讨论如何权衡并行策略、显存开销、吞吐、延迟与模型质量,将局部加速转化为可验证的端到端收益。