具体日期、时间与会场确认后将在此补充。
本工作坊介绍针对冷启动延迟、KV Cache 效率与分布式调度的 vLLM 深度优化,涵盖 GPUDirect RDMA 权重加载、结合高级前缀缓存的无状态推理、I/O 预加载,以及提升并发和 GPU 利用率的事件驱动无等待调度器。
讲师