具体日期、时间与会场确认后将在此补充。
本工作坊介绍 Turbo:在上下文并行大模型推理中,将查询组播和局部注意力结果聚合卸载到可编程交换机。系统通过在线聚合、流水线状态滚动与负载感知聚合树减少网络流量和解码延迟,同时保持模型输出质量。
讲师