BJTU Edge Computing & Edge Intelligence Group · 端侧大模型部署与推理优化
本课题组致力于大模型在端侧设备上的高效部署与推理优化, 围绕 LLM 推理效率瓶颈,从算法、系统、硬件三个层面开展研究。 当前重点方向包括:
token 的生成与传输是 LLM 推理的核心瓶颈之一。我们通过 token 剪枝、动态上下文压缩、KV cache 量化等技术,降低每轮交互的 token 开销,提升端侧设备的响应速度。
降低 token 开销 · 适配边缘算力传统自回归解码串行生成,难以充分利用边缘设备的并行算力。我们以小模型草稿先行推测、大模型并行验证,在保证生成质量的同时显著提升推理吞吐量和响应速度。
以草稿推测代替串行生成 · 提升并行效率单一边缘设备算力有限,难以独立运行完整大模型。我们研究跨设备模型切分与协同推理,将任务分解到多个边缘节点并行执行,在资源受限集群上实现高效部署和推理。
跨节点协同推理 · 突破单设备算力天花板端侧环境中,任务复杂度和设备状态差异显著。我们研究智能路由分发策略,根据输入任务特性与各节点负载情况,动态调度请求至最优模型或推理端点,平衡服务质量与资源效率。
动态路由调度 · 平衡质量与效率