Make LLM Efficient Again!

BJTU Edge Computing & Edge Intelligence Group · 端侧大模型部署与推理优化

本课题组致力于大模型在端侧设备上的高效部署与推理优化, 围绕 LLM 推理效率瓶颈,从算法、系统、硬件三个层面开展研究。 当前重点方向包括:

Token Optimization Speculative Decoding Distributed Inference LLM Routing
Token Optimization

token 的生成与传输是 LLM 推理的核心瓶颈之一。我们通过 token 剪枝、动态上下文压缩、KV cache 量化等技术,降低每轮交互的 token 开销,提升端侧设备的响应速度。

降低 token 开销 · 适配边缘算力
Speculative Decoding

传统自回归解码串行生成,难以充分利用边缘设备的并行算力。我们以小模型草稿先行推测、大模型并行验证,在保证生成质量的同时显著提升推理吞吐量和响应速度。

以草稿推测代替串行生成 · 提升并行效率
Distributed Inference

单一边缘设备算力有限,难以独立运行完整大模型。我们研究跨设备模型切分与协同推理,将任务分解到多个边缘节点并行执行,在资源受限集群上实现高效部署和推理。

跨节点协同推理 · 突破单设备算力天花板
LLM Routing

端侧环境中,任务复杂度和设备状态差异显著。我们研究智能路由分发策略,根据输入任务特性与各节点负载情况,动态调度请求至最优模型或推理端点,平衡服务质量与资源效率。

动态路由调度 · 平衡质量与效率

技术栈与硬件平台

平台 NVIDIA Jetson Orin Raspberry Pi 5 Android Phone Windows Laptop Edge Server
工具 Ollama vLLM TensorRT-LLM ONNX Runtime llama.cpp PyTorch Mobile TensorFlow Lite
格式 GGUF GPTQ AWQ ONNX Safetensors BitsandBytes
模型 Llama 3 DeepSeek-R1 Gemma 2 Qwen 2.5 Phi-3 Mistral Yi-34B

联系我们

欢迎对大模型端侧部署、推理优化、边缘智能感兴趣的同学与我们联系。

Learn More →