Make LLM Efficient Again!

北京交通大学系统与网络实验室 (Systems and Networking Laboratory, BJTU) · 端侧大模型部署与推理优化

我们致力于大模型在端侧设备上的高效部署与推理优化, 围绕 LLM 推理效率瓶颈,从算法、系统、硬件三个层面开展研究。 当前重点方向包括:

Token Optimization Speculative Decoding Distributed Inference LLM Routing
Token Optimization

token 的生成与传输是 LLM 推理的核心瓶颈之一。我们通过 token 剪枝、动态上下文压缩、KV cache 量化等技术,降低每轮交互的 token 开销,提升端侧设备的响应速度。

降低 token 开销 · 适配边缘算力
Speculative Decoding

传统自回归解码串行生成,难以充分利用边缘设备的并行算力。我们以小模型草稿先行推测、大模型并行验证,在保证生成质量的同时显著提升推理吞吐量和响应速度。

以草稿推测代替串行生成 · 提升并行效率
Distributed Inference

单一边缘设备算力有限,难以独立运行完整大模型。我们研究跨设备模型切分与协同推理,将任务分解到多个边缘节点并行执行,在资源受限集群上实现高效部署和推理。

跨节点协同推理 · 突破单设备算力天花板
LLM Routing

端侧环境中,任务复杂度和设备状态差异显著。我们研究智能路由分发策略,根据输入任务特性与各节点负载情况,动态调度请求至最优模型或推理端点,平衡服务质量与资源效率。

动态路由调度 · 平衡质量与效率

技术栈与硬件平台

模型层Model Zoo
DeepSeek-V4 Llama 4 Qwen 3 Gemma 3 GLM-4.6 Kimi K2 Phi-4-mini
GGUF · GPTQ · AWQ 量化
引擎层Inference
Ollama vLLM SGLang TensorRT-LLM llama.cpp MLC-LLM ExecuTorch
ONNX · Safetensors · BitsandBytes
硬件层Hardware
NVIDIA Jetson Orin NVIDIA Jetson Thor Raspberry Pi 5 Android Phone Windows Laptop (NPU) Apple Silicon Mac Edge Server

联系我们

欢迎对大模型端侧部署、推理优化、边缘智能感兴趣的同学与我们联系。

Learn More →