边缘与设备端推理:LLM 走到终端
直觉版:让大模型跑在手机上
Section titled “直觉版:让大模型跑在手机上”云端 LLM 需要联网、有延迟、可能泄露隐私。能不能让模型直接跑在你的手机、平板甚至手表上?这就是设备端推理(On-device Inference)的目标。
直觉上,手机芯片比数据中心 GPU 弱得多,但通过模型压缩(让模型更小)和推理优化(让计算更高效),现在 70 亿参数的模型已经能在手机上流畅运行。就像把一座图书馆的精华浓缩成一本口袋书——信息密度还在,体积却小得多。
工程版:内存、功耗与延迟的三难困境
Section titled “工程版:内存、功耗与延迟的三难困境”设备端推理的核心约束不是算力,而是内存和功耗:
- 内存瓶颈:手机 RAM 通常 8-16GB,模型权重就占几 GB,加上 KV Cache 很快溢出。
- 功耗限制:持续推理会快速消耗电池并导致设备发热。
- 延迟要求:用户期望交互式响应(100ms 以内),但设备算力有限。
关键技术路径:
- 极致量化:从 INT8 到 INT4 甚至更低比特。Apple 的 “LLM in a flash” 用分层加载,只把当前需要的层放进内存。
- 混合专家(MoE)路由优化:MoE 模型每次只激活部分专家,但路由决策本身有开销。TailorLLM(EuroSys 2026)用低秩适配在端云之间协作推理。
- 移动 NPU 利用:智能手机的 NPU(Neural Processing Unit)专为矩阵运算设计。Scaling LLM Test-Time Compute with Mobile NPU(EuroSys 2026)探索了在移动 NPU 上做 test-time 计算扩展。
- 联邦微调:在设备上本地微调小型 LoRA 适配器,保护隐私的同时个性化模型。
- no_std 嵌入式:Ratatui v0.30.0 等库开始支持 no_std,让 TUI 应用也能跑在微控制器上——LLM 推理的嵌入式化也在同步推进。
研究版:从云端下沉到端侧的系统挑战
Section titled “研究版:从云端下沉到端侧的系统挑战”研究层面的核心问题是:如何在资源受限设备上实现接近云端的推理质量?
2026 年关键突破:
- Sereno(OSDI 2026):驯服移动 LLM 推理中的内存带宽争用,通过核心调度优化减少 NPU/GPU 之间的内存竞争。
- OpenJarvis(Stanford):个人 AI 在本地设备上运行,LLM 引导的 spec 搜索 + 本地-云端协作,隐私与能力的平衡。
- TZ-LLM(EuroSys 2026):用 Arm TrustZone 保护设备端大语言模型,解决模型权重被盗取的风险。
- IntAttention(MLSys 2026):全整数注意力流水线,消除浮点运算,大幅降低边缘设备功耗。
开放问题:
- 端侧推理的安全模型:模型权重是知识产权,如何防止提取攻击?
- 端云协作的最优分界点:哪些计算该在本地做、哪些该上云?
- 当每个设备都运行自己的 LLM,如何管理和更新这些模型?
🔬 开放研究问题
该领域的关键问题与研究方向:
- 端侧 LLM 的推理质量与云端差距有多大?在哪些任务上端侧已经足够?
- MoE 模型在移动设备上的路由开销能否通过硬件-软件协同设计消除?
- 联邦微调中的梯度泄漏风险如何量化?现有隐私保护方案(DP-SGD、安全聚合)的实用性边界在哪里?