这一篇在干嘛?
Luo 等,Efficient Deep Learning Infrastructures for Embedded Computing Systems: A Comprehensive Survey and Future Envision,ACM TECS 2024,100 页、651 篇参考文献。 这是目前覆盖最完整的端侧(on-device)高效深度学习综述之一:从手工轻量网络、自动化网络设计(NAS),到网络压缩、端侧学习与端侧大模型,再到框架与实际应用,一条线讲完”怎么让深度学习在资源受限的嵌入式设备上跑起来”。 中文精讲拆成 5 篇,建议按顺序读。
📑 全 5 篇
-
① 概述与手工网络设计 —— 计算鸿沟有多大、手工轻量化的核心招式(1×1 卷积 / 群卷积 / 深度卷积 / 空洞卷积 / Ghost 卷积),以及为什么”FLOPs 少 ≠ 跑得快”。
-
② 自动化网络设计 NAS —— 搜索空间怎么设计、搜索策略(强化学习 / 进化算法 / 可微分 DARTS / 一次性 One-Shot)各自的套路与代价,以及让 NAS 真正跑得起的加速技术。
-
③ 网络压缩:剪枝、量化、蒸馏 —— 剪枝剪什么、非结构化剪枝为什么在通用硬件上不省时间;量化把浮点换成整数到底怎么算、PTQ 与 QAT 差在哪;蒸馏让学生学老师的什么。
-
④ 端侧学习与端侧大模型 —— 训练为什么比推理更难搬上端侧、持续学习 / 迁移学习 / 联邦学习各自的取舍;以及大语言模型上端的三条路:高效架构、压缩、系统优化。
-
⑤ 框架、应用与未来展望 —— 端侧软件框架(TFLite / MNN / NCNN / TVM 等)与硬件加速器生态,计算机视觉与 NLP 的落地形态,以及作者对未来的判断。
🧭 可以按自己的需求挑着读
只想让模型跑得动 ① → ③
想自动搜网络结构 ① → ②
要做端侧训练/联邦学习 ③ → ④
关心大模型上设备 ④
要落地到产品 ⑤读之前先记住一个判据
端侧优化的所有手段,本质上都是在精度、延迟、能耗、内存占用这四者之间做交换。 看任何一篇论文时先问一句”它拿什么换了什么”,就不会被各种漂亮的数字带偏。