端侧大模型推理
端侧大模型推理研究如何在手机、IoT、嵌入式等资源受限设备上部署和加速大语言模型。核心技术包括模型压缩(量化、剪枝、知识蒸馏、低秩分解)、KV Cache 优化(分页、压缩、驱逐)、推理框架优化(kernel fusion、算子融合)、软硬件协同设计(MoE+Speculative Decoding、Block-Diffusion)。端侧推理瓶颈已从算力转向内存带宽与热墙,ALEM/ALPE 评估框架统一衡量 Accuracy/Latency/Energy/Memory。
研学进度
标记你在该领域的研学阶段,大轮廓记录即可。
领域资源
期刊
- ACM Computing Surveys → (ACM)
- IEEE Transactions on Computers → (IEEE)
学会/组织
- MLCommons → (MLCommons)
- Apache Software Foundation (TVM/Relay) → (Apache)
综述/资源库
- arXiv: Computation and Language (cs.CL) → (arXiv)
- MLSys Conference → (MLSys)
近期学术动态
来源:: arXivAtindra Jha, Margaret Li, Jure Leskovec, Percy Liang, Luke Zettlemoyer · 2026-09-10
As the supply of human-written text is exhausted, it has become standard practice to repeat language model training data. Prior work has studied data repetition for densely activated Transformers, but the effects of data repetition remains largely unexplored for recently dominant sparse architecture...
Daniel Henrik Nevermann, Claudius Gros · 2026-09-10
Out-of-distribution length generalization, namely to extrapolate a task from short to longer context, has been studied intensively for transformers. Here we focus on distance generalization, which probes performance when inter-token distances are changed between training and inference, while keeping...
Yunfei Ge, Anbang Liu, Qineng Wang, Johnalbert Garnica, Jianwen Lyu · 2026-09-10
Spatial reasoning depends not only on metric properties such as distance, angle, and shape, but also on topological relations that remain invariant under continuous deformation. Cognitive science identifies these relations as foundational to spatial understanding, yet foundation-model evaluations la...
Yingzhi Wang, Reem Alhazzani, Muhammad Alqurishi · 2026-09-10
As Speech Large Language Models (speech-LLMs) become increasingly multilingual, Arabic remains significantly underrepresented, highlighting the need for dedicated infrastructure to train and evaluate Arabic speech-LLMs. To address this gap, we introduce Nuha-Speech, a comprehensive initiative to d...
Varun Teja Chundru, Debasmita Biswas · 2026-09-10
Large language models generate fluent text that can contain unfaithful claims -- a phenomenon known as hallucination. We present a multi-signal detection pipeline combining fine-tuned DeBERTa-v3 classification, Monte Carlo (MC) Dropout uncertainty quantification, and temperature-scaled calibration f...
以上论文由 arXiv API 自动抓取,仅供参考。数据定期更新。
全球最好的大学项目
加州大学伯克利分校
加州大学伯克利分校·电子工程与计算机科学系·端侧大模型推理方向
美国 · 博士
UC Berkeley 在 ML 系统领域拥有世界顶尖的研究实力,Joseph Gonzalez 和 Ion Stoica 教授领导的团队在高效 LLM 推理与服务系统方面持续产出突破性成果,从 Checkmate 内存优化到 MoE-Lightning 资源受限推理,为端侧和边缘大模型部署提供了系统级解决方案。
剑桥大学
剑桥大学·计算机科学与技术系·端侧大模型推理方向
英国 · 博士
剑桥大学在端侧机器学习系统领域拥有独特的研究实力,Nic Lane 教授领导的 CaMLSys 实验室专注于设备端与云端协同的高效 ML 系统,Cecilia Mascolo 教授的移动系统研究则为端侧设备上的学习与推理提供了系统级支撑。
卡内基梅隆大学
卡内基梅隆大学·计算机科学系·端侧大模型推理方向
美国 · 博士
CMU 在端侧计算与边缘智能领域拥有深厚传统,从 Mahadev Satyanarayanan 提出的 Cloudlet 边缘计算范式到 Virginia Smith 在联邦学习与高效机器学习系统方面的前沿工作,形成了从系统架构到算法优化的完整研究链条,是端侧大模型推理研究的重要阵地。
苏黎世联邦理工学院
苏黎世联邦理工学院·计算机科学系·端侧大模型推理方向
瑞士 · 博士
ETH Zurich 在高效 AI 计算领域横跨从极端边缘到大规模推理的全谱系研究,Torsten Hoefler 教授的 SPCL 实验室在 LLM 量化推理(QUIK、MARLIN)方面处于前沿,Luca Benini 教授的 PULP 开源平台则为 IoT 端节点的超低功耗 AI 加速提供了硬件基础。
韩国科学技术院
韩国科学技术院·电气工程学院·端侧大模型推理方向
韩国 · 博士
KAIST 在端侧 AI 硬件与系统领域拥有世界级研究实力,Minsoo Rhu 教授的 VIA 研究组在 LLM 推理架构与 KV Cache 量化方面处于前沿,Jongse Park 教授的 CASYS 实验室则专注于端侧 AI 系统、存内计算加速和 AI 编译器框架,为端侧大模型推理提供了从芯片到系统的全栈方案。
麻省理工学院
麻省理工学院·电子工程与计算机科学系·端侧大模型推理方向
美国 · 博士
MIT 在高效 AI 计算领域处于全球领先地位,Song Han 教授开创的深度压缩(Deep Compression)和模型量化技术(AWQ、SmoothQuant、QServe)已成为端侧大模型推理的核心方法,Vivienne Sze 教授在软硬件协同设计方面的工作为在智能手机和微型机器人上部署 AI 提供了关键基础。
新加坡国立大学
新加坡国立大学·计算机学院·端侧大模型推理方向
新加坡 · 博士
新加坡国立大学在高效 AI 系统与边缘智能领域拥有显著研究实力,Bingsheng He 教授在 GPU/FPGA 加速和大规模 ML 系统优化方面的工作为端侧推理提供了系统级方案,Ooi Wei Tsang 教授在边缘 AI 与学习延迟决策方面的研究则探索了端侧与云端模型协同的新范式。
斯坦福大学
斯坦福大学·计算机科学系·端侧大模型推理方向
美国 · 博士
斯坦福大学在 AI 系统与高效机器学习推理方面拥有世界级研究实力,Christopher Ré 教授的 ThunderKittens AI 内核框架和 Intelligence per Watt 效率度量工作,以及 Matei Zaharia 教授在 ML 系统基础设施方面的贡献,为端侧大模型推理提供了从底层内核到上层系统的全栈技术支撑。
多伦多大学
多伦多大学·电子与计算机工程系·端侧大模型推理方向
加拿大 · 博士
多伦多大学在边缘 AI 硬件与高效 ML 系统领域拥有独特优势,Xilin Liu 教授在边缘 AI 芯片设计方面的研究为端侧深度学习提供了硬件基础,Nandita Vijaykumar 教授的 embARC 研究组则从跨栈协同设计角度构建高效可编程的视觉计算与生成式 AI 推理系统。
华盛顿大学
华盛顿大学·保罗·艾伦计算机科学与工程学院·端侧大模型推理方向
美国 · 博士
华盛顿大学在 ML 系统与计算机架构交叉领域拥有卓越研究实力,Luis Ceze 教授联合创建的 Apache TVM 深度学习编译栈是端侧 AI 部署的核心工具链之一,Mark Oskin 教授在开源硬件与近似计算方面的工作为资源受限设备上的高效推理提供了架构基础。
发现信息有误? 提交纠错