机器学习安全

机器学习安全研究如何确保AI系统在能力增强时保持可控、可靠和可解释。核心议题包括可扩展对齐、强化学习人类反馈(RLHF)、机械可解释性、奖励欺骗、对抗鲁棒性等。该领域是AI对齐研究的技术核心,直接面向高级AI系统的工程化安全挑战。

研学进度

标记你在该领域的研学阶段,大轮廓记录即可。

领域资源

学会/组织

综述/资源库

近期学术动态

来源:: arXiv
#1
Recent advances in the field

Author A, Author B · 2026-08-15

This paper presents recent developments and open problems in the field, with new results on key conjectures.

#2
A unified framework for classical problems

Researcher C, Researcher D · 2026-07-22

We introduce a novel approach that unifies several classical results, providing new insights into long-standing questions.

以上论文由 arXiv API 自动抓取,仅供参考。数据定期更新。

全球最好的大学项目

#1

加州大学伯克利分校

Center for Human-Compatible AI (CHAI)

美国 · PhD/Postdoc

CHAI是AI对齐领域最具影响力的学术研究中心之一,由Stuart Russell创立,致力于研究如何确保AI系统目标与人类意图保持一致。中心聚焦逆向强化学习(IRL)、协作式人类-AI交互、可扩展对齐等核心议题,是AI安全学术研究的重要发源地。

#2

剑桥大学

Leverhulme Centre for the Future of Intelligence (LCFI) / AI Safety Research

英国 · PhD/Postdoc

剑桥大学Leverhulme Centre for the Future of Intelligence是欧洲AI安全研究的核心学术中心,聚焦AI安全的技术与哲学交叉研究。中心整合计算机科学、哲学、心理学等多学科力量,研究AI对齐中的价值观学习、不确定性建模与长期安全议题。

#3

卡内基梅隆大学

Machine Learning Department - AI Safety & Robustness Research

美国 · PhD/Postdoc

CMU机器学习系是全球首个独立的ML系,在AI安全与鲁棒性研究方面有深厚积累。研究方向涵盖对抗鲁棒性、分布外泛化、可信ML系统、安全强化学习等,为AI对齐提供从理论分析到系统实现的完整研究链条。

#4

麻省理工学院

Computer Science and Artificial Intelligence Laboratory (CSAIL) - AI Safety Group

美国 · PhD/Postdoc

MIT CSAIL是全球最大的AI研究实验室之一,其AI安全研究方向涵盖机械可解释性、对抗鲁棒性、可信AI系统设计。依托MIT在理论与系统方面的深厚积累,CSAIL为AI对齐提供从数学基础到工程实现的完整研究链条。

#5

斯坦福大学

Center for Research on Foundation Models (CRFM) / Stanford AI Lab

美国 · PhD/Postdoc

斯坦福CRFM是基础模型研究的核心学术中心,研究大语言模型的安全对齐、评估与治理。依托斯坦福AI Lab (SAIL)的深厚积累,中心在RLHF、模型评估、安全基准测试等方向产出大量影响力研究,是AI安全学术与产业交叉的重要枢纽。

发现信息有误? 提交纠错