机器学习安全
机器学习安全研究如何确保AI系统在能力增强时保持可控、可靠和可解释。核心议题包括可扩展对齐、强化学习人类反馈(RLHF)、机械可解释性、奖励欺骗、对抗鲁棒性等。该领域是AI对齐研究的技术核心,直接面向高级AI系统的工程化安全挑战。
研学进度
标记你在该领域的研学阶段,大轮廓记录即可。
领域资源
期刊
- AI Safety (arXiv) → (arXiv)
- Machine Learning (Springer) → (Springer)
学会/组织
- Partnership on AI → (Partnership on AI 官网)
- Center for AI Safety → (Center for AI Safety 官网)
综述/资源库
- AI Alignment Forum → (Alignment Forum)
- LessWrong - AI Safety → (LessWrong)
近期学术动态
来源:: arXivAuthor A, Author B · 2026-08-15
This paper presents recent developments and open problems in the field, with new results on key conjectures.
Researcher C, Researcher D · 2026-07-22
We introduce a novel approach that unifies several classical results, providing new insights into long-standing questions.
以上论文由 arXiv API 自动抓取,仅供参考。数据定期更新。
全球最好的大学项目
加州大学伯克利分校
Center for Human-Compatible AI (CHAI)
美国 · PhD/Postdoc
CHAI是AI对齐领域最具影响力的学术研究中心之一,由Stuart Russell创立,致力于研究如何确保AI系统目标与人类意图保持一致。中心聚焦逆向强化学习(IRL)、协作式人类-AI交互、可扩展对齐等核心议题,是AI安全学术研究的重要发源地。
剑桥大学
Leverhulme Centre for the Future of Intelligence (LCFI) / AI Safety Research
英国 · PhD/Postdoc
剑桥大学Leverhulme Centre for the Future of Intelligence是欧洲AI安全研究的核心学术中心,聚焦AI安全的技术与哲学交叉研究。中心整合计算机科学、哲学、心理学等多学科力量,研究AI对齐中的价值观学习、不确定性建模与长期安全议题。
卡内基梅隆大学
Machine Learning Department - AI Safety & Robustness Research
美国 · PhD/Postdoc
CMU机器学习系是全球首个独立的ML系,在AI安全与鲁棒性研究方面有深厚积累。研究方向涵盖对抗鲁棒性、分布外泛化、可信ML系统、安全强化学习等,为AI对齐提供从理论分析到系统实现的完整研究链条。
麻省理工学院
Computer Science and Artificial Intelligence Laboratory (CSAIL) - AI Safety Group
美国 · PhD/Postdoc
MIT CSAIL是全球最大的AI研究实验室之一,其AI安全研究方向涵盖机械可解释性、对抗鲁棒性、可信AI系统设计。依托MIT在理论与系统方面的深厚积累,CSAIL为AI对齐提供从数学基础到工程实现的完整研究链条。
斯坦福大学
Center for Research on Foundation Models (CRFM) / Stanford AI Lab
美国 · PhD/Postdoc
斯坦福CRFM是基础模型研究的核心学术中心,研究大语言模型的安全对齐、评估与治理。依托斯坦福AI Lab (SAIL)的深厚积累,中心在RLHF、模型评估、安全基准测试等方向产出大量影响力研究,是AI安全学术与产业交叉的重要枢纽。
发现信息有误? 提交纠错