機器學習安全

機器學習安全研究如何確保AI系統在能力增強時保持可控、可靠和可解釋。核心議題包括可擴展對齊、強化學習人類反饋(RLHF)、機械可解釋性、獎勵欺騙、對抗魯棒性等。該領域是AI對齊研究的技術核心,直接面向高級AI系統的工程化安全挑戰。

研學進度

標記你在該領域的研學階段,大輪廓記錄即可。

领域资源

学会/组织

综述/资源库

近期學術動態

來源:: arXiv
#1
Recent advances in the field

Author A, Author B · 2026-08-15

This paper presents recent developments and open problems in the field, with new results on key conjectures.

#2
A unified framework for classical problems

Researcher C, Researcher D · 2026-07-22

We introduce a novel approach that unifies several classical results, providing new insights into long-standing questions.

以上論文由 arXiv API 自動抓取,僅供參考。數據定期更新。

全球最好的大学项目

#1

加州大學伯克利分校

Center for Human-Compatible AI (CHAI)

美國 · PhD/Postdoc

CHAI是AI對齊領域最具影響力的學術研究中心之一,由Stuart Russell創立,致力於研究如何確保AI系統目標與人類意圖保持一致。中心聚焦逆向強化學習(IRL)、協作式人類-AI交互、可擴展對齊等核心議題,是AI安全學術研究的重要發源地。

#2

劍橋大學

Leverhulme Centre for the Future of Intelligence (LCFI) / AI Safety Research

英國 · PhD/Postdoc

劍橋大學Leverhulme Centre for the Future of Intelligence是歐洲AI安全研究的核心學術中心,聚焦AI安全的技術與哲學交叉研究。中心整合計算機科學、哲學、心理學等多學科力量,研究AI對齊中的價值觀學習、不確定性建模與長期安全議題。

#3

卡內基梅隆大學

Machine Learning Department - AI Safety & Robustness Research

美國 · PhD/Postdoc

CMU機器學習系是全球首個獨立的ML系,在AI安全與魯棒性研究方面有深厚積累。研究方向涵蓋對抗魯棒性、分佈外泛化、可信ML系統、安全強化學習等,為AI對齊提供從理論分析到系統實現的完整研究鏈條。

#4

麻省理工學院

Computer Science and Artificial Intelligence Laboratory (CSAIL) - AI Safety Group

美國 · PhD/Postdoc

MIT CSAIL是全球最大的AI研究實驗室之一,其AI安全研究方向涵蓋機械可解釋性、對抗魯棒性、可信AI系統設計。依託MIT在理論與系統方面的深厚積累,CSAIL為AI對齊提供從數學基礎到工程實現的完整研究鏈條。

#5

斯坦福大學

Center for Research on Foundation Models (CRFM) / Stanford AI Lab

美國 · PhD/Postdoc

斯坦福CRFM是基礎模型研究的核心學術中心,研究大語言模型的安全對齊、評估與治理。依託斯坦福AI Lab (SAIL)的深厚積累,中心在RLHF、模型評估、安全基準測試等方向產出大量影響力研究,是AI安全學術與產業交叉的重要樞紐。

发现信息有误? 提交纠错