加州大學伯克利分校
Center for Human-Compatible AI (CHAI)
美國 · PhD/Postdoc
CHAI是AI對齊領域最具影響力的學術研究中心之一,由Stuart Russell創立,致力於研究如何確保AI系統目標與人類意圖保持一致。中心聚焦逆向強化學習(IRL)、協作式人類-AI交互、可擴展對齊等核心議題,是AI安全學術研究的重要發源地。
学术历史
CHAI成立於2016年,由Stuart Russell聯合多位研究者發起,源於其在《Human Compatible》(2019)中提出的人類兼容AI框架。中心成立前,Russell與Peter Norvig合著的《Artificial Intelligence: A Modern Approach》已將AI安全議題納入主流教材。CHAI的建立標誌著AI對齊從哲學討論進入系統化學術研究階段,其提出的逆向強化學習範式成為對齊研究的核心技術路徑之一。
当前状态
CHAI目前由多位核心教職領導,研究方向涵蓋逆向強化學習、人類反饋學習、AI安全理論基礎、協作機器人等。中心與Anthropic、OpenAI等前沿AI企業保持密切合作,定期發佈技術報告與安全研究論文。設有博士生培養項目,接受計算機科學系與統計系的申請。中心同時參與BAIR (Berkeley AI Research) 聯盟,共享計算資源與跨實驗室合作。
实验室 / 研究中心
Center for Human-Compatible AI
访问页面 →关键人物
Stuart Russell
教授/中心創始人
AI領域泰斗,UC Berkeley計算機科學系教授,著有《Artificial Intelligence: A Modern Approach》(全球最廣泛使用的AI教材)。提出人類兼容AI框架,倡導以不確定性為核心的對齊方法。2019年出版《Human Compatible》系統闡述AI安全願景。
Anca Dragan
副教授
研究人機交互與AI安全,聚焦人類模型構建與價值學習。曾參與OpenAI安全團隊,獲MIT Technology Review 35歲以下創新者稱號。
Dawn Song
教授
計算機安全與AI安全領域專家,研究對抗樣本、模型隱私、聯邦學習安全等。MacArthur天才獎獲得者。
标志性成果
- 提出人類兼容AI框架(Stuart Russell, 2019),系統化定義對齊問題的形式化解決方案
- 逆向強化學習(IRL)的理論基礎與算法發展,為從人類行為中學習價值觀提供技術路徑
- 提出協作式逆強化學習(CIRL),建模人類-AI協作中的價值推斷問題
- 深度強化學習中的獎勵欺騙(reward hacking)系統性分析,揭示RLHF的潛在風險
学术资源
证据
师资
8 位相关教师
知名:Stuart Russell、Anca Dragan、Dawn Song、Pieter Abbeel、Stuart Russell Lab
研究产出
CHAI關聯研究者在NeurIPS、ICML、ICLR等頂會持續發表AI安全與對齊相關論文,近年聚焦RLHF、可擴展對齊與機械可解釋性
就业去向
畢業生進入Anthropic、OpenAI、DeepMind、Google DeepMind等前沿AI安全團隊,或在MIT、Stanford等頂尖大學擔任教職
发现信息有误? 提交纠错