加州大学伯克利分校
Center for Human-Compatible AI (CHAI)
美国 · PhD/Postdoc
CHAI是AI对齐领域最具影响力的学术研究中心之一,由Stuart Russell创立,致力于研究如何确保AI系统目标与人类意图保持一致。中心聚焦逆向强化学习(IRL)、协作式人类-AI交互、可扩展对齐等核心议题,是AI安全学术研究的重要发源地。
学术历史
CHAI成立于2016年,由Stuart Russell联合多位研究者发起,源于其在《Human Compatible》(2019)中提出的人类兼容AI框架。中心成立前,Russell与Peter Norvig合著的《Artificial Intelligence: A Modern Approach》已将AI安全议题纳入主流教材。CHAI的建立标志着AI对齐从哲学讨论进入系统化学术研究阶段,其提出的逆向强化学习范式成为对齐研究的核心技术路径之一。
当前状态
CHAI目前由多位核心教职领导,研究方向涵盖逆向强化学习、人类反馈学习、AI安全理论基础、协作机器人等。中心与Anthropic、OpenAI等前沿AI企业保持密切合作,定期发布技术报告与安全研究论文。设有博士生培养项目,接受计算机科学系与统计系的申请。中心同时参与BAIR (Berkeley AI Research) 联盟,共享计算资源与跨实验室合作。
实验室 / 研究中心
Center for Human-Compatible AI
访问页面 →关键人物
Stuart Russell
教授/中心创始人
AI领域泰斗,UC Berkeley计算机科学系教授,著有《Artificial Intelligence: A Modern Approach》(全球最广泛使用的AI教材)。提出人类兼容AI框架,倡导以不确定性为核心的对齐方法。2019年出版《Human Compatible》系统阐述AI安全愿景。
Anca Dragan
副教授
研究人机交互与AI安全,聚焦人类模型构建与价值学习。曾参与OpenAI安全团队,获MIT Technology Review 35岁以下创新者称号。
Dawn Song
教授
计算机安全与AI安全领域专家,研究对抗样本、模型隐私、联邦学习安全等。MacArthur天才奖获得者。
标志性成果
- 提出人类兼容AI框架(Stuart Russell, 2019),系统化定义对齐问题的形式化解决方案
- 逆向强化学习(IRL)的理论基础与算法发展,为从人类行为中学习价值观提供技术路径
- 提出协作式逆强化学习(CIRL),建模人类-AI协作中的价值推断问题
- 深度强化学习中的奖励欺骗(reward hacking)系统性分析,揭示RLHF的潜在风险
学术资源
证据
师资
8 位相关教师
知名:Stuart Russell、Anca Dragan、Dawn Song、Pieter Abbeel、Stuart Russell Lab
研究产出
CHAI关联研究者在NeurIPS、ICML、ICLR等顶会持续发表AI安全与对齐相关论文,近年聚焦RLHF、可扩展对齐与机械可解释性
就业去向
毕业生进入Anthropic、OpenAI、DeepMind、Google DeepMind等前沿AI安全团队,或在MIT、Stanford等顶尖大学担任教职
发现信息有误? 提交纠错