Université de Californie, Berkeley
Center for Human-Compatible AI (CHAI)
États-Unis · PhD/Postdoc
CHAI est l'un des centres de recherche académiques les plus influents dans le domaine de l'alignement de l'IA, fondé par Stuart Russell. Il se consacre à l'étude des moyens de garantir l'alignement des objectifs des systèmes d'IA avec les intentions humaines. Le centre se concentre sur des thèmes centraux tels que l'apprentissage par renforcement inversé (IRL), l'interaction humain-IA collaborative et l'alignement évolutif, constituant un berceau majeur de la recherche académique en sécurité de l'IA.
学术历史
CHAI a été fondé en 2016 par Stuart Russell et plusieurs chercheurs, dans la continuité du cadre d'IA compatible avec l'humain présenté dans son ouvrage « Human Compatible » (2019). Avant la création du centre, le manuel « Artificial Intelligence: A Modern Approach », coécrit par Russell et Peter Norvig, avait déjà intégré les questions de sécurité de l'IA dans l'enseignement dominant. La fondation de CHAI marque le passage de l'alignement de l'IA d'une discussion philosophique à une recherche académique systématique, et le paradigme d'apprentissage par renforcement inversé qu'il a proposé est devenu l'une des approches techniques centrales de la recherche sur l'alignement.
当前状态
CHAI est actuellement dirigé par plusieurs membres clés du corps professoral, avec des axes de recherche couvrant l'apprentissage par renforcement inversé, l'apprentissage à partir des retours humains, les fondements théoriques de la sécurité de l'IA et la robotique collaborative. Le centre maintient une collaboration étroite avec des entreprises d'IA de pointe telles qu'Anthropic et OpenAI, et publie régulièrement des rapports techniques et des articles de recherche en sécurité. Il propose un programme de formation doctorale, acceptant les candidatures des départements d'informatique et de statistique. Le centre participe également à la coalition BAIR (Berkeley AI Research), partageant les ressources de calcul et favorisant la collaboration interlaboratoires.
实验室 / 研究中心
Center for Human-Compatible AI
访问页面 →关键人物
Stuart Russell
Professeur / Fondateur du centre
Figure éminente du domaine de l'IA, professeur au département d'informatique de UC Berkeley, auteur de « Artificial Intelligence: A Modern Approach » (le manuel d'IA le plus largement utilisé au monde). Il a proposé le cadre d'IA compatible avec l'humain et plaide pour une approche de l'alignement fondée sur l'incertitude. En 2019, il a publié « Human Compatible », exposant systématiquement sa vision de la sécurité de l'IA.
Anca Dragan
Professeure associée
Ses recherches portent sur l'interaction humain-machine et la sécurité de l'IA, avec un accent sur la modélisation humaine et l'apprentissage des valeurs. Elle a participé à l'équipe de sécurité d'OpenAI et a été nommée parmi les innovateurs de moins de 35 ans par le MIT Technology Review.
Dawn Song
Professeure
Experte en sécurité informatique et sécurité de l'IA, ses recherches portent sur les exemples adverses, la confidentialité des modèles et la sécurité de l'apprentissage fédéré. Lauréate de la bourse MacArthur.
标志性成果
- Proposition du cadre d'IA compatible avec l'humain (Stuart Russell, 2019), définissant systématiquement une solution formalisée au problème de l'alignement
- Fondements théoriques et développement algorithmique de l'apprentissage par renforcement inversé (IRL), offrant une approche technique pour l'apprentissage des valeurs à partir du comportement humain
- Proposition de l'apprentissage par renforcement inversé collaboratif (CIRL), modélisant le problème de l'inférence des valeurs dans la collaboration humain-IA
- Analyse systématique de la tromperie par récompense (reward hacking) dans l'apprentissage par renforcement profond, révélant les risques potentiels du RLHF
学术资源
证据
师资
8 位相关教师
知名:Stuart Russell、Anca Dragan、Dawn Song、Pieter Abbeel、Stuart Russell Lab
研究产出
Les chercheurs associés à CHAI publient continuellement des articles sur la sécurité et l'alignement de l'IA dans les conférences de premier plan telles que NeurIPS, ICML et ICLR, avec une attention récente portée au RLHF, à l'alignement évolutif et à l'interprétabilité mécanistique
就业去向
Les diplômés rejoignent des équipes de sécurité de l'IA de pointe chez Anthropic, OpenAI, DeepMind, Google DeepMind, ou occupent des postes de professeurs dans des universités de premier plan telles que le MIT et Stanford
发现信息有误? 提交纠错