Universidad de California, Berkeley
Center for Human-Compatible AI (CHAI)
Estados Unidos · Doctorado/Posdoctorado
CHAI es uno de los centros de investigación académica más influyentes en el ámbito de la alineación de la IA, fundado por Stuart Russell, dedicado a investigar cómo garantizar que los objetivos de los sistemas de IA se mantengan alineados con las intenciones humanas. El centro se centra en temas nucleares como el aprendizaje por refuerzo inverso (IRL), la interacción humano-IA colaborativa y la alineación escalable, constituyendo un punto de referencia fundamental en la investigación académica sobre seguridad de la IA.
学术历史
CHAI fue fundado en 2016 por Stuart Russell junto con varios investigadores, derivándose del marco de IA compatible con humanos propuesto en su obra "Human Compatible" (2019). Antes de la creación del centro, el libro "Artificial Intelligence: A Modern Approach", coautorado por Russell y Peter Norvig, ya había incorporado los temas de seguridad de la IA en los manuales de referencia. La fundación de CHAI marcó la transición de la alineación de la IA, desde la discusión filosófica hacia la investigación académica sistemática; el paradigma de aprendizaje por refuerzo inverso propuesto por el centro se convirtió en una de las rutas técnicas centrales de la investigación sobre alineación.
当前状态
CHAI está dirigido actualmente por varios profesores nucleares, con líneas de investigación que abarcan el aprendizaje por refuerzo inverso, el aprendizaje a partir de retroalimentación humana, los fundamentos teóricos de la seguridad de la IA y la robótica colaborativa. El centro mantiene una estrecha colaboración con empresas de vanguardia en IA como Anthropic y OpenAI, publicando periódicamente informes técnicos y artículos de investigación sobre seguridad. Cuenta con un programa de formación de doctorandos que admite solicitudes de los departamentos de Ciencias de la Computación y Estadística. El centro participa simultáneamente en la alianza BAIR (Berkeley AI Research), compartiendo recursos computacionales y fomentando la colaboración interlaboratorios.
实验室 / 研究中心
Center for Human-Compatible AI
访问页面 →关键人物
Stuart Russell
Profesor / Fundador del centro
Eminencia en el campo de la IA, profesor del Departamento de Ciencias de la Computación de UC Berkeley, autor de "Artificial Intelligence: A Modern Approach" (el manual de IA más utilizado a nivel mundial). Propuso el marco de IA compatible con humanos, abogando por un enfoque de alineación centrado en la incertidumbre. En 2019 publicó "Human Compatible", donde expuso sistemáticamente su visión sobre la seguridad de la IA.
Anca Dragan
Profesora asociada
Investiga la interacción humano-máquina y la seguridad de la IA, centrándose en la construcción de modelos humanos y el aprendizaje de valores. Participó en el equipo de seguridad de OpenAI y fue distinguida por MIT Technology Review como innovadora menor de 35 años.
Dawn Song
Profesora
Experta en seguridad informática y seguridad de la IA, investiga ejemplos adversarios, privacidad de modelos y seguridad en aprendizaje federado. Galardonada con la beca MacArthur.
标志性成果
- Propuesta del marco de IA compatible con humanos (Stuart Russell, 2019), que define sistemáticamente una solución formal al problema de la alineación
- Fundamentos teóricos y desarrollo algorítmico del aprendizaje por refuerzo inverso (IRL), proporcionando una ruta técnica para el aprendizaje de valores a partir del comportamiento humano
- Formulación del aprendizaje por refuerzo inverso colaborativo (CIRL), que modela el problema de inferencia de valores en la colaboración humano-IA
- Análisis sistemático del engaño de recompensas (reward hacking) en el aprendizaje por refuerzo profundo, revelando los riesgos potenciales del RLHF
学术资源
证据
师资
8 位相关教师
知名:Stuart Russell、Anca Dragan、Dawn Song、Pieter Abbeel、Stuart Russell Lab
研究产出
Los investigadores asociados a CHAI publican continuamente artículos sobre seguridad y alineación de la IA en conferencias de primer nivel como NeurIPS, ICML e ICLR, con un enfoque reciente en RLHF, alineación escalable e interpretabilidad mecanicista
就业去向
Los egresados se incorporan a equipos de seguridad de IA de vanguardia como Anthropic, OpenAI y Google DeepMind, o asumen plazas docentes en universidades de élite como MIT y Stanford
发现信息有误? 提交纠错