Sécurité de l'Apprentissage Automatique

La sécurité de l'apprentissage automatique étudie comment garantir que les systèmes d'IA demeurent contrôlables, fiables et interprétables à mesure que leurs capacités s'accroissent. Les thématiques centrales incluent l'alignement évolutif, l'apprentissage par renforcement à partir de rétroaction humaine (RLHF), l'interprétabilité mécanistique, le piratage de récompense et la robustesse adversaire. Ce domaine constitue le cœur technique de la recherche sur l'alignement de l'IA, directement confronté aux défis de sécurité ingénieriale des systèmes d'IA avancés.

Progrès de Recherche

Marquez votre étape de recherche dans ce domaine. Juste un aperçu général.

领域资源

学会/组织

综述/资源库

Publications Recentess

Source :: arXiv
#1
Recent advances in the field

Author A, Author B · 2026-08-15

This paper presents recent developments and open problems in the field, with new results on key conjectures.

#2
A unified framework for classical problems

Researcher C, Researcher D · 2026-07-22

We introduce a novel approach that unifies several classical results, providing new insights into long-standing questions.

Articles recupere via arXiv API, pour reference uniquement.

全球最好的大学项目

#1

Université de Californie, Berkeley

Center for Human-Compatible AI (CHAI)

États-Unis · PhD/Postdoc

CHAI est l'un des centres de recherche académiques les plus influents dans le domaine de l'alignement de l'IA, fondé par Stuart Russell. Il se consacre à l'étude des moyens de garantir l'alignement des objectifs des systèmes d'IA avec les intentions humaines. Le centre se concentre sur des thèmes centraux tels que l'apprentissage par renforcement inversé (IRL), l'interaction humain-IA collaborative et l'alignement évolutif, constituant un berceau majeur de la recherche académique en sécurité de l'IA.

#2

Université de Cambridge

Leverhulme Centre for the Future of Intelligence (LCFI) / AI Safety Research

Royaume-Uni · PhD/Postdoc

Le Leverhulme Centre for the Future of Intelligence de l'Université de Cambridge est le centre académique central de la recherche en sécurité de l'IA en Europe, se concentrant sur la recherche interdisciplinaire entre les aspects techniques et philosophiques de la sécurité de l'IA. Le centre rassemble les forces de l'informatique, de la philosophie, de la psychologie et d'autres disciplines, étudiant l'apprentissage des valeurs, la modélisation de l'incertitude et les questions de sécurité à long terme dans l'alignement de l'IA.

#3

Université Carnegie Mellon

Machine Learning Department - AI Safety & Robustness Research

États-Unis · PhD/Postdoc

Le département d'apprentissage automatique de CMU est le premier département de ML indépendant au monde, avec une expertise approfondie en recherche sur la sécurité et la robustesse de l'IA. Les axes de recherche couvrent la robustesse adversaire, la généralisation hors distribution, les systèmes ML de confiance et l'apprentissage par renforcement sûr, offrant une chaîne de recherche complète de l'analyse théorique à la mise en œuvre système pour l'alignement de l'IA.

#4

Massachusetts Institute of Technology

Computer Science and Artificial Intelligence Laboratory (CSAIL) - AI Safety Group

États-Unis · PhD/Postdoc

Le MIT CSAIL est l'un des plus grands laboratoires de recherche en IA au monde. Ses recherches en sécurité de l'IA couvrent l'interprétabilité mécanistique, la robustesse adversariale et la conception de systèmes d'IA fiables. Fort de l'expertise approfondie du MIT en théorie et systèmes, le CSAIL offre une chaîne de recherche complète pour l'alignement de l'IA, depuis les fondements mathématiques jusqu'à la mise en œuvre technique.

#5

Université Stanford

Center for Research on Foundation Models (CRFM) / Stanford AI Lab

États-Unis · PhD/Postdoc

Le CRFM de Stanford est le centre académique central pour la recherche sur les modèles de fondation, étudiant l'alignement sécurisé, l'évaluation et la gouvernance des grands modèles de langage. S'appuyant sur l'expertise approfondie du Stanford AI Lab (SAIL), le centre produit de nombreuses recherches influentes en RLHF, évaluation de modèles et tests de sécurité de référence, constituant un carrefour majeur entre la recherche académique et industrielle en sécurité de l'IA.

发现信息有误? 提交纠错