أمان التعلم الآلي

يبحث أمان التعلم الآلي في كيفية ضمان بقاء أنظمة الذكاء الاصطناعي خاضعةً للسيطرة وموثوقةً وقابلةً للتفسير مع تعزّز قدراتها. وتشمل الموضوعات الأساسية المواءمة القابلة للتوسع، وتعزيز التعلم بالتغذية الراجعة البشرية (RLHF)، والقابلية الميكانيكية للتفسير، وخداع المكافآت، والمتانة العدائية، وغيرها. ويُعدّ هذا المجال النواة التقنية لأبحاث مواءمة الذكاء الاصطناعي، ويتوجه مباشرةً إلى تحديات السلامة الهندسية لأنظمة الذكاء الاصطناعي المتقدمة.

تقدم البحث

حدد مرحلتك البحثية في هذا المجال. مجرد مخطط عام.

领域资源

学会/组织

综述/资源库

منشورات حديثة

المصدر:: arXiv
#1
Recent advances in the field

Author A, Author B · 2026-08-15

This paper presents recent developments and open problems in the field, with new results on key conjectures.

#2
A unified framework for classical problems

Researcher C, Researcher D · 2026-07-22

We introduce a novel approach that unifies several classical results, providing new insights into long-standing questions.

تم جلب الأوراق من واجهة arXiv برمجياً، للمرجع فقط.

全球最好的大学项目

#1

جامعة كاليفورنيا، بيركلي

Center for Human-Compatible AI (CHAI)

الولايات المتحدة · PhD/Postdoc

مركز CHAI هو أحد أكثر مراكز البحث الأكاديمي تأثيرًا في مجال مواءمة الذكاء الاصطناعي، أسسه Stuart Russell، ويكرس جهوده لبحث كيفية ضمان توافق أهداف أنظمة الذكاء الاصطناعي مع نوايا البشر. يركز المركز على قضايا محورية تشمل التعلم العكسي المعزز (IRL)، والتفاعل التعاوني بين الإنسان والذكاء الاصطناعي، والمواءمة القابلة للتوسع، وهو منبع مهم للبحث الأكاديمي في أمان الذكاء الاصطناعي.

#2

جامعة كامبريدج

Leverhulme Centre for the Future of Intelligence (LCFI) / AI Safety Research

المملكة المتحدة · PhD/Postdoc

مركز Leverhulme لمستقبل الذكاء الاصطناعي بجامعة كامبريدج هو المركز الأكاديمي الأساسي لأبحاث أمان الذكاء الاصطناعي في أوروبا، ويركز على البحث التقاطي بين الجوانب التقنية والفلسفية لأمان الذكاء الاصطناعي. يجمع المركز بين علوم الحاسوب والفلسفة وعلم النفس وغيرها من التخصصات، ويبحث في قضايا تعلم القيم ونمذجة عدم اليقين والأمان طويل الأمد في مواءمة الذكاء الاصطناعي.

#3

جامعة كارنيجي ميلون

Machine Learning Department - AI Safety & Robustness Research

الولايات المتحدة · PhD/Postdoc

قسم التعلم الآلي في جامعة كارنيجي ميلون هو أول قسم مستقل للتعلم الآلي في العالم، ولديه تراكم عميق في أبحاث أمان الذكاء الاصطناعي والمتانة. تشمل اتجاهات البحث المتانة الخصومية والتعميم خارج التوزيع وأنظمة التعلم الآلي الموثوقة والتعلم المعزز الآمن وغيرها، مما يوفر سلسلة بحثية متكاملة من التحليل النظري إلى التطبيق العملي لمواءمة الذكاء الاصطناعي.

#4

معهد ماساتشوستس للتكنولوجيا

Computer Science and Artificial Intelligence Laboratory (CSAIL) - AI Safety Group

الولايات المتحدة · PhD/Postdoc

يُعدّ مختبر علوم الحاسوب والذكاء الاصطناعي (CSAIL) في معهد ماساتشوستس للتكنولوجيا من أكبر مختبرات أبحاث الذكاء الاصطناعي في العالم، وتشمل اتجاهات أبحاث سلامة الذكاء الاصطناعي فيه القابلية للتفسير الآلي والمتانة العدائية وتصميم أنظمة الذكاء الاصطناعي الموثوقة. وبناءً على التراكم العميق لـ MIT في الجوانب النظرية والنظامية، يوفر CSAIL سلسلة بحثية متكاملة لمحاذاة الذكاء الاصطناعي تمتد من الأسس الرياضية إلى التطبيق الهندسي.

#5

جامعة ستانفورد

Center for Research on Foundation Models (CRFM) / Stanford AI Lab

الولايات المتحدة · PhD/Postdoc

مركز CRFM في ستانفورد هو المركز الأكاديمي الأساسي لأبحاث النماذج الأساسية، ويدرس المواءمة الآمنة للنماذج اللغوية الكبيرة وتقييمها وحوكمتها. بالاعتماد على التراكم العميق لمعمل الذكاء الاصطناعي في ستانفورد (SAIL)، أنتج المركز أبحاثاً مؤثرة في اتجاهات RLHF وتقييم النماذج واختبارات الأمان المرجعية، وهو مركز مهم للتقاطع بين الأبحاث الأكاديمية والصناعية في أمان الذكاء الاصطناعي.

发现信息有误? 提交纠错