🤖
🔑⭐ 노버트 위너
학과장
AI 안전·정렬 센터는 첨단 AI 시스템을 고위험 환경에 배치할 때 요구되는 안전성·통제가능성·유익성을 평가하고 확보하는 능력을 기른다. 학생은 RLHF 등 정렬 기법의 원리를 익히고, 기계적 해석가능성 도구로 모델 내부를 분석하며, 강건성 시험과 레드팀 공격을 직접 설계·수행하는 실습을 반복한다. 또한 확장 가능한 감독(scalable oversight) 체계를 설계하는 과제를 통해, 사람이 모델의 판단을 신뢰성 있게 검증하는 방법을 체득한다. 이 과정을 마친 학생은 과학·사회적으로 민감한 영역에 배치되는 AI 시스템의 위험을 사전에 식별하고 완화 조치를 설계할 수 있다.