본문 바로가기
클로드 아카데미클로드 아카데미
← 전체 강의
리서치중급

AI 안전성과 해석가능성

AI Safety & Interpretability

AI 모델의 내부를 들여다보는 해석가능성 연구와, 보상 해킹·탈옥 같은 위험에 대응하는 안전성 연구를 Anthropic 연구진의 시선으로 살펴봅니다.

첫 강의 시작하기5개 레슨 · 3시간 12분

이 강의에서 배우는 것

  • 모델 내부를 들여다보는 해석가능성의 기초
  • 정렬(alignment)과 안전성의 핵심 개념
  • AI 행동을 평가하고 통제하는 접근
  • 안전 연구가 실제로 다루는 문제들

커리큘럼

원본: youtube.com