🧑🔬🔑1941–1997해리 클롭프연구원(액터-크리틱기법/쾌락뉴런이론)💡 '쾌락뉴런' 가설 제안 — 개별뉴런이 국소적 보상유사신호를 최대화하도록 작동한다는 이론 — 정책('액터')과 가치추정 비평가를 분리하는 서턴·바르토의 액터-크리틱구조에 직접 영감을 줌🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🧑🔬🔑1919–1997야코프 츠이프킨연구원(적응·자기조정제어시스템)💡 적응·학습제어시스템이론 창시 — 조절기가 관측된 시스템행동에 기반해 자신의 매개변수를 온라인으로 조정하는 법 규명 — 변화하는 환경에 반응해 정책을 조정하는 적응제어이론적 강화학습에이전트의 직접적 기초🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🧑🔬🔑1924–1976대니얼 벌린연구원(내적동기/호기심기반탐색)💡 호기심의 실험심리학 창시, 새로움·불확실성·복잡성 자체가 외적보상과 무관하게 탐색행동을 유발함을 입증 — 강화학습의 내적동기·호기심기반탐색보너스가 직접 형식화하는 창시적 심리이론🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🔑1908–1984구스타브 엘프빙연구원(베이즈·최적 과학실험설계)💡 최적실험설계이론 창시 — 실험당 얻는 통계적정보를 최대화하도록 실험조건을 선택하는 방법('엘프빙집합') 규명 — 자율과학탐색을 위한 베이즈최적실험설계의 기초🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🧑🔬🔑1927–2021피터 휘틀연구원(탐색-활용/다중슬롯머신문제이론)💡 '불안정한슬롯머신' 이론과 휘틀지수 개발, 관측되지않은 슬롯도 계속 진화하는 더 현실적인 상황으로 다중슬롯머신이론을 일반화 — 정보수집과 기지의좋은선택지 활용 간 균형을 맞추는 현대 탐색-활용알고리즘의 기초🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🧑🔬🔑1925–2014해럴드 W. 쿤연구원(순차게임/전개형분석)💡 전개형게임이론(순차적수와 정보집합을 가진 게임트리) 개발, 게임트리탐색과 순차적 다중에이전트RL이 직접 다루는 불확실성하 순차적 다단계 의사결정의 정확한 형식적 표현 제공🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🧑🔬🔑1927–1992앨런 뉴얼연구원(계층적강화학습/목표분해)💡 일반문제해결기(GPS)와 수단-목표분석 공동개발, 복합목표를 하위목표계층으로 분해하는 창시적방법 — 계층적강화학습의 옵션·하위목표틀의 직접적 기초🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🔑1925–2021앨버트 반두라연구원(모방학습/관찰·사회학습)💡 사회학습이론 창시, 유기체가 직접적 시행착오보상 없이 타인을 관찰·모방함으로써 복잡한행동을 학습함을 입증(보보인형실험) — 강화학습의 모방학습·행동복제가 직접 형식화하는 창시적 심리현상🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🔑1900–1970아르투로 로센블루에스연구원(LLM기반 자율에이전트/목표지향행동이론)💡 위너·비글로와 함께 사이버네틱스 공동창시, 목표지향적·피드백기반 기계행동이론 형식화 — 지각-행동-피드백루프를 통해 목표를 추구하는 에이전트의 창시적 이론틀, 도구사용·피드백기반 LLM자율에이전트와 직결🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🧑🔬🔑1901–1990아서 새뮤얼연구원(몬테카를로트리서치/자기대국학습)💡 자기자신과 대국하며 미니맥스탐색으로 보드위치를 평가해 학습하는 최초의 자기개선형 게임프로그램(체커) 제작, '머신러닝' 용어 창시 및 MCTS·AlphaZero급 시스템이 직접 계승하는 자기대국트리탐색패러다임 창시🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🔑1919–2010데이비드 블랙웰연구원(마르코프의사결정과정/최적확률제어)💡 마르코프의사결정과정의 최적성·수렴성에 관한 기초적결과(블랙웰최적성) 증명, 동적계획법기반 순차적의사결정정책이 증명가능하게 최적인 엄밀한조건 확립 — 벨먼틀의 확장·엄밀화🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🧑🔬🔑1918–2016제이 라이트 포레스터연구원(모델기반강화학습/월드모델)💡 시스템다이내믹스 창시 — 복잡시스템의 행동을 예측·추론하기 위해 명시적 피드백루프 시뮬레이션모델을 구축하는 학문 — 모델기반강화학습에이전트가 학습하고 그 안에서 계획하는 '월드모델'의 직접적 개념·용어적 조상🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🔑1923–2016로이드 섀플리연구원(다중에이전트시스템/확률게임)💡 확률게임이론 창시 — 마르코프의사결정과정을 경쟁·협력적목표를 가진 다중상호작용에이전트로 일반화 — 다중에이전트강화학습의 정확한 수학적틀🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🔑1906–1991매그너스 헤스테네스연구원(정책경사/직접정책최적화)💡 변분법·제약최적화의 현대적 수치기법(켤레기울기법, 증강라그랑주법) 창시, 정책경사강화학습알고리즘이 정책매개변수 최적화에 직접 적용하는 경사기반 최적화기제 제공🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터
🔑1849–1936이반 파블로프연구원(시간차학습/연합학습)💡 고전적조건화 발견 — 유기체가 반복된 시간적짝짓기를 통해 예측적자극과 지연된보상을 연합하는 것을 학습 — 강화학습의 시간차학습알고리즘이 직접 수학적으로 형식화하는 근본적 연합학습현상🖥️ AI·컴퓨팅과학연구본부강화학습·에이전트 센터