바로가기YTtrendAIHRD자동화논문영상리포트
논문 메모 · 2026년 6월 26일

좋은 AI 코치는 언제 물러날지 안다

논문 『AI Coaching for Accelerating Human Skill Development with Reinforcement Learning』를 읽고

대표 이미지

드론 레이싱 사용자 연구를 통해, AI 코칭이 즉각적 수행보다 독립적 숙련을 목표로 할 때 무엇이 달라지는지 읽은 작업 메모.

제일 먼저 든 생각

AI가 일을 도와준다는 말에는 이상한 함정이 있다. 지금 당장 성과가 좋아지면, 우리는 쉽게 “도움이 됐다”고 말한다. 그런데 학습과 숙련의 관점에서는 질문이 다르다. 도움을 받은 사람이 나중에 혼자 더 잘하게 되었는가.

이 논문은 그 질문을 드론 레이싱이라는 몸의 기술 위에서 다룬다. AI가 조종을 보정해주면 당장의 랩타임은 좋아질 수 있다. 하지만 늘 보정받는 학습자는 실패를 겪지 못하고, 실패를 겪지 못하면 자기 감각을 만들 기회를 잃는다. 논문이 제안하는 AI 코치는 그래서 계속 붙잡아주는 시스템이 아니라, 학습자의 수준과 상황에 맞춰 받쳐주고(scaffolding) 물러서는(stepping back) 시스템이다.

논문의 핵심 구조를 요약한 카드형 인포그래픽

이 연구에서 AI 코치는 단기 수행 점수가 아니라, 도움 없이 해낼 수 있는 독립적 숙련을 목표로 삼는다.

도움과 방해 사이의 얇은 선

논문 첫머리의 문제 제기가 선명하다.

“인간이 지금 성공하도록 돕는 것과, 미래에 혼자 성공하도록 돕는 것은 근본적으로 다르다.”
“Helping humans succeed now is fundamentally different from helping them succeed alone in the future.”

이 문장은 HRD와 성과관리 쪽에서 오래 남을 문장이다. 교육에서 좋은 피드백은 학습자를 덜 실패하게 만드는 것이 아니라, 배울 수 있는 실패를 만나게 하는 일에 가깝다. 논문은 이를 “생산적인 실패(productive failures)”라고 부른다. 너무 많이 개입하면 과잉 의존(over-reliance)이 생기고, 너무 빨리 손을 떼면 좌절만 남는다.

연구진은 이 문제를 인간-AI 코칭 게임(Human–AI Coaching Game)으로 형식화한다. 학습자는 현재 과업 수행을 최대화하고 싶어하지만, 코치는 학습자의 장기적 독립 역량을 키우는 보상을 목표로 한다. 둘의 목표가 완전히 같지 않기 때문에, 코칭은 단순한 보조가 아니라 긴장 있는 조율 문제가 된다.

실험이 보여준 범위

실험은 33명을 대상으로 한 1인칭 시점(FPV) 드론 레이싱 사용자 연구다. 논문은 40분의 훈련 뒤 제안한 L2C 코치가 평균 랩타임을 27.9% 줄였고, 비교 기준인 RBF 11.3%, MIA 6.2%보다 큰 향상을 보였다고 보고한다. 실패 횟수도 줄었다고 설명한다.

물론 이것을 사무직 교육 전체로 곧바로 일반화할 수는 없다. 드론 조종은 몸의 기술이고, 시뮬레이터 안에서 측정 가능한 과업이다. 하지만 “AI가 얼마나 많이 도와줬는가”가 아니라 “언제, 왜, 얼마나 물러났는가”를 설계 변수로 삼았다는 점은 업무 학습에도 옮겨볼 만하다.

원문 첫 페이지

논문은 강화학습 기반 코칭 정책과 사용자 연구를 결합해, 보조 AI를 ‘보호자’가 아니라 ‘멘토’로 설계하는 문제를 다룬다.

HRD에서 다시 묻고 싶은 것

사내 AI 교육을 만들 때 우리는 종종 “어떤 프롬프트를 알려줄까”부터 생각한다. 이 논문을 읽고 나면 질문이 조금 달라진다.

성과관리에도 비슷한 질문이 붙는다. AI를 붙인 뒤 결과물이 좋아졌다고 해서 숙련이 높아졌다고 말하기는 어렵다. 오히려 다음 평가에는 “AI 도움을 받은 산출물”과 “도움 없이 판단한 근거”를 구분해야 할 수 있다.

오늘의 작은 실험은 하나다. 교육 과제 하나를 고르고, AI가 도와줘야 하는 구간일부러 물러나야 하는 구간을 나눠 표시해보기. 좋은 AI 코치는 늘 곁에 있는 AI가 아니라, 학습자가 혼자 설 수 있는 순간을 설계하는 AI일 수 있다.

원문 논문: AI Coaching for Accelerating Human Skill Development with Reinforcement Learning