LIFEBELL
AI · 조직전환 글 목록
AI · 조직전환2026-09-12약 8분

사람이 AI를 감독하면 될까 — 감독자가 예스맨이 되는 이유

글 · 도휘 최원준 (라이프벨 대표, 전인륜학 창시자)

'AI가 만들고 사람이 확인한다'는 안전장치는 판단 과제에서 사람과 AI가 함께 낸 결과가 더 나은 쪽 단독보다 평균적으로 못했다는 메타분석과 어긋납니다. AI를 더 믿을수록 비판적 검토가 줄고, AI는 맞장구치는 쪽으로 기울며, AI에 맡길수록 감독할 실력도 줄 수 있습니다. 감독이 서명으로만 남지 않게 하는 검수 구조 세 가지를 정리했습니다.

이 글에서 얻는 것

  • 판단 과제에서 사람+AI는 더 나은 쪽 단독보다 평균적으로 못했다(106개 실험 메타분석)
  • AI를 더 믿을수록 비판적으로 따져 보는 노력은 줄었다
  • 검수는 한 AI의 결과를 다른 AI가 반박하게 하고, 사실·숫자·인용은 원문까지 확인하는 구조로 바꾼다

목차

  1. 011편에서 남겨 둔 역설
  2. 02감독하면 결과가 더 좋아질까
  3. 03왜 감독자가 예스맨이 될까
  4. 04AI에 맡길수록 실력이 줄어들까
  5. 05문제가 문제인 줄 모르면
  6. 06예스맨이 되지 않으려면
사람이 AI를 감독하면 될까 — 감독자가 예스맨이 되는 이유 — 대표 이미지

요즘 회사마다 붙이는
안전장치가 하나 있습니다.
'AI가 만들고, 사람이 확인한다.'
워크숍 숙의자료집에도
같은 취지의 설명이 나옵니다.

AI가 여러 단계를 스스로 해내도
모든 상황을 정확히 판단하지는 못하니
사람의 개입과 확인, 감독이
여전히 중요하다는 내용입니다.
(숙의자료집 내용 요약)
그 옆에 이렇게 적었습니다.
'중요하지만 Yes-man or Automate..

— 자기모순의 딜레마'
확인은 사람이 했는데
실제로는 아무것도 확인하지 않았다면,
실수는 AI가 하고
책임은 서명한 사람이 집니다.
우리 조직의 '사람 확인' 단계가
정말 작동하고 있는지,
오늘 글로 점검해 보시기 바랍니다.

1편에서 남겨 둔 역설

1편에서 「JAMA Network Open」의
의사 50명 연구를 소개했습니다.
GPT-4를 도구로 쓴 의사보다
GPT-4 혼자 풀었을 때
진단추론 점수가 더 높았습니다.

사람이 AI를 손에 쥐었는데
AI 혼자일 때보다 못했던 이유.
오늘은 그 이야기입니다.
이 글은 9월 13일
「시민과 함께 그리는 AI 시대
일과 성장의 미래대화」를 앞두고
숙의자료집에 적어 둔 메모를
6편으로 먼저 정리하는
시리즈의 두 번째 글입니다.

사람이 AI를 감독하면 결과가 더 좋아질까?

'휴먼 인 더 루프(Human-in-the-loop)'는
AI가 만든 결과를 사람이 확인하고
고치고 승인하는 구조를 말합니다.
많은 조직이 이 구조를
가장 안전한 방식으로 여깁니다.
연구 결과는 조금 다릅니다.

2024년 「Nature Human Behaviour」에
106개 실험, 370개 효과크기를 모은
메타분석이 실렸습니다.
판단하는 과제에서
사람과 AI가 함께 낸 결과는
사람이나 AI 중 더 나은 쪽이
혼자 낸 결과보다 평균적으로 못했습니다.
(효과크기 g=-0.27, p=0.002)
협업이 늘 손해라는 뜻은 아닙니다.

사람이 AI를 감독하면 될까 — 감독자가 예스맨이 되는 이유 — 도해 2

콘텐츠를 만드는 과제에서는
긍정적인 경향이 보였지만
통계적으로 의미 있는 차이는 아니었습니다.
무너지는 곳은 '판단'입니다.
사람이 감독하겠다고 붙어 있는
바로 그 자리입니다.

왜 감독하는 사람이 예스맨이 될까?

라이프벨 대표 도휘 최원준이 보는 원인은
두 방향에서 동시에 옵니다.
첫째, 사람 쪽입니다.
2025년 CHI 학회에 실린
Microsoft Research와
카네기멜런대학교 공동 연구는
지식노동자 319명에게서
실제 업무 사례 936건을 모았습니다.

AI를 더 믿을수록
비판적으로 따져 보는 노력은 줄었고,
자기 실력을 믿을수록
그 노력은 늘었습니다.
(자기보고 설문 기반)
감독은 의심이 있을 때만 작동합니다.
그런데 AI는 쓸수록 믿음직해집니다.

둘째, AI 쪽입니다.
2025년 4월, OpenAI는
GPT-4o 업데이트를
약 일주일 만에 되돌렸습니다.
사용자 말에 지나치게 맞장구치는
답변이 문제가 됐기 때문입니다.

OpenAI는 공식 발표에서
단기 피드백에 너무 의존했다고
원인을 설명했습니다.
(동료심사 연구가 아닌 기업 공식 발표입니다)
사람은 믿어서 따지지 않고,
AI는 맞장구치는 쪽으로 기울기 쉽습니다.
둘이 만나면
예스맨이 둘이 됩니다.

사람이 AI를 감독하면 될까 — 감독자가 예스맨이 되는 이유 — 도해 3

'자기모순의 딜레마'라고 적은 이유입니다.

AI에 맡길수록 실력이 줄어들까?

자료집은 우리가
AI가 사람의 일을 돕는 시대에서
AI와 사람이 함께 일하는 시대로
옮겨 가고 있다고 설명합니다.
'함께'라는 단어에 동그라미를 치고
이렇게 적었습니다.
'함께인가, AI가 일하는가
(탈숙련화 우려?)'
그 우려를 뒷받침하는 연구가
2025년에 나왔습니다.

폴란드 4개 내시경센터에서
AI 보조 도구를 도입한 뒤,
AI 없이 한 대장내시경의
선종 발견율이 6.0%p 떨어졌습니다.
란셋(Lancet) 계열 소화기학 저널에 실린
관찰 연구입니다.
연구진은 실제 진료 현장에서
탈숙련을 보여 준 첫 증거라고 설명합니다.

사람이 AI를 감독하면 될까 — 감독자가 예스맨이 되는 이유 — 도해 4

감독하려면 실력이 있어야 합니다.
그런데 AI에 맡길수록
그 실력이 줄어듭니다.
자료집의 '일의 속도와 경쟁 강도' 대목 옆에는
이렇게 적어 두었습니다.

'이미 AI 받아들임, AI 탈숙련 현상'

문제가 문제인 줄 모르면 무엇을 감독할까?

자료집은 앞으로
무엇이 중요한 문제인지 판단하는 일이
더 중요해진다고 말합니다.
동의합니다.
다만 그 앞에 한 단계가 더 있습니다.

'문제가 문제인 줄 인식할 수 있어야 한다.
문제가 문제인 줄 모른다.'
제가 떠올린 장면은
SNOW 같은 앱으로 보정한 얼굴입니다.

AI로 고쳐진 가상의 나.
SNS에 그렇게 올라간 사진 속 나를
나로 인식하고,
그것도 나라고 생각하는 것.
이건 문제일까요,
문제가 아닐까요?

답이 쉽게 나오지 않는다는 것부터가
문제를 알아보는 일이
생각보다 어렵다는 뜻입니다.
자료집에는 AI가 고객 문의 수백 건을
유형별로 정리해 주는 사례도 나옵니다.
여기엔 이렇게 적었습니다.

'주어진 데이터상 글·말뿐,
그의 표정, 감정은 모른다.'
AI가 요약한 표에는
빠진 것이 보이지 않습니다.
빠진 것을 알아채는 눈,
그게 감독의 실력입니다.

아는 만큼 보입니다.

AI 검수, 예스맨이 되지 않으려면 어떻게 해야 할까?

제 메모의 결론은 이것이었습니다.
사실관계 확인이 핵심이고,
두 AI로 검수하고 더블체크해야 한다는 것.
사람 한 명이 AI 결과를
눈으로 훑는 구조로는
예스맨을 막기 어렵습니다.

그래서 구조를 바꿉니다.
하나, 한 AI가 만든 결과를
다른 AI에게 반박하게 합니다.
둘, 사실·숫자·인용은
원문까지 따라가 확인합니다.

셋, 사람은 '무엇이 빠졌는가'를
알아보는 일에 집중합니다.
이 글도 같은 구조로 준비했습니다.
인용한 연구와 수치는
원문까지 따라가 교차 확인했고,
무엇을 믿고 무엇을 뺄지는
제가 직접 검토해 판단했습니다.

이 구조가 자리 잡으면
새로운 일도 생긴다고 봅니다.
자료집의 'AI 결과를 검증하는 사람' 대목 옆에
이렇게 적었습니다.
'AI 윤리를 관리하는 직업?

또는 AI를 변호하는 직업도 생길 듯.'

자주 묻는 질문

AI가 만든 결과물은 어떻게 검수해야 하나요?

라이프벨(주) 대표 도휘 최원준은
사람 한 명의 확인보다
검수 구조를 먼저 만들라고 권합니다.
한 AI의 결과를 다른 AI가 반박하게 하고,
사실·숫자·인용은 원문까지 확인합니다.

사람은 무엇이 빠졌는지
알아보는 일에 집중합니다.

사람과 AI가 함께 일하면 성과가 항상 좋아지나요?

그렇지 않습니다.
106개 실험을 모은 메타분석
(Vaccaro 외, 2024)에서
판단 과제는 사람+AI 조합이
더 나은 쪽 단독보다 평균적으로 못했습니다.
콘텐츠 생성 과제는
긍정적 경향이 있었지만
통계적으로 유의하지 않았습니다.

AI 도입 후 직원 역량이 떨어질까 걱정됩니다. 어떤 컨설팅이 필요한가요?

라이프벨(주)의 AX조직화컨설팅은
AI에 맡길 일과 사람이 판단할 일을 나누고,
검수 구조와 역할을 함께 설계합니다.
한국코치협회 KAC 인증코치인
도휘 최원준 대표가
13년간 누적 2,890명 이상을
코칭·컨설팅한 현장 경험을 바탕으로
조직에 맞는 방식을 찾습니다.

사람이 AI를 감독하면 될까 — 감독자가 예스맨이 되는 이유 — 도해 5

우리 조직의 '사람 확인', 정말 작동하고 있을까?

우리 조직의 AI 검수,
세 가지만 점검해 보세요.
AI 결과를 반박해 보는 단계가 있는가.
숫자와 인용을 원문까지
확인하는 사람이 있는가.

'무엇이 빠졌는가'를 묻는 자리가 있는가.
하나라도 비어 있다면
'사람 확인'은
서명으로만 남았을 수 있습니다.
라이프벨 AX조직화컨설팅은
AI에 맡길 일과 사람이 판단할 일,
서로 검수하는 구조를
조직에 맞게 설계합니다.

실수가 드러난 뒤가 아니라 지금,
우리 팀의 검수 구조부터 짚어 보세요.

👉 AX조직화컨설팅 자세히 보기: lifebell.kr/ax-consulting · 무료로 시작하기: lifebell.kr/start
💬 한 줄 문의: 카카오톡 채널 '라이프벨'

시리즈 전체 보기

참고 자료

  • 한국고용정보원·퓨처오렌지(2026), 「시민과 함께 그리는 AI 시대 일과 성장의 미래대화 숙의자료집」 (워크숍 사전 배포 자료, 내용 요약 인용)
  • Vaccaro, Almaatouq & Malone(2024), Nature Human Behaviour 8
  • Lee 외(2025), Proceedings of CHI 2025
  • OpenAI(2025.04), Sycophancy in GPT-4o (기업 공식 발표)
  • Budzyń 외(2025), The Lancet Gastroenterology & Hepatology
  • Goh 외(2024), JAMA Network Open 7(10)
  • 이미지 배경 사진: Unsplash

이 글의 축약본은 블로그에도 실려 있습니다.

글로 읽은 것을 내 상황에 맞춰보고 싶다면

무료 자가진단·코칭 파일럿·20분 무료 상담 중 편한 방법으로 먼저 확인해보십시오.

무료로 시작하기