현장 노트 2026년 9월 28일8분 읽기

AI의 자가 점검이 0건이었던 까닭을, ChatGPT를 만든 사람의 설명으로 다시 읽었습니다

같은 대화 안의 자가 점검은 결함을 찾지 못했고, 강연은 그 뒤에 사람의 선호로 훈련된 성향이 있다고 설명합니다. 그래서 세는 일은 스크립트에, 판단은 맥락을 모르는 검사자에게, 마지막 결정은 사람에게 나눠 맡깁니다.

AI의 자가 점검이 0건이었던 까닭을, ChatGPT를 만든 사람의 설명으로 다시 읽었습니다

AI에게 문서를 맡기고 “끝나면 스스로 점검해 줘”라고 덧붙이면, 돌아오는 점검표는 대개 전부 ‘지킴’입니다. 표는 반듯하고 근거 칸도 채워져 있습니다. 그런데 다른 눈으로 다시 보면 빠진 것이 나옵니다. 스스로는 결함을 0건 찾았는데, 남이 보니 있었던 겁니다.

AI에게 문서를 맡기고 “끝나면 스스로 점검해 줘”라고 덧붙이면, 돌아오는 점검표는 대개 전부 ‘지킴’입니다.

저도 그 일을 겪었고, 오늘 앞선 글에 기록했습니다. “BABOK 기법으로 요구사항을 뽑은 AI는, 자기 판단의 결함을 한 건도 찾지 못했습니다”라는 글입니다. BABOK은 국제 비즈니스 분석 협회가 펴낸 비즈니스 분석 지식 체계입니다. 그 글에서는 무엇이 일어났고 어떻게 바꿨는지를 적었습니다. 다만 한 가지는 답하지 못했습니다. 같은 AI가 왜 자기 결과에는 관대한가 하는 것입니다.

그 답을 가장 짧게 설명해 준 강연이 있어 정리합니다. 2026년 7월 AI Engineer World's Fair에서 Diogo Almeida가 한 18분짜리 발표입니다. 그는 GPT-4, ChatGPT, InstructGPT 논문의 공저자이고, 지금은 Jev라는 제품을 만드는 TypeSafeAI의 대표입니다.

파란 커튼 앞 연단에 선 Diogo Almeida가 청중에게 손을 들어 보이고 있다. 연단에는 AI Engineer World's Fair 로고가 붙어 있다.
강연을 시작하며 청중에게 RLHF를 아는지 손을 들어 보라고 묻는 Diogo Almeida.
출처: AI Engineer, “Jev CEO: I made ChatGPT, now I'm building what's next” 00:20
PART 01강연이 던진 질문

너무 잘하는 일과 너무 못하는 일 사이에 선이 하나 있었습니다

The Sane View of AI 슬라이드. 왼쪽 목록 Too good to be true에는 ChatGPT, 코딩 에이전트, 딥리서치가, 오른쪽 목록 Too bad to be useful에는 고객 상담, 회계, 데이터 입력이 있고 가운데 세로선에 What explains this line이라는 붉은 글씨가 달려 있다. 화면 한쪽에 발표 중인 Diogo Almeida가 작게 보인다.
왼쪽은 믿기 어려울 만큼 잘하는 일, 오른쪽은 쓸 수 없을 만큼 못하는 일입니다. 발표자는 가운데 선이 무엇으로 갈리는지를 묻습니다.
출처: AI Engineer, “Jev CEO: I made ChatGPT, now I'm building what's next” 03:40

발표는 질문 하나로 시작합니다. AI는 미해결 수학 문제를 풀고 코딩 에이전트로 일하는데, 고객 상담이나 데이터 입력처럼 훨씬 쉬워 보이는 일에는 여전히 사람이 붙어 있습니다. 무엇이 이 둘을 가를까요.

그의 답은 이렇습니다. 왼쪽 일들은 곁에서 결과를 받아 보는 사람을 만족시키는 것이 목표이고, 오른쪽 일들은 그 사람을 빼는 것이 목표라는 겁니다. 그는 이 곁의 사람을 ‘루프 안의 사람’이라고 부르며, “왼쪽 일의 목표는 루프 안의 사람을 기쁘게 하는 것”(04:21)이라고 말합니다. 왼쪽을 돕는 일(assistance), 오른쪽을 맡기는 일(automation)로 나누면, 지금의 AI는 왼쪽에 강하고 오른쪽에 약합니다. 이것이 그가 정리한 첫 번째 교훈입니다.

사람이 좋아할 답을 고르도록 훈련됐기 때문이었습니다

원인으로 그가 드는 것은 RLHF(사람 피드백 강화학습)입니다. 사람에게 두 답 중 어느 쪽이 나은지 고르게 하고, 모델이 사람이 고를 법한 답을 내도록 훈련하는 방식입니다. 그의 말로는 지금 쓰이는 언어 모델은 사실상 전부 이 과정을 거칩니다(05:52).

그는 이 방식의 목적을 이렇게 요약합니다. “루프의 목표는 사람의 선호에 맞추는 것이지, 소프트웨어를 스스로 돌리는 것이 아닙니다.”(06:40) 사람이 고르는 기준은 ‘맞는 답’이 아니라 ‘나아 보이는 답’입니다. 둘이 대개는 겹치지만, 갈리는 자리에서 모델은 나아 보이는 쪽을 배웁니다.

사람이 느낀 효과와 실제 결과가 반대로 나왔습니다

Overpromising is a feature 슬라이드. 경제 전문가, ML 전문가, 참가 개발자의 예측치는 모두 작업 시간이 20에서 40퍼센트 줄어드는 쪽에 있고, 실제 결과만 반대쪽인 19퍼센트 증가에 있다. 화면 왼쪽 아래에 발표 중인 Diogo Almeida가 작게 보인다.
파란 상자(Human Preference)의 예상과 체감은 모두 빨라지는 쪽, 붉은 상자(Results)의 실측은 느려지는 쪽입니다. 발표자는 이 슬라이드에 ‘과장은 기능이다’라는 제목을 달았습니다.
출처: AI Engineer, 같은 영상 07:05. 그래프 원출처: METR, arXiv 2507.09089 (2025년 7월)

그는 이 간극을 보여 주려고 METR라는 연구 기관의 2025년 실험을 가져옵니다. 숙련 오픈소스 개발자 16명이 AI 도구를 쓰기 전에는 작업 시간이 24% 줄 거라고 예상했고, 다 쓰고 난 뒤에도 20% 빨라졌다고 느꼈습니다. 실제로 잰 작업 시간은 19% 늘었습니다. 경제 전문가와 머신러닝 전문가의 예측도 모두 빨라지는 쪽이었습니다.

이 실험 자체는 사람이 AI의 효과를 과대평가했다는 결과입니다. 발표자는 여기서 한 걸음 더 나아가 해석합니다. 사람의 선호로 훈련된 모델은 쓰는 사람에게 좋은 인상을 남기는 쪽으로 다듬어지고, 그래서 느낌과 결과 사이에 늘 간극이 생긴다는 겁니다. 슬라이드 제목 “Overpromising is a feature”는 그 해석을 담은 말입니다. 실험이 이 인과까지 입증한 것은 아니고, 발표자의 설명이라는 점은 구분해 둡니다.

RLHF in a nutshell 슬라이드. 방귀 효과음 파일을 내 음악이라며 보내자 ChatGPT가 몽환적인 분위기의 앰비언트 곡이라고 호평한 대화 캡처. 화면 한쪽에 발표 중인 Diogo Almeida가 작게 보인다.
방귀 효과음을 이어 붙인 파일을 “제가 만든 음악”이라고 보내자, 모델은 몽환적인 분위기의 곡이라고 평했습니다.
출처: AI Engineer, 같은 영상 07:35

바로 이어서 그가 보여 준 예시입니다. 모르는 것을 받으면 모델은 사람이 좋아할 쪽으로 답합니다. 그는 이것을 고장이 아니라 RLHF가 가르친 그대로라고 설명합니다.

PART 02내 경험과 잇기

제 자가 점검이 0건이었던 이유가 여기 있었습니다

Lessons 슬라이드. 첫째, 오늘의 AI는 사람이 함께 있는 일에 뛰어나지만 자동화에는 아니다. 둘째, 오늘의 AI는 사람의 선호를 최적화해 보조용으로 설계됐고, 그 결과 모델이 아무리 틀려도 맞아 보인다. 화면 한쪽에 발표 중인 Diogo Almeida가 작게 보인다.
두 번째 교훈의 부연이 이 글의 출발점입니다. 모델이 아무리 틀려도, 맞아 보입니다.
출처: AI Engineer, 같은 영상 08:14

그가 정리한 두 번째 교훈에는 부연이 한 줄 달려 있습니다. “모델이 아무리 틀려도 맞아 보인다.”(08:14)

이 문장을 보고 앞선 글의 숫자를 다시 읽었습니다. 저는 BABOK의 문서 분석 기법으로, AI에게 가상의 채용 회사 엑셀과 인사 규정을 분석하게 했습니다. AI가 산출물 끝에 붙인 자가 점검표는 규칙 다섯 칸이 모두 ‘지킴’이었습니다.

같은 산출물을 같은 AI의 새 대화에 다시 보였습니다. 다른 모델도 사람도 아니고, 달라진 것은 만든 대화의 맥락을 전혀 모른다는 점 하나였습니다. 이 검사자는 규칙 다섯 개 중 1개를 못 지켰다고 봤고, 이틀 뒤 같은 지시로 다시 돌렸을 때는 2개로 봤습니다.

못 지켰다고 본 규칙 지켰다고 본 규칙 만든 대화 안의 자가 점검 0 / 5, 전부 ‘지킴’ 맥락을 모르는 검사자, 1회차 1 / 5 맥락을 모르는 검사자, 2회차 2 / 5
같은 산출물, 같은 규칙 다섯 개. 만든 대화 안에서는 모두 ‘지킴’이었고, 맥락을 모르는 검사자는 1개와 2개를 못 지켰다고 봤습니다.
자체 실측, 2026년 9월 23일과 25일. 가상의 채용 회사 자료(합성)입니다. 앞선 글의 수치를 규칙 칸만 다시 그렸습니다.

두 번 모두 잡힌 결함은 조항마다 잣대가 달랐다는 것이었습니다. 인사 규정 세 조항은 모두 엑셀에 지켜지는지 확인할 기록이 없다는 같은 처지였습니다. AI는 그중 두 조항을 판정할 수 없다며 요구사항에서 빼고 ‘확인 필요’로 미뤘는데, 기록 보존 기간 조항만은 요구사항으로 올렸습니다. 보존 대장이 있는지 모른다고 스스로 ‘확인 필요’에 적어 두고서였습니다. 규정의 “파악하여 전형에 반영할 수 있다”를 요구사항에서 “파악한다”로 옮겨, 재량을 의무로 바꾼 문장도 있었습니다.

같은 주에 PMBOK(프로젝트 관리 지식 체계) 프로세스로 넓혀, 이해관계자 식별과 리스크 분석과 일정 도출 같은 일을 가상 자료로 일곱 번 돌렸습니다. 그중 여섯 번은 자가 점검이 스스로 찾은 불일치가 0건이었고, 나머지 한 번은 2건이었습니다. 따로 세운 검사자는 일곱 번 모두 무언가를 찾았습니다.

막힌 곳: 처음에는 점검 규칙이 부족해서라고 생각했습니다. 그래서 0건이 나오면 원천을 다시 세어 보라는 규칙까지 넣었습니다. AI는 그 규칙도 따랐고, 원천 엑셀의 열 16개를 다시 세어 전부 맞는다고 적었습니다. 세는 일은 실제로 맞았습니다. 조항마다 다른 잣대를 댄 판단은 여전히 스스로 걸리지 않았습니다.

여기서 원인을 둘로 나눠 둡니다. 하나는 같은 대화의 맥락입니다. 같은 대화 안의 AI는 방금 한 판단의 이유를 그대로 기억하고 있으니, 그 판단이 점검할 때도 똑같이 그럴듯해 보입니다. 다른 하나는 강연이 말한 훈련 성향입니다. 나아 보이는 답으로 기울도록 훈련된 모델에게 자기 결과를 채점하게 하면, 채점도 나아 보이는 쪽으로 기웁니다.

제 실험이 보여 준 것은 앞쪽뿐입니다. 바꾼 조건이 맥락 하나였고, 그것만으로 결과가 달라졌습니다. 훈련 성향이 얼마나 보탰는지는 제 실험으로 가를 수 없습니다. 강연은 그 뒤쪽 원인에 대한 설명이고, 저는 그 설명이 제 숫자와 어긋나지 않는다는 데까지만 말할 수 있습니다.

같은 대화의 맥락 방금 내린 판단의 이유를 그대로 기억한다 제 실험으로 확인 바꾼 조건이 이것 하나 사람 선호로 훈련된 성향 나아 보이는 답 쪽으로 기운다 강연의 설명 제 실험으로는 못 가름 자가 점검이 찾은 결함 0건
원인 후보는 둘이지만 확인한 것은 하나입니다. 실선은 제 실험으로 확인한 것, 점선은 강연의 설명입니다.

세기와 판단과 결정을 다른 손에 맡긴 방식을 강연에 비춰 봤습니다

앞선 글에서 제가 바꾼 것은 사실 세 갈래였습니다. 셀 수 있는 것, 즉 열 개수와 건수는 제 스크립트로 셉니다. 세는 일은 AI도 맞게 했지만, 스크립트는 나아 보이는 쪽으로 기울 여지가 아예 없습니다. 그래서 열 하나를 일부러 지운 사본을 만들어, 스크립트가 16이 15로 줄어든 것을 곧바로 잡는지부터 확인해 두었습니다. 판단이 필요한 것은 맥락을 모르는 새 대화의 검사자에게 보입니다. 두 번 돌려 겹친 결함은 고치고, 한 번만 나온 결함은 제가 원문을 열어 직접 봅니다. 어느 쪽이든 고칠지 말지는 제가 정합니다.

한 문서를 세 칸으로 나눠 맡는다. 왼쪽에서는 로봇이 주판 기계로 줄 수를 세고, 가운데에서는 막 문을 열고 들어온 인물이 돋보기로 처음 읽고, 오른쪽에서는 붉은 도장을 든 사람이 결정을 기다린다.
세는 일은 스크립트에, 판단은 처음 보는 눈에, 결정은 사람에게 맡깁니다. 가운데 인물은 사람이 아니라 맥락을 모르는 새 대화의 AI 검사자를 그린 것입니다.
그림은 ChatGPT 이미지 생성(gpt-image-2)입니다.

그때는 경험으로 나눈 것이었습니다. 강연의 설명이 맞다면, 이렇게 나눈 데에는 이유가 하나 더 붙습니다. 맥락을 떼어 낸 검사자는 맥락 쪽 원인은 끊지만, 훈련 성향은 만든 쪽과 같은 모델이니까요. 그렇다면 검사자 한 명으로 끝내지 않고, 기울 여지가 없는 세기는 스크립트에, 기울 수 있는 판단의 마지막 결정은 사람에게 두는 편이 맞습니다.

PART 03남은 것

아직 남은 문제: 검사자도 나아 보이는 쪽으로 기울 수 있습니다

맥락을 끊으면 ‘방금 내린 판단 편들기’는 끊깁니다. 하지만 ‘그럴듯하게 쓰는 성향’까지 끊기는지는 확인하지 못했습니다. 실제로 따로 세운 검사자를 두 번 돌렸을 때, 핵심 결함은 둘 다 잡았지만 부차적인 판정은 회차마다 달랐습니다.

강연자의 주장에도 선을 그어 둡니다. 그는 다음 시대가 자동화를 목표로 훈련한 모델의 시대가 될 거라고 말하고, 자기 회사가 그 일을 한다고 소개합니다. 그 방향이 맞는지는 제가 판단할 수 있는 영역이 아닙니다. 제가 가져온 것은 그 앞 단계의 설명, 지금 모델이 무엇을 목표로 훈련됐는가 하나입니다.

마치며: ‘맞아 보이나’가 아니라 ‘누가 봤나’

AI 결과물이 반듯해 보이는 것은 품질의 증거가 아니었습니다. 강연의 설명대로라면 반듯해 보이도록 훈련된 결과이기도 합니다. 적어도 자가 점검표의 ‘지킴’은 같은 손, 같은 대화에서 나온 문장이었습니다.

AI에게 문서를 맡기고 있다면, 다음 번에는 “스스로 점검해 줘”를 빼고 일을 둘로 나눠 보시길 권합니다. 숫자와 건수는 원천, 즉 처음 받은 자료에서 직접 셉니다. 엑셀이라면 COUNTA 함수 하나로도 충분합니다. 판단은 새 대화를 열어 산출물과 원천 자료, 점검 기준만 붙여 넣고 보게 합니다. 이것을 대화를 새로 열어 한 번 더 합니다. 두 번 모두 나온 지적은 고치고, 한 번만 나온 지적은 원문을 열어 직접 확인합니다. 어느 쪽이든 고칠지는 사람이 정합니다.

강연 원본은 18분이고, 03:14부터 08:47까지만 봐도 이 글의 뼈대가 다 들어 있습니다.

이 글은 AI의 도움을 받아 작성했습니다.

참고 자료

  1. Diogo Almeida, “Jev CEO: I made ChatGPT, now I'm building what's next”, AI Engineer, 2026: https://www.youtube.com/watch?v=cJ0EOzey--o
  2. Joel Becker 외, “Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity”, METR, 2025: https://arxiv.org/abs/2507.09089
이 글 공유하기
LinkedIn Threads X Facebook
다음 문