고객이 배송 예정일을 묻습니다. AI는 “오늘 도착할 예정입니다”라고 자신 있게 답합니다. 말투는 친절하지만 배송 기록을 확인한 흔적은 없습니다. 다른 답변은 “현재 정보로는 도착일을 확정할 수 없습니다. 배송 상태를 확인하겠습니다”라고 말합니다.
설명을 위한 가상의 상황입니다. 어느 답변을 더 좋다고 평가할지는 정확성, 확인 가능한 정보, 다음 행동에 대한 기준에 달려 있습니다. 문장이 자연스러운지 살펴보는 것만으로는 고객에게 도움이 되는 답변을 충분히 판단하기 어렵습니다.
언어모델을 학습시킬 때도 이런 평가를 학습 가능한 신호로 연결할 방법이 필요합니다. 대표적인 접근이 RLHF, 인간 피드백을 통한 강화학습입니다. 사람의 선호를 활용해 모델의 답변 방식을 조정하는 방법입니다.
모범 답변과 선호 평가는 다른 역할을 합니다
2022년 공개된 InstructGPT 연구는 그 과정을 구체적으로 보여 줍니다. 연구진은 사람이 작성한 모범 답변으로 모델을 지도 미세조정했습니다. 이후 같은 질문에 대한 여러 답변을 사람이 비교하게 하고, 그 비교 결과로 사람의 선호를 예측하는 보상모델을 학습시켰습니다. 마지막으로 그 보상을 이용해 언어모델을 강화학습으로 조정했습니다. InstructGPT 원 논문
여기서 모범 답변과 선호 평가는 서로 다른 역할을 합니다. 모범 답변은 원하는 응답의 예를 제공합니다. 선호 평가는 여러 후보 중 어느 쪽이 더 나은지 알려 줍니다. 보상모델은 그 비교에서 나타난 패턴을 배워 새 답변에도 점수를 매깁니다.
앞의 배송 문의를 이 학습 방식에 대입해 보겠습니다. 평가자가 근거 없이 도착일을 확정한 답변보다 확인이 필요하다고 알린 답변을 선호했다고 가정하겠습니다. 이런 비교 자료가 쌓이면, 보상모델은 유사한 상황에서 어떤 응답이 더 좋은 평가를 받을지 추정하게 됩니다. 이 배송 예시는 연구의 실제 평가 문항이 아닌 설명용 예시입니다.
보상모델의 점수는 사람 평가의 예측입니다
그 점수는 사람이 모든 새 답변을 직접 읽어 준 결과와 같지는 않습니다. 사람의 평가를 바탕으로 학습한 모델의 예측입니다. 따라서 평가 데이터가 무엇을 담고 있는지와 보상모델이 그 기준을 새로운 사례에도 얼마나 잘 적용하는지가 중요합니다.
InstructGPT는 이 보상을 이용하는 단계에 PPO라는 강화학습 알고리즘을 사용했습니다. 동시에 원래 모델의 응답 방식에서 크게 벗어날수록 학습 점수를 낮추는 장치도 두었습니다. 높은 보상 점수를 추구하는 과정이 답변 방식을 과도하게 바꿀 수 있다는 점을 고려한 설계입니다. 연구진은 학습 후에도 모델에 오류가 남는다고 밝혔습니다. 학습 방법과 한계
언어모델 분야의 용어를 읽을 때는 이런 학습 목표와 구체적인 절차를 구분하면 도움이 됩니다. 사람의 선호를 사용한다고 해서 모든 방법이 동일한 보상모델과 강화학습 과정을 거치는 것은 아닙니다.
DPO는 선호하는 답변으로 모델을 직접 조정합니다
예를 들어 DPO는 선호하는 답변과 덜 선호하는 답변의 쌍을 이용해 언어모델을 직접 조정하는 방법입니다. 별도의 보상모델을 먼저 학습시키고 PPO로 점수를 높이는 절차를 생략합니다. 선호 자료를 이용해 원하는 답변이 나올 가능성을 높이므로, 학습 절차를 설명할 때는 앞서 살펴본 RLHF 과정과 구별할 필요가 있습니다. DPO 원 논문
답을 검사할 수 있다면 검증 결과도 보상이 됩니다
보상을 만드는 방법도 사람의 선호에 한정되지 않습니다. 정답을 검사할 수 있는 수학 문제나 코드를 실행해 확인할 수 있는 과제에서는 검증 결과를 보상에 활용할 수 있습니다. 이를 검증 가능한 보상을 통한 강화학습, RLVR이라고 부릅니다.
2025년 공개된 DeepSeek-R1 논문의 R1-Zero 학습 설명에서는 수학 문제의 답을 판정하거나 코드 실행 결과를 확인하는 정확도 보상을 사용했습니다. 정해진 출력 형식을 따르는지도 평가했습니다. 여기서는 이런 보상 구성만 참고하며, 정해진 평가 과제에서 얻은 성과를 일반 업무 성과로 확대하지 않습니다. DeepSeek-R1 원 논문
각 방식의 차이는 어떤 신호를 사용하고 어떤 학습 절차를 거치는지에 있습니다.
표를 좌우로 움직여 전체 내용을 볼 수 있습니다.
| 접근 | 사용하는 신호 | 학습 절차를 읽을 때 볼 점 |
|---|---|---|
| InstructGPT의 RLHF | 사람의 선호를 예측한 보상모델의 점수 | 보상모델을 학습한 뒤 PPO로 언어모델 조정 |
| DPO | 선호하는 답변과 덜 선호하는 답변의 쌍 | 별도의 보상모델 학습 없이 선호 답변이 나올 가능성을 높이도록 조정 |
| 검증 가능한 보상을 쓰는 RL | 답의 일치 여부나 코드 실행 결과 등 | 검증 결과를 보상으로 사용하며 RL 알고리즘은 별도 선택 |
이 표의 항목은 완전히 배타적인 제품 분류가 아닙니다. 하나의 모델을 개발하는 과정에서 여러 방법을 조합할 수 있습니다. 연구를 읽을 때는 사용한 신호와 실제 학습 단계를 각각 확인하는 편이 정확합니다.
자동 검증에도 범위가 있습니다. 가상의 코드 작성 과제에서 테스트가 빈 입력을 다루지 않는다면, 그 테스트를 통과했다는 사실만으로 빈 입력에서도 잘 작동한다고 말할 수 없습니다. 검증 가능한 보상은 명확한 피드백을 주지만, 검사하지 않은 조건까지 보장하지는 않습니다.
대화의 지시를 따르는 것과 모델 학습은 다릅니다
또 하나 구분할 것은 학습과 사용 중 피드백입니다. 대화에서 “조금 더 짧게 답해 주세요”라고 요청한 뒤 답변이 짧아졌다는 사실만으로 모델이 강화학습되었다고 볼 수는 없습니다. 대화에 담긴 지시를 반영해 응답한 것인지, 별도 학습 과정에서 모델 내부의 수치인 매개변수가 바뀐 것인지 구별해야 합니다. 매개변수 중 입력의 영향을 조절하는 수치를 가중치라고 합니다. 문맥에 주어진 예시로 과제를 수행하면서 가중치를 갱신하지 않는 방식은 GPT-3 논문에서도 설명합니다. 문맥을 이용한 과제 수행 연구
누가 평가하고 무엇을 바꾸는지 확인합니다
업무용 AI의 학습 방식을 설명받을 때는 평가자가 누구인지, 어떤 결과에 보상을 주는지, 그 신호로 무엇을 업데이트하는지를 함께 적어 보면 좋겠습니다. ‘피드백을 반영합니다’라는 설명이 어떤 동작을 뜻하는지 훨씬 구체적으로 이해할 수 있습니다.
다음 글에서는 평가 기준이 실제 업무의 목적을 놓치는 경우를 다룹니다. 점수가 올라갔다는 사실을 어떤 근거와 함께 읽어야 하는지 살펴봅니다. 3편으로 이어 읽기 · 1편 읽기
이 글은 AI의 도움을 받아 작성했습니다.
