강화학습 2편 2026년 10월 5일7분 읽기

언어모델은 사람의 평가를 어떻게 학습할까요

언어모델이 사람의 평가를 학습하는 과정을 InstructGPT 연구로 설명합니다. RLHF의 보상모델과 PPO, DPO의 직접 선호 최적화, 검증 가능한 보상의 차이를 살펴봅니다. 대화 중 피드백과 모델 학습을 구분하고, 평가 신호가 무엇을 보장하는지 이해합니다.

언어모델은 사람의 평가를 어떻게 학습할까요

고객이 배송 예정일을 묻습니다. AI는 “오늘 도착할 예정입니다”라고 자신 있게 답합니다. 말투는 친절하지만 배송 기록을 확인한 흔적은 없습니다. 다른 답변은 “현재 정보로는 도착일을 확정할 수 없습니다. 배송 상태를 확인하겠습니다”라고 말합니다.

설명을 위한 가상의 상황입니다. 어느 답변을 더 좋다고 평가할지는 정확성, 확인 가능한 정보, 다음 행동에 대한 기준에 달려 있습니다. 문장이 자연스러운지 살펴보는 것만으로는 고객에게 도움이 되는 답변을 충분히 판단하기 어렵습니다.

언어모델을 학습시킬 때도 이런 평가를 학습 가능한 신호로 연결할 방법이 필요합니다. 대표적인 접근이 RLHF, 인간 피드백을 통한 강화학습입니다. 사람의 선호를 활용해 모델의 답변 방식을 조정하는 방법입니다.

PART 01사람의 평가를 학습으로 잇기

모범 답변과 선호 평가는 다른 역할을 합니다

2022년 공개된 InstructGPT 연구는 그 과정을 구체적으로 보여 줍니다. 연구진은 사람이 작성한 모범 답변으로 모델을 지도 미세조정했습니다. 이후 같은 질문에 대한 여러 답변을 사람이 비교하게 하고, 그 비교 결과로 사람의 선호를 예측하는 보상모델을 학습시켰습니다. 마지막으로 그 보상을 이용해 언어모델을 강화학습으로 조정했습니다. InstructGPT 원 논문

InstructGPT의 학습 절차InstructGPT의 학습 절차. 사람이 쓴 모범 답변으로 지도 미세조정하고, 여러 답변을 사람이 비교합니다. 그 선호 자료로 보상모델을 학습한 뒤, 보상 점수를 이용해 PPO로 언어모델을 조정합니다. InstructGPT 연구의 학습 과정 1모범 답변으로 시작합니다사람이 쓴 답변으로 지도 미세조정 2답변 후보를 비교합니다같은 질문에 더 좋은 답변을 사람이 선택 3선호를 예측하는 모델을 만듭니다비교 자료로 보상모델을 학습 4보상을 이용해 답변 방식을 바꿉니다PPO로 언어모델 조정 · 과도한 변화 제한 모범 답변과 비교 평가는 서로 다른 학습 자료입니다.
InstructGPT는 모범 답변, 비교 평가, 보상모델, 강화학습을 순서대로 연결했습니다.
InstructGPT 논문 3절의 학습 절차를 간소화한 설명 도식입니다. 모든 언어모델의 공통 학습 절차를 뜻하지 않습니다.

여기서 모범 답변과 선호 평가는 서로 다른 역할을 합니다. 모범 답변은 원하는 응답의 예를 제공합니다. 선호 평가는 여러 후보 중 어느 쪽이 더 나은지 알려 줍니다. 보상모델은 그 비교에서 나타난 패턴을 배워 새 답변에도 점수를 매깁니다.

앞의 배송 문의를 이 학습 방식에 대입해 보겠습니다. 평가자가 근거 없이 도착일을 확정한 답변보다 확인이 필요하다고 알린 답변을 선호했다고 가정하겠습니다. 이런 비교 자료가 쌓이면, 보상모델은 유사한 상황에서 어떤 응답이 더 좋은 평가를 받을지 추정하게 됩니다. 이 배송 예시는 연구의 실제 평가 문항이 아닌 설명용 예시입니다.

보상모델의 점수는 사람 평가의 예측입니다

그 점수는 사람이 모든 새 답변을 직접 읽어 준 결과와 같지는 않습니다. 사람의 평가를 바탕으로 학습한 모델의 예측입니다. 따라서 평가 데이터가 무엇을 담고 있는지와 보상모델이 그 기준을 새로운 사례에도 얼마나 잘 적용하는지가 중요합니다.

InstructGPT는 이 보상을 이용하는 단계에 PPO라는 강화학습 알고리즘을 사용했습니다. 동시에 원래 모델의 응답 방식에서 크게 벗어날수록 학습 점수를 낮추는 장치도 두었습니다. 높은 보상 점수를 추구하는 과정이 답변 방식을 과도하게 바꿀 수 있다는 점을 고려한 설계입니다. 연구진은 학습 후에도 모델에 오류가 남는다고 밝혔습니다. 학습 방법과 한계

언어모델 분야의 용어를 읽을 때는 이런 학습 목표와 구체적인 절차를 구분하면 도움이 됩니다. 사람의 선호를 사용한다고 해서 모든 방법이 동일한 보상모델과 강화학습 과정을 거치는 것은 아닙니다.

PART 02학습 방법의 차이

DPO는 선호하는 답변으로 모델을 직접 조정합니다

예를 들어 DPO는 선호하는 답변과 덜 선호하는 답변의 쌍을 이용해 언어모델을 직접 조정하는 방법입니다. 별도의 보상모델을 먼저 학습시키고 PPO로 점수를 높이는 절차를 생략합니다. 선호 자료를 이용해 원하는 답변이 나올 가능성을 높이므로, 학습 절차를 설명할 때는 앞서 살펴본 RLHF 과정과 구별할 필요가 있습니다. DPO 원 논문

답을 검사할 수 있다면 검증 결과도 보상이 됩니다

보상을 만드는 방법도 사람의 선호에 한정되지 않습니다. 정답을 검사할 수 있는 수학 문제나 코드를 실행해 확인할 수 있는 과제에서는 검증 결과를 보상에 활용할 수 있습니다. 이를 검증 가능한 보상을 통한 강화학습, RLVR이라고 부릅니다.

2025년 공개된 DeepSeek-R1 논문의 R1-Zero 학습 설명에서는 수학 문제의 답을 판정하거나 코드 실행 결과를 확인하는 정확도 보상을 사용했습니다. 정해진 출력 형식을 따르는지도 평가했습니다. 여기서는 이런 보상 구성만 참고하며, 정해진 평가 과제에서 얻은 성과를 일반 업무 성과로 확대하지 않습니다. DeepSeek-R1 원 논문

각 방식의 차이는 어떤 신호를 사용하고 어떤 학습 절차를 거치는지에 있습니다.

표를 좌우로 움직여 전체 내용을 볼 수 있습니다.

접근 사용하는 신호 학습 절차를 읽을 때 볼 점
InstructGPT의 RLHF 사람의 선호를 예측한 보상모델의 점수 보상모델을 학습한 뒤 PPO로 언어모델 조정
DPO 선호하는 답변과 덜 선호하는 답변의 쌍 별도의 보상모델 학습 없이 선호 답변이 나올 가능성을 높이도록 조정
검증 가능한 보상을 쓰는 RL 답의 일치 여부나 코드 실행 결과 등 검증 결과를 보상으로 사용하며 RL 알고리즘은 별도 선택

이 표의 항목은 완전히 배타적인 제품 분류가 아닙니다. 하나의 모델을 개발하는 과정에서 여러 방법을 조합할 수 있습니다. 연구를 읽을 때는 사용한 신호와 실제 학습 단계를 각각 확인하는 편이 정확합니다.

자동 검증에도 범위가 있습니다. 가상의 코드 작성 과제에서 테스트가 빈 입력을 다루지 않는다면, 그 테스트를 통과했다는 사실만으로 빈 입력에서도 잘 작동한다고 말할 수 없습니다. 검증 가능한 보상은 명확한 피드백을 주지만, 검사하지 않은 조건까지 보장하지는 않습니다.

PART 03업무에서 구분할 것

대화의 지시를 따르는 것과 모델 학습은 다릅니다

또 하나 구분할 것은 학습과 사용 중 피드백입니다. 대화에서 “조금 더 짧게 답해 주세요”라고 요청한 뒤 답변이 짧아졌다는 사실만으로 모델이 강화학습되었다고 볼 수는 없습니다. 대화에 담긴 지시를 반영해 응답한 것인지, 별도 학습 과정에서 모델 내부의 수치인 매개변수가 바뀐 것인지 구별해야 합니다. 매개변수 중 입력의 영향을 조절하는 수치를 가중치라고 합니다. 문맥에 주어진 예시로 과제를 수행하면서 가중치를 갱신하지 않는 방식은 GPT-3 논문에서도 설명합니다. 문맥을 이용한 과제 수행 연구

대화 중 지시 반영과 별도 학습의 차이대화 중 지시 반영과 별도 학습의 차이. 사용 중에는 문맥의 지시를 반영해도 매개변수가 그대로일 수 있습니다. 학습에서는 학습 자료와 목표에 따라 모델 내부 매개변수가 바뀝니다. 답변이 달라졌을 때 무엇이 바뀌었는가 대화 문맥을 이용한 응답 “짧게 답해 주세요”대화에 지시 추가 짧아진 응답매개변수는 그대로 별도 학습으로 모델 조정 학습 자료 + 학습 목표학습 과정 수행 조정된 모델매개변수 변경
대화 문맥을 이용한 응답 조정과 별도 학습에서의 매개변수 변경을 구분합니다.
GPT-3의 문맥 내 과제 수행과 InstructGPT의 학습을 개념적으로 비교했습니다. 특정 서비스의 데이터 수집 정책을 설명하는 그림은 아닙니다.

누가 평가하고 무엇을 바꾸는지 확인합니다

업무용 AI의 학습 방식을 설명받을 때는 평가자가 누구인지, 어떤 결과에 보상을 주는지, 그 신호로 무엇을 업데이트하는지를 함께 적어 보면 좋겠습니다. ‘피드백을 반영합니다’라는 설명이 어떤 동작을 뜻하는지 훨씬 구체적으로 이해할 수 있습니다.

다음 글에서는 평가 기준이 실제 업무의 목적을 놓치는 경우를 다룹니다. 점수가 올라갔다는 사실을 어떤 근거와 함께 읽어야 하는지 살펴봅니다. 3편으로 이어 읽기 · 1편 읽기

이 글은 AI의 도움을 받아 작성했습니다.

이 글 공유하기
LinkedIn Threads X Facebook
다음 문