라이프스타일

Google Cloud, Gemini 강화학습 미세조정(RLFT) 모범 사례 발표: 정답 대신 '보상'으로 모델 맞춤화

Google Cloud가 Gemini 모델을 정답 예시 대신 사용자가 정한 채점 기준인 '보상'으로 맞춤화하는 관리형 강화학습 미세조정(RLFT) 서비스의 모범 사례를 공개했다. AI를 자사 업무에 맞게 조정하려는 기업 개발자에게 언제 이 방식을 써야 하는지와 초기 도입 사례를 설명한다. 소개된 성과는 Google Cloud의 자체 주장이다.

읽는 데 약 7분

Google Cloud, Gemini 강화학습 미세조정(RLFT) 모범 사례 발표: 정답 대신 '보상'으로 모델 맞춤화
사진: Mokaair (Original editorial artwork)

무슨 일이 있었나

Google Cloud 블로그에 Google의 시니어 소프트웨어 엔지니어 Jiaqi Pan과 시니어 제품 관리자 Kunal Jha가 작성한 가이드가 게재됐다. 이 가이드는 강화학습(RL)으로 Gemini 모델을 맞춤화하는 방법을 설명한다. Google Cloud는 강화학습이 현대 대규모 언어 모델 후학습(기본 학습을 마친 모델을 다듬는 단계)의 핵심이지만, 대형 학습 클러스터와 모델 내부 접근 권한이 필요하며 외부 고객은 Gemini 같은 독점 모델에서 이를 확보할 수 없다고 지적했다. 이에 Google Cloud는 이를 관리형 RL 미세조정 서비스로 제공한다고 밝혔다. 고객은 프롬프트와 보상 함수만 제공하면 되고, 인프라와 모델 내부는 Google이 처리한다.

Google Cloud의 설명에 따르면, 이 서비스는 각 학습 단계마다 여러 후보 응답을 생성하고 사용자의 보상으로 점수를 매긴 뒤, 높은 점수의 응답이 나올 가능성을 높이는 동시에 모델이 원래 Gemini에서 크게 벗어나지 않도록 유지한다. 강화학습의 세부 사항은 완전히 관리되며, 사용자가 책임져야 하고 결과에 가장 큰 영향을 미치는 것은 보상 그 자체다.

Google Cloud, Gemini 강화학습 미세조정(RLFT) 모범 사례 발표: 정답 대신 '보상'으로 모델 맞춤화
Mokaair 편집 검증 절차 · 사진: Mokaair (Original editorial artwork)
자세한 설명 보기

출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.

RLFT와 SFT는 무엇이 다른가

지도 미세조정(SFT)은 모델에 '정답' 묶음을 주고 모방하게 하는 방식이다. 반면 Google Cloud가 설명하는 RLFT는 채점 프로그램을 작성해 모델이 높은 점수 방향으로 개선되도록 한다. Google Cloud는 RLFT의 세 가지 특성을 제시했다. 모델 자체 출력으로 학습하므로 무관한 능력에 대한 간섭이 SFT보다 적은 경향이 있고, 경로가 아닌 결과에 보상하며, 기존 능력을 증폭해 가끔 나오던 성공을 안정적으로 만들 수 있지만 모델이 한 번도 보여 주지 않은 기술을 가르칠 수는 없다는 점이다.

Google Cloud 가이드 내용을 바탕으로 정리한 비교
항목지도 미세조정(SFT)강화학습 미세조정(RLFT)
학습 근거라벨링된 시연 답안사용자가 정의한 보상 신호
적합한 작업시연을 제공하기 쉬운 작업시연은 어렵지만 채점은 쉬운 작업
정답이 여러 개인 경우단일 참조 답안이 다른 정답을 잘못 감점할 수 있음결과가 좋으면 점수를 받을 수 있음
무관한 능력에 미치는 영향Google Cloud에 따르면 상대적으로 큼Google Cloud에 따르면 대체로 작음
한계핵심 지표에서 정체될 수 있음모델이 한 번도 보여 주지 않은 기술은 가르칠 수 없음

Google Cloud는 먼저 프롬프트와 SFT를 충분히 활용할 것을 권장한다. 기본 모델이 이미 부분적으로 성공한다면 바로 RLFT를 사용할 수 있다. 성공률이 너무 낮거나 SFT 데이터가 있다면 2단계 방식을 쓸 수 있다. 먼저 가벼운 SFT로 웜 스타트(짧게 먼저 학습시켜 출발점을 마련하는 것)를 한 뒤, Continuous Tuning을 통해 SFT 체크포인트(학습 중 저장된 모델 상태)에서 이어서 RL을 진행하는 방식이다.

Google Cloud가 언급한 활용 사례

  • 게임 AI NPC: Gemini 자동 평가기(다른 AI 모델이 채점자 역할을 하는 LLM-as-a-judge)로 롤플레이와 언어를 채점했다. Google Cloud는 반복 루프와 언어 드리프트가 사라졌다고 밝혔다.
  • 구조화된 엔티티 추출: 규칙 기반 정밀도/재현율 보상을 사용했다. Google Cloud는 노이즈가 많은 실제 문서에서 필드 정확도가 높아져 사람의 검토를 자동화로 전환했다고 밝혔다.
  • 콘텐츠 검수: Cloud Run 보상으로 형식 검증과 결정론적 평가기(같은 입력에 항상 같은 결과를 내는 채점기)를 결합했다. Google Cloud는 오판과 사람이 처리해야 하는 물량이 크게 줄었다고 밝혔다.
  • 실행 결과로 평가하는 코드: 안전한 샌드박스에서 SQL이나 API 호출을 실행한 뒤 채점했다. Google Cloud는 비기술 사용자가 자연어로 독점 데이터를 조회할 수 있게 됐다고 밝혔다.
  • HTML 프레젠테이션 생성: 슬라이드를 렌더링한 뒤 레이아웃과 디자인을 채점했다. Google Cloud는 스타일이 일관되고 레이아웃 넘침이 없는 프레젠테이션을 생성했다고 밝혔다.

일반 독자와 기업에 미치는 실제 영향

일반 사용자에게 이런 기술은 기업 내 AI 도구가 특정 업무에서 더 신뢰할 수 있게 되는 결과로 이어질 수 있다. 예를 들어 송장에서 데이터를 더 정확하게 추출하거나, 코딩을 모르는 사람도 자연어로 회사 데이터를 조회하게 하는 식이다. 기업 개발자에게 Google Cloud가 강조하는 핵심은 보상 설계다. 좋은 보상은 사람의 선호와 상관관계가 있어야 하고, 형식이 잘못된 출력도 무너지지 않고 처리해야 하며, 모델이 실제로 작업을 완수하지 않고 채점의 허점을 파고드는 '보상 해킹'에 저항해야 한다. Google Cloud는 또한 학습 데이터와 평가 데이터를 엄격히 분리하고, 기본값에서 시작하며, 마지막 단계가 아니라 검증 보상이 포화된 시점의 체크포인트를 선택할 것을 권장했다.

자주 묻는 질문

RLFT란 무엇인가?

Google Cloud에 따르면 RLFT는 관리형 강화학습 미세조정 서비스로, 고객이 라벨링된 답안 대신 사용자 정의 보상 함수로 Gemini를 조정할 수 있게 한다. 강화학습 인프라와 모델 내부는 Google이 처리한다.

Gemini를 맞춤화하려면 반드시 RLFT를 써야 하나?

아니다. Google Cloud는 먼저 프롬프트와 지도 미세조정을 충분히 활용할 것을 권장한다. 채점은 가능하지만 답을 작성하기 어렵거나, SFT가 정체되거나, 정답이 여러 형태일 때 RLFT가 특히 가치 있다.

RLFT로 모델이 완전히 새로운 기술을 배울 수 있나?

Google Cloud에 따르면 불가능하다. RLFT는 기존 능력을 증폭해 가끔 나오던 성공을 안정적으로 만들지만, 모델이 한 번도 보여 주지 않은 기술은 가르칠 수 없다. 성공률이 너무 낮다면 먼저 SFT로 웜 스타트할 수 있다.

보상 해킹이란 무엇인가?

모델이 채점 방식의 허점을 찾아 높은 점수를 얻지만 실제로는 작업을 완수하지 않는 현상을 말한다. Google Cloud는 여러 평가자를 사용하고, 지나치게 긴 출력에 페널티를 주며, 모델의 의견에만 의존하기보다 검증 가능한 검사를 우선할 것을 권장했다.

본문의 성과는 믿을 만한가?

이 사례들은 Google Cloud가 밝힌 초기 도입 기업의 경험으로, 구체적인 수치가 공개되지 않았고 독립적으로 검증되지도 않았다. 공급업체의 주장으로 보는 것이 적절하다.

이 주제의 최신 뉴스 보기

최신 여행 소식·가이드

출처

라이프스타일