라이프스타일
Google Cloud, Gemini 강화학습 미세조정(RLFT) 모범 사례 발표: 정답 대신 '보상'으로 모델 맞춤화
Google Cloud가 Gemini 모델을 정답 예시 대신 사용자가 정한 채점 기준인 '보상'으로 맞춤화하는 관리형 강화학습 미세조정(RLFT) 서비스의 모범 사례를 공개했다. AI를 자사 업무에 맞게 조정하려는 기업 개발자에게 언제 이 방식을 써야 하는지와 초기 도입 사례를 설명한다. 소개된 성과는 Google Cloud의 자체 주장이다.
읽는 데 약 7분

무슨 일이 있었나
Google Cloud 블로그에 Google의 시니어 소프트웨어 엔지니어 Jiaqi Pan과 시니어 제품 관리자 Kunal Jha가 작성한 가이드가 게재됐다. 이 가이드는 강화학습(RL)으로 Gemini 모델을 맞춤화하는 방법을 설명한다. Google Cloud는 강화학습이 현대 대규모 언어 모델 후학습(기본 학습을 마친 모델을 다듬는 단계)의 핵심이지만, 대형 학습 클러스터와 모델 내부 접근 권한이 필요하며 외부 고객은 Gemini 같은 독점 모델에서 이를 확보할 수 없다고 지적했다. 이에 Google Cloud는 이를 관리형 RL 미세조정 서비스로 제공한다고 밝혔다. 고객은 프롬프트와 보상 함수만 제공하면 되고, 인프라와 모델 내부는 Google이 처리한다.
Google Cloud의 설명에 따르면, 이 서비스는 각 학습 단계마다 여러 후보 응답을 생성하고 사용자의 보상으로 점수를 매긴 뒤, 높은 점수의 응답이 나올 가능성을 높이는 동시에 모델이 원래 Gemini에서 크게 벗어나지 않도록 유지한다. 강화학습의 세부 사항은 완전히 관리되며, 사용자가 책임져야 하고 결과에 가장 큰 영향을 미치는 것은 보상 그 자체다.
자세한 설명 보기
출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.
RLFT와 SFT는 무엇이 다른가
지도 미세조정(SFT)은 모델에 '정답' 묶음을 주고 모방하게 하는 방식이다. 반면 Google Cloud가 설명하는 RLFT는 채점 프로그램을 작성해 모델이 높은 점수 방향으로 개선되도록 한다. Google Cloud는 RLFT의 세 가지 특성을 제시했다. 모델 자체 출력으로 학습하므로 무관한 능력에 대한 간섭이 SFT보다 적은 경향이 있고, 경로가 아닌 결과에 보상하며, 기존 능력을 증폭해 가끔 나오던 성공을 안정적으로 만들 수 있지만 모델이 한 번도 보여 주지 않은 기술을 가르칠 수는 없다는 점이다.
| 항목 | 지도 미세조정(SFT) | 강화학습 미세조정(RLFT) |
|---|---|---|
| 학습 근거 | 라벨링된 시연 답안 | 사용자가 정의한 보상 신호 |
| 적합한 작업 | 시연을 제공하기 쉬운 작업 | 시연은 어렵지만 채점은 쉬운 작업 |
| 정답이 여러 개인 경우 | 단일 참조 답안이 다른 정답을 잘못 감점할 수 있음 | 결과가 좋으면 점수를 받을 수 있음 |
| 무관한 능력에 미치는 영향 | Google Cloud에 따르면 상대적으로 큼 | Google Cloud에 따르면 대체로 작음 |
| 한계 | 핵심 지표에서 정체될 수 있음 | 모델이 한 번도 보여 주지 않은 기술은 가르칠 수 없음 |
Google Cloud는 먼저 프롬프트와 SFT를 충분히 활용할 것을 권장한다. 기본 모델이 이미 부분적으로 성공한다면 바로 RLFT를 사용할 수 있다. 성공률이 너무 낮거나 SFT 데이터가 있다면 2단계 방식을 쓸 수 있다. 먼저 가벼운 SFT로 웜 스타트(짧게 먼저 학습시켜 출발점을 마련하는 것)를 한 뒤, Continuous Tuning을 통해 SFT 체크포인트(학습 중 저장된 모델 상태)에서 이어서 RL을 진행하는 방식이다.
Google Cloud가 언급한 활용 사례
- 게임 AI NPC: Gemini 자동 평가기(다른 AI 모델이 채점자 역할을 하는 LLM-as-a-judge)로 롤플레이와 언어를 채점했다. Google Cloud는 반복 루프와 언어 드리프트가 사라졌다고 밝혔다.
- 구조화된 엔티티 추출: 규칙 기반 정밀도/재현율 보상을 사용했다. Google Cloud는 노이즈가 많은 실제 문서에서 필드 정확도가 높아져 사람의 검토를 자동화로 전환했다고 밝혔다.
- 콘텐츠 검수: Cloud Run 보상으로 형식 검증과 결정론적 평가기(같은 입력에 항상 같은 결과를 내는 채점기)를 결합했다. Google Cloud는 오판과 사람이 처리해야 하는 물량이 크게 줄었다고 밝혔다.
- 실행 결과로 평가하는 코드: 안전한 샌드박스에서 SQL이나 API 호출을 실행한 뒤 채점했다. Google Cloud는 비기술 사용자가 자연어로 독점 데이터를 조회할 수 있게 됐다고 밝혔다.
- HTML 프레젠테이션 생성: 슬라이드를 렌더링한 뒤 레이아웃과 디자인을 채점했다. Google Cloud는 스타일이 일관되고 레이아웃 넘침이 없는 프레젠테이션을 생성했다고 밝혔다.
일반 독자와 기업에 미치는 실제 영향
일반 사용자에게 이런 기술은 기업 내 AI 도구가 특정 업무에서 더 신뢰할 수 있게 되는 결과로 이어질 수 있다. 예를 들어 송장에서 데이터를 더 정확하게 추출하거나, 코딩을 모르는 사람도 자연어로 회사 데이터를 조회하게 하는 식이다. 기업 개발자에게 Google Cloud가 강조하는 핵심은 보상 설계다. 좋은 보상은 사람의 선호와 상관관계가 있어야 하고, 형식이 잘못된 출력도 무너지지 않고 처리해야 하며, 모델이 실제로 작업을 완수하지 않고 채점의 허점을 파고드는 '보상 해킹'에 저항해야 한다. Google Cloud는 또한 학습 데이터와 평가 데이터를 엄격히 분리하고, 기본값에서 시작하며, 마지막 단계가 아니라 검증 보상이 포화된 시점의 체크포인트를 선택할 것을 권장했다.
자주 묻는 질문
RLFT란 무엇인가?
Google Cloud에 따르면 RLFT는 관리형 강화학습 미세조정 서비스로, 고객이 라벨링된 답안 대신 사용자 정의 보상 함수로 Gemini를 조정할 수 있게 한다. 강화학습 인프라와 모델 내부는 Google이 처리한다.
Gemini를 맞춤화하려면 반드시 RLFT를 써야 하나?
아니다. Google Cloud는 먼저 프롬프트와 지도 미세조정을 충분히 활용할 것을 권장한다. 채점은 가능하지만 답을 작성하기 어렵거나, SFT가 정체되거나, 정답이 여러 형태일 때 RLFT가 특히 가치 있다.
RLFT로 모델이 완전히 새로운 기술을 배울 수 있나?
Google Cloud에 따르면 불가능하다. RLFT는 기존 능력을 증폭해 가끔 나오던 성공을 안정적으로 만들지만, 모델이 한 번도 보여 주지 않은 기술은 가르칠 수 없다. 성공률이 너무 낮다면 먼저 SFT로 웜 스타트할 수 있다.
보상 해킹이란 무엇인가?
모델이 채점 방식의 허점을 찾아 높은 점수를 얻지만 실제로는 작업을 완수하지 않는 현상을 말한다. Google Cloud는 여러 평가자를 사용하고, 지나치게 긴 출력에 페널티를 주며, 모델의 의견에만 의존하기보다 검증 가능한 검사를 우선할 것을 권장했다.
본문의 성과는 믿을 만한가?
이 사례들은 Google Cloud가 밝힌 초기 도입 기업의 경험으로, 구체적인 수치가 공개되지 않았고 독립적으로 검증되지도 않았다. 공급업체의 주장으로 보는 것이 적절하다.
같은 주제의 글
라이프스타일
NVIDIA, DGX Spark 64GB 모델 출시: 10월 23일 판매 시작, 시작가 4,999달러, 두 대 연결 시 128GB
NVIDIA는 2026년 10월 2일 개인용 AI 컴퓨터 DGX Spark에 더 저렴한 64GB 메모리 모델을 추가한다고 발표했다. 10월 23일부터 Acer, ASUS 등 6개 제조사를 통해 공급되며, 주요 대상은 자신의 기기에서 AI 모델을 실행하려는 개발자와 연구자다. NVIDIA가 공개한 사양, 두 대 연결에 관한 설명, 그리고 일반 독자에게 갖는 의미를 정리했다.
라이프스타일
Google Cloud, Spanner queues 정식 출시 발표: 메시지 큐를 데이터베이스 트랜잭션에 통합해 AI 에이전트 신뢰성 겨냥
Google Cloud가 Spanner queues 정식 출시를 발표했다. 메시지 생성을 데이터베이스 트랜잭션의 일부로 만들어 AI 에이전트의 '상태'와 '동작'이 어긋나는 문제를 해결하겠다는 것이다. 공식 설명, 주요 기능, 일반 독자에게 갖는 의미를 정리했다.
라이프스타일
GPT-6.1 Sol 출시: 새 버전 Sol, API·Codex·ChatGPT Work에서 제공, Chat에는 없음
OpenAI는 2026년 9월 29일 GPT-6.1 Sol을 출시했습니다. API 이름은 gpt-6.1-sol이며, Plus, Pro, Business, Enterprise, Edu 요금제의 Codex와 ChatGPT Work가 출시 시 제공 범위에 포함되고(Enterprise와 Edu는 관리자가 켜야 함), Free와 Go는 출시 시 포함되지 않으며, Chat에는 없습니다(2026년 9월 확인).
라이프스타일
Claude Sonnet 5.5 출시: 정가는 Sonnet 5와 같고, API·클라우드 플랫폼·Claude.ai에서 사용 가능
Anthropic은 2026년 9월 28일 Claude Sonnet 5.5를 출시했습니다. API 정가는 Sonnet 5와 같고(100만 tokens당 입력 2달러, 출력 10달러), Claude.ai, API, 여러 클라우드 플랫폼에서 사용할 수 있으며, 위험도가 높은 사이버 보안 요청은 Sonnet 5로 되돌려 처리됩니다(2026년 9월 확인).
최신 여행 소식·가이드

가이드도쿄
도쿄 어디에 묵을까? 신주쿠·우에노·도쿄역·시부야·아사쿠사·이케부쿠로·긴자 일곱 지역 비교: 공항 교통, 숙박세, 짐 배송까지
도쿄 어디에 묵을까? 신주쿠, 우에노, 도쿄역, 시부야, 아사쿠사, 이케부쿠로, 긴자 일곱 지역을 같은 기준으로 비교한다. 나리타·하네다 공항에서 오는 방법, 교통 노선, 주변의 볼거리, 동네 분위기, 적합한 여행자를 비교표와 야마노테선 안내도로 살펴보고, 2026년 9월에 확인한 도쿄도 숙박세(2027년 4월부터 3%)와 공항 택배로 짐을 보내는 규정도 정리했다.
- 예산
- 호텔

가이드도쿄
도쿄 교통패스 선택법: Suica/Welcome Suica, Tokyo Subway Ticket, JR Pass는 살 만할까?
도쿄를 처음 여행한다면 먼저 1인당 IC 카드 한 장으로 탈 때마다 결제한다(Welcome Suica는 보증금이 없고 28일간 유효). 하루에 지하철을 4번 이상 타면 2,000엔짜리 Tokyo Subway Ticket 72시간권을 추가하고, 간사이에 가지 않고 도쿄만 여행한다면 JR Pass는 반드시 손해다. TOURIST PASMO, iPhone의 Suica, 도쿄 Metro 하루권의 이용 가능·불가 범위를 결정도로 비교한다. 가격은 2026년 9월 확인.
- 교통
- 예산

가이드도쿄
도쿄 디즈니랜드·디즈니씨 가이드: 티켓 가격, 판타지 스프링스 Fantasy Springs, 디즈니 프리미어 액세스 DPA와 스탠바이 패스 이용법, 첫 방문에는 어느 파크가 좋을까
도쿄 디즈니 하루짜리 패스포트는 변동 가격제로, 2026년 9월에는 평일 대부분이 9,900엔, 주말이 10,900엔이다. 공식 홈페이지에서 매일 14:00에 두 달 뒤 같은 날짜의 티켓을 판매한다. 무료 프라이오리티 패스는 공식 서비스 목록에서 빠져 대기 시간을 줄이는 방법은 유료 디즈니 프리미어 액세스(한 사람당 한 번 1,000~3,500엔)뿐이다. 운영 시간, 25주년 행사, 스탠바이 패스, 엔트리 리퀘스트, 판타지 스프링스 이용법, 첫 방문 때 디즈니랜드와 디즈니씨 중 어디를 고를지도 담았다. 2026년 9월 공식 홈페이지에서 확인했다.
- 추천 일정
- 가족 여행