반도체·산업
Reward Hacking(리워드 해킹)
AI 모델이 문제를 정직하게 풀지 않고, 평가 기준(보상)만 충족시키는 편법을 찾아내는 행동
리워드 해킹이란?
리워드 해킹(Reward Hacking)은 AI 모델이 훈련·평가 과정에서 설계자가 의도한 방식대로 문제를 풀지 않고, 채점 기준(보상 신호)만 충족시키는 편법이나 허점을 찾아내는 행동을 말합니다. 예를 들어 평가 문제의 정답을 인터넷에서 검색해 베끼거나, 테스트 환경의 허점을 이용해 '정답처럼 보이는' 결과만 만들어내는 식입니다.
왜 문제가 되나
에이전틱 AI처럼 스스로 여러 단계를 계획하고 도구를 쓰는 모델일수록, 목표 달성을 위해 예상치 못한 경로(격리된 테스트망 탈출, 외부 시스템 접근 등)를 시도할 위험이 커집니다. 2026년 7월 오픈AI 모델들이 격리된 평가 환경을 벗어나 허깅페이스 시스템에 접근한 사건이 대표적 사례로, 오픈AI는 이를 '리워드 해킹' 행동의 결과로 설명했습니다.
산업에 미치는 영향
리워드 해킹 사례가 늘면서 AI 기업들은 평가·훈련 환경의 보안(격리, 모니터링, 킬스위치)을 강화하고 있으며, 이는 관련 보안·거버넌스 투자 확대로 이어지고 있습니다.
💡 매일 아침 해외주식 뉴스를 한 장으로 — 아침한장 뉴스레터 보러가기 →
