통합
뉴스
블로그
웹문서
동영상
혹시
test 후기
(으)로 찾으셨나요?
관련성순
최신순
블로그
Reward Model과 Verifier 한 조각: AI는 좋은 답을 어떻게 알아볼까?
지난 글에서는 답변을 한 번만 생성하는 대신 여러 풀이를 만들고, 수정하고, 검증하는
Test
-Time Scaling을 살펴보았다. 이 방식이 효과를 내려면 모델이 정답 후보를 생성하는 능력만큼, 여러
후보
중 무엇이 좋은 답인지 판단하는 능력이 필요하다. 수학 문제에 열 개의 풀이가 있다고 해보자.
blog.naver.com · 2026.07.27