← 회차 전체 문제공개 기출내용 검수 완료2026년 9급 국가직 공무원 컴퓨터일반 · 컴퓨터일반 · 머신러닝 · 3번
특정 환경에서 선택 가능한 행동들 중 보상(reward)을 최대화하는 행동을 선택하는 머신러닝(machine learning) 기법은?
- 1
지도 학습(supervised learning)
오답 이유지도 학습은 정답 라벨이 붙은 학습 데이터로 입력과 출력의 대응 관계를 학습한다. 보상을 최대화하는 행동 선택이 핵심은 아니다. - 2
강화 학습(reinforcement learning)
정답 근거지문은 입력에 대한 정답 라벨을 맞히는 대신 선택한 행동의 보상을 평가한다. 보상으로 행동 선택 정책을 개선한다는 점이 강화 학습을 가리킨다. - 3
비지도 학습(unsupervised learning)
오답 이유비지도 학습은 정답 라벨 없이 데이터의 군집이나 잠재 구조를 찾는 방식이다. - 4
준지도 학습(semi-supervised learning)
오답 이유준지도 학습은 소량의 라벨 데이터와 다량의 비라벨 데이터를 함께 사용한다. 보상 기반 행동 선택과는 구별된다.
정답·상세해설정답 2번
강화 학습은 에이전트가 환경과 상호작용하며 행동에 따른 보상을 받고, 누적 보상을 최대화하는 정책을 학습한다
콘텐츠 기록콘텐츠 정보
- 자료 유형
- 공개 기출
- 검수 상태
- 내용 검수 완료
- 최종 검수
- 2026-08-09