← 회차 전체 문제실제 기출자료 분류 확인9급 전산 · 2026년 1회 컴퓨터일반 · 3번
특정 환경에서 선택 가능한 행동들 중 보상(reward)을 최대화하는 행동을 선택하는 머신러닝(machine learning) 기법은?
- 1
지도 학습(supervised learning)
오답 이유지도 학습은 정답 라벨이 붙은 학습 데이터로 입력과 출력의 대응 관계를 학습한다. 보상을 최대화하는 행동 선택이 핵심은 아니다. - 2
강화 학습(reinforcement learning)
- 3
비지도 학습(unsupervised learning)
오답 이유비지도 학습은 정답 라벨 없이 데이터의 군집이나 잠재 구조를 찾는 방식이다. - 4
준지도 학습(semi-supervised learning)
오답 이유준지도 학습은 소량의 라벨 데이터와 다량의 비라벨 데이터를 함께 사용한다. 보상 기반 행동 선택과는 구별된다.
ANSWER & EXPLANATION정답 2번
강화 학습은 에이전트가 환경과 상호작용하며 행동에 따른 보상을 받고, 누적 보상을 최대화하는 정책을 학습한다.
CONTENT RECORD콘텐츠 정보
- 자료 유형
- 사용자 제공 복원 자료
- 검수 상태
- 문항·보기·해설 편집 확인
- 최종 검수
- 2026-07-26