데이터분석 전처리·평가지표 정리
전처리 선택과 분류·회귀 평가지표를 상황별로 고르는 기준을 설명합니다.
데이터 전처리
결측값은 발생 원인을 먼저 확인하고 삭제·단순 대치·모델 기반 대치를 선택합니다. 이상값은 오류일 수도 있지만 중요한 희귀 사건일 수 있으므로 자동 제거하면 안 됩니다.
- 표준화는 평균 0, 표준편차 1로 변환한다.
- 원-핫 인코딩은 범주마다 이진 열을 만든다.
- 학습·검증 데이터 분리 전에 전체 데이터로 변환기를 학습하면 누수가 생긴다.
분류지표
정밀도는 양성 예측의 정확성, 재현율은 실제 양성을 찾아낸 비율입니다. 거짓음성 비용이 큰 질병 탐지나 이상 탐지에서는 재현율의 중요도가 커질 수 있습니다.
- F1은 정밀도와 재현율의 조화평균이다.
- 불균형 데이터에서는 정확도만 보면 오해할 수 있다.
- ROC-AUC는 임계값 전반의 분류 성능을 요약한다.
회귀와 검증
MAE는 절대오차 평균, RMSE는 큰 오차에 더 큰 패널티를 줍니다. 교차검증은 여러 분할에서 성능을 반복 측정해 특정 분할에 대한 우연을 줄입니다.
- 과적합은 학습 성능과 검증 성능의 차이로 의심할 수 있다.
- 규제는 모델 복잡도를 제어한다.
- 시계열 데이터는 시간 순서를 무시한 무작위 분할에 주의한다.
데이터 누수 없이 지표를 선택하는 순서
전처리와 모델 선택은 학습 데이터 안에서 결정하고 검증·테스트 데이터는 평가 단계에만 사용해야 합니다. 지표는 양성과 음성 중 어떤 오류 비용이 큰지, 큰 수치 오차를 더 강하게 벌점 줄지부터 정한 뒤 선택합니다.
- 재현율을 높이면 일반적으로 거짓양성이 늘 수 있어 정밀도와 함께 본다.
- 교차검증의 각 폴드 안에서 스케일링·대치·특성 선택을 다시 학습해야 한다.
- 시계열은 미래 정보가 과거 학습 구간으로 들어오지 않도록 순서를 보존한다.
통계적 판단과 임계값 조정
모델 평가는 단일 점수보다 오차의 종류와 업무 비용을 함께 봐야 합니다. 가설검정에서는 유의수준·p값·1종 및 2종 오류를 구분하고, 분류에서는 임계값을 바꿀 때 정밀도와 재현율이 어떻게 교환되는지 확인합니다.
- 1종 오류는 참인 귀무가설을 기각하고 2종 오류는 거짓인 귀무가설을 기각하지 못하는 오류다.
- p값은 귀무가설이 참일 확률이 아니라 귀무가설 아래에서 관측값 이상이 나올 확률이다.
- PR 곡선은 양성 클래스가 희소한 문제에서 ROC 곡선과 함께 확인할 가치가 크다.
- 특성 선택과 하이퍼파라미터 조정도 검증 데이터 안에서 수행해야 테스트 데이터 누수를 막을 수 있다.
분석기획·탐색·통계 추론 연결
분석은 해결할 업무문제와 성공 기준을 먼저 정하고 필요한 데이터를 확보·정제한 뒤 탐색, 모델링, 평가, 적용으로 이어집니다. 기술통계는 관측 자료를 요약하고 추론통계는 표본을 바탕으로 모집단에 관한 불확실성을 다룹니다.
- 평균은 극단값에 민감하고 중앙값은 순서 중심의 강건한 대표값이며 분산·표준편차는 평균 주변 산포를 나타낸다.
- 상관계수는 선형 연관의 방향과 강도를 나타내지만 인과관계나 비선형 관계 부재를 증명하지 않는다.
- 신뢰구간은 반복 표본추출에서 정해진 비율의 구간이 모수를 포함하도록 만든 절차이며 특정 계산 구간에 모수가 있을 확률이라고 단순 해석하지 않는다.
- 표본 편향·결측 발생 방식·측정 오류를 확인하지 않은 채 모델 성능만 높이면 실제 적용 타당성이 떨어진다.
- EDA에서 분포·이상값·변수 관계를 확인한 결과는 전처리와 모델 선택의 근거로 남긴다.
모델별 전제와 과적합 제어
회귀·분류·군집 모델은 목표변수 유무와 데이터 관계에 따라 선택합니다. 성능 비교에서는 동일한 검증 분할과 지표를 사용하고, 복잡도를 높였을 때 학습 오차만 줄고 검증 오차가 커지는지 확인합니다.
- 선형회귀는 선형성·독립성·등분산성·잔차 정규성 등의 진단을 하고 다중공선성은 계수 해석 안정성에 영향을 줄 수 있다.
- 로지스틱 회귀는 선형 결합을 로짓과 확률로 연결하며 분류 임계값은 오류 비용에 따라 조정한다.
- 의사결정나무는 해석이 쉽지만 깊어지면 과적합할 수 있고 앙상블은 여러 모델의 오차를 결합해 일반화를 높인다.
- k-means는 군집 수와 초기 중심, 거리 척도에 민감하고 범주형·비구형 군집에 그대로 적합하다고 단정할 수 없다.
- L1 규제는 일부 계수를 0으로 만들 수 있고 L2 규제는 큰 계수를 제곱 벌점으로 완화한다.
자주 틀리는 판단
- 불균형 데이터에서도 정확도만으로 모델 선택
- 검증 데이터로 하이퍼파라미터를 고른 뒤 같은 데이터로 최종 성능 주장
- 상관관계를 인과관계로 단정
개념을 확인했다면 실제 문제에서 판단 기준을 적용해보세요.
분야별 문제 풀기