TIL(Today I Learned)1️⃣최종 프로젝트(10)908 샘플 × 2,881 컬럼짜리 초고차원 제조 데이터를 누수 없이 2,876 → 549/334개 피처로 줄이고, 최종적으로 18~75개 피처만으로 성능의 99%를 확보한 과정을 정리한다.1. 왜 전처리가 필요했나 데이터는 908 샘플 × 2,881 컬럼(센서 피처 2,876개 + 제품 코드 T·A·O). 타깃(Y_Class)은 정상 640 vs 불량 124/144로 편중된 3-클래스다.전처리가 필수였던 이유는 다섯 가지다.고차원 — 피처(2,876) ≫ 샘플(908)이라 과적합 위험이 구조적으로 크다.위장 결측 — 999, -9999 같은 placeholder가 실제 결측을 숫자로 은폐하고 있다. 이를 NaN으로 통일하는 작업을 최우선으로 ..