TIL(Today I Learned)
1️⃣실무에 바로 쓰는 머신러닝 기초 1
머신러닝의 3대 요소
- 데이터: 데이터가 참고하는 정보의 모음
- 알고리즘: 문제를 해결하기 위해 순서대로 처리하는 방법이나 규칙
- 컴퓨팅 파워: 컴퓨터가 얼마나 빠르고 많이 일(연산)이 가능한지
머신러닝, AI, 딥러닝의 관계

- 인공지능(AI): 사람의 지능적인 작업을 기계가 수행하도록 만드는 광범위한 개념
- 머신러닝: AI를 실현하기 위한 방법 중 하나, 데이터로부터 특징이나 규칙을 찾아내 학습하는 것
- 딥러닝(Deep Learning): 사람의 뇌신경을 본 떠 만든 인공신경망, 이 신경망을 겹처서 복잡한 정보 학습
머신러닝의 역할 및 중요성
대량의 데이터 처리와 분석
- 빅데이터란? -> 일반적인 방법으로 저장, 분석하기 힘들만큼 방대한 양의 데이터
다양한 산업 분야에서의 활용
- 제조업: 센서데이터 수집 -> 설비 이상 징후 예측, 품질 예측
- 금융: 신용카드 사기 거래 탐지, 알고리즘 트레이딩
- 헬스케어: 질병 진단, 환자 상태 예측
- 마케팅: 고객 세분화, 구매 패턴 분석, 타겟 마케팅
- 자율주행: 카메라, 라이다 등을 통한 실시간 도로 상황 분석 -> 의사 결정
머신러닝 vs 기존 통계 분석
가설 검증 vs 예측 성능
- 통계 분석
- 가설 검증(서로 다른 두 변수 사이에 유의한 관계가 있는지), 추론
- 머신 러닝
- 예측(얼마나 정확하게 미래나 미지의 데이터를 예측할 수 있는지)
- 정확도, 재현율
데이터가 많아질수록
- 통계: 표본 수가 커지면 정교한 추론이 가능하지만, 가설 자체는 사람이 세운다.
- 머신러닝: 데이터가 많을수록 학습에 유리, 더 좋은 모델 생성 가능
머신러닝의 종류
지도학습
우리가 맞다고 알고있는 결과값을 정답값(레이블) -> 이러한 정답값이 있는 데이터를 학습
- 분류: 어느 그룹에 속하는지 결정
- 회귀: 숫자로 된 결과를 예측
비지도 학습
레이블 없이 데이터 패턴을 스스로 찾는 학습
- 군집화: 성향이 비슷한 사람이나 사물을 자동으로 묶어내는 기법
- 차원축소: 데이터의 특징(변수)가 많을 때 핵심 정보만 남기고 압축하는 기법

강화 학습
- 환경과 상호작용하며 보상을 최대화하도록 학습
- 시뮬레이션 환경에서 시도-오류를 반복하며 가장 높은 보상을 보장해주는 행동 규칙(전략)을 학습

머신러닝 모델링 프로세스
- 데이터 수집: 웹 크롤링, 센서 측정, 설문조사, DB 추출 등 양질의 데이터가 중요
- 전처리
- 결측치 처리: 데이터 표에서 빈 칸을 평균이나 가장 빈도 높은 값으로 채우거나 삭제
- 이상치 처리: 데이터의 범위에서 심하게 벗어난 값 해결
- 스케일링: 각각 다른 단위를 쓰는 데이터(ex)키, 몸무게)를 비슷하게 맞춰주는 작업
- 범주형 전환: 글자로 된 정보를 숫자로 바꿔주는 과정
- 모델링
- 지도학습: 분류/회귀 알고리즘 선택(ex: 로지스틱 회귀, 랜덤 포레스트 , XGBoost 등)
- 비지도학습: 클러스터링/ 차원 축소 알고리즘 선택(ex: K-Means, PCA 등)
- 성능평가
- 분류: Accuracy, Precision, Recall, F1-score, ROC-AUC 등
- 회귀: MAE, RMSE, R^2 등
- 비지도(군집): 실루엣 계수 등
2️⃣프로젝트 부트캠프: NASA 엔진 수명 예측 (1)
문제정의 및 데이터 탐색
1. 문제 정의
- 비즈니스 목표: 항공 정비 관할 팀의 항공기 사고 예방 및 정비 효율 증대
- ML 목표: [ 입력 → 출력, 회귀/분류 ]
- 성공 기준:
- 1. RMSE <= 30 사이클
- 2. 조기 경보 정확도 >= 85%
- 3. 2종 오류 <= 5%
- 4. Score Function 최소화
2. 데이터
- 출처: NASA Open Data Portal
- 규모:
- 구성: 데이터 셋 FD001 ~ 004
- 단위: 터보팬 엔진을 고장 직전까지 시뮬레이션
- 변수: 엔진 번호, 사이클 시간, 운전 조건, 센서 측정값
- 타깃: RUL = (엔진의 최대 사이클) - (현재 사이클)
3. 접근 방법
| 단계 | 핵심 결정 | 근거 |
| EDA | [1. 엔진 별 수명 분포 및 결측치 확인 2. 편차가 없는 운전 조건 및 센서 확인 3. 센서 간 상관관계 확인 4. RUL 대비 센서가 추세가 있는지 ] |
[ 추후 작성 예정 ] |
| 전처리 | [1. Train의 주행 조건 피쳐 삭제 2. Train 센서 데이터 (1, 5, 6, 10, 16, 18, 19) ] |
[1. 주행 조건 피쳐의 표준편차가 0에 수렴 2. 센서 데이터(i)의 표준편차가 0에 수렴 ] |
진행 계획
- Test 데이터와 RUL 데이터 결합
- RUL 대비 센서 데이터 분포 파악
- 센서 데이터 상관관계 및 분산 기반 필터링
💡 느낀점
오늘은 복습 위주로 학습하였다. 전반위에 걸쳐 데이터의 전처리부터 이를 검정하고 머신러닝을 진행하는 과정까지 훑으며 어느 부분이 부족했는지 머릿속에서 정리할 수 있었다. 또한 라이브 세션에서도 동일하게 전체 과정을 한 번 훑고 직접 데이터를 통해서 문제정의 부터 구체화 하며 많은 고민을 할 수 있었고, 마크 다운 파일로 정리하며 전 과정을 근거에 따라 진행한 것이 만족스러운 데이터 분석에 한 발자국 더 다가간 것 같다.
'머신러닝 활용 품질관리' 카테고리의 다른 글
| Chapter.8 머신러닝 활용 품질관리(6) (0) | 2026.06.23 |
|---|---|
| Chapter.8 머신러닝 활용 품질관리(5) (0) | 2026.06.22 |
| Chapter.8 머신러닝 활용 품질관리(4) (0) | 2026.06.19 |
| Chapter.8 머신러닝 활용 품질관리(3) (0) | 2026.06.17 |
| Chapter.8 머신러닝 활용 품질관리(2) (0) | 2026.06.16 |