머신러닝 활용 품질관리

Chapter.8 머신러닝 활용 품질관리(1)

devjjun 2026. 6. 15. 20:03

TIL(Today I Learned)


1️⃣실무에 바로 쓰는 머신러닝 기초 1

머신러닝의 3대 요소 

  1. 데이터: 데이터가 참고하는 정보의 모음
  2. 알고리즘: 문제를 해결하기 위해 순서대로 처리하는 방법이나 규칙 
  3. 컴퓨팅 파워: 컴퓨터가 얼마나 빠르고 많이 일(연산)이 가능한지

머신러닝, AI, 딥러닝의 관계

  • 인공지능(AI): 사람의 지능적인 작업을 기계가 수행하도록 만드는 광범위한 개념
  • 머신러닝: AI를 실현하기 위한 방법 중 하나, 데이터로부터 특징이나 규칙을 찾아내 학습하는 것
  • 딥러닝(Deep Learning): 사람의 뇌신경을 본 떠 만든 인공신경망, 이 신경망을 겹처서 복잡한 정보 학습

머신러닝의 역할 및 중요성

대량의 데이터 처리와 분석

  • 빅데이터란? -> 일반적인 방법으로 저장, 분석하기 힘들만큼 방대한 양의 데이터

다양한 산업 분야에서의 활용 

  1. 제조업: 센서데이터 수집 -> 설비 이상 징후 예측, 품질 예측
  2. 금융: 신용카드 사기 거래 탐지, 알고리즘 트레이딩
  3. 헬스케어: 질병 진단, 환자 상태 예측
  4. 마케팅: 고객 세분화, 구매 패턴 분석, 타겟 마케팅
  5. 자율주행: 카메라, 라이다 등을 통한 실시간 도로 상황 분석 -> 의사 결정

머신러닝 vs 기존 통계 분석 

가설 검증 vs 예측 성능 

  • 통계 분석
    • 가설 검증(서로 다른 두 변수 사이에 유의한 관계가 있는지), 추론
  • 머신 러닝 
    • 예측(얼마나 정확하게 미래나 미지의 데이터를 예측할 수 있는지)
    • 정확도, 재현율

데이터가 많아질수록

  • 통계: 표본 수가 커지면 정교한 추론이 가능하지만, 가설 자체는 사람이 세운다.
  • 머신러닝: 데이터가 많을수록 학습에 유리, 더 좋은 모델 생성 가능 

머신러닝의 종류 

지도학습 

우리가 맞다고 알고있는 결과값을 정답값(레이블) -> 이러한 정답값이 있는 데이터를 학습 

  1. 분류: 어느 그룹에 속하는지 결정
  2. 회귀: 숫자로 된 결과를 예측 

비지도 학습

레이블 없이 데이터 패턴을 스스로 찾는 학습 

  1. 군집화: 성향이 비슷한 사람이나 사물을 자동으로 묶어내는 기법 
  2. 차원축소: 데이터의 특징(변수)가 많을 때 핵심 정보만 남기고 압축하는 기법 

강화 학습

  • 환경과 상호작용하며 보상을 최대화하도록 학습 
  • 시뮬레이션 환경에서 시도-오류를 반복하며 가장 높은 보상을 보장해주는 행동 규칙(전략)을 학습 

머신러닝 모델링 프로세스 

  1. 데이터 수집: 웹 크롤링, 센서 측정, 설문조사, DB 추출 등 양질의 데이터가 중요
  2. 전처리
    1. 결측치 처리: 데이터 표에서 빈 칸을 평균이나 가장 빈도 높은 값으로 채우거나 삭제 
    2. 이상치 처리: 데이터의 범위에서 심하게 벗어난 값 해결
    3. 스케일링: 각각 다른 단위를 쓰는 데이터(ex)키, 몸무게)를 비슷하게 맞춰주는 작업
    4. 범주형 전환: 글자로 된 정보를 숫자로 바꿔주는 과정 
  3. 모델링
    1. 지도학습: 분류/회귀 알고리즘 선택(ex: 로지스틱 회귀, 랜덤 포레스트 , XGBoost 등)
    2. 비지도학습: 클러스터링/ 차원 축소 알고리즘 선택(ex: K-Means, PCA 등)
  4. 성능평가 
    1. 분류: Accuracy, Precision, Recall, F1-score, ROC-AUC 등
    2. 회귀: MAE, RMSE, R^2 등
    3. 비지도(군집): 실루엣 계수 등

2️⃣프로젝트 부트캠프: NASA 엔진 수명 예측 (1)

문제정의 및 데이터 탐색

1. 문제 정의 

  • 비즈니스 목표: 항공 정비 관할 팀의 항공기 사고 예방 및 정비 효율 증대 
  • ML 목표: [ 입력 → 출력, 회귀/분류 ]
  • 성공 기준:
    • 1. RMSE <= 30 사이클
    • 2. 조기 경보 정확도 >= 85%
    • 3. 2종 오류 <= 5%
    • 4. Score Function 최소화

2. 데이터

  • 출처: NASA Open Data Portal
  • 규모
    • 구성: 데이터 셋 FD001 ~ 004
    • 단위: 터보팬 엔진을 고장 직전까지 시뮬레이션 
    • 변수: 엔진 번호, 사이클 시간, 운전 조건, 센서 측정값
  • 타깃: RUL = (엔진의 최대 사이클) - (현재 사이클)

3. 접근 방법

단계 핵심 결정 근거
EDA [1. 엔진 별 수명 분포 및 결측치 확인
2. 편차가 없는 운전 조건 및 센서 확인
3. 센서 간 상관관계 확인

 4. RUL 대비 센서가 추세가 있는지 ]
[ 추후 작성 예정 ]
전처리 [1. Train의 주행 조건 피쳐 삭제
2. Train 센서 데이터 (1, 5, 6, 10, 16, 18, 19)  ]
[1. 주행 조건 피쳐의 표준편차가 0에 수렴
2. 센서 데이터(i)의 표준편차가 0에 수렴 ]

진행 계획

  1. Test 데이터와 RUL 데이터 결합
  2. RUL 대비 센서 데이터 분포 파악
  3. 센서 데이터 상관관계 및 분산 기반 필터링

💡 느낀점

오늘은 복습 위주로 학습하였다. 전반위에 걸쳐 데이터의 전처리부터 이를 검정하고 머신러닝을 진행하는 과정까지 훑으며 어느 부분이 부족했는지 머릿속에서 정리할 수 있었다. 또한 라이브 세션에서도 동일하게 전체 과정을 한 번 훑고 직접 데이터를 통해서 문제정의 부터 구체화 하며 많은 고민을 할 수 있었고, 마크 다운 파일로 정리하며 전 과정을 근거에 따라 진행한 것이 만족스러운 데이터 분석에 한 발자국 더 다가간 것 같다.