2026/04 21

Chapter.5 심화 프로젝트(2)

TIL(Today I Learned)1️⃣심화 프로젝트 데이터 전처리 과정 전체 변수 별 데이터 분포 확인데이터들 사이 CO, HC등 불규칙하고 비정상적인 그래프 확인 주요 변수 로그를 통한 박스플롯 확인타겟변수(Fault)별 분포 확인해석COFault 1에서 분산이 크고, 최댓값이 크다. 결함2,3에서는 중앙값은 낮지만 이상치 존재해석 -> Fault 1은 CO 배출이 불안정하게 증가하는 경향, 연소 과정에서 연료 과다 또는 불완전 연소가 간헐적으로 발생가능성. Fault 2, 3은 평균적인 CO 수준은 낮지만 특정 상황에서 급격히 증가하는 이상 패턴을 보인다.HCFault 1에서 HC가 압도적으로 높다.해석 -> HC 농도는 Fault 1에서 비정상적으로 높은 값을 보이며, 이는 연료가 완전히 연소되..

심화 프로젝트 2026.04.30

Chapter.5 심화 프로젝트(1)

TIL(Today I Learned)1️⃣심화 프로젝트 프로젝트 주제 선정주제: [모빌리티] 엔진 센서 데이터 기반 결함 예측 및 품질관리 분석분석 목표:엔진 성능 지표(MAP, TPS, Force, Power, RPM)와 배기가스 지표(CO, HC, CO2, O2), 연료 효율성(Consumption L/H, Consumption L/100KM) 등의 주요 변수와 결함(Fault) 간 통계 분석 및 EDA를 통해 관계를 명확히 파악통계 기법(t 검정, ANOVA 등)을 이용하여 결함 그룹 간의 차이점을 정량적으로 검증머신러닝 모델을 통해 결함 상태를 사전에 예측하고, 안전·품질관리 업무에 적용할 수 있는 인사이트 도출데이터: 프로젝트 기획서 작성🔗심화 프로젝트 기획서 | Notion엔진 결함 분석을 ..

심화 프로젝트 2026.04.29

Chapter.4 데이터 분석 심화(11)

TIL(Today I Learned)1️⃣통계 & 머신러닝 복습 머신러닝 전체 과정 요약머신러닝은 단순히 모델을 만드는 것이 아니라👉 데이터 이해 → 가공 → 학습 → 평가 → 개선의 과정이다.문제 정의무엇을 예측할지 결정 (분류 / 회귀)데이터 수집 & 탐색 (EDA)결측치, 이상치 확인분포, 상관관계 분석통계 분석 (가설 검정)t-test: 평균 차이 확인 (연속형 데이터)카이제곱: 범주형 변수 관계 확인👉 변수들이 의미 있는지 먼저 검증데이터 전처리결측치 처리인코딩 (문자 → 숫자)스케일링데이터 분리Train / Test로 나눔일반화 성능 확인 목적모델 학습RandomForest, XGBoost 등 적용예측 & 평가회귀: MAE, RMSE, R²분류: Accuracy, F1-score개선Feat..

Chapter.4 데이터 분석 심화(10)

TIL(Today I Learned)1️⃣데이터 불균형과 샘플링 기법데이터 불균형이란?각 클래스에 속하는 샘플 수가 크게 차이 나는 상태를 말한다. 예를 들어 사기 탐지 데이터에서 정상 거래 99%, 사기 거래 1%라면, 모델이 모든 케이스를 "정상"으로 예측해도 정확도 99%를 달성한다. 그래서 정작 탐지해야 할 소수 클래스를 제대로 학습하지 못하는 문제가 생긴다.불균형 데이터에서는 Accuracy 대신 Precision, Recall, F1-score, AUC-ROC 같은 지표를 함께 봐야 한다.샘플링 기법클래스 간 데이터 수를 맞춰주는 방식으로, 크게 오버샘플링과 언더샘플링으로 나뉜다.오버샘플링소수 클래스의 샘플 수를 늘리는 방법이다.Random Oversampling : 소수 클래스 샘플을 단순 ..

Chapter.4 데이터 분석 심화(9)

TIL(Today I Learned)1️⃣머신러닝 심화 - 딥러닝1. 퍼셉트론(Perceptron)에서 심층 신경망으로딥러닝의 최소 단위인 퍼셉트론이 층(Layer)을 이루어 쌓인 것구조적 진화: 단일 층으로는 해결할 수 없던 복잡한 데이터 패턴을 **은닉층(Hidden Layers)**을 여러 층 쌓음으로써 해결 가능특징 학습(Feature Learning): 과거에는 사람이 직접 특징을 정의했으나, 딥러닝은 데이터로부터 모델이 스스로 유의미한 특징을 추출2. 딥러닝의 3대 핵심 구성 요소학습을 가능하게 만드는 내부 메커니즘가중치와 편향 (Weights & Bias): 입력 데이터의 중요도를 결정하는 변수. 학습이란 최적의 가중치 값을 찾아내는 과정활성화 함수 (Activation Function): ..

Chapter.4 데이터 분석 심화(8)

TIL(Today I Learned)1️⃣머신러닝 심화1. 군집화 핵심 개념목적: 유사한 데이터끼리 그룹(Cluster) 형성기준: 거리(distance) 또는 유사도(similarity)특징정답 없음 → 패턴을 스스로 발견데이터 탐색(EDA)에서 많이 사용예: 고객 데이터를 군집화 → “비슷한 소비 패턴 가진 고객 그룹” 발견2. 대표 알고리즘① K-Means가장 기본적인 군집화 알고리즘원리:K개의 중심점(centroid) 설정각 데이터를 가장 가까운 중심점에 할당중심점 업데이트반복특징빠르고 간단K값을 직접 정해야 함구형(원형) 군집에 강함② 계층적 군집화 (Hierarchical Clustering)데이터를 트리 구조(덴드로그램)로 표현방식Agglomerative (Bottom-up): 하나씩 합침D..

Chapter.4 데이터 분석 심화(7)

TIL(Today I Learned)1️⃣머신러닝 심화군집화 (Clustering)👉 비슷한 데이터끼리 묶는 것목적: 데이터 안에 숨어있는 그룹 찾기정답(label) 없이 스스로 그룹을 나눔 (비지도 학습)예시고객 데이터를 분석해서 비슷한 소비 패턴끼리 묶기뉴스 기사들을 주제별로 자동 분류대표 알고리즘K-meansDBSCANHierarchical Clustering👉 핵심: “누가 누구랑 비슷한지”를 찾는다 차원 축소 (Dimensionality Reduction)👉 데이터의 변수(컬럼)를 줄이는 것목적: 정보는 최대한 유지하면서 데이터 간단하게 만들기고차원 데이터 → 저차원 데이터로 변환예시100개의 변수 → 2~3개로 줄여서 시각화모델 학습 속도 개선, 과적합 방지대표 기법PCA (주성분 분석)..

Chapter.4 데이터 분석 심화(6)

TIL(Today I Learned)1️⃣머신러닝 기초 라이브 세션 앙상블 모델이란?여러 모델의 예측을 결합하여 더 나은 결과를 얻는 방법배깅 (Bagging: Bootstrap AGGregatING)원래 데이터에서 여러 번 샘플링하여 다양한 데이터셋을 만들고, 각각에 대해 독립적으로 모델을 학습배깅: 랜덤 포레스트여러 개의 결정 트리를 독립적으로 학습각 트리가 서로 다른 데이터와 특성을 사용부스팅 (Boosting)이전 모델이 잘못 예측한 데이터에 더 많은 가중치를 두어 순차적으로 모델을 개선부스팅: XGBoost, LightGBM(LGBM)이전 모델의 오차를 보완하는 방향으로 학습높은 예측 성능으로 실무에서 널리 사용됨앙상블 모델의 장점?더 안정적이고 강건한 예측 가능과적합 위험을 줄일 수 있음더 높..

Chapter.4 데이터 분석 심화(5)

TIL(Today I Learned)1️⃣머신러닝 기초 용어정리선형회귀Y (종속 변수): 결과 변수, 우리가 예측하거나 설명하려는 대상X (독립 변수): 원인 변수, 설명 변수 (Y에 영향을 주는 변수)선형 회귀는 다음과 같은 식으로 표현된다: Y=β0+β1X+εY β0(절편, Bias)→ X가 0일 때 Y의 예상값β1(회귀 계수)→ X가 1 증가할 때 Y가 얼마나 변하는지 나타냄ε(오차, Error)→ 모델이 설명하지 못하는 Y의 변동 (실제값과 예측값의 차이)머신러닝 / 딥러닝에서의 선형 회귀머신러닝에서는 선형 회귀를 다음과 같이 표현한다: Y=wX+b w(가중치, Weight)→ 입력값 X가 결과 Y에 미치는 영향력 (기울기)b (편향, Bias)→ 모델의 기본값 (X가 0일 때의 출력값)통계학과의..

Chapter.4 데이터 분석 심화(4)

TIL(Today I Learned)1️⃣통계학 기초 Chapter.4 & 5단순선형회귀란?하나의 독립변수(X)와 하나의 종속변수(Y) 간의 관계를 직선으로 모델링하는 방법 회귀식Y = β0 + β1X, 여기서 β0는 절편, β1는 기울기특징독립변수의 변화에 따라 종속변수가 어떻게 변하는지 설명하고 예측데이터가 직선적 경향을 따를 때 사용 실습더보기import numpy as npimport pandas as pdimport matplotlib.pyplot as pltfrom sklearn.linear_model import LinearRegressionfrom sklearn.model_selection import train_test_splitfrom sklearn.metrics import mean_..