분류 전체보기 85

Chapter.6 대시보드 활용 품질관리(2)

TIL(Today I Learned)1️⃣태블로를 활용한 데이터 시각화 Chapter.31.데이터 그룹 원래 차원의 멤버(예: 국가, 제품명, 고객명 등)를 사용자가 지정한 기준으로 묶어 새로운 범주를 생성그룹을 만들면 원본 데이터는 변경되지 않고, 새로운 계산된 차원 필드가 생성그룹은 분석 중 특정 항목들을 집계하거나 맞춤형 범주를 만들 때 활용1-2.권역 그룹 만들기 권역 그룹 생성강원 : 강원도경기 : 경기도, 서울특별시, 인천광역시경상 : 경상남도, 경상북도, 대구광역시, 부산광역시, 울산광역시전라 : 광주광역시, 전라남도, 전라북도충청 : 대전광역시, 세종특별자치시, 충청남도, 충청북도제주 : 제주특별자치도기존 지역별 필드에서 권역 그룹으로 시각화 변경📌계산식을 통한 구현더보기Ex) C_권역I..

Chapter.6 대시보드 활용 품질관리(1)

TIL(Today I Learned)1️⃣태블로를 활용한 데이터 시각화 Chapter.1 ~ 2Tableau 기초상단 탭 메뉴 번호한국어명칭설명1시작 페이지로 이동Tableau 시작 화면으로 돌아가는 버튼, 최근 작업한 파일 목록 등을 볼 수 있음2데이터 패널불러온 데이터 소스를 기반으로 필드(열)를 표시하는 영역, 여기에 있는 차원/측정값을 끌어서 시각화에 사용3분석 패널트렌드 라인, 평균선, 예측 등 분석 관련 기능을 추가할 수 있는 공간4워크북 이름현재 열려 있는 Tableau 파일(.twb/.twbx)의 이름을 표시5카드 보기 영역(선반)필터, 마크, 색상, 크기, 레이블 등의 카드가 표시되는 영역, 시각화 세부 조정에 사용6툴바 아이콘저장, 실행 취소, 다시 실행, 형식 지정 등 자주 쓰는 명..

Chapter.5 심화 프로젝트(6)

TIL(Today I Learned)1️⃣심화 프로젝트머신러닝 모델 성능 개선을 위한 Voting Ensemble 적용엔진 센서 데이터를 활용한 결함 유형 분류 문제에서는 단일 모델만으로는 모든 결함 유형을 안정적으로 구분하기 어려웠다. 특히 정상 상태와 일부 결함 유형은 비교적 명확하게 분리되었지만, Fault 2와 Fault 3은 센서 분포가 매우 유사하여 모델이 두 클래스를 혼동하는 경향이 나타났다.이를 보완하기 위해 Random Forest, XGBoost, LightGBM, CatBoost 등 여러 Tree 기반 모델을 학습하고, 성능이 우수한 모델들을 조합한 Soft Voting Ensemble을 적용하였다.1. 단일 모델 성능 비교먼저 Logistic Regression, Random For..

심화 프로젝트 2026.05.08

Chapter.5 심화 프로젝트(5)

TIL(Today I Learned)1️⃣심화 프로젝트 1. 모델링 목적이번 프로젝트에서는 엔진 센서 데이터를 기반으로 차량 결함 유형을 분류하는 머신러닝 모델을 구축하였다.타겟 변수는 Fault이며, 총 4개의 상태를 예측하는 다중 분류 문제로 설정하였다.Fault 0 : Normal, 정상 상태Fault 1 : Rich, 연료 과다 결함Fault 2 : Lean, 희박 혼합기 결함Fault 3 : Low Voltage, 저전압 결함모델링의 핵심 목표는 단순히 정상과 결함을 구분하는 것이 아니라, 결함 유형별 센서 패턴을 학습하여 어떤 결함인지까지 분류하는 것이다.2. 사용 모델프로젝트에서는 여러 머신러닝 모델을 비교하여 엔진 결함 데이터에 적합한 모델을 찾고자 하였다.Logistic Regressio..

심화 프로젝트 2026.05.07

Chapter.5 심화 프로젝트(3)

TIL(Today I Learned)1️⃣심화 프로젝트 데이터 정제 및 스케일링 계획HC: 하위 이상치 삭제CO: 로그를 씌워 안정화변수 삭제도메인 지식Consumption L/100km vs Consumption L/H : 엔진 부하를 보기 위해 → Consumption L/H 채택 / Consumption L/100km 삭제Force : TPS 스로틀이 열리는 정도에 따라 토크가 증가 →TPS와 상관계수가 높고 TPS로 설명가능, RPM x Force =Power로 RPM과 Power로 Force 설명 가능 → Force 삭제MAP : TPS → 운전자가 액셀 밟아 스로틀이 열리는 정도(원인), MAP → 스로틀이 열려서 들어온 공기압 (결과) → MAP는 TPS의 결과로 상관관계가 높게 비례 → M..

심화 프로젝트 2026.05.01

Chapter.5 심화 프로젝트(2)

TIL(Today I Learned)1️⃣심화 프로젝트 데이터 전처리 과정 전체 변수 별 데이터 분포 확인데이터들 사이 CO, HC등 불규칙하고 비정상적인 그래프 확인 주요 변수 로그를 통한 박스플롯 확인타겟변수(Fault)별 분포 확인해석COFault 1에서 분산이 크고, 최댓값이 크다. 결함2,3에서는 중앙값은 낮지만 이상치 존재해석 -> Fault 1은 CO 배출이 불안정하게 증가하는 경향, 연소 과정에서 연료 과다 또는 불완전 연소가 간헐적으로 발생가능성. Fault 2, 3은 평균적인 CO 수준은 낮지만 특정 상황에서 급격히 증가하는 이상 패턴을 보인다.HCFault 1에서 HC가 압도적으로 높다.해석 -> HC 농도는 Fault 1에서 비정상적으로 높은 값을 보이며, 이는 연료가 완전히 연소되..

심화 프로젝트 2026.04.30

Chapter.5 심화 프로젝트(1)

TIL(Today I Learned)1️⃣심화 프로젝트 프로젝트 주제 선정주제: [모빌리티] 엔진 센서 데이터 기반 결함 예측 및 품질관리 분석분석 목표:엔진 성능 지표(MAP, TPS, Force, Power, RPM)와 배기가스 지표(CO, HC, CO2, O2), 연료 효율성(Consumption L/H, Consumption L/100KM) 등의 주요 변수와 결함(Fault) 간 통계 분석 및 EDA를 통해 관계를 명확히 파악통계 기법(t 검정, ANOVA 등)을 이용하여 결함 그룹 간의 차이점을 정량적으로 검증머신러닝 모델을 통해 결함 상태를 사전에 예측하고, 안전·품질관리 업무에 적용할 수 있는 인사이트 도출데이터: 프로젝트 기획서 작성🔗심화 프로젝트 기획서 | Notion엔진 결함 분석을 ..

심화 프로젝트 2026.04.29

Chapter.4 데이터 분석 심화(11)

TIL(Today I Learned)1️⃣통계 & 머신러닝 복습 머신러닝 전체 과정 요약머신러닝은 단순히 모델을 만드는 것이 아니라👉 데이터 이해 → 가공 → 학습 → 평가 → 개선의 과정이다.문제 정의무엇을 예측할지 결정 (분류 / 회귀)데이터 수집 & 탐색 (EDA)결측치, 이상치 확인분포, 상관관계 분석통계 분석 (가설 검정)t-test: 평균 차이 확인 (연속형 데이터)카이제곱: 범주형 변수 관계 확인👉 변수들이 의미 있는지 먼저 검증데이터 전처리결측치 처리인코딩 (문자 → 숫자)스케일링데이터 분리Train / Test로 나눔일반화 성능 확인 목적모델 학습RandomForest, XGBoost 등 적용예측 & 평가회귀: MAE, RMSE, R²분류: Accuracy, F1-score개선Feat..

Chapter.4 데이터 분석 심화(10)

TIL(Today I Learned)1️⃣데이터 불균형과 샘플링 기법데이터 불균형이란?각 클래스에 속하는 샘플 수가 크게 차이 나는 상태를 말한다. 예를 들어 사기 탐지 데이터에서 정상 거래 99%, 사기 거래 1%라면, 모델이 모든 케이스를 "정상"으로 예측해도 정확도 99%를 달성한다. 그래서 정작 탐지해야 할 소수 클래스를 제대로 학습하지 못하는 문제가 생긴다.불균형 데이터에서는 Accuracy 대신 Precision, Recall, F1-score, AUC-ROC 같은 지표를 함께 봐야 한다.샘플링 기법클래스 간 데이터 수를 맞춰주는 방식으로, 크게 오버샘플링과 언더샘플링으로 나뉜다.오버샘플링소수 클래스의 샘플 수를 늘리는 방법이다.Random Oversampling : 소수 클래스 샘플을 단순 ..