분류 전체보기 85

Chapter.8 머신러닝 활용 품질관리(3)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 2 실습 총 정리결측치와 이상치를 올바르게 처리하는 것이 모델의 기초 불균형 데이터 문제를 해결하지 않으면 소수 클래스(불량)을 놓칠 수 있다.범주형 변수는 원-핫 인코딩, 레이블 인코딩 등으로 적절히 반환 피처 엔지니어링을 통해 데이터에서 추가정보(패턴)을 추출하거나,중요하지 않은 변수는 제거해 모델의 효율과 성능을 높일 수 있다.전처리와 피처 엔지니어링 과정에서의 모든 선택(결측치 처리 방식, 이상치 제거 기준 등)은도메인 지식과 데이터 탐색(EDA) 결과를 함께 고려해야 한다. 주요 질문 및 답변 Q1.결측치 처리 시 예측모델을 쓰는 경우 A1. 결측치가 중요한 변수이거나, 전체 데이터의 상당 부분을 차지하는 경우 Q2.이상치..

Chapter.8 머신러닝 활용 품질관리(2)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 2데이터 전처리란?원시(raw) 데이터에서 불필요하거나 손실(노이즈)이 있는 부분을 처리하고 분석 목적에 맞는 형태로 만드는 과정 필요성모델 정확도 및 신뢰도 향상이상치나 결측치가 존재하면 모델 학습 성능이 크게 떨어짐효율적인 데이터 분석과 모델 훈련을 위한 필수적인 단계결측치 처리결측치 발생 원인삭제(Removal)결측치가 있는 행(row) 또는 열(column)을 제거->간단하지만 데이터 손실이 발생->결측치가 전체 데이터에서 매우 소수일 때 적합대치(Imputation)평균 또는 중앙값으로 대체 ->수치형 데이터에서 많이 사용/분포 왜곡 적음최빈값으로 대체 -> 범주형 데이터에서 사용예측 모델로 대체-> 회귀/분류 모델을 이용..

Chapter.8 머신러닝 활용 품질관리(1)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 1머신러닝의 3대 요소 데이터: 데이터가 참고하는 정보의 모음알고리즘: 문제를 해결하기 위해 순서대로 처리하는 방법이나 규칙 컴퓨팅 파워: 컴퓨터가 얼마나 빠르고 많이 일(연산)이 가능한지머신러닝, AI, 딥러닝의 관계인공지능(AI): 사람의 지능적인 작업을 기계가 수행하도록 만드는 광범위한 개념머신러닝: AI를 실현하기 위한 방법 중 하나, 데이터로부터 특징이나 규칙을 찾아내 학습하는 것딥러닝(Deep Learning): 사람의 뇌신경을 본 떠 만든 인공신경망, 이 신경망을 겹처서 복잡한 정보 학습머신러닝의 역할 및 중요성대량의 데이터 처리와 분석빅데이터란? -> 일반적인 방법으로 저장, 분석하기 힘들만큼 방대한 양의 데이터다양한..

Chapter.7 실전 프로젝트 대시보드(10)

TIL(Today I Learned)1️⃣실전 프로젝트 최종(10)베이스라인 성능 비교최종 점수가 0.87 -> 0.86 하락EV 주행거리를 예측하는 머신러닝 프로젝트를 했다. 데이터는 뮌헨 공대(FTM TU München)가 공개한 1세대 BMW i3의 실주행 기록 — 실제 70번의 주행 데이터일반화의 결과로 인한 점수의 하락은 실전 상용화를 위해 꼭 필요한 과정이다문제: 경쟁력 향상을 위한 남은 주행거리 예측계절에 따른 냉,난방에 의한 주행거리 하락은 전력 소모에 따른 결과이다.낮은 주행거리에 따른 배터리 개선을 위한 주행거리 예측 데이터 확보주행이 끝난 뒤, 실제 주행 조건을 바탕으로 그 주행에서 차가 얼마나 갈 수 있었는지를 데이터로 예측이 목표데이터 전처리원본은 0.1초 단위 실 주행 시계열. ..

Chapter.7 실전 프로젝트 대시보드(9)

TIL(Today I Learned)1️⃣실전 프로젝트 대시보드(9)BMW i3 주행거리 예측 대시보드 개선 기록Streamlit 기반의 EV 주행거리 예측 대시보드를 실사용 관점에서 점검하면서 발견된 문제들을 수정하고, UI를 일반 사용자 친화적으로 개편1. 데이터 누수(Data Leakage) 제거문제: 피처 중요도를 확인하니 Duration, SOC_Consumed, Battery_State_of_Charge_End 세 컬럼의 중요도가 비정상적으로 높게 나왔습니다. 이 값들은 주행이 끝난 후에야 알 수 있는 결과값이기 때문에 예측 모델에 포함X해결: 세 컬럼을 LEAKAGE_COLS로 분리하고 모델 학습과 예측에서 완전히 제외2. SHAP 기반 최종 피처 13개로 교체SHAP 분석에서 선정된 13개..

Chapter.7 실전 프로젝트 대시보드(8)

TIL(Today I Learned)1️⃣실전 프로젝트 대시보드(8)대시보드 수정 사항 대시보드 구성 순서 수정사이드 바에 CSV 업로드를 통한 거리 예측 기능을 추가배터리 소모량 민감도 분석 해석 추가 절대 오차 누적 분포 그래프에 KPI를 추가 그래프를 통한 도메인 인사이트를 도출하기 위해 속도와 거리 관련한 산점도 제작추가 수정 예정차량 운전자 입장에서의 대시보드 추가 제작 도메인 기반으로 도출된 인사이트 그래프 밑에 추가 샘플로 로드된 CSV 파일 삭제2️⃣제출용 PPT 구성 분석 파이프라인 페이지 제작 PPT 개선 사항도메인 변수 분포 해석 및 인사이트 도출28p case2 데이터 수 오류 10만개 수정/ 계절차이 미반영 된 이유 전체 그래프 색상 통일 EV_데이터분석_팀과제_발표_v2.pptx..

Chapter.7 실전 프로젝트 대시보드(7)

TIL(Today I Learned)1️⃣실전 프로젝트(7)BMW i3 주행거리 예측 대시보드 — 제작부터 피드백까지1. 대시보드 제작두 개의 노트북(데이터 병합·전처리 노트북 + 머신러닝 노트북)을 기반으로 Streamlit 대시보드를 만들었다. 70개 trip, 타깃은 Distance(km)이고, 최종 모델은 Optuna로 튜닝한 CatBoost(R²≈0.84, MAE≈3.7km)다.화면은 F1 피트월 느낌으로 잡았다. 다크 카본 + 레드 테마에 Orbitron 폰트, 평균 속도를 보여주는 Plotly 속도계 게이지, 예측 거리 대형 표시, KPI 카드(물리 거리 v×t, 주행 시간, SOC 소모, SOC 효율), 모델 성능 지표(R²/MAE/RMSE), feature importance 막대그래프로..

Chapter.7 실전 프로젝트 대시보드(6)

TIL(Today I Learned)1️⃣실전 프로젝트 전처리 및 통계검정(7)오늘 추가한 핵심 작업: Lag / 이동평균 피처의 통계적 정당화문제의식기존 파이프라인에서는 시계열 피처를 만들 때 별 고민 없이 모든 변수에 이동평균(_MA3)과 1초 전 값(_lag1)을 붙였다. 그런데 검증 관점에서 보면 이게 약점이었다. "그냥 만들었다"가 아니라 "데이터가 이런 성질을 가지므로 만들었다"가 되어야 설득력이 생긴다.(1) Ljung-Box 검정 — Lag Feature의 근거 (자기상관성)Lag Feature는 "과거 값이 현재 값을 설명하는가?"를 전제로 한다. 이걸 검증하는 게 자기상관 검정이다.from statsmodels.stats.diagnostic import acorr_ljungboxlb =..

Chapter.7 실전 프로젝트 대시보드(5)

TIL(Today I Learned)1️⃣실전 프로젝트(5)주행거리(Distance)를 회귀 예측 파이프 라인 병합·정제 — 여러 Trip*.csv를 합치고 인코딩/깨진 문자(℃) 수정, 컬럼명 오탈자(Velocity [km/h]]]) 보정.컬럼 축소 — 상관계수 0.9 이상 쌍 + 도메인 판단(HVAC 송풍구 세부 온도 등은 "원인이 아닌 결과값")으로 중복 컬럼 대량 제거.정렬·결측 처리 — Trip_ID/Time 정렬, SoC 등은 Trip별 선형보간, 통째로 빈 컬럼은 삭제.리샘플링 — 0.1초 → 1초 평균.파생변수 — Accel_abs, Total_HVAC, Battery_Power, Temp_gap.이상치 탐색 — 주요 15개 변수 히스토그램+박스플롯으로 확인(대부분 "정상 주행 범위"로..

Chapter.7 실전 프로젝트 대시보드(4)

TIL(Today I Learned)1️⃣실전 프로젝트(4)통계 검정 추가① TripA vs TripB — Mann-Whitney U두 Trip 간 핵심 변수 분포 차이 검정. 전부 유의미하게 나왔지만 중앙값 차이 크기(Diff_%)를 같이 봤을 때 실질적 차이가 작은 변수도 있었고, 차이의 원인이 계절/환경 차이로 설명되기 때문에 합쳐서 학습하는 게 맞다는 결론.② Weather / Route 그룹별 — Kruskal-Wallis날씨·경로 그룹에 따라 SoC, HVAC, Battery_Power 등이 유의미하게 다른지 검정. 전부 p=0.0000으로 나왔지만 초단위 샘플이 수만 개라 작은 차이도 유의하게 잡히는 것. 중앙값 범위로 실질 크기를 같이 봐야 의미 있는 결과.머신러닝 시각화① RMSE 분포 ..