분류 전체보기 85

Chapter.9 최종 실전 자동화 프로젝트 (7)

TIL(Today I Learned)1️⃣실전 자동화 프로젝트 (6)오늘의 작업 요약조기종료 유/무 비교를 반영한 베이스라인 모델링 비교및 피처 선택 로직 개선1. 베이스라인 모델링 — 조기종료 유/무 비교목표: Y_Quality(연속형) 예측을 회귀로 학습한 뒤, fold별 임곗값으로 3-클래스 품질 등급을 분류후보 모델 3종: XGBoost, CatBoost, LightGBM타겟 변수 처리Y_Quality를 회귀 타깃으로만 학습, 분류는 사후 처리Product_id, product_code, timestamp, LINE_ 관련 컬럼 등 누수 피처 제거회귀→분류 임곗값도 fold별 train에서만 뽑기주요 내용Y_Quality 자체 회귀 성능(R² 0.54~0.68, 편차 큼)Stratified K-F..

최종 프로젝트 2026.07.02

Chapter.9 최종 실전 자동화 프로젝트 (6)

TIL(Today I Learned)1️⃣실전 자동화 프로젝트 (5)피처 선택 파이프라인전처리.ipynb에서 생성한 A_31_preprocessed.csv, TO_31_preprocessed.csv를 입력으로 받아,타깃(Y_Class) 기준으로 Cross Validation 안에서 피처 중요도를 계산하고 불필요한 피처를 추가로 제거.전처리 단계(결측/분산/상관)는 타깃을 보지 않는 구조적 정리라 전체 데이터에 한 번 적용해도 무방하지만,데이터 누수 방지를 위해 반드시 CV 폴드 안에서 수행.STEP 1. 전처리 결과 불러오기 및 분리load_preprocessed()Y_Quality, Y_Class, PRODUCT_ID, PRODUCT_CODE, TIMESTAMP를 X에서 다시 분리CSV에는 저장을 위해..

최종 프로젝트 2026.07.01

Chapter.9 최종 실전 자동화 프로젝트 (5)

TIL(Today I Learned)1️⃣실전 자동화 프로젝트 (4)데이터 전처리 파이프라인STEP 1. 누수(Leakage) 컬럼 제거모델 학습 시 타깃 정보가 포함되지 않도록 누수 컬럼을 제거한다.타깃 컬럼 Y_Quality 제거PRODUCT_ID, TIMESTAMP는 모델 입력 피처에서 제외단, TIMESTAMP는 시간 기반 검증을 위해 별도로 보관STEP 2. 완전 결측 컬럼 유지완전히 결측(NaN)으로 이루어진 컬럼도 삭제하지 않고 유지한다.모든 값이 NaN인 컬럼 유지결측 여부 자체가 의미를 가질 수 있으므로 제거하지 않음STEP 3. 상수 · 저분산 컬럼 제거정보량이 없는 센서 컬럼을 제거한다.제거 기준nunique() ≤ 1std() = 0STEP 4. 위장 결측값 정규화실제 결측값을 의미..

최종 프로젝트 2026.06.30

Chapter.9 최종 실전 자동화 프로젝트 (4)

TIL(Today I Learned)1️⃣ 이미지 데이터와 불량 검출 5회차멀티모달이란?정의멀티모달 AI는 여러 개의 데이터 형식(modality)을 동시에 처리하고 학습할 수 있는 인공지능 기술입니다.Multi = 여러 개Modal = Modality (데이터 형식)Modality = 텍스트, 이미지, 오디오, 비디오 등의 데이터 형식핵심 특징2개 이상의 데이터 형식을 동시에 입력 가능다양한 형태의 정보를 통합적으로 이해인간의 지각 방식과 유사한 정보 처리멀티모달 vs 멀티모델멀티모달의 3가지 아키텍처Early Fusion은 다양한 모달리티의 데이터를 입력 단계에서 결합한다. 여러 유형의 데이터를 하나의 통합된 특성 벡터로 변환해 모델에 입력하는 방식이다.Late Fusion은 모델의 출력 단계에서 여..

최종 프로젝트 2026.06.29

Chapter.9 최종 실전 자동화 프로젝트 (3)

TIL(Today I Learned)1️⃣이미지 데이터와 불량 검출 4회차Ultralytics 소개YOLO 시리즈의 개발과 배포를 담당하는 AI 비전 전문 기업YOLOv5 ~ YOLOv11 Ultralytics에서 개발하고 유지보수Ultralytics 설치 확인# pip install ultralyticsimport ultralyticsultralytics.checks()Ultralytics 프레임워크 장점}d">항목장점 요약}d">다양한 Task 지원Detect, Classify, Segment, Pose 전부 지원}d">배포 편의성ONNX, TensorRT, CoreML 등 export 지원}d">문서 & 튜토리얼https://docs.ultralytics.com 에 매우 잘 정리되어 있음}d">지속..

최종 프로젝트 2026.06.26

Chapter.9 최종 실전 자동화 프로젝트 (2)

TIL(Today I Learned)1️⃣이미지 데이터와 불량 검출 3회차이미지 분류 vs Object Detection이미지 분류: 이미지가 어떤 객체인가?Object Detection: 어디에 어떤 객체가 있는가?Object Detection의 특징전처리특징 추출분류R-CNN 계열(2-stage) vs YOLO(1-stage) 비교 R-CNN이미지를 영역 제안(Region Proposal)을 통해 여러 개의 작은 후보로 나눈다후보 각각을 CNN에 입력해 특징을 추출한다추출된 특징 벡터를 분류기(SVM)에 입력에 객첼를 분류한다.Bounding Box Regression을 통해 위치를 보정한다.Region Proposal + CNN = 객체탐지 YOLO(you only look once)이미지를 단 ..

최종 프로젝트 2026.06.25

Chapter.9 최종 실전 자동화 프로젝트 (1)

TIL(Today I Learned)1️⃣이미지 데이터와 불량 검출 1,2회차머신러닝과 딥러닝이 차이점 머신러닝: 주어진 데이터를 인간이 처리함, 컴퓨터에 특정 패턴 추출 방법을 지시하고 이후 스스로 분석 축적딥러닝: 컴퓨터가 스스로 데이터를 기반으로 학습할 수 있도록 정해진 신경망을 컴퓨터에 주고, 경험 중심으로 학습 심층 신경망 구조입력층: 데이터를 제공하는 첫 번째 층, 외부로부터 데이터를 받아 내부의 신경망으로 전달은닉층: 데이터의 패턴이나 특징을 학습하는 층, 각 입력값에 특정 가중치를 곱하여 중요한 특징 인식 향상출력층: 결과나 예측을 출력하는 층, 확률을 계산해 가장 높은 답을 출력퍼셉트론퍼셉트론: 뉴런의 작동 방식에서 착안한 가장 기초적인 형태로 인공 신경망 모델 딥러닝구성요소: 인풋, 가..

최종 프로젝트 2026.06.24

Chapter.8 머신러닝 활용 품질관리(6)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 7차원축소 선형적 차원 축소: 데이터를 특정 선형으로 투영하여 차원을 줄이는 방법 비선형 차원 축소: 데이터가 복잡한 기하학적 구조를 가질 때, 비선형 맵핑을 이용 차원 축소와 노이즈 제거 대부분의 데이터에는 잡음(irrelevant feature)이 포함 차원 축소 시 중요한 변동을 설명하지 못하는 데이터를 제거함으로 불필요 정보 필터링PCA데이터의 가장 분산이 큰 방향(주성분)을 찾아 그 방향으로 투영하면 그 축이 데이터의 중요한 변동을 설명할 수 있다. 주성분: 가장 큰 분산이 갖는 방향을 1주성분, 그 다음 큰 분산이 갖는 서로 직교하는 방향을 2주성분설명 분산: 몇 개의 주성분만으로 전체 분산의 몇 퍼센트를 설명할 수 있는..

Chapter.8 머신러닝 활용 품질관리(5)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 6앙상블 기법 배깅과 부스팅을 통해 모델 조합으로 성능 향상 과적합 vs 과소적합과적합: 복잡도 높음 -> 정규화, 드롭아웃, 조기종료, 데이터 증강 등으로 대응 과소적합: 복잡도 낮음 -> 모델 파라미터 수 늘리기, 학습 시간(에폭) 늘리기 하이퍼 파라미터 튜닝GridSearchCV, RandomizedSearchCV 등을 통해 모델 성능 최적화 Fearture Importance 시각화를 통해 트리 기반의 모델의 경우 어느정도 해석도 가능Q1: 배깅(Bagging)과 부스팅(Boosting)의 가장 큰 차이점A1: 배깅은 여러 모델을 ‘병렬적으로’ 독립 학습시킨 뒤 결과를 결합(평균/투표)하는 방식이고, 부스팅은 모델을 ‘순차적..

Chapter.8 머신러닝 활용 품질관리(4)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 5 & 실습 과제부족한 개념 SVM(Support Vector Machine)추가 모델(K-NN, 나이브 베이즈, Naive Bayes, 신경망(MLP) 또는 딥러닝 모델 모델 평가 방법 정리 SVM(Support Vector Machine)데이터를 가장 잘(안전 여유 공간을 크게) 구분하는 경계를 찾는 알고리즘 장점차원이 높은 데이터에서도 좋은 성능 결정 경계(SVM이 찾은 최적의 분류선)을 명확하게 찾는 경우, 예측 성능 우수단점파라미터(C, 커널 종류 등) 적절히 찾아야 하므로 튜닝 비용이 큼 대규모 데이터 세트에 대해서는 학습 속도 느릴 수 있음 SVM 코드 예시 더보기from sklearn.datasets import l..