2026/06 19

Chapter.9 최종 실전 자동화 프로젝트 (5)

TIL(Today I Learned)1️⃣실전 자동화 프로젝트 (4)데이터 전처리 파이프라인STEP 1. 누수(Leakage) 컬럼 제거모델 학습 시 타깃 정보가 포함되지 않도록 누수 컬럼을 제거한다.타깃 컬럼 Y_Quality 제거PRODUCT_ID, TIMESTAMP는 모델 입력 피처에서 제외단, TIMESTAMP는 시간 기반 검증을 위해 별도로 보관STEP 2. 완전 결측 컬럼 유지완전히 결측(NaN)으로 이루어진 컬럼도 삭제하지 않고 유지한다.모든 값이 NaN인 컬럼 유지결측 여부 자체가 의미를 가질 수 있으므로 제거하지 않음STEP 3. 상수 · 저분산 컬럼 제거정보량이 없는 센서 컬럼을 제거한다.제거 기준nunique() ≤ 1std() = 0STEP 4. 위장 결측값 정규화실제 결측값을 의미..

최종 프로젝트 2026.06.30

Chapter.9 최종 실전 자동화 프로젝트 (4)

TIL(Today I Learned)1️⃣ 이미지 데이터와 불량 검출 5회차멀티모달이란?정의멀티모달 AI는 여러 개의 데이터 형식(modality)을 동시에 처리하고 학습할 수 있는 인공지능 기술입니다.Multi = 여러 개Modal = Modality (데이터 형식)Modality = 텍스트, 이미지, 오디오, 비디오 등의 데이터 형식핵심 특징2개 이상의 데이터 형식을 동시에 입력 가능다양한 형태의 정보를 통합적으로 이해인간의 지각 방식과 유사한 정보 처리멀티모달 vs 멀티모델멀티모달의 3가지 아키텍처Early Fusion은 다양한 모달리티의 데이터를 입력 단계에서 결합한다. 여러 유형의 데이터를 하나의 통합된 특성 벡터로 변환해 모델에 입력하는 방식이다.Late Fusion은 모델의 출력 단계에서 여..

최종 프로젝트 2026.06.29

Chapter.9 최종 실전 자동화 프로젝트 (3)

TIL(Today I Learned)1️⃣이미지 데이터와 불량 검출 4회차Ultralytics 소개YOLO 시리즈의 개발과 배포를 담당하는 AI 비전 전문 기업YOLOv5 ~ YOLOv11 Ultralytics에서 개발하고 유지보수Ultralytics 설치 확인# pip install ultralyticsimport ultralyticsultralytics.checks()Ultralytics 프레임워크 장점}d">항목장점 요약}d">다양한 Task 지원Detect, Classify, Segment, Pose 전부 지원}d">배포 편의성ONNX, TensorRT, CoreML 등 export 지원}d">문서 & 튜토리얼https://docs.ultralytics.com 에 매우 잘 정리되어 있음}d">지속..

최종 프로젝트 2026.06.26

Chapter.9 최종 실전 자동화 프로젝트 (2)

TIL(Today I Learned)1️⃣이미지 데이터와 불량 검출 3회차이미지 분류 vs Object Detection이미지 분류: 이미지가 어떤 객체인가?Object Detection: 어디에 어떤 객체가 있는가?Object Detection의 특징전처리특징 추출분류R-CNN 계열(2-stage) vs YOLO(1-stage) 비교 R-CNN이미지를 영역 제안(Region Proposal)을 통해 여러 개의 작은 후보로 나눈다후보 각각을 CNN에 입력해 특징을 추출한다추출된 특징 벡터를 분류기(SVM)에 입력에 객첼를 분류한다.Bounding Box Regression을 통해 위치를 보정한다.Region Proposal + CNN = 객체탐지 YOLO(you only look once)이미지를 단 ..

최종 프로젝트 2026.06.25

Chapter.9 최종 실전 자동화 프로젝트 (1)

TIL(Today I Learned)1️⃣이미지 데이터와 불량 검출 1,2회차머신러닝과 딥러닝이 차이점 머신러닝: 주어진 데이터를 인간이 처리함, 컴퓨터에 특정 패턴 추출 방법을 지시하고 이후 스스로 분석 축적딥러닝: 컴퓨터가 스스로 데이터를 기반으로 학습할 수 있도록 정해진 신경망을 컴퓨터에 주고, 경험 중심으로 학습 심층 신경망 구조입력층: 데이터를 제공하는 첫 번째 층, 외부로부터 데이터를 받아 내부의 신경망으로 전달은닉층: 데이터의 패턴이나 특징을 학습하는 층, 각 입력값에 특정 가중치를 곱하여 중요한 특징 인식 향상출력층: 결과나 예측을 출력하는 층, 확률을 계산해 가장 높은 답을 출력퍼셉트론퍼셉트론: 뉴런의 작동 방식에서 착안한 가장 기초적인 형태로 인공 신경망 모델 딥러닝구성요소: 인풋, 가..

최종 프로젝트 2026.06.24

Chapter.8 머신러닝 활용 품질관리(6)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 7차원축소 선형적 차원 축소: 데이터를 특정 선형으로 투영하여 차원을 줄이는 방법 비선형 차원 축소: 데이터가 복잡한 기하학적 구조를 가질 때, 비선형 맵핑을 이용 차원 축소와 노이즈 제거 대부분의 데이터에는 잡음(irrelevant feature)이 포함 차원 축소 시 중요한 변동을 설명하지 못하는 데이터를 제거함으로 불필요 정보 필터링PCA데이터의 가장 분산이 큰 방향(주성분)을 찾아 그 방향으로 투영하면 그 축이 데이터의 중요한 변동을 설명할 수 있다. 주성분: 가장 큰 분산이 갖는 방향을 1주성분, 그 다음 큰 분산이 갖는 서로 직교하는 방향을 2주성분설명 분산: 몇 개의 주성분만으로 전체 분산의 몇 퍼센트를 설명할 수 있는..

Chapter.8 머신러닝 활용 품질관리(5)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 6앙상블 기법 배깅과 부스팅을 통해 모델 조합으로 성능 향상 과적합 vs 과소적합과적합: 복잡도 높음 -> 정규화, 드롭아웃, 조기종료, 데이터 증강 등으로 대응 과소적합: 복잡도 낮음 -> 모델 파라미터 수 늘리기, 학습 시간(에폭) 늘리기 하이퍼 파라미터 튜닝GridSearchCV, RandomizedSearchCV 등을 통해 모델 성능 최적화 Fearture Importance 시각화를 통해 트리 기반의 모델의 경우 어느정도 해석도 가능Q1: 배깅(Bagging)과 부스팅(Boosting)의 가장 큰 차이점A1: 배깅은 여러 모델을 ‘병렬적으로’ 독립 학습시킨 뒤 결과를 결합(평균/투표)하는 방식이고, 부스팅은 모델을 ‘순차적..

Chapter.8 머신러닝 활용 품질관리(4)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 5 & 실습 과제부족한 개념 SVM(Support Vector Machine)추가 모델(K-NN, 나이브 베이즈, Naive Bayes, 신경망(MLP) 또는 딥러닝 모델 모델 평가 방법 정리 SVM(Support Vector Machine)데이터를 가장 잘(안전 여유 공간을 크게) 구분하는 경계를 찾는 알고리즘 장점차원이 높은 데이터에서도 좋은 성능 결정 경계(SVM이 찾은 최적의 분류선)을 명확하게 찾는 경우, 예측 성능 우수단점파라미터(C, 커널 종류 등) 적절히 찾아야 하므로 튜닝 비용이 큼 대규모 데이터 세트에 대해서는 학습 속도 느릴 수 있음 SVM 코드 예시 더보기from sklearn.datasets import l..

Chapter.8 머신러닝 활용 품질관리(3)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 2 실습 총 정리결측치와 이상치를 올바르게 처리하는 것이 모델의 기초 불균형 데이터 문제를 해결하지 않으면 소수 클래스(불량)을 놓칠 수 있다.범주형 변수는 원-핫 인코딩, 레이블 인코딩 등으로 적절히 반환 피처 엔지니어링을 통해 데이터에서 추가정보(패턴)을 추출하거나,중요하지 않은 변수는 제거해 모델의 효율과 성능을 높일 수 있다.전처리와 피처 엔지니어링 과정에서의 모든 선택(결측치 처리 방식, 이상치 제거 기준 등)은도메인 지식과 데이터 탐색(EDA) 결과를 함께 고려해야 한다. 주요 질문 및 답변 Q1.결측치 처리 시 예측모델을 쓰는 경우 A1. 결측치가 중요한 변수이거나, 전체 데이터의 상당 부분을 차지하는 경우 Q2.이상치..

Chapter.8 머신러닝 활용 품질관리(2)

TIL(Today I Learned)1️⃣실무에 바로 쓰는 머신러닝 기초 2데이터 전처리란?원시(raw) 데이터에서 불필요하거나 손실(노이즈)이 있는 부분을 처리하고 분석 목적에 맞는 형태로 만드는 과정 필요성모델 정확도 및 신뢰도 향상이상치나 결측치가 존재하면 모델 학습 성능이 크게 떨어짐효율적인 데이터 분석과 모델 훈련을 위한 필수적인 단계결측치 처리결측치 발생 원인삭제(Removal)결측치가 있는 행(row) 또는 열(column)을 제거->간단하지만 데이터 손실이 발생->결측치가 전체 데이터에서 매우 소수일 때 적합대치(Imputation)평균 또는 중앙값으로 대체 ->수치형 데이터에서 많이 사용/분포 왜곡 적음최빈값으로 대체 -> 범주형 데이터에서 사용예측 모델로 대체-> 회귀/분류 모델을 이용..