데이터 분석 프로젝트

Chapter.3 데이터 분석 팀 과제(1)

devjjun 2026. 4. 2. 20:41

TIL(Today I Learned)


1️⃣팀 프로젝트 주제 선정 및 기획서 작성 

주제

식품 부작용 신고 데이터를 전처리(Preprocessing)하고 위험 요인을 탐색(EDA)하라

예시 데이터

RA_Report AEC_Event Start Date PRI_Product Role PRI_Reported Brand/Product Name PRI_FDA Industry Name CI_Age at Adverse Event CI_Age Unit CI_Gender
65325 8/4/2003 Suspect MIDWEST COUNTRY FAIR CHOCOLATE Bakery Prod/Dough/Mix 2 Year(s) Female
65333 1/1/2004 Suspect KROGER CLASSIC MINT ICE CREAM Ice Cream Prod Not Available Not Available Female
65335 11/24/2003 Suspect ENFAMIL LIPIL BABY FORMULA Baby Food Prod 3 Month(s) Not Available
65345 12/21/2003 Suspect FRITO LAY FUNYUNS ONION Snack Food Item 10 Year(s) Male

 

데이터는 12개의 컬럼으로 구성된 FDA 부작용 신고 기록입니다.

  • RA_Report: 고유 신고 ID.
  • RA_CAERS Created Date: 리포트 생성 날짜.
  • AEC_Event Start Date: 부작용 발생 시작 날짜.
  • PRI_Product Role: 제품의 역할 (Suspect: 의심 제품).
  • PRI_Reported Brand/Product Name: 신고된 브랜드 또는 제품명 (대문자로 표기됨).
  • PRI_FDA Industry Name: FDA 산업 분류명 (예: Bakery, Ice Cream Prod, Baby Food Prod, Snack Food).
  • CI_Age at Adverse Event: 피해자의 나이 (숫자).
  • CI_Age Unit: 나이의 단위 (Year(s), Month(s), Day(s) 등). [주의: 전처리 필수]
  • CI_Gender: 피해자의 성별 (Male, Female).

프로젝트 기획서 

https://www.notion.so/teamsparta/4-3362dc3ef514805da4e6d8a99337b1a6


2️⃣Python 알고리즘 주요 문제 

문제1

    • 문제 접근: 기준 변수를 하나 잡고 section을 순회하며 현재의 위치가 마지막에 칠해진 부분보다 크면 새로 칠해야 하고 이하면 스킵한다.
  • 코드
def solution(n, m, section):
    count = 0
    last_painted = 0

    for i in section:
        if i > last_painted:
            count += 1
            last_painted = i + m - 1

    return count

 


💡 느낀점

실제 데이터를 분석하는 팀 단위 프로젝트가 시작됨에 따라 기획서를 작성하는 부분에서 가설을 세우고 활용할 전처리 및 시각화의 계획을 세우는 것이 상당히 오래 걸렸다. 단순히 시각화에만 치중되는 것이 아니라 데이터의 핵심을 보고 이를 활용하고 컬럼끼리 접목시켜 논리적인 결과를 도출하는 것이 중요할 것 같다.