TIL(Today I Learned)
1️⃣머신러닝 기초 용어정리
선형회귀
- Y (종속 변수): 결과 변수, 우리가 예측하거나 설명하려는 대상
- X (독립 변수): 원인 변수, 설명 변수 (Y에 영향을 주는 변수)
선형 회귀는 다음과 같은 식으로 표현된다:
Y=β0+β1X+εY
- β0(절편, Bias)
→ X가 0일 때 Y의 예상값 - β1(회귀 계수)
→ X가 1 증가할 때 Y가 얼마나 변하는지 나타냄 - ε(오차, Error)
→ 모델이 설명하지 못하는 Y의 변동 (실제값과 예측값의 차이)
머신러닝 / 딥러닝에서의 선형 회귀
머신러닝에서는 선형 회귀를 다음과 같이 표현한다:
Y=wX+b
- w(가중치, Weight)
→ 입력값 X가 결과 Y에 미치는 영향력 (기울기) - b (편향, Bias)
→ 모델의 기본값 (X가 0일 때의 출력값)
통계학과의 차이점
- 통계학에서는 오차항 ε을 명시적으로 포함
- 머신러닝/딥러닝에서는
👉 오차항을 따로 표현하지 않고
**손실 함수(Loss Function)**를 통해 간접적으로 다룸
📌 머신러닝에서는 선형 회귀를 가중치(w)와 편향(b)을 학습하는 과정으로 이해한다.
회귀분석 평가 지표
선형회귀 모델을 만들었다면,
👉 이 모델이 얼마나 잘 예측하는지 평가하는 과정이 필요하다.
MSE (Mean Squared Error)
모델의 예측 성능은 “에러(오차)”를 기반으로 정의된다.
에러 정의 과정
1️⃣에러 정의
→ 실제값 - 예측값
2️⃣ 제곱해서 모두 양수로 변환 + 합산
→ 음수 제거 및 큰 오차에 더 큰 패널티 부여
3️⃣ 평균 계산
→ 데이터 개수로 나눔
👉 오차를 제곱한 뒤 평균낸 값 = MSE
특징
- 값이 작을수록 좋은 모델
- 큰 오차에 더 민감 (제곱 때문)
기타 회귀 평가지표
RMSE (Root Mean Squared Error)
- MSE에 루트를 씌운 값
- 👉 원래 데이터 단위로 복원
선형회귀의 대표 지표 – R² (결정계수)
개념
- 모델이 데이터를 얼마나 잘 설명하는지를 나타내는 지표
해석
- 1에 가까울수록 좋음 → 설명력 높음
- 0에 가까움 → 모델이 거의 설명 못함
- 음수도 가능 → 평균으로 예측하는 것보다 못한 모델
한 줄 정리
- MSE / RMSE / MAE → “얼마나 틀렸는가”
- R² → “얼마나 잘 설명하는가”
로지스틱 회귀 (Logistic Regression)
👉 이진 분류 문제를 위한 모델
(예: 합격/불합격, 구매/미구매)
모델 구조
1️⃣ 선형 결합
2️⃣ 시그모이드 함수로 확률 변환
👉 최종적으로
→ 출력값: 0 ~ 1 (확률)
분류 기준
- 보통 0.5 기준으로 분류
- 0.5 이상 → 1
- 0.5 미만 → 0
선형회귀 vs 로지스틱 회귀
| 목적 | 숫자 예측 | 분류 |
| 출력값 | -∞ ~ ∞ | 0 ~ 1 |
| 함수 | 직선 | 시그모이드 |
| 손실함수 | MSE | Cross Entropy |
한 줄 정리
📌로지스틱 회귀는 선형식을 확률로 변환해서 분류하는 모델이다.
💡 느낀점
선형회귀와 로지스틱 회귀를 비교해보면서, 같은 선형 구조를 사용하더라도 문제의 성격에 따라 접근 방식이 달라진다는 점이 인상적이었다. 특히 로지스틱 회귀가 확률 개념을 통해 분류 문제를 해결하는 방식이 흥미로웠다.단순히 모델을 사용하는 것보다, 문제 유형에 맞는 모델과 평가 지표를 선택하는 것이 중요하다는 걸 느꼈다.
'데이터 분석 심화' 카테고리의 다른 글
| Chapter.4 데이터 분석 심화(7) (0) | 2026.04.21 |
|---|---|
| Chapter.4 데이터 분석 심화(6) (1) | 2026.04.20 |
| Chapter.4 데이터 분석 심화(4) (0) | 2026.04.16 |
| Chapter.4 데이터 분석 심화(3) (1) | 2026.04.15 |
| Chapter.4 데이터 분석 심화(2) (1) | 2026.04.14 |