본문 바로가기

[광주 스마트인재개발원]딥러닝 첫걸음, 선형회귀 완벽 가이드!

@히야c2026. 3. 9. 10:46

안녕하세요! 스마트인재개발원에서 딥러닝 과정을 수강하고 있는 교육생입니다. 딥러닝이라는 거대한 산을 오르기 위한 첫걸음으로, 오늘은 딥러닝의 가장 기본적인 개념이자 중요한 축이 되는 '선형회귀(Linear Regression)'에 대해 자세히 알아보는 시간을 가져보려고 합니다. 국비교육내일배움카드를 통해 알찬 학습을 이어가고 있는 저의 교육후기라고도 할 수 있겠네요.

많은 분들이 딥러닝이라고 하면 복잡한 신경망만을 떠올리시겠지만, 사실 선형회귀는 우리가 데이터를 이해하고 예측하는 데 있어 가장 기본적이면서도 강력한 도구 중 하나입니다. 이번 포스팅에서는 선형회귀가 무엇인지, 왜 중요한지, 그리고 모델의 성능을 평가하는 핵심 지표인 MSE와 RMSE에 대해 소개해드리겠습니다. 저와 함께 선형회귀의 세계로 떠나보시죠!

선형회귀(Linear Regression)란 무엇인가요?

선형회귀는 통계학 및 기계 학습에서 가장 기본적인 예측 모델 중 하나입니다. 한 개 이상의 독립 변수(설명 변수)와 종속 변수(반응 변수) 사이의 선형 관계를 모델링하는 방법으로, 쉽게 말해 데이터 포인트들을 가장 잘 대표하는 '직선'을 찾아내는 과정이라고 할 수 있습니다. 이 직선을 통해 우리는 새로운 데이터가 들어왔을 때 그 값을 예측할 수 있게 됩니다. 예를 들어, 공부 시간에 따라 시험 점수가 어떻게 변하는지를 예측하거나, 집 크기에 따라 집값이 어떻게 달라지는지를 예측하는 문제에 활용될 수 있습니다.

선형회귀는 통계적 예측뿐만 아니라 데이터의 경향성을 파악하고, 여러 변수들 간의 관계를 이해하는 데에도 중요한 역할을 합니다. 이 개념을 제대로 이해해야 이후에 배우게 될 복잡한 딥러닝 모델들도 더욱 쉽게 접근할 수 있습니다.

선형회귀의 중요성 및 필요성

그렇다면 우리는 왜 선형회귀를 중요하게 다루고 배워야 할까요? 그 이유는 다음과 같습니다.

  • 딥러닝의 기초: 딥러닝 모델의 많은 부분이 사실 선형회귀의 확장된 형태로 볼 수 있습니다. 각 뉴런 내부에서는 일종의 선형 변환이 일어나고, 이러한 선형 변환들이 겹겹이 쌓여 복잡한 비선형 관계를 학습하게 됩니다. 따라서 선형회귀에 대한 탄탄한 이해는 딥러닝의 원리를 파악하는 데 필수적입니다.
  • 해석 가능성: 다른 복잡한 모델들에 비해 선형회귀는 모델의 결과가 왜 그렇게 나왔는지 해석하기가 매우 용이합니다. 각 변수가 결과에 미치는 영향력을 직관적으로 이해할 수 있어, 비즈니스 의사결정 등 실제 문제 해결에 중요한 통찰력을 제공합니다.
  • 다양한 분야에서의 활용: 경제, 사회학, 공학, 의료 등 거의 모든 분야에서 데이터 간의 관계를 파악하고 미래를 예측하는 데 선형회귀가 광범위하게 사용됩니다. 가장 기본적이지만 강력한 예측 모델로서 그 가치는 여전히 높습니다.

이러한 이유들로 인해 딥러닝 학습의 시작점으로서 선형회귀를 배우는 것은 매우 중요하다고 할 수 있습니다.

선형회귀 모델의 기본, y = wx + b

선형회귀 모델의 가장 기본적인 형태는 1차 방정식으로 표현됩니다. 중학교 수학 시간에 배웠던 직선의 방정식과 매우 유사합니다.

y = wx + b

여기서 각 문자가 의미하는 바는 다음과 같습니다.

  • y: 우리가 예측하고자 하는 종속 변수(출력값)입니다. (예: 집값, 시험 점수)
  • x: 종속 변수에 영향을 미치는 독립 변수(입력값)입니다. (예: 집 크기, 공부 시간)
  • w (Weight, 가중치): 기울기를 의미합니다. x값이 변할 때 y값이 얼마나 변하는지를 나타냅니다. 이 값이 모델의 예측에 가장 큰 영향을 미칩니다.
  • b (Bias, 편향): y절편을 의미합니다. x가 0일 때의 y값으로, 모델의 전반적인 예측 수준을 조정합니다.

선형회귀 모델은 주어진 데이터를 통해 최적의 'w'와 'b' 값을 찾아내는 것을 목표로 합니다. 이 최적의 'w'와 'b'를 찾아야만 실제 데이터와 가장 유사한 예측값을 내는 직선을 그릴 수 있기 때문입니다.

선형회귀 모델 평가하기: MSE와 RMSE

우리가 찾아낸 'w'와 'b'가 과연 얼마나 좋은 값인지, 즉 모델이 얼마나 데이터를 잘 예측하는지 어떻게 알 수 있을까요? 이를 평가하는 지표들이 필요합니다. 선형회귀 모델에서 가장 흔히 사용되는 평가지표로는 MSE와 RMSE가 있습니다.

1. MSE (Mean Squared Error, 평균 제곱 오차)

MSE는 실제 값과 예측 값 사이의 오차(잔차)를 제곱하여 평균을 낸 값입니다. 오차를 제곱하는 이유는 다음과 같습니다.

  • 음수 오차가 양수 오차와 상쇄되는 것을 방지합니다.
  • 오차가 클수록 더 큰 페널티를 부여하여, 모델이 큰 오차를 줄이도록 유도합니다.

MSE는 값이 작을수록 모델의 성능이 좋다는 것을 의미합니다. 수식은 다음과 같습니다.

 

2. RMSE (Root Mean Squared Error, 평균 제곱근 오차)

RMSE는 MSE에 제곱근을 취한 값입니다. MSE의 단점 중 하나는 오차를 제곱하기 때문에 실제 오차보다 값이 훨씬 커지고, 단위 또한 원래 종속 변수의 단위와 달라진다는 점입니다. RMSE는 이러한 문제점을 보완합니다.

  • 제곱근을 취함으로써 오차의 단위를 원래 종속 변수의 단위와 같게 만듭니다. 이 덕분에 MSE보다 직관적으로 모델의 오차를 이해하고 해석하기가 용이합니다.
  • 역시 값이 작을수록 모델의 성능이 좋다는 것을 의미합니다.

RMSE의 수식은 다음과 같습니다.

RMSE는 MSE의 장점을 유지하면서도 해석 가능성을 높여주기 때문에, 실제 모델 평가에 더욱 자주 활용되는 지표입니다.

마무리하며

오늘은 딥러닝의 기본이자 핵심 개념인 선형회귀에 대해 자세히 살펴보았습니다. 선형회귀가 무엇인지, 왜 중요한지, 그리고 모델의 성능을 평가하는 MSE와 RMSE에 대해서도 함께 알아보는 유익한 시간이었기를 바랍니다. 스마트인재개발원에서 배우는 내용들이 이렇게 실질적으로 다가오니 학습의 재미가 배가 되는 것 같습니다.

다음 포스팅에서는 이 선형회귀 모델을 실제로 구현하고, 최적의 'w'와 'b' 값을 찾아내는 과정인 '경사하강법(Gradient Descent)'에 대해 더 깊이 있게 다뤄보도록 하겠습니다. 정보처리기사를 준비하며 광주AI교육광주AI취업을 목표로 하는 모든 분들께 도움이 되는 교육후기가 되기를 바랍니다. 계속해서 흥미로운 딥러닝 여정에 저와 함께 해주세요! 감사합니다.

 

 

스마트인재개발원

취업과 나를 IT다! 빅데이터, 인공지능, 프로그래밍 전문 취업연계교육기관

smhrd.or.kr

 

 

히야c
@히야c :: 여러가지 끄적끄적

코딩+AI

공감하셨다면 ❤️ 구독도 환영합니다! 🤗

목차