[DATA-006][기초] 평균·분산·상관계수를 올바르게 해석하기 > IT 기술 공유

본문 바로가기
사이트 내 전체검색

IT 기술 공유

[DATA-006][기초] 평균·분산·상관계수를 올바르게 해석하기

페이지 정보

profile_image
작성자 기술팀장
댓글 0건 조회 151회 작성일 26-09-02 04:34

본문

[이번 수업]
평균은 데이터의 중심, 분산은 값들이 퍼진 정도, 상관계수는 두 변수의 선형 관계를 요약합니다. 숫자 하나로 전체 데이터를 설명하므로 계산법보다 해석 조건이 더 중요합니다. 이번에는 같은 자료에서 모집단·표본 분산과 Pearson 상관계수를 계산하고, 무엇을 말할 수 있고 말할 수 없는지 배웁니다.

[선수지식]
CS-001의 숫자 자료형과 PY-003의 리스트를 알면 좋습니다. Python 3.10 이상 표준 라이브러리만 사용합니다.

[학습목표]
1. 산술평균과 분산이 나타내는 정보를 설명한다.
2. 모집단 분산과 표본 분산을 목적에 맞게 선택한다.
3. 상관계수를 선형 관계로 해석하고 인과관계와 구분한다.

[핵심개념]
산술평균은 모든 값을 더해 개수로 나눈 중심값입니다. 모든 관측값을 반영하지만 매우 크거나 작은 값에 민감합니다. 치우친 분포에서는 중앙값, 최솟값·최댓값, 표본 수를 함께 봐야 합니다.

분산은 각 값과 평균의 차이를 제곱해 평균 낸 값입니다. 0이면 모든 값이 같고 클수록 더 퍼져 있습니다. 단위가 제곱되므로 원래 단위로 읽고 싶으면 분산의 제곱근인 표준편차를 봅니다. 가진 자료가 관심 대상 전체라면 모집단 분산을 사용해 `n`으로 나눕니다. 더 큰 모집단을 추정하려고 무작위 표본을 뽑았다면 표본 분산을 사용하며 보통 `n-1`로 나눕니다. “자료가 적다”만으로 둘을 고르는 것이 아니라 자료의 역할로 결정합니다.

Pearson 상관계수 `r`은 -1부터 1 사이에서 두 수치형 변수의 선형 관계 방향과 강도를 나타냅니다. 1에 가까우면 함께 증가하는 직선 관계, -1에 가까우면 한쪽이 증가할 때 다른 쪽이 감소하는 직선 관계입니다. 0에 가까워도 곡선 관계는 있을 수 있습니다. 이상치 하나가 값을 크게 바꿀 수 있으므로 산점도, 표본 수, 측정 방법을 함께 확인해야 합니다. 상관은 원인과 결과를 증명하지 않습니다. 숨은 변수나 우연이 같은 움직임을 만들 수도 있습니다.

[따라하기]
아래를 `stats_demo.py`로 저장합니다.

```python
from statistics import correlation, mean, pvariance, variance

study_hours = [1, 2, 3, 4, 5]
scores = [2, 4, 5, 4, 5]

print("평균:", mean(study_hours))
print("모집단 분산:", pvariance(study_hours))
print("표본 분산:", variance(study_hours))
print("상관계수:", round(correlation(study_hours, scores), 3))
```

macOS·Linux는 `python3 stats_demo.py`, Windows PowerShell은 `python stats_demo.py`로 실행합니다.

```text
평균: 3
모집단 분산: 2
표본 분산: 2.5
상관계수: 0.775
```

평균 공부 시간은 3이고 모집단 분산은 2입니다. 같은 다섯 값을 더 큰 집단의 표본으로 보면 `n-1`을 쓰므로 분산이 2.5가 됩니다. 상관계수 0.775는 이 자료에서 양의 선형 관계가 있다는 뜻이지만, 공부 시간이 점수 상승의 원인임을 증명하지는 않습니다.

[흔한 실수]
평균만 보고 분포가 고르다고 판단하지 않습니다. 모집단과 표본의 의미를 정하지 않은 채 분모를 선택하지 않습니다. 상관계수의 절댓값만 보고 산점도와 이상치를 생략하지 않습니다. 서로 다른 집단을 합친 값이 각 집단의 관계와 다를 수 있으며, 반올림된 결과로 정밀한 결론을 내리지 않습니다.

[보안 주의]
실제 데이터에는 개인정보와 민감한 속성이 섞일 수 있습니다. 분석 목적에 필요한 열과 기간만 수집하고 접근 권한·보관 기간을 제한합니다. 작은 집단의 평균도 개인을 추정하게 만들 수 있으므로 최소 집계 인원과 공개 기준을 둡니다. 원본 행을 예제나 로그에 복사하지 말고 가명·합성 데이터를 사용합니다. 이번 실습은 로컬의 가상 숫자만 처리합니다.

[직접 해볼 과제]
`scores`의 마지막 값을 50으로 바꿔 평균·분산·상관계수를 다시 계산하세요. 원래 결과와 비교하고 이상치가 해석에 미친 영향을 네 문장으로 적습니다.

[확인문제]
1. 모집단 분산과 표본 분산은 어떤 기준으로 선택하나요?
2. 상관계수가 0에 가까우면 두 변수 사이에 아무 관계도 없다고 말할 수 있나요?
3. 높은 양의 상관계수만으로 인과관계를 증명할 수 없는 이유는 무엇인가요?

[다음 학습]
DATA-007에서는 평균·분산·상관을 표와 산점도에 올바르게 표현하고 오해를 줄이는 시각화 원칙을 배웁니다.

[공식 참고 자료]
- 수학 통계 함수: https://docs.python.org/3/library/statistics.html
- 평균·분산·공분산: https://www.itl.nist.gov/div898/handbook/pmc/section5/pmc541.htm
- 상관계수 정의: https://www.itl.nist.gov/div898/handbook/pmc/section5/pmc542.htm
- 상관과 인과의 구분: https://www.itl.nist.gov/div898/handbook/ppc/section1/ppc136.htm

댓글목록

등록된 댓글이 없습니다.

회원로그인

회원가입

사이트 정보

회사명 : 회사명 / 대표 : 대표자명
주소 : OO도 OO시 OO구 OO동 123-45
사업자 등록번호 : 123-45-67890
전화 : 02-123-4567 팩스 : 02-123-4568
통신판매업신고번호 : 제 OO구 - 123호
개인정보관리책임자 : 정보책임자명

접속자집계

오늘
3,904
어제
6,862
최대
16,772
전체
769,855
Copyright © 소유하신 도메인. All rights reserved.