2026. 4. 25. 15:37ㆍ그로스로그
통계학 : 불확실한 현상을 이해하기 위해 데이터를 수집하고, 데이터 패턴을 요약, 분석하여 불확실한 현상에 대한 결론을 찾는 학문
데이터 : 하나 이상의 변수에 대한 관찰값의 모음
- 단위 : 관측되는 개별 대상
- 변수 : 각 단위에 대해 관측되는 특성
- 관찰값 : 각 단위로부터 관측한 특성의 값
모집단 : 관심 대상이 되는 모든 개체의 모임
표본 : 모집단을 알기 위해 실제로 관측한 모집단의 일부
모수 : 모집단의 특성을 나타내는 대푯값
통계량 : 표본의 특성을 나타내는 대푯값
질적 변수 : 유한개의 범주 중 하나의 값을 가짐
- 명목형 변수: 범주들에 순서를 정할 수 없는 질적 변수
- 순서형 변수: 범주들에 순서를 정할 수 있는 질적 변수
※ 막대그래프
양적 변수 : 양적인 수치로 측정됨
- 연속형 변수: 실수 구간 안의 모든 값을 가질 수 있음
- 이산형 변수: 셀 수 있는 양적 변수
※ 히스토그램, 점도표
최빈값 : 관찰값 중에서 발생빈도가 가장 높은 값
평균 : 양적 변수의 분포의 균형을 이루는 무게중심의 위치에 해당하는 값 (관찰값 총합 / 관찰값 개수)
편차 : 관찰값 - 평균
분산 : 편차의 제곱의 평균 (표본분산)
표준편차 : 분산의 제곱근 (표본표준편차)
분산, 표준편차가 큼 -> 데이터가 평균 중심으로 광범위하게 분포 / 작음 -> 데이터가 평균을 중심으로 조밀하게 모여 있음
변이계수 : 표준편차룰 평균으로 나눈 값
중앙값 : 순서대로 놓인 데이터 중 정확히 중앙에 위치한 값 (특이점 영향 X)
사분위수 : 순서대로 늘어놓은 데이터를 4등분하는 값
p백분위수 : 전체 데이터의 p%가 이 값보다 작거나 같은 값
범위 : 관찰값의 최댓값 - 최솟값 (특이점 영향 심함)
다섯 수치요약: 최솟값, 1사분위수, 중앙값, 3사분위수, 최댓값
상자그림 : 다섯 수치요약을 나타낸 그래프
가설검정 : 모집단으로부터 추출한 표본 데이터를 이용하여 모집단에 대한 가설에 대한 결론을 도출하는 것
귀무가설 : 기존의 가설
대립가설 : 밝히려고 하는 가설
데이터가 귀무가설과 일치 : 귀무가설 기각 X
데이터가 귀무가설과 일치하지 않음 : 귀무가설 기각 & 대립가설 채택
제1종 오류 : 귀무가설 참 but 귀무가설 기각
제2종 오류 : 대립가설 참 but 귀무가설 기각 X
유의확률(p값) : 귀무가설이 참일 때 검정통계량의 값이 우리가 관측한 검정통계량 값보다 더 극단적일 확률
- 대립가설에 가까운 데이터를 관측할수록 p값이 작아짐
- p값 작음 = 데이터가 귀무가설보다는 대립가설을 지지
- p값 < α => 귀무가설 기각