콘텐츠로 이동

계량분석 기초

확률변수 XX기대값 은 가능한 결과에 확률을 가중하여 합산한 값이다.

E(X)=ixiP(xi)E(X) = \sum_{i} x_i \cdot P(x_i)

연속형 자산 수익률의 경우 과거 관측치의 평균으로 추정한다.

분산(Variance) 은 기대값 주변의 흩어짐 정도를 측정한다.

σ2=E[(Xμ)2]=i(xiμ)2P(xi)\sigma^2 = E[(X - \mu)^2] = \sum_{i} (x_i - \mu)^2 \cdot P(x_i)

표준편차 σ\sigma 는 분산의 제곱근이며, 원래 단위와 동일하여 해석이 용이하다. 투자에서는 수익률의 표준편차를 위험(Risk) 의 척도로 사용한다.

두 자산 수익률의 동조 방향성과 크기 를 측정한다.

Cov(RA,RB)=E[(RAμA)(RBμB)]Cov(R_A, R_B) = E[(R_A - \mu_A)(R_B - \mu_B)]

  • 양(+): 두 자산이 같은 방향으로 움직이는 경향
  • 음(-): 두 자산이 반대 방향으로 움직이는 경향
  • 0: 두 자산 간 선형 관계 없음

공분산을 각 자산의 표준편차로 나누어 표준화 한 값이다.

ρAB=Cov(RA,RB)σAσB\rho_{AB} = \frac{Cov(R_A, R_B)}{\sigma_A \cdot \sigma_B}

ρ\rho 의 범위는 1ρ1-1 \leq \rho \leq 1 이며, ρ=1\rho = -1 이면 완전 음의 상관, ρ=1\rho = 1 이면 완전 양의 상관이다. ρ<1\rho < 1 인 경우 분산투자로 포트폴리오 위험을 낮출 수 있다.


정규분포(Normal Distribution) 는 평균을 중심으로 좌우 대칭인 종 모양의 분포다. 수익률 분포를 정규분포로 가정하는 경우가 많다.

f(x)=1σ2πe(xμ)22σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x-\mu)^2}{2\sigma^2}}

표준정규분포 는 평균 0, 표준편차 1인 정규분포다. 임의의 정규분포를 표준화하면 표준정규분포를 따른다.

Z=XμσZ = \frac{X - \mu}{\sigma}

범위포함 확률
μ±1σ\mu \pm 1\sigma약 68.3%
μ±1.65σ\mu \pm 1.65\sigma약 90% (단측 5%)
μ±1.96σ\mu \pm 1.96\sigma약 95%
μ±2.58σ\mu \pm 2.58\sigma약 99%

VaR 계산 시 신뢰수준 95%는 z=1.65z = 1.65, 99%는 z=2.33z = 2.33 을 사용한다.


종속변수 YY 를 하나의 독립변수 XX 로 설명하는 모형이다.

Yi=α+βXi+ϵiY_i = \alpha + \beta X_i + \epsilon_i

  • α\alpha: 절편(상수항)
  • β\beta: 기울기(독립변수 1단위 변화 시 종속변수 변화량)
  • ϵi\epsilon_i: 오차항

금융에서는 주식 수익률(RiR_i)을 시장수익률(RmR_m)로 회귀하는 CAPM 회귀 가 대표적이다.

Ri=αi+βiRm+ϵiR_i = \alpha_i + \beta_i R_m + \epsilon_i

복수의 독립변수로 종속변수를 설명하는 모형이다.

Yi=α+β1X1i+β2X2i++βkXki+ϵiY_i = \alpha + \beta_1 X_{1i} + \beta_2 X_{2i} + \cdots + \beta_k X_{ki} + \epsilon_i

다중 회귀에서는 다중공선성(Multicollinearity) 문제(독립변수 간 높은 상관관계)에 주의해야 한다.


결정계수 는 회귀모형이 종속변수의 변동을 얼마나 설명하는지 나타내는 지표다.

R2=1SSESST=SSRSSTR^2 = 1 - \frac{SSE}{SST} = \frac{SSR}{SST}

  • SSTSST: 총 변동, SSRSSR: 회귀로 설명된 변동, SSESSE: 잔차 변동
  • 0R210 \leq R^2 \leq 1 이며, 1에 가까울수록 모형 설명력이 높음
  • 단순 회귀에서 R2=ρ2R^2 = \rho^2 (상관계수의 제곱)

t-검정 은 표본에서 추정한 모수가 통계적으로 유의한지 검정하는 방법이다. 회귀계수가 0과 유의하게 다른지 검정할 때 사용한다.

t=β^0SE(β^)t = \frac{\hat{\beta} - 0}{SE(\hat{\beta})}

t|t| 값이 임계값(자유도와 유의수준에 따라 결정)보다 크면 귀무가설(계수 = 0)을 기각한다. 실무에서는 p-값 이 0.05 미만이면 5% 수준에서 유의하다고 판단한다.


시계열(Time Series) 은 동일 변수를 시간 순서로 관측한 데이터다. 금융 데이터의 대부분이 시계열이다.

  • 정상성(Stationarity): 평균과 분산이 시간에 따라 변하지 않는 성질. 대부분의 통계 분석이 정상 시계열을 가정한다.
  • 단위근(Unit Root): 주가처럼 시간에 따라 추세가 있는 비정상 시계열. 차분(Differencing)으로 정상화할 수 있다.
  • 자기상관(Autocorrelation): 현재 값과 과거 값 간의 상관관계. 더빈-왓슨 검정으로 확인한다.
  • 이동평균(Moving Average): 일정 기간의 평균값을 시계열로 나타내어 추세를 파악하는 방법이다.