분산분석 (Analysis of Variance)
쉽게 풀면
세 가지 다른 재료로 만든 제품의 강도를 비교한다고 해봅시다. 각 재료별로 여러 번 측정한 강도 값들이 있을 때, 재료 간 평균 강도의 차이가 진짜 재료 때문인지, 아니면 측정할 때마다 생기는 자연스러운 편차 때문인지 구분해야 합니다. 분산분석은 전체 데이터의 흩어진 정도(분산)를 집단 간 차이로 인한 부분과 집단 내 오차로 인한 부분으로 나누어, 두 부분의 크기를 비교함으로써 집단 간 차이가 우연이 아니라고 판단할 수 있는지 알려줍니다.
왜 중요한가
산업공학에서는 여러 공정 조건, 원자재, 설비 설정 등 세 개 이상의 대안을 동시에 비교해야 하는 실험이 흔합니다. 분산분석은 이런 다중 집단 비교를 한 번의 검정으로 처리할 수 있게 해주어 실험계획법의 핵심 분석 도구로 쓰입니다.
논문에서는 이렇게 쓰입니다
절삭 속도라는 하나의 요인이 세 가지 수준으로 나뉠 때, 표면 거칠기 평균이 조건별로 실제로 다른지 분산분석으로 확인했다는 뜻입니다.
두 가지 요인(숙련도, 설비 종류)이 결과에 미치는 영향과 두 요인이 함께 작용할 때의 효과를 동시에 분석했다는 의미입니다.
조금 더 깊게 보면
분산분석은 요인의 개수에 따라 일원분산분석(요인 1개), 이원분산분석(요인 2개) 등으로 구분됩니다. 검정 통계량으로 F값을 사용하며, 이는 집단 간 분산을 집단 내 분산으로 나눈 값입니다. F값이 충분히 크면 집단 간 평균 차이가 우연이 아니라고 판단하며, 유의한 차이가 발견되면 어느 집단들 사이에 차이가 있는지 확인하기 위한 사후검정을 추가로 수행하는 경우가 많습니다.
주의할 점
분산분석은 각 집단의 데이터가 정규분포를 따르고 분산이 서로 비슷하다는 가정을 전제로 합니다. 이 가정이 크게 어긋나면 결과 해석에 주의가 필요하며, 유의한 차이가 어느 집단 사이에 있는지는 분산분석 자체만으로는 알 수 없습니다.