판다스(pandas) (pandas (Python Library))

통계
한 줄 정의: 파이썬에서 표 형태의 데이터를 불러오고 정리, 가공, 요약하는 데 널리 쓰이는 오픈소스 데이터 처리 라이브러리.

쉽게 풀면

통계분석을 하기 전에는 자료를 불러오고, 결측치를 처리하고, 필요한 형태로 정리하는 작업이 먼저 필요한데, 판다스는 이런 데이터 전처리 작업을 파이썬에서 효율적으로 할 수 있게 해주는 도구다. 엑셀의 표와 비슷한 '데이터프레임'이라는 구조를 이용해 데이터를 다루며, 이렇게 정리된 자료를 statsmodels 같은 통계 라이브러리로 넘겨 분석을 진행하는 경우가 많다.

왜 중요한가

데이터 분석 연구에서 결과의 신뢰성은 분석 기법 이전에 데이터 전처리 과정이 얼마나 꼼꼼했는지에 크게 좌우되는데, pandas는 이 전처리 단계를 재현 가능하고 표준화된 코드로 남길 수 있게 해줍니다. 그래서 사회과학의 설문 데이터 정리부터 생물정보학의 대규모 유전체 데이터 가공, 머신러닝 파이프라인의 특성 공학까지, 정량 연구 전반에서 사실상 표준 도구처럼 언급되는 경우가 많습니다.

논문에서는 이렇게 쓰입니다

"수집된 원자료는 파이썬 pandas 라이브러리를 이용하여 전처리한 뒤 통계분석에 사용하였다."

통계분석 이전 단계에서 자료를 정리하고 가공하는 작업을 pandas라는 도구로 수행했다는 뜻이다.

"설문조사 응답 데이터는 pandas를 이용해 결측치를 제거하고 응답 척도를 표준화한 뒤 군집분석에 투입하였다."

사회과학 연구에서 설문 데이터의 결측치 처리와 척도 변환 같은 정제 작업에 pandas가 활용되는 사례이다.

"대규모 임상 데이터베이스에서 추출한 시계열 생체신호는 pandas의 데이터프레임 구조로 변환한 뒤 특성 추출 및 모델 학습에 사용되었다."

의료 데이터 분석과 머신러닝 파이프라인의 초기 단계에서 pandas가 데이터 구조화 도구로 쓰이는 예시이다.

조금 더 깊게 보면

pandas의 핵심 자료구조인 데이터프레임은 행과 열에 이름표(인덱스)가 붙은 표 형태로, 조건에 따른 행 선택, 그룹별 집계(groupby), 서로 다른 표를 합치는 병합(merge/join) 같은 연산을 비교적 간결한 코드로 처리할 수 있게 해줍니다. 내부적으로는 NumPy 배열을 기반으로 동작해 대용량 수치 연산에서도 비교적 빠른 편이지만, 아주 큰 데이터셋에서는 메모리 사용량이 문제가 되어 Dask나 폴라스(Polars) 같은 대안 라이브러리가 함께 언급되기도 합니다.

주의할 점

pandas 자체는 통계적 유의성 검정 기능을 제공하지 않으므로, 실제 가설검정에는 statsmodels 등 별도의 통계 라이브러리가 함께 사용된다.

관련 용어