텐서 코어 (Tensor Core)
쉽게 풀면
텐서 코어는 GPU 안에 들어 있는 더 작고 특화된 계산 부품으로, 신경망에서 가장 많이 등장하는 연산인 행렬 곱셈을 한 번에 처리하도록 설계되었다. 일반 GPU 코어로 같은 연산을 하는 것보다 훨씬 빠르며, 특히 정밀도를 낮춘 숫자 표현과 함께 쓰일 때 성능이 극대화된다. 최신 엔비디아 GPU(A100, H100 등)에는 이 텐서 코어가 대량으로 내장되어 있어 딥러닝 학습 속도를 크게 끌어올린다.
왜 중요한가
딥러닝 논문에서 학습 속도와 비용은 모델 성능만큼이나 중요한 실험 변수이며, 텐서 코어 활용 여부는 대형 모델을 현실적인 시간 안에 학습시킬 수 있는지를 가르는 핵심 요인입니다. 대규모 언어모델이나 컴퓨터 비전 모델을 다루는 논문에서는 학습 인프라를 설명할 때 텐서 코어 지원 GPU와 혼합 정밀도 학습을 함께 언급하는 경우가 많으며, 이는 재현성과 비용 산정에도 직결됩니다.
논문에서는 이렇게 쓰입니다
GPU의 텐서 코어가 지닌 가속 성능을 실제로 끌어내기 위해 낮은 정밀도의 숫자 형식을 사용했다는 의미이다.
사용한 하드웨어 사양(텐서 코어 탑재 GPU)을 명시해 실험 재현성과 연산 비용을 독자가 가늠할 수 있도록 했다는 의미이다.
정밀도를 낮춘 숫자 형식(BF16)과 텐서 코어를 함께 사용해 정확도 손실 없이 속도를 개선했다는 의미이다.
조금 더 깊게 보면
텐서 코어는 저정밀도(FP16, BF16, INT8 등) 입력을 받아 곱셈은 낮은 정밀도로, 누적(accumulate)은 더 높은 정밀도로 수행하는 방식으로 속도와 수치 안정성을 동시에 확보합니다. 논문을 읽을 때는 어떤 정밀도 조합을 썼는지, 자동 혼합 정밀도(AMP) 같은 소프트웨어 지원을 함께 사용했는지, 그리고 이러한 최적화가 모델 정확도에 미치는 영향을 별도로 검증했는지를 살펴보는 것이 중요합니다.
주의할 점
텐서 코어의 성능 이점을 온전히 얻으려면 혼합 정밀도 학습처럼 특정 데이터 형식과 함께 사용해야 하는 경우가 많다.