Post-IT

전이 학습, Transfer Learning 본문

인공지능

전이 학습, Transfer Learning

생각없는 개발자 2025. 10. 27. 20:31

전이 학습은 한 작업에서 학습한 지식을 다른 작업에 적용하는 기계학습 기법입니다. 자전거를 탈 줄 아는 사람이 오토바이를 운전할 때 더 빨리 배우는 것처럼, 이미 학습된 모델의 지식을 새로운 문제에 활용하는 것입니다.

전이 학습 기본 원리

전통적인 기계학습에서는 각 작업마다 모델을 처음부터 학습시켜야 했습니다. 하지만 전이 학습은 이미 대규모 데이터로 학습된 모델의 지식을 재사용합니다. 이는 인간의 학습 방식과 유사합니다. 우리는 새로운 것을 배울 때 완전히 백지 상태에서 시작하지 않고, 기존 지식과 경험을 활용합니다.

핵심 아이디어는 모델이 학습한 저수준의 특징들은 여러 작업에 공통적으로 유용하다는 것입니다. 예를 들어, 이미지 인식 모델이 학습한 엣지, 텍스처, 색상, 패턴 같은 기본적인 시각적 특징은 다양한 이미지 관련 작업에 활용될 수 있습니다.

전이 학습이 필요한 이유

현실 세계에서는 충분한 양의 라벨링된 데이터를 확보하기 어렵습니다. 의료 영상 진단을 위한 모델을 만든다고 가정해봅시다. 희귀 질병의 경우 라벨링된 이미지가 몇장 없을 수 있습니다. 이 정도 데이터로 처음부터 딥러닝 모델을 학습시키면 과적합이 발생하고 성능이 매우 낮아집니다.

하지만 ImageNet 같은 대규모 데이터로 사전 학습된 모델을 가져와서 의료 영상 데이터로 미세 조정하게 된다면, 적은 데이터로도 높은 성능을 달성할 수 있습니다. 사전 학습 단계에서 모델은 이미 시각적 패턴을 인식한느 방법을 배웠기 때문입니다. 또한, 대규모 모델을 처음부터 학습시키려면 수백개의 GPU로 정말 오랜 시간동안 학습을 해야하는데 사전 학습된 모델을 사용하면 단일 GPU로도 몇 시간 안에 특정 작업에 맞는 모델을 만들 수 있습니다.

전이 학습의 주요 전략

전이 학습에는 여러 가지 접근 방식이 있으며, 상황에 따라 적절한 방법을 선택해야합니다.

Feature Extraction 방식은 사전 학습된 모델을 고정된 특징 추출기로 사용합니다. 모델의 가중치를 동결하고, 마지막 분류 레이어만 새로운 작업에 맞게 교체합니다. 이 방법은 타겟 데이터셋이 적고, 사전 학습 데이터와 유사할 때 효과적입니다. 학습이 빠르고, 과적합 위험이 적습니다.

Fine-tuning 방식은 사전 학습된 모델의 일부 또는 전체 레이어를 추가로 학습시킵니다. 일반적으로 낮은 레이어는 동결하거나 아주 작은 학습률로 학습시키고, 높은 레이어는 더 큰 학습률로 학습시킵니다. 이는 낮은 레이어가 학습한 일반적인 특징을 보존하면서 높은 레이어가 새로운 작업에 특화되도록 합니다.

Domain Adaption 방식은 소스 도메인과 타겟 도메인 사이의 분포 차이를 줄이는 데 초점을 맞춥니다. 예를 들어, 실제 이미지로 학습한 모델을 합성이 이미지에 적용하거나, 한 언어로 학습한 모델을 다른 언어에 적용할 때 사용됩니다.

컴퓨터 비전에서의 전이 학습

이미지 인식 분야에서 전이 학습은 표준적인 접근 방식이 되었습니다. ResNet, VGG, Inception, EfficientNet 같은 모델들이 ImageNet 데이터셋으로 사전 학습되어 공개되어 있습니다.

실무에서는 다음과 같은 방식으로 활용됩니다. PyTorch나 TensorFlow 같은 프레임워크에서 사전 학습된 모델을 불러옵니다. 그 다음 마지막 분류 레이어를 제거하고 새로운 작업에 맞는 레이어로 교체합니다. 타겟 데이터의 양과 유사성에 따라 학습 전략을 결정합니다.

데이터가 매우 적고 유사한 경우에는 마지막 레이어만 학습시킵니다. 데이터가 중간 정도이고 유사한 경우에는 몇 개 레이어를 fine-tuning합니다. 데이터가 충분하고 다른 경우에는 전체 모델을 fine-tunig하되 낮은 학습률을 사용합니다.

예를 들어, 개와 고양이를 분류하는 모델을 만든다면 ImageNet으로 사전 학습된 ResNet을 가져와서 마지막 1000개 클래스 분류 레이어를 2개 클래스 레이어로 교체하고, 몇 천 장의 개/고양이 이미지로 학습시키면 됩니다.

자연어 처리에서 전이 학습

NLP 분야는 Word2Vec나 GloVe 같은 단어 임베딩만 전이했지만, BERT, GPT 같은 대규모 언어 모델의 등장으로 이제는 전체 언어 모델을 전이합니다. BERT는 Masked Language Modeling과 Next Sentence Prediction으로 사전 학습됩니다. 문장에서 일부 단어를 가리고 맞추거나, 두 문장이 연속된 것인지 판단하는 과제를 통해 언어의 문맥적 의미를 학습합니다. 이렇게 학습된 BERT를 감정 분석, 질의응답, 개체명 인식 등 다양한 작업에 fine-tuning할 수 있습니다.

GPT는 다음 단어 예측으로 사전 학습됩니다. 이는 방대한 텍스트 데이터로 언어의 패턴, 문법, 지식을 학습하게 합니다. GPT-3는 few-shot learning도 가능합니다. 즉, 추가 학습 없이 몇 개의 예시만으로도 새로운 작업을 수행할 수 있습니다.

전이 학습 고려사항

효과적인 전이 학습을 위해서는 몇 가지 실용적인 고려사항이 존재합니다.

학습률 설정이 중요합니다. 사전 학습된 레이어는 작은 학습률을, 새로 추가된 레이어는 큰 학습률을 사용합니다. 이를 차등 학습률(differential learning rate)이라고 합니다. 일반적으로 사전 학습된 레이어는 1e-5 정도, 새 레이어는 1e-3 정도를 사용합니다.

데이터 전처리도 중요합니다. 사전 학습 시 사용된 정규화 방식과 동일하게 적용해야 합니다. ImageNet으로 학습된 모델이라면 ImageNet의 평균과 표준편차로 정규화해야 합니다.

Gradual Unfreezing 기법도 유용합니다. 처음에는 모든 사전 학습된 레이어를 동결하고 마지막 레이어만 학습시킵니다. 그 다음 단계적으로 상위 레이어부터 동결을 해제하며 학습시킵니다. 이는 급격한 가중치 변화를 방지하고 안정적인 학습을 가능하게 합니다.

'인공지능' 카테고리의 다른 글

ML 엔지니어링 용어 정리  (0) 2025.11.20
Top-N Error  (0) 2025.10.28
사전 학습 모델, Pre-trained Model  (0) 2025.10.27