본문으로 이동
메뉴 여닫기
환경 설정 메뉴 여닫기
개인 메뉴 여닫기
로그인하지 않음
지금 편집한다면 당신의 IP 주소가 공개될 수 있습니다.

매개변수 효율적 미세조정

IT 위키

매개변수 효율적 미세조정(Parameter-Efficient Fine-Tuning, PEFT)은 사전학습된 파운데이션 모델의 전체 매개변수를 다시 학습하지 않고 일부 매개변수만 조정하거나 소규모의 학습 가능한 매개변수를 추가하여 적은 연산·메모리 비용으로 모델을 특정 작업에 적응시키는 미세조정 방법의 총칭이다.

대형 언어 모델의 규모가 수십억~수천억 개의 매개변수로 증가하면서 모델 전체를 다시 학습하는 전체 미세조정(Full Fine-Tuning)의 비용도 크게 증가했다.

전체 미세조정에서는 모델의 많은 가중치뿐 아니라 학습 과정에 필요한 그래디언트와 옵티마이저 상태 등을 메모리에 유지해야 한다. 또한 용도별로 전체 모델의 가중치를 별도로 저장하면 저장 공간도 크게 증가한다.

매개변수 효율적 미세조정(PEFT)은 이러한 문제를 줄이기 위해 기반 모델의 대부분을 고정하고 전체 매개변수 가운데 일부만 학습하거나, 비교적 작은 추가 매개변수를 삽입하여 학습한다.

Hugging Face는 PEFT를 사전학습된 모델의 모든 매개변수를 미세조정하지 않고 소수의 추가 모델 매개변수만 학습함으로써 계산 및 저장 비용을 크게 줄이는 방법으로 설명한다.[1]

전체 미세조정

사전학습 모델
 ├─ 가중치 A ─ 학습
 ├─ 가중치 B ─ 학습
 ├─ 가중치 C ─ 학습
 └─ 가중치 D ─ 학습


PEFT

사전학습 모델
 ├─ 가중치 A ─ 고정
 ├─ 가중치 B ─ 고정
 ├─ 가중치 C ─ 고정
 └─ 추가·선택 매개변수 ─ 학습

PEFT는 하나의 단일 알고리즘이 아니라 이러한 목적을 가진 여러 기법의 상위 개념이다. 대표적으로 LoRA, Adapter, Prefix Tuning, Prompt Tuning, IA3 등이 있다.

초기의 전이 학습에서는 사전학습된 모델 전체를 특정 작업의 데이터로 다시 학습하는 방식이 널리 사용됐다.

모델의 규모가 비교적 작을 때는 이러한 방식이 실용적이었지만 대형 언어 모델이 수십억 개 이상의 매개변수를 갖게 되면서 전체 미세조정에 필요한 GPU 메모리와 연산량이 중요한 문제가 됐다.

또한 하나의 기반 모델을 여러 업무에 특화하는 경우에도 문제가 발생한다.

예를 들어 동일한 기반 모델을 법률·금융·고객상담에 각각 전체 미세조정한다면 각 용도마다 전체 모델 가중치를 저장해야 할 수 있다.

전체 미세조정

기반 모델 10 GB
 ├─ 법률 모델 10 GB
 ├─ 금융 모델 10 GB
 └─ 상담 모델 10 GB

PEFT에서는 기반 모델을 공통으로 유지하고 용도별로 상대적으로 작은 어댑터 등의 매개변수만 별도로 저장하는 구성이 가능하다.

PEFT

기반 모델
 ├─ 법률 어댑터
 ├─ 금융 어댑터
 └─ 상담 어댑터

이 때문에 PEFT는 대형 모델을 제한된 GPU 자원으로 특화하거나 하나의 기반 모델에서 다수의 파생 모델을 운영하는 방법으로 활용된다.[1]

전체 미세조정과의 차이

편집 원본 편집
구분 전체 미세조정 PEFT
영문 Full Fine-Tuning Parameter-Efficient Fine-Tuning
학습 대상 모델 전체 또는 대부분의 매개변수 일부 또는 추가 매개변수
기반 가중치 변경 대부분 고정
학습 메모리 큼 상대적으로 작음
저장 공간 특화 모델마다 전체 가중치가 필요할 수 있음 소규모 어댑터만 별도 저장 가능
학습 비용 높음 상대적으로 낮음
모델 적응 능력 매우 높음 방법·작업에 따라 차이

PEFT가 항상 전체 미세조정보다 성능이 낮은 것은 아니다.

LoRA 연구에서는 일부 자연어 처리 작업에서 전체 미세조정과 비슷하거나 더 나은 성능을 보이면서 학습 가능한 매개변수를 크게 줄일 수 있음을 보고했다.[2]

다만 작업의 성격과 데이터 규모, 기반 모델, PEFT 구성에 따라 결과가 달라지므로 PEFT가 전체 미세조정을 모든 상황에서 대체한다고 볼 수는 없다.

PEFT에는 여러 접근법이 존재한다.

방식 기본 원리
LoRA 기존 가중치를 고정하고 저랭크 행렬을 추가해 학습
AdaLoRA 중요도에 따라 LoRA의 랭크를 동적으로 배분
Adapter Transformer 계층 사이에 작은 신경망 모듈을 삽입
Prefix Tuning 각 Transformer 계층에 학습 가능한 연속적인 Prefix 벡터를 추가
Prompt Tuning 입력 임베딩에 학습 가능한 가상 토큰을 추가
IA3 내부 활성값을 조절하는 소수의 학습 가능한 벡터를 사용

구체적인 구현 방식은 다르지만 대규모 기반 모델의 대부분을 그대로 유지하면서 적은 수의 매개변수만 학습한다는 공통점이 있다.[1]

LoRA(Low-Rank Adaptation)는 현대 대형 언어 모델에서 널리 사용되는 PEFT 기법 가운데 하나이다.

Microsoft 연구진이 2021년 제안했으며, 사전학습 모델의 기존 가중치를 고정하고 특정 가중치 행렬에 저랭크 행렬을 추가해 그 행렬만 학습한다.[2]

기존 가중치 행렬을 W0라고 하면 미세조정으로 필요한 변화량을 거대한 행렬 전체로 직접 학습하는 대신 다음과 같이 저랭크 행렬의 곱으로 표현할 수 있다.

W = W₀ + ΔW

ΔW = BA

여기서 W0는 고정하고 작은 행렬 A와 B만 학습한다.

행렬의 랭크 r를 원래 가중치 행렬의 차원보다 훨씬 작게 설정하면 학습해야 하는 매개변수를 크게 줄일 수 있다.[2]

예를 들어 개념적으로 다음과 같이 동작한다.

기존 모델 가중치 W
       │
       ├───────────── 고정
       │
       └─ LoRA A × B ─ 학습
              │
              ↓
       기존 출력 + 변화량

학습 후에는 LoRA 어댑터를 기반 모델과 별도로 보관하거나 기반 모델의 가중치에 병합할 수도 있다.

QLoRA(Quantized Low-Rank Adaptation)는 양자화된 기반 모델에 LoRA를 적용해 학습에 필요한 메모리를 더욱 줄이는 방법이다.

2023년 발표된 QLoRA 연구에서는 사전학습 모델을 4비트로 양자화한 상태에서 고정하고, 양자화된 모델을 통해 그래디언트를 LoRA 어댑터로 전달하는 방법을 제안했다.[3]

QLoRA는 다음과 같은 구조로 이해할 수 있다.

4비트로 양자화된 기반 모델
          │
          └─ 고정
              +
        LoRA 어댑터
          │
          └─ 학습

QLoRA 논문은 65B 매개변수 모델을 단일 48GB GPU에서 미세조정하는 사례를 제시했다.[3]

이를 가능하게 하기 위해 논문에서는 4비트 NormalFloat(NF4), Double Quantization, Paged Optimizers 등의 기법을 함께 제안했다.[3]

Adapter 방식은 사전학습 모델의 기존 계층 사이에 비교적 작은 신경망 모듈을 삽입하고 해당 모듈을 중심으로 학습하는 방법이다.

2019년 Houlsby 등이 자연어 처리 전이학습을 위해 제안한 Adapter 방식에서는 원래 모델의 매개변수를 고정하고 작업별로 소수의 새로운 매개변수를 추가한다.[4]

각 작업마다 전체 모델을 복제하지 않고 작은 Adapter만 교체할 수 있다는 장점이 있다.

Transformer Layer
       ↓
    Adapter
       ↓
Transformer Layer
       ↓
    Adapter
       ↓
      ...

LoRA와 마찬가지로 하나의 기반 모델을 여러 작업에 특화하는 데 사용할 수 있다.

Prefix Tuning은 모델의 기존 매개변수를 고정하고 각 Transformer 계층에 학습 가능한 연속적인 벡터를 추가하는 방법이다.

2021년 Li와 Liang이 제안했으며 모델의 전체 매개변수를 변경하는 대신 작은 연속 벡터인 Prefix를 학습한다.[5]

일반적인 자연어 프롬프트를 사람이 작성하는 것과 달리 Prefix Tuning에서 사용하는 벡터는 학습 과정에서 최적화되는 모델 내부의 연속적인 값이다.

Prompt Tuning은 입력 임베딩 앞에 학습 가능한 가상 토큰 또는 Soft Prompt를 추가하는 방법이다.

Google 연구진이 2021년 발표한 연구에서는 모델 전체를 고정한 채 각 작업에 해당하는 Soft Prompt를 학습했다.[6]

이는 사람이 자연어로 작성하는 일반적인 프롬프트 엔지니어링과 구별된다.

일반 프롬프트
"다음 문서를 요약하라."
          ↓
사람이 텍스트 작성


Prompt Tuning
[학습된 벡터][학습된 벡터][학습된 벡터]
          ↓
학습 과정에서 값 결정

즉 Prompt Tuning의 Prompt는 사람이 직접 읽고 작성하는 문장이 아니라 모델이 학습하는 임베딩 벡터이다.

IA3(Infused Adapter by Inhibiting and Amplifying Inner Activations)는 Transformer 내부의 활성값을 학습 가능한 벡터를 이용해 증폭하거나 억제하는 PEFT 기법이다.

2022년 연구 《Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning》에서 제안됐으며 적은 수의 학습 가능한 매개변수를 이용해 모델을 작업에 적응시키는 것을 목표로 한다.[7]

PEFT와 SFT의 관계

편집 원본 편집

PEFT와 지도 미세조정(Supervised Fine-Tuning, SFT)은 서로 대체되는 개념이 아니다.

두 용어는 미세조정의 서로 다른 측면을 나타낸다.

  • SFT — 어떤 학습 데이터와 학습 신호를 사용하는가
  • PEFT — 모델의 어떤 매개변수를 얼마나 효율적으로 학습하는가

따라서 LoRA를 이용해 SFT를 수행하는 것도 가능하다.

지도 미세조정(SFT)
      │
      └─ 학습 데이터:
         지시 → 모범 응답

PEFT / LoRA
      │
      └─ 학습 방법:
         전체 모델 대신 일부 매개변수만 학습

예를 들어 지시와 모범 응답으로 구성된 데이터를 이용하면서 기반 모델은 고정하고 LoRA 어댑터만 학습한다면 이는 동시에 SFT이면서 PEFT이다.

이 구분은 SFT, LoRA, PEFT를 같은 계층의 서로 다른 미세조정 방법으로 오해하지 않기 위해 중요하다.

PEFT와 양자화의 관계

편집 원본 편집

양자화(Quantization) 역시 PEFT와 다른 개념이다.

양자화는 모델 가중치 등을 더 낮은 정밀도로 표현해 메모리 사용량과 연산 비용을 줄이는 기법이다.

PEFT는 학습해야 하는 매개변수를 줄이는 방법이다.

구분 PEFT 양자화
주요 목적 학습 매개변수 감소 수치 표현의 정밀도 감소
대상 학습 과정 모델 표현·추론·학습
대표 기술 LoRA, Adapter, IA3 INT8, INT4, FP8 등

두 방법은 함께 사용할 수 있으며 대표적인 사례가 QLoRA이다.[3]

PEFT는 다양한 분야에서 사용할 수 있다.

기업 특화 모델

  • 사내 업무 형식 학습
  • 고객 상담 응답 방식 학습
  • 특정 산업의 작업 수행 방식 학습

개인화

  • 사용자별 문체
  • 특정 캐릭터나 응답 스타일
  • 개인화된 작업 수행 방식

연구

  • 제한된 GPU 환경에서 대형 모델 실험
  • 여러 데이터셋에 대한 모델 적응
  • 다양한 학습 방법의 비교

이미지 생성

  • 인물·화풍·사물 등의 특성을 이미지 생성 모델에 학습

특히 Stable Diffusion 계열에서도 LoRA가 널리 사용되면서 PEFT는 언어 모델뿐 아니라 생성형 이미지 모델에서도 일반적으로 활용되고 있다.

학습 자원 절감

편집 원본 편집

기반 모델 대부분을 고정하기 때문에 전체 미세조정보다 학습해야 하는 매개변수가 적다.

이에 따라 GPU 메모리와 학습 비용을 줄일 수 있다.[1]

저장 공간 절감

편집 원본 편집

하나의 기반 모델을 여러 용도로 사용할 때 각 용도마다 전체 모델을 저장할 필요가 없다.

공통 기반 모델
 ├─ Adapter A
 ├─ Adapter B
 ├─ Adapter C
 └─ Adapter D

작은 어댑터만 별도로 저장하고 필요할 때 기반 모델에 적용하는 구조를 사용할 수 있다.

모델 배포의 유연성

편집 원본 편집

동일한 기반 모델에서 어댑터를 교체해 서로 다른 작업을 수행하도록 구성할 수 있다.

이 때문에 다수의 고객이나 업무별 모델을 운영해야 하는 환경에서 유용할 수 있다.

전체 미세조정과 동일하지 않음

편집 원본 편집

학습 가능한 매개변수가 제한되기 때문에 기반 모델 자체를 크게 변화시켜야 하는 작업에서는 전체 미세조정보다 적응 능력이 제한될 수 있다.

따라서 PEFT와 전체 미세조정 가운데 어느 방식이 적합한지는 모델과 데이터, 작업의 성격에 따라 결정해야 한다.

기반 모델 의존성

편집 원본 편집

PEFT는 기존 모델의 대부분을 그대로 사용하기 때문에 기반 모델의 능력과 한계에 크게 의존한다.

기반 모델에 존재하지 않는 근본적인 능력을 소량의 PEFT 데이터만으로 새롭게 만드는 데에는 한계가 있다.

하이퍼파라미터

편집 원본 편집

LoRA의 랭크, 적용 계층, 학습률과 같은 설정에 따라 결과가 크게 달라질 수 있다.

단순히 PEFT를 사용한다는 것만으로 좋은 결과가 보장되는 것은 아니다.

어댑터 호환성

편집 원본 편집

PEFT 어댑터는 일반적으로 특정 기반 모델과 구조를 전제로 학습된다.

따라서 동일한 모델 계열이라도 버전이나 구조가 달라지면 기존 어댑터를 그대로 사용할 수 없는 경우가 있다.

  1. ↑ 1.0 1.1 1.2 1.3 Hugging Face, 「Parameter-efficient fine-tuning」, https://huggingface.co/docs/peft/index, 확인일: 2026-10-04.
  2. ↑ 2.0 2.1 2.2 Edward J. Hu et al., 「LoRA: Low-Rank Adaptation of Large Language Models」, https://arxiv.org/abs/2106.09685, 확인일: 2026-10-04.
  3. ↑ 3.0 3.1 3.2 3.3 Tim Dettmers et al., 「QLoRA: Efficient Finetuning of Quantized LLMs」, https://arxiv.org/abs/2305.14314, 확인일: 2026-10-04.
  4. ↑ Neil Houlsby et al., 「Parameter-Efficient Transfer Learning for NLP」, https://proceedings.mlr.press/v97/houlsby19a.html, 확인일: 2026-10-04.
  5. ↑ Xiang Lisa Li, Percy Liang, 「Prefix-Tuning: Optimizing Continuous Prompts for Generation」, https://arxiv.org/abs/2101.00190, 확인일: 2026-10-04.
  6. ↑ Brian Lester, Rami Al-Rfou, Noah Constant, 「The Power of Scale for Parameter-Efficient Prompt Tuning」, https://arxiv.org/abs/2104.08691, 확인일: 2026-10-04.
  7. ↑ Haokun Liu et al., 「Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning」, https://arxiv.org/abs/2205.05638, 확인일: 2026-10-04.