
Attention Is All You Need
1. 개요
Attention Is All You Need는 2017년 발표된 논문으로, 기존의 RNN이나 CNN 구조를 사용하지 않고 Attention 메커니즘만으로 자연어 처리 모델을 구성할 수 있음을 보여준다.
이 논문에서 제안된 구조가 바로 Transformer이며, 이후 BERT, GPT 등 대부분의 현대 NLP 모델의 기반이 되었다.
2. 기존 방식의 한계
RNN (Recurrent Neural Network)
- 순차적으로 데이터를 처리하기 때문에 병렬화가 어렵다
- 문장이 길어질수록 앞의 정보를 잊는 문제 발생 (Long-term dependency 문제)
CNN (Convolutional Neural Network)
- 병렬 처리는 가능하지만, 문장 내 단어 간 관계를 직접적으로 표현하기 어렵다
- 멀리 떨어진 단어 간 관계 파악이 제한적
3. 핵심 아이디어: Attention
Transformer의 핵심은 다음과 같다.
문장 내 각 단어가 다른 모든 단어를 참고하여 자신의 표현을 만든다
예를 들어,
"나는 어제 먹은 사과가 맛있었다"라는 문장에서
"사과"는 "먹은", "맛있었다"와 강하게 연결된다.
이처럼 단어 간 관계를 직접적으로 계산하는 방식이 Attention이다.
4. Self-Attention 메커니즘
Self-Attention은 동일한 문장 내 단어들 간의 관계를 계산하는 방식이다.
- 수식

구성 요소
- Q (Query): 현재 단어가 찾고자 하는 정보
- K (Key): 각 단어의 특징
- V (Value): 실제 전달되는 정보
동작 과정
- Query와 Key를 비교하여 단어 간 유사도를 계산
- softmax를 통해 중요도를 확률 형태로 변환
- 해당 비율로 Value를 가중합하여 최종 표현 생성
5. Multi-Head Attention
하나의 Attention만으로는 다양한 관계를 충분히 표현하기 어렵다.
이를 해결하기 위해 여러 개의 Attention을 병렬로 수행하는 구조가 Multi-Head Attention이다.
각 Head는 서로 다른 관점에서 문장을 해석한다.
예를 들어,
- 문법적 관계
- 의미적 관계
- 거리 기반 관계
이렇게 다양한 정보를 동시에 학습할 수 있다.
6. Transformer 구조
Transformer는 크게 두 부분으로 구성된다.
Encoder
- 입력 문장을 처리하는 부분
- Self-Attention + Feed Forward Network 반복 구조
Decoder
- 출력 문장을 생성하는 부분
- Masked Attention을 사용하여 미래 정보 차단
7. Positional Encoding
Attention 구조는 단어의 순서를 고려하지 않는다.
이를 보완하기 위해 Positional Encoding을 사용한다.

각 단어에 위치 정보를 벡터 형태로 추가하여 순서를 학습하도록 한다.
8. 장점
Transformer 구조의 주요 장점은 다음과 같다.
- 완전한 병렬 처리 가능
- 긴 문장에서도 안정적인 성능
- 단어 간 관계를 직접적으로 학습
이러한 특징 덕분에 기존 모델 대비 성능과 효율성이 크게 향상되었다.
9. 정리
Transformer는 다음과 같은 특징을 가진다.
- 장점: 높은 성능, 병렬 처리 가능
- 단점: 높은 계산량, 많은 메모리 사용, 대규모 학습 데이터 필요
결론적으로 Transformer는 높은 성능을 제공하는 대신 계산 비용이 큰 구조이며, 이후 연구들은 이러한 한계를 개선하기 위해 다양한 Transformer 기반 모델을 제안하고 있다.
또한 Transformer는 이후 BERT, GPT, ViT, DNABERT 등 수많은 Transformer 기반 모델의 출발점이 되었다.
따라서 「Attention Is All You Need」는 현대 AI와 대규모 언어 모델(LLM) 시대를 연 가장 영향력 있는 논문 중 하나로 평가받는다.
댓글