오늘날 전 세계를 뒤흔들고 있는 ChatGPT, Claude, Gemini 같은 거대 생성형 인공지능(AI) 서비스들에게는 공통점이 하나 있습니다. 이들의 뼈대를 이루는 근본 기술이 단 하나의 이름으로 귀결된다는 점입니다. 바로 트랜스포머(Transformer) 아키텍처입니다.

2017년, Google의 연구진(Ashish Vaswani, Noam Shazeer 등 8명)이 발표한 논문 한 장은 컴퓨터가 언어를 이해하는 방식을 통째로 바꿨습니다. 그리고 9년이 지난 2026년 현재까지도 이 트랜스포머를 대체할 만한 혁신적인 범용 아키텍처는 아직 나오지 못했습니다.

과연 이 트랜스포머 모델은 어떻게 세상을 지배하게 되었을까요? 이전 기술의 한계부터 수학적 핵심 원리, 논문 원문(arXiv:1706.03762)에 기록된 정교한 벤치마크 데이터, 그리고 파생 모델들의 계보까지 가장 깊이 있고 명쾌하게 뜯어보겠습니다.

복잡한 신경망 속에서 빛을 발하는 인공지능 신경망 노드 콘셉트 아트 복잡한 신경망 속에서 빛을 발하는 인공지능 신경망 노드 콘셉트 아트 — 출처: agy 생성

⏳ 트랜스포머 이전의 세계 — 순차 처리의 감옥과 RNN

트랜스포머가 얼마나 위대한지 이해하려면, 그 이전 세대의 인공지능이 겪었던 지독한 한계부터 짚어봐야 합니다. 2010년대 중반까지 자연어 처리(NLP)를 지배하던 두뇌는 RNN(순환 신경망, Recurrent Neural Network)과 그 개량형인 LSTM(장단기 메모리, Long Short-Term Memory)이었습니다.

순차적(Sequential) 데이터 처리의 한계

인간은 글을 읽을 때 왼쪽에서 오른쪽으로 차례대로 읽습니다. RNN도 이 방식을 그대로 흉내 냈습니다. “나는 오늘 학교에 가서 공부를했다”라는 문장이 있다면, RNN은 다음과 같이 일합니다.

① “나는”을 입력받아 첫 번째 계산을 합니다. ② 그 계산 결과를 들고 “오늘”을 입력받아 두 번째 계산을 합니다. ③ 그 결과들을 짊어지고 “학교에”를 입력받아 세 번째 계산을 합니다.

입력 데이터가 컨베이어 벨트처럼 순차적으로 들어가며 연산 병목을 유발하는 RNN 아키텍처 한계 도식 입력 데이터가 컨베이어 벨트처럼 순차적으로 들어가며 연산 병목을 유발하는 RNN 아키텍처 한계 도식 — 출처: agy 생성

  • 여기에 치명적인 두 가지 문제가 발생합니다.

  • 첫째, 병렬 연산이 불가능합니다. 두 번째 단어를 연산하려면 무조건 첫 번째 단어의 계산이 끝날 때까지 기다려야 합니다. NVIDIA가 수천 개의 코어를 탑재한 GPU를 팔기 시작했는데, 정작 AI 알고리즘이 순서대로만 계산하느라 GPU의 멀티코어를 10%도 제대로 활용하지 못하는 비극이 발생했습니다.
  • 둘째, 장기 의존성(Long-Term Dependency) 상실 문제입니다. 문장이 길어지면 앞에 나온 단어들의 기억이 점점 희미해집니다. “어제 내가 서점에서 산 은 참 재미있었는데, 오늘 버스를 타고 오면서 그것을 잃어버려서 나는 너무…“라는 문장에서 그것이라는 것을 RNN은 문장이 길어지면 까먹어 버립니다. 정보가 계속 축적되며 희석되거나 기울기 소실(Vanishing Gradient) 현상이 발생하기 때문입니다.

한 줄 요약: RNN은 단어를 하나씩 차례로 처리하느라 엄청나게 느렸고, 긴 문장을 읽으면 앞 내용을 까먹었습니다.

역사의 전환점 — “Attention Is All You Need”

이 답답한 정체를 깬 주인공들이 바로 Google Brain(구글 브레인)과 Google Research(구글 리서치) 연구진이었습니다. 2017년 6월, 이들은 아카이브(arXiv)에 한 편의 기념비적인 논문을 업로드합니다. 제목은 도발적이었습니다.

“Attention Is All You Need” (어텐션만 있으면 충분하다)

2017년 발표된 구글 연구진의 Attention Is All You Need 논문 첫 페이지 아카이브(arXiv) 표지 스크린샷 2017년 발표된 구글 연구진의 Attention Is All You Need 논문 첫 페이지 아카이브(arXiv) 표지 스크린샷 — 출처: arXiv / Google Research https://arxiv.org/abs/1706.03762

어텐션(Attention)만 남기고 다 갖다 버려라

이전에도 RNN의 기억 상실을 보완하기 위해 어텐션(Attention, 주의 집중)이라는 보조 장치가 쓰이고 있었습니다. 단어를 순서대로 읽되, 중요 단어끼리 따로 연결선을 만드는 보조 기억 기술이었습니다.

하지만 구글 연구진은 완전히 획기적인 발상을 제안했습니다. 느려 터진 RNN을 보조하기 위해 어텐션을 쓰지 말고, RNN을 완전히 버리고 오직 어텐션 메커니즘만으로 전체 모델을 설계하면 어떨까?

이 무모해 보였던 제안이 트랜스포머의 시작이었습니다. 트랜스포머는 문장의 단어들을 순서대로 넣는 대신, 문장 안의 모든 단어를 한꺼번에(동시에) 모델에 밀어 넣었습니다.

이로 인해 GPU의 수천 개 코어가 한꺼번에 불을 뿜으며 병렬로 연산을 처리하기 시작했습니다. 속도가 수십 배 이상 빨라졌고, 아무리 긴 문장도 단 한 번의 연산으로 단어 사이의 거리를 좁힐 수 있게 되었습니다.

트랜스포머의 핵심 심장 — 셀프 어텐션(Self-Attention)

트랜스포머가 모든 단어를 동시에 넣으면서도 단어 사이의 순서와 문맥을 이해할 수 있는 비밀은 바로 셀프 어텐션(Self-Attention, 자가 주의 집중)에 있습니다.

비전공자도 단번에 이해할 수 있도록 쉽게 풀어보겠습니다.

단어들끼리의 연결망 점수 매기기

문장 안의 모든 단어는 다른 단어들과의 관계 속에서 진짜 의미가 결정됩니다. 예를 들어 다음과 같은 영어 문장이 있습니다. “The animal didn’t cross the street because it was too tired.” (그 동물은 너무 피곤해서 길을 건너지 않았다.)

여기서 itanimal(동물)일까요, street(길)일까요? 인간은 당연히 동물이라고 생각합니다. 하지만 기계는 모릅니다.

셀프 어텐션은 문장의 모든 단어가 다른 모든 단어를 쳐다보며 내가 너랑 얼마나 밀접한 연관이 있지? 하고 점수를 매깁니다. it이라는 단어를 처리할 때, itanimalstreet를 동시에 계산하며, animal과의 연관 점수를 압도적으로 높게 부여합니다. 이 과정을 모든 단어가 서로에 대해 수행합니다.

문장 속 단어들이 서로에 대해 관계도(어텐션 웨이트)를 형성하며 연결선 굵기를 조절하는 셀프 어텐션 메커니즘 개념도 문장 속 단어들이 서로에 대해 관계도(어텐션 웨이트)를 형성하며 연결선 굵기를 조절하는 셀프 어텐션 메커니즘 개념도 — 출처: agy 생성

Query, Key, Value의 수학적 아날로그

셀프 어텐션이 수학적으로 작동하는 방식을 이해하기 위해, 트랜스포머는 각 단어 벡터를 세 가지 역할로 복사해 연산합니다. 바로 Query(쿼리), Key(키), Value(밸류)입니다. 이는 마치 도서관에서 책을 검색하는 과정과 완벽하게 일치합니다.

  • Query (질문): 내가 지금 의미를 찾고자 하는 단어 (예: it)
  • Key (이름표): 문장 속 다른 단어들이 가지고 있는 레이블 (예: The, animal, street 등 각각의 이름표)
  • Value (내용물): 해당 단어가 담고 있는 실제 정보 값

작동 알고리즘은 다음과 같습니다. ① Query(it)와 문장 내 모든 단어의 Key를 곱해(내적 연산) 유사도 점수를 구합니다. ② 이 점수를 합이 1이 되도록 확률 값으로 바꿉니다(소프트맥스 함수). 이 결과가 바로 어텐션 가중치입니다. ③ 이 가중치를 각 단어의 Value와 곱해 모두 더해줍니다.

이 연산을 한 번에 처리함으로써, 트랜스포머는 문장의 구조와 관계를 완벽한 수학적 행렬로 압축해 낼 수 있게 되었습니다.

논문 원문으로 검증하는 연산 복잡도와 벤치마크 성과

구글 연구진은 논문(Attention Is All You Need)에서 트랜스포머가 기존 구조 대비 왜 우월한지를 명확한 수학적 복잡도 수치와 벤치마크 데이터로 입증했습니다.

논문 Table 1 - 레이어 유형별 연산 복잡도, 순차 연산 수, 최대 경로 길이 비교 도표 논문 Table 1 - 레이어 유형별 연산 복잡도, 순차 연산 수, 최대 경로 길이 비교 도표 — 출처: Google Research https://arxiv.org/abs/1706.03762

1. 구조별 연산 복잡도 및 병렬성 비교 (Table 1 분석)

문장 길이가 N, 차원이 d일 때 각 모델 아키텍처의 성능 특성은 다음과 같이 극명하게 갈립니다.

레이어 유형 (Layer Type) 레이어당 연산 복잡도 (Complexity per Layer) 최소 순차 연산 수 (Sequential Operations) 최대 정보 경로 길이 (Maximum Path Length)
Self-Attention (트랜스포머) O(N² · d) O(1) O(1)
Recurrent (RNN) O(N · d²) O(N) O(N)
Convolutional (CNN) O(k · N · d²) O(1) O(log_k N)

위 표에서 가장 주목해야 할 점은 순차 연산 수(Sequential Operations)최대 정보 경로 길이(Maximum Path Length)입니다.

  • 순차 연산 수 O(1): RNN은 문장 길이 N만큼 차례대로 계산을 기다려야 하는 O(N)인 반면, 트랜스포머는 O(1)로 모든 토큰을 한 번에 병렬 연산합니다.
  • 최대 경로 길이 O(1): 문장 제일 앞의 단어와 제일 뒤의 단어가 서로 정보를 주고받을 때, RNN은 N번의 단계를 거쳐야 하지만 트랜스포머는 단 1번(O(1))의 셀프 어텐션 연산만으로 직통 연결됩니다. 장기 의존성 문제가 완벽하게 해결되는 수학적 비결입니다.

논문 Table 2 - WMT 2014 번역 벤치마크 BLEU 스코어 및 FLOPs 연산 비용 비교 도표 논문 Table 2 - WMT 2014 번역 벤치마크 BLEU 스코어 및 FLOPs 연산 비용 비교 도표 — 출처: Google Research https://arxiv.org/abs/1706.03762

2. WMT 2014 번역 벤치마크와 연산 효율성 (Table 2 분석)

구글 연구진은 당시 최고 성능을 다투던 모델들과 WMT 2014 영독(EN-DE) 및 영불(EN-FR) 번역 성능(BLEU)과 학습 연산량(FLOPs)을 비교했습니다.

모델 (Model) EN-DE (BLEU) EN-FR (BLEU) 학습 연산 비용 (FLOPs)
ByteNet 23.75 - -
GNMT + RL (구글 기존 신경망) 24.60 39.92 2.3×10¹⁹ (DE) / 1.4×10²⁰ (FR)
ConvS2S (페이스북 합성곱) 25.16 40.46 9.6×10¹⁸ (DE) / 1.5×10²⁰ (FR)
MoE (혼합 전문가) 26.03 40.56 2.0×10¹⁹ (DE) / 1.2×10²⁰ (FR)
Transformer (base) 27.30 38.10 3.3×10¹⁸
Transformer (big) 28.40 41.80 2.3×10¹⁹

결과는 가히 압도적이었습니다.

  • 성능 경신: Transformer (big) 모델은 영독(EN-DE) 번역에서 기존 SOTA 앙상블 모델까지 제치고 28.4 BLEU를 기록하며 최고 성과를 달성했습니다.
  • 압도적 효율성: 기존 GNMT나 ConvS2S가 영불(EN-FR) 번역 학습에 1.4~1.5×10²⁰ FLOPs를 소모했던 반면, Transformer (big)는 단 2.3×10¹⁹ FLOPs(기존의 1/6 수준)만으로 41.8 BLEU라는 대기록을 썼습니다. NVIDIA P100 GPU 8대로 단 3.5일 만에 이뤄낸 성과였습니다.

트랜스포머의 뼈대 — 인코더(Encoder)와 디코더(Decoder)

트랜스포머 모델의 전체 아키텍처는 크게 두 가지 기둥으로 조립되어 있습니다. 입력을 읽어 들이는 인코더(Encoder)와 답변을 뱉어내는 디코더(Decoder)입니다.

Attention Is All You Need 논문에 수록된 인코더(왼쪽)와 디코더(오른쪽)의 대칭 구조와 멀티헤드 어텐션 아키텍처 상세 다이어그램 Attention Is All You Need 논문에 수록된 인코더(왼쪽)와 디코더(오른쪽)의 대칭 구조와 멀티헤드 어텐션 아키텍처 상세 다이어그램 — 출처: Google Research https://arxiv.org/abs/1706.03762

인코더 (Encoder)의 역할: 문맥 파악의 천재

인코더는 입력받은 문장 전체를 씹어 먹어 단어들 간의 유기적인 관계를 수치로 정형화합니다.

  • 인코더 내부에는 셀프 어텐션 블록과 일반 신경망 블록이 수십 층 겹쳐져 있습니다.
  • 문장의 앞뒤를 모두 보며 단어의 진짜 뜻을 파악하기 때문에 양방향성(Bidirectional)을 가집니다.

디코더 (Decoder)의 역할: 한 단어씩 예측하는 생성의 귀재

디코더는 번역이나 답변 생성처럼 새로운 텍스트를 만들어 냅니다.

  • 특이하게도 디코더는 단어를 만들 때 이전에 자신이 뱉어낸 단어들과 인코더가 준 힌트를 결합해 다음 단어를 하나씩 예측합니다.
  • 미래에 나올 단어를 미리 보면 안 되기 때문에, 앞부분만 보게 막는 마스크드 셀프 어텐션(Masked Self-Attention)을 씁니다. 그래서 단방향성(Unidirectional)을 띱니다.

이 인코더와 디코더가 서로 주거니 받거니 하며 작동하는 구조가 오리지널 트랜스포머의 핵심입니다.

두 개의 큰 줄기로 갈라지다 — BERT vs GPT

트랜스포머 아키텍처가 공개된 이후, 글로벌 테크 기업들은 이 강력한 뼈대를 자신들의 목적에 맞춰 쪼개기 시작했습니다. 여기서 자연어 처리 역사상 가장 거대한 두 갈래의 계보가 탄생합니다.

트랜스포머의 인코더와 디코더에서 각각 분화해 나와 BERT 진영과 GPT 진영으로 진화한 AI 모델 계보 나무 일러스트 트랜스포머의 인코더와 디코더에서 각각 분화해 나와 BERT 진영과 GPT 진영으로 진화한 AI 모델 계보 나무 일러스트 — 출처: agy 생성

① BERT: 글을 가장 깊이 이해하는 모델

Google은 트랜스포머에서 인코더(Encoder) 부분만 똑 떼어내어 BERT를 만들었습니다.

  • 문장 전체를 양방향으로 쳐다보며 빈칸 채우기 방식으로 학습했습니다.
  • 검색 엔진, 감정 분석, 질문 답변 등 문장의 숨은 뜻을 이해하고 분류하는 문제에서 독보적인 성능을 냈습니다. 구글 검색 엔진의 정확도를 수십 배 올린 핵심 기술이 바로 이 BERT입니다.

② GPT: 다음 단어를 기가 막히게 맞추는 모델

OpenAI는 디코더(Decoder) 부분만 떼어내어 GPT 시리즈를 만들었습니다.

  • GPT는 오직 이전 단어들을 보고 바로 다음에 올 단어가 무엇일지 확률적으로 맞추며 학습했습니다.
  • 문장을 생성하는 데 특화되어 있으며, 모델의 크기를 무지막지하게 키울수록(Scaling Law) 마치 인간처럼 지능을 가진 것처럼 문맥을 잇는 능력을 보여줬습니다. 이 흐름이 결국 오늘날의 ChatGPT와 거대 생성 AI 시대를 열었습니다.

2026년 현재의 관점 — 트랜스포머의 진화와 포스트 트랜스포머

트랜스포머가 인공지능 세상을 정복했지만, 단점이 없는 것은 아닙니다. 가장 큰 문제는 컴퓨팅 연산량입니다.

어텐션 연산은 문장이 길어질수록 연산량이 문장 길이의 제곱에 비례해서 증가합니다. 책 한 권을 읽히려면 서버가 터져나가는 이유가 여기에 있습니다.

하이브리드 진화와 새로운 시도들

이 때문에 2026년 현재는 트랜스포머를 더 가볍게 만들기 위한 다양한 칩 최적화와 아키텍처 진화가 병행되고 있습니다.

  • Mixture-of-Experts (MoE, 혼합 전문가): 모델 전체를 돌리는 대신, 질문에 최적화된 일부 신경망(Expert)만 활성화해 추론 비용을 10분의 1로 낮추는 기술입니다. GPT-5.6이나 Gemini 3.5 등 최근의 모델들은 모두 MoE 구조의 트랜스포머를 씁니다.
  • 포스트 트랜스포머 (Mamba 등): 제곱 비례 문제를 해결하기 위해 선형 시간으로 동작하는 SSM(State Space Models) 기반의 Mamba 같은 기술이 트랜스포머의 지위를 위협하고 있습니다. 하지만 여전히 성능의 정교함 측면에서는 트랜스포머가 절대 우위를 점하고 있습니다.

거대한 데이터센터 랙 내부에서 고속 병렬 추론 연산을 고속으로 수행 중인 최신 AI 가속기 클러스터 콘셉트 거대한 데이터센터 랙 내부에서 고속 병렬 추론 연산을 고속으로 수행 중인 최신 AI 가속기 클러스터 콘셉트 — 출처: agy 생성

새로운 기술 지평에서 꼭 기억할 핵심 요약

트랜스포머의 역사를 통해 알 수 있는 본질적인 변화는 세 가지입니다.

  • 순서의 포기가 가속을 불렀다 텍스트의 순서 처리를 포기하고 동시에 쏟아붓는 구조적 역발상이 GPU 하드웨어 혁신과 맞물려 거대 AI 시대를 개척했습니다.

  • 단어의 맥락은 관계성(Attention)이 정한다 단어 사전적 의미가 아니라 주변 단어와의 연결 점수를 동적으로 계산하는 셀프 어텐션 덕분에 AI는 비유, 은유, 다의어를 문맥에 맞게 이해할 수 있게 되었습니다.

  • 인프라와 돈의 싸움으로 변모 제곱 연산의 한계로 인해 트랜스포머를 돌리려면 엄청난 전력과 칩셋이 필요하게 되었고, 이 아키텍처의 한계를 극복하려는 아키텍처 최적화와 하드웨어 통합이 미래 AI 패권의 핵심 승부처입니다.

참고 출처