Rootorial

INTERACTIVE DEEP LEARNING TEXTBOOK

Transformer를
바닥부터 이해하기

공식을 외우기 전에 직접 움직여 보고, 코드를 복사하기 전에 브라우저에서 실행합니다. 벡터에서 시작해 Attention과 작은 Transformer까지 하나의 길로 연결합니다.

새로운 학습자들이 이 학습 여정을 시작하고 있어요.

10CHAPTERS
VectorGradientEmbeddingAttention
나의 진도0%
계정 진도를 불러오는 중입니다.

학습 원칙

읽는 지식을 움직이는 지식으로

01

먼저 직관

슬라이더와 그림으로 변화의 방향을 본 뒤 수식을 만납니다.

02

바로 실행

설치 없이 Python과 NumPy 코드를 브라우저에서 바꿔 봅니다.

03

하나의 연결

각 개념이 Transformer의 어느 부분으로 이어지는지 놓치지 않습니다.

메인 커리큘럼

0에서 Transformer까지

각 챕터는 직관, 시각화, 최소 수식, 코드 실습, 이해 확인으로 구성됩니다.

01
NumPy약 60분

벡터와 텐서

숫자의 묶음이 어떻게 의미와 방향을 갖는가

벡터의 크기와 방향, NumPy reshape와 axis, 브로드캐스팅과 내적을 예측·수정 실습으로 연결합니다.

reshapeaxis내적
02
수학 모델 · 선택 NumPy약 55분

학습과 최적화

모델은 어떻게 정답에 가까워지는가

선형 모델의 MSE와 gradient를 계산하고, 발산하는 학습률을 직접 복구하며 한 번의 파라미터 업데이트를 디버깅합니다.

MSEgradientlearning rate
준비 중
03
수학 모델약 70분

분류와 신경망

직선을 쌓아 복잡한 경계를 만드는 법

sigmoid와 BCE로 이진 분류를 읽고, hidden feature로 XOR을 조립한 뒤 chain rule로 두 weight 층까지 역전파합니다.

sigmoid · BCEhidden layer · XORchain rule · backprop
준비 중
04
TypeScript 수학 모델약 65분

딥러닝 학습 구조

작은 배치가 깊은 모델을 학습시키는 과정

3-class logits의 Softmax·Cross Entropy를 mini-batch와 Adam update로 연결하고, validation·Dropout 경계를 실행하며 디버깅합니다.

mini-batch · CEAdam statevalidation · Dropout
준비 중
05
TypeScript 임베딩 모델약 65분

토큰과 임베딩

단어를 계산 가능한 공간에 놓기

결정적 subword 토큰화에서 embedding lookup·반복 row gradient·cosine·masked mean까지 직접 계산하고 디버깅합니다.

token ID · lookuprow gradient · cosinemasked mean
준비 중
06
TypeScript 시퀀스 모델약 65분

순서가 있는 데이터

RNN은 무엇을 기억하고 무엇을 잊는가

결정적 RNN unroll에서 hidden state와 공유 recurrence를 조작하고, 시간축 gradient와 LSTM cell update를 계산해 causal prefix를 디버깅합니다.

hidden state · recurrencetemporal gradientLSTM · causal prefix
준비 중
07
TypeScript Attention 모델약 65분

Attention

필요한 정보를 직접 찾아보는 방법

단일 query와 분리된 Key·Value로 점수를 계산하고, key축 Softmax와 value 가중합 문맥을 실행하며 잘못된 Attention 계약을 디버깅합니다.

Query · Key 역할key축 SoftmaxValue · context
준비 중
08
TypeScript Self-Attention 모델약 75분

Self-Attention

같은 시퀀스의 토큰들이 서로를 읽는 법

같은 입력에서 Q·K·V를 따로 투영해 모든 token row의 scaled dot-product를 계산하고, causal mask와 multi-head 분할·병합 계약을 실행하며 정보 누출과 shape 결함을 디버깅합니다.

Q/K/V 투영 · token rowscaled score · causal maskmulti-head split · concat
준비 중
09
TypeScript Transformer 블록 모델약 80분

Transformer 블록

Attention만으로는 충분하지 않다

결정적 absolute 위치 신호를 첫 블록 입력에 한 번 더하고, pre-LayerNorm causal Self-Attention과 position-wise FFN을 residual 경로로 감싸 [T,d_model]을 보존하는 decoder-only block을 실행·디버깅합니다.

position · block inputpre-LayerNorm · residualposition-wise FFN · handoff
준비 중
10
TypeScript Mini Transformer 모델약 90분

Mini Transformer

배운 조각을 하나의 작동하는 모델로

결정적 tokenizer→embedding+position→pre-LayerNorm decoder block→final norm→vocabulary logits를 연결하고, shifted target loss·한 번의 LM-head update와 EOS/max-length autoregressive decoding을 실행·디버깅합니다.

shifted target · causal prefixfinal norm · vocabulary logitsloss · autoregressive decode
준비 중