먼저 직관
슬라이더와 그림으로 변화의 방향을 본 뒤 수식을 만납니다.
INTERACTIVE DEEP LEARNING TEXTBOOK
공식을 외우기 전에 직접 움직여 보고, 코드를 복사하기 전에 브라우저에서 실행합니다. 벡터에서 시작해 Attention과 작은 Transformer까지 하나의 길로 연결합니다.
새로운 학습자들이 이 학습 여정을 시작하고 있어요.
학습 원칙
슬라이더와 그림으로 변화의 방향을 본 뒤 수식을 만납니다.
설치 없이 Python과 NumPy 코드를 브라우저에서 바꿔 봅니다.
각 개념이 Transformer의 어느 부분으로 이어지는지 놓치지 않습니다.
메인 커리큘럼
각 챕터는 직관, 시각화, 최소 수식, 코드 실습, 이해 확인으로 구성됩니다.
숫자의 묶음이 어떻게 의미와 방향을 갖는가
벡터의 크기와 방향, NumPy reshape와 axis, 브로드캐스팅과 내적을 예측·수정 실습으로 연결합니다.
모델은 어떻게 정답에 가까워지는가
선형 모델의 MSE와 gradient를 계산하고, 발산하는 학습률을 직접 복구하며 한 번의 파라미터 업데이트를 디버깅합니다.
직선을 쌓아 복잡한 경계를 만드는 법
sigmoid와 BCE로 이진 분류를 읽고, hidden feature로 XOR을 조립한 뒤 chain rule로 두 weight 층까지 역전파합니다.
작은 배치가 깊은 모델을 학습시키는 과정
3-class logits의 Softmax·Cross Entropy를 mini-batch와 Adam update로 연결하고, validation·Dropout 경계를 실행하며 디버깅합니다.
단어를 계산 가능한 공간에 놓기
결정적 subword 토큰화에서 embedding lookup·반복 row gradient·cosine·masked mean까지 직접 계산하고 디버깅합니다.
RNN은 무엇을 기억하고 무엇을 잊는가
결정적 RNN unroll에서 hidden state와 공유 recurrence를 조작하고, 시간축 gradient와 LSTM cell update를 계산해 causal prefix를 디버깅합니다.
필요한 정보를 직접 찾아보는 방법
단일 query와 분리된 Key·Value로 점수를 계산하고, key축 Softmax와 value 가중합 문맥을 실행하며 잘못된 Attention 계약을 디버깅합니다.
같은 시퀀스의 토큰들이 서로를 읽는 법
같은 입력에서 Q·K·V를 따로 투영해 모든 token row의 scaled dot-product를 계산하고, causal mask와 multi-head 분할·병합 계약을 실행하며 정보 누출과 shape 결함을 디버깅합니다.
Attention만으로는 충분하지 않다
결정적 absolute 위치 신호를 첫 블록 입력에 한 번 더하고, pre-LayerNorm causal Self-Attention과 position-wise FFN을 residual 경로로 감싸 [T,d_model]을 보존하는 decoder-only block을 실행·디버깅합니다.
배운 조각을 하나의 작동하는 모델로
결정적 tokenizer→embedding+position→pre-LayerNorm decoder block→final norm→vocabulary logits를 연결하고, shifted target loss·한 번의 LM-head update와 EOS/max-length autoregressive decoding을 실행·디버깅합니다.