전체 글(112)
-
[LLM] Gated Delta Network & DSA(DeepSeek Sparse Attention)
최근 중국 오픈 모델에서, 어텐션 연산의 효율성을 높이기 위해 제안된 두 가지 모델링 기법을 소개하고자 한다. 1. Gated Delta NetworkGated Delta Network는 Qwen3 Next에서 채택한 블록으로 Gated Delta Rule이 핵심인 신경망이다. 수식으로 살펴보자면, 다음과 같다.$$S_t = S_{t-1}\bigl(\alpha (I - \beta k_t k_t^\top)\bigr) + \beta v_t k_t^\top$$ Gated Delta Network는 Linear Attention 구조를 기반으로 하여 어텐션 연산을 $O(N)$ 계산 복잡도로 수행한다. 또한 Gating Mechanism과 Delta Rule을 적용해, 기존 정보($S_{t-1}$) 중 불필요한 ..
2025.10.10 -
[LLM 학습 방법론] SFT(Supervised Fine Tuning) vs RL(PPO, GRPO)
InstructGPT에서, "답변 선호도(preference)"를 높이기 위해 LLM에 RLHF(PPO)기법을 도입한 것을 시작으로, RL 학습 방법론이 널리 사용되기 시작했다. 이번 글은 SFT와 RL를 비교해보며, SFT와 RL에 대한 강정의 생각을 풀어보고자 한다. 목표 함수 비교$$\quad \nabla_{\theta} Loss(\theta) = \sum_{t=1}^{T} \frac{1}{P(x_t \mid x_{ 위 목표 함수를 해석해보자면,- RL: 모델이 생성한 토큰(output)이 정답(target)이면 output의 생성 확률을 높이는 방향으로 학습. 반대로, 오답이면 output의 생성 확률을 줄이는 방향으로 학습- SFT: 모델이 생성한 토큰(output)이 오답이든 정답이든 무조건 ..
2025.08.20 -
[RL] HybridFlow: A Flexible and Efficient RLHF Framework
1. Traditional RL FrameworkTraditional RL Framework는 single-controller paradigm을 사용한다. 즉, single-controller가 inter-node communication과 intra-node computation을 모두 관리한다. 구체적으로 말하면, single-controller가1. RL dataflow의 node(actor, critic, etc)마다 process를 할당 해주고,2. node의 연산 수행을 위해 worker가 추가적으로 필요한 경우 추가 worker를 spawn 해주며,3. 각 worker에게 직접 작업을 지시하며, 모든 worker를 직접 지휘한다. 그렇기 때문에, single-controller에 과부화(ov..
2025.07.31 -
[RL] GRPO and Beyond(DAPO, GSPO)
1. Proximal Policy Optimization (PPO)Objective: $$\mathcal{T}_{\mathrm{PPO}}(\theta) = \mathbb{E}_{[q \sim \mathbb{P}(Q), o \sim \pi_{\theta_{\text{old}}}(o|q)]} \left[ \frac{1}{|o|} \sum_{t=1}^{|o|} \min \left[ \frac{\pi_\theta(o_t | q, \alpha_{2. Group Relative Policy Optimization (GRPO)PPO에서 사용되는 Value Function은 Policy 모델과 비슷한 크기의 모델이기 때문에, 상당한 메모리와 연산 자원이 요구된다.LLM에서는 보통 마지막 토큰에만 reward가 제공되기..
2025.07.29 -
[LLM] DeepSeek-V3
이번 글에서는 DeepSeek-V3에서 사용된 방법론들에 대해 살펴볼 것이다. DeepSeek-V3은 기존 트랜스포머 아키텍처와 두 가지 주요 부분에서 차이를 보인다.1. Multi-Head Attention (MHA) → Multi-Head Latent Attention (MLA)2. FeedForward Network (FFN) → Mixture of Experts (MoE) 기반 FeedForward Network (FFN)1. Mutli-head Latent Attention (MLA)최근 CoT, 추론 모델(reasoning model)의 등장 등 inference-time scaling 방법론이 각광 받으면서, 답변 길이가 길어지는 추세가 나타나 KV Cache가 점유하는 메모리 사용량이 늘어..
2025.02.28 -
[LLM 시간 및 메모리 최적화] 2. KV Cache & Paged Attention
KV CacheTransformer 디코더의 각 레이어에서 $i$번째 Query, Key, Value의 행은 직전 레이어의 $i$번째 Query와 $1$부터 $i$번째 Key, Value의 행에 영향을 받는다.다시 말해, $i$번째 Query, Key, Value의 행은 직전 레이어의 $i$번째 이후의 Query, Key, Value의 행에 전혀 영향을 받지 않는다.$i$시점에 계산된 Query, Key, Value는 그 이후로도 변하지 않는다.그렇기 때문에, $i+1$번째 토큰을 예측할 때, 이전에 계산했던 $1$부터 $i$번째 Key, Value의 행을 그대로 재활용할 수 있다는 것이다.(참고로, $i+1$번째 토큰 예측 시 오직 $i+1$번째 Query 행만 필요하기 때문에, Query에서 재활용할..
2025.02.26