Low-rank down-projection for KV cache
Up-project compressed KV back to full size
Separate RoPE for compressed keys
Full MLA combining compression and decoupled RoPE
Top-k expert selection with gating
Always-active shared expert mechanism
Auxiliary-loss-free load balancing via bias
Full sparse MoE feedforward block
First N layers use dense FFN before MoE
Predict multiple future tokens simultaneously
MLA + MoE combined block
Complete DeepSeek V3 forward pass