EXPERT
Speculative Decoding & Multi-Model Harnesses
Accelerate autoregressive inference by 2x-3.5x using draft models, Medusa heads, and token tree verification. Part of the free Inference & Harness Engineering Academy — every lesson below is open to everyone, no signup required.
1 lessons225 XP~25 min total100% free