Speculative decoding
Speculative decoding is a computational technique used primarily in natural language processing and machine learning to accelerate model inference by anticipating likely outputs. It involves generating multiple candidate predictions in parallel and verifying them with a more accurate model, balancing speed and accuracy.