Block Diffusion restores efficient caching for diffusion language models, a post says
The post describes a block-by-block approach: decode from left to right while generating the tokens within each block in parallel.
TLDR
Diffusion language models generate multiple tokens—pieces of text—in parallel, a post explains. But iterative unmasking repeatedly updates token states, limiting reuse of the key-value (KV) cache. The post says Block Diffusion restores efficient caching by decoding blocks from left to right while generating each block in parallel.
Combined views
6.3K
2 Sources, first seen 20d ago