AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation
Diffusion Transformers (DiTs) achieve high-quality generation but are costly due to iterative sampling. Dynamic-resolution sampling reduces early-stage cost by denoising at low resolution; however, uniformly upsampling all latent tokens at resolution transitions incurs redundant computation and may degrade fine-detail consistency. Existing partial upsampling strategies typically rely on local latent structure cues or single-step statistics, making it difficult to jointly capture token-text semantic relevance and token-wise representation dynamics across diffusion steps. We propose AViTS, an ad
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- PossiblePossibly related (embedding) · 58%DiffusionGemma: 4x faster text generation →
- LinkedLinked via arxiv author · 85%Haoran Qin →
“AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation”
- LinkedLinked via arxiv author · 85%Zhengan Yan →
“AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation”
- LinkedLinked via arxiv author · 85%Shikang Zheng →
“AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation”
- LinkedLinked via arxiv author · 85%Xiaobing Tu →
“AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation”
- LinkedLinked via arxiv author · 85%Jiacheng Liu →
“AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation”
- LinkedLinked via arxiv author · 85%Yuqi Lin →
“AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation”
- LinkedLinked via arxiv author · 85%Chang Zou →
“AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation”
