Read original ↗
paperarXivTrust 82 · PrimaryPublished 2d agoLive · 21h ago

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

Diffusion Transformers (DiTs) achieve high-quality generation but are costly due to iterative sampling. Dynamic-resolution sampling reduces early-stage cost by denoising at low resolution; however, uniformly upsampling all latent tokens at resolution transitions incurs redundant computation and may degrade fine-detail consistency. Existing partial upsampling strategies typically rely on local latent structure cues or single-step statistics, making it difficult to jointly capture token-text semantic relevance and token-wise representation dynamics across diffusion steps. We propose AViTS, an ad

Lineage graph

Paper → model → repo connections mined from source citations (Tier-1 exact match).

Why these links exist

Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.

  • PossiblePossibly related (embedding) · 58%DiffusionGemma: 4x faster text generation
  • LinkedLinked via arxiv author · 85%Haoran Qin

    AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

  • LinkedLinked via arxiv author · 85%Zhengan Yan

    AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

  • LinkedLinked via arxiv author · 85%Shikang Zheng

    AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

  • LinkedLinked via arxiv author · 85%Xiaobing Tu

    AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

  • LinkedLinked via arxiv author · 85%Jiacheng Liu

    AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

  • LinkedLinked via arxiv author · 85%Yuqi Lin

    AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

  • LinkedLinked via arxiv author · 85%Chang Zou

    AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

Covers

authored (incoming)

Implements (incoming)

Related across the graph

Topics