VicEdit: Learning to Edit Videos from Visual In-Context Examples
Despite progress in instruction-based video editing, unimodal textual instructions inherently struggle to convey fine-grained textures and complex dynamics. To bridge this perceptual gap, we propose Visual In-context Editing, a new paradigm elevating video editing from textual instructions to multi-modal visual guidance encompassing single image, image pair, and video pair. To facilitate this paradigm, we curate VicEdit-400K, the first large-scale dataset for visual in-context video editing. We develop an automated pipeline to generate 400K high-quality samples across ten task types, ensuring
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- FuzzyOverlapping authors or contributors · 62%ray-project/ray →
“Shared author/contributor keys: wang”
- FuzzyOverlapping authors or contributors · 62%bytedance/deer-flow →
“Shared author/contributor keys: wang”
- FuzzySimilar title/name (fuzzy) · 59%aymericdamien/TopDeepLearning →
“Fuzzy title match (0.73): “VicEdit: Learning to Edit Videos from Visual In-Context Exam” ≈ “aymericdamien/TopDeepLearning””
- LinkedLinked via arxiv author · 85%Yuji Wang →
“VicEdit: Learning to Edit Videos from Visual In-Context Examples”
- LinkedLinked via arxiv author · 85%Teng Hu →
“VicEdit: Learning to Edit Videos from Visual In-Context Examples”
- LinkedLinked via arxiv author · 85%Yuheng Chen →
“VicEdit: Learning to Edit Videos from Visual In-Context Examples”
- LinkedLinked via arxiv author · 85%Ran Yi →
“VicEdit: Learning to Edit Videos from Visual In-Context Examples”
- LinkedLinked via arxiv author · 85%Han Feng →
“VicEdit: Learning to Edit Videos from Visual In-Context Examples”
