Diverse-Intent Multi-Turn Fashion Image Retrieval
Real-world fashion search involves interactive retrieval across multiple turns. However, existing multi-turn retrieval methods are built on a restrictive assumption that every interaction follows the same attribute-editing paradigm, leaving heterogeneous intent transitions unexplored. Moreover, existing approaches often rely on textification to bridge multimodal queries and visual retrieval, which may lose fine-grained visual cues. To address these gaps, we introduce DIM-Fashion, a benchmark of 26K multi-turn sessions constructed from 13 fashion retrieval datasets across 7 tasks, featuring div
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- FuzzySimilar title/name (fuzzy) · 59%Tongyi-MAI/Z-Image-Turbo →
“Fuzzy title match (0.73): “Diverse-Intent Multi-Turn Fashion Image Retrieval” ≈ “Tongyi-MAI/Z-Image-Turbo””
- FuzzyOverlapping authors or contributors · 62%modular/modular →
“Shared author/contributor keys: liu”
- LinkedLinked via arxiv author · 85%Mingqiang Tang →
“Diverse-Intent Multi-Turn Fashion Image Retrieval”
- LinkedLinked via arxiv author · 85%Haokun Wen →
“Diverse-Intent Multi-Turn Fashion Image Retrieval”
- LinkedLinked via arxiv author · 85%Meng Liu →
“Diverse-Intent Multi-Turn Fashion Image Retrieval”
- LinkedLinked via arxiv author · 85%Yupeng Hu →
“Diverse-Intent Multi-Turn Fashion Image Retrieval”
- LinkedLinked via arxiv author · 85%Weili Guan →
“Diverse-Intent Multi-Turn Fashion Image Retrieval”
- LinkedLinked via arxiv author · 85%Xuemeng Song →
“Diverse-Intent Multi-Turn Fashion Image Retrieval”
