Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
Recent unified multimodal models show a single architecture can jointly perform vision/language understanding and image generation/editing. However, they repeatedly feed all historical visual and textual inputs into a shared context window, limiting long-horizon multimodal dialogue due to visual token explosion and unreliable cross-turn referencing. We propose a Cognitive-structured Multimodal Agent that externalizes visual information into an Episodic Visual Memory and selectively reactivates relevant episodes during reasoning. The agent consists of a Perceptual Abstraction Engine for structu
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- PossiblePossibly related (embedding) · 52%VioletVision-3B →
- LinkedLinked via arxiv author · 85%Zefeng Wang →
“Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing”
- LinkedLinked via arxiv author · 85%Canmiao Fu →
“Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing”
- LinkedLinked via arxiv author · 85%Zhipeng Huang →
“Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing”
- LinkedLinked via arxiv author · 85%Zichen Liu →
“Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing”
- LinkedLinked via arxiv author · 85%Jing Lyu →
“Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing”
- LinkedLinked via arxiv author · 85%Ge Li →
“Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing”
