Read original ↗
paperarXivTrust 82 · PrimaryPublished 1mo agoLive · 1mo ago

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

Recent unified multimodal models show a single architecture can jointly perform vision/language understanding and image generation/editing. However, they repeatedly feed all historical visual and textual inputs into a shared context window, limiting long-horizon multimodal dialogue due to visual token explosion and unreliable cross-turn referencing. We propose a Cognitive-structured Multimodal Agent that externalizes visual information into an Episodic Visual Memory and selectively reactivates relevant episodes during reasoning. The agent consists of a Perceptual Abstraction Engine for structu

Lineage graph

Paper → model → repo connections mined from source citations (Tier-1 exact match).

Why these links exist

Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.

  • PossiblePossibly related (embedding) · 52%VioletVision-3B
  • LinkedLinked via arxiv author · 85%Zefeng Wang

    Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

  • LinkedLinked via arxiv author · 85%Canmiao Fu

    Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

  • LinkedLinked via arxiv author · 85%Zhipeng Huang

    Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

  • LinkedLinked via arxiv author · 85%Zichen Liu

    Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

  • LinkedLinked via arxiv author · 85%Jing Lyu

    Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

  • LinkedLinked via arxiv author · 85%Ge Li

    Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

Has model

authored (incoming)

Related across the graph

Topics