Vision as Unified Multimodal Generation
We formulate computer vision as unified multimodal generation, where heterogeneous visual tasks are expressed in the native text and image generation spaces of a unified multimodal model, without task-specific architectures. Under this formulation, SenseNova-Vision uses natural-language instructions and optional visual prompts to specify tasks, target regions or views, and decoding conventions, and generates responses as text for symbolic outputs, images for dense spatial predictions, or mixed text-and-image outputs for compositional tasks. To support large-scale training, we convert diverse c
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- PossiblePossibly related (embedding) · 26%CVHub520/X-AnyLabeling →
“Possibly related via embedding similarity 0.57 (not asserted). Timestamp check: artifact slightly before paper (-3d).”
- PossiblePossibly related (embedding) · 55%VioletVision-3B →
- PossiblePossibly related (embedding) · 61%STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation - Apple Machine Learning Research →
- LinkedLinked via arxiv author · 85%Xiaoyang Han →
“Vision as Unified Multimodal Generation”
- LinkedLinked via arxiv author · 85%Jianhua Li →
“Vision as Unified Multimodal Generation”
- LinkedLinked via arxiv author · 85%Kewang Deng →
“Vision as Unified Multimodal Generation”
- LinkedLinked via arxiv author · 85%Zukai Chen →
“Vision as Unified Multimodal Generation”
- LinkedLinked via arxiv author · 85%Xuanke Shi →
“Vision as Unified Multimodal Generation”
