VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
Vision-language models (VLMs) process large numbers of visual tokens, resulting in substantial inference latency and memory overhead. This has motivated extensive research on visual token compression. While training-free strategies rely on heuristic metrics and suffer significant performance degradation under high compression ratios, many training-based methods introduce external compression modules that force the VLM backbone to adapt, incurring substantial retraining cost and compromising VLMs' priors. Effective visual token compression hinges on strong information encoding, a capability alr
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- PossiblePossibly related (embedding) · 56%New Server Hopes to Break Through AI’s “Memory Wall” →
- PossiblePossibly related (embedding) · 54%VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization - Apple Machine Learning Research →
- PossiblePossibly related (embedding) · 54%vlm-starter →
- LinkedLinked via arxiv author · 85%Yupeng Zheng →
“VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression”
- LinkedLinked via arxiv author · 85%Kai Zou →
“VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression”
- LinkedLinked via arxiv author · 85%Bin Liu →
“VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression”
- LinkedLinked via arxiv author · 85%Nenghai Yu →
“VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression”
