Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding
Computed tomography (CT) vision-language pretraining from paired volumes and radiology reports is a scalable yet challenging task. Existing methods commonly adopt global scan-report contrast, which is scalable but obscures heterogeneous organ evidence. Meanwhile, direct organ-level alignment remains coarse, since the same anatomy can exhibit multiple distinct radiological appearances. Therefore, pretraining requires a finer alignment unit: the organ-conditioned radiological pattern. In this work, we propose OCP-CT, an organ-conditioned pattern-token alignment framework for CT vision-language p
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- FuzzySimilar title/name (fuzzy) · 59%VioletVision-3B →
“Fuzzy title match (0.73): “Fine-Grained Vision-Language Pretraining with Organ-Conditio” ≈ “VioletVision-3B””
- FuzzySimilar title/name (fuzzy) · 84%pytorch/vision →
“Fuzzy title match (0.92): “Fine-Grained Vision-Language Pretraining with Organ-Conditio” ≈ “pytorch/vision””
- LinkedLinked via arxiv author · 85%Guoliang You →
“Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding”
- LinkedLinked via arxiv author · 85%Xiaomeng Chu →
“Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding”
