Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment
Efficient multimodal document question answering with explicit visual grounding, locating the precise document region that supports each answer remains an open challenge. Current approaches bifurcate into Supervised Fine-Tuning (SFT), which requires large annotated datasets and reaches optimization plateaus, and reasoning-centric Reinforcement Learning (RL), which depends on verbose intermediate traces that inflate inference token cost without clear benefit. We introduce Perception-RFT, a training framework that applies Group Relative Policy Optimization (GRPO) to multimodal document QA, bypas
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- LinkedLinked via arxiv author · 85%Harikrishnan P M →
“Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig”
- LinkedLinked via arxiv author · 85%Goutham Vignesh →
“Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig”
- LinkedLinked via arxiv author · 85%Ganesh Parab →
“Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig”
- LinkedLinked via arxiv author · 85%Saisubramaniam Gopalakrishnan →
“Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig”
- LinkedLinked via arxiv author · 85%Vishal Vaddina →
“Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig”
- LinkedLinked via arxiv author · 85%Varun V →
“Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig”
- LinkedLinked via arxiv author · 85%Rohit Agrawal →
“Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig”
- FuzzySimilar title/name (fuzzy) · 59%rasbt/reasoning-from-scratch →
“Fuzzy title match (0.73): “Stop Thinking, Start Looking: Efficient Post-Training for Mu” ≈ “rasbt/reasoning-from-scratch””
