Read original ↗
paperarXivTrust 82 · PrimaryPublished 1mo agoLive · 1mo ago

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

Efficient multimodal document question answering with explicit visual grounding, locating the precise document region that supports each answer remains an open challenge. Current approaches bifurcate into Supervised Fine-Tuning (SFT), which requires large annotated datasets and reaches optimization plateaus, and reasoning-centric Reinforcement Learning (RL), which depends on verbose intermediate traces that inflate inference token cost without clear benefit. We introduce Perception-RFT, a training framework that applies Group Relative Policy Optimization (GRPO) to multimodal document QA, bypas

Lineage graph

Paper → model → repo connections mined from source citations (Tier-1 exact match).

Why these links exist

Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.

  • LinkedLinked via arxiv author · 85%Harikrishnan P M

    Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig

  • LinkedLinked via arxiv author · 85%Goutham Vignesh

    Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig

  • LinkedLinked via arxiv author · 85%Ganesh Parab

    Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig

  • LinkedLinked via arxiv author · 85%Saisubramaniam Gopalakrishnan

    Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig

  • LinkedLinked via arxiv author · 85%Vishal Vaddina

    Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig

  • LinkedLinked via arxiv author · 85%Varun V

    Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig

  • LinkedLinked via arxiv author · 85%Rohit Agrawal

    Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alig

  • FuzzySimilar title/name (fuzzy) · 59%rasbt/reasoning-from-scratch

    Fuzzy title match (0.73): “Stop Thinking, Start Looking: Efficient Post-Training for Mu” ≈ “rasbt/reasoning-from-scratch”

authored (incoming)

Implements (incoming)

Related across the graph

Topics