Read original ↗
paperarXivTrust 82 · PrimaryPublished 4d agoLive · yesterday

Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large language models, but covering multiple capabilities often involves training separate domain experts and subsequently consolidating them. We organize three fusion paradigms by the artefacts they reuse: Merge combines expert task vectors, Mix RL pools their datasets, and multi-teacher on-policy distillation (MOPD) uses both. Because they have largely been studied in isolation, how they compare and how to choose among them remain unclear. We compare all three using shared experts and data across model sc

Lineage graph

Paper → model → repo connections mined from source citations (Tier-1 exact match).

Why these links exist

Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.

  • FuzzyOverlapping authors or contributors · 62%ray-project/ray

    Shared author/contributor keys: wang

  • FuzzyOverlapping authors or contributors · 62%modular/modular

    Shared author/contributor keys: liu

  • FuzzyOverlapping authors or contributors · 62%TauricResearch/TradingAgents

    Shared author/contributor keys: xiao

  • FuzzyOverlapping authors or contributors · 62%bytedance/deer-flow

    Shared author/contributor keys: wang

  • LinkedLinked via arxiv author · 85%Siye Wu

    Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

  • LinkedLinked via arxiv author · 85%Wenkai Yang

    Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

  • LinkedLinked via arxiv author · 85%Yuchen Cai

    Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

  • LinkedLinked via arxiv author · 85%Bingxin Xu

    Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

Implements (incoming)

authored (incoming)

Related across the graph

Topics