Read original ↗
paperarXivTrust 82 · PrimaryPublished 3d agoLive · 12h ago

Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

Vision-language models (VLMs) enable embodied agents to reason and act from visual observations and language instructions. Reinforcement learning (RL) post-training enhances these capabilities using task feedback, but current on-policy RL runtimes execute rollout, reference scoring, and actor training in strict serial phases. While effective for text-only RL, this phase-granular execution is wasteful for VLMs, where processing dense video inputs and prompt prefixes occupies a large fraction of each phase. Because prefix processing is independent of the generated response, it can be run alongsi

Lineage graph

Paper → model → repo connections mined from source citations (Tier-1 exact match).

Why these links exist

Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.

  • FuzzySimilar title/name (fuzzy) · 59%VioletVision-3B

    Fuzzy title match (0.73): “Rollplex: Cross-Phase GPU Spatial Sharing for Vision Languag” ≈ “VioletVision-3B”

  • FuzzySimilar title/name (fuzzy) · 84%pytorch/vision

    Fuzzy title match (0.92): “Rollplex: Cross-Phase GPU Spatial Sharing for Vision Languag” ≈ “pytorch/vision”

  • FuzzyOverlapping authors or contributors · 62%bytedance/deer-flow

    Shared author/contributor keys: wang

  • FuzzyOverlapping authors or contributors · 62%ray-project/ray

    Shared author/contributor keys: wang

  • LinkedLinked via arxiv author · 85%Hanfeng Lu

    Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

  • LinkedLinked via arxiv author · 85%Tianyu Feng

    Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

  • LinkedLinked via arxiv author · 85%Suyi Li

    Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

  • LinkedLinked via arxiv author · 85%Yuheng Zhao

    Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

Has model

Implements (incoming)

authored (incoming)

Related across the graph

Topics