Read original ↗
paperarXivTrust 82 · PrimaryPublished 1mo agoLive · 1mo ago

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

Extracting dynamic 4D object interactions from massive, in-the-wild monocular videos offers a highly efficient data collection pathway for scaling Embodied AI and training VLAs. However, existing monocular 4D reconstruction methods primarily focus on isolated objects, often failing under the severe occlusions and complex dynamics inherent in multi-object interactions. To bridge this gap, we propose HAT-4D, the first agentic framework designed to reconstruct the 3D geometry, temporal dynamics, and physical interactions of multiple objects from a single video. By integrating VLMs with a multi-le

Lineage graph

Paper → model → repo connections mined from source citations (Tier-1 exact match).

Why these links exist

Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.

  • FuzzySimilar title/name (fuzzy) · 59%AgentCore-8B

    Fuzzy title match (0.73): “HAT-4D: Lifting Monocular Video for 4D Multi-Object Interact” ≈ “AgentCore-8B”

  • FuzzySimilar title/name (fuzzy) · 87%zhayujie/CowAgent

    Fuzzy title match (0.94): “HAT-4D: Lifting Monocular Video for 4D Multi-Object Interact” ≈ “zhayujie/CowAgent”

  • FuzzySimilar title/name (fuzzy) · 66%open-multi-agent/open-multi-agent

    Fuzzy title match (0.78): “HAT-4D: Lifting Monocular Video for 4D Multi-Object Interact” ≈ “open-multi-agent/open-multi-agent”

  • FuzzySimilar title/name (fuzzy) · 59%NousResearch/hermes-agent

    Fuzzy title match (0.73): “HAT-4D: Lifting Monocular Video for 4D Multi-Object Interact” ≈ “NousResearch/hermes-agent”

  • FuzzySimilar title/name (fuzzy) · 59%2FastLabs/agent-squad

    Fuzzy title match (0.73): “HAT-4D: Lifting Monocular Video for 4D Multi-Object Interact” ≈ “2FastLabs/agent-squad”

  • FuzzySimilar title/name (fuzzy) · 59%Developer-Y/cs-video-courses

    Fuzzy title match (0.73): “HAT-4D: Lifting Monocular Video for 4D Multi-Object Interact” ≈ “Developer-Y/cs-video-courses”

  • FuzzySimilar title/name (fuzzy) · 87%SWE-agent/SWE-agent

    Fuzzy title match (0.94): “HAT-4D: Lifting Monocular Video for 4D Multi-Object Interact” ≈ “SWE-agent/SWE-agent”

Has model

Covers (incoming)

Implements (incoming)

Related across the graph

Topics