Read original ↗
paperarXivTrust 82 · PrimaryPublished 9d agoLive · 8d ago

Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

Vision-Language Models (VLMs) provide useful priors for interactive decision-making, but using them directly as policies is expensive and brittle: they must be queried at every step, do not improve from environment interaction, and can repeat systematic errors. We study how to learn a cheap autonomous policy from an online, expensive, and imperfect but informative VLM teacher. We propose SAGE (Selective Agent Guidance via Entropy), a framework that queries a VLM only when the learner is uncertain, executes the suggested action during training, and distills guidance into a lightweight Reinforce

Lineage graph

Paper → model → repo connections mined from source citations (Tier-1 exact match).

Why these links exist

Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.

  • FuzzySimilar title/name (fuzzy) · 59%AgentCore-8B

    Fuzzy title match (0.73): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “AgentCore-8B”

  • FuzzySimilar title/name (fuzzy) · 87%SWE-agent/SWE-agent

    Fuzzy title match (0.94): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “SWE-agent/SWE-agent”

  • FuzzySimilar title/name (fuzzy) · 87%zhayujie/CowAgent

    Fuzzy title match (0.94): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “zhayujie/CowAgent”

  • FuzzySimilar title/name (fuzzy) · 84%amitness/learning

    Fuzzy title match (0.92): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “amitness/learning”

  • FuzzySimilar title/name (fuzzy) · 59%NousResearch/hermes-agent

    Fuzzy title match (0.73): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “NousResearch/hermes-agent”

  • FuzzySimilar title/name (fuzzy) · 59%bojieli/ai-agent-book

    Fuzzy title match (0.73): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “bojieli/ai-agent-book”

  • LinkedLinked via arxiv author · 85%Matteo Merler

    Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

  • LinkedLinked via arxiv author · 85%Giovanni Bonetta

    Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

Has model

Implements (incoming)

authored (incoming)

Related across the graph

Topics