Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers
Vision-Language Models (VLMs) provide useful priors for interactive decision-making, but using them directly as policies is expensive and brittle: they must be queried at every step, do not improve from environment interaction, and can repeat systematic errors. We study how to learn a cheap autonomous policy from an online, expensive, and imperfect but informative VLM teacher. We propose SAGE (Selective Agent Guidance via Entropy), a framework that queries a VLM only when the learner is uncertain, executes the suggested action during training, and distills guidance into a lightweight Reinforce
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- FuzzySimilar title/name (fuzzy) · 59%AgentCore-8B →
“Fuzzy title match (0.73): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “AgentCore-8B””
- FuzzySimilar title/name (fuzzy) · 87%SWE-agent/SWE-agent →
“Fuzzy title match (0.94): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “SWE-agent/SWE-agent””
- FuzzySimilar title/name (fuzzy) · 87%zhayujie/CowAgent →
“Fuzzy title match (0.94): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “zhayujie/CowAgent””
- FuzzySimilar title/name (fuzzy) · 84%amitness/learning →
“Fuzzy title match (0.92): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “amitness/learning””
- FuzzySimilar title/name (fuzzy) · 59%NousResearch/hermes-agent →
“Fuzzy title match (0.73): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “NousResearch/hermes-agent””
- FuzzySimilar title/name (fuzzy) · 59%bojieli/ai-agent-book →
“Fuzzy title match (0.73): “Selective Agent Guidance via Entropy: Learning Autonomous Po” ≈ “bojieli/ai-agent-book””
- LinkedLinked via arxiv author · 85%Matteo Merler →
“Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers”
- LinkedLinked via arxiv author · 85%Giovanni Bonetta →
“Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers”
