Q-based Variational Inverse Reinforcement Learning
The development of safe and beneficial AI requires that systems can learn and act in accordance with human preferences. However, explicitly specifying these preferences by hand is often infeasible. Inverse reinforcement learning (IRL) addresses this challenge by inferring preferences, represented as reward functions, from expert behaviour. We introduce Q-based Variational IRL (QVIRL), a novel Bayesian IRL method that recovers a posterior distribution over rewards from expert demonstrations via primarily learning a variational distribution over optimal Q-values. Unlike previous approaches, QVIR
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- PossiblePossibly related (embedding) · 54%Maxims for machines: operationalizing Kant’s universal law via inverse reinforcement learning - Springer Nature Link →
- PossiblePossibly related (embedding) · 53%RLHF →
- FuzzySimilar title/name (fuzzy) · 59%aymericdamien/TopDeepLearning →
“Fuzzy title match (0.73): “Q-based Variational Inverse Reinforcement Learning” ≈ “aymericdamien/TopDeepLearning””
- FuzzySimilar title/name (fuzzy) · 59%MathFoundationRL/Book-Mathematical-Foundation-of-Reinforcement-Learning →
“Fuzzy title match (0.73): “Q-based Variational Inverse Reinforcement Learning” ≈ “MathFoundationRL/Book-Mathematical-Foundation-of-Reinforceme””
- LinkedLinked via arxiv author · 85%Ondrej Bajgar →
“Q-based Variational Inverse Reinforcement Learning”
- LinkedLinked via arxiv author · 85%Peter Tisnikar →
“Q-based Variational Inverse Reinforcement Learning”
- LinkedLinked via arxiv author · 85%Alessandro Abate →
“Q-based Variational Inverse Reinforcement Learning”
- LinkedLinked via arxiv author · 85%Konstantinos Gatsis →
“Q-based Variational Inverse Reinforcement Learning”
