Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes
In this paper, we study Reinforcement Learning in Parametrized Action Markov Decision Processes (PAMDP), where each decision consists of a symbolic action and numerical parameters. In such settings Reinforcement Learning algorithms typically determine parameters with one-shot estimators, which makes their training sample inefficient. Though in most PAMDP environments explicit but incomplete knowledge (e.g., rules, safety constraints, or expert heuristics) is available, it is rarely directly used to increase the sample-efficiency of training Reinforcement Learning agents. We step into this gap
Lineage graph
Paper → model → repo connections mined from source citations (Tier-1 exact match).
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- PossiblePossibly related (embedding) · 53%AgentCore-8B →
- PossiblePossibly related (embedding) · 48%Learning Structured Reasoning via Tractable Trajectory Control - Apple Machine Learning Research →
- PossiblePossibly related (embedding) · 47%AgileRL/AgileRL →
- LinkedLinked via arxiv author · 85%Jonas Ehrhardt →
“Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes”
- LinkedLinked via arxiv author · 85%René Heesch →
“Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes”
- LinkedLinked via arxiv author · 85%Oliver Niggemann →
“Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes”
