AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published 3 days ago • 77
TACO: Tool-Augmented Credit Optimization for Agentic Tool Use Paper • 2606.30251 • Published Jun 29 • 22
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles Paper • 2605.22177 • Published May 21 • 21