CuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RL
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mai, Shinji, Zhai, Yunpeng, Chen, Ziqian, Chen, Cheng, Zou, Anni, Tao, Shuchang, Liu, Zhaoyang, Ding, Bolin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AgentEvolver: Towards Efficient Self-Evolving Agent System
par: Zhai, Yunpeng, et autres
Publié: (2025)
par: Zhai, Yunpeng, et autres
Publié: (2025)
SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees
par: Hu, Tianyi, et autres
Publié: (2026)
par: Hu, Tianyi, et autres
Publié: (2026)
Curiosity-driven RL for symbolic equation solving
par: O'Keeffe, Kevin P.
Publié: (2025)
par: O'Keeffe, Kevin P.
Publié: (2025)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
par: Xie, Lipeng, et autres
Publié: (2025)
par: Xie, Lipeng, et autres
Publié: (2025)
d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
par: Pan, Leyi, et autres
Publié: (2025)
par: Pan, Leyi, et autres
Publié: (2025)
Curiosity & Entropy Driven Unsupervised RL in Multiple Environments
par: Dewan, Shaurya, et autres
Publié: (2024)
par: Dewan, Shaurya, et autres
Publié: (2024)
Provoking Multi-modal Few-Shot LVLM via Exploration-Exploitation In-Context Learning
par: Chen, Cheng, et autres
Publié: (2025)
par: Chen, Cheng, et autres
Publié: (2025)
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
par: Pan, Leyi, et autres
Publié: (2025)
par: Pan, Leyi, et autres
Publié: (2025)
AgenticIQA: An Agentic Framework for Adaptive and Interpretable Image Quality Assessment
par: Zhu, Hanwei, et autres
Publié: (2025)
par: Zhu, Hanwei, et autres
Publié: (2025)
ToolCoder: A Systematic Code-Empowered Tool Learning Framework for Large Language Models
par: Ding, Hanxing, et autres
Publié: (2025)
par: Ding, Hanxing, et autres
Publié: (2025)
E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning
par: Zhang, Lingzhe, et autres
Publié: (2026)
par: Zhang, Lingzhe, et autres
Publié: (2026)
MicroRemed: Benchmarking LLMs in Microservices Remediation
par: Zhang, Lingzhe, et autres
Publié: (2025)
par: Zhang, Lingzhe, et autres
Publié: (2025)
The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments
par: Ritchie, Logan, et autres
Publié: (2026)
par: Ritchie, Logan, et autres
Publié: (2026)
Mutation-Based Deep Learning Framework Testing Method in JavaScript Environment
par: Zou, Yinglong, et autres
Publié: (2024)
par: Zou, Yinglong, et autres
Publié: (2024)
Coherence-Seeking Architectures for Agentic AI: A Unified Framework for Curiosity, Introspection, and Continuity
par: Maio, Anthony
Publié: (2025)
par: Maio, Anthony
Publié: (2025)
Coherence-Seeking Architectures for Agentic AI: A Unified Framework for Curiosity, Introspection, and Continuity
par: Maio, Anthony
Publié: (2025)
par: Maio, Anthony
Publié: (2025)
Modular Diffusion Policy Training: Decoupling and Recombining Guidance and Diffusion for Offline RL
par: Chen, Zhaoyang, et autres
Publié: (2025)
par: Chen, Zhaoyang, et autres
Publié: (2025)
Anyprefer: An Agentic Framework for Preference Data Synthesis
par: Zhou, Yiyang, et autres
Publié: (2025)
par: Zhou, Yiyang, et autres
Publié: (2025)
An Auction-based Marketplace for Model Trading in Federated Learning
par: Cui, Yue, et autres
Publié: (2024)
par: Cui, Yue, et autres
Publié: (2024)
Enhancing Tool Learning in Large Language Models with Hierarchical Error Checklists
par: Cui, Yue, et autres
Publié: (2025)
par: Cui, Yue, et autres
Publié: (2025)
Incentivizing Strong Reasoning from Weak Supervision
par: Yuan, Yige, et autres
Publié: (2025)
par: Yuan, Yige, et autres
Publié: (2025)
Agentic Link Construction for Environment and Intent Aware 6G Communication
par: Li, Zhaoyang, et autres
Publié: (2025)
par: Li, Zhaoyang, et autres
Publié: (2025)
Curiosity-driven Red-teaming for Large Language Models
par: Hong, Zhang-Wei, et autres
Publié: (2024)
par: Hong, Zhang-Wei, et autres
Publié: (2024)
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
par: Yang, Zhuo, et autres
Publié: (2025)
par: Yang, Zhuo, et autres
Publié: (2025)
Designing Algorithms Empowered by Language Models: An Analytical Framework, Case Studies, and Insights
par: Chen, Yanxi, et autres
Publié: (2024)
par: Chen, Yanxi, et autres
Publié: (2024)
DialogueReason: Rule-Based RL Sparks Dialogue Reasoning in LLMs
par: Shu, Yubo, et autres
Publié: (2025)
par: Shu, Yubo, et autres
Publié: (2025)
When to Trust LLMs: Aligning Confidence with Response Quality
par: Tao, Shuchang, et autres
Publié: (2024)
par: Tao, Shuchang, et autres
Publié: (2024)
PyVision-RL: Forging Open Agentic Vision Models via RL
par: Zhao, Shitian, et autres
Publié: (2026)
par: Zhao, Shitian, et autres
Publié: (2026)
The Curiosity Erosion Model: A Theoretical Framework for Understanding the Impact of Large Language Models on Human Curiosity
par: Venkat Ram Reddy Ganuthula, et autres
Publié: (2026)
par: Venkat Ram Reddy Ganuthula, et autres
Publié: (2026)
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent
par: Li, Wanli, et autres
Publié: (2026)
par: Li, Wanli, et autres
Publié: (2026)
Polar: Agentic RL on Any Harness at Scale
par: Xu, Binfeng, et autres
Publié: (2026)
par: Xu, Binfeng, et autres
Publié: (2026)
Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution
par: Cao, Zouying, et autres
Publié: (2025)
par: Cao, Zouying, et autres
Publié: (2025)
SPGrasp: Spatiotemporal Prompt-driven Grasp Synthesis in Dynamic Scenes
par: Mei, Yunpeng, et autres
Publié: (2025)
par: Mei, Yunpeng, et autres
Publié: (2025)
Curiosity-Diffuser: Curiosity Guide Diffusion Models for Reliability
par: Liu, Zihao, et autres
Publié: (2025)
par: Liu, Zihao, et autres
Publié: (2025)
Enhancing Rover Mobility Monitoring: Autoencoder-driven Anomaly Detection for Curiosity
par: Sabzehi, Mielad, et autres
Publié: (2024)
par: Sabzehi, Mielad, et autres
Publié: (2024)
Highly Efficient Ozone‐Assisted Catalytic Oxidation of VOCs under Mild Conditions by Cu/MnO 2 Catalyst
par: Chunhui Zhai, et autres
Publié: (2025)
par: Chunhui Zhai, et autres
Publié: (2025)
Hexcute: A Compiler Framework for Automating Layout Synthesis in GPU Programs
par: Zhang, Xiao, et autres
Publié: (2025)
par: Zhang, Xiao, et autres
Publié: (2025)
Balancing Exploration and Cybersickness: Investigating Curiosity-Driven Behavior in Virtual Environments
par: Li, Tangyao, et autres
Publié: (2025)
par: Li, Tangyao, et autres
Publié: (2025)
Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning
par: Wei, Zhaoyang, et autres
Publié: (2025)
par: Wei, Zhaoyang, et autres
Publié: (2025)
Towards Anthropomorphic Conversational AI Part I: A Practical Framework
par: Wei, Fei, et autres
Publié: (2025)
par: Wei, Fei, et autres
Publié: (2025)
Documents similaires
-
AgentEvolver: Towards Efficient Self-Evolving Agent System
par: Zhai, Yunpeng, et autres
Publié: (2025) -
SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees
par: Hu, Tianyi, et autres
Publié: (2026) -
Curiosity-driven RL for symbolic equation solving
par: O'Keeffe, Kevin P.
Publié: (2025) -
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
par: Xie, Lipeng, et autres
Publié: (2025) -
d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
par: Pan, Leyi, et autres
Publié: (2025)