Gespeichert in:
| Hauptverfasser: | Xi, Zhiheng, Ding, Yiwen, Chen, Wenxiang, Hong, Boyang, Guo, Honglin, Wang, Junzhe, Yang, Dingwen, Liao, Chenyang, Guo, Xin, He, Wei, Gao, Songyang, Chen, Lu, Zheng, Rui, Zou, Yicheng, Gui, Tao, Zhang, Qi, Qiu, Xipeng, Huang, Xuanjing, Wu, Zuxuan, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2406.04151 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
Better Process Supervision with Bi-directional Rewarding Signals
von: Chen, Wenxiang, et al.
Veröffentlicht: (2025)
von: Chen, Wenxiang, et al.
Veröffentlicht: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
von: Shen, Yujiong, et al.
Veröffentlicht: (2026)
von: Shen, Yujiong, et al.
Veröffentlicht: (2026)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents
von: Wang, Zirui, et al.
Veröffentlicht: (2026)
von: Wang, Zirui, et al.
Veröffentlicht: (2026)
MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
von: Lin, Jiahang, et al.
Veröffentlicht: (2026)
von: Lin, Jiahang, et al.
Veröffentlicht: (2026)
AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts
von: Fang, Shicheng, et al.
Veröffentlicht: (2026)
von: Fang, Shicheng, et al.
Veröffentlicht: (2026)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
von: Chen, Yitong, et al.
Veröffentlicht: (2026)
von: Chen, Yitong, et al.
Veröffentlicht: (2026)
OceanGym: A Benchmark Environment for Underwater Embodied Agents
von: Xue, Yida, et al.
Veröffentlicht: (2025)
von: Xue, Yida, et al.
Veröffentlicht: (2025)
Agent Alignment in Evolving Social Norms
von: Li, Shimin, et al.
Veröffentlicht: (2024)
von: Li, Shimin, et al.
Veröffentlicht: (2024)
Pre-Trained Policy Discriminators are General Reward Models
von: Dou, Shihan, et al.
Veröffentlicht: (2025)
von: Dou, Shihan, et al.
Veröffentlicht: (2025)
CritiQ: Mining Data Quality Criteria from Human Preferences
von: Guo, Honglin, et al.
Veröffentlicht: (2025)
von: Guo, Honglin, et al.
Veröffentlicht: (2025)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
von: Lv, Kai, et al.
Veröffentlicht: (2025)
von: Lv, Kai, et al.
Veröffentlicht: (2025)
UserBench: An Interactive Gym Environment for User-Centric Agents
von: Qian, Cheng, et al.
Veröffentlicht: (2025)
von: Qian, Cheng, et al.
Veröffentlicht: (2025)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
NARRA-Gym for Evaluating Interactive Narrative Agents
von: Huang, Yue, et al.
Veröffentlicht: (2026)
von: Huang, Yue, et al.
Veröffentlicht: (2026)
Gym-Anything: Turn any Software into an Agent Environment
von: Aggarwal, Pranjal, et al.
Veröffentlicht: (2026)
von: Aggarwal, Pranjal, et al.
Veröffentlicht: (2026)
AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems
von: Wang, Weiyi, et al.
Veröffentlicht: (2026)
von: Wang, Weiyi, et al.
Veröffentlicht: (2026)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
von: Wang, Junzhe, et al.
Veröffentlicht: (2026)
von: Wang, Junzhe, et al.
Veröffentlicht: (2026)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
von: Xi, Zhiheng, et al.
Veröffentlicht: (2023)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2023)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
von: Guo, Xin, et al.
Veröffentlicht: (2025)
von: Guo, Xin, et al.
Veröffentlicht: (2025)
LongAgent: Scaling Language Models to 128k Context through Multi-Agent Collaboration
von: Zhao, Jun, et al.
Veröffentlicht: (2024)
von: Zhao, Jun, et al.
Veröffentlicht: (2024)
AEL: Agent Evolving Learning for Open-Ended Environments
von: Xu, Wujiang, et al.
Veröffentlicht: (2026)
von: Xu, Wujiang, et al.
Veröffentlicht: (2026)
NegotiationGym: Self-Optimizing Agents in a Multi-Agent Social Simulation Environment
von: Mangla, Shashank, et al.
Veröffentlicht: (2025)
von: Mangla, Shashank, et al.
Veröffentlicht: (2025)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
von: Xia, Han, et al.
Veröffentlicht: (2024)
von: Xia, Han, et al.
Veröffentlicht: (2024)
Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders
von: He, Zhengfu, et al.
Veröffentlicht: (2024)
von: He, Zhengfu, et al.
Veröffentlicht: (2024)
Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models
von: Zhou, Xin, et al.
Veröffentlicht: (2025)
von: Zhou, Xin, et al.
Veröffentlicht: (2025)
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
von: Lin, Jiahang, et al.
Veröffentlicht: (2026)
von: Lin, Jiahang, et al.
Veröffentlicht: (2026)
EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents
von: Ma, Sai, et al.
Veröffentlicht: (2026)
von: Ma, Sai, et al.
Veröffentlicht: (2026)
AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agents
von: Wang, Xiaoxing, et al.
Veröffentlicht: (2026)
von: Wang, Xiaoxing, et al.
Veröffentlicht: (2026)
VehicleWorld: A Highly Integrated Multi-Device Environment for Intelligent Vehicle Interaction
von: Yang, Jie, et al.
Veröffentlicht: (2025)
von: Yang, Jie, et al.
Veröffentlicht: (2025)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
When Agents Evolve, Institutions Follow
von: Fei, Chao, et al.
Veröffentlicht: (2026)
von: Fei, Chao, et al.
Veröffentlicht: (2026)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
von: Wang, Bowen, et al.
Veröffentlicht: (2026)
von: Wang, Bowen, et al.
Veröffentlicht: (2026)
DataEnvGym: Data Generation Agents in Teacher Environments with Student Feedback
von: Khan, Zaid, et al.
Veröffentlicht: (2024)
von: Khan, Zaid, et al.
Veröffentlicht: (2024)
WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks
von: Bai, Hao, et al.
Veröffentlicht: (2026)
von: Bai, Hao, et al.
Veröffentlicht: (2026)
Can RL Improve Generalization of LLM Agents? An Empirical Study
von: Xi, Zhiheng, et al.
Veröffentlicht: (2026)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025) -
Better Process Supervision with Bi-directional Rewarding Signals
von: Chen, Wenxiang, et al.
Veröffentlicht: (2025) -
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025) -
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
von: Shen, Yujiong, et al.
Veröffentlicht: (2026) -
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)