No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Zhicong, Jiang, Lingjie, Hu, Yulan, Zeng, Xingchen, Li, Yixia, Zhang, Xiangwen, Chen, Guanhua, Pan, Zheng, Li, Xin, Liu, Yong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
by: Cheng, Xiang, et al.
Published: (2025)
by: Cheng, Xiang, et al.
Published: (2025)
Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation
by: Zheng, Lulu, et al.
Published: (2026)
by: Zheng, Lulu, et al.
Published: (2026)
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
by: Cheng, Xiang, et al.
Published: (2026)
by: Cheng, Xiang, et al.
Published: (2026)
SeTAR: Out-of-Distribution Detection with Selective Low-Rank Approximation
by: Li, Yixia, et al.
Published: (2024)
by: Li, Yixia, et al.
Published: (2024)
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
by: Yi, Hao, et al.
Published: (2026)
by: Yi, Hao, et al.
Published: (2026)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
by: Ruan, Zhiwen, et al.
Published: (2025)
by: Ruan, Zhiwen, et al.
Published: (2025)
COMAP: Co-Evolving World Models and Agent Policies for LLM Agents
by: Liu, Youwei, et al.
Published: (2026)
by: Liu, Youwei, et al.
Published: (2026)
Exploring the Limitations of Mamba in COPY and CoT Reasoning
by: Ren, Ruifeng, et al.
Published: (2024)
by: Ren, Ruifeng, et al.
Published: (2024)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
by: Jiang, Lingjie, et al.
Published: (2025)
by: Jiang, Lingjie, et al.
Published: (2025)
MiLoRA: Harnessing Minor Singular Components for Parameter-Efficient LLM Finetuning
by: Wang, Hanqing, et al.
Published: (2024)
by: Wang, Hanqing, et al.
Published: (2024)
PACIT: Unlocking the Power of Examples for Better In-Context Instruction Tuning
by: Xue, Tianci, et al.
Published: (2023)
by: Xue, Tianci, et al.
Published: (2023)
Co-Evolving Latent Action World Models
by: Wang, Yucen, et al.
Published: (2025)
by: Wang, Yucen, et al.
Published: (2025)
Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
by: Wang, Jiaxuan, et al.
Published: (2026)
by: Wang, Jiaxuan, et al.
Published: (2026)
From Word to World: Can Large Language Models be Implicit Text-based World Models?
by: Li, Yixia, et al.
Published: (2025)
by: Li, Yixia, et al.
Published: (2025)
Cross-Cultural Communication in the Digital Age: An Analysis of Cultural Representation and Inclusivity in Emojis
by: Li, Lingfeng, et al.
Published: (2024)
by: Li, Lingfeng, et al.
Published: (2024)
Anchored Policy Optimization: Mitigating Exploration Collapse Via Support-Constrained Rectification
by: Wang, Tianyi, et al.
Published: (2026)
by: Wang, Tianyi, et al.
Published: (2026)
ContextEvolve: Multi-Agent Context Compression for Systems Code Optimization
by: Su, Hongyuan, et al.
Published: (2026)
by: Su, Hongyuan, et al.
Published: (2026)
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning
by: Zeng, Fanhu, et al.
Published: (2026)
by: Zeng, Fanhu, et al.
Published: (2026)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
by: Yi, Hao, et al.
Published: (2024)
by: Yi, Hao, et al.
Published: (2024)
Groupy: An Open‐Source Toolkit for Molecular Simulation and Property Calculation
by: Ruichen Liu, et al.
Published: (2024)
by: Ruichen Liu, et al.
Published: (2024)
EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks
by: Feng, Tongtong, et al.
Published: (2025)
by: Feng, Tongtong, et al.
Published: (2025)
EvolveSearch: An Iterative Self-Evolving Search Agent
by: Zhang, Dingchu, et al.
Published: (2025)
by: Zhang, Dingchu, et al.
Published: (2025)
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
by: Lin, Zichuan, et al.
Published: (2026)
by: Lin, Zichuan, et al.
Published: (2026)
PsychAgent: An Experience-Driven Lifelong Learning Agent for Self-Evolving Psychological Counselor
by: Yang, Yutao, et al.
Published: (2026)
by: Yang, Yutao, et al.
Published: (2026)
Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
by: Li, Zeping, et al.
Published: (2026)
by: Li, Zeping, et al.
Published: (2026)
‘Male, Pale and Stale’? For More Curious, Diverse and Heterodox Economic Geographies
by: Sarah Marie Hall, et al.
Published: (2025)
by: Sarah Marie Hall, et al.
Published: (2025)
CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
by: Yang, Shidong, et al.
Published: (2026)
by: Yang, Shidong, et al.
Published: (2026)
Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism
by: Zhang, Haoxiang, et al.
Published: (2026)
by: Zhang, Haoxiang, et al.
Published: (2026)
Online Learning from Strategic Human Feedback in LLM Fine-Tuning
by: Hao, Shugang, et al.
Published: (2024)
by: Hao, Shugang, et al.
Published: (2024)
A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation
by: Li, Xiaocan, et al.
Published: (2025)
by: Li, Xiaocan, et al.
Published: (2025)
Open-World Reinforcement Learning over Long Short-Term Imagination
by: Li, Jiajian, et al.
Published: (2024)
by: Li, Jiajian, et al.
Published: (2024)
Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
by: Hu, Mengkang, et al.
Published: (2025)
by: Hu, Mengkang, et al.
Published: (2025)
FedStaleWeight: Buffered Asynchronous Federated Learning with Fair Aggregation via Staleness Reweighting
by: Ma, Jeffrey, et al.
Published: (2024)
by: Ma, Jeffrey, et al.
Published: (2024)
Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback
by: Yan, Lecheng, et al.
Published: (2026)
by: Yan, Lecheng, et al.
Published: (2026)
Distributed Learning for Dynamic Congestion Games
by: Li, Hongbo, et al.
Published: (2024)
by: Li, Hongbo, et al.
Published: (2024)
ImPart: Importance-Aware Delta-Sparsification for Improved Model Compression and Merging in LLMs
by: Yang, Yan, et al.
Published: (2025)
by: Yang, Yan, et al.
Published: (2025)
G2: Guided Generation for Enhanced Output Diversity in LLMs
by: Ruan, Zhiwen, et al.
Published: (2025)
by: Ruan, Zhiwen, et al.
Published: (2025)
Human-in-the-loop Learning for Dynamic Congestion Games
by: Li, Hongbo, et al.
Published: (2024)
by: Li, Hongbo, et al.
Published: (2024)
Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution
by: Shang, Ye, et al.
Published: (2026)
by: Shang, Ye, et al.
Published: (2026)
CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification
by: Zhang, Hanrong, et al.
Published: (2026)
by: Zhang, Hanrong, et al.
Published: (2026)
Similar Items
-
Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
by: Cheng, Xiang, et al.
Published: (2025) -
Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation
by: Zheng, Lulu, et al.
Published: (2026) -
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
by: Cheng, Xiang, et al.
Published: (2026) -
SeTAR: Out-of-Distribution Detection with Selective Low-Rank Approximation
by: Li, Yixia, et al.
Published: (2024) -
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
by: Yi, Hao, et al.
Published: (2026)