Scaling Agent Learning via Experience Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Zhaorun, Zhao, Zhuokai, Zhang, Kai, Liu, Bo, Qi, Qi, Wu, Yifan, Kalluri, Tarun, Cao, Sara, Xiong, Yuanhao, Tong, Haibo, Yao, Huaxiu, Li, Hengduo, Zhu, Jiacheng, Li, Xian, Song, Dawn, Li, Bo, Weston, Jason, Huynh, Dat |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
Agent Learning via Early Experience
par: Zhang, Kai, et autres
Publié: (2025)
par: Zhang, Kai, et autres
Publié: (2025)
AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning
par: Chen, Zhaorun, et autres
Publié: (2025)
par: Chen, Zhaorun, et autres
Publié: (2025)
UDA-Bench: Revisiting Common Assumptions in Unsupervised Domain Adaptation Using a Standardized Framework
par: Kalluri, Tarun, et autres
Publié: (2024)
par: Kalluri, Tarun, et autres
Publié: (2024)
Not all Temperature Shocks are Alike: Disentangling Heat and High Temperature Shocks and Their Effects on Inflation in Australia
par: Tan Dat Huynh, et autres
Publié: (2026)
par: Tan Dat Huynh, et autres
Publié: (2026)
Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs
par: Wang, Ganghua, et autres
Publié: (2025)
par: Wang, Ganghua, et autres
Publié: (2025)
SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
Tell, Don't Show!: Language Guidance Eases Transfer Across Domains in Images and Videos
par: Kalluri, Tarun, et autres
Publié: (2024)
par: Kalluri, Tarun, et autres
Publié: (2024)
Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
par: Fang, Yixiong, et autres
Publié: (2024)
par: Fang, Yixiong, et autres
Publié: (2024)
Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
RankCLIP: Ranking-Consistent Language-Image Pretraining
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Token-Level LLM Collaboration via FusionRoute
par: Xiong, Nuoya, et autres
Publié: (2026)
par: Xiong, Nuoya, et autres
Publié: (2026)
Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge
par: Saha, Swarnadeep, et autres
Publié: (2025)
par: Saha, Swarnadeep, et autres
Publié: (2025)
Self-Challenging Language Model Agents
par: Zhou, Yifei, et autres
Publié: (2025)
par: Zhou, Yifei, et autres
Publié: (2025)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
par: Zhao, Yunhan, et autres
Publié: (2026)
par: Zhao, Yunhan, et autres
Publié: (2026)
GRATH: Gradual Self-Truthifying for Large Language Models
par: Chen, Weixin, et autres
Publié: (2024)
par: Chen, Weixin, et autres
Publié: (2024)
DiffAttack: Evasion Attacks Against Diffusion-Based Adversarial Purification
par: Kang, Mintong, et autres
Publié: (2023)
par: Kang, Mintong, et autres
Publié: (2023)
RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents
par: Guo, Chengquan, et autres
Publié: (2025)
par: Guo, Chengquan, et autres
Publié: (2025)
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
par: Zeng, Yi, et autres
Publié: (2024)
par: Zeng, Yi, et autres
Publié: (2024)
Psychological Antecedents to Emergence of Team Autonomy in Agile Scrum Teams
par: Kalluri, Ravikiran
Publié: (2024)
par: Kalluri, Ravikiran
Publié: (2024)
Agent-Based Simulation of Trust Development in Human-Robot Teams: An Empirically-Validated Framework
par: Kalluri, Ravi
Publié: (2026)
par: Kalluri, Ravi
Publié: (2026)
Why Does the Engineering Manager Still Exist in Agile Software Development?
par: Kalluri, Ravi
Publié: (2025)
par: Kalluri, Ravi
Publié: (2025)
Anyprefer: An Agentic Framework for Preference Data Synthesis
par: Zhou, Yiyang, et autres
Publié: (2025)
par: Zhou, Yiyang, et autres
Publié: (2025)
scPER: A Rigorous Computational Approach to Determine Cellular Subtypes in Tumors Aligned With Cancer Phenotypes From Total RNA Sequencing
par: Bingrui Li, et autres
Publié: (2025)
par: Bingrui Li, et autres
Publié: (2025)
YAP prevents senescence of dermal fibroblast and inhibits melanogenesis via paracrine effect of DKK1
par: Tong Li, et autres
Publié: (2024)
par: Tong Li, et autres
Publié: (2024)
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
par: Xu, Peiyang, et autres
Publié: (2025)
par: Xu, Peiyang, et autres
Publié: (2025)
Safe Reinforcement Learning via Hierarchical Adaptive Chance-Constraint Safeguards
par: Chen, Zhaorun, et autres
Publié: (2023)
par: Chen, Zhaorun, et autres
Publié: (2023)
The Era of Real-World Human Interaction: RL from User Conversations
par: Jin, Chuanyang, et autres
Publié: (2025)
par: Jin, Chuanyang, et autres
Publié: (2025)
The Shielding Effect of Foreign Managers: Evidence From Chinese Listed Companies During the U.S.‐China Trade War
par: Bo Pu, et autres
Publié: (2026)
par: Bo Pu, et autres
Publié: (2026)
On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
par: Yin, Bo, et autres
Publié: (2026)
par: Yin, Bo, et autres
Publié: (2026)
Novel Blockchain-based Protocols for Electronic Voting and Auctions
par: Lin, Zhaorun
Publié: (2025)
par: Lin, Zhaorun
Publié: (2025)
Branch-Solve-Merge Improves Large Language Model Evaluation and Generation
par: Saha, Swarnadeep, et autres
Publié: (2023)
par: Saha, Swarnadeep, et autres
Publié: (2023)
Better Alignment with Instruction Back-and-Forth Translation
par: Nguyen, Thao, et autres
Publié: (2024)
par: Nguyen, Thao, et autres
Publié: (2024)
How Machine Learning Predicts Fluid Densities under Nanoconfinement
par: Li, Yuanhao
Publié: (2025)
par: Li, Yuanhao
Publié: (2025)
AdaER: An Adaptive Experience Replay Approach for Continual Lifelong Learning
par: Li, Xingyu, et autres
Publié: (2023)
par: Li, Xingyu, et autres
Publié: (2023)
MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion
par: Liu, Bin, et autres
Publié: (2026)
par: Liu, Bin, et autres
Publié: (2026)
Thermodynamics and P-v criticality of RN-AdS black hole surrounded by PFDM on the EGUP framework
par: Liu, Bo-Li, et autres
Publié: (2025)
par: Liu, Bo-Li, et autres
Publié: (2025)
Synergistic Bimetallic Active Sites in Extended MOF‐74 Architectures for Highly Efficient Oxidative Carboxylation of Olefins with CO 2
par: Wanchang Li, et autres
Publié: (2025)
par: Wanchang Li, et autres
Publié: (2025)
Documents similaires
-
HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding
par: Chen, Zhaorun, et autres
Publié: (2024) -
Agent Learning via Early Experience
par: Zhang, Kai, et autres
Publié: (2025) -
AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
par: Chen, Zhaorun, et autres
Publié: (2024) -
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
par: Chen, Zhaorun, et autres
Publié: (2024) -
ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning
par: Chen, Zhaorun, et autres
Publié: (2025)