Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Chi, Qiu, Haibo, Zhang, Qiming, Xu, Yufei, Gao, Xinbo, Zhang, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
par: Chen, Jiaqi, et autres
Publié: (2025)
par: Chen, Jiaqi, et autres
Publié: (2025)
PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play
par: Castanyer, Roger Creus, et autres
Publié: (2026)
par: Castanyer, Roger Creus, et autres
Publié: (2026)
Self-Evolving Curriculum for LLM Reasoning
par: Chen, Xiaoyin, et autres
Publié: (2025)
par: Chen, Xiaoyin, et autres
Publié: (2025)
Heterogeneous Adversarial Play in Interactive Environments
par: Xu, Manjie, et autres
Publié: (2025)
par: Xu, Manjie, et autres
Publié: (2025)
Learning Robust Reasoning through Guided Adversarial Self-Play
par: Li, Shuozhe, et autres
Publié: (2026)
par: Li, Shuozhe, et autres
Publié: (2026)
AgentDevel: Reframing Self-Evolving LLM Agents as Release Engineering
par: Zhang, Di
Publié: (2026)
par: Zhang, Di
Publié: (2026)
Behind EvoMap: Characterizing a Self-Evolving Agent-to-Agent Collaboration Network
par: Ye, Qiming, et autres
Publié: (2026)
par: Ye, Qiming, et autres
Publié: (2026)
RaCoT: Plug-and-Play Contrastive Example Generation Mechanism for Enhanced LLM Reasoning Reliability
par: Cai, Kaitong, et autres
Publié: (2025)
par: Cai, Kaitong, et autres
Publié: (2025)
Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning
par: Zhang, Yanzhi, et autres
Publié: (2025)
par: Zhang, Yanzhi, et autres
Publié: (2025)
How Is LLM Reasoning Distracted by Irrelevant Context? An Analysis Using a Controlled Benchmark
par: Yang, Minglai, et autres
Publié: (2025)
par: Yang, Minglai, et autres
Publié: (2025)
CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical Reasoning
par: Wang, Zhuo, et autres
Publié: (2026)
par: Wang, Zhuo, et autres
Publié: (2026)
Ratchet: A Minimal Hygiene Recipe for Self-Evolving LLM Agents
par: Zhang, Xing, et autres
Publié: (2026)
par: Zhang, Xing, et autres
Publié: (2026)
Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play
par: Feng, Xiachong, et autres
Publié: (2026)
par: Feng, Xiachong, et autres
Publié: (2026)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
The Docking Game: Loop Self-Play for Fast, Dynamic, and Accurate Prediction of Flexible Protein-Ligand Binding
par: Zhang, Youzhi, et autres
Publié: (2025)
par: Zhang, Youzhi, et autres
Publié: (2025)
Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections
par: Yang, Xianglin, et autres
Publié: (2026)
par: Yang, Xianglin, et autres
Publié: (2026)
Visual Distraction Undermines Moral Reasoning in Vision-Language Models
par: Yang, Xinyi, et autres
Publié: (2026)
par: Yang, Xinyi, et autres
Publié: (2026)
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
par: Li, Yibo, et autres
Publié: (2026)
par: Li, Yibo, et autres
Publié: (2026)
Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment
par: Li, Jiajia, et autres
Publié: (2026)
par: Li, Jiajia, et autres
Publié: (2026)
Better LLM Reasoning via Dual-Play
par: Zhang, Zhengxin, et autres
Publié: (2025)
par: Zhang, Zhengxin, et autres
Publié: (2025)
Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM Reasoning
par: Wu, Wenjie, et autres
Publié: (2025)
par: Wu, Wenjie, et autres
Publié: (2025)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
par: Sheng, Leheng, et autres
Publié: (2026)
par: Sheng, Leheng, et autres
Publié: (2026)
EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation
par: Wang, Xinda, et autres
Publié: (2025)
par: Wang, Xinda, et autres
Publié: (2025)
EXG: Self-Evolving Agents with Experience Graphs
par: Jin, Yuxin, et autres
Publié: (2026)
par: Jin, Yuxin, et autres
Publié: (2026)
STELLA: Self-Evolving LLM Agent for Biomedical Research
par: Jin, Ruofan, et autres
Publié: (2025)
par: Jin, Ruofan, et autres
Publié: (2025)
The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF
par: Su, Zeli, et autres
Publié: (2026)
par: Su, Zeli, et autres
Publié: (2026)
Multi-Agent Evolve: LLM Self-Improve through Co-evolution
par: Chen, Yixing, et autres
Publié: (2025)
par: Chen, Yixing, et autres
Publié: (2025)
Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation
par: Yu, Ye, et autres
Publié: (2026)
par: Yu, Ye, et autres
Publié: (2026)
Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation
par: Chong, Yee Hin, et autres
Publié: (2026)
par: Chong, Yee Hin, et autres
Publié: (2026)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
par: Yuan, Huining, et autres
Publié: (2025)
par: Yuan, Huining, et autres
Publié: (2025)
CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning
par: Chen, Shuxu, et autres
Publié: (2026)
par: Chen, Shuxu, et autres
Publié: (2026)
CODESKILL: Learning Self-Evolving Skills for Coding Agents
par: Li, Yanzhou, et autres
Publié: (2026)
par: Li, Yanzhou, et autres
Publié: (2026)
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
par: Zhuang, Ziqing, et autres
Publié: (2026)
par: Zhuang, Ziqing, et autres
Publié: (2026)
HyEvo: Self-Evolving Hybrid Agentic Workflows for Efficient Reasoning
par: Xu, Beibei, et autres
Publié: (2026)
par: Xu, Beibei, et autres
Publié: (2026)
ALIVE: Awakening LLM Reasoning via Adversarial Learning and Instructive Verbal Evaluation
par: Duan, Yiwen, et autres
Publié: (2026)
par: Duan, Yiwen, et autres
Publié: (2026)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
par: Diao, Muxi, et autres
Publié: (2024)
par: Diao, Muxi, et autres
Publié: (2024)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
par: Ke, Junlong, et autres
Publié: (2026)
par: Ke, Junlong, et autres
Publié: (2026)
Beyond Self-Play: Hierarchical Reasoning for Continuous Motion in Closed-Loop Traffic Simulation
par: Zhang, Weifan, et autres
Publié: (2026)
par: Zhang, Weifan, et autres
Publié: (2026)
Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents
par: Lin, Minhua, et autres
Publié: (2026)
par: Lin, Minhua, et autres
Publié: (2026)
Real-Time Reasoning Agents in Evolving Environments
par: Wen, Yule, et autres
Publié: (2025)
par: Wen, Yule, et autres
Publié: (2025)
Documents similaires
-
SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
par: Chen, Jiaqi, et autres
Publié: (2025) -
PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play
par: Castanyer, Roger Creus, et autres
Publié: (2026) -
Self-Evolving Curriculum for LLM Reasoning
par: Chen, Xiaoyin, et autres
Publié: (2025) -
Heterogeneous Adversarial Play in Interactive Environments
par: Xu, Manjie, et autres
Publié: (2025) -
Learning Robust Reasoning through Guided Adversarial Self-Play
par: Li, Shuozhe, et autres
Publié: (2026)