MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Pengfei, Wang, Shijie, Li, Fangyuan, Fu, Yikun, Liu, Kaifeng, Zhang, Kaiyan, Zhang, Dazhi, Li, Yuqiang, Qi, Biqing, Zhou, Bowen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation
di: Wang, Shijie, et al.
Pubblicazione: (2026)
di: Wang, Shijie, et al.
Pubblicazione: (2026)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
di: Li, Fangyuan, et al.
Pubblicazione: (2026)
di: Li, Fangyuan, et al.
Pubblicazione: (2026)
Towards Building Specialized Generalist AI with System 1 and System 2 Fusion
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
di: Long, Xinwei, et al.
Pubblicazione: (2025)
di: Long, Xinwei, et al.
Pubblicazione: (2025)
Evolution of Thought: Diverse and High-Quality Reasoning via Multi-Objective Optimization
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models
di: Song, Siqi, et al.
Pubblicazione: (2025)
di: Song, Siqi, et al.
Pubblicazione: (2025)
GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning
di: Zhao, Jian, et al.
Pubblicazione: (2025)
di: Zhao, Jian, et al.
Pubblicazione: (2025)
MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making
di: Fu, Dayuan, et al.
Pubblicazione: (2024)
di: Fu, Dayuan, et al.
Pubblicazione: (2024)
Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling
di: Liu, Runze, et al.
Pubblicazione: (2025)
di: Liu, Runze, et al.
Pubblicazione: (2025)
SMR: State Memory Replay for Long Sequence Modeling
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction Following
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning
di: Zhu, Xuekai, et al.
Pubblicazione: (2023)
di: Zhu, Xuekai, et al.
Pubblicazione: (2023)
Fast and Slow Generating: An Empirical Study on Large and Small Language Models Collaborative Decoding
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
PDAC: Efficient Coreset Selection for Continual Learning via Probability Density Awareness
di: Gao, Junqi, et al.
Pubblicazione: (2025)
di: Gao, Junqi, et al.
Pubblicazione: (2025)
Less is More: Efficient Model Merging with Binary Task Switch
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Fast and Slow Gradient Approximation for Binary Neural Network Optimization
di: Chen, Xinquan, et al.
Pubblicazione: (2024)
di: Chen, Xinquan, et al.
Pubblicazione: (2024)
Bohdi: Heterogeneous LLM Fusion with Automatic Data Exploration
di: Gao, Junqi, et al.
Pubblicazione: (2025)
di: Gao, Junqi, et al.
Pubblicazione: (2025)
Intuitive Fine-Tuning: Towards Simplifying Alignment into a Single Process
di: Hua, Ermo, et al.
Pubblicazione: (2024)
di: Hua, Ermo, et al.
Pubblicazione: (2024)
Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
di: Pan, Jiadong, et al.
Pubblicazione: (2025)
di: Pan, Jiadong, et al.
Pubblicazione: (2025)
Perturbation Towards Easy Samples Improves Targeted Adversarial Transferability
di: Gao, Junqi, et al.
Pubblicazione: (2024)
di: Gao, Junqi, et al.
Pubblicazione: (2024)
MARS: A Meta-Adaptive Reinforcement Learning Framework for Risk-Aware Multi-Agent Portfolio Management
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
Neural Residual Diffusion Models for Deep Scalable Vision Generation
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024)
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024)
MARS-Sep: Multimodal-Aligned Reinforced Sound Separation
di: Zhang, Zihan, et al.
Pubblicazione: (2025)
di: Zhang, Zihan, et al.
Pubblicazione: (2025)
SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning
di: Shen, Shuaike, et al.
Pubblicazione: (2025)
di: Shen, Shuaike, et al.
Pubblicazione: (2025)
Chem3DLLM: 3D Multimodal Large Language Models for Chemistry
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
Auto-FlexSwitch: Efficient Dynamic Model Merging via Learnable Task Vector Compression
di: Gao, Junqi, et al.
Pubblicazione: (2026)
di: Gao, Junqi, et al.
Pubblicazione: (2026)
Dynamic Residual Safe Reinforcement Learning for Multi-Agent Safety-Critical Scenarios Decision-Making
di: Wang, Kaifeng, et al.
Pubblicazione: (2025)
di: Wang, Kaifeng, et al.
Pubblicazione: (2025)
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024)
di: Ma, Zhiyuan, et al.
Pubblicazione: (2024)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
di: Chng, Yong Xien, et al.
Pubblicazione: (2025)
di: Chng, Yong Xien, et al.
Pubblicazione: (2025)
TTRL: Test-Time Reinforcement Learning
di: Zuo, Yuxin, et al.
Pubblicazione: (2025)
di: Zuo, Yuxin, et al.
Pubblicazione: (2025)
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
di: Hua, Ermo, et al.
Pubblicazione: (2024)
di: Hua, Ermo, et al.
Pubblicazione: (2024)
Heterojunction Organic Solar Cells with Efficient Charge Mobility and Separation Capabilities Studied by DFT
di: Yuqiang Huang, et al.
Pubblicazione: (2024)
di: Yuqiang Huang, et al.
Pubblicazione: (2024)
Exploring Adversarial Robustness of Deep State Space Models
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
SELT: Self-Evaluation Tree Search for LLMs with Task Decomposition
di: Wu, Mengsong, et al.
Pubblicazione: (2025)
di: Wu, Mengsong, et al.
Pubblicazione: (2025)
CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models
di: Li, Jierui, et al.
Pubblicazione: (2024)
di: Li, Jierui, et al.
Pubblicazione: (2024)
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Reasoning as Gradient: Scaling MLE Agents Beyond Tree Search
di: Zhang, Yifei, et al.
Pubblicazione: (2026)
di: Zhang, Yifei, et al.
Pubblicazione: (2026)
L-MARS: Legal Multi-Agent Workflow with Orchestrated Reasoning and Agentic Search
di: Wang, Ziqi, et al.
Pubblicazione: (2025)
di: Wang, Ziqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation
di: Wang, Shijie, et al.
Pubblicazione: (2026) -
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
di: Qi, Biqing, et al.
Pubblicazione: (2024) -
WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
di: Li, Fangyuan, et al.
Pubblicazione: (2026) -
Towards Building Specialized Generalist AI with System 1 and System 2 Fusion
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024) -
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
di: Long, Xinwei, et al.
Pubblicazione: (2025)