MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Shijie, Li, Pengfei, Fu, Yikun, Liu, Kaifeng, Li, Fangyuan, Liu, Yang, Sun, Xiaowei, Li, Zonglin, Zhao, Siyao, Zhao, Jian, Tian, Kai, Li, Dong, Gao, Junqi, Zhang, Yutong, Chen, Yiqun, Li, Yuqiang, Li, Zoe, Zhang, Weinan, Ye, Peng, Hu, Shuyue, Bai, Lei, Zhou, Bowen, Zhang, Kaiyan, Qi, Biqing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
par: Li, Pengfei, et autres
Publié: (2026)
par: Li, Pengfei, et autres
Publié: (2026)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
par: Li, Fangyuan, et autres
Publié: (2026)
par: Li, Fangyuan, et autres
Publié: (2026)
Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models
par: Song, Siqi, et autres
Publié: (2025)
par: Song, Siqi, et autres
Publié: (2025)
Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling
par: Liu, Runze, et autres
Publié: (2025)
par: Liu, Runze, et autres
Publié: (2025)
SMR: State Memory Replay for Long Sequence Modeling
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Fast and Slow Gradient Approximation for Binary Neural Network Optimization
par: Chen, Xinquan, et autres
Publié: (2024)
par: Chen, Xinquan, et autres
Publié: (2024)
Evolution of Thought: Diverse and High-Quality Reasoning via Multi-Objective Optimization
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Towards Building Specialized Generalist AI with System 1 and System 2 Fusion
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Less is More: Efficient Model Merging with Binary Task Switch
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning
par: Zhao, Jian, et autres
Publié: (2025)
par: Zhao, Jian, et autres
Publié: (2025)
An Efficient Memory Module for Graph Few-Shot Class-Incremental Learning
par: Li, Dong, et autres
Publié: (2024)
par: Li, Dong, et autres
Publié: (2024)
Bohdi: Heterogeneous LLM Fusion with Automatic Data Exploration
par: Gao, Junqi, et autres
Publié: (2025)
par: Gao, Junqi, et autres
Publié: (2025)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025)
par: Long, Xinwei, et autres
Publié: (2025)
Exploring Adversarial Robustness of Deep State Space Models
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Multiagent Multitraversal Multimodal Self-Driving: Open MARS Dataset
par: Li, Yiming, et autres
Publié: (2024)
par: Li, Yiming, et autres
Publié: (2024)
Heterojunction Organic Solar Cells with Efficient Charge Mobility and Separation Capabilities Studied by DFT
par: Yuqiang Huang, et autres
Publié: (2024)
par: Yuqiang Huang, et autres
Publié: (2024)
Digital Twin/MARS‐CycleGAN: Enhancing Sim‐to‐Real Crop/Row Detection for MARS Phenotyping Robot Using Synthetic Images
par: David Liu, et autres
Publié: (2024)
par: David Liu, et autres
Publié: (2024)
Contrastive Augmented Graph2Graph Memory Interaction for Few Shot Continual Learning
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Interactive Continual Learning: Fast and Slow Thinking
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
ReviewRL: Towards Automated Scientific Review with RL
par: Zeng, Sihang, et autres
Publié: (2025)
par: Zeng, Sihang, et autres
Publié: (2025)
MARS: Modality-Aligned Retrieval for Sequence Augmented CTR Prediction
par: Xiao, Yutian, et autres
Publié: (2025)
par: Xiao, Yutian, et autres
Publié: (2025)
Perturbation Towards Easy Samples Improves Targeted Adversarial Transferability
par: Gao, Junqi, et autres
Publié: (2024)
par: Gao, Junqi, et autres
Publié: (2024)
CAMixerSR: Only Details Need More "Attention"
par: Wang, Yan, et autres
Publié: (2024)
par: Wang, Yan, et autres
Publié: (2024)
PDAC: Efficient Coreset Selection for Continual Learning via Probability Density Awareness
par: Gao, Junqi, et autres
Publié: (2025)
par: Gao, Junqi, et autres
Publié: (2025)
AdverMCTS: Combating Pseudo-Correctness in Code Generation via Adversarial Monte Carlo Tree Search
par: Li, Qingyao, et autres
Publié: (2026)
par: Li, Qingyao, et autres
Publié: (2026)
VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning
par: Zhang, Xuanyu, et autres
Publié: (2025)
par: Zhang, Xuanyu, et autres
Publié: (2025)
StrTune: Data Dependence-based Code Slicing for Binary Similarity Detection with Fine-tuned Representation
par: He, Kaiyan, et autres
Publié: (2024)
par: He, Kaiyan, et autres
Publié: (2024)
Eliminating VAE for Fast and High-Resolution Generative Detail Restoration
par: Wang, Yan, et autres
Publié: (2026)
par: Wang, Yan, et autres
Publié: (2026)
Adaptive High-Frequency Preprocessing for Video Coding
par: Pang, Yingxue, et autres
Publié: (2025)
par: Pang, Yingxue, et autres
Publié: (2025)
Generative Preprocessing for Image Compression with Pre-trained Diffusion Models
par: Guo, Mengxi, et autres
Publié: (2025)
par: Guo, Mengxi, et autres
Publié: (2025)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Enhancing Adversarial Transferability via Information Bottleneck Constraints
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Oscillon decay via parametric resonance: the case of three-point scalar interactions
par: Li, Siyao
Publié: (2025)
par: Li, Siyao
Publié: (2025)
CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction Following
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning
par: Zhu, Xuekai, et autres
Publié: (2023)
par: Zhu, Xuekai, et autres
Publié: (2023)
DexEMG: Towards Dexterous Teleoperation System via EMG2Pose Generalization
par: Zhao, Qianyou, et autres
Publié: (2026)
par: Zhao, Qianyou, et autres
Publié: (2026)
The potential impact of large-scale wind clusters on the local weather patterns
par: Li, Rui, et autres
Publié: (2024)
par: Li, Rui, et autres
Publié: (2024)
GenDR: Lighten Generative Detail Restoration
par: Wang, Yan, et autres
Publié: (2025)
par: Wang, Yan, et autres
Publié: (2025)
Documents similaires
-
MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
par: Li, Pengfei, et autres
Publié: (2026) -
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
par: Qi, Biqing, et autres
Publié: (2024) -
WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
par: Li, Fangyuan, et autres
Publié: (2026) -
Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models
par: Song, Siqi, et autres
Publié: (2025) -
Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling
par: Liu, Runze, et autres
Publié: (2025)