Coding Agents with Multimodal Browsing are Generalist Problem Solvers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Soni, Aditya Bharat, Li, Boxuan, Wang, Xingyao, Chen, Valerie, Neubig, Graham |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Go-Browse: Training Web Agents with Structured Exploration
par: Gandhi, Apurva, et autres
Publié: (2025)
par: Gandhi, Apurva, et autres
Publié: (2025)
Beyond Browsing: API-Based Web Agents
par: Song, Yueqi, et autres
Publié: (2024)
par: Song, Yueqi, et autres
Publié: (2024)
CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents
par: Sutawika, Lintang, et autres
Publié: (2026)
par: Sutawika, Lintang, et autres
Publié: (2026)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
par: Li, Shilong, et autres
Publié: (2025)
par: Li, Shilong, et autres
Publié: (2025)
Training Versatile Coding Agents in Synthetic Environments
par: Zhu, Yiqi, et autres
Publié: (2025)
par: Zhu, Yiqi, et autres
Publié: (2025)
OpenHands: An Open Platform for AI Software Developers as Generalist Agents
par: Wang, Xingyao, et autres
Publié: (2024)
par: Wang, Xingyao, et autres
Publié: (2024)
Training Software Engineering Agents and Verifiers with SWE-Gym
par: Pan, Jiayi, et autres
Publié: (2024)
par: Pan, Jiayi, et autres
Publié: (2024)
Hybrid-Gym: Training Coding Agents to Generalize Across Tasks
par: Xie, Yiqing, et autres
Publié: (2026)
par: Xie, Yiqing, et autres
Publié: (2026)
Effective Strategies for Asynchronous Software Engineering Agents
par: Geng, Jiayi, et autres
Publié: (2026)
par: Geng, Jiayi, et autres
Publié: (2026)
Training Proactive and Personalized LLM Agents
par: Sun, Weiwei, et autres
Publié: (2025)
par: Sun, Weiwei, et autres
Publié: (2025)
Solving NLP Problems through Human-System Collaboration: A Discussion-based Approach
par: Kaneko, Masahiro, et autres
Publié: (2023)
par: Kaneko, Masahiro, et autres
Publié: (2023)
BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
par: Wei, Jason, et autres
Publié: (2025)
par: Wei, Jason, et autres
Publié: (2025)
Agent Workflow Memory
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models
par: Tjuatja, Lindia, et autres
Publié: (2025)
par: Tjuatja, Lindia, et autres
Publié: (2025)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
par: Lee, Nahyun, et autres
Publié: (2026)
par: Lee, Nahyun, et autres
Publié: (2026)
Do LLMs exhibit human-like response biases? A case study in survey design
par: Tjuatja, Lindia, et autres
Publié: (2023)
par: Tjuatja, Lindia, et autres
Publié: (2023)
Executable Code Actions Elicit Better LLM Agents
par: Wang, Xingyao, et autres
Publié: (2024)
par: Wang, Xingyao, et autres
Publié: (2024)
PresentAgent-2: Towards Generalist Multimodal Presentation Agents
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion
par: Wang, Ziyue, et autres
Publié: (2024)
par: Wang, Ziyue, et autres
Publié: (2024)
ZINA: Multimodal Fine-grained Hallucination Detection and Editing
par: Wada, Yuiga, et autres
Publié: (2025)
par: Wada, Yuiga, et autres
Publié: (2025)
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
par: Song, Yueqi, et autres
Publié: (2025)
par: Song, Yueqi, et autres
Publié: (2025)
Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
par: Chen, Dongping, et autres
Publié: (2026)
par: Chen, Dongping, et autres
Publié: (2026)
Grounding Multilingual Multimodal LLMs With Cultural Knowledge
par: Nyandwi, Jean de Dieu, et autres
Publié: (2025)
par: Nyandwi, Jean de Dieu, et autres
Publié: (2025)
BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions
par: Yu, Tao, et autres
Publié: (2025)
par: Yu, Tao, et autres
Publié: (2025)
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
par: Zhang, Charlie, et autres
Publié: (2025)
par: Zhang, Charlie, et autres
Publié: (2025)
Midtraining Bridges Pretraining and Posttraining Distributions
par: Liu, Emmy, et autres
Publié: (2025)
par: Liu, Emmy, et autres
Publié: (2025)
An Incomplete Loop: Instruction Inference, Instruction Following, and In-context Learning in Language Models
par: Liu, Emmy, et autres
Publié: (2024)
par: Liu, Emmy, et autres
Publié: (2024)
What Is Missing in Multilingual Visual Reasoning and How to Fix It
par: Song, Yueqi, et autres
Publié: (2024)
par: Song, Yueqi, et autres
Publié: (2024)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
par: Chern, Steffi, et autres
Publié: (2024)
par: Chern, Steffi, et autres
Publié: (2024)
A Rubric-Supervised Critic from Sparse Real-World Outcomes
par: Wang, Xingyao, et autres
Publié: (2026)
par: Wang, Xingyao, et autres
Publié: (2026)
PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving
par: Thole, Aditya, et autres
Publié: (2026)
par: Thole, Aditya, et autres
Publié: (2026)
BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese
par: Zhou, Peilin, et autres
Publié: (2025)
par: Zhou, Peilin, et autres
Publié: (2025)
AgentSkiller: Scaling Generalist Agent Intelligence through Semantically Integrated Cross-Domain Data Synthesis
par: Sun, Zexu, et autres
Publié: (2026)
par: Sun, Zexu, et autres
Publié: (2026)
InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
RAGGED: Towards Informed Design of Scalable and Stable RAG Systems
par: Hsia, Jennifer, et autres
Publié: (2024)
par: Hsia, Jennifer, et autres
Publié: (2024)
Recursive Agent Optimization
par: Gandhi, Apurva, et autres
Publié: (2026)
par: Gandhi, Apurva, et autres
Publié: (2026)
LocAgent: Graph-Guided LLM Agents for Code Localization
par: Chen, Zhaoling, et autres
Publié: (2025)
par: Chen, Zhaoling, et autres
Publié: (2025)
Cognitive Agent Compilation for Explicit Problem Solver Modeling
par: Moon, Hyeongdon, et autres
Publié: (2026)
par: Moon, Hyeongdon, et autres
Publié: (2026)
CodeRAG-Bench: Can Retrieval Augment Code Generation?
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
par: Ou, Litu, et autres
Publié: (2025)
par: Ou, Litu, et autres
Publié: (2025)
Documents similaires
-
Go-Browse: Training Web Agents with Structured Exploration
par: Gandhi, Apurva, et autres
Publié: (2025) -
Beyond Browsing: API-Based Web Agents
par: Song, Yueqi, et autres
Publié: (2024) -
CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents
par: Sutawika, Lintang, et autres
Publié: (2026) -
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
par: Li, Shilong, et autres
Publié: (2025) -
Training Versatile Coding Agents in Synthetic Environments
par: Zhu, Yiqi, et autres
Publié: (2025)