Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Kexun, Yao, Weiran, Liu, Zuxin, Feng, Yihao, Liu, Zhiwei, Murthy, Rithesh, Lan, Tian, Li, Lei, Lou, Renze, Xu, Jiacheng, Pang, Bo, Zhou, Yingbo, Heinecke, Shelby, Savarese, Silvio, Wang, Huan, Xiong, Caiming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
por: Liu, Zuxin, et al.
Publicado: (2024)
por: Liu, Zuxin, et al.
Publicado: (2024)
PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Data
por: Tan, Juntao, et al.
Publicado: (2025)
por: Tan, Juntao, et al.
Publicado: (2025)
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
por: Qiu, Jielin, et al.
Publicado: (2025)
por: Qiu, Jielin, et al.
Publicado: (2025)
Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
por: Murthy, Rithesh, et al.
Publicado: (2025)
por: Murthy, Rithesh, et al.
Publicado: (2025)
Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding
por: Chen, Haolin, et al.
Publicado: (2024)
por: Chen, Haolin, et al.
Publicado: (2024)
PRACT: Optimizing Principled Reasoning and Acting of LLM Agent
por: Liu, Zhiwei, et al.
Publicado: (2024)
por: Liu, Zhiwei, et al.
Publicado: (2024)
xLAM: A Family of Large Action Models to Empower AI Agent Systems
por: Zhang, Jianguo, et al.
Publicado: (2024)
por: Zhang, Jianguo, et al.
Publicado: (2024)
Personalized Multi-task Training for Recommender System
por: Yang, Liangwei, et al.
Publicado: (2024)
por: Yang, Liangwei, et al.
Publicado: (2024)
AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning
por: Zhang, Jianguo, et al.
Publicado: (2024)
por: Zhang, Jianguo, et al.
Publicado: (2024)
Test-Time Adaptation for LLM Agents via Environment Interaction
por: Chen, Arthur, et al.
Publicado: (2025)
por: Chen, Arthur, et al.
Publicado: (2025)
MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models
por: Liu, Zhiwei, et al.
Publicado: (2025)
por: Liu, Zhiwei, et al.
Publicado: (2025)
UserBench: An Interactive Gym Environment for User-Centric Agents
por: Qian, Cheng, et al.
Publicado: (2025)
por: Qian, Cheng, et al.
Publicado: (2025)
Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization
por: Yao, Weiran, et al.
Publicado: (2023)
por: Yao, Weiran, et al.
Publicado: (2023)
REX: Rapid Exploration and eXploitation for AI Agents
por: Murthy, Rithesh, et al.
Publicado: (2023)
por: Murthy, Rithesh, et al.
Publicado: (2023)
AgentLite: A Lightweight Library for Building and Advancing Task-Oriented LLM Agent System
por: Liu, Zhiwei, et al.
Publicado: (2024)
por: Liu, Zhiwei, et al.
Publicado: (2024)
DialogStudio: Towards Richest and Most Diverse Unified Dataset Collection for Conversational AI
por: Zhang, Jianguo, et al.
Publicado: (2023)
por: Zhang, Jianguo, et al.
Publicado: (2023)
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
por: Qiu, Jielin, et al.
Publicado: (2025)
por: Qiu, Jielin, et al.
Publicado: (2025)
UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
por: Qian, Cheng, et al.
Publicado: (2025)
por: Qian, Cheng, et al.
Publicado: (2025)
xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
por: Qian, Cheng, et al.
Publicado: (2025)
por: Qian, Cheng, et al.
Publicado: (2025)
ToolLibGen: Scalable Automatic Tool Creation and Aggregation for LLM Reasoning
por: Yue, Murong, et al.
Publicado: (2025)
por: Yue, Murong, et al.
Publicado: (2025)
Prompt Optimization Via Diffusion Language Models
por: Wang, Shiyu, et al.
Publicado: (2026)
por: Wang, Shiyu, et al.
Publicado: (2026)
RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation
por: Zhu, Ming, et al.
Publicado: (2026)
por: Zhu, Ming, et al.
Publicado: (2026)
CoDA: Coding LM via Diffusion Adaptation
por: Chen, Haolin, et al.
Publicado: (2025)
por: Chen, Haolin, et al.
Publicado: (2025)
Causal Layering via Conditional Entropy
por: Feigenbaum, Itai, et al.
Publicado: (2024)
por: Feigenbaum, Itai, et al.
Publicado: (2024)
Editing Arbitrary Propositions in LLMs without Subject Labels
por: Feigenbaum, Itai, et al.
Publicado: (2024)
por: Feigenbaum, Itai, et al.
Publicado: (2024)
ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs
por: Kokane, Shirley, et al.
Publicado: (2024)
por: Kokane, Shirley, et al.
Publicado: (2024)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Enterprise Sales Copilot: Enabling Real-Time AI Support with Automatic Information Retrieval in Live Sales Calls
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation
por: Pang, Bo, et al.
Publicado: (2025)
por: Pang, Bo, et al.
Publicado: (2025)
Position: Vector Prompt Interfaces Should Be Exposed to Enable Customization of Large Language Models
por: Yang, Liangwei, et al.
Publicado: (2026)
por: Yang, Liangwei, et al.
Publicado: (2026)
MobileAIBench: Benchmarking LLMs and LMMs for On-Device Use Cases
por: Murthy, Rithesh, et al.
Publicado: (2024)
por: Murthy, Rithesh, et al.
Publicado: (2024)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
por: Pang, Bo, et al.
Publicado: (2025)
por: Pang, Bo, et al.
Publicado: (2025)
APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay
por: Prabhakar, Akshara, et al.
Publicado: (2025)
por: Prabhakar, Akshara, et al.
Publicado: (2025)
GeoGNN: Quantifying and Mitigating Semantic Drift in Text-Attributed Graphs
por: Yang, Liangwei, et al.
Publicado: (2025)
por: Yang, Liangwei, et al.
Publicado: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
por: Yang, Liangwei, et al.
Publicado: (2025)
por: Yang, Liangwei, et al.
Publicado: (2025)
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
por: Cen, Zhepeng, et al.
Publicado: (2025)
por: Cen, Zhepeng, et al.
Publicado: (2025)
Enabling High Data Throughput Reinforcement Learning on GPUs: A Domain Agnostic Framework for Data-Driven Scientific Research
por: Lan, Tian, et al.
Publicado: (2024)
por: Lan, Tian, et al.
Publicado: (2024)
ActionStudio: A Lightweight Framework for Data and Training of Large Action Models
por: Zhang, Jianguo, et al.
Publicado: (2025)
por: Zhang, Jianguo, et al.
Publicado: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Ejemplares similares
-
APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
por: Liu, Zuxin, et al.
Publicado: (2024) -
PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Data
por: Tan, Juntao, et al.
Publicado: (2025) -
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
por: Qiu, Jielin, et al.
Publicado: (2025) -
Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
por: Murthy, Rithesh, et al.
Publicado: (2025) -
Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding
por: Chen, Haolin, et al.
Publicado: (2024)