LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering
Fuente:
arXiv
Salvato in:
| Autori principali: | Qiu, Jielin, Liu, Zuxin, Liu, Zhiwei, Murthy, Rithesh, Zhang, Jianguo, Chen, Haolin, Wang, Shiyu, Zhu, Ming, Yang, Liangwei, Tan, Juntao, Cen, Zhepeng, Qian, Cheng, Heinecke, Shelby, Yao, Weiran, Savarese, Silvio, Xiong, Caiming, Wang, Huan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
di: Qiu, Jielin, et al.
Pubblicazione: (2025)
di: Qiu, Jielin, et al.
Pubblicazione: (2025)
Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
di: Murthy, Rithesh, et al.
Pubblicazione: (2025)
di: Murthy, Rithesh, et al.
Pubblicazione: (2025)
PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Data
di: Tan, Juntao, et al.
Pubblicazione: (2025)
di: Tan, Juntao, et al.
Pubblicazione: (2025)
Prompt Optimization Via Diffusion Language Models
di: Wang, Shiyu, et al.
Pubblicazione: (2026)
di: Wang, Shiyu, et al.
Pubblicazione: (2026)
MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
di: Cen, Zhepeng, et al.
Pubblicazione: (2025)
di: Cen, Zhepeng, et al.
Pubblicazione: (2025)
Position: Vector Prompt Interfaces Should Be Exposed to Enable Customization of Large Language Models
di: Yang, Liangwei, et al.
Pubblicazione: (2026)
di: Yang, Liangwei, et al.
Pubblicazione: (2026)
RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation
di: Zhu, Ming, et al.
Pubblicazione: (2026)
di: Zhu, Ming, et al.
Pubblicazione: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
UserBench: An Interactive Gym Environment for User-Centric Agents
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
Personalized Multi-task Training for Recommender System
di: Yang, Liangwei, et al.
Pubblicazione: (2024)
di: Yang, Liangwei, et al.
Pubblicazione: (2024)
GeoGNN: Quantifying and Mitigating Semantic Drift in Text-Attributed Graphs
di: Yang, Liangwei, et al.
Pubblicazione: (2025)
di: Yang, Liangwei, et al.
Pubblicazione: (2025)
ToolLibGen: Scalable Automatic Tool Creation and Aggregation for LLM Reasoning
di: Yue, Murong, et al.
Pubblicazione: (2025)
di: Yue, Murong, et al.
Pubblicazione: (2025)
PRACT: Optimizing Principled Reasoning and Acting of LLM Agent
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
VoiceAgentRAG: Solving the RAG Latency Bottleneck in Real-Time Voice Agents Using Dual-Agent Architectures
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Enterprise Sales Copilot: Enabling Real-Time AI Support with Automatic Information Retrieval in Live Sales Calls
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
AgentLite: A Lightweight Library for Building and Advancing Task-Oriented LLM Agent System
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
di: Liu, Zuxin, et al.
Pubblicazione: (2024)
di: Liu, Zuxin, et al.
Pubblicazione: (2024)
UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents
di: Zhang, Kexun, et al.
Pubblicazione: (2024)
di: Zhang, Kexun, et al.
Pubblicazione: (2024)
AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning
di: Zhang, Jianguo, et al.
Pubblicazione: (2024)
di: Zhang, Jianguo, et al.
Pubblicazione: (2024)
CoDA: Coding LM via Diffusion Adaptation
di: Chen, Haolin, et al.
Pubblicazione: (2025)
di: Chen, Haolin, et al.
Pubblicazione: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
di: Yang, Liangwei, et al.
Pubblicazione: (2025)
di: Yang, Liangwei, et al.
Pubblicazione: (2025)
ActionStudio: A Lightweight Framework for Data and Training of Large Action Models
di: Zhang, Jianguo, et al.
Pubblicazione: (2025)
di: Zhang, Jianguo, et al.
Pubblicazione: (2025)
ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs
di: Kokane, Shirley, et al.
Pubblicazione: (2024)
di: Kokane, Shirley, et al.
Pubblicazione: (2024)
Test-Time Adaptation for LLM Agents via Environment Interaction
di: Chen, Arthur, et al.
Pubblicazione: (2025)
di: Chen, Arthur, et al.
Pubblicazione: (2025)
APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay
di: Prabhakar, Akshara, et al.
Pubblicazione: (2025)
di: Prabhakar, Akshara, et al.
Pubblicazione: (2025)
Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding
di: Chen, Haolin, et al.
Pubblicazione: (2024)
di: Chen, Haolin, et al.
Pubblicazione: (2024)
MobileAIBench: Benchmarking LLMs and LMMs for On-Device Use Cases
di: Murthy, Rithesh, et al.
Pubblicazione: (2024)
di: Murthy, Rithesh, et al.
Pubblicazione: (2024)
Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization
di: Yao, Weiran, et al.
Pubblicazione: (2023)
di: Yao, Weiran, et al.
Pubblicazione: (2023)
xLAM: A Family of Large Action Models to Empower AI Agent Systems
di: Zhang, Jianguo, et al.
Pubblicazione: (2024)
di: Zhang, Jianguo, et al.
Pubblicazione: (2024)
DialogStudio: Towards Richest and Most Diverse Unified Dataset Collection for Conversational AI
di: Zhang, Jianguo, et al.
Pubblicazione: (2023)
di: Zhang, Jianguo, et al.
Pubblicazione: (2023)
Causal Layering via Conditional Entropy
di: Feigenbaum, Itai, et al.
Pubblicazione: (2024)
di: Feigenbaum, Itai, et al.
Pubblicazione: (2024)
Editing Arbitrary Propositions in LLMs without Subject Labels
di: Feigenbaum, Itai, et al.
Pubblicazione: (2024)
di: Feigenbaum, Itai, et al.
Pubblicazione: (2024)
REX: Rapid Exploration and eXploitation for AI Agents
di: Murthy, Rithesh, et al.
Pubblicazione: (2023)
di: Murthy, Rithesh, et al.
Pubblicazione: (2023)
LATTE: Learning to Think with Vision Specialists
di: Ma, Zixian, et al.
Pubblicazione: (2024)
di: Ma, Zixian, et al.
Pubblicazione: (2024)
Towards More Robust and Accurate Sequential Recommendation with Cascade-guided Adversarial Training
di: Tan, Juntao, et al.
Pubblicazione: (2023)
di: Tan, Juntao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
di: Qiu, Jielin, et al.
Pubblicazione: (2025) -
Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
di: Murthy, Rithesh, et al.
Pubblicazione: (2025) -
PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Data
di: Tan, Juntao, et al.
Pubblicazione: (2025) -
Prompt Optimization Via Diffusion Language Models
di: Wang, Shiyu, et al.
Pubblicazione: (2026) -
MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)