Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents
Fuente:
arXiv
Guardado en:
| Autor principal: | Kovács, Ádám |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
por: Phan, Huy Nhat, et al.
Publicado: (2024)
por: Phan, Huy Nhat, et al.
Publicado: (2024)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
por: Ni, Ziyi, et al.
Publicado: (2025)
por: Ni, Ziyi, et al.
Publicado: (2025)
Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution
por: Shastry, KN Ajay, et al.
Publicado: (2026)
por: Shastry, KN Ajay, et al.
Publicado: (2026)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
por: Li, Yuangang, et al.
Publicado: (2026)
por: Li, Yuangang, et al.
Publicado: (2026)
Output Format Biases in the Evaluation of Large Language Models for Code Translation
por: Macedo, Marcos, et al.
Publicado: (2024)
por: Macedo, Marcos, et al.
Publicado: (2024)
ToolFuzz -- Automated Agent Tool Testing
por: Milev, Ivan, et al.
Publicado: (2025)
por: Milev, Ivan, et al.
Publicado: (2025)
Architecture Without Architects: How AI Coding Agents Shape Software Architecture
por: Konrad, Phongsakon Mark, et al.
Publicado: (2026)
por: Konrad, Phongsakon Mark, et al.
Publicado: (2026)
User Centric Evaluation of Code Generation Tools
por: Miah, Tanha, et al.
Publicado: (2024)
por: Miah, Tanha, et al.
Publicado: (2024)
RA-Gen: A Controllable Code Generation Framework Using ReAct for Multi-Agent Task Execution
por: Liu, Aofan, et al.
Publicado: (2025)
por: Liu, Aofan, et al.
Publicado: (2025)
CodeWatcher: IDE Telemetry Data Extraction Tool for Understanding Coding Interactions with LLMs
por: Basha, Manaal, et al.
Publicado: (2025)
por: Basha, Manaal, et al.
Publicado: (2025)
Less is More: Towards Green Code Large Language Models via Unified Structural Pruning
por: Yang, Guang, et al.
Publicado: (2024)
por: Yang, Guang, et al.
Publicado: (2024)
RedCode: Risky Code Execution and Generation Benchmark for Code Agents
por: Guo, Chengquan, et al.
Publicado: (2024)
por: Guo, Chengquan, et al.
Publicado: (2024)
ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents
por: Li, Dawei, et al.
Publicado: (2026)
por: Li, Dawei, et al.
Publicado: (2026)
TaskEval: Assessing Difficulty of Code Generation Tasks for Large Language Models
por: Tambon, Florian, et al.
Publicado: (2024)
por: Tambon, Florian, et al.
Publicado: (2024)
EfficientUICoder: Efficient MLLM-based UI Code Generation via Input and Output Token Compression
por: Xiao, Jingyu, et al.
Publicado: (2025)
por: Xiao, Jingyu, et al.
Publicado: (2025)
CodeGenLink: A Tool to Find the Likely Origin and License of Automatically Generated Code
por: Bifolco, Daniele, et al.
Publicado: (2025)
por: Bifolco, Daniele, et al.
Publicado: (2025)
Code Review Agent Benchmark
por: Zhang, Yuntong, et al.
Publicado: (2026)
por: Zhang, Yuntong, et al.
Publicado: (2026)
Applying an Agentic Coding Tool for Improving Published Algorithm Implementations
por: Suwannik, Worasait
Publicado: (2026)
por: Suwannik, Worasait
Publicado: (2026)
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks
por: Hou, Shuyang, et al.
Publicado: (2024)
por: Hou, Shuyang, et al.
Publicado: (2024)
CodeR: Issue Resolving with Multi-Agent and Task Graphs
por: Chen, Dong, et al.
Publicado: (2024)
por: Chen, Dong, et al.
Publicado: (2024)
DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use
por: Chen, Aili, et al.
Publicado: (2026)
por: Chen, Aili, et al.
Publicado: (2026)
Runtime-Structured Task Decomposition for Agentic Coding Systems
por: Asthana, Shubhi, et al.
Publicado: (2026)
por: Asthana, Shubhi, et al.
Publicado: (2026)
Task Abstention for Large Language Models in Code Generation
por: Zhou, Yanke, et al.
Publicado: (2026)
por: Zhou, Yanke, et al.
Publicado: (2026)
Ambiguity Resolution with Human Feedback for Code Writing Tasks
por: Nandan, Aditey, et al.
Publicado: (2025)
por: Nandan, Aditey, et al.
Publicado: (2025)
An Empirical Study of Knowledge Distillation for Code Understanding Tasks
por: Wang, Ruiqi, et al.
Publicado: (2025)
por: Wang, Ruiqi, et al.
Publicado: (2025)
Automated Benchmark Generation for Repository-Level Coding Tasks
por: Vergopoulos, Konstantinos, et al.
Publicado: (2025)
por: Vergopoulos, Konstantinos, et al.
Publicado: (2025)
Workflows vs Agents for Code Translation
por: Gray, Henry, et al.
Publicado: (2025)
por: Gray, Henry, et al.
Publicado: (2025)
Theory of Code Space: Do Code Agents Understand Software Architecture?
por: Sapunov, Grigory
Publicado: (2026)
por: Sapunov, Grigory
Publicado: (2026)
SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion
por: Ma, George, et al.
Publicado: (2025)
por: Ma, George, et al.
Publicado: (2025)
Code for Machines, Not Just Humans: Quantifying AI-Friendliness with Code Health Metrics
por: Borg, Markus, et al.
Publicado: (2026)
por: Borg, Markus, et al.
Publicado: (2026)
Analyzing Message-Code Inconsistency in AI Coding Agent-Authored Pull Requests
por: Gong, Jingzhi, et al.
Publicado: (2026)
por: Gong, Jingzhi, et al.
Publicado: (2026)
Code Researcher: Deep Research Agent for Large Systems Code and Commit History
por: Singh, Ramneet, et al.
Publicado: (2025)
por: Singh, Ramneet, et al.
Publicado: (2025)
ASA: Training-Free Representation Engineering for Tool-Calling Agents
por: Wang, Youjin, et al.
Publicado: (2026)
por: Wang, Youjin, et al.
Publicado: (2026)
MCP-Zero: Active Tool Discovery for Autonomous LLM Agents
por: Fei, Xiang, et al.
Publicado: (2025)
por: Fei, Xiang, et al.
Publicado: (2025)
Schema First Tool APIs for LLM Agents: A Controlled Study of Tool Misuse, Recovery, and Budgeted Performance
por: Sigdel, Akshey, et al.
Publicado: (2026)
por: Sigdel, Akshey, et al.
Publicado: (2026)
Scaling Coding Agents via Atomic Skills
por: Ma, Yingwei, et al.
Publicado: (2026)
por: Ma, Yingwei, et al.
Publicado: (2026)
SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
por: Orlanski, Gabriel, et al.
Publicado: (2026)
por: Orlanski, Gabriel, et al.
Publicado: (2026)
DialogAgent: An Auto-engagement Agent for Code Question Answering Data Production
por: Liang, Xiaoyun, et al.
Publicado: (2024)
por: Liang, Xiaoyun, et al.
Publicado: (2024)
Coherence Collapse: Diagnosing Why Code Agents Fail After Reaching the Right Code
por: Kim, Myeongsoo, et al.
Publicado: (2026)
por: Kim, Myeongsoo, et al.
Publicado: (2026)
Does Code Cleanliness Affect Coding Agents? A Controlled Minimal-Pair Study
por: Trivedi, Priyansh, et al.
Publicado: (2026)
por: Trivedi, Priyansh, et al.
Publicado: (2026)
Ejemplares similares
-
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
por: Phan, Huy Nhat, et al.
Publicado: (2024) -
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
por: Ni, Ziyi, et al.
Publicado: (2025) -
Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution
por: Shastry, KN Ajay, et al.
Publicado: (2026) -
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
por: Li, Yuangang, et al.
Publicado: (2026) -
Output Format Biases in the Evaluation of Large Language Models for Code Translation
por: Macedo, Marcos, et al.
Publicado: (2024)