Same Signal, Different Semantics: A Cross-Framework Behavioral Analysis of Software Engineering Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Wei, Chen, Zhi, Gu, Jingxu, Li, Tianling, Liu, Shangqing, Jiang, Lingxiao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios
by: Chen, Zhi, et al.
Published: (2025)
by: Chen, Zhi, et al.
Published: (2025)
Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents
by: Chen, Zhi, et al.
Published: (2026)
by: Chen, Zhi, et al.
Published: (2026)
Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios
by: Chen, Zhi, et al.
Published: (2024)
by: Chen, Zhi, et al.
Published: (2024)
Unified Software Engineering Agent as AI Software Engineer
by: Applis, Leonhard, et al.
Published: (2025)
by: Applis, Leonhard, et al.
Published: (2025)
Promise and Peril of Collaborative Code Generation Models: Balancing Effectiveness and Memorization
by: Chen, Zhi, et al.
Published: (2024)
by: Chen, Zhi, et al.
Published: (2024)
Debugging the Debuggers: Failure-Anchored Structured Recovery for Software Engineering Agents
by: Zhao, Chenyu, et al.
Published: (2026)
by: Zhao, Chenyu, et al.
Published: (2026)
ALMAS: an Autonomous LLM-based Multi-Agent Software Engineering Framework
by: Tawosi, Vali, et al.
Published: (2025)
by: Tawosi, Vali, et al.
Published: (2025)
Impact-driven Context Filtering For Cross-file Code Completion
by: Li, Yanzhou, et al.
Published: (2025)
by: Li, Yanzhou, et al.
Published: (2025)
Your Instructions Are Not Always Helpful: Assessing the Efficacy of Instruction Fine-tuning for Software Vulnerability Detection
by: Yusuf, Imam Nur Bani, et al.
Published: (2024)
by: Yusuf, Imam Nur Bani, et al.
Published: (2024)
Unveiling Code Pre-Trained Models: Investigating Syntax and Semantics Capacities
by: Ma, Wei, et al.
Published: (2022)
by: Ma, Wei, et al.
Published: (2022)
AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering
by: Kumar, Rajesh, et al.
Published: (2026)
by: Kumar, Rajesh, et al.
Published: (2026)
Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute
by: Ma, Yingwei, et al.
Published: (2025)
by: Ma, Yingwei, et al.
Published: (2025)
SWE-Next: Scalable Real-World Software Engineering Tasks for Agents
by: Liang, Jiarong, et al.
Published: (2026)
by: Liang, Jiarong, et al.
Published: (2026)
Large Language Model-Based Agents for Software Engineering: A Survey
by: Liu, Junwei, et al.
Published: (2024)
by: Liu, Junwei, et al.
Published: (2024)
Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling
by: Trae Research Team, et al.
Published: (2025)
by: Trae Research Team, et al.
Published: (2025)
Do Research Software Engineers and Software Engineering Researchers Speak the Same Language?
by: Kehrer, Timo, et al.
Published: (2025)
by: Kehrer, Timo, et al.
Published: (2025)
From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents
by: Ma, Murong, et al.
Published: (2026)
by: Ma, Murong, et al.
Published: (2026)
SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering
by: Gong, Jingzhi, et al.
Published: (2026)
by: Gong, Jingzhi, et al.
Published: (2026)
Accountable Agents in Software Engineering: An Analysis of Terms of Service and a Research Roadmap
by: Treude, Christoph
Published: (2026)
by: Treude, Christoph
Published: (2026)
MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering
by: Guo, Chuanzhe, et al.
Published: (2026)
by: Guo, Chuanzhe, et al.
Published: (2026)
TOM-SWE: User Mental Modeling For Software Engineering Agents
by: Zhou, Xuhui, et al.
Published: (2025)
by: Zhou, Xuhui, et al.
Published: (2025)
Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models
by: Wang, Jian, et al.
Published: (2025)
by: Wang, Jian, et al.
Published: (2025)
daVinci-Dev: Agent-native Mid-training for Software Engineering
by: Zeng, Ji, et al.
Published: (2026)
by: Zeng, Ji, et al.
Published: (2026)
LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
by: Qiu, Jielin, et al.
Published: (2025)
by: Qiu, Jielin, et al.
Published: (2025)
Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents
by: Tse-Hsun, et al.
Published: (2026)
by: Tse-Hsun, et al.
Published: (2026)
Agents in Software Engineering: Survey, Landscape, and Vision
by: Wang, Yanlin, et al.
Published: (2024)
by: Wang, Yanlin, et al.
Published: (2024)
Transducer Tuning: Efficient Model Adaptation for Software Tasks Using Code Property Graphs
by: Yusuf, Imam Nur Bani, et al.
Published: (2024)
by: Yusuf, Imam Nur Bani, et al.
Published: (2024)
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
by: Han, Tingxu, et al.
Published: (2026)
by: Han, Tingxu, et al.
Published: (2026)
FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair
by: Ma, Ruize, et al.
Published: (2026)
by: Ma, Ruize, et al.
Published: (2026)
Same App, Different Behaviors: Uncovering Device-specific Behaviors in Android Apps
by: Dong, Zikan, et al.
Published: (2024)
by: Dong, Zikan, et al.
Published: (2024)
Reversa: A Reverse Documentation Engineering Framework for Converting Legacy Software into Operational Specifications for AI Agents
by: de Macedo, Sanderson Oliveira, et al.
Published: (2026)
by: de Macedo, Sanderson Oliveira, et al.
Published: (2026)
Prompt Stability in Code LLMs: Measuring Sensitivity across Emotion- and Personality-Driven Variations
by: Ma, Wei, et al.
Published: (2025)
by: Ma, Wei, et al.
Published: (2025)
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
by: Phan, Huy Nhat, et al.
Published: (2024)
by: Phan, Huy Nhat, et al.
Published: (2024)
Structurally Aligned Subtask-Level Memory for Software Engineering Agents
by: Shen, Kangning, et al.
Published: (2026)
by: Shen, Kangning, et al.
Published: (2026)
Lifecycle-Aware code generation: Leveraging Software Engineering Phases in LLMs
by: Xing, Xing, et al.
Published: (2025)
by: Xing, Xing, et al.
Published: (2025)
From Correctness to Collaboration: Toward a Human-Centered Framework for Evaluating AI Agent Behavior in Software Engineering
by: Dong, Tao, et al.
Published: (2025)
by: Dong, Tao, et al.
Published: (2025)
AgentGuard: A Multi-Agent Framework for Robust Package Confusion Detection via Hybrid Search and Metadata-Content Fusion
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
Software Performance Engineering for Foundation Model-Powered Software
by: Zhang, Haoxiang, et al.
Published: (2024)
by: Zhang, Haoxiang, et al.
Published: (2024)
From Human Interfaces to Agent Interfaces: Rethinking Software Design in the Age of AI-Native Systems
by: Wang, Shaolin, et al.
Published: (2026)
by: Wang, Shaolin, et al.
Published: (2026)
OmniCode: A Benchmark for Evaluating Software Engineering Agents
by: Sonwane, Atharv, et al.
Published: (2026)
by: Sonwane, Atharv, et al.
Published: (2026)
Similar Items
-
Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios
by: Chen, Zhi, et al.
Published: (2025) -
Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents
by: Chen, Zhi, et al.
Published: (2026) -
Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios
by: Chen, Zhi, et al.
Published: (2024) -
Unified Software Engineering Agent as AI Software Engineer
by: Applis, Leonhard, et al.
Published: (2025) -
Promise and Peril of Collaborative Code Generation Models: Balancing Effectiveness and Memorization
by: Chen, Zhi, et al.
Published: (2024)