daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Mohan, Fu, Dayuan, Shi, Junhao, Zeng, Ji, Si, Weiye, Li, Keyu, Li, Xuefeng, Xiao, Yang, Li, Wenjie, Wang, Dequan, Liu, Pengfei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
daVinci-Dev: Agent-native Mid-training for Software Engineering
par: Zeng, Ji, et autres
Publié: (2026)
par: Zeng, Ji, et autres
Publié: (2026)
daVinci-Env: Open SWE Environment Synthesis at Scale
par: Fu, Dayuan, et autres
Publié: (2026)
par: Fu, Dayuan, et autres
Publié: (2026)
AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
par: Li, Keyu, et autres
Publié: (2026)
par: Li, Keyu, et autres
Publié: (2026)
daVinci-LLM:Towards the Science of Pretraining
par: Qin, Yiwei, et autres
Publié: (2026)
par: Qin, Yiwei, et autres
Publié: (2026)
LIMI: Less is More for Agency
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
DatasetResearch: Benchmarking Agent Systems for Demand-Driven Dataset Discovery
par: Li, Keyu, et autres
Publié: (2025)
par: Li, Keyu, et autres
Publié: (2025)
A Small Leak Sinks All: Exploring the Transferable Vulnerability of Source Code Models
par: Li, Weiye, et autres
Publié: (2025)
par: Li, Weiye, et autres
Publié: (2025)
Interaction as Intelligence Part II: Asynchronous Human-Agent Rollout for Long-Horizon Task Training
par: Fu, Dayuan, et autres
Publié: (2025)
par: Fu, Dayuan, et autres
Publié: (2025)
A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management
par: Liu, Yang, et autres
Publié: (2026)
par: Liu, Yang, et autres
Publié: (2026)
Libraries and Subscription Agencies: Interactions and Innovations.
par: Gellatly, Peter, Ed., et autres
Publié: (1988)
par: Gellatly, Peter, Ed., et autres
Publié: (1988)
Prometheus: Towards Long-Horizon Codebase Navigation for Repository-Level Problem Solving
par: Pan, Yue, et autres
Publié: (2025)
par: Pan, Yue, et autres
Publié: (2025)
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
par: Xu, Xinbo, et autres
Publié: (2026)
par: Xu, Xinbo, et autres
Publié: (2026)
SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies
par: Saxena, Siddhant, et autres
Publié: (2026)
par: Saxena, Siddhant, et autres
Publié: (2026)
SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering
par: Ren, Qingnan, et autres
Publié: (2026)
par: Ren, Qingnan, et autres
Publié: (2026)
From Assistance to Agency: Rethinking Autonomy and Control in CI/CD Pipelines
par: Barnes, Marcus Emmanuel, et autres
Publié: (2026)
par: Barnes, Marcus Emmanuel, et autres
Publié: (2026)
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
par: Zhao, Bingchen, et autres
Publié: (2026)
par: Zhao, Bingchen, et autres
Publié: (2026)
Unlocking the Power of Numbers: Log Compression via Numeric Token Parsing
par: Yu, Siyu, et autres
Publié: (2024)
par: Yu, Siyu, et autres
Publié: (2024)
EfficientEdit: Accelerating Code Editing via Edit-Oriented Speculative Decoding
par: Wang, Peiding, et autres
Publié: (2025)
par: Wang, Peiding, et autres
Publié: (2025)
From Junior to Senior: Allocating Agency and Navigating Professional Growth in Agentic AI-Mediated Software Engineering
par: Feng, Dana, et autres
Publié: (2026)
par: Feng, Dana, et autres
Publié: (2026)
LONGCODEU: Benchmarking Long-Context Language Models on Long Code Understanding
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming
par: Si, Yuan, et autres
Publié: (2026)
par: Si, Yuan, et autres
Publié: (2026)
EcoScratch: Cost-Effective Multimodal Repair for Scratch Using Execution Feedback
par: Si, Yuan, et autres
Publié: (2026)
par: Si, Yuan, et autres
Publié: (2026)
Stitch: Step-by-step LLM Guided Tutoring for Scratch
par: Si, Yuan, et autres
Publié: (2025)
par: Si, Yuan, et autres
Publié: (2025)
QuanTest: Entanglement-Guided Testing of Quantum Neural Network Systems
par: Shi, Jinjing, et autres
Publié: (2024)
par: Shi, Jinjing, et autres
Publié: (2024)
Probabilistic Verification of Neural Networks via Efficient Probabilistic Hull Generation
par: Li, Jingyang, et autres
Publié: (2026)
par: Li, Jingyang, et autres
Publié: (2026)
aiXcoder-7B-v2: Training LLMs to Fully Utilize the Long Context in Repository-level Code Completion
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
ViScratch: Using Large Language Models and Gameplay Videos for Automated Feedback in Scratch
par: Si, Yuan, et autres
Publié: (2025)
par: Si, Yuan, et autres
Publié: (2025)
Enhancing LLMs in Long Code Translation through Instrumentation and Program State Alignment
par: Xin-Ye, Li, et autres
Publié: (2025)
par: Xin-Ye, Li, et autres
Publié: (2025)
KModels: Unlocking AI for Business Applications
par: Abitbol, Roy, et autres
Publié: (2024)
par: Abitbol, Roy, et autres
Publié: (2024)
The Limits of Long-Context Reasoning in Automated Bug Fixing
par: Raju, Ravi, et autres
Publié: (2026)
par: Raju, Ravi, et autres
Publié: (2026)
LLMigrate: Transforming "Lazy" Large Language Models into Efficient Source Code Migrators
par: Liu, Yuchen, et autres
Publié: (2025)
par: Liu, Yuchen, et autres
Publié: (2025)
Tackling Long Code Search with Splitting, Encoding, and Aggregating
par: Hu, Fan, et autres
Publié: (2022)
par: Hu, Fan, et autres
Publié: (2022)
Adaptive and Efficient Log Parsing as a Cloud Service
par: Li, Zeyan, et autres
Publié: (2025)
par: Li, Zeyan, et autres
Publié: (2025)
Unseen Horizons: Unveiling the Real Capability of LLM Code Generation Beyond the Familiar
par: Zhang, Yuanliang, et autres
Publié: (2024)
par: Zhang, Yuanliang, et autres
Publié: (2024)
Counterexample Guided Branching via Directional Relaxation Analysis in Complete Neural Network Verification
par: Li, Jingyang, et autres
Publié: (2026)
par: Li, Jingyang, et autres
Publié: (2026)
What Makes Programmers Laugh? Exploring the Submissions of the Subreddit r/ProgrammerHumor
par: Kuutila, Miikka, et autres
Publié: (2024)
par: Kuutila, Miikka, et autres
Publié: (2024)
Boosting Automatic Java-to-Cangjie Translation with Multi-Stage LLM Training and Error Repair
par: Liang, Xinyue, et autres
Publié: (2026)
par: Liang, Xinyue, et autres
Publié: (2026)
When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
par: Yan, Lu, et autres
Publié: (2026)
par: Yan, Lu, et autres
Publié: (2026)
The Conversations Beneath the Code: Triadic Data for Long-Horizon Software Engineering Agents
par: Kim, Yelin
Publié: (2026)
par: Kim, Yelin
Publié: (2026)
ABFS: Natural Robustness Testing for LLM-based NLP Software
par: Xiao, Mingxuan, et autres
Publié: (2025)
par: Xiao, Mingxuan, et autres
Publié: (2025)
Documents similaires
-
daVinci-Dev: Agent-native Mid-training for Software Engineering
par: Zeng, Ji, et autres
Publié: (2026) -
daVinci-Env: Open SWE Environment Synthesis at Scale
par: Fu, Dayuan, et autres
Publié: (2026) -
AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
par: Li, Keyu, et autres
Publié: (2026) -
daVinci-LLM:Towards the Science of Pretraining
par: Qin, Yiwei, et autres
Publié: (2026) -
LIMI: Less is More for Agency
par: Xiao, Yang, et autres
Publié: (2025)