Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Hao, Mu, Chunjiang, Chen, Jianhao, Ren, Siyue, Cui, Zhiyao, Zhang, Yiqun, Bai, Lei, Hu, Shuyue |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond GPT-5: Making LLMs Cheaper and Better via Performance-Efficiency Optimized Routing
par: Zhang, Yiqun, et autres
Publié: (2025)
par: Zhang, Yiqun, et autres
Publié: (2025)
Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity
par: Zhang, Hangfan, et autres
Publié: (2025)
par: Zhang, Hangfan, et autres
Publié: (2025)
Emergence of Social Norms in Generative Agent Societies: Principles and Architecture
par: Ren, Siyue, et autres
Publié: (2024)
par: Ren, Siyue, et autres
Publié: (2024)
Multi-Agent, Human-Agent and Beyond: A Survey on Cooperation in Social Dilemmas
par: Mu, Chunjiang, et autres
Publié: (2024)
par: Mu, Chunjiang, et autres
Publié: (2024)
MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings
par: Zhang, Yiqun, et autres
Publié: (2026)
par: Zhang, Yiqun, et autres
Publié: (2026)
AOrchestra: Automating Sub-Agent Creation for Agentic Orchestration
par: Ruan, Jianhao, et autres
Publié: (2026)
par: Ruan, Jianhao, et autres
Publié: (2026)
Nature-Inspired Population-Based Evolution of Large Language Models
par: Zhang, Yiqun, et autres
Publié: (2025)
par: Zhang, Yiqun, et autres
Publié: (2025)
MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation
par: Chen, Yiqun, et autres
Publié: (2025)
par: Chen, Yiqun, et autres
Publié: (2025)
ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory
par: Ge, Zhuohan, et autres
Publié: (2026)
par: Ge, Zhuohan, et autres
Publié: (2026)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
par: Qu, Yubin, et autres
Publié: (2026)
par: Qu, Yubin, et autres
Publié: (2026)
Data Agent: A Holistic Architecture for Orchestrating Data+AI Ecosystems
par: Sun, Zhaoyan, et autres
Publié: (2025)
par: Sun, Zhaoyan, et autres
Publié: (2025)
The Avengers: A Simple Recipe for Uniting Smaller Language Models to Challenge Proprietary Giants
par: Zhang, Yiqun, et autres
Publié: (2025)
par: Zhang, Yiqun, et autres
Publié: (2025)
Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
par: Qiao, Yuxuan, et autres
Publié: (2025)
par: Qiao, Yuxuan, et autres
Publié: (2025)
The Scaling Laws of Skills in LLM Agent Systems
par: Chen, Charles, et autres
Publié: (2026)
par: Chen, Charles, et autres
Publié: (2026)
MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
par: Che, Xinyu, et autres
Publié: (2026)
par: Che, Xinyu, et autres
Publié: (2026)
Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation
par: Cui, Zhiyao, et autres
Publié: (2026)
par: Cui, Zhiyao, et autres
Publié: (2026)
Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence
par: Hu, Shuyue, et autres
Publié: (2025)
par: Hu, Shuyue, et autres
Publié: (2025)
RefuteBench 2.0 -- Agentic Benchmark for Dynamic Evaluation of LLM Responses to Refutation Instruction
par: Yan, Jianhao, et autres
Publié: (2025)
par: Yan, Jianhao, et autres
Publié: (2025)
Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents
par: Yu, Jianxiang, et autres
Publié: (2026)
par: Yu, Jianxiang, et autres
Publié: (2026)
Guardrails Beat Guidance: A Large-Scale Study of Rules, Skills, and Persistent Configuration for Coding Agents
par: Zhang, Xing, et autres
Publié: (2026)
par: Zhang, Xing, et autres
Publié: (2026)
LitVISTA: A Benchmark for Narrative Orchestration in Literary Text
par: Lu, Mingzhe, et autres
Publié: (2026)
par: Lu, Mingzhe, et autres
Publié: (2026)
Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
par: Yang, Chang, et autres
Publié: (2025)
par: Yang, Chang, et autres
Publié: (2025)
Lyra: Orchestrating Dual Correction in Automated Theorem Proving
par: Zheng, Chuanyang, et autres
Publié: (2023)
par: Zheng, Chuanyang, et autres
Publié: (2023)
Scaling Physical Reasoning with the PHYSICS Dataset
par: Zheng, Shenghe, et autres
Publié: (2025)
par: Zheng, Shenghe, et autres
Publié: (2025)
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
par: Wu, Jinyang, et autres
Publié: (2026)
par: Wu, Jinyang, et autres
Publié: (2026)
Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
par: Li, Xinze, et autres
Publié: (2026)
par: Li, Xinze, et autres
Publié: (2026)
Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research
par: Zhang, Qianqian, et autres
Publié: (2025)
par: Zhang, Qianqian, et autres
Publié: (2025)
Benchmark Test-Time Scaling of General LLM Agents
par: Li, Xiaochuan, et autres
Publié: (2026)
par: Li, Xiaochuan, et autres
Publié: (2026)
Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation
par: Ren, Zhiyao, et autres
Publié: (2026)
par: Ren, Zhiyao, et autres
Publié: (2026)
SynTQA: Synergistic Table-based Question Answering via Mixture of Text-to-SQL and E2E TQA
par: Zhang, Siyue, et autres
Publié: (2024)
par: Zhang, Siyue, et autres
Publié: (2024)
Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG
par: Sun, Yiqun, et autres
Publié: (2026)
par: Sun, Yiqun, et autres
Publié: (2026)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
RPDR: A Round-trip Prediction-Based Data Augmentation Framework for Long-Tail Question Answering
par: Zhang, Yiming, et autres
Publié: (2026)
par: Zhang, Yiming, et autres
Publié: (2026)
Benchmarking Data Science Agents
par: Zhang, Yuge, et autres
Publié: (2024)
par: Zhang, Yuge, et autres
Publié: (2024)
Multi-Agent Collaboration via Evolving Orchestration
par: Dang, Yufan, et autres
Publié: (2025)
par: Dang, Yufan, et autres
Publié: (2025)
AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture
par: Yang, Bo, et autres
Publié: (2026)
par: Yang, Bo, et autres
Publié: (2026)
SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs
par: Li, Xiaoyuan, et autres
Publié: (2026)
par: Li, Xiaoyuan, et autres
Publié: (2026)
Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
par: Sun, Haochen, et autres
Publié: (2025)
par: Sun, Haochen, et autres
Publié: (2025)
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
par: Kang, Hao, et autres
Publié: (2024)
par: Kang, Hao, et autres
Publié: (2024)
Terminal-World: Scaling Terminal-Agent Environments via Agent Skills
par: Cheng, Zihao, et autres
Publié: (2026)
par: Cheng, Zihao, et autres
Publié: (2026)
Documents similaires
-
Beyond GPT-5: Making LLMs Cheaper and Better via Performance-Efficiency Optimized Routing
par: Zhang, Yiqun, et autres
Publié: (2025) -
Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity
par: Zhang, Hangfan, et autres
Publié: (2025) -
Emergence of Social Norms in Generative Agent Societies: Principles and Architecture
par: Ren, Siyue, et autres
Publié: (2024) -
Multi-Agent, Human-Agent and Beyond: A Survey on Cooperation in Social Dilemmas
par: Mu, Chunjiang, et autres
Publié: (2024) -
MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings
par: Zhang, Yiqun, et autres
Publié: (2026)