Benchmarking Agentic Workflow Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Qiao, Shuofei, Fang, Runnan, Qiu, Zhisong, Wang, Xiaobin, Zhang, Ningyu, Jiang, Yong, Xie, Pengjun, Huang, Fei, Chen, Huajun |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AutoAct: Automatic Agent Learning from Scratch for QA via Self-Planning
by: Qiao, Shuofei, et al.
Published: (2024)
by: Qiao, Shuofei, et al.
Published: (2024)
Agentic Knowledgeable Self-awareness
by: Qiao, Shuofei, et al.
Published: (2025)
by: Qiao, Shuofei, et al.
Published: (2025)
SynWorld: Virtual Scenario Synthesis for Agentic Action Knowledge Refinement
by: Fang, Runnan, et al.
Published: (2025)
by: Fang, Runnan, et al.
Published: (2025)
Memp: Exploring Agent Procedural Memory
by: Fang, Runnan, et al.
Published: (2025)
by: Fang, Runnan, et al.
Published: (2025)
KnowAgent: Knowledge-Augmented Planning for LLM-Based Agents
by: Zhu, Yuqi, et al.
Published: (2024)
by: Zhu, Yuqi, et al.
Published: (2024)
AutoMind: Adaptive Knowledgeable Agent for Automated Data Science
by: Ou, Yixin, et al.
Published: (2025)
by: Ou, Yixin, et al.
Published: (2025)
Agent Planning with World Knowledge Model
by: Qiao, Shuofei, et al.
Published: (2024)
by: Qiao, Shuofei, et al.
Published: (2024)
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
by: Qiu, Zhisong, et al.
Published: (2026)
by: Qiu, Zhisong, et al.
Published: (2026)
Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models
by: Mittal, Avni, et al.
Published: (2026)
by: Mittal, Avni, et al.
Published: (2026)
TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
by: Xuan, Xi, et al.
Published: (2025)
by: Xuan, Xi, et al.
Published: (2025)
Toward the Autonomous AI Doctor: Quantitative Benchmarking of an Autonomous Agentic AI Versus Board-Certified Clinicians in a Real World Setting
by: Hayat, Hashim, et al.
Published: (2025)
by: Hayat, Hashim, et al.
Published: (2025)
Agentic AI: The Era of Semantic Decoding
by: Peyrard, Maxime, et al.
Published: (2024)
by: Peyrard, Maxime, et al.
Published: (2024)
Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency
by: Xu, Haoming, et al.
Published: (2026)
by: Xu, Haoming, et al.
Published: (2026)
Exploring Plan Space through Conversation: An Agentic Framework for LLM-Mediated Explanations in Planning
by: Fouilhé, Guilhem, et al.
Published: (2026)
by: Fouilhé, Guilhem, et al.
Published: (2026)
FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
by: Wu, Haotian, et al.
Published: (2025)
by: Wu, Haotian, et al.
Published: (2025)
Scaffolding Empathy: Training Counselors with Simulated Patients and Utterance-level Performance Visualizations
by: Steenstra, Ian, et al.
Published: (2025)
by: Steenstra, Ian, et al.
Published: (2025)
Plato's Cave: A Human-Centered Research Verification System
by: Maldaner, Matheus Kunzler, et al.
Published: (2026)
by: Maldaner, Matheus Kunzler, et al.
Published: (2026)
The Application of MATEC (Multi-AI Agent Team Care) Framework in Sepsis Care
by: Cho, Andrew, et al.
Published: (2025)
by: Cho, Andrew, et al.
Published: (2025)
The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind
by: Lupu, Andrei, et al.
Published: (2025)
by: Lupu, Andrei, et al.
Published: (2025)
Proteus: Shapeshifting Desktop Visualizations for Mobile via Multi-level Intelligent Adaptation
by: Liu, Can, et al.
Published: (2026)
by: Liu, Can, et al.
Published: (2026)
ALLOY: Generating Reusable Agent Workflows from User Demonstration
by: Li, Jiawen, et al.
Published: (2025)
by: Li, Jiawen, et al.
Published: (2025)
OmniThink: Expanding Knowledge Boundaries in Machine Writing through Thinking
by: Xi, Zekun, et al.
Published: (2025)
by: Xi, Zekun, et al.
Published: (2025)
CompeteAI: Understanding the Competition Dynamics in Large Language Model-based Agents
by: Zhao, Qinlin, et al.
Published: (2023)
by: Zhao, Qinlin, et al.
Published: (2023)
Algorithmic Prompt Generation for Diverse Human-like Teaming and Communication with Large Language Models
by: Srikanth, Siddharth, et al.
Published: (2025)
by: Srikanth, Siddharth, et al.
Published: (2025)
AIAP: A No-Code Workflow Builder for Non-Experts with Natural Language and Multi-Agent Collaboration
by: An, Hyunjn, et al.
Published: (2025)
by: An, Hyunjn, et al.
Published: (2025)
Can LLMs Reason About Trust?: A Pilot Study
by: Debnath, Anushka, et al.
Published: (2025)
by: Debnath, Anushka, et al.
Published: (2025)
CultivAgents: Cultivating Relationship-Centered Multi-Agent Systems for Personalized Gardening
by: Wang, Yiyang, et al.
Published: (2026)
by: Wang, Yiyang, et al.
Published: (2026)
MADS: Multi-Agent Dialogue Simulation for Diverse Persuasion Data Generation
by: Li, Mingjin, et al.
Published: (2025)
by: Li, Mingjin, et al.
Published: (2025)
MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task Automation
by: Zhu, Zichen, et al.
Published: (2024)
by: Zhu, Zichen, et al.
Published: (2024)
The Automated but Risky Game: Modeling and Benchmarking Agent-to-Agent Negotiations and Transactions in Consumer Markets
by: Zhu, Shenzhe, et al.
Published: (2025)
by: Zhu, Shenzhe, et al.
Published: (2025)
CartoAgent: a multimodal large language model-powered multi-agent cartographic framework for map style transfer and evaluation
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
FlowEval: Reference-based Evaluation of Generated User Interfaces
by: Wu, Jason, et al.
Published: (2026)
by: Wu, Jason, et al.
Published: (2026)
MAxPrototyper: A Multi-Agent Generation System for Interactive User Interface Prototyping
by: Yuan, Mingyue, et al.
Published: (2024)
by: Yuan, Mingyue, et al.
Published: (2024)
Decoupled Intelligence: A Multi-Agent LLM Framework for Controllable Traffic Scenario Generation in SUMO
by: Li, Shuyang, et al.
Published: (2026)
by: Li, Shuyang, et al.
Published: (2026)
KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality
by: Ren, Baochang, et al.
Published: (2025)
by: Ren, Baochang, et al.
Published: (2025)
Auto-Slides: An Interactive Multi-Agent System for Creating and Customizing Research Presentations
by: Yang, Yuheng, et al.
Published: (2025)
by: Yang, Yuheng, et al.
Published: (2025)
LLMs Can Simulate Standardized Patients via Agent Coevolution
by: Du, Zhuoyun, et al.
Published: (2024)
by: Du, Zhuoyun, et al.
Published: (2024)
MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions
by: Liu, Yuxuan, et al.
Published: (2025)
by: Liu, Yuxuan, et al.
Published: (2025)
Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations
by: Mukherjee, Subhabrata, et al.
Published: (2026)
by: Mukherjee, Subhabrata, et al.
Published: (2026)
Prune4Web: DOM Tree Pruning Programming for Web Agent
by: Zhang, Jiayuan, et al.
Published: (2025)
by: Zhang, Jiayuan, et al.
Published: (2025)
Similar Items
-
AutoAct: Automatic Agent Learning from Scratch for QA via Self-Planning
by: Qiao, Shuofei, et al.
Published: (2024) -
Agentic Knowledgeable Self-awareness
by: Qiao, Shuofei, et al.
Published: (2025) -
SynWorld: Virtual Scenario Synthesis for Agentic Action Knowledge Refinement
by: Fang, Runnan, et al.
Published: (2025) -
Memp: Exploring Agent Procedural Memory
by: Fang, Runnan, et al.
Published: (2025) -
KnowAgent: Knowledge-Augmented Planning for LLM-Based Agents
by: Zhu, Yuqi, et al.
Published: (2024)