DDL2PropBank Agent: Benchmarking Multi-Agent Frameworks' Developer Experience Through a Novel Relational Schema Mapping Task
Fuente:
arXiv
Salvato in:
| Autori principali: | Ahmed, Shafiuddin Rehan, Wei, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Within-Document Event Coreference with BERT-Based Contextualized Representations
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2021)
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2021)
Enhancing Retrieval for ESGLLM via ESG-CID -- A Disclosure Content Index Finetuning Dataset for Mapping GRI and ESRS
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2025)
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2025)
X-AMR Annotation Tool
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2024)
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2024)
CAMRA: Copilot for AMR Annotation
di: Cai, Jon Z., et al.
Pubblicazione: (2023)
di: Cai, Jon Z., et al.
Pubblicazione: (2023)
From Algebraic Word Problem to Program: A Formalized Approach
di: Wiemerslage, Adam, et al.
Pubblicazione: (2020)
di: Wiemerslage, Adam, et al.
Pubblicazione: (2020)
Linear Cross-document Event Coreference Resolution with X-AMR
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2024)
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2024)
Schema-Guided Culture-Aware Complex Event Simulation with Multi-Agent Role-Play
di: Li, Sha, et al.
Pubblicazione: (2024)
di: Li, Sha, et al.
Pubblicazione: (2024)
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
di: Shen, Yiting, et al.
Pubblicazione: (2026)
di: Shen, Yiting, et al.
Pubblicazione: (2026)
Truth Sleuth and Trend Bender: AI Agents to fact-check YouTube videos and influence opinions
di: Logé, Cécile, et al.
Pubblicazione: (2025)
di: Logé, Cécile, et al.
Pubblicazione: (2025)
AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectories
di: Song, Yifan, et al.
Pubblicazione: (2024)
di: Song, Yifan, et al.
Pubblicazione: (2024)
Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
di: Jing, Huihao, et al.
Pubblicazione: (2025)
di: Jing, Huihao, et al.
Pubblicazione: (2025)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
GLiNER2: An Efficient Multi-Task Information Extraction System with Schema-Driven Interface
di: Zaratiana, Urchade, et al.
Pubblicazione: (2025)
di: Zaratiana, Urchade, et al.
Pubblicazione: (2025)
Schema-Aware Multi-Task Learning for Complex Text-to-SQL
di: Wu, Yangjun, et al.
Pubblicazione: (2024)
di: Wu, Yangjun, et al.
Pubblicazione: (2024)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
di: He, Wei, et al.
Pubblicazione: (2025)
di: He, Wei, et al.
Pubblicazione: (2025)
Grounding Agent Reasoning in Image Schemas: A Neurosymbolic Approach to Embodied Cognition
di: Olivier, François, et al.
Pubblicazione: (2025)
di: Olivier, François, et al.
Pubblicazione: (2025)
InfiAgent-DABench: Evaluating Agents on Data Analysis Tasks
di: Hu, Xueyu, et al.
Pubblicazione: (2024)
di: Hu, Xueyu, et al.
Pubblicazione: (2024)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025)
di: Li, Junlong, et al.
Pubblicazione: (2025)
MAG-SQL: Multi-Agent Generative Approach with Soft Schema Linking and Iterative Sub-SQL Refinement for Text-to-SQL
di: Xie, Wenxuan, et al.
Pubblicazione: (2024)
di: Xie, Wenxuan, et al.
Pubblicazione: (2024)
Enhancing Text Classification with a Novel Multi-Agent Collaboration Framework Leveraging BERT
di: Baban, Hediyeh, et al.
Pubblicazione: (2025)
di: Baban, Hediyeh, et al.
Pubblicazione: (2025)
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
di: Yang, Cheng, et al.
Pubblicazione: (2025)
di: Yang, Cheng, et al.
Pubblicazione: (2025)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
AgentQuest: A Modular Benchmark Framework to Measure Progress and Improve LLM Agents
di: Gioacchini, Luca, et al.
Pubblicazione: (2024)
di: Gioacchini, Luca, et al.
Pubblicazione: (2024)
Iterative Experience Refinement of Software-Developing Agents
di: Qian, Chen, et al.
Pubblicazione: (2024)
di: Qian, Chen, et al.
Pubblicazione: (2024)
Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks
di: Yin, Jiaqi, et al.
Pubblicazione: (2025)
di: Yin, Jiaqi, et al.
Pubblicazione: (2025)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
AutoPatent: A Multi-Agent Framework for Automatic Patent Generation
di: Wang, Qiyao, et al.
Pubblicazione: (2024)
di: Wang, Qiyao, et al.
Pubblicazione: (2024)
MADIAVE: Multi-Agent Debate for Implicit Attribute Value Extraction
di: Huang, Wei-Chieh, et al.
Pubblicazione: (2025)
di: Huang, Wei-Chieh, et al.
Pubblicazione: (2025)
The Cognitive Bandwidth Bottleneck: Shifting Long-Horizon Agent from Planning with Actions to Planning with Schemas
di: Xu, Baixuan, et al.
Pubblicazione: (2025)
di: Xu, Baixuan, et al.
Pubblicazione: (2025)
GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks
di: Krechetova, Varvara, et al.
Pubblicazione: (2025)
di: Krechetova, Varvara, et al.
Pubblicazione: (2025)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
di: Xie, Tianbao, et al.
Pubblicazione: (2024)
di: Xie, Tianbao, et al.
Pubblicazione: (2024)
Building from Scratch: A Multi-Agent Framework with Human-in-the-Loop for Multilingual Legal Terminology Mapping
di: Meng, Lingyi, et al.
Pubblicazione: (2025)
di: Meng, Lingyi, et al.
Pubblicazione: (2025)
Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue
di: Gao, Ning, et al.
Pubblicazione: (2026)
di: Gao, Ning, et al.
Pubblicazione: (2026)
MedAgentBoard: Benchmarking Multi-Agent Collaboration with Conventional Methods for Diverse Medical Tasks
di: Zhu, Yinghao, et al.
Pubblicazione: (2025)
di: Zhu, Yinghao, et al.
Pubblicazione: (2025)
PolicyBank: Evolving Policy Understanding for LLM Agents
di: Choi, Jihye, et al.
Pubblicazione: (2026)
di: Choi, Jihye, et al.
Pubblicazione: (2026)
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
Leverage Laws: A Per-Task Framework for Human-Agent Collaboration
di: Loosmore, Stan
Pubblicazione: (2026)
di: Loosmore, Stan
Pubblicazione: (2026)
Unleashing the Emergent Cognitive Synergy in Large Language Models: A Task-Solving Agent through Multi-Persona Self-Collaboration
di: Wang, Zhenhailong, et al.
Pubblicazione: (2023)
di: Wang, Zhenhailong, et al.
Pubblicazione: (2023)
Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs
di: Chen, Yurun, et al.
Pubblicazione: (2025)
di: Chen, Yurun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Within-Document Event Coreference with BERT-Based Contextualized Representations
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2021) -
Enhancing Retrieval for ESGLLM via ESG-CID -- A Disclosure Content Index Finetuning Dataset for Mapping GRI and ESRS
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2025) -
X-AMR Annotation Tool
di: Ahmed, Shafiuddin Rehan, et al.
Pubblicazione: (2024) -
CAMRA: Copilot for AMR Annotation
di: Cai, Jon Z., et al.
Pubblicazione: (2023) -
From Algebraic Word Problem to Program: A Formalized Approach
di: Wiemerslage, Adam, et al.
Pubblicazione: (2020)