InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Du, Yaxin, Zhang, Yuanshuo, Yang, Xiyuan, Zhou, Yifan, Wang, Cheng, Zou, Gongyi, Pang, Xianghe, Wang, Wenhao, Chen, Menglan, Tang, Shuo, Li, Zhiyu, Xiong, Feiyu, Chen, Siheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent Pair
por: Pang, Xianghe, et al.
Publicado: (2025)
por: Pang, Xianghe, et al.
Publicado: (2025)
MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation
por: Wang, Wenhao, et al.
Publicado: (2026)
por: Wang, Wenhao, et al.
Publicado: (2026)
VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization
por: Chen, Menglan, et al.
Publicado: (2025)
por: Chen, Menglan, et al.
Publicado: (2025)
SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
por: Yin, Sheng, et al.
Publicado: (2024)
por: Yin, Sheng, et al.
Publicado: (2024)
Text2Mem: A Unified Memory Operation Language for Memory Operating System
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
por: Wang, Wenhao, et al.
Publicado: (2025)
por: Wang, Wenhao, et al.
Publicado: (2025)
Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation
por: Pang, Xianghe, et al.
Publicado: (2024)
por: Pang, Xianghe, et al.
Publicado: (2024)
SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
por: Du, Yaxin, et al.
Publicado: (2025)
por: Du, Yaxin, et al.
Publicado: (2025)
InfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented Generation
por: Xi, Yunjia, et al.
Publicado: (2025)
por: Xi, Yunjia, et al.
Publicado: (2025)
WideSearch: Benchmarking Agentic Broad Info-Seeking
por: Wong, Ryan, et al.
Publicado: (2025)
por: Wong, Ryan, et al.
Publicado: (2025)
Malicious Agent Detection for Robust Multi-Agent Collaborative Perception
por: Zhao, Yangheng, et al.
Publicado: (2023)
por: Zhao, Yangheng, et al.
Publicado: (2023)
GNNs as Predictors of Agentic Workflow Performances
por: Zhang, Yuanshuo, et al.
Publicado: (2025)
por: Zhang, Yuanshuo, et al.
Publicado: (2025)
EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots
por: Lei, Zixing, et al.
Publicado: (2026)
por: Lei, Zixing, et al.
Publicado: (2026)
$G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA
por: Du, Yaxin, et al.
Publicado: (2026)
por: Du, Yaxin, et al.
Publicado: (2026)
Synthesizing Post-Training Data for LLMs through Multi-Agent Simulation
por: Tang, Shuo, et al.
Publicado: (2024)
por: Tang, Shuo, et al.
Publicado: (2024)
HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation
por: Liu, Hao, et al.
Publicado: (2025)
por: Liu, Hao, et al.
Publicado: (2025)
HRDE: Retrieval-Augmented Large Language Models for Chinese Health Rumor Detection and Explainability
por: Chen, Yanfang, et al.
Publicado: (2024)
por: Chen, Yanfang, et al.
Publicado: (2024)
X-MAS: Towards Building Multi-Agent Systems with Heterogeneous LLMs
por: Ye, Rui, et al.
Publicado: (2025)
por: Ye, Rui, et al.
Publicado: (2025)
InfoAgent: Advancing Autonomous Information-Seeking Agents
por: Zhang, Gongrui, et al.
Publicado: (2025)
por: Zhang, Gongrui, et al.
Publicado: (2025)
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
por: Ye, Rui, et al.
Publicado: (2024)
por: Ye, Rui, et al.
Publicado: (2024)
MoM: Mixtures of Scenario-Aware Document Memories for Retrieval-Augmented Generation Systems
por: Zhao, Jihao, et al.
Publicado: (2025)
por: Zhao, Jihao, et al.
Publicado: (2025)
DeepSeek‐Lattice‐KG: A Compact Language Model With Knowledge Graph Augmentation for Lattice Structure Design
por: Zhiyang Shu, et al.
Publicado: (2026)
por: Zhiyang Shu, et al.
Publicado: (2026)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
por: Wang, Sizhe, et al.
Publicado: (2025)
por: Wang, Sizhe, et al.
Publicado: (2025)
Pragmatic Communication in Multi-Agent Collaborative Perception
por: Hu, Yue, et al.
Publicado: (2024)
por: Hu, Yue, et al.
Publicado: (2024)
Distributed Multi-robot Source Seeking in Unknown Environments with Unknown Number of Sources
por: Chen, Lingpeng, et al.
Publicado: (2025)
por: Chen, Lingpeng, et al.
Publicado: (2025)
RARE: Retrieval-Augmented Reasoning Modeling
por: Wang, Zhengren, et al.
Publicado: (2025)
por: Wang, Zhengren, et al.
Publicado: (2025)
FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion
por: Ruan, Jiacheng, et al.
Publicado: (2024)
por: Ruan, Jiacheng, et al.
Publicado: (2024)
PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research
por: Miao, Tingjia, et al.
Publicado: (2026)
por: Miao, Tingjia, et al.
Publicado: (2026)
Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review
por: Ye, Rui, et al.
Publicado: (2024)
por: Ye, Rui, et al.
Publicado: (2024)
Enhancing Data Quality in Federated Fine-Tuning of Foundation Models
por: Zhao, Wanru, et al.
Publicado: (2024)
por: Zhao, Wanru, et al.
Publicado: (2024)
OpenFedLLM: Training Large Language Models on Decentralized Private Data via Federated Learning
por: Ye, Rui, et al.
Publicado: (2024)
por: Ye, Rui, et al.
Publicado: (2024)
Incomplete Utterance Rewriting with Editing Operation Guidance and Utterance Augmentation
por: Cao, Zhiyu, et al.
Publicado: (2025)
por: Cao, Zhiyu, et al.
Publicado: (2025)
Select-Mosaic: Data Augmentation Method for Dense Small Object Scenes
por: Zhang, Hao, et al.
Publicado: (2024)
por: Zhang, Hao, et al.
Publicado: (2024)
Non-collapsibility and Built-in Selection Bias of Hazard Ratio in Randomized Controlled Trials
por: Bian, Helen, et al.
Publicado: (2024)
por: Bian, Helen, et al.
Publicado: (2024)
Data-Efficient Learning of Anomalous Diffusion with Wavelet Representations: Enabling Direct Learning from Experimental Trajectories
por: Wang, Gongyi, et al.
Publicado: (2025)
por: Wang, Gongyi, et al.
Publicado: (2025)
MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation System
por: Zhao, Jihao, et al.
Publicado: (2025)
por: Zhao, Jihao, et al.
Publicado: (2025)
MAS-GPT: Training LLMs to Build LLM-based Multi-Agent Systems
por: Ye, Rui, et al.
Publicado: (2025)
por: Ye, Rui, et al.
Publicado: (2025)
MobileA3gent: Training Mobile GUI Agents Using Decentralized Self-Sourced Data from Diverse Users
por: Wang, Wenhao, et al.
Publicado: (2025)
por: Wang, Wenhao, et al.
Publicado: (2025)
Understanding InfoNCE: Transition Probability Matrix Induced Feature Clustering
por: Cheng, Ge, et al.
Publicado: (2025)
por: Cheng, Ge, et al.
Publicado: (2025)
Optimizing Cross-Client Domain Coverage for Federated Instruction Tuning of Large Language Models
por: Wang, Zezhou, et al.
Publicado: (2024)
por: Wang, Zezhou, et al.
Publicado: (2024)
Ejemplares similares
-
BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent Pair
por: Pang, Xianghe, et al.
Publicado: (2025) -
MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation
por: Wang, Wenhao, et al.
Publicado: (2026) -
VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization
por: Chen, Menglan, et al.
Publicado: (2025) -
SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
por: Yin, Sheng, et al.
Publicado: (2024) -
Text2Mem: A Unified Memory Operation Language for Memory Operating System
por: Wang, Yi, et al.
Publicado: (2025)