Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports
Fuente:
arXiv
Salvato in:
| Autori principali: | Yao, Yang, Wang, Yixu, Zhang, Yuxuan, Lu, Yi, Gu, Tianle, Li, Lingyu, Zhao, Dingyi, Wu, Keming, Wang, Haozhe, Nie, Ping, Teng, Yan, Wang, Yingchun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reflection-Bench: Evaluating Epistemic Agency in Large Language Models
di: Li, Lingyu, et al.
Pubblicazione: (2024)
di: Li, Lingyu, et al.
Pubblicazione: (2024)
HoneypotNet: Backdoor Attacks Against Model Extraction
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
The Other Mind: How Language Models Exhibit Human Temporal Cognition
di: Li, Lingyu, et al.
Pubblicazione: (2025)
di: Li, Lingyu, et al.
Pubblicazione: (2025)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?
di: Yao, Yang, et al.
Pubblicazione: (2025)
di: Yao, Yang, et al.
Pubblicazione: (2025)
StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
di: Gu, Tianle, et al.
Pubblicazione: (2025)
di: Gu, Tianle, et al.
Pubblicazione: (2025)
ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models
di: Zhao, Haiquan, et al.
Pubblicazione: (2024)
di: Zhao, Haiquan, et al.
Pubblicazione: (2024)
Mechanistic Origin of Moral Indifference in Language Models
di: Li, Lingyu, et al.
Pubblicazione: (2026)
di: Li, Lingyu, et al.
Pubblicazione: (2026)
OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs
di: Wang, Xin, et al.
Pubblicazione: (2026)
di: Wang, Xin, et al.
Pubblicazione: (2026)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
di: Gu, Tianle, et al.
Pubblicazione: (2024)
di: Gu, Tianle, et al.
Pubblicazione: (2024)
Towards Context-Invariant Safety Alignment for Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2026)
di: Wang, Yixu, et al.
Pubblicazione: (2026)
From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation
di: Gu, Tianle, et al.
Pubblicazione: (2026)
di: Gu, Tianle, et al.
Pubblicazione: (2026)
MEOW: MEMOry Supervised LLM Unlearning Via Inverted Facts
di: Gu, Tianle, et al.
Pubblicazione: (2024)
di: Gu, Tianle, et al.
Pubblicazione: (2024)
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
di: Yao, Yang, et al.
Pubblicazione: (2025)
di: Yao, Yang, et al.
Pubblicazione: (2025)
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
di: Yu, Jiaqi, et al.
Pubblicazione: (2026)
di: Yu, Jiaqi, et al.
Pubblicazione: (2026)
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
di: Song, Jiaxin, et al.
Pubblicazione: (2025)
di: Song, Jiaxin, et al.
Pubblicazione: (2025)
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
di: Wang, Yibo, et al.
Pubblicazione: (2026)
di: Wang, Yibo, et al.
Pubblicazione: (2026)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
di: Li, Ruizhe, et al.
Pubblicazione: (2026)
di: Li, Ruizhe, et al.
Pubblicazione: (2026)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
di: Li, Minghao, et al.
Pubblicazione: (2025)
di: Li, Minghao, et al.
Pubblicazione: (2025)
The inversion number of dijoins and blow-up digraphs
di: Wang, Haozhe, et al.
Pubblicazione: (2024)
di: Wang, Haozhe, et al.
Pubblicazione: (2024)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?
di: Chen, Chiyu, et al.
Pubblicazione: (2025)
di: Chen, Chiyu, et al.
Pubblicazione: (2025)
Deep Research Bench: Evaluating AI Web Research Agents
di: FutureSearch, et al.
Pubblicazione: (2025)
di: FutureSearch, et al.
Pubblicazione: (2025)
Inversion diameter and treewidth
di: Wang, Yichen, et al.
Pubblicazione: (2024)
di: Wang, Yichen, et al.
Pubblicazione: (2024)
From <Answer> to <Think>: Multidimensional Supervision of Reasoning Process for LLM Optimization
di: Wang, Beining, et al.
Pubblicazione: (2025)
di: Wang, Beining, et al.
Pubblicazione: (2025)
PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent
di: Nie, Hongyi, et al.
Pubblicazione: (2026)
di: Nie, Hongyi, et al.
Pubblicazione: (2026)
Trends and Evolution of Hydrogen Storage Technology Research: A Multidimensional Analysis Using Bibliometrics and LDA Model
di: Huiyang Wang, et al.
Pubblicazione: (2025)
di: Huiyang Wang, et al.
Pubblicazione: (2025)
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
di: Zhu, Fengbin, et al.
Pubblicazione: (2025)
di: Zhu, Fengbin, et al.
Pubblicazione: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision
di: Chen, Bingsen, et al.
Pubblicazione: (2026)
di: Chen, Bingsen, et al.
Pubblicazione: (2026)
UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench
di: Yu, Boxi, et al.
Pubblicazione: (2025)
di: Yu, Boxi, et al.
Pubblicazione: (2025)
Identifying the Relationships Among Ecosystem Services and Their Influencing Pathways in the Jialing River Basin: An Integrated Social‐Ecological Perspective
di: Yixu Wang, et al.
Pubblicazione: (2025)
di: Yixu Wang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reflection-Bench: Evaluating Epistemic Agency in Large Language Models
di: Li, Lingyu, et al.
Pubblicazione: (2024) -
HoneypotNet: Backdoor Attacks Against Model Extraction
di: Wang, Yixu, et al.
Pubblicazione: (2025) -
The Other Mind: How Language Models Exhibit Human Temporal Cognition
di: Li, Lingyu, et al.
Pubblicazione: (2025) -
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025) -
Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?
di: Yao, Yang, et al.
Pubblicazione: (2025)