TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yanyu, Jiang, Jiyue, Liu, Jiahong, Zhang, Yifei, Guo, Xiao, King, Irwin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition
par: Chen, Yanyu, et autres
Publié: (2026)
par: Chen, Yanyu, et autres
Publié: (2026)
Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey
par: Li, Jindong, et autres
Publié: (2025)
par: Li, Jindong, et autres
Publié: (2025)
ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents
par: Guo, Zhihan, et autres
Publié: (2025)
par: Guo, Zhihan, et autres
Publié: (2025)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
par: Li, Jindong, et autres
Publié: (2025)
par: Li, Jindong, et autres
Publié: (2025)
Following the TRACE: A Structured Path to Empathetic Response Generation with Multi-Agent Models
par: Liu, Ziqi, et autres
Publié: (2025)
par: Liu, Ziqi, et autres
Publié: (2025)
AgentIR: Reasoning-Aware Retrieval for Deep Research Agents
par: Chen, Zijian, et autres
Publié: (2026)
par: Chen, Zijian, et autres
Publié: (2026)
DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents
par: Gupta, Nikita, et autres
Publié: (2026)
par: Gupta, Nikita, et autres
Publié: (2026)
DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
par: Venkit, Pranav Narayanan, et autres
Publié: (2025)
par: Venkit, Pranav Narayanan, et autres
Publié: (2025)
A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment
par: Jiang, Jiyue, et autres
Publié: (2026)
par: Jiang, Jiyue, et autres
Publié: (2026)
TRACE: Discovering Task-Specific Parameter via Adaptation-Aware Probing for Continual Fine-Tuning
par: Han, Xiaosong, et autres
Publié: (2026)
par: Han, Xiaosong, et autres
Publié: (2026)
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
par: Zhu, Fengbin, et autres
Publié: (2025)
par: Zhu, Fengbin, et autres
Publié: (2025)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
par: Du, Mingxuan, et autres
Publié: (2025)
par: Du, Mingxuan, et autres
Publié: (2025)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
par: Guo, Zhihan, et autres
Publié: (2025)
par: Guo, Zhihan, et autres
Publié: (2025)
DS-ProGen: A Dual-Structure Deep Language Model for Functional Protein Design
par: Li, Yanting, et autres
Publié: (2025)
par: Li, Yanting, et autres
Publié: (2025)
From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Training Retrieval-Augmented Generation Agents
par: Li, Muzhi, et autres
Publié: (2025)
par: Li, Muzhi, et autres
Publié: (2025)
Less is More: Extreme Gradient Boost Rank-1 Adaption for Efficient Finetuning of LLMs
par: Zhang, Yifei, et autres
Publié: (2024)
par: Zhang, Yifei, et autres
Publié: (2024)
How Far Are We from Genuinely Useful Deep Research Agents?
par: Zhang, Dingling, et autres
Publié: (2025)
par: Zhang, Dingling, et autres
Publié: (2025)
TRACE: Trajectory Correction from Cross-layer Evidence for Hallucination Reduction
par: Ranade, Tej Sanibh
Publié: (2026)
par: Ranade, Tej Sanibh
Publié: (2026)
Developing and Utilizing a Large-Scale Cantonese Dataset for Multi-Tasking in Large Language Models
par: Jiang, Jiyue, et autres
Publié: (2025)
par: Jiang, Jiyue, et autres
Publié: (2025)
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
par: Gao, Yiwen, et autres
Publié: (2026)
par: Gao, Yiwen, et autres
Publié: (2026)
MedResearcher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework
par: Yu, Ailing, et autres
Publié: (2025)
par: Yu, Ailing, et autres
Publié: (2025)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
par: Cui, Wenqian, et autres
Publié: (2026)
par: Cui, Wenqian, et autres
Publié: (2026)
HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents
par: Zhu, Jinchang, et autres
Publié: (2026)
par: Zhu, Jinchang, et autres
Publié: (2026)
Towards Comprehensive Semantic Speech Embeddings for Chinese Dialects
par: Chang, Kalvin, et autres
Publié: (2026)
par: Chang, Kalvin, et autres
Publié: (2026)
TRACE for Tracking the Emergence of Semantic Representations in Transformers
par: Aljaafari, Nura, et autres
Publié: (2025)
par: Aljaafari, Nura, et autres
Publié: (2025)
QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks
par: Xie, Jian, et autres
Publié: (2026)
par: Xie, Jian, et autres
Publié: (2026)
From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents
par: Zhang, Weizhi, et autres
Publié: (2025)
par: Zhang, Weizhi, et autres
Publié: (2025)
Quantifying the Climate Risk of Generative AI: Region-Aware Carbon Accounting with G-TRACE and the AI Sustainability Pyramid
par: Kausar, Zahida, et autres
Publié: (2025)
par: Kausar, Zahida, et autres
Publié: (2025)
CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
par: Qiu, Zexuan, et autres
Publié: (2024)
par: Qiu, Zexuan, et autres
Publié: (2024)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
par: Zhang, He, et autres
Publié: (2025)
par: Zhang, He, et autres
Publié: (2025)
OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
par: Li, Zhuofeng, et autres
Publié: (2026)
par: Li, Zhuofeng, et autres
Publié: (2026)
Watermarking LLM Agent Trajectories
par: Meng, Wenlong, et autres
Publié: (2026)
par: Meng, Wenlong, et autres
Publié: (2026)
Data Augmentation of Multi-turn Psychological Dialogue via Knowledge-driven Progressive Thought Prompting
par: Jiang, Jiyue, et autres
Publié: (2024)
par: Jiang, Jiyue, et autres
Publié: (2024)
An Entropy-based Text Watermarking Detection Method
par: Lu, Yijian, et autres
Publié: (2024)
par: Lu, Yijian, et autres
Publié: (2024)
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
par: Huang, Tianai, et autres
Publié: (2025)
par: Huang, Tianai, et autres
Publié: (2025)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
par: Sharma, Manasi, et autres
Publié: (2025)
par: Sharma, Manasi, et autres
Publié: (2025)
Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies
par: Zhang, Ming, et autres
Publié: (2026)
par: Zhang, Ming, et autres
Publié: (2026)
Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking
par: Zhang, Jingqi, et autres
Publié: (2025)
par: Zhang, Jingqi, et autres
Publié: (2025)
TRACE: Training and Inference-Time Interpretability Analysis for Language Models
par: Aljaafari, Nura, et autres
Publié: (2025)
par: Aljaafari, Nura, et autres
Publié: (2025)
BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
par: Chen, Zijian, et autres
Publié: (2025)
par: Chen, Zijian, et autres
Publié: (2025)
Documents similaires
-
LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition
par: Chen, Yanyu, et autres
Publié: (2026) -
Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey
par: Li, Jindong, et autres
Publié: (2025) -
ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents
par: Guo, Zhihan, et autres
Publié: (2025) -
Implicit Reasoning in Large Language Models: A Comprehensive Survey
par: Li, Jindong, et autres
Publié: (2025) -
Following the TRACE: A Structured Path to Empathetic Response Generation with Multi-Agent Models
par: Liu, Ziqi, et autres
Publié: (2025)