TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Yanyu, Jiang, Jiyue, Liu, Jiahong, Zhang, Yifei, Guo, Xiao, King, Irwin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition
di: Chen, Yanyu, et al.
Pubblicazione: (2026)
di: Chen, Yanyu, et al.
Pubblicazione: (2026)
Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey
di: Li, Jindong, et al.
Pubblicazione: (2025)
di: Li, Jindong, et al.
Pubblicazione: (2025)
ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
di: Li, Jindong, et al.
Pubblicazione: (2025)
di: Li, Jindong, et al.
Pubblicazione: (2025)
Following the TRACE: A Structured Path to Empathetic Response Generation with Multi-Agent Models
di: Liu, Ziqi, et al.
Pubblicazione: (2025)
di: Liu, Ziqi, et al.
Pubblicazione: (2025)
AgentIR: Reasoning-Aware Retrieval for Deep Research Agents
di: Chen, Zijian, et al.
Pubblicazione: (2026)
di: Chen, Zijian, et al.
Pubblicazione: (2026)
DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents
di: Gupta, Nikita, et al.
Pubblicazione: (2026)
di: Gupta, Nikita, et al.
Pubblicazione: (2026)
DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2025)
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2025)
A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment
di: Jiang, Jiyue, et al.
Pubblicazione: (2026)
di: Jiang, Jiyue, et al.
Pubblicazione: (2026)
TRACE: Discovering Task-Specific Parameter via Adaptation-Aware Probing for Continual Fine-Tuning
di: Han, Xiaosong, et al.
Pubblicazione: (2026)
di: Han, Xiaosong, et al.
Pubblicazione: (2026)
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
di: Zhu, Fengbin, et al.
Pubblicazione: (2025)
di: Zhu, Fengbin, et al.
Pubblicazione: (2025)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
DS-ProGen: A Dual-Structure Deep Language Model for Functional Protein Design
di: Li, Yanting, et al.
Pubblicazione: (2025)
di: Li, Yanting, et al.
Pubblicazione: (2025)
From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Training Retrieval-Augmented Generation Agents
di: Li, Muzhi, et al.
Pubblicazione: (2025)
di: Li, Muzhi, et al.
Pubblicazione: (2025)
Less is More: Extreme Gradient Boost Rank-1 Adaption for Efficient Finetuning of LLMs
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
How Far Are We from Genuinely Useful Deep Research Agents?
di: Zhang, Dingling, et al.
Pubblicazione: (2025)
di: Zhang, Dingling, et al.
Pubblicazione: (2025)
TRACE: Trajectory Correction from Cross-layer Evidence for Hallucination Reduction
di: Ranade, Tej Sanibh
Pubblicazione: (2026)
di: Ranade, Tej Sanibh
Pubblicazione: (2026)
Developing and Utilizing a Large-Scale Cantonese Dataset for Multi-Tasking in Large Language Models
di: Jiang, Jiyue, et al.
Pubblicazione: (2025)
di: Jiang, Jiyue, et al.
Pubblicazione: (2025)
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
di: Gao, Yiwen, et al.
Pubblicazione: (2026)
di: Gao, Yiwen, et al.
Pubblicazione: (2026)
MedResearcher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework
di: Yu, Ailing, et al.
Pubblicazione: (2025)
di: Yu, Ailing, et al.
Pubblicazione: (2025)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents
di: Zhu, Jinchang, et al.
Pubblicazione: (2026)
di: Zhu, Jinchang, et al.
Pubblicazione: (2026)
Towards Comprehensive Semantic Speech Embeddings for Chinese Dialects
di: Chang, Kalvin, et al.
Pubblicazione: (2026)
di: Chang, Kalvin, et al.
Pubblicazione: (2026)
TRACE for Tracking the Emergence of Semantic Representations in Transformers
di: Aljaafari, Nura, et al.
Pubblicazione: (2025)
di: Aljaafari, Nura, et al.
Pubblicazione: (2025)
QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks
di: Xie, Jian, et al.
Pubblicazione: (2026)
di: Xie, Jian, et al.
Pubblicazione: (2026)
From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents
di: Zhang, Weizhi, et al.
Pubblicazione: (2025)
di: Zhang, Weizhi, et al.
Pubblicazione: (2025)
Quantifying the Climate Risk of Generative AI: Region-Aware Carbon Accounting with G-TRACE and the AI Sustainability Pyramid
di: Kausar, Zahida, et al.
Pubblicazione: (2025)
di: Kausar, Zahida, et al.
Pubblicazione: (2025)
CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
di: Qiu, Zexuan, et al.
Pubblicazione: (2024)
di: Qiu, Zexuan, et al.
Pubblicazione: (2024)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
di: Zhang, He, et al.
Pubblicazione: (2025)
di: Zhang, He, et al.
Pubblicazione: (2025)
OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
di: Li, Zhuofeng, et al.
Pubblicazione: (2026)
di: Li, Zhuofeng, et al.
Pubblicazione: (2026)
Watermarking LLM Agent Trajectories
di: Meng, Wenlong, et al.
Pubblicazione: (2026)
di: Meng, Wenlong, et al.
Pubblicazione: (2026)
Data Augmentation of Multi-turn Psychological Dialogue via Knowledge-driven Progressive Thought Prompting
di: Jiang, Jiyue, et al.
Pubblicazione: (2024)
di: Jiang, Jiyue, et al.
Pubblicazione: (2024)
An Entropy-based Text Watermarking Detection Method
di: Lu, Yijian, et al.
Pubblicazione: (2024)
di: Lu, Yijian, et al.
Pubblicazione: (2024)
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
di: Huang, Tianai, et al.
Pubblicazione: (2025)
di: Huang, Tianai, et al.
Pubblicazione: (2025)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
di: Sharma, Manasi, et al.
Pubblicazione: (2025)
di: Sharma, Manasi, et al.
Pubblicazione: (2025)
Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies
di: Zhang, Ming, et al.
Pubblicazione: (2026)
di: Zhang, Ming, et al.
Pubblicazione: (2026)
Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking
di: Zhang, Jingqi, et al.
Pubblicazione: (2025)
di: Zhang, Jingqi, et al.
Pubblicazione: (2025)
TRACE: Training and Inference-Time Interpretability Analysis for Language Models
di: Aljaafari, Nura, et al.
Pubblicazione: (2025)
di: Aljaafari, Nura, et al.
Pubblicazione: (2025)
BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
di: Chen, Zijian, et al.
Pubblicazione: (2025)
di: Chen, Zijian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition
di: Chen, Yanyu, et al.
Pubblicazione: (2026) -
Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey
di: Li, Jindong, et al.
Pubblicazione: (2025) -
ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents
di: Guo, Zhihan, et al.
Pubblicazione: (2025) -
Implicit Reasoning in Large Language Models: A Comprehensive Survey
di: Li, Jindong, et al.
Pubblicazione: (2025) -
Following the TRACE: A Structured Path to Empathetic Response Generation with Multi-Agent Models
di: Liu, Ziqi, et al.
Pubblicazione: (2025)