Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Kuicai, Huang, Shurui, Ye, Fangda, Han, Wei, Zhang, Zhi, Li, Dexun, Li, Wenjun, Yang, Qu, Wang, Gang, Wang, Yichao, Zhang, Chen, Liu, Yong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcement Learning Foundations for Deep Research Systems: A Survey
par: Li, Wenjun, et autres
Publié: (2025)
par: Li, Wenjun, et autres
Publié: (2025)
SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation
par: Ye, Fangda, et autres
Publié: (2026)
par: Ye, Fangda, et autres
Publié: (2026)
Deep Research: A Survey of Autonomous Research Agents
par: Zhang, Wenlin, et autres
Publié: (2025)
par: Zhang, Wenlin, et autres
Publié: (2025)
To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention
par: Zhang, Wenlin, et autres
Publié: (2026)
par: Zhang, Wenlin, et autres
Publié: (2026)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
par: Ouyang, Linke, et autres
Publié: (2024)
par: Ouyang, Linke, et autres
Publié: (2024)
A Unified Framework for Multi-Domain CTR Prediction via Large Language Models
par: Fu, Zichuan, et autres
Publié: (2023)
par: Fu, Zichuan, et autres
Publié: (2023)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery
par: Li, Xiaopeng, et autres
Publié: (2026)
par: Li, Xiaopeng, et autres
Publié: (2026)
Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing
par: Zhang, Wenlin, et autres
Publié: (2026)
par: Zhang, Wenlin, et autres
Publié: (2026)
LLMTreeRec: Unleashing the Power of Large Language Models for Cold-Start Recommendations
par: Zhang, Wenlin, et autres
Publié: (2024)
par: Zhang, Wenlin, et autres
Publié: (2024)
DocMMIR: A Framework for Document Multi-modal Information Retrieval
par: Li, Zirui, et autres
Publié: (2025)
par: Li, Zirui, et autres
Publié: (2025)
Deep Research for Recommender Systems
par: Ou, Kesha, et autres
Publié: (2026)
par: Ou, Kesha, et autres
Publié: (2026)
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
par: Zhang, Wenlin, et autres
Publié: (2025)
par: Zhang, Wenlin, et autres
Publié: (2025)
System Log Parsing: A Survey
par: Zhang, Tianzhu, et autres
Publié: (2022)
par: Zhang, Tianzhu, et autres
Publié: (2022)
Collaborative Cross-modal Fusion with Large Language Model for Recommendation
par: Liu, Zhongzhou, et autres
Publié: (2024)
par: Liu, Zhongzhou, et autres
Publié: (2024)
Docs2KG: Unified Knowledge Graph Construction from Heterogeneous Documents Assisted by Large Language Models
par: Sun, Qiang, et autres
Publié: (2024)
par: Sun, Qiang, et autres
Publié: (2024)
Doc To The Future: Infomorphs for Interactive, Multimodal Document Transformation and Generation
par: Kumaravel, Balasaravanan Thoravi
Publié: (2025)
par: Kumaravel, Balasaravanan Thoravi
Publié: (2025)
FollowTable: A Benchmark for Instruction-Following Table Retrieval
par: Jin, Rihui, et autres
Publié: (2026)
par: Jin, Rihui, et autres
Publié: (2026)
Unifying Multimodal Retrieval via Document Screenshot Embedding
par: Ma, Xueguang, et autres
Publié: (2024)
par: Ma, Xueguang, et autres
Publié: (2024)
DocReLM: Mastering Document Retrieval with Language Model
par: Wei, Gengchen, et autres
Publié: (2024)
par: Wei, Gengchen, et autres
Publié: (2024)
Research on Short-Video Platform User Decision-Making via Multimodal Temporal Modeling and Reinforcement Learning
par: Wang, Jinmeiyang, et autres
Publié: (2025)
par: Wang, Jinmeiyang, et autres
Publié: (2025)
WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent
par: Geng, Xinyu, et autres
Publié: (2025)
par: Geng, Xinyu, et autres
Publié: (2025)
CtrlA: Adaptive Retrieval-Augmented Generation via Inherent Control
par: Liu, Huanshuo, et autres
Publié: (2024)
par: Liu, Huanshuo, et autres
Publié: (2024)
DocGraphLM: Documental Graph Language Model for Information Extraction
par: Wang, Dongsheng, et autres
Publié: (2024)
par: Wang, Dongsheng, et autres
Publié: (2024)
CoIR: A Comprehensive Benchmark for Code Information Retrieval Models
par: Li, Xiangyang, et autres
Publié: (2024)
par: Li, Xiangyang, et autres
Publié: (2024)
SELF: Surrogate-light Feature Selection with Large Language Models in Deep Recommender Systems
par: Jia, Pengyue, et autres
Publié: (2024)
par: Jia, Pengyue, et autres
Publié: (2024)
Research on Evaluation Methods for Patent Novelty Search Systems and Empirical Analysis
par: Zhang, Shu, et autres
Publié: (2025)
par: Zhang, Shu, et autres
Publié: (2025)
DocFusion: A Unified Framework for Document Parsing Tasks
par: Chai, Mingxu, et autres
Publié: (2024)
par: Chai, Mingxu, et autres
Publié: (2024)
SWGCN: Synergy Weighted Graph Convolutional Network for Multi-Behavior Recommendation
par: Chen, Fangda, et autres
Publié: (2026)
par: Chen, Fangda, et autres
Publié: (2026)
UniECS: Unified Multimodal E-Commerce Search Framework with Gated Cross-modal Fusion
par: Liang, Zihan, et autres
Publié: (2025)
par: Liang, Zihan, et autres
Publié: (2025)
RAGR: Review-Augmented Generative Recommendation
par: Zhang, Yingyi, et autres
Publié: (2026)
par: Zhang, Yingyi, et autres
Publié: (2026)
MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
par: Zhang, Sheng, et autres
Publié: (2026)
par: Zhang, Sheng, et autres
Publié: (2026)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
par: Du, Mingxuan, et autres
Publié: (2025)
par: Du, Mingxuan, et autres
Publié: (2025)
Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
par: Cui, Cheng, et autres
Publié: (2026)
par: Cui, Cheng, et autres
Publié: (2026)
C2T-ID: Converting Semantic Codebooks to Textual Document Identifiers for Generative Search
par: Zhang, Yingchen, et autres
Publié: (2025)
par: Zhang, Yingchen, et autres
Publié: (2025)
OpenResearcher: Unleashing AI for Accelerated Scientific Research
par: Zheng, Yuxiang, et autres
Publié: (2024)
par: Zheng, Yuxiang, et autres
Publié: (2024)
Harnessing Multimodal Large Language Models for Multimodal Sequential Recommendation
par: Ye, Yuyang, et autres
Publié: (2024)
par: Ye, Yuyang, et autres
Publié: (2024)
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
par: Dou, Zheng, et autres
Publié: (2026)
par: Dou, Zheng, et autres
Publié: (2026)
Documents similaires
-
Reinforcement Learning Foundations for Deep Research Systems: A Survey
par: Li, Wenjun, et autres
Publié: (2025) -
SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents
par: Zhang, Chen, et autres
Publié: (2026) -
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
par: Dong, Kuicai, et autres
Publié: (2025) -
Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation
par: Ye, Fangda, et autres
Publié: (2026) -
Deep Research: A Survey of Autonomous Research Agents
par: Zhang, Wenlin, et autres
Publié: (2025)