Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Kuicai, Huang, Shurui, Ye, Fangda, Han, Wei, Zhang, Zhi, Li, Dexun, Li, Wenjun, Yang, Qu, Wang, Gang, Wang, Yichao, Zhang, Chen, Liu, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforcement Learning Foundations for Deep Research Systems: A Survey
di: Li, Wenjun, et al.
Pubblicazione: (2025)
di: Li, Wenjun, et al.
Pubblicazione: (2025)
SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents
di: Zhang, Chen, et al.
Pubblicazione: (2026)
di: Zhang, Chen, et al.
Pubblicazione: (2026)
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation
di: Ye, Fangda, et al.
Pubblicazione: (2026)
di: Ye, Fangda, et al.
Pubblicazione: (2026)
Deep Research: A Survey of Autonomous Research Agents
di: Zhang, Wenlin, et al.
Pubblicazione: (2025)
di: Zhang, Wenlin, et al.
Pubblicazione: (2025)
To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention
di: Zhang, Wenlin, et al.
Pubblicazione: (2026)
di: Zhang, Wenlin, et al.
Pubblicazione: (2026)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
A Unified Framework for Multi-Domain CTR Prediction via Large Language Models
di: Fu, Zichuan, et al.
Pubblicazione: (2023)
di: Fu, Zichuan, et al.
Pubblicazione: (2023)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery
di: Li, Xiaopeng, et al.
Pubblicazione: (2026)
di: Li, Xiaopeng, et al.
Pubblicazione: (2026)
Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing
di: Zhang, Wenlin, et al.
Pubblicazione: (2026)
di: Zhang, Wenlin, et al.
Pubblicazione: (2026)
LLMTreeRec: Unleashing the Power of Large Language Models for Cold-Start Recommendations
di: Zhang, Wenlin, et al.
Pubblicazione: (2024)
di: Zhang, Wenlin, et al.
Pubblicazione: (2024)
DocMMIR: A Framework for Document Multi-modal Information Retrieval
di: Li, Zirui, et al.
Pubblicazione: (2025)
di: Li, Zirui, et al.
Pubblicazione: (2025)
Deep Research for Recommender Systems
di: Ou, Kesha, et al.
Pubblicazione: (2026)
di: Ou, Kesha, et al.
Pubblicazione: (2026)
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
di: Zhang, Wenlin, et al.
Pubblicazione: (2025)
di: Zhang, Wenlin, et al.
Pubblicazione: (2025)
System Log Parsing: A Survey
di: Zhang, Tianzhu, et al.
Pubblicazione: (2022)
di: Zhang, Tianzhu, et al.
Pubblicazione: (2022)
Collaborative Cross-modal Fusion with Large Language Model for Recommendation
di: Liu, Zhongzhou, et al.
Pubblicazione: (2024)
di: Liu, Zhongzhou, et al.
Pubblicazione: (2024)
Docs2KG: Unified Knowledge Graph Construction from Heterogeneous Documents Assisted by Large Language Models
di: Sun, Qiang, et al.
Pubblicazione: (2024)
di: Sun, Qiang, et al.
Pubblicazione: (2024)
Doc To The Future: Infomorphs for Interactive, Multimodal Document Transformation and Generation
di: Kumaravel, Balasaravanan Thoravi
Pubblicazione: (2025)
di: Kumaravel, Balasaravanan Thoravi
Pubblicazione: (2025)
FollowTable: A Benchmark for Instruction-Following Table Retrieval
di: Jin, Rihui, et al.
Pubblicazione: (2026)
di: Jin, Rihui, et al.
Pubblicazione: (2026)
Unifying Multimodal Retrieval via Document Screenshot Embedding
di: Ma, Xueguang, et al.
Pubblicazione: (2024)
di: Ma, Xueguang, et al.
Pubblicazione: (2024)
DocReLM: Mastering Document Retrieval with Language Model
di: Wei, Gengchen, et al.
Pubblicazione: (2024)
di: Wei, Gengchen, et al.
Pubblicazione: (2024)
Research on Short-Video Platform User Decision-Making via Multimodal Temporal Modeling and Reinforcement Learning
di: Wang, Jinmeiyang, et al.
Pubblicazione: (2025)
di: Wang, Jinmeiyang, et al.
Pubblicazione: (2025)
WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent
di: Geng, Xinyu, et al.
Pubblicazione: (2025)
di: Geng, Xinyu, et al.
Pubblicazione: (2025)
CtrlA: Adaptive Retrieval-Augmented Generation via Inherent Control
di: Liu, Huanshuo, et al.
Pubblicazione: (2024)
di: Liu, Huanshuo, et al.
Pubblicazione: (2024)
DocGraphLM: Documental Graph Language Model for Information Extraction
di: Wang, Dongsheng, et al.
Pubblicazione: (2024)
di: Wang, Dongsheng, et al.
Pubblicazione: (2024)
CoIR: A Comprehensive Benchmark for Code Information Retrieval Models
di: Li, Xiangyang, et al.
Pubblicazione: (2024)
di: Li, Xiangyang, et al.
Pubblicazione: (2024)
SELF: Surrogate-light Feature Selection with Large Language Models in Deep Recommender Systems
di: Jia, Pengyue, et al.
Pubblicazione: (2024)
di: Jia, Pengyue, et al.
Pubblicazione: (2024)
Research on Evaluation Methods for Patent Novelty Search Systems and Empirical Analysis
di: Zhang, Shu, et al.
Pubblicazione: (2025)
di: Zhang, Shu, et al.
Pubblicazione: (2025)
DocFusion: A Unified Framework for Document Parsing Tasks
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
SWGCN: Synergy Weighted Graph Convolutional Network for Multi-Behavior Recommendation
di: Chen, Fangda, et al.
Pubblicazione: (2026)
di: Chen, Fangda, et al.
Pubblicazione: (2026)
UniECS: Unified Multimodal E-Commerce Search Framework with Gated Cross-modal Fusion
di: Liang, Zihan, et al.
Pubblicazione: (2025)
di: Liang, Zihan, et al.
Pubblicazione: (2025)
RAGR: Review-Augmented Generative Recommendation
di: Zhang, Yingyi, et al.
Pubblicazione: (2026)
di: Zhang, Yingyi, et al.
Pubblicazione: (2026)
MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search
di: Zhang, Sheng, et al.
Pubblicazione: (2026)
di: Zhang, Sheng, et al.
Pubblicazione: (2026)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
di: Cui, Cheng, et al.
Pubblicazione: (2026)
di: Cui, Cheng, et al.
Pubblicazione: (2026)
C2T-ID: Converting Semantic Codebooks to Textual Document Identifiers for Generative Search
di: Zhang, Yingchen, et al.
Pubblicazione: (2025)
di: Zhang, Yingchen, et al.
Pubblicazione: (2025)
OpenResearcher: Unleashing AI for Accelerated Scientific Research
di: Zheng, Yuxiang, et al.
Pubblicazione: (2024)
di: Zheng, Yuxiang, et al.
Pubblicazione: (2024)
Harnessing Multimodal Large Language Models for Multimodal Sequential Recommendation
di: Ye, Yuyang, et al.
Pubblicazione: (2024)
di: Ye, Yuyang, et al.
Pubblicazione: (2024)
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
di: Dou, Zheng, et al.
Pubblicazione: (2026)
di: Dou, Zheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Reinforcement Learning Foundations for Deep Research Systems: A Survey
di: Li, Wenjun, et al.
Pubblicazione: (2025) -
SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents
di: Zhang, Chen, et al.
Pubblicazione: (2026) -
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
di: Dong, Kuicai, et al.
Pubblicazione: (2025) -
Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation
di: Ye, Fangda, et al.
Pubblicazione: (2026) -
Deep Research: A Survey of Autonomous Research Agents
di: Zhang, Wenlin, et al.
Pubblicazione: (2025)