CogDoc: Towards Unified thinking in Documents
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Qixin, Wang, Haozhe, Liu, Che, Lin, Fangzhen, Chen, Wenhu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
por: Wang, Haozhe, et al.
Publicado: (2026)
por: Wang, Haozhe, et al.
Publicado: (2026)
Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
por: Wu, Yuhuan, et al.
Publicado: (2026)
por: Wu, Yuhuan, et al.
Publicado: (2026)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
por: Wang, Haozhe, et al.
Publicado: (2025)
por: Wang, Haozhe, et al.
Publicado: (2025)
Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation
por: Zhu, Xiaomeng, et al.
Publicado: (2025)
por: Zhu, Xiaomeng, et al.
Publicado: (2025)
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
por: Zhang, Jiaxin, et al.
Publicado: (2024)
por: Zhang, Jiaxin, et al.
Publicado: (2024)
DocRevive: A Unified Pipeline for Document Text Restoration
por: Purkayastha, Kunal, et al.
Publicado: (2026)
por: Purkayastha, Kunal, et al.
Publicado: (2026)
DocSAM: Unified Document Image Segmentation via Query Decomposition and Heterogeneous Mixed Learning
por: Li, Xiao-Hui, et al.
Publicado: (2025)
por: Li, Xiao-Hui, et al.
Publicado: (2025)
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
por: Hu, Anwen, et al.
Publicado: (2024)
por: Hu, Anwen, et al.
Publicado: (2024)
Uni-DocDiff: A Unified Document Restoration Model Based on Diffusion
por: Zhao, Fangmin, et al.
Publicado: (2025)
por: Zhao, Fangmin, et al.
Publicado: (2025)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
por: Wang, Wenjie, et al.
Publicado: (2026)
por: Wang, Wenjie, et al.
Publicado: (2026)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
DocDeshadower: Frequency-Aware Transformer for Document Shadow Removal
por: Zhou, Ziyang, et al.
Publicado: (2023)
por: Zhou, Ziyang, et al.
Publicado: (2023)
SynthDoc: Bilingual Documents Synthesis for Visual Document Understanding
por: Ding, Chuanghao, et al.
Publicado: (2024)
por: Ding, Chuanghao, et al.
Publicado: (2024)
Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning
por: Wang, Haozhe, et al.
Publicado: (2025)
por: Wang, Haozhe, et al.
Publicado: (2025)
OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning
por: Kang, Hengrui, et al.
Publicado: (2025)
por: Kang, Hengrui, et al.
Publicado: (2025)
Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models
por: Huang, Jiaxi, et al.
Publicado: (2025)
por: Huang, Jiaxi, et al.
Publicado: (2025)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
por: Wang, An-Lan, et al.
Publicado: (2025)
por: Wang, An-Lan, et al.
Publicado: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
por: Ma, Yubo, et al.
Publicado: (2024)
por: Ma, Yubo, et al.
Publicado: (2024)
AIForge-Doc: A Benchmark for Detecting AI-Forged Tampering in Financial and Form Documents
por: Wu, Jiaqi, et al.
Publicado: (2026)
por: Wu, Jiaqi, et al.
Publicado: (2026)
MosaicDoc: A Large-Scale Bilingual Benchmark for Visually Rich Document Understanding
por: Chen, Ketong, et al.
Publicado: (2025)
por: Chen, Ketong, et al.
Publicado: (2025)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
por: Wang, Changpeng, et al.
Publicado: (2025)
por: Wang, Changpeng, et al.
Publicado: (2025)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
por: Xiong, Junyu, et al.
Publicado: (2025)
por: Xiong, Junyu, et al.
Publicado: (2025)
DocShaDiffusion: Diffusion Model in Latent Space for Document Image Shadow Removal
por: Liu, Wenjie, et al.
Publicado: (2025)
por: Liu, Wenjie, et al.
Publicado: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
por: Wei, Cong, et al.
Publicado: (2025)
por: Wei, Cong, et al.
Publicado: (2025)
PP-DocLayout: A Unified Document Layout Detection Model to Accelerate Large-Scale Data Construction
por: Sun, Ting, et al.
Publicado: (2025)
por: Sun, Ting, et al.
Publicado: (2025)
CogBlender: Towards Continuous Cognitive Intervention in Text-to-Image Generation
por: Dang, Shengqi, et al.
Publicado: (2026)
por: Dang, Shengqi, et al.
Publicado: (2026)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
por: Feng, Xiang, et al.
Publicado: (2026)
por: Feng, Xiang, et al.
Publicado: (2026)
CogVLM: Visual Expert for Pretrained Language Models
por: Wang, Weihan, et al.
Publicado: (2023)
por: Wang, Weihan, et al.
Publicado: (2023)
CogAgent: A Visual Language Model for GUI Agents
por: Hong, Wenyi, et al.
Publicado: (2023)
por: Hong, Wenyi, et al.
Publicado: (2023)
CogMorph: Cognitive Morphing Attacks for Text-to-Image Models
por: Jing, Zonglei, et al.
Publicado: (2025)
por: Jing, Zonglei, et al.
Publicado: (2025)
DeQA-Doc: Adapting DeQA-Score to Document Image Quality Assessment
por: Gao, Junjie, et al.
Publicado: (2025)
por: Gao, Junjie, et al.
Publicado: (2025)
DocTTT: Test-Time Training for Handwritten Document Recognition Using Meta-Auxiliary Learning
por: Gu, Wenhao, et al.
Publicado: (2025)
por: Gu, Wenhao, et al.
Publicado: (2025)
AniDoc: Animation Creation Made Easier
por: Meng, Yihao, et al.
Publicado: (2024)
por: Meng, Yihao, et al.
Publicado: (2024)
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
por: Du, Yongkun, et al.
Publicado: (2025)
por: Du, Yongkun, et al.
Publicado: (2025)
CogStream: Context-guided Streaming Video Question Answering
por: Zhao, Zicheng, et al.
Publicado: (2025)
por: Zhao, Zicheng, et al.
Publicado: (2025)
DocVCE: Diffusion-based Visual Counterfactual Explanations for Document Image Classification
por: Saifullah, Saifullah, et al.
Publicado: (2025)
por: Saifullah, Saifullah, et al.
Publicado: (2025)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
por: Yu, Wenwen, et al.
Publicado: (2025)
por: Yu, Wenwen, et al.
Publicado: (2025)
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
por: Huang, Kui, et al.
Publicado: (2025)
por: Huang, Kui, et al.
Publicado: (2025)
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
por: Liu, Zhiheng, et al.
Publicado: (2025)
por: Liu, Zhiheng, et al.
Publicado: (2025)
DocReward: A Document Reward Model for Structuring and Stylizing
por: Liu, Junpeng, et al.
Publicado: (2025)
por: Liu, Junpeng, et al.
Publicado: (2025)
Ejemplares similares
-
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
por: Wang, Haozhe, et al.
Publicado: (2026) -
Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
por: Wu, Yuhuan, et al.
Publicado: (2026) -
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
por: Wang, Haozhe, et al.
Publicado: (2025) -
Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation
por: Zhu, Xiaomeng, et al.
Publicado: (2025) -
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
por: Zhang, Jiaxin, et al.
Publicado: (2024)