DREAM: Document Reconstruction via End-to-end Autoregressive Model
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Xin, Gong, Mingming, Wu, Yunfei, Dai, Jianxin, Guo, Antai, Jiang, Xinghua, Cao, Haoyu, Liu, Yinsong, Jiang, Deqiang, Sun, Xing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
by: Li, Xin, et al.
Published: (2024)
by: Li, Xin, et al.
Published: (2024)
HRVDA: High-Resolution Visual Document Assistant
by: Liu, Chaohu, et al.
Published: (2024)
by: Liu, Chaohu, et al.
Published: (2024)
TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs
by: Kan, Zhehan, et al.
Published: (2025)
by: Kan, Zhehan, et al.
Published: (2025)
Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
by: Yin, Kun, et al.
Published: (2026)
by: Yin, Kun, et al.
Published: (2026)
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
by: Li, Yi, et al.
Published: (2026)
by: Li, Yi, et al.
Published: (2026)
End-to-End Spatial-Temporal Transformer for Real-time 4D HOI Reconstruction
by: Zhang, Haoyu, et al.
Published: (2026)
by: Zhang, Haoyu, et al.
Published: (2026)
Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?
by: Jiang, Hongbo, et al.
Published: (2026)
by: Jiang, Hongbo, et al.
Published: (2026)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
by: Wang, Yubo, et al.
Published: (2024)
by: Wang, Yubo, et al.
Published: (2024)
End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
by: Guo, Yuwei, et al.
Published: (2025)
by: Guo, Yuwei, et al.
Published: (2025)
DREAM: Diffusion Rectification and Estimation-Adaptive Models
by: Zhou, Jinxin, et al.
Published: (2023)
by: Zhou, Jinxin, et al.
Published: (2023)
Fast Autoregressive Video Generation with Diagonal Decoding
by: Ye, Yang, et al.
Published: (2025)
by: Ye, Yang, et al.
Published: (2025)
EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control
by: Weng, Yuzhe, et al.
Published: (2026)
by: Weng, Yuzhe, et al.
Published: (2026)
End-to-end Triple-domain PET Enhancement: A Hybrid Denoising-and-reconstruction Framework for Reconstructing Standard-dose PET Images from Low-dose PET Sinograms
by: Jiang, Caiwen, et al.
Published: (2024)
by: Jiang, Caiwen, et al.
Published: (2024)
VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
by: Han, Feng, et al.
Published: (2025)
by: Han, Feng, et al.
Published: (2025)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
by: Dong, Shaoqi, et al.
Published: (2025)
by: Dong, Shaoqi, et al.
Published: (2025)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
by: Wei, Zhixiang, et al.
Published: (2026)
by: Wei, Zhixiang, et al.
Published: (2026)
End-to-end Surface Optimization for Light Control
by: Sun, Yuou, et al.
Published: (2024)
by: Sun, Yuou, et al.
Published: (2024)
End-to-end Adaptive Dynamic Subsampling and Reconstruction for Cardiac MRI
by: Yiasemis, George, et al.
Published: (2024)
by: Yiasemis, George, et al.
Published: (2024)
InfoGNN: End-to-end deep learning on mesh via graph neural networks
by: Gao, Ling, et al.
Published: (2025)
by: Gao, Ling, et al.
Published: (2025)
End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer
by: Chu, Wenda, et al.
Published: (2026)
by: Chu, Wenda, et al.
Published: (2026)
End-to-end reconstruction of OCT optical properties and speckle-reduced structural intensity via physics-based learning
by: Yu, Jinglun, et al.
Published: (2026)
by: Yu, Jinglun, et al.
Published: (2026)
TransDiffuser: Diverse Trajectory Generation with Decorrelated Multi-modal Representation for End-to-end Autonomous Driving
by: Jiang, Xuefeng, et al.
Published: (2025)
by: Jiang, Xuefeng, et al.
Published: (2025)
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
by: Dong, Daxiang, et al.
Published: (2026)
by: Dong, Daxiang, et al.
Published: (2026)
WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild
by: Potamias, Rolandos Alexandros, et al.
Published: (2024)
by: Potamias, Rolandos Alexandros, et al.
Published: (2024)
Hi-DREAM: Brain Inspired Hierarchical Diffusion for fMRI Reconstruction via ROI Encoder and visuAl Mapping
by: Zhang, Guowei, et al.
Published: (2025)
by: Zhang, Guowei, et al.
Published: (2025)
Generalized Trajectory Scoring for End-to-end Multimodal Planning
by: Li, Zhenxin, et al.
Published: (2025)
by: Li, Zhenxin, et al.
Published: (2025)
AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation
by: Zhou, Milton, et al.
Published: (2026)
by: Zhou, Milton, et al.
Published: (2026)
UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving
by: Lu, Hao, et al.
Published: (2025)
by: Lu, Hao, et al.
Published: (2025)
End-to-End PET Image Reconstruction via a Posterior-Mean Diffusion Model
by: Sun, Yiran, et al.
Published: (2025)
by: Sun, Yiran, et al.
Published: (2025)
End4: End-to-end Denoising Diffusion for Diffusion-Based Inpainting Detection
by: Wang, Fei, et al.
Published: (2025)
by: Wang, Fei, et al.
Published: (2025)
Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
by: Li, Zhenxin, et al.
Published: (2024)
by: Li, Zhenxin, et al.
Published: (2024)
End-to-end Cortical Surface Reconstruction from Clinical Magnetic Resonance Images
by: Nielsen, Jesper Duemose, et al.
Published: (2025)
by: Nielsen, Jesper Duemose, et al.
Published: (2025)
End2end-ALARA: Approaching the ALARA Law in CT Imaging with End-to-end Learning
by: Tao, Xi, et al.
Published: (2025)
by: Tao, Xi, et al.
Published: (2025)
GeoGS3D: Single-view 3D Reconstruction via Geometric-aware Diffusion Model and Gaussian Splatting
by: Feng, Qijun, et al.
Published: (2024)
by: Feng, Qijun, et al.
Published: (2024)
Action Images: End-to-End Policy Learning via Multiview Video Generation
by: Zhen, Haoyu, et al.
Published: (2026)
by: Zhen, Haoyu, et al.
Published: (2026)
Play to Generalize: Learning to Reason Through Game Play
by: Xie, Yunfei, et al.
Published: (2025)
by: Xie, Yunfei, et al.
Published: (2025)
RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
by: Liu, Yifan, et al.
Published: (2025)
by: Liu, Yifan, et al.
Published: (2025)
Efficient Neural Implicit Representation for 3D Human Reconstruction
by: Huang, Zexu, et al.
Published: (2024)
by: Huang, Zexu, et al.
Published: (2024)
UncAD: Towards Safe End-to-end Autonomous Driving via Online Map Uncertainty
by: Yang, Pengxuan, et al.
Published: (2025)
by: Yang, Pengxuan, et al.
Published: (2025)
End-to-end Video Gaze Estimation via Capturing Head-face-eye Spatial-temporal Interaction Context
by: Guan, Yiran, et al.
Published: (2023)
by: Guan, Yiran, et al.
Published: (2023)
Similar Items
-
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
by: Li, Xin, et al.
Published: (2024) -
HRVDA: High-Resolution Visual Document Assistant
by: Liu, Chaohu, et al.
Published: (2024) -
TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs
by: Kan, Zhehan, et al.
Published: (2025) -
Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
by: Yin, Kun, et al.
Published: (2026) -
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
by: Li, Yi, et al.
Published: (2026)