Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR
Fuente:
arXiv
Saved in:
| Main Authors: | Yuan, Ziye, Yao, Ruchang, Zheng, Chengxin, Zhao, Yusheng, Dong, Daxiang, Zhang, Ming |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM
by: Zhang, Guohua, et al.
Published: (2026)
by: Zhang, Guohua, et al.
Published: (2026)
Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding
by: Park, Jaeyoo, et al.
Published: (2024)
by: Park, Jaeyoo, et al.
Published: (2024)
Predict to Skip: Linear Multistep Feature Forecasting for Efficient Diffusion Transformers
by: Cui, Hanshuai, et al.
Published: (2026)
by: Cui, Hanshuai, et al.
Published: (2026)
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
by: Dong, Daxiang, et al.
Published: (2026)
by: Dong, Daxiang, et al.
Published: (2026)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
by: Zhong, Yufeng, et al.
Published: (2025)
by: Zhong, Yufeng, et al.
Published: (2025)
UNICBench: UNIfied Counting Benchmark for MLLM
by: Rong, Chenggang, et al.
Published: (2026)
by: Rong, Chenggang, et al.
Published: (2026)
Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency
by: Liang, Yupu, et al.
Published: (2025)
by: Liang, Yupu, et al.
Published: (2025)
Skip and Skip: Segmenting Medical Images with Prompts
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Reading Between the Lines: Abstaining from VLM-Generated OCR Errors via Latent Representation Probes
by: Yao, Jihan, et al.
Published: (2025)
by: Yao, Jihan, et al.
Published: (2025)
Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking
by: Wang, Shilei, et al.
Published: (2026)
by: Wang, Shilei, et al.
Published: (2026)
HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes
by: Li, Keliang, et al.
Published: (2025)
by: Li, Keliang, et al.
Published: (2025)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
by: Xu, Jingwei, et al.
Published: (2024)
by: Xu, Jingwei, et al.
Published: (2024)
Temporal Propagation of Asymmetric Feature Pyramid for Surgical Scene Segmentation
by: Yuan, Cheng, et al.
Published: (2025)
by: Yuan, Cheng, et al.
Published: (2025)
Enhancing Feature Fusion of U-like Networks with Dynamic Skip Connections
by: Cao, Yue, et al.
Published: (2025)
by: Cao, Yue, et al.
Published: (2025)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
by: Dong, Daxiang, et al.
Published: (2025)
by: Dong, Daxiang, et al.
Published: (2025)
ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning
by: Zhou, Weijie, et al.
Published: (2025)
by: Zhou, Weijie, et al.
Published: (2025)
ProSMA-UNet: Decoder Conditioning for Proximal-Sparse Skip Feature Selection
by: Cheng, Chun-Wun, et al.
Published: (2026)
by: Cheng, Chun-Wun, et al.
Published: (2026)
VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection
by: Han, Hui, et al.
Published: (2026)
by: Han, Hui, et al.
Published: (2026)
Template-Based Feature Aggregation Network for Industrial Anomaly Detection
by: Luo, Wei, et al.
Published: (2026)
by: Luo, Wei, et al.
Published: (2026)
SSI-DM: Singularity Skipping Inversion of Diffusion Models
by: Min, Chen, et al.
Published: (2026)
by: Min, Chen, et al.
Published: (2026)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
by: Wei, Haoran, et al.
Published: (2024)
by: Wei, Haoran, et al.
Published: (2024)
Decouple to Reconstruct: High Quality UHD Restoration via Active Feature Disentanglement and Reversible Fusion
by: Liu, Yidi, et al.
Published: (2025)
by: Liu, Yidi, et al.
Published: (2025)
SkipSR: Faster Super Resolution with Token Skipping
by: Choudhury, Rohan, et al.
Published: (2025)
by: Choudhury, Rohan, et al.
Published: (2025)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
by: Chen, Song, et al.
Published: (2025)
by: Chen, Song, et al.
Published: (2025)
SkipGS: Post-Densification Backward Skipping for Efficient 3DGS Training
by: Li, Jingxing, et al.
Published: (2026)
by: Li, Jingxing, et al.
Published: (2026)
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
by: Liu, Yikun, et al.
Published: (2026)
by: Liu, Yikun, et al.
Published: (2026)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
by: Chen, Qian, et al.
Published: (2025)
by: Chen, Qian, et al.
Published: (2025)
Enhancing Human Motion Prediction via Multi-range Decoupling Decoding with Gating-adjusting Aggregation
by: Wang, Jiexin, et al.
Published: (2025)
by: Wang, Jiexin, et al.
Published: (2025)
Holistic Reliability Propagation: Decoupling Annotation and Prediction for Robust Noisy-Label
by: Mao, Jingyang, et al.
Published: (2026)
by: Mao, Jingyang, et al.
Published: (2026)
Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent
by: Wu, Junda, et al.
Published: (2025)
by: Wu, Junda, et al.
Published: (2025)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
by: Wen, Shimin, et al.
Published: (2026)
by: Wen, Shimin, et al.
Published: (2026)
OmniOCR: Generalist OCR for Ethnic Minority Languages
by: Liu, Bonan, et al.
Published: (2026)
by: Liu, Bonan, et al.
Published: (2026)
SkipVAR: Accelerating Visual Autoregressive Modeling via Adaptive Frequency-Aware Skipping
by: Li, Jiajun, et al.
Published: (2025)
by: Li, Jiajun, et al.
Published: (2025)
GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
by: Huang, Lianming, et al.
Published: (2025)
by: Huang, Lianming, et al.
Published: (2025)
MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization
by: Zhang, Yiyi, et al.
Published: (2025)
by: Zhang, Yiyi, et al.
Published: (2025)
Detached and Interactive Multimodal Learning
by: Fan, Yunfeng, et al.
Published: (2024)
by: Fan, Yunfeng, et al.
Published: (2024)
Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data
by: Deng, Yuchuan, et al.
Published: (2026)
by: Deng, Yuchuan, et al.
Published: (2026)
GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning
by: Liu, Zhaochen, et al.
Published: (2026)
by: Liu, Zhaochen, et al.
Published: (2026)
Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning
by: Zhao, Rui, et al.
Published: (2025)
by: Zhao, Rui, et al.
Published: (2025)
Diverse Semantics-Guided Feature Alignment and Decoupling for Visible-Infrared Person Re-Identification
by: Dong, Neng, et al.
Published: (2025)
by: Dong, Neng, et al.
Published: (2025)
Similar Items
-
GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM
by: Zhang, Guohua, et al.
Published: (2026) -
Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding
by: Park, Jaeyoo, et al.
Published: (2024) -
Predict to Skip: Linear Multistep Feature Forecasting for Efficient Diffusion Transformers
by: Cui, Hanshuai, et al.
Published: (2026) -
Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
by: Dong, Daxiang, et al.
Published: (2026) -
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
by: Zhong, Yufeng, et al.
Published: (2025)