TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Luan, Bozhi, Feng, Hao, Chen, Hong, Wang, Yonghui, Zhou, Wengang, Li, Houqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
por: Wang, Yonghui, et al.
Publicado: (2024)
por: Wang, Yonghui, et al.
Publicado: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
por: Luan, Bozhi, et al.
Publicado: (2025)
por: Luan, Bozhi, et al.
Publicado: (2025)
Revisiting Shadow Detection from a Vision-Language Perspective
por: Wang, Yonghui, et al.
Publicado: (2026)
por: Wang, Yonghui, et al.
Publicado: (2026)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
por: Zhou, Keyi, et al.
Publicado: (2024)
por: Zhou, Keyi, et al.
Publicado: (2024)
DeepEraser: Deep Iterative Context Mining for Generic Text Eraser
por: Feng, Hao, et al.
Publicado: (2024)
por: Feng, Hao, et al.
Publicado: (2024)
BookNet: Book Image Rectification via Cross-Page Attention Network
por: Liu, Shaokai, et al.
Publicado: (2026)
por: Liu, Shaokai, et al.
Publicado: (2026)
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models
por: Wang, Zhendong, et al.
Publicado: (2025)
por: Wang, Zhendong, et al.
Publicado: (2025)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
por: Liu, Xiaoyang, et al.
Publicado: (2024)
por: Liu, Xiaoyang, et al.
Publicado: (2024)
ROOT: VLM based System for Indoor Scene Understanding and Beyond
por: Wang, Yonghui, et al.
Publicado: (2024)
por: Wang, Yonghui, et al.
Publicado: (2024)
SwinShadow: Shifted Window for Ambiguous Adjacent Shadow Detection
por: Wang, Yonghui, et al.
Publicado: (2024)
por: Wang, Yonghui, et al.
Publicado: (2024)
Scaling up Multimodal Pre-training for Sign Language Understanding
por: Zhou, Wengang, et al.
Publicado: (2024)
por: Zhou, Wengang, et al.
Publicado: (2024)
Text-Animator: Controllable Visual Text Video Generation
por: Liu, Lin, et al.
Publicado: (2024)
por: Liu, Lin, et al.
Publicado: (2024)
RoFIR: Robust Fisheye Image Rectification Framework Impervious to Optical Center Deviation
por: Liao, Zhaokang, et al.
Publicado: (2024)
por: Liao, Zhaokang, et al.
Publicado: (2024)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
por: Xiong, Junyu, et al.
Publicado: (2025)
por: Xiong, Junyu, et al.
Publicado: (2025)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
por: Feng, Hao, et al.
Publicado: (2023)
por: Feng, Hao, et al.
Publicado: (2023)
Progressive Multi-modal Conditional Prompt Tuning
por: Qiu, Xiaoyu, et al.
Publicado: (2024)
por: Qiu, Xiaoyu, et al.
Publicado: (2024)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval
por: Du, Yongchao, et al.
Publicado: (2024)
por: Du, Yongchao, et al.
Publicado: (2024)
Robust Multimodal Large Language Models Against Modality Conflict
por: Zhang, Zongmeng, et al.
Publicado: (2025)
por: Zhang, Zongmeng, et al.
Publicado: (2025)
Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal Navigation
por: Lei, Xiaohan, et al.
Publicado: (2024)
por: Lei, Xiaohan, et al.
Publicado: (2024)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
GaussNav: Gaussian Splatting for Visual Navigation
por: Lei, Xiaohan, et al.
Publicado: (2024)
por: Lei, Xiaohan, et al.
Publicado: (2024)
StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
por: Liu, Keli, et al.
Publicado: (2026)
por: Liu, Keli, et al.
Publicado: (2026)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
Uni-Sign: Toward Unified Sign Language Understanding at Scale
por: Li, Zecheng, et al.
Publicado: (2025)
por: Li, Zecheng, et al.
Publicado: (2025)
CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion Models
por: Zhang, Gaoyang, et al.
Publicado: (2024)
por: Zhang, Gaoyang, et al.
Publicado: (2024)
SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval
por: Jiang, Longtao, et al.
Publicado: (2024)
por: Jiang, Longtao, et al.
Publicado: (2024)
Semantic Image Synthesis via Diffusion Models
por: Zhou, Wengang, et al.
Publicado: (2022)
por: Zhou, Wengang, et al.
Publicado: (2022)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
por: Ma, Lichen, et al.
Publicado: (2026)
por: Ma, Lichen, et al.
Publicado: (2026)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
por: Fu, Pei, et al.
Publicado: (2025)
por: Fu, Pei, et al.
Publicado: (2025)
Motion-aware 3D Gaussian Splatting for Efficient Dynamic Scene Reconstruction
por: Guo, Zhiyang, et al.
Publicado: (2024)
por: Guo, Zhiyang, et al.
Publicado: (2024)
Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene Synthesis
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation
por: Chai, Shang, et al.
Publicado: (2025)
por: Chai, Shang, et al.
Publicado: (2025)
Recurrent Generic Contour-based Instance Segmentation with Progressive Learning
por: Feng, Hao, et al.
Publicado: (2023)
por: Feng, Hao, et al.
Publicado: (2023)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
por: Yang, Yue, et al.
Publicado: (2025)
por: Yang, Yue, et al.
Publicado: (2025)
Multi-Scale Invertible Neural Network for Wide-Range Variable-Rate Learned Image Compression
por: Tu, Hanyue, et al.
Publicado: (2025)
por: Tu, Hanyue, et al.
Publicado: (2025)
Rich Human Feedback for Text-to-Image Generation
por: Liang, Youwei, et al.
Publicado: (2023)
por: Liang, Youwei, et al.
Publicado: (2023)
Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition
por: Zhao, Weichao, et al.
Publicado: (2024)
por: Zhao, Weichao, et al.
Publicado: (2024)
Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering
por: Cai, Jianfeng, et al.
Publicado: (2025)
por: Cai, Jianfeng, et al.
Publicado: (2025)
Exploiting Spatial-Temporal Context for Interacting Hand Reconstruction on Monocular RGB Video
por: Zhao, Weichao, et al.
Publicado: (2023)
por: Zhao, Weichao, et al.
Publicado: (2023)
Ejemplares similares
-
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
por: Wang, Yonghui, et al.
Publicado: (2024) -
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
por: Luan, Bozhi, et al.
Publicado: (2025) -
Revisiting Shadow Detection from a Vision-Language Perspective
por: Wang, Yonghui, et al.
Publicado: (2026) -
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
por: Zhou, Keyi, et al.
Publicado: (2024) -
DeepEraser: Deep Iterative Context Mining for Generic Text Eraser
por: Feng, Hao, et al.
Publicado: (2024)