Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction
Fuente:
arXiv
Saved in:
| Main Authors: | Jian, Yiren, Liu, Tingkai, Tao, Yunzhe, Zhang, Chunhui, Vosoughi, Soroush, Yang, Hongxia |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Pretrained Image-Text Models are Secretly Video Captioners
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
DeVAn: Dense Video Annotation for Video-Language Models
by: Liu, Tingkai, et al.
Published: (2023)
by: Liu, Tingkai, et al.
Published: (2023)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
by: Diao, Xingjian, et al.
Published: (2026)
by: Diao, Xingjian, et al.
Published: (2026)
Semantic Compositions Enhance Vision-Language Contrastive Learning
by: Aladago, Maxwell, et al.
Published: (2024)
by: Aladago, Maxwell, et al.
Published: (2024)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
by: Xing, Long, et al.
Published: (2024)
by: Xing, Long, et al.
Published: (2024)
Beyond Intermediate States: Explaining Visual Redundancy through Language
by: Yang, Dingchen, et al.
Published: (2025)
by: Yang, Dingchen, et al.
Published: (2025)
Enabling Generalized Zero-shot Learning Towards Unseen Domains by Intrinsic Learning from Redundant LLM Semantics
by: Yue, Jiaqi, et al.
Published: (2024)
by: Yue, Jiaqi, et al.
Published: (2024)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
by: Zhang, Renshan, et al.
Published: (2025)
by: Zhang, Renshan, et al.
Published: (2025)
Unlocking the Latent Canvas: Eliciting and Benchmarking Symbolic Visual Expression in LLMs
by: Zheng, Yiren, et al.
Published: (2026)
by: Zheng, Yiren, et al.
Published: (2026)
Interpretable Image Classification with Adaptive Prototype-based Vision Transformers
by: Ma, Chiyu, et al.
Published: (2024)
by: Ma, Chiyu, et al.
Published: (2024)
Towards Redundancy Reduction in Diffusion Models for Efficient Video Super-Resolution
by: Guo, Jinpei, et al.
Published: (2025)
by: Guo, Jinpei, et al.
Published: (2025)
ViTAR: Vision Transformer with Any Resolution
by: Fan, Qihang, et al.
Published: (2024)
by: Fan, Qihang, et al.
Published: (2024)
RedMotion: Motion Prediction via Redundancy Reduction
by: Wagner, Royden, et al.
Published: (2023)
by: Wagner, Royden, et al.
Published: (2023)
Learning to Rank Patches for Unbiased Image Redundancy Reduction
by: Luo, Yang, et al.
Published: (2024)
by: Luo, Yang, et al.
Published: (2024)
Scale-GS: Efficient Scalable Gaussian Splatting via Redundancy-filtering Training on Streaming Content
by: Yang, Jiayu, et al.
Published: (2025)
by: Yang, Jiayu, et al.
Published: (2025)
Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy
by: Yang, Te, et al.
Published: (2024)
by: Yang, Te, et al.
Published: (2024)
Efficient Redundancy Reduction for Open-Vocabulary Semantic Segmentation
by: Chen, Lin, et al.
Published: (2025)
by: Chen, Lin, et al.
Published: (2025)
Efficient Conditional Generation on Scale-based Visual Autoregressive Models
by: Liu, Jiaqi, et al.
Published: (2025)
by: Liu, Jiaqi, et al.
Published: (2025)
MESA: Effective Matching Redundancy Reduction by Semantic Area Segmentation
by: Zhang, Yesheng, et al.
Published: (2024)
by: Zhang, Yesheng, et al.
Published: (2024)
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
by: Li, Duo, et al.
Published: (2025)
by: Li, Duo, et al.
Published: (2025)
Color-Oriented Redundancy Reduction in Dataset Distillation
by: Yuan, Bowen, et al.
Published: (2024)
by: Yuan, Bowen, et al.
Published: (2024)
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
by: Diao, Xingjian, et al.
Published: (2025)
by: Diao, Xingjian, et al.
Published: (2025)
Pragmatist: Multiview Conditional Diffusion Models for High-Fidelity 3D Reconstruction from Unposed Sparse Views
by: Zhang, Songchun, et al.
Published: (2024)
by: Zhang, Songchun, et al.
Published: (2024)
HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
by: Qiu, Haonan, et al.
Published: (2025)
by: Qiu, Haonan, et al.
Published: (2025)
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
by: Li, Hongliang, et al.
Published: (2025)
by: Li, Hongliang, et al.
Published: (2025)
Semi-supervised Medical Image Segmentation via Geometry-aware Consistency Training
by: Liu, Zihang, et al.
Published: (2022)
by: Liu, Zihang, et al.
Published: (2022)
DiffSim: Taming Diffusion Models for Evaluating Visual Similarity
by: Song, Yiren, et al.
Published: (2024)
by: Song, Yiren, et al.
Published: (2024)
InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding
by: Liu, Haogeng, et al.
Published: (2024)
by: Liu, Haogeng, et al.
Published: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
by: Liu, Haogeng, et al.
Published: (2024)
by: Liu, Haogeng, et al.
Published: (2024)
Guiding Diffusion Models with Semantically Degraded Conditions
by: Han, Shilong, et al.
Published: (2026)
by: Han, Shilong, et al.
Published: (2026)
Neural Video Representation for Redundancy Reduction and Consistency Preservation
by: Hayami, Taiga, et al.
Published: (2024)
by: Hayami, Taiga, et al.
Published: (2024)
Counterfactual Visual Explanation via Causally-Guided Adversarial Steering
by: Qiao, Yiran, et al.
Published: (2025)
by: Qiao, Yiran, et al.
Published: (2025)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
by: You, Wenhao, et al.
Published: (2025)
by: You, Wenhao, et al.
Published: (2025)
Loom: Diffusion-Transformer for Interleaved Generation
by: Ye, Mingcheng, et al.
Published: (2025)
by: Ye, Mingcheng, et al.
Published: (2025)
Boosting Text-to-Image Diffusion Models via Core Token Attention-Based Seed Selection
by: Zhang, Yunzhe, et al.
Published: (2026)
by: Zhang, Yunzhe, et al.
Published: (2026)
TVG: A Training-free Transition Video Generation Method with Diffusion Models
by: Zhang, Rui, et al.
Published: (2024)
by: Zhang, Rui, et al.
Published: (2024)
Evict3R: Training-Free Token Eviction for Memory-Bounded Streaming Visual Geometry Transformers
by: Mahdi, Soroush, et al.
Published: (2025)
by: Mahdi, Soroush, et al.
Published: (2025)
RainFusion: Adaptive Video Generation Acceleration via Multi-Dimensional Visual Redundancy
by: Chen, Aiyue, et al.
Published: (2025)
by: Chen, Aiyue, et al.
Published: (2025)
End to End Face Reconstruction via Differentiable PnP
by: Lu, Yiren, et al.
Published: (2024)
by: Lu, Yiren, et al.
Published: (2024)
TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
by: Yao, Linli, et al.
Published: (2025)
by: Yao, Linli, et al.
Published: (2025)
Similar Items
-
Pretrained Image-Text Models are Secretly Video Captioners
by: Zhang, Chunhui, et al.
Published: (2025) -
DeVAn: Dense Video Annotation for Video-Language Models
by: Liu, Tingkai, et al.
Published: (2023) -
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
by: Diao, Xingjian, et al.
Published: (2026) -
Semantic Compositions Enhance Vision-Language Contrastive Learning
by: Aladago, Maxwell, et al.
Published: (2024) -
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
by: Xing, Long, et al.
Published: (2024)