Enregistré dans:
| Auteurs principaux: | Tang, Lv, Zheng, Tianyi, Liu, Yang, Li, Bo, Li, Xingyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.06708 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs
par: Tang, Lv, et autres
Publié: (2026)
par: Tang, Lv, et autres
Publié: (2026)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
par: Li, Jianjian, et autres
Publié: (2025)
par: Li, Jianjian, et autres
Publié: (2025)
Interactive Visual Assessment for Text-to-Image Generation Models
par: Mi, Xiaoyue, et autres
Publié: (2024)
par: Mi, Xiaoyue, et autres
Publié: (2024)
What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis
par: Li, Xirui, et autres
Publié: (2026)
par: Li, Xirui, et autres
Publié: (2026)
SSMamba: A Self-Supervised Hybrid State Space Model for Pathological Image Classification
par: Chai, Enhui, et autres
Publié: (2026)
par: Chai, Enhui, et autres
Publié: (2026)
QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression
par: Li, Zhongyang, et autres
Publié: (2026)
par: Li, Zhongyang, et autres
Publié: (2026)
LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
par: Xie, Roy, et autres
Publié: (2026)
par: Xie, Roy, et autres
Publié: (2026)
UAR-NVC: A Unified AutoRegressive Framework for Memory-Efficient Neural Video Compression
par: Wang, Jia, et autres
Publié: (2025)
par: Wang, Jia, et autres
Publié: (2025)
Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design
par: Sun, Haoxiang, et autres
Publié: (2026)
par: Sun, Haoxiang, et autres
Publié: (2026)
IPCV: Information-Preserving Compression for MLLM Visual Encoders
par: Chen, Yuan, et autres
Publié: (2025)
par: Chen, Yuan, et autres
Publié: (2025)
Causal-Story: Local Causal Attention Utilizing Parameter-Efficient Tuning For Visual Story Synthesis
par: Song, Tianyi, et autres
Publié: (2023)
par: Song, Tianyi, et autres
Publié: (2023)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
par: Fu, Ling, et autres
Publié: (2024)
par: Fu, Ling, et autres
Publié: (2024)
Benchmarking and Analyzing Generative Data for Visual Recognition
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
par: Li, Zejun, et autres
Publié: (2025)
par: Li, Zejun, et autres
Publié: (2025)
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
par: Li, Yuanshuai, et autres
Publié: (2025)
par: Li, Yuanshuai, et autres
Publié: (2025)
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
par: Lin, Fenfen, et autres
Publié: (2025)
par: Lin, Fenfen, et autres
Publié: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
par: Wang, Huanyu, et autres
Publié: (2025)
par: Wang, Huanyu, et autres
Publié: (2025)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
par: Gao, Mingjian, et autres
Publié: (2026)
par: Gao, Mingjian, et autres
Publié: (2026)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
par: Liu, Ziyan, et autres
Publié: (2025)
par: Liu, Ziyan, et autres
Publié: (2025)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
par: Shen, Zhixuan, et autres
Publié: (2024)
par: Shen, Zhixuan, et autres
Publié: (2024)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
par: Ma, Yinchao, et autres
Publié: (2026)
par: Ma, Yinchao, et autres
Publié: (2026)
Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training
par: Li, Wenbo, et autres
Publié: (2024)
par: Li, Wenbo, et autres
Publié: (2024)
Powerful Teachers Matter: Text-Guided Multi-view Knowledge Distillation with Visual Prior Enhancement
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Visual Position Prompt for MLLM based Visual Grounding
par: Tang, Wei, et autres
Publié: (2025)
par: Tang, Wei, et autres
Publié: (2025)
Multi-Grained Compositional Visual Clue Learning for Image Intent Recognition
par: Tang, Yin, et autres
Publié: (2025)
par: Tang, Yin, et autres
Publié: (2025)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
par: Liu, Zhihang, et autres
Publié: (2025)
par: Liu, Zhihang, et autres
Publié: (2025)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
par: Li, Yiwei, et autres
Publié: (2026)
par: Li, Yiwei, et autres
Publié: (2026)
On the Faithfulness of Visual Thinking: Measurement and Enhancement
par: Liu, Zujing, et autres
Publié: (2025)
par: Liu, Zujing, et autres
Publié: (2025)
T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Global Context Compression with Interleaved Vision-Text Transformation
par: Jiao, Dian, et autres
Publié: (2026)
par: Jiao, Dian, et autres
Publié: (2026)
Audio-centric Video Understanding Benchmark without Text Shortcut
par: Yang, Yudong, et autres
Publié: (2025)
par: Yang, Yudong, et autres
Publié: (2025)
Task-Aware KV Compression For Cost-Effective Long Video Understanding
par: Qin, Minghao, et autres
Publié: (2025)
par: Qin, Minghao, et autres
Publié: (2025)
Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models
par: Chen, Junyu, et autres
Publié: (2024)
par: Chen, Junyu, et autres
Publié: (2024)
Voxel-based Point Cloud Geometry Compression with Space-to-Channel Context
par: Liu, Bojun, et autres
Publié: (2025)
par: Liu, Bojun, et autres
Publié: (2025)
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
par: Li, Yueying, et autres
Publié: (2026)
par: Li, Yueying, et autres
Publié: (2026)
Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation
par: Li, Yuting, et autres
Publié: (2025)
par: Li, Yuting, et autres
Publié: (2025)
Exploring Visual Prompting: Robustness Inheritance and Beyond
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
par: Zhang, Jielu, et autres
Publié: (2023)
par: Zhang, Jielu, et autres
Publié: (2023)
Documents similaires
-
InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs
par: Tang, Lv, et autres
Publié: (2026) -
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
par: Li, Jianjian, et autres
Publié: (2025) -
Interactive Visual Assessment for Text-to-Image Generation Models
par: Mi, Xiaoyue, et autres
Publié: (2024) -
What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis
par: Li, Xirui, et autres
Publié: (2026) -
SSMamba: A Self-Supervised Hybrid State Space Model for Pathological Image Classification
par: Chai, Enhui, et autres
Publié: (2026)