SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yin, Yuanyang, Zhao, Yaqi, Zhang, Yajie, Zhang, Yuanxing, Lin, Ke, Wang, Jiahao, Tao, Xin, Wan, Pengfei, Zhang, Wentao, Zhao, Feng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge
par: Zhao, Yaqi, et autres
Publié: (2024)
par: Zhao, Yaqi, et autres
Publié: (2024)
Towards Precise Scaling Laws for Video Diffusion Transformers
par: Yin, Yuanyang, et autres
Publié: (2024)
par: Yin, Yuanyang, et autres
Publié: (2024)
Self-Supervised Visual Preference Alignment
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
par: Li, Bozhou, et autres
Publié: (2025)
par: Li, Bozhou, et autres
Publié: (2025)
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
par: Jiang, Pengfei, et autres
Publié: (2025)
par: Jiang, Pengfei, et autres
Publié: (2025)
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
par: Li, Bozhou, et autres
Publié: (2025)
par: Li, Bozhou, et autres
Publié: (2025)
FG-CLIP: Fine-Grained Visual and Textual Alignment
par: Xie, Chunyu, et autres
Publié: (2025)
par: Xie, Chunyu, et autres
Publié: (2025)
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation
par: Tong, Chengzhuo, et autres
Publié: (2026)
par: Tong, Chengzhuo, et autres
Publié: (2026)
T-REG: Preference Optimization with Token-Level Reward Regularization
par: Zhou, Wenxuan, et autres
Publié: (2024)
par: Zhou, Wenxuan, et autres
Publié: (2024)
Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
par: Zou, Xin, et autres
Publié: (2025)
par: Zou, Xin, et autres
Publié: (2025)
Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
par: Ye, Zixuan, et autres
Publié: (2025)
par: Ye, Zixuan, et autres
Publié: (2025)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
par: Chen, Yuhao, et autres
Publié: (2026)
par: Chen, Yuhao, et autres
Publié: (2026)
Beyond Textual Context: Structural Graph Encoding with Adaptive Space Alignment to alleviate the hallucination of LLMs
par: Zhang, Yifang, et autres
Publié: (2025)
par: Zhang, Yifang, et autres
Publié: (2025)
REAL: Response Embedding-based Alignment for LLMs
par: Zhang, Honggen, et autres
Publié: (2024)
par: Zhang, Honggen, et autres
Publié: (2024)
Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Token-Level Inference-Time Alignment for Vision-Language Models
par: Chen, Kejia, et autres
Publié: (2025)
par: Chen, Kejia, et autres
Publié: (2025)
Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models
par: Yin, Yuanyang, et autres
Publié: (2026)
par: Yin, Yuanyang, et autres
Publié: (2026)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
par: Wang, Qixun, et autres
Publié: (2025)
par: Wang, Qixun, et autres
Publié: (2025)
Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
par: Zhu, Xuanyu, et autres
Publié: (2026)
par: Zhu, Xuanyu, et autres
Publié: (2026)
CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
par: Zhang, Yang, et autres
Publié: (2026)
par: Zhang, Yang, et autres
Publié: (2026)
Learning Concepts, Not Tokens: Self-Supervised Semantic Alignment for Language Models
par: Zhang, Christine, et autres
Publié: (2026)
par: Zhang, Christine, et autres
Publié: (2026)
Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
par: Ou, Siqu, et autres
Publié: (2026)
par: Ou, Siqu, et autres
Publié: (2026)
Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
Enhancing Visual Continual Learning with Language-Guided Supervision
par: Ni, Bolin, et autres
Publié: (2024)
par: Ni, Bolin, et autres
Publié: (2024)
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
par: Guo, Xuyang, et autres
Publié: (2025)
par: Guo, Xuyang, et autres
Publié: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
par: Zhang, Songming, et autres
Publié: (2025)
par: Zhang, Songming, et autres
Publié: (2025)
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
par: Jiang, Yankai, et autres
Publié: (2026)
par: Jiang, Yankai, et autres
Publié: (2026)
VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption
par: Zhong, Tianxiong, et autres
Publié: (2025)
par: Zhong, Tianxiong, et autres
Publié: (2025)
Context Tokens are Anchors: Understanding the Repetition Curse in dMLLMs from an Information Flow Perspective
par: Zhao, Qiyan, et autres
Publié: (2026)
par: Zhao, Qiyan, et autres
Publié: (2026)
TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs
par: Zhang, Kejia, et autres
Publié: (2025)
par: Zhang, Kejia, et autres
Publié: (2025)
GITA: Graph to Visual and Textual Integration for Vision-Language Graph Reasoning
par: Wei, Yanbin, et autres
Publié: (2024)
par: Wei, Yanbin, et autres
Publié: (2024)
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
par: Li, Hongliang, et autres
Publié: (2025)
par: Li, Hongliang, et autres
Publié: (2025)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
par: Zhang, Qizhe, et autres
Publié: (2025)
par: Zhang, Qizhe, et autres
Publié: (2025)
Demystifying Numerosity in Diffusion Models -- Limitations and Remedies
par: Zhao, Yaqi, et autres
Publié: (2025)
par: Zhao, Yaqi, et autres
Publié: (2025)
Joint Semantic Token Selection and Prompt Optimization for Interpretable Prompt Learning
par: Wang, Yating, et autres
Publié: (2026)
par: Wang, Yating, et autres
Publié: (2026)
Supervised Gromov-Wasserstein Optimal Transport
par: Cang, Zixuan, et autres
Publié: (2024)
par: Cang, Zixuan, et autres
Publié: (2024)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
par: Tan, Yifan, et autres
Publié: (2026)
par: Tan, Yifan, et autres
Publié: (2026)
Documents similaires
-
Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge
par: Zhao, Yaqi, et autres
Publié: (2024) -
Towards Precise Scaling Laws for Video Diffusion Transformers
par: Yin, Yuanyang, et autres
Publié: (2024) -
Self-Supervised Visual Preference Alignment
par: Zhu, Ke, et autres
Publié: (2024) -
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
par: Li, Bozhou, et autres
Publié: (2025) -
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
par: Li, Qi, et autres
Publié: (2026)