Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Pengfei, Luan, Rongbo, Zhang, Wei, Wu, Peng, He, Sifeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Modality-Fair Preference Optimization for Trustworthy MLLM Alignment
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
SliceLens: Fine-Grained and Grounded Error Slice Discovery for Multi-Instance Vision Tasks
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
von: Lin, Yiheng, et al.
Veröffentlicht: (2025)
von: Lin, Yiheng, et al.
Veröffentlicht: (2025)
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
NeuroBridge: Bio-Inspired Self-Supervised EEG-to-Image Decoding via Cognitive Priors and Bidirectional Semantic Alignment
von: Zhang, Wenjiang, et al.
Veröffentlicht: (2025)
von: Zhang, Wenjiang, et al.
Veröffentlicht: (2025)
UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
von: He, Haichen, et al.
Veröffentlicht: (2026)
von: He, Haichen, et al.
Veröffentlicht: (2026)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
von: Qian, Chengxuan, et al.
Veröffentlicht: (2025)
von: Qian, Chengxuan, et al.
Veröffentlicht: (2025)
BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM
von: Wen, Haiquan, et al.
Veröffentlicht: (2025)
von: Wen, Haiquan, et al.
Veröffentlicht: (2025)
Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration
von: Wang, Jun, et al.
Veröffentlicht: (2025)
von: Wang, Jun, et al.
Veröffentlicht: (2025)
The Devil is in the Details: Boosting Guided Depth Super-Resolution via Rethinking Cross-Modal Alignment and Aggregation
von: Jiang, Xinni, et al.
Veröffentlicht: (2024)
von: Jiang, Xinni, et al.
Veröffentlicht: (2024)
Enhancing CLIP Robustness via Cross-Modality Alignment
von: Zhu, Xingyu, et al.
Veröffentlicht: (2025)
von: Zhu, Xingyu, et al.
Veröffentlicht: (2025)
Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints
von: Ahmad, Wasim, et al.
Veröffentlicht: (2026)
von: Ahmad, Wasim, et al.
Veröffentlicht: (2026)
HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding
von: Yao, Lei, et al.
Veröffentlicht: (2026)
von: Yao, Lei, et al.
Veröffentlicht: (2026)
DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning
von: Huang, Chao, et al.
Veröffentlicht: (2025)
von: Huang, Chao, et al.
Veröffentlicht: (2025)
Clinical-Prior Guided Multi-Modal Learning with Latent Attention Pooling for Gait-Based Scoliosis Screening
von: Chen, Dong, et al.
Veröffentlicht: (2026)
von: Chen, Dong, et al.
Veröffentlicht: (2026)
Building-Guided Pseudo-Label Learning for Cross-Modal Building Damage Mapping
von: Li, Jiepan, et al.
Veröffentlicht: (2025)
von: Li, Jiepan, et al.
Veröffentlicht: (2025)
MDF-MLLM: Deep Fusion Through Cross-Modal Feature Alignment for Contextually Aware Fundoscopic Image Classification
von: Jordan, Jason, et al.
Veröffentlicht: (2025)
von: Jordan, Jason, et al.
Veröffentlicht: (2025)
Cross-Modal Scene Semantic Alignment for Image Complexity Assessment
von: Luo, Yuqing, et al.
Veröffentlicht: (2025)
von: Luo, Yuqing, et al.
Veröffentlicht: (2025)
Ultrasound Report Generation with Cross-Modality Feature Alignment via Unsupervised Guidance
von: Li, Jun, et al.
Veröffentlicht: (2024)
von: Li, Jun, et al.
Veröffentlicht: (2024)
MASRA: MLLM-Assisted Semantic-Relational Consistent Alignment for Video Temporal Grounding
von: Ran, Ran, et al.
Veröffentlicht: (2026)
von: Ran, Ran, et al.
Veröffentlicht: (2026)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
von: Ma, Wenxuan, et al.
Veröffentlicht: (2024)
von: Ma, Wenxuan, et al.
Veröffentlicht: (2024)
Efficient Physics Simulation for 3D Scenes via MLLM-Guided Gaussian Splatting
von: Zhao, Haoyu, et al.
Veröffentlicht: (2024)
von: Zhao, Haoyu, et al.
Veröffentlicht: (2024)
Open-set Cross Modal Generalization via Multimodal Unified Representation
von: Huang, Hai, et al.
Veröffentlicht: (2025)
von: Huang, Hai, et al.
Veröffentlicht: (2025)
Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering
von: Prakash, Nirmalendu, et al.
Veröffentlicht: (2026)
von: Prakash, Nirmalendu, et al.
Veröffentlicht: (2026)
Joint Imaging-ROI Representation Learning via Cross-View Contrastive Alignment for Brain Disorder Classification
von: Liang, Wei, et al.
Veröffentlicht: (2026)
von: Liang, Wei, et al.
Veröffentlicht: (2026)
AttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention Anchors
von: Zhang, Junyang, et al.
Veröffentlicht: (2025)
von: Zhang, Junyang, et al.
Veröffentlicht: (2025)
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
von: Kim, Jeonghyeon, et al.
Veröffentlicht: (2025)
von: Kim, Jeonghyeon, et al.
Veröffentlicht: (2025)
MLLM-as-a-Judge Exhibits Model Preference Bias
von: Koyama, Shuitsu, et al.
Veröffentlicht: (2026)
von: Koyama, Shuitsu, et al.
Veröffentlicht: (2026)
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
von: Liu, Yikun, et al.
Veröffentlicht: (2026)
von: Liu, Yikun, et al.
Veröffentlicht: (2026)
Event-based Facial Keypoint Alignment via Cross-Modal Fusion Attention and Self-Supervised Multi-Event Representation Learning
von: Kang, Donghwa, et al.
Veröffentlicht: (2025)
von: Kang, Donghwa, et al.
Veröffentlicht: (2025)
CrossOver: 3D Scene Cross-Modal Alignment
von: Sarkar, Sayan Deb, et al.
Veröffentlicht: (2025)
von: Sarkar, Sayan Deb, et al.
Veröffentlicht: (2025)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
von: He, Xiang, et al.
Veröffentlicht: (2025)
von: He, Xiang, et al.
Veröffentlicht: (2025)
SPAST: Arbitrary Style Transfer with Style Priors via Pre-trained Large-scale Model
von: Zhang, Zhanjie, et al.
Veröffentlicht: (2025)
von: Zhang, Zhanjie, et al.
Veröffentlicht: (2025)
In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Prompting
von: Peng, Taiying, et al.
Veröffentlicht: (2025)
von: Peng, Taiying, et al.
Veröffentlicht: (2025)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection
von: Zhao, Youjun, et al.
Veröffentlicht: (2025)
von: Zhao, Youjun, et al.
Veröffentlicht: (2025)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
von: Liu, Zheng, et al.
Veröffentlicht: (2025)
von: Liu, Zheng, et al.
Veröffentlicht: (2025)
Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment
von: Huang, Huayang, et al.
Veröffentlicht: (2026)
von: Huang, Huayang, et al.
Veröffentlicht: (2026)
Cross-Modal Attention Guided Unlearning in Vision-Language Models
von: Bhaila, Karuna, et al.
Veröffentlicht: (2025)
von: Bhaila, Karuna, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Modality-Fair Preference Optimization for Trustworthy MLLM Alignment
von: Jiang, Songtao, et al.
Veröffentlicht: (2024) -
SliceLens: Fine-Grained and Grounded Error Slice Discovery for Multi-Instance Vision Tasks
von: Zhang, Wei, et al.
Veröffentlicht: (2025) -
AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
von: Lin, Yiheng, et al.
Veröffentlicht: (2025) -
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
von: Yang, Lei, et al.
Veröffentlicht: (2026) -
NeuroBridge: Bio-Inspired Self-Supervised EEG-to-Image Decoding via Cognitive Priors and Bidirectional Semantic Alignment
von: Zhang, Wenjiang, et al.
Veröffentlicht: (2025)