CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Fu, Jinlan, Huangfu, Shenzhen, Fei, Hao, Shen, Xiaoyu, Hooi, Bryan, Qiu, Xipeng, Ng, See-Kiong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
di: Fu, Jinlan, et al.
Pubblicazione: (2024)
di: Fu, Jinlan, et al.
Pubblicazione: (2024)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
CET2: Modelling Topic Transitions for Coherent and Engaging Knowledge-Grounded Conversations
di: Xu, Lin, et al.
Pubblicazione: (2024)
di: Xu, Lin, et al.
Pubblicazione: (2024)
Spatio-Temporal Foundation Models: Vision, Challenges, and Opportunities
di: Goodge, Adam, et al.
Pubblicazione: (2025)
di: Goodge, Adam, et al.
Pubblicazione: (2025)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
di: Zhu, Zhihao, et al.
Pubblicazione: (2026)
di: Zhu, Zhihao, et al.
Pubblicazione: (2026)
Chain of Thought Explanation for Dialogue State Tracking
di: Xu, Lin, et al.
Pubblicazione: (2024)
di: Xu, Lin, et al.
Pubblicazione: (2024)
RoboOmni: Proactive Robot Manipulation in Omni-modal Context
di: Wang, Siyin, et al.
Pubblicazione: (2025)
di: Wang, Siyin, et al.
Pubblicazione: (2025)
$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
di: Fan, Yingqi, et al.
Pubblicazione: (2025)
di: Fan, Yingqi, et al.
Pubblicazione: (2025)
How Does Response Length Affect Long-Form Factuality
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
di: Wang, Siyin, et al.
Pubblicazione: (2025)
di: Wang, Siyin, et al.
Pubblicazione: (2025)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
TRACE: TRansformer-based Attribution using Contrastive Embeddings in LLMs
di: Wang, Cheng, et al.
Pubblicazione: (2024)
di: Wang, Cheng, et al.
Pubblicazione: (2024)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
Investigating and Enhancing the Robustness of Large Multimodal Models Against Temporal Inconsistency
di: Liang, Jiafeng, et al.
Pubblicazione: (2025)
di: Liang, Jiafeng, et al.
Pubblicazione: (2025)
Balancing Truthfulness and Informativeness with Uncertainty-Aware Instruction Fine-Tuning
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
di: Huang, Haojian, et al.
Pubblicazione: (2025)
di: Huang, Haojian, et al.
Pubblicazione: (2025)
Multimodal Mathematical Reasoning with Diverse Solving Perspective
di: Shi, Wenhao, et al.
Pubblicazione: (2025)
di: Shi, Wenhao, et al.
Pubblicazione: (2025)
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
di: Hu, Zhiyuan, et al.
Pubblicazione: (2026)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2026)
Principled Multimodal Representation Learning
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance
di: Liu, Renyang, et al.
Pubblicazione: (2024)
di: Liu, Renyang, et al.
Pubblicazione: (2024)
Multi-Layer Visual Feature Fusion in Multimodal LLMs: Methods, Analysis, and Best Practices
di: Lin, Junyan, et al.
Pubblicazione: (2025)
di: Lin, Junyan, et al.
Pubblicazione: (2025)
CHiQPM: Calibrated Hierarchical Interpretable Image Classification
di: Norrenbrock, Thomas, et al.
Pubblicazione: (2025)
di: Norrenbrock, Thomas, et al.
Pubblicazione: (2025)
Unveiling In-Context Learning: A Coordinate System to Understand Its Working Mechanism
di: Zhao, Anhao, et al.
Pubblicazione: (2024)
di: Zhao, Anhao, et al.
Pubblicazione: (2024)
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
di: Sui, Yuan, et al.
Pubblicazione: (2026)
di: Sui, Yuan, et al.
Pubblicazione: (2026)
LongRecipe: Recipe for Efficient Long Context Generalization in Large Language Models
di: Hu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2024)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
di: Bin, Yi, et al.
Pubblicazione: (2024)
di: Bin, Yi, et al.
Pubblicazione: (2024)
Confidence Elicitation: A New Attack Vector for Large Language Models
di: Formento, Brian, et al.
Pubblicazione: (2025)
di: Formento, Brian, et al.
Pubblicazione: (2025)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
di: Liu, Wenjie, et al.
Pubblicazione: (2026)
di: Liu, Wenjie, et al.
Pubblicazione: (2026)
Uncertainty of Thoughts: Uncertainty-Aware Planning Enhances Information Seeking in Large Language Models
di: Hu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2024)
Benchmarking LLMs for Unit Test Generation from Real-World Functions
di: Huang, Dong, et al.
Pubblicazione: (2025)
di: Huang, Dong, et al.
Pubblicazione: (2025)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
di: Zong, Yi, et al.
Pubblicazione: (2024)
di: Zong, Yi, et al.
Pubblicazione: (2024)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
di: Wu, Jiaying, et al.
Pubblicazione: (2025)
di: Wu, Jiaying, et al.
Pubblicazione: (2025)
When Text and Images Don't Mix: Bias-Correcting Language-Image Similarity Scores for Anomaly Detection
di: Goodge, Adam, et al.
Pubblicazione: (2024)
di: Goodge, Adam, et al.
Pubblicazione: (2024)
Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2023)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2023)
FreeAct: Freeing Activations for LLM Quantization
di: Liu, Xiaohao, et al.
Pubblicazione: (2026)
di: Liu, Xiaohao, et al.
Pubblicazione: (2026)
Data-Free Federated Class Incremental Learning with Diffusion-Based Generative Memory
di: Wang, Naibo, et al.
Pubblicazione: (2024)
di: Wang, Naibo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
di: Fu, Jinlan, et al.
Pubblicazione: (2025) -
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
di: Fu, Jinlan, et al.
Pubblicazione: (2024) -
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026) -
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
di: Zhang, Haowei, et al.
Pubblicazione: (2026) -
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
di: Zhao, James Xu, et al.
Pubblicazione: (2025)