Shapley Value-based Contrastive Alignment for Multimodal Information Extraction
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Wen, Xia, Yu, Tianshu, Shen, Li, Sujian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Robust Multimodal Sentiment Analysis with Incomplete Data
por: Zhang, Haoyu, et al.
Publicado: (2024)
por: Zhang, Haoyu, et al.
Publicado: (2024)
PTA: Enhancing Multimodal Sentiment Analysis through Pipelined Prediction and Translation-based Alignment
por: Song, Shezheng, et al.
Publicado: (2024)
por: Song, Shezheng, et al.
Publicado: (2024)
Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment
por: Zeng, Delong, et al.
Publicado: (2026)
por: Zeng, Delong, et al.
Publicado: (2026)
GeoGuess: Multimodal Reasoning based on Hierarchy of Visual Information in Street View
por: Cheng, Fenghua, et al.
Publicado: (2025)
por: Cheng, Fenghua, et al.
Publicado: (2025)
SemEval-2024 Task 3: Multimodal Emotion Cause Analysis in Conversations
por: Wang, Fanfan, et al.
Publicado: (2024)
por: Wang, Fanfan, et al.
Publicado: (2024)
Interpretable Multimodal Misinformation Detection with Logic Reasoning
por: Liu, Hui, et al.
Publicado: (2023)
por: Liu, Hui, et al.
Publicado: (2023)
Towards Better Text-to-Image Generation Alignment via Attention Modulation
por: Wu, Yihang, et al.
Publicado: (2024)
por: Wu, Yihang, et al.
Publicado: (2024)
Unsupervised Multimodal Clustering for Semantics Discovery in Multimodal Utterances
por: Zhang, Hanlei, et al.
Publicado: (2024)
por: Zhang, Hanlei, et al.
Publicado: (2024)
A Survey on Image-text Multimodal Models
por: Guo, Ruifeng, et al.
Publicado: (2023)
por: Guo, Ruifeng, et al.
Publicado: (2023)
Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum
por: Yang, Xinglong, et al.
Publicado: (2025)
por: Yang, Xinglong, et al.
Publicado: (2025)
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
por: Ren, Yiming, et al.
Publicado: (2026)
por: Ren, Yiming, et al.
Publicado: (2026)
Knowledge-Guided Dynamic Modality Attention Fusion Framework for Multimodal Sentiment Analysis
por: Feng, Xinyu, et al.
Publicado: (2024)
por: Feng, Xinyu, et al.
Publicado: (2024)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
por: Zhang, Hanlei, et al.
Publicado: (2025)
por: Zhang, Hanlei, et al.
Publicado: (2025)
Machine Unlearning in Hyperbolic vs. Euclidean Multimodal Contrastive Learning: Adapting Alignment Calibration to MERU
por: Vidal, Àlex Pujol, et al.
Publicado: (2025)
por: Vidal, Àlex Pujol, et al.
Publicado: (2025)
Enhancing Multimodal Affective Analysis with Learned Live Comment Features
por: Deng, Zhaoyuan, et al.
Publicado: (2024)
por: Deng, Zhaoyuan, et al.
Publicado: (2024)
LLM-Guided Semantic Relational Reasoning for Multimodal Intent Recognition
por: Zhou, Qianrui, et al.
Publicado: (2025)
por: Zhou, Qianrui, et al.
Publicado: (2025)
A Survey of Generative Categories and Techniques in Multimodal Generative Models
por: Han, Longzhen, et al.
Publicado: (2025)
por: Han, Longzhen, et al.
Publicado: (2025)
MultimodalHugs: Enabling Sign Language Processing in Hugging Face
por: Sant, Gerard, et al.
Publicado: (2025)
por: Sant, Gerard, et al.
Publicado: (2025)
HateSieve: A Contrastive Learning Framework for Detecting and Segmenting Hateful Content in Multimodal Memes
por: Su, Xuanyu, et al.
Publicado: (2024)
por: Su, Xuanyu, et al.
Publicado: (2024)
A Multimodal Framework for Explainable Evaluation of Soft Skills in Educational Environments
por: Guerrero-Sosa, Jared D. T., et al.
Publicado: (2025)
por: Guerrero-Sosa, Jared D. T., et al.
Publicado: (2025)
Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
por: Liu, Shuo, et al.
Publicado: (2025)
por: Liu, Shuo, et al.
Publicado: (2025)
Temporal-Spatial Decouple before Act: Disentangled Representation Learning for Multimodal Sentiment Analysis
por: Meng, Chunlei, et al.
Publicado: (2026)
por: Meng, Chunlei, et al.
Publicado: (2026)
Beyond Spurious Signals: Debiasing Multimodal Large Language Models via Counterfactual Inference and Adaptive Expert Routing
por: Wu, Zichen, et al.
Publicado: (2025)
por: Wu, Zichen, et al.
Publicado: (2025)
'No' Matters: Out-of-Distribution Detection in Multimodality Long Dialogue
por: Gao, Rena, et al.
Publicado: (2024)
por: Gao, Rena, et al.
Publicado: (2024)
Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction
por: Zhang, Qintong, et al.
Publicado: (2024)
por: Zhang, Qintong, et al.
Publicado: (2024)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
por: Zhou, Ziyi, et al.
Publicado: (2024)
por: Zhou, Ziyi, et al.
Publicado: (2024)
TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding
por: Ku, Max, et al.
Publicado: (2025)
por: Ku, Max, et al.
Publicado: (2025)
MusicAIR: A Multimodal AI Music Generation Framework Powered by an Algorithm-Driven Core
por: Liao, Callie C., et al.
Publicado: (2025)
por: Liao, Callie C., et al.
Publicado: (2025)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
por: Luo, Ziyang, et al.
Publicado: (2024)
por: Luo, Ziyang, et al.
Publicado: (2024)
Multi-Agent System for AI-Assisted Extraction of Narrative Arcs in TV Series
por: Balestri, Roberto, et al.
Publicado: (2025)
por: Balestri, Roberto, et al.
Publicado: (2025)
Unleashing the Power of Imbalanced Modality Information for Multi-modal Knowledge Graph Completion
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
EEG2TEXT-CN: An Exploratory Study of Open-Vocabulary Chinese Text-EEG Alignment via Large Language Model and Contrastive Learning on ChineseEEG
por: Lu, Jacky Tai-Yu, et al.
Publicado: (2025)
por: Lu, Jacky Tai-Yu, et al.
Publicado: (2025)
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
por: Xue, Dong, et al.
Publicado: (2025)
por: Xue, Dong, et al.
Publicado: (2025)
Enhancing Multimodal Entity and Relation Extraction with Variational Information Bottleneck
por: Cui, Shiyao, et al.
Publicado: (2023)
por: Cui, Shiyao, et al.
Publicado: (2023)
A Picture Is Worth a Graph: A Blueprint Debate Paradigm for Multimodal Reasoning
por: Zheng, Changmeng, et al.
Publicado: (2024)
por: Zheng, Changmeng, et al.
Publicado: (2024)
Cardiverse: Harnessing LLMs for Novel Card Game Prototyping
por: Li, Danrui, et al.
Publicado: (2025)
por: Li, Danrui, et al.
Publicado: (2025)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
por: Lu, Jinghui, et al.
Publicado: (2024)
por: Lu, Jinghui, et al.
Publicado: (2024)
Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
por: Lu, Jinghui, et al.
Publicado: (2025)
por: Lu, Jinghui, et al.
Publicado: (2025)
Ejemplares similares
-
Towards Robust Multimodal Sentiment Analysis with Incomplete Data
por: Zhang, Haoyu, et al.
Publicado: (2024) -
PTA: Enhancing Multimodal Sentiment Analysis through Pipelined Prediction and Translation-based Alignment
por: Song, Shezheng, et al.
Publicado: (2024) -
Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment
por: Zeng, Delong, et al.
Publicado: (2026) -
GeoGuess: Multimodal Reasoning based on Hierarchy of Visual Information in Street View
por: Cheng, Fenghua, et al.
Publicado: (2025) -
SemEval-2024 Task 3: Multimodal Emotion Cause Analysis in Conversations
por: Wang, Fanfan, et al.
Publicado: (2024)