Verifying Cross-modal Entity Consistency in News using Vision-language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tahmasebi, Sahar, Ernst, David, Müller-Budack, Eric, Ewerth, Ralph |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multimodal Misinformation Detection using Large Vision-Language Models
par: Tahmasebi, Sahar, et autres
Publié: (2024)
par: Tahmasebi, Sahar, et autres
Publié: (2024)
Patent Figure Classification using Large Vision-language Models
par: Awale, Sushil, et autres
Publié: (2025)
par: Awale, Sushil, et autres
Publié: (2025)
Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks
par: Tahmasebi, Sahar, et autres
Publié: (2026)
par: Tahmasebi, Sahar, et autres
Publié: (2026)
Mitigating Modality Bias in Multi-modal Entity Alignment from a Causal Perspective
par: Su, Taoyu, et autres
Publié: (2025)
par: Su, Taoyu, et autres
Publié: (2025)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
par: Li, Haoxuan, et autres
Publié: (2025)
par: Li, Haoxuan, et autres
Publié: (2025)
Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond
par: Wei, Tianxin, et autres
Publié: (2024)
par: Wei, Tianxin, et autres
Publié: (2024)
Why Multi-Interest Fairness Matters: Hypergraph Contrastive Multi-Interest Learning for Fair Conversational Recommender System
par: Zheng, Yongsen, et autres
Publié: (2025)
par: Zheng, Yongsen, et autres
Publié: (2025)
PREMISE: Matching-based Prediction for Accurate Review Recommendation
par: Han, Wei, et autres
Publié: (2025)
par: Han, Wei, et autres
Publié: (2025)
Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation
par: Yang, Jheng-Hong, et autres
Publié: (2024)
par: Yang, Jheng-Hong, et autres
Publié: (2024)
MDF: A Dynamic Fusion Model for Multi-modal Fake News Detection
par: Lv, Hongzhen, et autres
Publié: (2024)
par: Lv, Hongzhen, et autres
Publié: (2024)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Reverse Region-to-Entity Annotation for Pixel-Level Visual Entity Linking
par: Xu, Zhengfei, et autres
Publié: (2024)
par: Xu, Zhengfei, et autres
Publié: (2024)
NativE: Multi-modal Knowledge Graph Completion in the Wild
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Joint-Dataset Learning and Cross-Consistent Regularization for Text-to-Motion Retrieval
par: Messina, Nicola, et autres
Publié: (2024)
par: Messina, Nicola, et autres
Publié: (2024)
MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval
par: Wu, Qiyu, et autres
Publié: (2025)
par: Wu, Qiyu, et autres
Publié: (2025)
Clustering Internet Memes Through Template Matching and Multi-Dimensional Similarity
par: Bloem, Tygo, et autres
Publié: (2025)
par: Bloem, Tygo, et autres
Publié: (2025)
EventCast: Hybrid Demand Forecasting in E-Commerce with LLM-Based Event Knowledge
par: Hu, Congcong, et autres
Publié: (2026)
par: Hu, Congcong, et autres
Publié: (2026)
AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents
par: Jin, Jiarui, et autres
Publié: (2026)
par: Jin, Jiarui, et autres
Publié: (2026)
Mitigating the Impact of Reference Quality on Evaluation of Summarization Systems with Reference-Free Metrics
par: Gigant, Théo, et autres
Publié: (2024)
par: Gigant, Théo, et autres
Publié: (2024)
Improving the Consistency in Cross-Lingual Cross-Modal Retrieval with 1-to-K Contrastive Learning
par: Nie, Zhijie, et autres
Publié: (2024)
par: Nie, Zhijie, et autres
Publié: (2024)
UCDR-Adapter: Exploring Adaptation of Pre-Trained Vision-Language Models for Universal Cross-Domain Retrieval
par: Jiang, Haoyu, et autres
Publié: (2024)
par: Jiang, Haoyu, et autres
Publié: (2024)
Leveraging Weak Cross-Modal Guidance for Coherence Modelling via Iterative Learning
par: Bin, Yi, et autres
Publié: (2024)
par: Bin, Yi, et autres
Publié: (2024)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
Performance Evaluation in Multimedia Retrieval
par: Sauter, Loris, et autres
Publié: (2024)
par: Sauter, Loris, et autres
Publié: (2024)
Automating Steering for Safe Multimodal Large Language Models
par: Wu, Lyucheng, et autres
Publié: (2025)
par: Wu, Lyucheng, et autres
Publié: (2025)
Unified Hallucination Detection for Multimodal Large Language Models
par: Chen, Xiang, et autres
Publié: (2024)
par: Chen, Xiang, et autres
Publié: (2024)
Cross-Modal Retrieval: A Systematic Review of Methods and Future Directions
par: Wang, Tianshi, et autres
Publié: (2023)
par: Wang, Tianshi, et autres
Publié: (2023)
FashionDPO:Fine-tune Fashion Outfit Generation Model using Direct Preference Optimization
par: Yu, Mingzhe, et autres
Publié: (2025)
par: Yu, Mingzhe, et autres
Publié: (2025)
CLEAR: Null-Space Projection for Cross-Modal De-Redundancy in Multimodal Recommendation
par: Zhan, Hao, et autres
Publié: (2026)
par: Zhan, Hao, et autres
Publié: (2026)
CLOSP: A Unified Semantic Space for SAR, MSI, and Text in Remote Sensing
par: Cambrin, Daniele Rege, et autres
Publié: (2025)
par: Cambrin, Daniele Rege, et autres
Publié: (2025)
Visual Lifelog Retrieval through Captioning-Enhanced Interpretation
par: Shih, Yu-Fei, et autres
Publié: (2025)
par: Shih, Yu-Fei, et autres
Publié: (2025)
Hierarchical Local-Global Transformer for Temporal Sentence Grounding
par: Fang, Xiang, et autres
Publié: (2022)
par: Fang, Xiang, et autres
Publié: (2022)
RAG-VisualRec: An Open Resource for Vision- and Text-Enhanced Retrieval-Augmented Generation in Recommendation
par: Tourani, Ali, et autres
Publié: (2025)
par: Tourani, Ali, et autres
Publié: (2025)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
par: Stamatakis, Markos, et autres
Publié: (2025)
par: Stamatakis, Markos, et autres
Publié: (2025)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
Multimodal Inverse Attention Network with Intrinsic Discriminant Feature Exploitation for Fake News Detection
par: Zhang, Tianlin, et autres
Publié: (2025)
par: Zhang, Tianlin, et autres
Publié: (2025)
Muse-it: A Tool for Analyzing Music Discourse on Reddit
par: Agarwala, Jatin, et autres
Publié: (2025)
par: Agarwala, Jatin, et autres
Publié: (2025)
Breaking the Curse of Knowledge: Towards Effective Multimodal Recommendation using Knowledge Soft Integration
par: Ouyang, Kai, et autres
Publié: (2023)
par: Ouyang, Kai, et autres
Publié: (2023)
LightThinker: Thinking Step-by-Step Compression
par: Zhang, Jintian, et autres
Publié: (2025)
par: Zhang, Jintian, et autres
Publié: (2025)
Documents similaires
-
Multimodal Misinformation Detection using Large Vision-Language Models
par: Tahmasebi, Sahar, et autres
Publié: (2024) -
Patent Figure Classification using Large Vision-language Models
par: Awale, Sushil, et autres
Publié: (2025) -
Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks
par: Tahmasebi, Sahar, et autres
Publié: (2026) -
Mitigating Modality Bias in Multi-modal Entity Alignment from a Causal Perspective
par: Su, Taoyu, et autres
Publié: (2025) -
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
par: Zhou, Ao, et autres
Publié: (2025)