Cross-modal Causal Relation Alignment for Video Question Grounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Weixing, Liu, Yang, Chen, Binglin, Su, Jiandong, Zheng, Yongsen, Lin, Liang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
ODMixer: Fine-grained Spatial-temporal MLP for Metro Origin-Destination Prediction
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023)
par: Lin, Jingyang, et autres
Publié: (2023)
CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes
par: Parmar, Paritosh, et autres
Publié: (2024)
par: Parmar, Paritosh, et autres
Publié: (2024)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings
par: Chen, Haonan, et autres
Publié: (2026)
par: Chen, Haonan, et autres
Publié: (2026)
Cross-Modal Causal Intervention for Medical Report Generation
par: Chen, Weixing, et autres
Publié: (2023)
par: Chen, Weixing, et autres
Publié: (2023)
Improve Cross-Architecture Generalization on Dataset Distillation
par: Zhou, Binglin, et autres
Publié: (2024)
par: Zhou, Binglin, et autres
Publié: (2024)
CAST: Cross-modal Alignment Similarity Test for Vision Language Models
par: Dagan, Gautier, et autres
Publié: (2024)
par: Dagan, Gautier, et autres
Publié: (2024)
Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation
par: Wu, Ning, et autres
Publié: (2026)
par: Wu, Ning, et autres
Publié: (2026)
VIMI: Grounding Video Generation through Multi-modal Instruction
par: Fang, Yuwei, et autres
Publié: (2024)
par: Fang, Yuwei, et autres
Publié: (2024)
RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language
par: Biswas, Subrata, et autres
Publié: (2025)
par: Biswas, Subrata, et autres
Publié: (2025)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
par: Khorrami, Khazar, et autres
Publié: (2021)
par: Khorrami, Khazar, et autres
Publié: (2021)
Multi-level Cross-modal Alignment for Image Clustering
par: Qiu, Liping, et autres
Publié: (2024)
par: Qiu, Liping, et autres
Publié: (2024)
Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
par: Li, Shengzhi, et autres
Publié: (2024)
par: Li, Shengzhi, et autres
Publié: (2024)
VidLA: Video-Language Alignment at Scale
par: Rizve, Mamshad Nayeem, et autres
Publié: (2024)
par: Rizve, Mamshad Nayeem, et autres
Publié: (2024)
Listen Then See: Video Alignment with Speaker Attention
par: Agrawal, Aviral, et autres
Publié: (2024)
par: Agrawal, Aviral, et autres
Publié: (2024)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
par: Cai, Chen, et autres
Publié: (2024)
par: Cai, Chen, et autres
Publié: (2024)
ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?
par: Meshram, Pragati Shuddhodhan, et autres
Publié: (2024)
par: Meshram, Pragati Shuddhodhan, et autres
Publié: (2024)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024)
par: Le, Quang-Hung, et autres
Publié: (2024)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
par: Zhu, Mengdan, et autres
Publié: (2025)
par: Zhu, Mengdan, et autres
Publié: (2025)
X-VILA: Cross-Modality Alignment for Large Language Model
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering
par: Parmar, Paritosh, et autres
Publié: (2025)
par: Parmar, Paritosh, et autres
Publié: (2025)
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
par: Liang, Jianxin, et autres
Publié: (2024)
par: Liang, Jianxin, et autres
Publié: (2024)
FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions
par: Qin, Bowen, et autres
Publié: (2025)
par: Qin, Bowen, et autres
Publié: (2025)
Semi-distributed Cross-modal Air-Ground Relative Localization
par: Lu, Weining, et autres
Publié: (2025)
par: Lu, Weining, et autres
Publié: (2025)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
par: Liang, Shuo, et autres
Publié: (2025)
par: Liang, Shuo, et autres
Publié: (2025)
Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
par: Madaan, Divyam, et autres
Publié: (2025)
par: Madaan, Divyam, et autres
Publié: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Self-Supervised Visual Preference Alignment
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
par: Zheng, Kening, et autres
Publié: (2024)
par: Zheng, Kening, et autres
Publié: (2024)
MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization
par: Chaubey, Ashutosh, et autres
Publié: (2026)
par: Chaubey, Ashutosh, et autres
Publié: (2026)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
par: Du, Mengfei, et autres
Publié: (2024)
par: Du, Mengfei, et autres
Publié: (2024)
VideoGEM: Training-free Action Grounding in Videos
par: Vogel, Felix, et autres
Publié: (2025)
par: Vogel, Felix, et autres
Publié: (2025)
HistGen: Histopathology Report Generation via Local-Global Feature Encoding and Cross-modal Context Interaction
par: Guo, Zhengrui, et autres
Publié: (2024)
par: Guo, Zhengrui, et autres
Publié: (2024)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Documents similaires
-
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
par: Tian, Yuanhe, et autres
Publié: (2025) -
ODMixer: Fine-grained Spatial-temporal MLP for Metro Origin-Destination Prediction
par: Liu, Yang, et autres
Publié: (2024) -
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023) -
CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes
par: Parmar, Paritosh, et autres
Publié: (2024) -
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
par: Zhang, Ming, et autres
Publié: (2024)