Energy-Based Constraint Networks: Learning Structural Coherence Across Modalities
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Shinde, Chirag |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Judge Anything: MLLM as a Judge Across Any Modality
par: Pu, Shu, et autres
Publié: (2025)
par: Pu, Shu, et autres
Publié: (2025)
Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities
par: Menon, Sachit, et autres
Publié: (2024)
par: Menon, Sachit, et autres
Publié: (2024)
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
par: Gigant, Théo, et autres
Publié: (2025)
par: Gigant, Théo, et autres
Publié: (2025)
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
par: Li, Qian, et autres
Publié: (2024)
par: Li, Qian, et autres
Publié: (2024)
Is Extending Modality The Right Path Towards Omni-Modality?
par: Zhu, Tinghui, et autres
Publié: (2025)
par: Zhu, Tinghui, et autres
Publié: (2025)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
par: Tumu, Akshar, et autres
Publié: (2025)
par: Tumu, Akshar, et autres
Publié: (2025)
Enhancing Chest X-ray Classification through Knowledge Injection in Cross-Modality Learning
par: Yan, Yang, et autres
Publié: (2025)
par: Yan, Yang, et autres
Publié: (2025)
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
par: Zhang, Yanghai, et autres
Publié: (2024)
par: Zhang, Yanghai, et autres
Publié: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
Shared and Private Information Learning in Multimodal Sentiment Analysis with Deep Modal Alignment and Self-supervised Multi-Task Learning
par: Lai, Songning, et autres
Publié: (2023)
par: Lai, Songning, et autres
Publié: (2023)
Beyond the Textual: Generating Coherent Visual Options for MCQs
par: Wang, Wanqiang, et autres
Publié: (2025)
par: Wang, Wanqiang, et autres
Publié: (2025)
Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
par: Shi, Yi, et autres
Publié: (2025)
par: Shi, Yi, et autres
Publié: (2025)
Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality
par: Qian, Kai, et autres
Publié: (2026)
par: Qian, Kai, et autres
Publié: (2026)
MMGR: Multi-Modal Generative Reasoning
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
More than a Moment: Towards Coherent Sequences of Audio Descriptions
par: Khandelwal, Eshika, et autres
Publié: (2025)
par: Khandelwal, Eshika, et autres
Publié: (2025)
CLEAR: Character Unlearning in Textual and Visual Modalities
par: Dontsov, Alexey, et autres
Publié: (2024)
par: Dontsov, Alexey, et autres
Publié: (2024)
COME: Dual Structure-Semantic Learning with Collaborative MoE for Universal Lesion Detection Across Heterogeneous Ultrasound Datasets
par: Chen, Lingyu, et autres
Publié: (2025)
par: Chen, Lingyu, et autres
Publié: (2025)
LongCat-Next: Lexicalizing Modalities as Discrete Tokens
par: Meituan LongCat Team, et autres
Publié: (2026)
par: Meituan LongCat Team, et autres
Publié: (2026)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
par: Zhang, Yuechen, et autres
Publié: (2023)
par: Zhang, Yuechen, et autres
Publié: (2023)
Modality-Agnostic fMRI Decoding of Vision and Language
par: Nikolaus, Mitja, et autres
Publié: (2024)
par: Nikolaus, Mitja, et autres
Publié: (2024)
Text-centric Alignment for Multi-Modality Learning
par: Tsai, Yun-Da, et autres
Publié: (2024)
par: Tsai, Yun-Da, et autres
Publié: (2024)
MotionGPT3: Human Motion as a Second Modality
par: Zhu, Bingfan, et autres
Publié: (2025)
par: Zhu, Bingfan, et autres
Publié: (2025)
Otter: A Multi-Modal Model with In-Context Instruction Tuning
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
MoExtend: Tuning New Experts for Modality and Task Extension
par: Zhong, Shanshan, et autres
Publié: (2024)
par: Zhong, Shanshan, et autres
Publié: (2024)
Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing
par: Bannur, Shruthi, et autres
Publié: (2023)
par: Bannur, Shruthi, et autres
Publié: (2023)
Cross-Modal Rationale Transfer for Explainable Humanitarian Classification on Social Media
par: Nguyen, Thi Huyen, et autres
Publié: (2026)
par: Nguyen, Thi Huyen, et autres
Publié: (2026)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
par: Han, Feng, et autres
Publié: (2026)
par: Han, Feng, et autres
Publié: (2026)
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
Multi-Modal 3D Mesh Reconstruction from Images and Text
par: Reka, Melvin, et autres
Publié: (2025)
par: Reka, Melvin, et autres
Publié: (2025)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
par: Chen, Yingfa, et autres
Publié: (2024)
par: Chen, Yingfa, et autres
Publié: (2024)
Cross-Modal Retrieval for Motion and Text via DropTriple Loss
par: Yan, Sheng, et autres
Publié: (2023)
par: Yan, Sheng, et autres
Publié: (2023)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following Models
par: Huang, Yupan, et autres
Publié: (2023)
par: Huang, Yupan, et autres
Publié: (2023)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding
par: Nguyen, Thong, et autres
Publié: (2023)
par: Nguyen, Thong, et autres
Publié: (2023)
How Do Vision-Language Models Process Conflicting Information Across Modalities?
par: Hua, Tianze, et autres
Publié: (2025)
par: Hua, Tianze, et autres
Publié: (2025)
CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks
par: Suharitdamrong, Wish, et autres
Publié: (2026)
par: Suharitdamrong, Wish, et autres
Publié: (2026)
Documents similaires
-
Judge Anything: MLLM as a Judge Across Any Modality
par: Pu, Shu, et autres
Publié: (2025) -
Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities
par: Menon, Sachit, et autres
Publié: (2024) -
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
par: Gigant, Théo, et autres
Publié: (2025) -
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
par: Li, Qian, et autres
Publié: (2024) -
Is Extending Modality The Right Path Towards Omni-Modality?
par: Zhu, Tinghui, et autres
Publié: (2025)