Guardado en:
| Autores principales: | Song, Xinhao, Su, Su, Song, Sirui, Wu, Hongliang, Shen, Wen, Wei, Zhihua, Liu, Gongshen, Zhang, Linfeng, Liu, Dongrui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2606.02449 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LoginMEA: Local-to-Global Interaction Network for Multi-modal Entity Alignment
por: Su, Taoyu, et al.
Publicado: (2024)
por: Su, Taoyu, et al.
Publicado: (2024)
Mitigating Modality Bias in Multi-modal Entity Alignment from a Causal Perspective
por: Su, Taoyu, et al.
Publicado: (2025)
por: Su, Taoyu, et al.
Publicado: (2025)
IBMEA: Exploring Variational Information Bottleneck for Multi-modal Entity Alignment
por: Su, Taoyu, et al.
Publicado: (2024)
por: Su, Taoyu, et al.
Publicado: (2024)
Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
por: Chen, Xiaolin, et al.
Publicado: (2025)
por: Chen, Xiaolin, et al.
Publicado: (2025)
Sentiment-enhanced Graph-based Sarcasm Explanation in Dialogue
por: Ouyang, Kun, et al.
Publicado: (2024)
por: Ouyang, Kun, et al.
Publicado: (2024)
Emotion Collider: Dual Hyperbolic Mirror Manifolds for Sentiment Recovery via Anti Emotion Reflection
por: Fu, Rong, et al.
Publicado: (2026)
por: Fu, Rong, et al.
Publicado: (2026)
Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models
por: Chen, Junjie, et al.
Publicado: (2025)
por: Chen, Junjie, et al.
Publicado: (2025)
MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter
por: Liu, Zhiyuan, et al.
Publicado: (2023)
por: Liu, Zhiyuan, et al.
Publicado: (2023)
Rethinking Radiology Report Generation via Causal Inspired Counterfactual Augmentation
por: Song, Xiao, et al.
Publicado: (2023)
por: Song, Xiao, et al.
Publicado: (2023)
MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks
por: Zhang, Lei, et al.
Publicado: (2025)
por: Zhang, Lei, et al.
Publicado: (2025)
Contrast then Memorize: Semantic Neighbor Retrieval-Enhanced Inductive Multimodal Knowledge Graph Completion
por: Zhao, Yu, et al.
Publicado: (2024)
por: Zhao, Yu, et al.
Publicado: (2024)
MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations
por: Zhang, Hanlei, et al.
Publicado: (2024)
por: Zhang, Hanlei, et al.
Publicado: (2024)
TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition
por: Wang, Xinyu, et al.
Publicado: (2026)
por: Wang, Xinyu, et al.
Publicado: (2026)
Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
por: Liu, Shuo, et al.
Publicado: (2025)
por: Liu, Shuo, et al.
Publicado: (2025)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
por: Quan, Weize, et al.
Publicado: (2024)
por: Quan, Weize, et al.
Publicado: (2024)
Every Part Matters: Integrity Verification of Scientific Figures Based on Multimodal Large Language Models
por: Shi, Xiang, et al.
Publicado: (2024)
por: Shi, Xiang, et al.
Publicado: (2024)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation
por: Zhu, Xiaofei, et al.
Publicado: (2024)
por: Zhu, Xiaofei, et al.
Publicado: (2024)
Conversation Understanding using Relational Temporal Graph Neural Networks with Auxiliary Cross-Modality Interaction
por: Nguyen, Cam-Van Thi, et al.
Publicado: (2023)
por: Nguyen, Cam-Van Thi, et al.
Publicado: (2023)
Retrieval-Augmented Generation for Electrocardiogram-Language Models
por: Song, Xiaoyu, et al.
Publicado: (2025)
por: Song, Xiaoyu, et al.
Publicado: (2025)
Shapley Value-based Contrastive Alignment for Multimodal Information Extraction
por: Luo, Wen, et al.
Publicado: (2024)
por: Luo, Wen, et al.
Publicado: (2024)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
Interpreting the linear structure of vision-language model embedding spaces
por: Papadimitriou, Isabel, et al.
Publicado: (2025)
por: Papadimitriou, Isabel, et al.
Publicado: (2025)
Hierarchical Aligned Multimodal Learning for NER on Tweet Posts
por: Liu, Peipei, et al.
Publicado: (2023)
por: Liu, Peipei, et al.
Publicado: (2023)
Can Prompting LLMs Unlock Hate Speech Detection across Languages? A Zero-shot and Few-shot Study
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
por: Wei, Jingxuan, et al.
Publicado: (2025)
por: Wei, Jingxuan, et al.
Publicado: (2025)
ResearchPulse: Building Method-Experiment Chains through Multi-Document Scientific Inference
por: Chen, Qi, et al.
Publicado: (2025)
por: Chen, Qi, et al.
Publicado: (2025)
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
por: Liu, Dancheng, et al.
Publicado: (2025)
por: Liu, Dancheng, et al.
Publicado: (2025)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
por: Chen, Yijing, et al.
Publicado: (2025)
por: Chen, Yijing, et al.
Publicado: (2025)
Multimodal Dialog Systems with Dual Knowledge-enhanced Generative Pretrained Language Model
por: Chen, Xiaolin, et al.
Publicado: (2022)
por: Chen, Xiaolin, et al.
Publicado: (2022)
SoMeLVLM: A Large Vision Language Model for Social Media Processing
por: Zhang, Xinnong, et al.
Publicado: (2024)
por: Zhang, Xinnong, et al.
Publicado: (2024)
Mixture-of-Prompt-Experts for Multi-modal Semantic Understanding
por: Wu, Zichen, et al.
Publicado: (2024)
por: Wu, Zichen, et al.
Publicado: (2024)
Lost in Overlap: Exploring Logit-based Watermark Collision in LLMs
por: Luo, Yiyang, et al.
Publicado: (2024)
por: Luo, Yiyang, et al.
Publicado: (2024)
Priority prediction of Asian Hornet sighting report using machine learning methods
por: Liu, Yixin, et al.
Publicado: (2021)
por: Liu, Yixin, et al.
Publicado: (2021)
Data-Efficient Hate Speech Detection via Cross-Lingual Nearest Neighbor Retrieval with Limited Labeled Data
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
por: Zhou, Ziya, et al.
Publicado: (2024)
por: Zhou, Ziya, et al.
Publicado: (2024)
MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
por: Peng, Yuezhang, et al.
Publicado: (2025)
por: Peng, Yuezhang, et al.
Publicado: (2025)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
por: Mei, Xinhao, et al.
Publicado: (2023)
por: Mei, Xinhao, et al.
Publicado: (2023)
Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis
por: Liu, Hao, et al.
Publicado: (2025)
por: Liu, Hao, et al.
Publicado: (2025)
Enhancing Multimodal Entity and Relation Extraction with Variational Information Bottleneck
por: Cui, Shiyao, et al.
Publicado: (2023)
por: Cui, Shiyao, et al.
Publicado: (2023)
Ejemplares similares
-
LoginMEA: Local-to-Global Interaction Network for Multi-modal Entity Alignment
por: Su, Taoyu, et al.
Publicado: (2024) -
Mitigating Modality Bias in Multi-modal Entity Alignment from a Causal Perspective
por: Su, Taoyu, et al.
Publicado: (2025) -
IBMEA: Exploring Variational Information Bottleneck for Multi-modal Entity Alignment
por: Su, Taoyu, et al.
Publicado: (2024) -
Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
por: Chen, Xiaolin, et al.
Publicado: (2025) -
Sentiment-enhanced Graph-based Sarcasm Explanation in Dialogue
por: Ouyang, Kun, et al.
Publicado: (2024)