Evaluation Before Generation: A Paradigm for Robust Multimodal Sentiment Analysis with Missing Modalities
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Rongfei, Zhang, Tingting, Shen, Xiaoyu, Zhang, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards a Robust Framework for Multimodal Hate Detection: A Study on Video vs. Image-based Content
por: Koushik, Girish A., et al.
Publicado: (2025)
por: Koushik, Girish A., et al.
Publicado: (2025)
Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy
por: Sutton, Matthew, et al.
Publicado: (2026)
por: Sutton, Matthew, et al.
Publicado: (2026)
Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis
por: Li, Jianing, et al.
Publicado: (2024)
por: Li, Jianing, et al.
Publicado: (2024)
Predicting When to Trust Vision-Language Models for Spatial Reasoning
por: Imran, Muhammad, et al.
Publicado: (2026)
por: Imran, Muhammad, et al.
Publicado: (2026)
Optimized Gradient Clipping for Noisy Label Learning
por: Ye, Xichen, et al.
Publicado: (2024)
por: Ye, Xichen, et al.
Publicado: (2024)
Transformer-Based Vector Font Classification Using Different Font Formats: TrueType versus PostScript
por: Fujioka, Takumu, et al.
Publicado: (2025)
por: Fujioka, Takumu, et al.
Publicado: (2025)
MDA: An Interpretable and Scalable Multi-Modal Fusion under Missing Modalities and Intrinsic Noise Conditions
por: Fan, Lin, et al.
Publicado: (2024)
por: Fan, Lin, et al.
Publicado: (2024)
Leveraging large multimodal models for audio-video deepfake detection: a pilot study
por: Cao, Songjun, et al.
Publicado: (2026)
por: Cao, Songjun, et al.
Publicado: (2026)
Correspondence of high-dimensional emotion structures elicited by video clips between humans and Multimodal LLMs
por: Asanuma, Haruka, et al.
Publicado: (2025)
por: Asanuma, Haruka, et al.
Publicado: (2025)
MIMIC-SR-ICD11: A Dataset for Narrative-Based Diagnosis
por: Wu, Yuexin, et al.
Publicado: (2025)
por: Wu, Yuexin, et al.
Publicado: (2025)
DROID: Dual Representation for Out-of-Scope Intent Detection
por: Rashwan, Wael, et al.
Publicado: (2025)
por: Rashwan, Wael, et al.
Publicado: (2025)
ZeShot-VQA: Zero-Shot Visual Question Answering Framework with Answer Mapping for Natural Disaster Damage Assessment
por: Karimi, Ehsan, et al.
Publicado: (2025)
por: Karimi, Ehsan, et al.
Publicado: (2025)
Prompt-Driven Building Footprint Extraction in Aerial Images with Offset-Building Model
por: Li, Kai, et al.
Publicado: (2023)
por: Li, Kai, et al.
Publicado: (2023)
Enhancing XR Auditory Realism via Multimodal Scene-Aware Acoustic Rendering
por: Xu, Tianyu, et al.
Publicado: (2025)
por: Xu, Tianyu, et al.
Publicado: (2025)
Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning
por: Ji, Binbin, et al.
Publicado: (2025)
por: Ji, Binbin, et al.
Publicado: (2025)
Listwise Direct Preference Optimization with Multi-Dimensional Preference Mixing
por: Sun, Yuhui, et al.
Publicado: (2025)
por: Sun, Yuhui, et al.
Publicado: (2025)
BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation
por: Yang, Qi, et al.
Publicado: (2026)
por: Yang, Qi, et al.
Publicado: (2026)
HalalBench: A Multilingual OCR Benchmark for Food Packaging Ingredient Extraction
por: Arief, Hasan
Publicado: (2026)
por: Arief, Hasan
Publicado: (2026)
A Lightweight Approach to Detection of AI-Generated Texts Using Stylometric Features
por: Aityan, Sergey K., et al.
Publicado: (2025)
por: Aityan, Sergey K., et al.
Publicado: (2025)
Classification of descriptions and summary using multiple passes of statistical and natural language toolkits
por: Banthia, Saumya, et al.
Publicado: (2020)
por: Banthia, Saumya, et al.
Publicado: (2020)
Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production
por: Gonzalez, Alberto Andres Valdes
Publicado: (2026)
por: Gonzalez, Alberto Andres Valdes
Publicado: (2026)
Computational Economics in Large Language Models: Exploring Model Behavior and Incentive Design under Resource Constraints
por: Reddy, Sandeep, et al.
Publicado: (2025)
por: Reddy, Sandeep, et al.
Publicado: (2025)
Logits-Constrained Framework with RoBERTa for Ancient Chinese NER
por: Hua, Wenjie, et al.
Publicado: (2025)
por: Hua, Wenjie, et al.
Publicado: (2025)
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
por: Yang, Baoyao, et al.
Publicado: (2025)
por: Yang, Baoyao, et al.
Publicado: (2025)
Accelerating Language Model Workflows with Prompt Choreography
por: Bai, TJ, et al.
Publicado: (2025)
por: Bai, TJ, et al.
Publicado: (2025)
GDDS: A Single Domain Generalized Defect Detection Frame of Open World Scenario using Gather and Distribute Domain-shift Suppression Network
por: Chen, Haiyong, et al.
Publicado: (2024)
por: Chen, Haiyong, et al.
Publicado: (2024)
Domain Adaptation of the Pyannote Diarization Pipeline for Conversational Indonesian Audio
por: Prasetyo, Muhammad Daffa'i Rafi, et al.
Publicado: (2026)
por: Prasetyo, Muhammad Daffa'i Rafi, et al.
Publicado: (2026)
GAEA: A Geolocation Aware Conversational Assistant
por: Campos, Ron, et al.
Publicado: (2025)
por: Campos, Ron, et al.
Publicado: (2025)
Sign language recognition based on deep learning and low-cost handcrafted descriptors
por: Carneiro, Alvaro Leandro Cavalcante, et al.
Publicado: (2024)
por: Carneiro, Alvaro Leandro Cavalcante, et al.
Publicado: (2024)
Transparent but Powerful: Explainability, Accuracy, and Generalizability in ADHD Detection from Social Media Data
por: Wiechmann, D., et al.
Publicado: (2024)
por: Wiechmann, D., et al.
Publicado: (2024)
Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory
por: Cacioli, Jon-Paul
Publicado: (2026)
por: Cacioli, Jon-Paul
Publicado: (2026)
Expertized Caption Auto-Enhancement for Video-Text Retrieval
por: Yang, Baoyao, et al.
Publicado: (2025)
por: Yang, Baoyao, et al.
Publicado: (2025)
Enhancing Diffusion Model Guidance through Calibration and Regularization
por: Javid, Seyed Alireza, et al.
Publicado: (2025)
por: Javid, Seyed Alireza, et al.
Publicado: (2025)
MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR
por: Xu, Tianyu, et al.
Publicado: (2026)
por: Xu, Tianyu, et al.
Publicado: (2026)
Semantic Superiority vs. Forensic Efficiency: A Comparative Analysis of Deep Learning and Psycholinguistics for Business Email Compromise Detection
por: Adjei, Yaw Osei, et al.
Publicado: (2025)
por: Adjei, Yaw Osei, et al.
Publicado: (2025)
Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent
por: Yasuno, Takato
Publicado: (2026)
por: Yasuno, Takato
Publicado: (2026)
A Semantic Approach to Negation Detection and Word Disambiguation with Natural Language Processing
por: Okpala, Izunna, et al.
Publicado: (2023)
por: Okpala, Izunna, et al.
Publicado: (2023)
Semantic Reconstruction of Adversarial Plagiarism: A Context-Aware Framework for Detecting and Restoring "Tortured Phrases" in Scientific Literature
por: Maiti, Agniva, et al.
Publicado: (2025)
por: Maiti, Agniva, et al.
Publicado: (2025)
R-Genie: Reasoning-Guided Generative Image Editing
por: Zhang, Dong, et al.
Publicado: (2025)
por: Zhang, Dong, et al.
Publicado: (2025)
Nonlinear Noise2Noise for Efficient Monte Carlo Denoiser Training
por: Tinits, Andrew, et al.
Publicado: (2025)
por: Tinits, Andrew, et al.
Publicado: (2025)
Ejemplares similares
-
Towards a Robust Framework for Multimodal Hate Detection: A Study on Video vs. Image-based Content
por: Koushik, Girish A., et al.
Publicado: (2025) -
Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy
por: Sutton, Matthew, et al.
Publicado: (2026) -
Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis
por: Li, Jianing, et al.
Publicado: (2024) -
Predicting When to Trust Vision-Language Models for Spatial Reasoning
por: Imran, Muhammad, et al.
Publicado: (2026) -
Optimized Gradient Clipping for Noisy Label Learning
por: Ye, Xichen, et al.
Publicado: (2024)