From Natural Alignment to Conditional Controllability in Multimodal Dialogue
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jin, Zeyu, Zhou, Songtao, Wang, Haoyu, Tian, Minghao, Yun, Kaifeng, Chen, Zhuo, Qin, Xiaoyu, Jia, Jia |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
par: Jin, Zeyu, et autres
Publié: (2026)
par: Jin, Zeyu, et autres
Publié: (2026)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
par: Jin, Zeyu, et autres
Publié: (2024)
par: Jin, Zeyu, et autres
Publié: (2024)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
MInD: Improving Multimodal Sentiment Analysis via Multimodal Information Disentanglement
par: Dai, Weichen, et autres
Publié: (2024)
par: Dai, Weichen, et autres
Publié: (2024)
Bridging Discrete and Continuous: A Multimodal Strategy for Complex Emotion Detection
par: Jia, Jiehui, et autres
Publié: (2024)
par: Jia, Jiehui, et autres
Publié: (2024)
Stage Light is Sequence$^2$: Multi-Light Control via Imitation Learning
par: Zhao, Zijian, et autres
Publié: (2026)
par: Zhao, Zijian, et autres
Publié: (2026)
BI-MDRG: Bridging Image History in Multimodal Dialogue Response Generation
par: Yoon, Hee Suk, et autres
Publié: (2024)
par: Yoon, Hee Suk, et autres
Publié: (2024)
Orthogonal Disentanglement with Projected Feature Alignment for Multimodal Emotion Recognition in Conversation
par: Che, Xinyi, et autres
Publié: (2025)
par: Che, Xinyi, et autres
Publié: (2025)
Multimodal Interaction Modeling via Self-Supervised Multi-Task Learning for Review Helpfulness Prediction
par: Gong, HongLin, et autres
Publié: (2024)
par: Gong, HongLin, et autres
Publié: (2024)
MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production
par: Hu, Huanran, et autres
Publié: (2026)
par: Hu, Huanran, et autres
Publié: (2026)
CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation
par: Zhu, Xiaofei, et autres
Publié: (2024)
par: Zhu, Xiaofei, et autres
Publié: (2024)
Learning Shared Sentiment Prototypes for Adaptive Multimodal Sentiment Analysis
par: Su, Chen, et autres
Publié: (2026)
par: Su, Chen, et autres
Publié: (2026)
ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
ISMAF: Intrinsic-Social Modality Alignment and Fusion for Multimodal Rumor Detection
par: Yu, Zihao, et autres
Publié: (2025)
par: Yu, Zihao, et autres
Publié: (2025)
From ID-based to ID-free: Rethinking ID Effectiveness in Multimodal Collaborative Filtering Recommendation
par: Li, Guohao, et autres
Publié: (2025)
par: Li, Guohao, et autres
Publié: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
par: Zhou, Yang-Hao, et autres
Publié: (2026)
par: Zhou, Yang-Hao, et autres
Publié: (2026)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2024)
par: Zhang, Bo, et autres
Publié: (2024)
Multimodal Unlearnable Examples: Protecting Data against Multimodal Contrastive Learning
par: Liu, Xinwei, et autres
Publié: (2024)
par: Liu, Xinwei, et autres
Publié: (2024)
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides
par: Zhao, Jinghua, et autres
Publié: (2025)
par: Zhao, Jinghua, et autres
Publié: (2025)
Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction
par: Zhou, Baohang, et autres
Publié: (2026)
par: Zhou, Baohang, et autres
Publié: (2026)
EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations
par: Song, Qiya, et autres
Publié: (2025)
par: Song, Qiya, et autres
Publié: (2025)
Towards Robust Multimodal Sentiment Analysis with Incomplete Data
par: Zhang, Haoyu, et autres
Publié: (2024)
par: Zhang, Haoyu, et autres
Publié: (2024)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
par: Wen, Haokun, et autres
Publié: (2026)
par: Wen, Haokun, et autres
Publié: (2026)
Listening to the Unspoken: Exploring "365" Aspects of Multimodal Interview Performance Assessment
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
Concept Drift Guided LayerNorm Tuning for Efficient Multimodal Metaphor Identification
par: Qian, Wenhao, et autres
Publié: (2025)
par: Qian, Wenhao, et autres
Publié: (2025)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
par: Qiu, Ke, et autres
Publié: (2026)
par: Qiu, Ke, et autres
Publié: (2026)
Multimodal Classification and Out-of-distribution Detection for Multimodal Intent Understanding
par: Zhang, Hanlei, et autres
Publié: (2024)
par: Zhang, Hanlei, et autres
Publié: (2024)
Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment
par: Zeng, Delong, et autres
Publié: (2026)
par: Zeng, Delong, et autres
Publié: (2026)
To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance
par: Fang, Wanlong, et autres
Publié: (2025)
par: Fang, Wanlong, et autres
Publié: (2025)
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
par: Wang, Yongqi, et autres
Publié: (2025)
par: Wang, Yongqi, et autres
Publié: (2025)
Multimodal Emotion Recognition with Large Language Models
par: Zhang, Hongrui, et autres
Publié: (2026)
par: Zhang, Hongrui, et autres
Publié: (2026)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Multimodal Graph-Based Variational Mixture of Experts Network for Zero-Shot Multimodal Information Extraction
par: Zhou, Baohang, et autres
Publié: (2025)
par: Zhou, Baohang, et autres
Publié: (2025)
Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding
par: Pan, Zhaoyan, et autres
Publié: (2026)
par: Pan, Zhaoyan, et autres
Publié: (2026)
Dark Side of Modalities: Reinforced Multimodal Distillation for Multimodal Knowledge Graph Reasoning
par: Zhao, Yu, et autres
Publié: (2025)
par: Zhao, Yu, et autres
Publié: (2025)
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation
par: Zhao, Yuan, et autres
Publié: (2026)
par: Zhao, Yuan, et autres
Publié: (2026)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
par: Zhou, Qianrui, et autres
Publié: (2026)
par: Zhou, Qianrui, et autres
Publié: (2026)
Documents similaires
-
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
par: Jin, Zeyu, et autres
Publié: (2026) -
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
par: Jin, Zeyu, et autres
Publié: (2024) -
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
par: Wang, Zixuan, et autres
Publié: (2024) -
MInD: Improving Multimodal Sentiment Analysis via Multimodal Information Disentanglement
par: Dai, Weichen, et autres
Publié: (2024) -
Bridging Discrete and Continuous: A Multimodal Strategy for Complex Emotion Detection
par: Jia, Jiehui, et autres
Publié: (2024)