BI-MDRG: Bridging Image History in Multimodal Dialogue Response Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yoon, Hee Suk, Yoon, Eunseop, Tee, Joshua Tian Jin, Zhang, Kang, Heo, Yu-Jung, Chang, Du-Seong, Yoo, Chang D. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ESD: Expected Squared Difference as a Tuning-Free Trainable Calibration Measure
par: Yoon, Hee Suk, et autres
Publié: (2023)
par: Yoon, Hee Suk, et autres
Publié: (2023)
C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion
par: Yoon, Hee Suk, et autres
Publié: (2024)
par: Yoon, Hee Suk, et autres
Publié: (2024)
HEAR: Hearing Enhanced Audio Response for Video-grounded Dialogue
par: Yoon, Sunjae, et autres
Publié: (2023)
par: Yoon, Sunjae, et autres
Publié: (2023)
HiQuE: Hierarchical Question Embedding Network for Multimodal Depression Detection
par: Jung, Juho, et autres
Publié: (2024)
par: Jung, Juho, et autres
Publié: (2024)
SimPSI: A Simple Strategy to Preserve Spectral Information in Time Series Data Augmentation
par: Ryu, Hyun, et autres
Publié: (2023)
par: Ryu, Hyun, et autres
Publié: (2023)
From Natural Alignment to Conditional Controllability in Multimodal Dialogue
par: Jin, Zeyu, et autres
Publié: (2026)
par: Jin, Zeyu, et autres
Publié: (2026)
Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models
par: Yoon, Eunseop, et autres
Publié: (2025)
par: Yoon, Eunseop, et autres
Publié: (2025)
LI-TTA: Language Informed Test-Time Adaptation for Automatic Speech Recognition
par: Yoon, Eunseop, et autres
Publié: (2024)
par: Yoon, Eunseop, et autres
Publié: (2024)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
par: Yoon, Hee Suk, et autres
Publié: (2025)
par: Yoon, Hee Suk, et autres
Publié: (2025)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
par: Cao, Jiajun, et autres
Publié: (2025)
par: Cao, Jiajun, et autres
Publié: (2025)
Forensic analysis of video data deletion and recovery in Honeywell surveillance file system
par: Yoon, Jinhee, et autres
Publié: (2026)
par: Yoon, Jinhee, et autres
Publié: (2026)
Interpreting Multimodal Communication at Scale in Short-Form Video: Visual, Audio, and Textual Mental Health Discourse on TikTok
par: Zha, Mingyue, et autres
Publié: (2026)
par: Zha, Mingyue, et autres
Publié: (2026)
Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction
par: Zhou, Baohang, et autres
Publié: (2026)
par: Zhou, Baohang, et autres
Publié: (2026)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2024)
par: Zhang, Bo, et autres
Publié: (2024)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
par: Tong, Haonan, et autres
Publié: (2024)
par: Tong, Haonan, et autres
Publié: (2024)
Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web
par: Heo, Ryang, et autres
Publié: (2026)
par: Heo, Ryang, et autres
Publié: (2026)
DAT: Dual-Aware Adaptive Transmission for Efficient Multimodal LLM Inference in Edge-Cloud Systems
par: Guo, Qi, et autres
Publié: (2026)
par: Guo, Qi, et autres
Publié: (2026)
PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search
par: Hu, Pengfei, et autres
Publié: (2025)
par: Hu, Pengfei, et autres
Publié: (2025)
Bridging Discrete and Continuous: A Multimodal Strategy for Complex Emotion Detection
par: Jia, Jiehui, et autres
Publié: (2024)
par: Jia, Jiehui, et autres
Publié: (2024)
Language-Guided Multimodal Texture Authoring via Generative Models
par: Qian, Wanli, et autres
Publié: (2026)
par: Qian, Wanli, et autres
Publié: (2026)
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
par: Zhang, Han, et autres
Publié: (2025)
par: Zhang, Han, et autres
Publié: (2025)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
par: Yoon, Sunjae, et autres
Publié: (2022)
par: Yoon, Sunjae, et autres
Publié: (2022)
Physics Informed Distillation for Diffusion Models
par: Tee, Joshua Tian Jin, et autres
Publié: (2024)
par: Tee, Joshua Tian Jin, et autres
Publié: (2024)
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
par: Jin, Hyundong, et autres
Publié: (2025)
par: Jin, Hyundong, et autres
Publié: (2025)
Designing a Multimodal Viewer for Piano Performance Analysis -- a Pedagogy-First Approach
par: Bae, Joonhyung, et autres
Publié: (2025)
par: Bae, Joonhyung, et autres
Publié: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
par: Zhou, Yang-Hao, et autres
Publié: (2026)
par: Zhou, Yang-Hao, et autres
Publié: (2026)
MIDI-LLM: Adapting Large Language Models for Text-to-MIDI Music Generation
par: Wu, Shih-Lun, et autres
Publié: (2025)
par: Wu, Shih-Lun, et autres
Publié: (2025)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
Learning Shared Sentiment Prototypes for Adaptive Multimodal Sentiment Analysis
par: Su, Chen, et autres
Publié: (2026)
par: Su, Chen, et autres
Publié: (2026)
AdaMER-CTC: Connectionist Temporal Classification with Adaptive Maximum Entropy Regularization for Automatic Speech Recognition
par: Eom, SooHwan, et autres
Publié: (2024)
par: Eom, SooHwan, et autres
Publié: (2024)
A Survey on Image-text Multimodal Models
par: Guo, Ruifeng, et autres
Publié: (2023)
par: Guo, Ruifeng, et autres
Publié: (2023)
High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding
par: Hong, Ji Woo, et autres
Publié: (2026)
par: Hong, Ji Woo, et autres
Publié: (2026)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
par: E, Shaojun, et autres
Publié: (2025)
par: E, Shaojun, et autres
Publié: (2025)
Multimodal Pretraining, Adaptation, and Generation for Recommendation: A Survey
par: Liu, Qijiong, et autres
Publié: (2024)
par: Liu, Qijiong, et autres
Publié: (2024)
Modeling Human Responses to Multimodal AI Content
par: Shen, Zhiqi, et autres
Publié: (2025)
par: Shen, Zhiqi, et autres
Publié: (2025)
Simple but Effective Raw-Data Level Multimodal Fusion for Composed Image Retrieval
par: Wen, Haokun, et autres
Publié: (2024)
par: Wen, Haokun, et autres
Publié: (2024)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
par: Zhang, Juan, et autres
Publié: (2024)
par: Zhang, Juan, et autres
Publié: (2024)
Analyzing Recursiveness in Multimodal Generative Artificial Intelligence: Stability or Divergence?
par: Conde, Javier, et autres
Publié: (2024)
par: Conde, Javier, et autres
Publié: (2024)
Bridging Compressed Image Latents and Multimodal Large Language Models
par: Kao, Chia-Hao, et autres
Publié: (2024)
par: Kao, Chia-Hao, et autres
Publié: (2024)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026)
par: Bai, Hayes, et autres
Publié: (2026)
Documents similaires
-
ESD: Expected Squared Difference as a Tuning-Free Trainable Calibration Measure
par: Yoon, Hee Suk, et autres
Publié: (2023) -
C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion
par: Yoon, Hee Suk, et autres
Publié: (2024) -
HEAR: Hearing Enhanced Audio Response for Video-grounded Dialogue
par: Yoon, Sunjae, et autres
Publié: (2023) -
HiQuE: Hierarchical Question Embedding Network for Multimodal Depression Detection
par: Jung, Juho, et autres
Publié: (2024) -
SimPSI: A Simple Strategy to Preserve Spectral Information in Time Series Data Augmentation
par: Ryu, Hyun, et autres
Publié: (2023)