Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Yeonju, Park, Se Jin, Ro, Yong Man |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
par: Choi, Jeongsoo, et autres
Publié: (2023)
par: Choi, Jeongsoo, et autres
Publié: (2023)
CODE: Contrasting Self-generated Description to Combat Hallucination in Large Multi-modal Models
par: Kim, Junho, et autres
Publié: (2024)
par: Kim, Junho, et autres
Publié: (2024)
Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
par: Lee, Hosu, et autres
Publié: (2025)
par: Lee, Hosu, et autres
Publié: (2025)
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
par: Park, Se Jin, et autres
Publié: (2023)
par: Park, Se Jin, et autres
Publié: (2023)
SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis
par: Kim, Junho, et autres
Publié: (2024)
par: Kim, Junho, et autres
Publié: (2024)
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
par: Choi, Jeongsoo, et autres
Publié: (2023)
par: Choi, Jeongsoo, et autres
Publié: (2023)
What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models
par: Kim, Junho, et autres
Publié: (2024)
par: Kim, Junho, et autres
Publié: (2024)
Visual Speech Recognition for Languages with Limited Labeled Data using Automatic Labels from Whisper
par: Yeo, Jeong Hun, et autres
Publié: (2023)
par: Yeo, Jeong Hun, et autres
Publié: (2023)
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
par: Kim, Junho, et autres
Publié: (2026)
par: Kim, Junho, et autres
Publié: (2026)
Causal Unsupervised Semantic Segmentation
par: Kim, Junho, et autres
Publié: (2023)
par: Kim, Junho, et autres
Publié: (2023)
Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing
par: Lee, Hosu, et autres
Publié: (2024)
par: Lee, Hosu, et autres
Publié: (2024)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
par: Wang, Huanyu, et autres
Publié: (2025)
par: Wang, Huanyu, et autres
Publié: (2025)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
par: Park, Sungjune, et autres
Publié: (2025)
par: Park, Sungjune, et autres
Publié: (2025)
Visual Preference Optimization with Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection
par: Park, Sungjune, et autres
Publié: (2023)
par: Park, Sungjune, et autres
Publié: (2023)
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
par: Li, Yuanshuai, et autres
Publié: (2025)
par: Li, Yuanshuai, et autres
Publié: (2025)
Prompt Tuning of Deep Neural Networks for Speaker-adaptive Visual Speech Recognition
par: Kim, Minsu, et autres
Publié: (2023)
par: Kim, Minsu, et autres
Publié: (2023)
MambaEye: A Size-Agnostic Visual Encoder with Causal Sequential Processing
par: Choi, Changho, et autres
Publié: (2025)
par: Choi, Changho, et autres
Publié: (2025)
ViPO: Visual Preference Optimization at Scale
par: Li, Ming, et autres
Publié: (2026)
par: Li, Ming, et autres
Publié: (2026)
SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization
par: Ahn, Young Jin, et autres
Publié: (2024)
par: Ahn, Young Jin, et autres
Publié: (2024)
Contribution-based Low-Rank Adaptation with Pre-training Model for Real Image Restoration
par: Park, Donwon, et autres
Publié: (2024)
par: Park, Donwon, et autres
Publié: (2024)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
par: Kim, Minsu, et autres
Publié: (2024)
par: Kim, Minsu, et autres
Publié: (2024)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
par: Park, Kyu Ri, et autres
Publié: (2024)
par: Park, Kyu Ri, et autres
Publié: (2024)
Semi-Supervised Audio-Visual Video Action Recognition with Audio Source Localization Guided Mixup
par: Kang, Seokun, et autres
Publié: (2025)
par: Kang, Seokun, et autres
Publié: (2025)
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
par: Lee, Byung-Kwan, et autres
Publié: (2024)
par: Lee, Byung-Kwan, et autres
Publié: (2024)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
par: Kim, Sohee, et autres
Publié: (2025)
par: Kim, Sohee, et autres
Publié: (2025)
Gather-Scatter Mamba: Accelerating Propagation with Efficient State Space Model
par: Ko, Hyun-kyu, et autres
Publié: (2025)
par: Ko, Hyun-kyu, et autres
Publié: (2025)
REPrune: Channel Pruning via Kernel Representative Selection
par: Park, Mincheol, et autres
Publié: (2024)
par: Park, Mincheol, et autres
Publié: (2024)
COLI: A Hierarchical Efficient Compressor for Large Images
par: Wang, Haoran, et autres
Publié: (2025)
par: Wang, Haoran, et autres
Publié: (2025)
VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation
par: Li, Mengtian, et autres
Publié: (2026)
par: Li, Mengtian, et autres
Publié: (2026)
Selective Visual Prompting in Vision Mamba
par: Yao, Yifeng, et autres
Publié: (2024)
par: Yao, Yifeng, et autres
Publié: (2024)
Imagery as Inquiry: Exploring A Multimodal Dataset for Conversational Recommendation
par: Yoon, Se-eun, et autres
Publié: (2024)
par: Yoon, Se-eun, et autres
Publié: (2024)
V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models
par: Kim, Jisoo, et autres
Publié: (2025)
par: Kim, Jisoo, et autres
Publié: (2025)
Synergistic Integration of Coordinate Network and Tensorial Feature for Improving Neural Radiance Fields from Sparse Inputs
par: Kim, Mingyu, et autres
Publié: (2024)
par: Kim, Mingyu, et autres
Publié: (2024)
LPOI: Listwise Preference Optimization for Vision Language Models
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking
par: Chung, Sangyun, et autres
Publié: (2024)
par: Chung, Sangyun, et autres
Publié: (2024)
Documents similaires
-
AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues
par: Park, Se Jin, et autres
Publié: (2024) -
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
par: Choi, Jeongsoo, et autres
Publié: (2023) -
CODE: Contrasting Self-generated Description to Combat Hallucination in Large Multi-modal Models
par: Kim, Junho, et autres
Publié: (2024) -
Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation
par: Park, Se Jin, et autres
Publié: (2024) -
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
par: Lee, Hosu, et autres
Publié: (2025)