VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Shiying, Qi, Xingqun, Yang, Bingkun, Weile, Chen, Tian, Zezhao, Sun, Muyi, Liu, Qifeng, Zhang, Man, Sun, Zhenan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
von: Hu, Yizhi, et al.
Veröffentlicht: (2025)
von: Hu, Yizhi, et al.
Veröffentlicht: (2025)
RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding
von: Sun, Muyi, et al.
Veröffentlicht: (2026)
von: Sun, Muyi, et al.
Veröffentlicht: (2026)
CustomListener: Text-guided Responsive Interaction for User-friendly Listening Head Generation
von: Liu, Xi, et al.
Veröffentlicht: (2024)
von: Liu, Xi, et al.
Veröffentlicht: (2024)
PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement
von: Hu, Teng, et al.
Veröffentlicht: (2025)
von: Hu, Teng, et al.
Veröffentlicht: (2025)
SemiTooth: a Generalizable Semi-supervised Framework for Multi-Source Tooth Segmentation
von: Sun, Muyi, et al.
Veröffentlicht: (2026)
von: Sun, Muyi, et al.
Veröffentlicht: (2026)
DanceEditor: Towards Iterative Editable Music-driven Dance Generation with Open-Vocabulary Descriptions
von: Zhang, Hengyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Hengyuan, et al.
Veröffentlicht: (2025)
GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization
von: Jin, Zhangyu, et al.
Veröffentlicht: (2026)
von: Jin, Zhangyu, et al.
Veröffentlicht: (2026)
DiTaiListener: Controllable High Fidelity Listener Video Generation with Diffusion
von: Siniukov, Maksim, et al.
Veröffentlicht: (2025)
von: Siniukov, Maksim, et al.
Veröffentlicht: (2025)
Let Storytelling Tell Vivid Stories: An Expressive and Fluent Multimodal Storyteller
von: Zang, Chuanqi, et al.
Veröffentlicht: (2024)
von: Zang, Chuanqi, et al.
Veröffentlicht: (2024)
Leveraging WaveNet for Dynamic Listening Head Modeling from Speech
von: Nguyen, Minh-Duc, et al.
Veröffentlicht: (2024)
von: Nguyen, Minh-Duc, et al.
Veröffentlicht: (2024)
PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction
von: Lin, Zhi-Yi, et al.
Veröffentlicht: (2026)
von: Lin, Zhi-Yi, et al.
Veröffentlicht: (2026)
Listening without Looking: Modality Bias in Audio-Visual Captioning
von: Ishikawa, Yuchi, et al.
Veröffentlicht: (2025)
von: Ishikawa, Yuchi, et al.
Veröffentlicht: (2025)
EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents
von: Zhang, Yu, et al.
Veröffentlicht: (2026)
von: Zhang, Yu, et al.
Veröffentlicht: (2026)
Let Your Video Listen to Your Music!
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
von: Lin, Haokun, et al.
Veröffentlicht: (2024)
von: Lin, Haokun, et al.
Veröffentlicht: (2024)
Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering
von: Ma, Jie, et al.
Veröffentlicht: (2024)
von: Ma, Jie, et al.
Veröffentlicht: (2024)
Listener-Rewarded Thinking in VLMs for Image Preferences
von: Gambashidze, Alexander, et al.
Veröffentlicht: (2025)
von: Gambashidze, Alexander, et al.
Veröffentlicht: (2025)
Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation
von: Lai, Bolin, et al.
Veröffentlicht: (2023)
von: Lai, Bolin, et al.
Veröffentlicht: (2023)
End-to-end Listen, Look, Speak and Act
von: Wang, Siyin, et al.
Veröffentlicht: (2025)
von: Wang, Siyin, et al.
Veröffentlicht: (2025)
Co$^{3}$Gesture: Towards Coherent Concurrent Co-speech 3D Gesture Generation with Interactive Diffusion
von: Qi, Xingqun, et al.
Veröffentlicht: (2025)
von: Qi, Xingqun, et al.
Veröffentlicht: (2025)
VeS: Teaching Pixels to Listen Without Supervision
von: Raj, Sajay
Veröffentlicht: (2025)
von: Raj, Sajay
Veröffentlicht: (2025)
MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation
von: Lin, Yukang, et al.
Veröffentlicht: (2025)
von: Lin, Yukang, et al.
Veröffentlicht: (2025)
Listen Then See: Video Alignment with Speaker Attention
von: Agrawal, Aviral, et al.
Veröffentlicht: (2024)
von: Agrawal, Aviral, et al.
Veröffentlicht: (2024)
Aligned Better, Listen Better for Audio-Visual Large Language Models
von: Guo, Yuxin, et al.
Veröffentlicht: (2025)
von: Guo, Yuxin, et al.
Veröffentlicht: (2025)
NeuroCine: Decoding Vivid Video Sequences from Human Brain Activties
von: Sun, Jingyuan, et al.
Veröffentlicht: (2024)
von: Sun, Jingyuan, et al.
Veröffentlicht: (2024)
SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition
von: Liu, Hongda, et al.
Veröffentlicht: (2025)
von: Liu, Hongda, et al.
Veröffentlicht: (2025)
Vivid-ZOO: Multi-View Video Generation with Diffusion Model
von: Li, Bing, et al.
Veröffentlicht: (2024)
von: Li, Bing, et al.
Veröffentlicht: (2024)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
von: Long, Lin, et al.
Veröffentlicht: (2025)
von: Long, Lin, et al.
Veröffentlicht: (2025)
Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
von: Zhou, Weijie, et al.
Veröffentlicht: (2026)
von: Zhou, Weijie, et al.
Veröffentlicht: (2026)
HairDiffusion: Vivid Multi-Colored Hair Editing via Latent Diffusion
von: Zeng, Yu, et al.
Veröffentlicht: (2024)
von: Zeng, Yu, et al.
Veröffentlicht: (2024)
MusicInfuser: Making Video Diffusion Listen and Dance
von: Hong, Susung, et al.
Veröffentlicht: (2025)
von: Hong, Susung, et al.
Veröffentlicht: (2025)
Learning Disentangled Representation for One-shot Progressive Face Swapping
von: Li, Qi, et al.
Veröffentlicht: (2022)
von: Li, Qi, et al.
Veröffentlicht: (2022)
Graph and Skipped Transformer: Exploiting Spatial and Temporal Modeling Capacities for Efficient 3D Human Pose Estimation
von: Cui, Mengmeng, et al.
Veröffentlicht: (2024)
von: Cui, Mengmeng, et al.
Veröffentlicht: (2024)
VividDream: Generating 3D Scene with Ambient Dynamics
von: Lee, Yao-Chih, et al.
Veröffentlicht: (2024)
von: Lee, Yao-Chih, et al.
Veröffentlicht: (2024)
Listening to the Noise: Blind Denoising with Gibbs Diffusion
von: Heurtel-Depeiges, David, et al.
Veröffentlicht: (2024)
von: Heurtel-Depeiges, David, et al.
Veröffentlicht: (2024)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
von: Chu, Xuangeng, et al.
Veröffentlicht: (2025)
von: Chu, Xuangeng, et al.
Veröffentlicht: (2025)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
von: Zhu, Yixin, et al.
Veröffentlicht: (2026)
von: Zhu, Yixin, et al.
Veröffentlicht: (2026)
Architect: Generating Vivid and Interactive 3D Scenes with Hierarchical 2D Inpainting
von: Wang, Yian, et al.
Veröffentlicht: (2024)
von: Wang, Yian, et al.
Veröffentlicht: (2024)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
von: Korbar, Bruno, et al.
Veröffentlicht: (2024)
von: Korbar, Bruno, et al.
Veröffentlicht: (2024)
A-JEPA: Joint-Embedding Predictive Architecture Can Listen
von: Fei, Zhengcong, et al.
Veröffentlicht: (2023)
von: Fei, Zhengcong, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
von: Hu, Yizhi, et al.
Veröffentlicht: (2025) -
RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding
von: Sun, Muyi, et al.
Veröffentlicht: (2026) -
CustomListener: Text-guided Responsive Interaction for User-friendly Listening Head Generation
von: Liu, Xi, et al.
Veröffentlicht: (2024) -
PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement
von: Hu, Teng, et al.
Veröffentlicht: (2025) -
SemiTooth: a Generalizable Semi-supervised Framework for Multi-Source Tooth Segmentation
von: Sun, Muyi, et al.
Veröffentlicht: (2026)