PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Zhi-Yi, Markhorst, Thomas, Chew, Jouh Yeong, Zhang, Xucong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MuPPet: Multi-person 2D-to-3D Pose Lifting
par: Markhorst, Thomas, et autres
Publié: (2026)
par: Markhorst, Thomas, et autres
Publié: (2026)
GazeHTA: End-to-end Gaze Target Detection with Head-Target Association
par: Lin, Zhi-Yi, et autres
Publié: (2024)
par: Lin, Zhi-Yi, et autres
Publié: (2024)
EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents
par: Zhang, Yu, et autres
Publié: (2026)
par: Zhang, Yu, et autres
Publié: (2026)
Ready-to-React: Online Reaction Policy for Two-Character Interaction Generation
par: Cen, Zhi, et autres
Publié: (2025)
par: Cen, Zhi, et autres
Publié: (2025)
3D Kinematics Estimation from Video with a Biomechanical Model and Synthetic Training Data
par: Lin, Zhi-Yi, et autres
Publié: (2024)
par: Lin, Zhi-Yi, et autres
Publié: (2024)
UniGaze: Towards Universal Gaze Estimation via Large-scale Pre-Training
par: Qin, Jiawei, et autres
Publié: (2025)
par: Qin, Jiawei, et autres
Publié: (2025)
VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction
par: Li, Shiying, et autres
Publié: (2025)
par: Li, Shiying, et autres
Publié: (2025)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
par: Chu, Xuangeng, et autres
Publié: (2025)
par: Chu, Xuangeng, et autres
Publié: (2025)
AttentionLut: Attention Fusion-based Canonical Polyadic LUT for Real-time Image Enhancement
par: Fu, Kang, et autres
Publié: (2024)
par: Fu, Kang, et autres
Publié: (2024)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
par: Long, Lin, et autres
Publié: (2025)
par: Long, Lin, et autres
Publié: (2025)
Interactive Humanoid: Online Full-Body Motion Reaction Synthesis with Social Affordance Canonicalization and Forecasting
par: Liu, Yunze, et autres
Publié: (2023)
par: Liu, Yunze, et autres
Publié: (2023)
End-to-end Listen, Look, Speak and Act
par: Wang, Siyin, et autres
Publié: (2025)
par: Wang, Siyin, et autres
Publié: (2025)
Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis
par: Liu, Miao, et autres
Publié: (2026)
par: Liu, Miao, et autres
Publié: (2026)
Domain-Adaptive Full-Face Gaze Estimation via Novel-View-Synthesis and Feature Disentanglement
par: Qin, Jiawei, et autres
Publié: (2023)
par: Qin, Jiawei, et autres
Publié: (2023)
PrivateGaze: Preserving User Privacy in Black-box Mobile Gaze Tracking Services
par: Du, Lingyu, et autres
Publié: (2024)
par: Du, Lingyu, et autres
Publié: (2024)
Pushing Joint Image Denoising and Classification to the Edge
par: Markhorst, Thomas C, et autres
Publié: (2024)
par: Markhorst, Thomas C, et autres
Publié: (2024)
MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation
par: Zhou, Bohan, et autres
Publié: (2025)
par: Zhou, Bohan, et autres
Publié: (2025)
Beyond Words: Multimodal LLM Knows When to Speak
par: Liao, Zikai, et autres
Publié: (2025)
par: Liao, Zikai, et autres
Publié: (2025)
CASHG: Context-Aware Stylized Online Handwriting Generation
par: Shin, Jinsu, et autres
Publié: (2026)
par: Shin, Jinsu, et autres
Publié: (2026)
GGPT: Geometry Grounded Point Transformer
par: Chen, Yutong, et autres
Publié: (2026)
par: Chen, Yutong, et autres
Publié: (2026)
Multimodal Information Interaction for Medical Image Segmentation
par: Fan, Xinxin, et autres
Publié: (2024)
par: Fan, Xinxin, et autres
Publié: (2024)
CustomListener: Text-guided Responsive Interaction for User-friendly Listening Head Generation
par: Liu, Xi, et autres
Publié: (2024)
par: Liu, Xi, et autres
Publié: (2024)
PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement
par: Hu, Teng, et autres
Publié: (2025)
par: Hu, Teng, et autres
Publié: (2025)
Poly-Autoregressive Prediction for Modeling Interactions
par: Thakkar, Neerja, et autres
Publié: (2025)
par: Thakkar, Neerja, et autres
Publié: (2025)
Defending Text-to-image Diffusion Models: Surprising Efficacy of Textual Perturbations Against Backdoor Attacks
par: Chew, Oscar, et autres
Publié: (2024)
par: Chew, Oscar, et autres
Publié: (2024)
ReactFace: Online Multiple Appropriate Facial Reaction Generation in Dyadic Interactions
par: Luo, Cheng, et autres
Publié: (2023)
par: Luo, Cheng, et autres
Publié: (2023)
HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation
par: Huang, Ziyao, et autres
Publié: (2025)
par: Huang, Ziyao, et autres
Publié: (2025)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
par: Lin, Junyan, et autres
Publié: (2026)
par: Lin, Junyan, et autres
Publié: (2026)
GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization
par: Jin, Zhangyu, et autres
Publié: (2026)
par: Jin, Zhangyu, et autres
Publié: (2026)
ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
par: Tan, Jiangtong, et autres
Publié: (2025)
par: Tan, Jiangtong, et autres
Publié: (2025)
ViSpeak: Visual Instruction Feedback in Streaming Videos
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
PointCubeNet: 3D Part-level Reasoning with 3x3x3 Point Cloud Blocks
par: Kim, Da-Yeong, et autres
Publié: (2025)
par: Kim, Da-Yeong, et autres
Publié: (2025)
DANCE: Density-agnostic and Class-aware Network for Point Cloud Completion
par: Kim, Da-Yeong, et autres
Publié: (2025)
par: Kim, Da-Yeong, et autres
Publié: (2025)
VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
Gaze-Guided 3D Hand Motion Prediction for Detecting Intent in Egocentric Grasping Tasks
par: He, Yufei, et autres
Publié: (2025)
par: He, Yufei, et autres
Publié: (2025)
OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
par: Luo, Cheng, et autres
Publié: (2025)
par: Luo, Cheng, et autres
Publié: (2025)
Speak, Segment, Track, Navigate: An Interactive System for Video-Guided Skull-Base Surgery
par: Mao, Jecia Z. Y., et autres
Publié: (2026)
par: Mao, Jecia Z. Y., et autres
Publié: (2026)
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
par: Huang, Zhipeng, et autres
Publié: (2025)
par: Huang, Zhipeng, et autres
Publié: (2025)
Decoupling Layout from Glyph in Online Chinese Handwriting Generation
par: Ren, Min-Si, et autres
Publié: (2024)
par: Ren, Min-Si, et autres
Publié: (2024)
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
par: Zhou, Donghao, et autres
Publié: (2026)
par: Zhou, Donghao, et autres
Publié: (2026)
Documents similaires
-
MuPPet: Multi-person 2D-to-3D Pose Lifting
par: Markhorst, Thomas, et autres
Publié: (2026) -
GazeHTA: End-to-end Gaze Target Detection with Head-Target Association
par: Lin, Zhi-Yi, et autres
Publié: (2024) -
EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents
par: Zhang, Yu, et autres
Publié: (2026) -
Ready-to-React: Online Reaction Policy for Two-Character Interaction Generation
par: Cen, Zhi, et autres
Publié: (2025) -
3D Kinematics Estimation from Video with a Biomechanical Model and Synthetic Training Data
par: Lin, Zhi-Yi, et autres
Publié: (2024)