Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
Fuente:
arXiv
Salvato in:
| Autori principali: | Tong, Haonan, Li, Haopeng, Du, Hongyang, Yang, Zhaohui, Yin, Changchuan, Niyato, Dusit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
di: Chen, Zehao, et al.
Pubblicazione: (2025)
di: Chen, Zehao, et al.
Pubblicazione: (2025)
Language-oriented Semantic Communication for Image Transmission with Fine-Tuned Diffusion Model
di: Wei, Xinfeng, et al.
Pubblicazione: (2024)
di: Wei, Xinfeng, et al.
Pubblicazione: (2024)
Video Semantic Communication with Major Object Extraction and Contextual Video Encoding
di: Li, Haopeng, et al.
Pubblicazione: (2024)
di: Li, Haopeng, et al.
Pubblicazione: (2024)
Semantic Item Graph Enhancement for Multimodal Recommendation
di: Zhang, Xiaoxiong, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoxiong, et al.
Pubblicazione: (2025)
HeadsetOff: Enabling Photorealistic Video Conferencing on Economical VR Headsets
di: Jin, Yili, et al.
Pubblicazione: (2024)
di: Jin, Yili, et al.
Pubblicazione: (2024)
Loss-resilient Coding of Texture and Depth for Free-viewpoint Video Conferencing
di: Macchiavello, Bruno, et al.
Pubblicazione: (2013)
di: Macchiavello, Bruno, et al.
Pubblicazione: (2013)
Learning Item Representations Directly from Multimodal Features for Effective Recommendation
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
Token Communications: A Large Model-Driven Framework for Cross-modal Context-aware Semantic Communications
di: Qiao, Li, et al.
Pubblicazione: (2025)
di: Qiao, Li, et al.
Pubblicazione: (2025)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
di: Chen, Gehui, et al.
Pubblicazione: (2024)
di: Chen, Gehui, et al.
Pubblicazione: (2024)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
Generative AI-enabled Mobile Tactical Multimedia Networks: Distribution, Generation, and Perception
di: Xu, Minrui, et al.
Pubblicazione: (2024)
di: Xu, Minrui, et al.
Pubblicazione: (2024)
Interpreting Multimodal Communication at Scale in Short-Form Video: Visual, Audio, and Textual Mental Health Discourse on TikTok
di: Zha, Mingyue, et al.
Pubblicazione: (2026)
di: Zha, Mingyue, et al.
Pubblicazione: (2026)
VineetVC: Adaptive Video Conferencing Under Severe Bandwidth Constraints Using Audio-Driven Talking-Head Reconstruction
di: Rakesh, Vineet Kumar, et al.
Pubblicazione: (2026)
di: Rakesh, Vineet Kumar, et al.
Pubblicazione: (2026)
Tile-Weighted Rate-Distortion Optimized Packet Scheduling for 360$^\circ$ VR Video Streaming
di: Wang, Haopeng, et al.
Pubblicazione: (2024)
di: Wang, Haopeng, et al.
Pubblicazione: (2024)
Lightweight Call Signaling and Peer-to-Peer Control of WebRTC Video Conferencing
di: Singh, Kundan
Pubblicazione: (2026)
di: Singh, Kundan
Pubblicazione: (2026)
Enhancing Video Music Recommendation with Transformer-Driven Audio-Visual Embeddings
di: Liu, Shimiao, et al.
Pubblicazione: (2025)
di: Liu, Shimiao, et al.
Pubblicazione: (2025)
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
di: Yang, An, et al.
Pubblicazione: (2025)
di: Yang, An, et al.
Pubblicazione: (2025)
QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
di: Lin, Zixing, et al.
Pubblicazione: (2026)
di: Lin, Zixing, et al.
Pubblicazione: (2026)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
di: Li, Yaoru, et al.
Pubblicazione: (2025)
di: Li, Yaoru, et al.
Pubblicazione: (2025)
Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes
di: Wei, Zihe, et al.
Pubblicazione: (2026)
di: Wei, Zihe, et al.
Pubblicazione: (2026)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
di: Li, Maomao, et al.
Pubblicazione: (2026)
di: Li, Maomao, et al.
Pubblicazione: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
di: Ren, Yong, et al.
Pubblicazione: (2024)
di: Ren, Yong, et al.
Pubblicazione: (2024)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025)
di: Li, Fu, et al.
Pubblicazione: (2025)
Contextual Wireless Video Semantic Communication in MIMO-OFDM Systems
di: Xie, Bingyan, et al.
Pubblicazione: (2026)
di: Xie, Bingyan, et al.
Pubblicazione: (2026)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
Exploring the Role of Audio in Multimodal Misinformation Detection
di: Liu, Moyang, et al.
Pubblicazione: (2024)
di: Liu, Moyang, et al.
Pubblicazione: (2024)
ICME 2025 Grand Challenge on Video Super-Resolution for Video Conferencing
di: Naderi, Babak, et al.
Pubblicazione: (2025)
di: Naderi, Babak, et al.
Pubblicazione: (2025)
Cap2Sum: Learning to Summarize Videos by Generating Captions
di: Zhao, Cairong, et al.
Pubblicazione: (2024)
di: Zhao, Cairong, et al.
Pubblicazione: (2024)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
di: Guan, Jiazhi, et al.
Pubblicazione: (2025)
di: Guan, Jiazhi, et al.
Pubblicazione: (2025)
Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale
di: Pan, Yongsen, et al.
Pubblicazione: (2026)
di: Pan, Yongsen, et al.
Pubblicazione: (2026)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
di: Yu, Fei, et al.
Pubblicazione: (2024)
di: Yu, Fei, et al.
Pubblicazione: (2024)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation
di: Zhou, S. Z., et al.
Pubblicazione: (2025)
di: Zhou, S. Z., et al.
Pubblicazione: (2025)
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
di: Li, Chengzhi, et al.
Pubblicazione: (2026)
di: Li, Chengzhi, et al.
Pubblicazione: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
Node-Based Editing for Multimodal Generation of Text, Audio, Image, and Video
di: Kyaw, Alexander Htet, et al.
Pubblicazione: (2025)
di: Kyaw, Alexander Htet, et al.
Pubblicazione: (2025)
ProMSC-MIS: Prompt-based Multimodal Semantic Communication for Multi-Spectral Image Segmentation
di: Zhang, Haoshuo, et al.
Pubblicazione: (2025)
di: Zhang, Haoshuo, et al.
Pubblicazione: (2025)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
di: Zhang, Juan, et al.
Pubblicazione: (2024)
di: Zhang, Juan, et al.
Pubblicazione: (2024)
Perception-Aware Video Semantic Communication
di: Huang, Yinhuan, et al.
Pubblicazione: (2026)
di: Huang, Yinhuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
di: Chen, Zehao, et al.
Pubblicazione: (2025) -
Language-oriented Semantic Communication for Image Transmission with Fine-Tuned Diffusion Model
di: Wei, Xinfeng, et al.
Pubblicazione: (2024) -
Video Semantic Communication with Major Object Extraction and Contextual Video Encoding
di: Li, Haopeng, et al.
Pubblicazione: (2024) -
Semantic Item Graph Enhancement for Multimodal Recommendation
di: Zhang, Xiaoxiong, et al.
Pubblicazione: (2025) -
HeadsetOff: Enabling Photorealistic Video Conferencing on Economical VR Headsets
di: Jin, Yili, et al.
Pubblicazione: (2024)