Guardado en:
| Autores principales: | Xue, Haiwei, Luo, Xiangyang, Hu, Zhanghao, Zhang, Xin, Xiang, Xunzhi, Dai, Yuqin, Liu, Jianzhuang, Zhang, Zhensong, Li, Minglei, Yang, Jian, Ma, Fei, Wu, Zhiyong, Yang, Changpeng, Dai, Zonghong, Yu, Fei Richard |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.03883 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Conversational Co-Speech Gesture Generation via Modeling Dialog Intention, Emotion, and Context with Diffusion Models
por: Xue, Haiwei, et al.
Publicado: (2023)
por: Xue, Haiwei, et al.
Publicado: (2023)
Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
por: He, Xu, et al.
Publicado: (2024)
por: He, Xu, et al.
Publicado: (2024)
Cross: A Delay Based Congestion Control Method for RTP Media
por: Zhang, Songyang, et al.
Publicado: (2024)
por: Zhang, Songyang, et al.
Publicado: (2024)
High-Fidelity 3D Gaussian Human Reconstruction via Region-Aware Initialization and Geometric Priors
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning
por: Yuan, Xiang, et al.
Publicado: (2026)
por: Yuan, Xiang, et al.
Publicado: (2026)
Discriminative-Generative Synergy for Occlusion Robust 3D Human Mesh Recovery
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
A Video Steganography for H.265/HEVC Based on Multiple CU Size and Block Structure Distortion
por: Zhang, Xiang, et al.
Publicado: (2026)
por: Zhang, Xiang, et al.
Publicado: (2026)
Tile-Weighted Rate-Distortion Optimized Packet Scheduling for 360$^\circ$ VR Video Streaming
por: Wang, Haopeng, et al.
Publicado: (2024)
por: Wang, Haopeng, et al.
Publicado: (2024)
EV-NVC: Efficient Variable bitrate Neural Video Compression
por: Hu, Yongcun, et al.
Publicado: (2025)
por: Hu, Yongcun, et al.
Publicado: (2025)
FeatDistill: A Feature Distillation Enhanced Multi-Expert Ensemble Framework for Robust AI-generated Image Detection
por: Tu, Zhilin, et al.
Publicado: (2026)
por: Tu, Zhilin, et al.
Publicado: (2026)
Large Language Models (LLMs): Deployment, Tokenomics and Sustainability
por: Dong, Haiwei, et al.
Publicado: (2024)
por: Dong, Haiwei, et al.
Publicado: (2024)
Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge
por: Yang, Sicheng, et al.
Publicado: (2026)
por: Yang, Sicheng, et al.
Publicado: (2026)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
por: Xie, Yifan, et al.
Publicado: (2024)
por: Xie, Yifan, et al.
Publicado: (2024)
HumanVLM: Foundation for Human-Scene Vision-Language Model
por: Dai, Dawei, et al.
Publicado: (2024)
por: Dai, Dawei, et al.
Publicado: (2024)
AxiomVision: Accuracy-Guaranteed Adaptive Visual Model Selection for Perspective-Aware Video Analytics
por: Dai, Xiangxiang, et al.
Publicado: (2024)
por: Dai, Xiangxiang, et al.
Publicado: (2024)
Bringing Robots Home: The Rise of AI Robots in Consumer Electronics
por: Dong, Haiwei, et al.
Publicado: (2024)
por: Dong, Haiwei, et al.
Publicado: (2024)
H.265/HEVC Video Steganalysis Based on CU Block Structure Gradients and IPM Mapping
por: Zhang, Xiang, et al.
Publicado: (2026)
por: Zhang, Xiang, et al.
Publicado: (2026)
Generating Attribute-Aware Human Motions from Textual Prompt
por: Wang, Xinghan, et al.
Publicado: (2025)
por: Wang, Xinghan, et al.
Publicado: (2025)
Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models
por: Wang, Chen, et al.
Publicado: (2025)
por: Wang, Chen, et al.
Publicado: (2025)
3DMambaIPF: A State Space Model for Iterative Point Cloud Filtering via Differentiable Rendering
por: Zhou, Qingyuan, et al.
Publicado: (2024)
por: Zhou, Qingyuan, et al.
Publicado: (2024)
Freetalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
por: Yang, Sicheng, et al.
Publicado: (2024)
por: Yang, Sicheng, et al.
Publicado: (2024)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
por: Zhang, Meishan, et al.
Publicado: (2024)
por: Zhang, Meishan, et al.
Publicado: (2024)
Multimodal Pretraining, Adaptation, and Generation for Recommendation: A Survey
por: Liu, Qijiong, et al.
Publicado: (2024)
por: Liu, Qijiong, et al.
Publicado: (2024)
MagicMotion: Controllable Video Generation with Dense-to-Sparse Trajectory Guidance
por: Li, Quanhao, et al.
Publicado: (2025)
por: Li, Quanhao, et al.
Publicado: (2025)
TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
por: Zhou, Yuchen, et al.
Publicado: (2025)
por: Zhou, Yuchen, et al.
Publicado: (2025)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
por: Wang, Yutian, et al.
Publicado: (2024)
por: Wang, Yutian, et al.
Publicado: (2024)
A H.265/HEVC Fine-Grained ROI Video Encryption Algorithm Based on Coding Unit and Prompt Segmentation
por: Zhang, Xiang, et al.
Publicado: (2026)
por: Zhang, Xiang, et al.
Publicado: (2026)
MHAD: Multimodal Home Activity Dataset with Multi-Angle Videos and Synchronized Physiological Signals
por: Yu, Lei, et al.
Publicado: (2024)
por: Yu, Lei, et al.
Publicado: (2024)
How to Cache Important Contents for Multi-modal Service in Dynamic Networks: A DRL-based Caching Scheme
por: Zhang, Zhe, et al.
Publicado: (2024)
por: Zhang, Zhe, et al.
Publicado: (2024)
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
por: Li, Yuxuan, et al.
Publicado: (2024)
por: Li, Yuxuan, et al.
Publicado: (2024)
TAVGBench: Benchmarking Text to Audible-Video Generation
por: Mao, Yuxin, et al.
Publicado: (2024)
por: Mao, Yuxin, et al.
Publicado: (2024)
Deep learning for 3D human pose estimation and mesh recovery: A survey
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
por: Zhang, Han, et al.
Publicado: (2025)
por: Zhang, Han, et al.
Publicado: (2025)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
por: Cheng, Shihao, et al.
Publicado: (2026)
por: Cheng, Shihao, et al.
Publicado: (2026)
Towards Unified Representation of Multi-Modal Pre-training for 3D Understanding via Differentiable Rendering
por: Fei, Ben, et al.
Publicado: (2024)
por: Fei, Ben, et al.
Publicado: (2024)
SIDQL: An Efficient Keyframe Extraction and Motion Reconstruction Framework in Motion Capture
por: Zhang, Xuling, et al.
Publicado: (2024)
por: Zhang, Xuling, et al.
Publicado: (2024)
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
por: Zhang, Yuang, et al.
Publicado: (2024)
por: Zhang, Yuang, et al.
Publicado: (2024)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
por: Zhang, Xueqiao, et al.
Publicado: (2025)
por: Zhang, Xueqiao, et al.
Publicado: (2025)
ConCLVD: Controllable Chinese Landscape Video Generation via Diffusion Model
por: Liu, Dingming, et al.
Publicado: (2024)
por: Liu, Dingming, et al.
Publicado: (2024)
Ejemplares similares
-
Conversational Co-Speech Gesture Generation via Modeling Dialog Intention, Emotion, and Context with Diffusion Models
por: Xue, Haiwei, et al.
Publicado: (2023) -
Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
por: He, Xu, et al.
Publicado: (2024) -
Cross: A Delay Based Congestion Control Method for RTP Media
por: Zhang, Songyang, et al.
Publicado: (2024) -
High-Fidelity 3D Gaussian Human Reconstruction via Region-Aware Initialization and Geometric Priors
por: Liu, Yang, et al.
Publicado: (2026) -
MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning
por: Yuan, Xiang, et al.
Publicado: (2026)