EyEar: Learning Audio Synchronized Human Gaze Trajectory Based on Physics-Informed Dynamics
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xiaochuan, Cheng, Xin, Sun, Yuchong, Wu, Xiaoxue, Song, Ruihua, Sun, Hao, Zhang, Denghao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
par: Chao, Jianghan, et autres
Publié: (2025)
par: Chao, Jianghan, et autres
Publié: (2025)
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
par: Wang, Yuyue, et autres
Publié: (2025)
par: Wang, Yuyue, et autres
Publié: (2025)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
par: Sun, Jiahui, et autres
Publié: (2025)
par: Sun, Jiahui, et autres
Publié: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
par: Wu, Qiong, et autres
Publié: (2024)
par: Wu, Qiong, et autres
Publié: (2024)
DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations
par: Song, Qiya, et autres
Publié: (2025)
par: Song, Qiya, et autres
Publié: (2025)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
SRA: Semantic Relation-Aware Flowchart Question Answering
par: Li, Xinyu, et autres
Publié: (2026)
par: Li, Xinyu, et autres
Publié: (2026)
Audio Matters Too! Enhancing Markerless Motion Capture with Audio Signals for String Performance Capture
par: Jin, Yitong, et autres
Publié: (2024)
par: Jin, Yitong, et autres
Publié: (2024)
Unsupervised Ego- and Exo-centric Dense Procedural Activity Captioning via Gaze Consensus Adaptation
par: Shi, Zhaofeng, et autres
Publié: (2025)
par: Shi, Zhaofeng, et autres
Publié: (2025)
FGAS: Fixed Decoder Network-Based Audio Steganography with Adversarial Perturbation Generation
par: Yan, Jialin, et autres
Publié: (2025)
par: Yan, Jialin, et autres
Publié: (2025)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
par: Liao, Junchao, et autres
Publié: (2026)
par: Liao, Junchao, et autres
Publié: (2026)
A 3D-Cascading Crossing Coupling Framework for Hyperchaotic Map Construction and Its Application to Color Image Encryption
par: Sun, Jilei, et autres
Publié: (2025)
par: Sun, Jilei, et autres
Publié: (2025)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
par: Li, Qingcao, et autres
Publié: (2026)
par: Li, Qingcao, et autres
Publié: (2026)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
Sec2Sec Co-attention for Video-Based Apparent Affective Prediction
par: Sun, Mingwei, et autres
Publié: (2024)
par: Sun, Mingwei, et autres
Publié: (2024)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
par: Sun, Luoyi, et autres
Publié: (2026)
par: Sun, Luoyi, et autres
Publié: (2026)
SentiAvatar: Towards Expressive and Interactive Digital Humans
par: Jin, Chuhao, et autres
Publié: (2026)
par: Jin, Chuhao, et autres
Publié: (2026)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024)
par: Liu, Qianhui, et autres
Publié: (2024)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline
par: Yang, Dingyi, et autres
Publié: (2024)
par: Yang, Dingyi, et autres
Publié: (2024)
Trusted Fake Audio Detection Based on Dirichlet Distribution
par: Ding, Chi, et autres
Publié: (2025)
par: Ding, Chi, et autres
Publié: (2025)
EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
Beyond Audio and Pose: A General-Purpose Framework for Video Synchronization
par: Shin, Yosub, et autres
Publié: (2025)
par: Shin, Yosub, et autres
Publié: (2025)
Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation
par: Gao, Zhilin, et autres
Publié: (2025)
par: Gao, Zhilin, et autres
Publié: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
par: Xu, Xinmeng, et autres
Publié: (2026)
par: Xu, Xinmeng, et autres
Publié: (2026)
Robust Latent Representation Tuning for Image-text Classification
par: Sun, Hao, et autres
Publié: (2024)
par: Sun, Hao, et autres
Publié: (2024)
Exploring the Role of Audio in Multimodal Misinformation Detection
par: Liu, Moyang, et autres
Publié: (2024)
par: Liu, Moyang, et autres
Publié: (2024)
Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?
par: An, Xiao, et autres
Publié: (2026)
par: An, Xiao, et autres
Publié: (2026)
Compressed Deepfake Video Detection Based on 3D Spatiotemporal Trajectories
par: Chen, Zongmei, et autres
Publié: (2024)
par: Chen, Zongmei, et autres
Publié: (2024)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
par: Sun, Luoyi, et autres
Publié: (2023)
par: Sun, Luoyi, et autres
Publié: (2023)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
par: Surana, Rohan, et autres
Publié: (2025)
par: Surana, Rohan, et autres
Publié: (2025)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
par: Chen, Yiming, et autres
Publié: (2024)
par: Chen, Yiming, et autres
Publié: (2024)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
par: Cheng, Shihao, et autres
Publié: (2026)
par: Cheng, Shihao, et autres
Publié: (2026)
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
par: Zou, Jialing, et autres
Publié: (2023)
par: Zou, Jialing, et autres
Publié: (2023)
Spatial-Temporal Human-Object Interaction Detection
par: Sun, Xu, et autres
Publié: (2025)
par: Sun, Xu, et autres
Publié: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
par: Zhou, Yang-Hao, et autres
Publié: (2026)
par: Zhou, Yang-Hao, et autres
Publié: (2026)
Documents similaires
-
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
par: Chao, Jianghan, et autres
Publié: (2025) -
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024) -
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
par: Wang, Yuyue, et autres
Publié: (2025) -
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
par: Sun, Jiahui, et autres
Publié: (2025) -
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)