AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance
Fuente:
arXiv
Guardado en:
| Autores principales: | Klein, Benjamin, Rahman, Kazi Ruslan, Ghose, Sanchita |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
por: Zhao, Yi, et al.
Publicado: (2026)
por: Zhao, Yi, et al.
Publicado: (2026)
Scene-Aware Vectorized Memory Multi-Agent Framework with Cross-Modal Differentiated Quantization VLMs for Visually Impaired Assistance
por: Wang, Xiangxiang, et al.
Publicado: (2025)
por: Wang, Xiangxiang, et al.
Publicado: (2025)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2024)
por: Wang, Langyu, et al.
Publicado: (2024)
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
por: Zhao, Yi, et al.
Publicado: (2024)
por: Zhao, Yi, et al.
Publicado: (2024)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
Vision-based Wearable Steering Assistance for People with Impaired Vision in Jogging
por: Liu, Xiaotong, et al.
Publicado: (2024)
por: Liu, Xiaotong, et al.
Publicado: (2024)
GAITGen: Disentangled Motion-Pathology Impaired Gait Generative Model -- Bringing Motion Generation to the Clinical Domain
por: Adeli, Vida, et al.
Publicado: (2025)
por: Adeli, Vida, et al.
Publicado: (2025)
AI-Driven Smartphone Solution for Digitizing Rapid Diagnostic Test Kits and Enhancing Accessibility for the Visually Impaired
por: Dastagir, R. B., et al.
Publicado: (2024)
por: Dastagir, R. B., et al.
Publicado: (2024)
3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation
por: Fang, Zhixue, et al.
Publicado: (2026)
por: Fang, Zhixue, et al.
Publicado: (2026)
Video Object Segmentation-Aware Audio Generation
por: Viertola, Ilpo, et al.
Publicado: (2025)
por: Viertola, Ilpo, et al.
Publicado: (2025)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2025)
por: Wang, Langyu, et al.
Publicado: (2025)
Efficient Audio-Visual Fusion for Video Classification
por: Awan, Mahrukh, et al.
Publicado: (2024)
por: Awan, Mahrukh, et al.
Publicado: (2024)
Efficient Motion-Aware Video MLLM
por: Zhao, Zijia, et al.
Publicado: (2025)
por: Zhao, Zijia, et al.
Publicado: (2025)
Motion-Aware Video Frame Interpolation
por: Han, Pengfei, et al.
Publicado: (2024)
por: Han, Pengfei, et al.
Publicado: (2024)
MotionBooth: Motion-Aware Customized Text-to-Video Generation
por: Wu, Jianzong, et al.
Publicado: (2024)
por: Wu, Jianzong, et al.
Publicado: (2024)
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
por: Wu, Xuecheng, et al.
Publicado: (2025)
por: Wu, Xuecheng, et al.
Publicado: (2025)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
por: Yao, Linli, et al.
Publicado: (2026)
por: Yao, Linli, et al.
Publicado: (2026)
MotiMotion: Motion-Controlled Video Generation with Visual Reasoning
por: Hsin-Ying, Lee, et al.
Publicado: (2026)
por: Hsin-Ying, Lee, et al.
Publicado: (2026)
AI-based Wearable Vision Assistance System for the Visually Impaired: Integrating Real-Time Object Recognition and Contextual Understanding Using Large Vision-Language Models
por: Baig, Mirza Samad Ahmed, et al.
Publicado: (2024)
por: Baig, Mirza Samad Ahmed, et al.
Publicado: (2024)
Video Generation with Learned Action Prior
por: Sarkar, Meenakshi, et al.
Publicado: (2024)
por: Sarkar, Meenakshi, et al.
Publicado: (2024)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
por: Wang, Kai, et al.
Publicado: (2024)
por: Wang, Kai, et al.
Publicado: (2024)
SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation
por: Tan, Shuai, et al.
Publicado: (2025)
por: Tan, Shuai, et al.
Publicado: (2025)
Adaptive Multi-Scale Channel-Spatial Attention Aggregation Framework for 3D Indoor Semantic Scene Completion Toward Assisting Visually Impaired
por: He, Qi, et al.
Publicado: (2026)
por: He, Qi, et al.
Publicado: (2026)
A Survey on Data Curation for Visual Contrastive Learning: Why Crafting Effective Positive and Negative Pairs Matters
por: Desai, Shasvat, et al.
Publicado: (2025)
por: Desai, Shasvat, et al.
Publicado: (2025)
Semantics-Aware Human Motion Generation from Audio Instructions
por: Wang, Zi-An, et al.
Publicado: (2025)
por: Wang, Zi-An, et al.
Publicado: (2025)
Turn-by-Turn Indoor Navigation for the Visually Impaired
por: Srinivasaiah, Santosh, et al.
Publicado: (2024)
por: Srinivasaiah, Santosh, et al.
Publicado: (2024)
SLAM for Visually Impaired People: a Survey
por: Bamdad, Marziyeh, et al.
Publicado: (2022)
por: Bamdad, Marziyeh, et al.
Publicado: (2022)
MotionAdapter: Video Motion Transfer via Content-Aware Attention Customization
por: Zhang, Zhexin, et al.
Publicado: (2026)
por: Zhang, Zhexin, et al.
Publicado: (2026)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
por: Baid, Ami, et al.
Publicado: (2026)
por: Baid, Ami, et al.
Publicado: (2026)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025)
por: Kim, Hongyeob, et al.
Publicado: (2025)
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
por: Yu, Li, et al.
Publicado: (2024)
por: Yu, Li, et al.
Publicado: (2024)
Spherical World-Locking for Audio-Visual Localization in Egocentric Videos
por: Yun, Heeseung, et al.
Publicado: (2024)
por: Yun, Heeseung, et al.
Publicado: (2024)
Tuning-free Visual Effect Transfer across Videos
por: Jones, Maxwell, et al.
Publicado: (2026)
por: Jones, Maxwell, et al.
Publicado: (2026)
Moaw: Unleashing Motion Awareness for Video Diffusion Models
por: Zhang, Tianqi, et al.
Publicado: (2026)
por: Zhang, Tianqi, et al.
Publicado: (2026)
iMOVE: Instance-Motion-Aware Video Understanding
por: Li, Jiaze, et al.
Publicado: (2025)
por: Li, Jiaze, et al.
Publicado: (2025)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
por: Wu, Hang, et al.
Publicado: (2026)
por: Wu, Hang, et al.
Publicado: (2026)
CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing
por: Sardari, Faegheh, et al.
Publicado: (2024)
por: Sardari, Faegheh, et al.
Publicado: (2024)
MotionShot: Adaptive Motion Transfer across Arbitrary Objects for Text-to-Video Generation
por: Liu, Yanchen, et al.
Publicado: (2025)
por: Liu, Yanchen, et al.
Publicado: (2025)
Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning
por: Li, Wenrui, et al.
Publicado: (2025)
por: Li, Wenrui, et al.
Publicado: (2025)
Zero-Shot Video Restoration and Enhancement with Assistance of Video Diffusion Models
por: Cao, Cong, et al.
Publicado: (2026)
por: Cao, Cong, et al.
Publicado: (2026)
Ejemplares similares
-
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
por: Zhao, Yi, et al.
Publicado: (2026) -
Scene-Aware Vectorized Memory Multi-Agent Framework with Cross-Modal Differentiated Quantization VLMs for Visually Impaired Assistance
por: Wang, Xiangxiang, et al.
Publicado: (2025) -
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2024) -
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
por: Zhao, Yi, et al.
Publicado: (2024) -
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
por: Wang, Xingrui, et al.
Publicado: (2025)