NowYouSee Me: Context-Aware Automatic Audio Description
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Seon-Ho, Wang, Jue, Fan, David, Zhang, Zhikang, Liu, Linda, Hao, Xiang, Bhat, Vimal, Li, Xinyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Text-Guided Video Masked Autoencoder
por: Fan, David, et al.
Publicado: (2024)
por: Fan, David, et al.
Publicado: (2024)
GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning
por: Wang, Yicheng, et al.
Publicado: (2024)
por: Wang, Yicheng, et al.
Publicado: (2024)
Video Token Merging for Long-form Video Understanding
por: Lee, Seon-Ho, et al.
Publicado: (2024)
por: Lee, Seon-Ho, et al.
Publicado: (2024)
Now You See Me, Now You Don't: A Unified Framework for Expression Consistent Anonymization in Talking Head Videos
por: Egin, Anil, et al.
Publicado: (2026)
por: Egin, Anil, et al.
Publicado: (2026)
What You See is What You Ask: Evaluating Audio Descriptions
por: Kala, Divy, et al.
Publicado: (2025)
por: Kala, Divy, et al.
Publicado: (2025)
Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation
por: Biswas, Shristi Das, et al.
Publicado: (2025)
por: Biswas, Shristi Das, et al.
Publicado: (2025)
RefTok: Reference-Based Tokenization for Video Generation
por: Fan, Xiang, et al.
Publicado: (2025)
por: Fan, Xiang, et al.
Publicado: (2025)
DiffSign: AI-Assisted Generation of Customizable Sign Language Videos With Enhanced Realism
por: Krishnamurthy, Sudha, et al.
Publicado: (2024)
por: Krishnamurthy, Sudha, et al.
Publicado: (2024)
Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs
por: Kanade, Aditya, et al.
Publicado: (2025)
por: Kanade, Aditya, et al.
Publicado: (2025)
One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
por: Zhang, Zheyu, et al.
Publicado: (2026)
por: Zhang, Zheyu, et al.
Publicado: (2026)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
por: Chen, Seng Nam, et al.
Publicado: (2026)
por: Chen, Seng Nam, et al.
Publicado: (2026)
Hear Me, See Me, Understand Me: Audio-Visual Autism Behavior Recognition
por: Deng, Shijian, et al.
Publicado: (2024)
por: Deng, Shijian, et al.
Publicado: (2024)
What You See Is What Matters: A Novel Visual and Physics-Based Metric for Evaluating Video Generation Quality
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
DistinctAD: Distinctive Audio Description Generation in Contexts
por: Fang, Bo, et al.
Publicado: (2024)
por: Fang, Bo, et al.
Publicado: (2024)
Tell Me What You See: Text-Guided Real-World Image Denoising
por: Yosef, Erez, et al.
Publicado: (2023)
por: Yosef, Erez, et al.
Publicado: (2023)
Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes
por: Lin, Kaiqing, et al.
Publicado: (2025)
por: Lin, Kaiqing, et al.
Publicado: (2025)
Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation
por: Wu, Jianzong, et al.
Publicado: (2025)
por: Wu, Jianzong, et al.
Publicado: (2025)
You Only Speak Once to See
por: Yang, Wenhao, et al.
Publicado: (2024)
por: Yang, Wenhao, et al.
Publicado: (2024)
Extending Segment Anything Model into Auditory and Temporal Dimensions for Audio-Visual Segmentation
por: Seon, Juhyeong, et al.
Publicado: (2024)
por: Seon, Juhyeong, et al.
Publicado: (2024)
MFP: Making Full Use of Probability Maps for Interactive Image Segmentation
por: Lee, Chaewon, et al.
Publicado: (2024)
por: Lee, Chaewon, et al.
Publicado: (2024)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
por: Xie, Junyu, et al.
Publicado: (2025)
por: Xie, Junyu, et al.
Publicado: (2025)
The More You See in 2D, the More You Perceive in 3D
por: Han, Xinyang, et al.
Publicado: (2024)
por: Han, Xinyang, et al.
Publicado: (2024)
Decom--CAM: Tell Me What You See, In Details! Feature-Level Interpretation via Decomposition Class Activation Map
por: Yang, Yuguang, et al.
Publicado: (2023)
por: Yang, Yuguang, et al.
Publicado: (2023)
SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
por: Agrawal, Vaibhav, et al.
Publicado: (2026)
por: Agrawal, Vaibhav, et al.
Publicado: (2026)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
por: Chen, Mingfei, et al.
Publicado: (2025)
por: Chen, Mingfei, et al.
Publicado: (2025)
Tell What You Hear From What You See -- Video to Audio Generation Through Text
por: Liu, Xiulong, et al.
Publicado: (2024)
por: Liu, Xiulong, et al.
Publicado: (2024)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
por: Chen, Yuxiao, et al.
Publicado: (2026)
por: Chen, Yuxiao, et al.
Publicado: (2026)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
What Do You See in Vehicle? Comprehensive Vision Solution for In-Vehicle Gaze Estimation
por: Cheng, Yihua, et al.
Publicado: (2024)
por: Cheng, Yihua, et al.
Publicado: (2024)
See Before You Code: Learning Visual Priors for Spatially Aware Educational Animation Generation
por: Li, Yuejia, et al.
Publicado: (2026)
por: Li, Yuejia, et al.
Publicado: (2026)
ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration
por: Yan, Bei, et al.
Publicado: (2026)
por: Yan, Bei, et al.
Publicado: (2026)
Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization
por: Pan, Miao, et al.
Publicado: (2026)
por: Pan, Miao, et al.
Publicado: (2026)
You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale
por: Ma, Baorui, et al.
Publicado: (2024)
por: Ma, Baorui, et al.
Publicado: (2024)
What Happens Next? Next Scene Prediction with a Unified Video Model
por: Li, Xinjie, et al.
Publicado: (2025)
por: Li, Xinjie, et al.
Publicado: (2025)
VeRVE: Versatile Retrieval for Videos via Unified Embeddings
por: Halbe, Shaunak, et al.
Publicado: (2026)
por: Halbe, Shaunak, et al.
Publicado: (2026)
3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio
por: Hong, Jihwan, et al.
Publicado: (2026)
por: Hong, Jihwan, et al.
Publicado: (2026)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
por: Choi, Hahyeon, et al.
Publicado: (2025)
por: Choi, Hahyeon, et al.
Publicado: (2025)
See No Evil: Semantic Context-Aware Privacy Risk Detection for AR
por: Liu, Jialu, et al.
Publicado: (2026)
por: Liu, Jialu, et al.
Publicado: (2026)
Your Robot Will Feel You Now: Empathy in Robots and Embodied Agents
por: Lim, Angelica, et al.
Publicado: (2026)
por: Lim, Angelica, et al.
Publicado: (2026)
Seeing Isn't Believing: Context-Aware Adversarial Patch Synthesis via Conditional GAN
por: Kazoom, Roie, et al.
Publicado: (2025)
por: Kazoom, Roie, et al.
Publicado: (2025)
Ejemplares similares
-
Text-Guided Video Masked Autoencoder
por: Fan, David, et al.
Publicado: (2024) -
GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning
por: Wang, Yicheng, et al.
Publicado: (2024) -
Video Token Merging for Long-form Video Understanding
por: Lee, Seon-Ho, et al.
Publicado: (2024) -
Now You See Me, Now You Don't: A Unified Framework for Expression Consistent Anonymization in Talking Head Videos
por: Egin, Anil, et al.
Publicado: (2026) -
What You See is What You Ask: Evaluating Audio Descriptions
por: Kala, Divy, et al.
Publicado: (2025)