Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Yolo Yunlong, Shimada, Daiki, Bi, Jing, Feng, Mingqian, Hua, Hang, Xu, Chenliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
por: Zhang, Zeliang, et al.
Publicado: (2025)
por: Zhang, Zeliang, et al.
Publicado: (2025)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
por: Liang, Susan, et al.
Publicado: (2026)
por: Liang, Susan, et al.
Publicado: (2026)
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
por: Feng, Mingqian, et al.
Publicado: (2024)
por: Feng, Mingqian, et al.
Publicado: (2024)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
por: Tang, Yolo Y., et al.
Publicado: (2024)
por: Tang, Yolo Y., et al.
Publicado: (2024)
MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
por: Tan, Zhangyun, et al.
Publicado: (2026)
por: Tan, Zhangyun, et al.
Publicado: (2026)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
por: Tang, Yunlong, et al.
Publicado: (2025)
por: Tang, Yunlong, et al.
Publicado: (2025)
MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos
por: Sinha, Arkaprava, et al.
Publicado: (2025)
por: Sinha, Arkaprava, et al.
Publicado: (2025)
TDMM-LM: Bridging Facial Understanding and Animation via Language Models
por: Song, Luchuan, et al.
Publicado: (2026)
por: Song, Luchuan, et al.
Publicado: (2026)
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
por: Bi, Jing, et al.
Publicado: (2024)
por: Bi, Jing, et al.
Publicado: (2024)
Video Understanding with Large Language Models: A Survey
por: Tang, Yolo Y., et al.
Publicado: (2023)
por: Tang, Yolo Y., et al.
Publicado: (2023)
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
por: Zhu, Lu, et al.
Publicado: (2025)
por: Zhu, Lu, et al.
Publicado: (2025)
MultiCounter: Multiple Action Agnostic Repetition Counting in Untrimmed Videos
por: Tang, Yin, et al.
Publicado: (2024)
por: Tang, Yin, et al.
Publicado: (2024)
What to Do Next? Memorizing skills from Egocentric Instructional Video
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
por: Tang, Yolo Yunlong, et al.
Publicado: (2023)
por: Tang, Yolo Yunlong, et al.
Publicado: (2023)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2025)
por: Wang, Langyu, et al.
Publicado: (2025)
Explainable Forensics of Manipulated Segments in Untrimmed Long Videos
por: Feng, Yue, et al.
Publicado: (2026)
por: Feng, Yue, et al.
Publicado: (2026)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
por: Tang, Yolo Yunlong, et al.
Publicado: (2022)
MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
por: Feng, Yue, et al.
Publicado: (2025)
por: Feng, Yue, et al.
Publicado: (2025)
Discover and Mitigate Multiple Biased Subgroups in Image Classifiers
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
EAGLE: Egocentric AGgregated Language-video Engine
por: Bi, Jing, et al.
Publicado: (2024)
por: Bi, Jing, et al.
Publicado: (2024)
FreSca: Scaling in Frequency Space Enhances Diffusion Models
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
Will the Inclusion of Generated Data Amplify Bias Across Generations in Future Image Classification Models?
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
ZeroSep: Separate Anything in Audio with Zero Training
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
Adapting Short-Term Transformers for Action Detection in Untrimmed Videos
por: Yang, Min, et al.
Publicado: (2023)
por: Yang, Min, et al.
Publicado: (2023)
Multi-Level LVLM Guidance for Untrimmed Video Action Recognition
por: Peng, Liyang, et al.
Publicado: (2025)
por: Peng, Liyang, et al.
Publicado: (2025)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
Diagnosing Visual Reasoning: Challenges, Insights, and a Path Forward
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
Cutup and Detect: Human Fall Detection on Cutup Untrimmed Videos Using a Large Foundational Video Understanding Model
por: Grutschus, Till, et al.
Publicado: (2024)
por: Grutschus, Till, et al.
Publicado: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
GaussianStyle: Gaussian Head Avatar via StyleGAN
por: Liu, Pinxin, et al.
Publicado: (2024)
por: Liu, Pinxin, et al.
Publicado: (2024)
What, when, and where? -- Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated Instructions
por: Chen, Brian, et al.
Publicado: (2023)
por: Chen, Brian, et al.
Publicado: (2023)
VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
Empowering LLMs to Understand and Generate Complex Vector Graphics
por: Xing, Ximing, et al.
Publicado: (2024)
por: Xing, Ximing, et al.
Publicado: (2024)
Language-Guided Joint Audio-Visual Editing via One-Shot Adaptation
por: Liang, Susan, et al.
Publicado: (2024)
por: Liang, Susan, et al.
Publicado: (2024)
Ejemplares similares
-
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
por: Tang, Yolo Y., et al.
Publicado: (2025) -
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
por: Hua, Hang, et al.
Publicado: (2024) -
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
por: Zhang, Zeliang, et al.
Publicado: (2025) -
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
por: Liang, Susan, et al.
Publicado: (2026) -
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)