Two Causally Related Needles in a Video Haystack
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Miaoyu, Chao, Qin, Li, Boyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Needle In A Multimodal Haystack
por: Wang, Weiyun, et al.
Publicado: (2024)
por: Wang, Weiyun, et al.
Publicado: (2024)
MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
por: Chowdhury, Sanjoy, et al.
Publicado: (2025)
por: Chowdhury, Sanjoy, et al.
Publicado: (2025)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
por: Wang, Hengyi, et al.
Publicado: (2024)
por: Wang, Hengyi, et al.
Publicado: (2024)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
por: Sharma, Aditya, et al.
Publicado: (2024)
por: Sharma, Aditya, et al.
Publicado: (2024)
Causality Model for Semantic Understanding on Videos
por: Yicong, Li
Publicado: (2025)
por: Yicong, Li
Publicado: (2025)
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
por: Li, Xuchen, et al.
Publicado: (2025)
por: Li, Xuchen, et al.
Publicado: (2025)
Finding Outliers in a Haystack: Anomaly Detection for Large Pointcloud Scenes
por: Faulkner, Ryan, et al.
Publicado: (2025)
por: Faulkner, Ryan, et al.
Publicado: (2025)
Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark
por: Wu, Tsung-Han, et al.
Publicado: (2024)
por: Wu, Tsung-Han, et al.
Publicado: (2024)
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
por: Zhao, Zijia, et al.
Publicado: (2024)
por: Zhao, Zijia, et al.
Publicado: (2024)
InstrAct: Towards Action-Centric Understanding in Instructional Videos
por: Yang, Zhuoyi, et al.
Publicado: (2026)
por: Yang, Zhuoyi, et al.
Publicado: (2026)
Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ Documents
por: Chen, Jun, et al.
Publicado: (2024)
por: Chen, Jun, et al.
Publicado: (2024)
Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events
por: Chinchure, Aditya, et al.
Publicado: (2024)
por: Chinchure, Aditya, et al.
Publicado: (2024)
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
por: Qin, Luozheng, et al.
Publicado: (2026)
por: Qin, Luozheng, et al.
Publicado: (2026)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
por: Fei, Jiajun, et al.
Publicado: (2024)
por: Fei, Jiajun, et al.
Publicado: (2024)
CausalVE: Face Video Privacy Encryption via Causal Video Prediction
por: Huang, Yubo, et al.
Publicado: (2024)
por: Huang, Yubo, et al.
Publicado: (2024)
Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index
por: Yuan, Chao, et al.
Publicado: (2026)
por: Yuan, Chao, et al.
Publicado: (2026)
FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding
por: Li, Kangcong, et al.
Publicado: (2026)
por: Li, Kangcong, et al.
Publicado: (2026)
MSA2-Net: Utilizing Self-Adaptive Convolution Module to Extract Multi-Scale Information in Medical Image Segmentation
por: Deng, Chao, et al.
Publicado: (2025)
por: Deng, Chao, et al.
Publicado: (2025)
Treble Counterfactual VLMs: A Causal Approach to Hallucination
por: Li, Shawn, et al.
Publicado: (2025)
por: Li, Shawn, et al.
Publicado: (2025)
This&That: Language-Gesture Controlled Video Generation for Robot Planning
por: Wang, Boyang, et al.
Publicado: (2024)
por: Wang, Boyang, et al.
Publicado: (2024)
Emergent Open-Vocabulary Semantic Segmentation from Off-the-shelf Vision-Language Models
por: Luo, Jiayun, et al.
Publicado: (2023)
por: Luo, Jiayun, et al.
Publicado: (2023)
Echo-Path: Pathology-Conditioned Echo Video Generation
por: Muhammad, Kabir Hamzah, et al.
Publicado: (2025)
por: Muhammad, Kabir Hamzah, et al.
Publicado: (2025)
Causally Steered Diffusion for Automated Video Counterfactual Generation
por: Spyrou, Nikos, et al.
Publicado: (2025)
por: Spyrou, Nikos, et al.
Publicado: (2025)
VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization
por: Cao, Xinye, et al.
Publicado: (2025)
por: Cao, Xinye, et al.
Publicado: (2025)
DINOv3 Meets YOLO26 for Weed Detection in Vegetable Crops
por: Deng, Boyang, et al.
Publicado: (2026)
por: Deng, Boyang, et al.
Publicado: (2026)
VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes
por: Chen, Jingru, et al.
Publicado: (2026)
por: Chen, Jingru, et al.
Publicado: (2026)
ViRED: Prediction of Visual Relations in Engineering Drawings
por: Gu, Chao, et al.
Publicado: (2024)
por: Gu, Chao, et al.
Publicado: (2024)
CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis
por: Liang, Kaidi, et al.
Publicado: (2025)
por: Liang, Kaidi, et al.
Publicado: (2025)
Causality in Video Diffusers is Separable from Denoising
por: Bai, Xingjian, et al.
Publicado: (2026)
por: Bai, Xingjian, et al.
Publicado: (2026)
HiProbe-VAD: Video Anomaly Detection via Hidden States Probing in Tuning-Free Multimodal LLMs
por: Cai, Zhaolin, et al.
Publicado: (2025)
por: Cai, Zhaolin, et al.
Publicado: (2025)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
por: Liu, Boyang, et al.
Publicado: (2025)
por: Liu, Boyang, et al.
Publicado: (2025)
Audio-centric Video Understanding Benchmark without Text Shortcut
por: Yang, Yudong, et al.
Publicado: (2025)
por: Yang, Yudong, et al.
Publicado: (2025)
Precipitation Nowcasting Using Diffusion Transformer with Causal Attention
por: Li, ChaoRong, et al.
Publicado: (2024)
por: Li, ChaoRong, et al.
Publicado: (2024)
Block Cascading: Training Free Acceleration of Block-Causal Video Models
por: Bandyopadhyay, Hmrishav, et al.
Publicado: (2025)
por: Bandyopadhyay, Hmrishav, et al.
Publicado: (2025)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
por: Yang, Xiaomeng, et al.
Publicado: (2025)
por: Yang, Xiaomeng, et al.
Publicado: (2025)
CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models
por: Shen, Fangjian, et al.
Publicado: (2025)
por: Shen, Fangjian, et al.
Publicado: (2025)
AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
por: Yang, Xiao, et al.
Publicado: (2026)
por: Yang, Xiao, et al.
Publicado: (2026)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
por: Luo, Yongdong, et al.
Publicado: (2024)
por: Luo, Yongdong, et al.
Publicado: (2024)
VideoQA in the Era of LLMs: An Empirical Study
por: Xiao, Junbin, et al.
Publicado: (2024)
por: Xiao, Junbin, et al.
Publicado: (2024)
VideoGuard: Protecting Video Content from Unauthorized Editing
por: Cao, Junjie, et al.
Publicado: (2025)
por: Cao, Junjie, et al.
Publicado: (2025)
Ejemplares similares
-
Needle In A Multimodal Haystack
por: Wang, Weiyun, et al.
Publicado: (2024) -
MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
por: Chowdhury, Sanjoy, et al.
Publicado: (2025) -
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
por: Wang, Hengyi, et al.
Publicado: (2024) -
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
por: Sharma, Aditya, et al.
Publicado: (2024) -
Causality Model for Semantic Understanding on Videos
por: Yicong, Li
Publicado: (2025)