LensWalk: Agentic Video Understanding by Planning How You See in Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Keliang, Li, Yansong, Shen, Hongze, Liu, Mengdi, Chang, Hong, Shan, Shiguang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HERM: Benchmarking and Enhancing Multimodal LLMs for Human-Centric Understanding
por: Li, Keliang, et al.
Publicado: (2024)
por: Li, Keliang, et al.
Publicado: (2024)
Preacher: Paper-to-Video Agentic System
por: Liu, Jingwei, et al.
Publicado: (2025)
por: Liu, Jingwei, et al.
Publicado: (2025)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
por: Liu, Wenqi, et al.
Publicado: (2026)
por: Liu, Wenqi, et al.
Publicado: (2026)
Segment Anything for Videos: A Systematic Survey
por: Zhang, Chunhui, et al.
Publicado: (2024)
por: Zhang, Chunhui, et al.
Publicado: (2024)
Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding
por: Gao, Hong, et al.
Publicado: (2025)
por: Gao, Hong, et al.
Publicado: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
por: Zhang, Xiaoyi, et al.
Publicado: (2025)
por: Zhang, Xiaoyi, et al.
Publicado: (2025)
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
por: Li, Yiheng, et al.
Publicado: (2024)
por: Li, Yiheng, et al.
Publicado: (2024)
HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes
por: Li, Keliang, et al.
Publicado: (2025)
por: Li, Keliang, et al.
Publicado: (2025)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
por: Yang, Junqi, et al.
Publicado: (2026)
por: Yang, Junqi, et al.
Publicado: (2026)
VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority
por: Qiu, Chenhao, et al.
Publicado: (2026)
por: Qiu, Chenhao, et al.
Publicado: (2026)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
por: Wang, Ziyang, et al.
Publicado: (2025)
por: Wang, Ziyang, et al.
Publicado: (2025)
Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval
por: Li, Aiden Yiliu, et al.
Publicado: (2026)
por: Li, Aiden Yiliu, et al.
Publicado: (2026)
AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling
por: Li, Yiheng, et al.
Publicado: (2026)
por: Li, Yiheng, et al.
Publicado: (2026)
BIMM: Brain Inspired Masked Modeling for Video Representation Learning
por: Wan, Zhifan, et al.
Publicado: (2024)
por: Wan, Zhifan, et al.
Publicado: (2024)
From Static to Dynamic: Adapting Landmark-Aware Image Models for Facial Expression Recognition in Videos
por: Chen, Yin, et al.
Publicado: (2023)
por: Chen, Yin, et al.
Publicado: (2023)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
por: Li, Chenglin, et al.
Publicado: (2026)
por: Li, Chenglin, et al.
Publicado: (2026)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
por: Wang, Shihao, et al.
Publicado: (2025)
por: Wang, Shihao, et al.
Publicado: (2025)
VCA: Video Curious Agent for Long Video Understanding
por: Yang, Zeyuan, et al.
Publicado: (2024)
por: Yang, Zeyuan, et al.
Publicado: (2024)
FrameOracle: Learning What to See and How Much to See in Videos
por: Li, Chaoyu, et al.
Publicado: (2025)
por: Li, Chaoyu, et al.
Publicado: (2025)
On Denoising Walking Videos for Gait Recognition
por: Jin, Dongyang, et al.
Publicado: (2025)
por: Jin, Dongyang, et al.
Publicado: (2025)
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
por: Yin, Xinlei, et al.
Publicado: (2026)
por: Yin, Xinlei, et al.
Publicado: (2026)
Causality Model for Semantic Understanding on Videos
por: Yicong, Li
Publicado: (2025)
por: Yicong, Li
Publicado: (2025)
LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?
por: Yu, Zhuang, et al.
Publicado: (2026)
por: Yu, Zhuang, et al.
Publicado: (2026)
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
por: Liu, Keliang, et al.
Publicado: (2025)
por: Liu, Keliang, et al.
Publicado: (2025)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
por: Fei, Jiajun, et al.
Publicado: (2024)
por: Fei, Jiajun, et al.
Publicado: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
por: Liu, Chengwen, et al.
Publicado: (2026)
por: Liu, Chengwen, et al.
Publicado: (2026)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
por: Li, Yifei, et al.
Publicado: (2025)
por: Li, Yifei, et al.
Publicado: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)
por: Zeng, Xiangyu, et al.
Publicado: (2024)
Time Blindness: Why Video-Language Models Can't See What Humans Can?
por: Upadhyay, Ujjwal, et al.
Publicado: (2025)
por: Upadhyay, Ujjwal, et al.
Publicado: (2025)
An Efficient Streaming Video Understanding Framework with Agentic Control
por: Liu, Jinming, et al.
Publicado: (2026)
por: Liu, Jinming, et al.
Publicado: (2026)
LumiVideo: An Intelligent Agentic System for Video Color Grading
por: Guo, Yuchen, et al.
Publicado: (2026)
por: Guo, Yuchen, et al.
Publicado: (2026)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
por: Lin, Kuanwei, et al.
Publicado: (2026)
por: Lin, Kuanwei, et al.
Publicado: (2026)
Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning
por: Li, Jiazheng, et al.
Publicado: (2026)
por: Li, Jiazheng, et al.
Publicado: (2026)
HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding
por: Zhao, Jiahe, et al.
Publicado: (2025)
por: Zhao, Jiahe, et al.
Publicado: (2025)
Uncovering What, Why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly
por: Du, Hang, et al.
Publicado: (2024)
por: Du, Hang, et al.
Publicado: (2024)
VideoPrism: A Foundational Visual Encoder for Video Understanding
por: Zhao, Long, et al.
Publicado: (2024)
por: Zhao, Long, et al.
Publicado: (2024)
Video Panels for Long Video Understanding
por: Doorenbos, Lars, et al.
Publicado: (2025)
por: Doorenbos, Lars, et al.
Publicado: (2025)
UVCG: Leveraging Temporal Consistency for Universal Video Protection
por: Li, KaiZhou, et al.
Publicado: (2024)
por: Li, KaiZhou, et al.
Publicado: (2024)
Ejemplares similares
-
HERM: Benchmarking and Enhancing Multimodal LLMs for Human-Centric Understanding
por: Li, Keliang, et al.
Publicado: (2024) -
Preacher: Paper-to-Video Agentic System
por: Liu, Jingwei, et al.
Publicado: (2025) -
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
por: Liu, Wenqi, et al.
Publicado: (2026) -
Segment Anything for Videos: A Systematic Survey
por: Zhang, Chunhui, et al.
Publicado: (2024) -
Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding
por: Gao, Hong, et al.
Publicado: (2025)