A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yue, Jing, Liqiang, Li, Jia, Tian, Yapeng, Du, Xinya, Guo, Yunhui, Gogate, Vibhav |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
por: Jing, Liqiang, et al.
Publicado: (2024)
por: Jing, Liqiang, et al.
Publicado: (2024)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
por: Jing, Liqiang, et al.
Publicado: (2025)
por: Jing, Liqiang, et al.
Publicado: (2025)
Deep Dependency Networks and Advanced Inference Schemes for Multi-Label Classification
por: Arya, Shivvrat, et al.
Publicado: (2024)
por: Arya, Shivvrat, et al.
Publicado: (2024)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
por: Jing, Liqiang, et al.
Publicado: (2023)
por: Jing, Liqiang, et al.
Publicado: (2023)
An Efficient Streaming Video Understanding Framework with Agentic Control
por: Liu, Jinming, et al.
Publicado: (2026)
por: Liu, Jinming, et al.
Publicado: (2026)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
por: Fan, Yue, et al.
Publicado: (2024)
por: Fan, Yue, et al.
Publicado: (2024)
Multimodal Reference Visual Grounding
por: Lu, Yangxiao, et al.
Publicado: (2025)
por: Lu, Yangxiao, et al.
Publicado: (2025)
Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos
por: Peddi, Rohith, et al.
Publicado: (2026)
por: Peddi, Rohith, et al.
Publicado: (2026)
Mitigating the ID-OOD Tradeoff in Open-Set Test-Time Adaptation
por: Zhao, Wenjie, et al.
Publicado: (2026)
por: Zhao, Wenjie, et al.
Publicado: (2026)
FIHA: Autonomous Hallucination Evaluation in Vision-Language Models with Davidson Scene Graphs
por: Yan, Bowen, et al.
Publicado: (2024)
por: Yan, Bowen, et al.
Publicado: (2024)
Towards Unbiased and Robust Spatio-Temporal Scene Graph Generation and Anticipation
por: Peddi, Rohith, et al.
Publicado: (2024)
por: Peddi, Rohith, et al.
Publicado: (2024)
Towards Scene Graph Anticipation
por: Peddi, Rohith, et al.
Publicado: (2024)
por: Peddi, Rohith, et al.
Publicado: (2024)
From Waveforms to Pixels: A Survey on Audio-Visual Segmentation
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
CURE-OOD: Benchmarking Out-of-Distribution Detection for Survival Prediction
por: Zhao, Wenjie, et al.
Publicado: (2026)
por: Zhao, Wenjie, et al.
Publicado: (2026)
HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding
por: Azad, Shehreen, et al.
Publicado: (2025)
por: Azad, Shehreen, et al.
Publicado: (2025)
Grasping Trajectory Optimization with Point Clouds
por: Xiang, Yu, et al.
Publicado: (2024)
por: Xiang, Yu, et al.
Publicado: (2024)
Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding
por: Gao, Hong, et al.
Publicado: (2025)
por: Gao, Hong, et al.
Publicado: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
por: Li, Handong, et al.
Publicado: (2025)
por: Li, Handong, et al.
Publicado: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
por: Pian, Weiguo, et al.
Publicado: (2026)
por: Pian, Weiguo, et al.
Publicado: (2026)
A Coding Framework and Benchmark towards Low-Bitrate Video Understanding
por: Tian, Yuan, et al.
Publicado: (2022)
por: Tian, Yuan, et al.
Publicado: (2022)
Towards Online Multi-Modal Social Interaction Understanding
por: Li, Xinpeng, et al.
Publicado: (2025)
por: Li, Xinpeng, et al.
Publicado: (2025)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
por: Chang, Yue, et al.
Publicado: (2024)
por: Chang, Yue, et al.
Publicado: (2024)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
por: Li, Kunchang, et al.
Publicado: (2023)
por: Li, Kunchang, et al.
Publicado: (2023)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
por: Jing, Liqiang, et al.
Publicado: (2025)
por: Jing, Liqiang, et al.
Publicado: (2025)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
por: Zhang, Xiaoyi, et al.
Publicado: (2025)
por: Zhang, Xiaoyi, et al.
Publicado: (2025)
DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures
por: Hogue, Steven, et al.
Publicado: (2024)
por: Hogue, Steven, et al.
Publicado: (2024)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
por: Wang, Kai, et al.
Publicado: (2024)
por: Wang, Kai, et al.
Publicado: (2024)
From Pixel to Mask: A Survey of Out-of-Distribution Segmentation
por: Zhao, Wenjie, et al.
Publicado: (2025)
por: Zhao, Wenjie, et al.
Publicado: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing
por: Gu, Jing, et al.
Publicado: (2024)
por: Gu, Jing, et al.
Publicado: (2024)
Dr.V: A Hierarchical Perception-Temporal-Cognition Framework to Diagnose Video Hallucination by Fine-grained Spatial-Temporal Grounding
por: Luo, Meng, et al.
Publicado: (2025)
por: Luo, Meng, et al.
Publicado: (2025)
On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes
por: Modi, Rajat, et al.
Publicado: (2024)
por: Modi, Rajat, et al.
Publicado: (2024)
CaptainCook4D: A Dataset for Understanding Errors in Procedural Activities
por: Peddi, Rohith, et al.
Publicado: (2023)
por: Peddi, Rohith, et al.
Publicado: (2023)
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
por: He, Haibin, et al.
Publicado: (2026)
por: He, Haibin, et al.
Publicado: (2026)
SkillFormer: Unified Multi-View Video Understanding for Proficiency Estimation
por: Bianchi, Edoardo, et al.
Publicado: (2025)
por: Bianchi, Edoardo, et al.
Publicado: (2025)
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
por: Yang, Zhenyu, et al.
Publicado: (2025)
por: Yang, Zhenyu, et al.
Publicado: (2025)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
por: Bai, Purui, et al.
Publicado: (2026)
por: Bai, Purui, et al.
Publicado: (2026)
Ejemplares similares
-
Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization
por: Zhang, Yue, et al.
Publicado: (2024) -
Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment
por: Zhang, Yue, et al.
Publicado: (2025) -
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
por: Jing, Liqiang, et al.
Publicado: (2024) -
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
por: Jing, Liqiang, et al.
Publicado: (2025) -
Deep Dependency Networks and Advanced Inference Schemes for Multi-Label Classification
por: Arya, Shivvrat, et al.
Publicado: (2024)