VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Haibin, Ye, Maoyuan, Zhang, Jing, Liu, Juhua, Du, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching
por: He, Haibin, et al.
Publicado: (2024)
por: He, Haibin, et al.
Publicado: (2024)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
por: Ye, Maoyuan, et al.
Publicado: (2025)
por: Ye, Maoyuan, et al.
Publicado: (2025)
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
por: Zhang, Xike, et al.
Publicado: (2026)
por: Zhang, Xike, et al.
Publicado: (2026)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
Adapting Segment Anything Model for Power Transmission Corridor Hazard Segmentation
por: Chen, Hang, et al.
Publicado: (2025)
por: Chen, Hang, et al.
Publicado: (2025)
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
por: Zhang, Yan, et al.
Publicado: (2024)
por: Zhang, Yan, et al.
Publicado: (2024)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
por: Zhang, Yan, et al.
Publicado: (2025)
por: Zhang, Yan, et al.
Publicado: (2025)
DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text Spotting
por: Ye, Maoyuan, et al.
Publicado: (2023)
por: Ye, Maoyuan, et al.
Publicado: (2023)
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
por: Ye, Maoyuan, et al.
Publicado: (2024)
por: Ye, Maoyuan, et al.
Publicado: (2024)
Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model
por: Qiao, Yixuan, et al.
Publicado: (2021)
por: Qiao, Yixuan, et al.
Publicado: (2021)
Rethink Sparse Signals for Pose-guided Text-to-image Generation
por: Xuan, Wenjie, et al.
Publicado: (2025)
por: Xuan, Wenjie, et al.
Publicado: (2025)
Agentic Keyframe Search for Video Question Answering
por: Fan, Sunqi, et al.
Publicado: (2025)
por: Fan, Sunqi, et al.
Publicado: (2025)
Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing
por: Liu, Lin, et al.
Publicado: (2026)
por: Liu, Lin, et al.
Publicado: (2026)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2025)
por: Zhou, Sheng, et al.
Publicado: (2025)
Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders
por: Fang, Bo, et al.
Publicado: (2025)
por: Fang, Bo, et al.
Publicado: (2025)
KFFocus: Highlighting Keyframes for Enhanced Video Understanding
por: Nie, Ming, et al.
Publicado: (2025)
por: Nie, Ming, et al.
Publicado: (2025)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
por: Zhong, Qihuang, et al.
Publicado: (2026)
por: Zhong, Qihuang, et al.
Publicado: (2026)
GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization
por: Song, Zixuan, et al.
Publicado: (2025)
por: Song, Zixuan, et al.
Publicado: (2025)
Large Model based Sequential Keyframe Extraction for Video Summarization
por: Tan, Kailong, et al.
Publicado: (2024)
por: Tan, Kailong, et al.
Publicado: (2024)
KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes
por: Wu, Jingchao, et al.
Publicado: (2025)
por: Wu, Jingchao, et al.
Publicado: (2025)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
QTG-VQA: Question-Type-Guided Architectural for VideoQA Systems
por: He, Zhixian, et al.
Publicado: (2024)
por: He, Zhixian, et al.
Publicado: (2024)
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
por: He, Qingdong, et al.
Publicado: (2025)
por: He, Qingdong, et al.
Publicado: (2025)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
por: Zhang, Chengyi, et al.
Publicado: (2026)
por: Zhang, Chengyi, et al.
Publicado: (2026)
Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge
por: Xu, Yinsong, et al.
Publicado: (2026)
por: Xu, Yinsong, et al.
Publicado: (2026)
PolarMAE: Efficient Fetal Ultrasound Pre-training via Semantic Screening and Polar-Guided Masking
por: Lv, Meng, et al.
Publicado: (2026)
por: Lv, Meng, et al.
Publicado: (2026)
Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering
por: Kwon, Minchan, et al.
Publicado: (2026)
por: Kwon, Minchan, et al.
Publicado: (2026)
RFL-CDNet: Towards Accurate Change Detection via Richer Feature Learning
por: Gan, Yuhang, et al.
Publicado: (2024)
por: Gan, Yuhang, et al.
Publicado: (2024)
EduVQA: Towards Concept-Aware Assessment of Educational AI-Generated Videos
por: Chen, Baoliang, et al.
Publicado: (2026)
por: Chen, Baoliang, et al.
Publicado: (2026)
Generative Inbetweening: Adapting Image-to-Video Models for Keyframe Interpolation
por: Wang, Xiaojuan, et al.
Publicado: (2024)
por: Wang, Xiaojuan, et al.
Publicado: (2024)
Adaptive Keyframe Sampling for Long Video Understanding
por: Tang, Xi, et al.
Publicado: (2025)
por: Tang, Xi, et al.
Publicado: (2025)
MUJICA: Reforming SISR Models for PBR Material Super-Resolution via Cross-Map Attention
por: Du, Xin, et al.
Publicado: (2025)
por: Du, Xin, et al.
Publicado: (2025)
KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs
por: Song, Baiyang, et al.
Publicado: (2026)
por: Song, Baiyang, et al.
Publicado: (2026)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
por: Wang, Jing, et al.
Publicado: (2025)
por: Wang, Jing, et al.
Publicado: (2025)
AdaFlow: Efficient Long Video Editing via Adaptive Attention Slimming And Keyframe Selection
por: Zhang, Shuheng, et al.
Publicado: (2025)
por: Zhang, Shuheng, et al.
Publicado: (2025)
SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models
por: Liu, Bo, et al.
Publicado: (2025)
por: Liu, Bo, et al.
Publicado: (2025)
Ejemplares similares
-
SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
por: He, Haibin, et al.
Publicado: (2025) -
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
por: He, Haibin, et al.
Publicado: (2025) -
GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching
por: He, Haibin, et al.
Publicado: (2024) -
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
por: Ye, Maoyuan, et al.
Publicado: (2025) -
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
por: Zhang, Xike, et al.
Publicado: (2026)