SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Haibin, Zhong, Qihuang, Liu, Juhua, Du, Bo, Wang, Peng, Zhang, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
di: He, Haibin, et al.
Pubblicazione: (2026)
di: He, Haibin, et al.
Pubblicazione: (2026)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
di: Ye, Maoyuan, et al.
Pubblicazione: (2025)
di: Ye, Maoyuan, et al.
Pubblicazione: (2025)
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
di: Zhang, Yan, et al.
Pubblicazione: (2024)
di: Zhang, Yan, et al.
Pubblicazione: (2024)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
di: Zhang, Yan, et al.
Pubblicazione: (2025)
di: Zhang, Yan, et al.
Pubblicazione: (2025)
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
di: He, Haibin, et al.
Pubblicazione: (2025)
di: He, Haibin, et al.
Pubblicazione: (2025)
GoMatching: A Simple Baseline for Video Text Spotting via Long and Short Term Matching
di: He, Haibin, et al.
Pubblicazione: (2024)
di: He, Haibin, et al.
Pubblicazione: (2024)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model
di: Qiao, Yixuan, et al.
Pubblicazione: (2021)
di: Qiao, Yixuan, et al.
Pubblicazione: (2021)
Adapting Segment Anything Model for Power Transmission Corridor Hazard Segmentation
di: Chen, Hang, et al.
Pubblicazione: (2025)
di: Chen, Hang, et al.
Pubblicazione: (2025)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
di: He, Haibin, et al.
Pubblicazione: (2025)
di: He, Haibin, et al.
Pubblicazione: (2025)
Rethink Sparse Signals for Pose-guided Text-to-image Generation
di: Xuan, Wenjie, et al.
Pubblicazione: (2025)
di: Xuan, Wenjie, et al.
Pubblicazione: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
di: Zhang, Xike, et al.
Pubblicazione: (2026)
di: Zhang, Xike, et al.
Pubblicazione: (2026)
Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly Detection
di: Yang, Zhiwei, et al.
Pubblicazione: (2024)
di: Yang, Zhiwei, et al.
Pubblicazione: (2024)
TokenFocus-VQA: Enhancing Text-to-Image Alignment with Position-Aware Focus and Multi-Perspective Aggregations on LVLMs
di: Zhang, Zijian, et al.
Pubblicazione: (2025)
di: Zhang, Zijian, et al.
Pubblicazione: (2025)
DeepSolo++: Let Transformer Decoder with Explicit Points Solo for Multilingual Text Spotting
di: Ye, Maoyuan, et al.
Pubblicazione: (2023)
di: Ye, Maoyuan, et al.
Pubblicazione: (2023)
TextIM: Part-aware Interactive Motion Synthesis from Text
di: Fan, Siyuan, et al.
Pubblicazione: (2024)
di: Fan, Siyuan, et al.
Pubblicazione: (2024)
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
di: Ye, Maoyuan, et al.
Pubblicazione: (2024)
di: Ye, Maoyuan, et al.
Pubblicazione: (2024)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
di: Zou, Bo, et al.
Pubblicazione: (2024)
di: Zou, Bo, et al.
Pubblicazione: (2024)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery
di: He, Runlong, et al.
Pubblicazione: (2024)
di: He, Runlong, et al.
Pubblicazione: (2024)
GHR-VQA: Graph-guided Hierarchical Relational Reasoning for Video Question Answering
di: Brilli, Dionysia Danai, et al.
Pubblicazione: (2025)
di: Brilli, Dionysia Danai, et al.
Pubblicazione: (2025)
Light-VQA+: A Video Quality Assessment Model for Exposure Correction with Vision-Language Guidance
di: Zhou, Xunchu, et al.
Pubblicazione: (2024)
di: Zhou, Xunchu, et al.
Pubblicazione: (2024)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
Text-Guided Mixup Towards Long-Tailed Image Categorization
di: Franklin, Richard, et al.
Pubblicazione: (2024)
di: Franklin, Richard, et al.
Pubblicazione: (2024)
SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models
di: Liu, Bo, et al.
Pubblicazione: (2025)
di: Liu, Bo, et al.
Pubblicazione: (2025)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2025)
PolarMAE: Efficient Fetal Ultrasound Pre-training via Semantic Screening and Polar-Guided Masking
di: Lv, Meng, et al.
Pubblicazione: (2026)
di: Lv, Meng, et al.
Pubblicazione: (2026)
RFL-CDNet: Towards Accurate Change Detection via Richer Feature Learning
di: Gan, Yuhang, et al.
Pubblicazione: (2024)
di: Gan, Yuhang, et al.
Pubblicazione: (2024)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
BERT-VQA: Visual Question Answering on Plots
di: Vu, Tai, et al.
Pubblicazione: (2025)
di: Vu, Tai, et al.
Pubblicazione: (2025)
TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling
di: Cho, Hyunmin, et al.
Pubblicazione: (2025)
di: Cho, Hyunmin, et al.
Pubblicazione: (2025)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
di: Bai, Ziyi, et al.
Pubblicazione: (2024)
di: Bai, Ziyi, et al.
Pubblicazione: (2024)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
QTG-VQA: Question-Type-Guided Architectural for VideoQA Systems
di: He, Zhixian, et al.
Pubblicazione: (2024)
di: He, Zhixian, et al.
Pubblicazione: (2024)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
Integrating Query-aware Segmentation and Cross-Attention for Robust VQA
di: Choi, Wonjun, et al.
Pubblicazione: (2024)
di: Choi, Wonjun, et al.
Pubblicazione: (2024)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
di: Min, Juhong, et al.
Pubblicazione: (2024)
di: Min, Juhong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
di: He, Haibin, et al.
Pubblicazione: (2026) -
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
di: Ye, Maoyuan, et al.
Pubblicazione: (2025) -
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
di: Zhang, Yan, et al.
Pubblicazione: (2024) -
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
di: Zhang, Yan, et al.
Pubblicazione: (2025) -
GoMatching++: Parameter- and Data-Efficient Arbitrary-Shaped Video Text Spotting and Benchmarking
di: He, Haibin, et al.
Pubblicazione: (2025)