R^3-VQA: "Read the Room" by Video Social Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Niu, Lixing, Li, Jiapeng, Yu, Xingping, Wang, Shu, Feng, Ruining, Wu, Bo, Wei, Ping, Wang, Yisen, Fan, Lifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
Knowledge Condensation and Reasoning for Knowledge-based VQA
par: Hao, Dongze, et autres
Publié: (2024)
par: Hao, Dongze, et autres
Publié: (2024)
Uncovering Hidden Connections: Iterative Search and Reasoning for Video-grounded Dialog
par: Zhang, Haoyu, et autres
Publié: (2023)
par: Zhang, Haoyu, et autres
Publié: (2023)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
par: Shi, Jiapeng, et autres
Publié: (2026)
par: Shi, Jiapeng, et autres
Publié: (2026)
Video-R1: Reinforcing Video Reasoning in MLLMs
par: Feng, Kaituo, et autres
Publié: (2025)
par: Feng, Kaituo, et autres
Publié: (2025)
DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment
par: Yu, Li, et autres
Publié: (2025)
par: Yu, Li, et autres
Publié: (2025)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
par: Yu, Suhao, et autres
Publié: (2025)
par: Yu, Suhao, et autres
Publié: (2025)
SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
par: He, Haibin, et autres
Publié: (2025)
par: He, Haibin, et autres
Publié: (2025)
Learning Concept-Based Causal Transition and Symbolic Reasoning for Visual Planning
par: Qian, Yilue, et autres
Publié: (2023)
par: Qian, Yilue, et autres
Publié: (2023)
Evaluating and Modeling Social Intelligence: A Comparative Study of Human and AI Capabilities
par: Wang, Junqi, et autres
Publié: (2024)
par: Wang, Junqi, et autres
Publié: (2024)
GHR-VQA: Graph-guided Hierarchical Relational Reasoning for Video Question Answering
par: Brilli, Dionysia Danai, et autres
Publié: (2025)
par: Brilli, Dionysia Danai, et autres
Publié: (2025)
DiffVQA: Video Quality Assessment Using Diffusion Feature Extractor
par: Chen, Wei-Ting, et autres
Publié: (2025)
par: Chen, Wei-Ting, et autres
Publié: (2025)
R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios
par: Zhu, Lu, et autres
Publié: (2025)
par: Zhu, Lu, et autres
Publié: (2025)
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
par: He, Haibin, et autres
Publié: (2026)
par: He, Haibin, et autres
Publié: (2026)
MDS-VQA: Model-Informed Data Selection for Video Quality Assessment
par: Zou, Jian, et autres
Publié: (2026)
par: Zou, Jian, et autres
Publié: (2026)
Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge
par: Xu, Yinsong, et autres
Publié: (2026)
par: Xu, Yinsong, et autres
Publié: (2026)
Understanding Multi-Agent Reasoning with Large Language Models for Cartoon VQA
par: Wu, Tong, et autres
Publié: (2026)
par: Wu, Tong, et autres
Publié: (2026)
KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts
par: Hwang, Taebaek, et autres
Publié: (2025)
par: Hwang, Taebaek, et autres
Publié: (2025)
FMM-Attack: A Flow-based Multi-modal Adversarial Attack on Video-based LLMs
par: Li, Jinmin, et autres
Publié: (2024)
par: Li, Jinmin, et autres
Publié: (2024)
ViSS-R1: Self-Supervised Reinforcement Video Reasoning
par: Fang, Bo, et autres
Publié: (2025)
par: Fang, Bo, et autres
Publié: (2025)
VQA$^2$: Visual Question Answering for Video Quality Assessment
par: Jia, Ziheng, et autres
Publié: (2024)
par: Jia, Ziheng, et autres
Publié: (2024)
MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration
par: Wei, Lai, et autres
Publié: (2024)
par: Wei, Lai, et autres
Publié: (2024)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
par: Min, Juhong, et autres
Publié: (2024)
par: Min, Juhong, et autres
Publié: (2024)
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
par: Zhang, Yan, et autres
Publié: (2024)
par: Zhang, Yan, et autres
Publié: (2024)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
par: Ge, Qihang, et autres
Publié: (2024)
par: Ge, Qihang, et autres
Publié: (2024)
HCNQA: Enhancing 3D VQA with Hierarchical Concentration Narrowing Supervision
par: Zhou, Shengli, et autres
Publié: (2025)
par: Zhou, Shengli, et autres
Publié: (2025)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
par: Liu, Bo, et autres
Publié: (2025)
par: Liu, Bo, et autres
Publié: (2025)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
par: Zhang, Yan, et autres
Publié: (2025)
par: Zhang, Yan, et autres
Publié: (2025)
DIVA-VQA: Detecting Inter-frame Variations in UGC Video Quality
par: Wang, Xinyi, et autres
Publié: (2025)
par: Wang, Xinyi, et autres
Publié: (2025)
Learn 3D VQA Better with Active Selection and Reannotation
par: Zhou, Shengli, et autres
Publié: (2025)
par: Zhou, Shengli, et autres
Publié: (2025)
GRAM: Global Reasoning for Multi-Page VQA
par: Blau, Tsachi, et autres
Publié: (2024)
par: Blau, Tsachi, et autres
Publié: (2024)
Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
par: Ning, Shan, et autres
Publié: (2026)
par: Ning, Shan, et autres
Publié: (2026)
RGC-VQA: An Exploration Database for Robotic-Generated Video Quality Assessment
par: Jin, Jianing, et autres
Publié: (2025)
par: Jin, Jianing, et autres
Publié: (2025)
CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models
par: Foss, Aaron, et autres
Publié: (2025)
par: Foss, Aaron, et autres
Publié: (2025)
Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space
par: Zhang, Weichen, et autres
Publié: (2025)
par: Zhang, Weichen, et autres
Publié: (2025)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
Object-Shot Enhanced Grounding Network for Egocentric Video
par: Feng, Yisen, et autres
Publié: (2025)
par: Feng, Yisen, et autres
Publié: (2025)
CycleHOI: Improving Human-Object Interaction Detection with Cycle Consistency of Detection and Generation
par: Wang, Yisen, et autres
Publié: (2024)
par: Wang, Yisen, et autres
Publié: (2024)
R2G: Reasoning to Ground in 3D Scenes
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
3DV-TON: Textured 3D-Guided Consistent Video Try-on via Diffusion Models
par: Wei, Min, et autres
Publié: (2025)
par: Wei, Min, et autres
Publié: (2025)
Documents similaires
-
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025) -
Knowledge Condensation and Reasoning for Knowledge-based VQA
par: Hao, Dongze, et autres
Publié: (2024) -
Uncovering Hidden Connections: Iterative Search and Reasoning for Video-grounded Dialog
par: Zhang, Haoyu, et autres
Publié: (2023) -
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
par: Shi, Jiapeng, et autres
Publié: (2026) -
Video-R1: Reinforcing Video Reasoning in MLLMs
par: Feng, Kaituo, et autres
Publié: (2025)