Leveraging LLMs with Iterative Loop Structure for Enhanced Social Intelligence in Video Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mori, Erika, Qiu, Yue, Kataoka, Hirokatsu, Aoki, Yoshimitsu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Simple Visual Artifact Detection in Sora-Generated Videos
par: Sugiyama, Misora, et autres
Publié: (2025)
par: Sugiyama, Misora, et autres
Publié: (2025)
Text-guided Synthetic Geometric Augmentation for Zero-shot 3D Understanding
par: Torimi, Kohei, et autres
Publié: (2025)
par: Torimi, Kohei, et autres
Publié: (2025)
Industrial Synthetic Segment Pre-training
par: Mae, Shinichi, et autres
Publié: (2025)
par: Mae, Shinichi, et autres
Publié: (2025)
S3OD: Towards Generalizable Salient Object Detection with Synthetic Data
par: Kupyn, Orest, et autres
Publié: (2025)
par: Kupyn, Orest, et autres
Publié: (2025)
Data Collection-free Masked Video Modeling
par: Ishikawa, Yuchi, et autres
Publié: (2024)
par: Ishikawa, Yuchi, et autres
Publié: (2024)
Rethinking Image Super-Resolution from Training Data Perspectives
par: Ohtani, Go, et autres
Publié: (2024)
par: Ohtani, Go, et autres
Publié: (2024)
Human Action Recognition without Human
par: Kataoka, Hirokatsu, et autres
Publié: (2016)
par: Kataoka, Hirokatsu, et autres
Publié: (2016)
HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics
par: Tateno, Masatoshi, et autres
Publié: (2025)
par: Tateno, Masatoshi, et autres
Publié: (2025)
BoundMatch: Boundary detection applied to semi-supervised segmentation
par: Ishikawa, Haruya, et autres
Publié: (2025)
par: Ishikawa, Haruya, et autres
Publié: (2025)
MaskDiffusion: Exploiting Pre-trained Diffusion Models for Semantic Segmentation
par: Kawano, Yasufumi, et autres
Publié: (2024)
par: Kawano, Yasufumi, et autres
Publié: (2024)
TAG: Guidance-free Open-Vocabulary Semantic Segmentation
par: Kawano, Yasufumi, et autres
Publié: (2024)
par: Kawano, Yasufumi, et autres
Publié: (2024)
Watermark-embedded Adversarial Examples for Copyright Protection against Diffusion Models
par: Zhu, Peifei, et autres
Publié: (2024)
par: Zhu, Peifei, et autres
Publié: (2024)
Can masking background and object reduce static bias for zero-shot action recognition?
par: Fukuzawa, Takumi, et autres
Publié: (2025)
par: Fukuzawa, Takumi, et autres
Publié: (2025)
Pre-training with 3D Synthetic Data: Learning 3D Point Cloud Instance Segmentation from 3D Synthetic Scenes
par: Otsuka, Daichi, et autres
Publié: (2025)
par: Otsuka, Daichi, et autres
Publié: (2025)
Structure Causal Models and LLMs Integration in Medical Visual Question Answering
par: Xu, Zibo, et autres
Publié: (2025)
par: Xu, Zibo, et autres
Publié: (2025)
3D Human Scan With A Moving Event Camera
par: Kohyama, Kai, et autres
Publié: (2024)
par: Kohyama, Kai, et autres
Publié: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering
par: Zou, Yuanhao, et autres
Publié: (2025)
par: Zou, Yuanhao, et autres
Publié: (2025)
AnimalClue: Recognizing Animals by their Traces
par: Shinoda, Risa, et autres
Publié: (2025)
par: Shinoda, Risa, et autres
Publié: (2025)
AgroBench: Vision-Language Model Benchmark in Agriculture
par: Shinoda, Risa, et autres
Publié: (2025)
par: Shinoda, Risa, et autres
Publié: (2025)
PowerCLIP: Powerset Alignment for Contrastive Pre-Training
par: Kawamura, Masaki, et autres
Publié: (2025)
par: Kawamura, Masaki, et autres
Publié: (2025)
Primitive Geometry Segment Pre-training for 3D Medical Image Segmentation
par: Tadokoro, Ryu, et autres
Publié: (2024)
par: Tadokoro, Ryu, et autres
Publié: (2024)
Exploring Limits of Diffusion-Synthetic Training with Weakly Supervised Semantic Segmentation
par: Yoshihashi, Ryota, et autres
Publié: (2023)
par: Yoshihashi, Ryota, et autres
Publié: (2023)
STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering
par: Bahrami, Emad, et autres
Publié: (2026)
par: Bahrami, Emad, et autres
Publié: (2026)
Top-down Activity Representation Learning for Video Question Answering
par: Wang, Yanan, et autres
Publié: (2024)
par: Wang, Yanan, et autres
Publié: (2024)
3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds
par: Yamada, Ryousuke, et autres
Publié: (2025)
par: Yamada, Ryousuke, et autres
Publié: (2025)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering
par: Tao, Qian, et autres
Publié: (2025)
par: Tao, Qian, et autres
Publié: (2025)
Iterative Event-based Motion Segmentation by Variational Contrast Maximization
par: Yamaki, Ryo, et autres
Publié: (2025)
par: Yamaki, Ryo, et autres
Publié: (2025)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
par: Liang, Lili, et autres
Publié: (2024)
par: Liang, Lili, et autres
Publié: (2024)
V-Loop: Visual Logical Loop Verification for Hallucination Detection in Medical Visual Question Answering
par: Jin, Mengyuan, et autres
Publié: (2026)
par: Jin, Mengyuan, et autres
Publié: (2026)
Multi-object event graph representation learning for Video Question Answering
par: Wang, Yanan, et autres
Publié: (2024)
par: Wang, Yanan, et autres
Publié: (2024)
Agentic Keyframe Search for Video Question Answering
par: Fan, Sunqi, et autres
Publié: (2025)
par: Fan, Sunqi, et autres
Publié: (2025)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
Secrets of Event-Based Optical Flow
par: Shiba, Shintaro, et autres
Publié: (2022)
par: Shiba, Shintaro, et autres
Publié: (2022)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
par: Meng, Yiran, et autres
Publié: (2025)
par: Meng, Yiran, et autres
Publié: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering
par: Zemskova, Tatiana, et autres
Publié: (2026)
par: Zemskova, Tatiana, et autres
Publié: (2026)
FDIF: Formula-Driven supervised Learning with Implicit Functions for 3D Medical Image Segmentation
par: Yamamoto, Yukinori, et autres
Publié: (2026)
par: Yamamoto, Yukinori, et autres
Publié: (2026)
Narrative Aligned Long Form Video Question Answering
par: Jain, Rahul, et autres
Publié: (2026)
par: Jain, Rahul, et autres
Publié: (2026)
Documents similaires
-
Simple Visual Artifact Detection in Sora-Generated Videos
par: Sugiyama, Misora, et autres
Publié: (2025) -
Text-guided Synthetic Geometric Augmentation for Zero-shot 3D Understanding
par: Torimi, Kohei, et autres
Publié: (2025) -
Industrial Synthetic Segment Pre-training
par: Mae, Shinichi, et autres
Publié: (2025) -
S3OD: Towards Generalizable Salient Object Detection with Synthetic Data
par: Kupyn, Orest, et autres
Publié: (2025) -
Data Collection-free Masked Video Modeling
par: Ishikawa, Yuchi, et autres
Publié: (2024)