ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yuan, Hua, Litao, Jin, Shilong, Huang, Wentao, Duan, Haoran |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Debiasing Diffusion Priors via 3D Attention for Consistent Gaussian Splatting
par: Jin, Shilong, et autres
Publié: (2025)
par: Jin, Shilong, et autres
Publié: (2025)
ConsDreamer: Advancing Multi-View Consistency for Zero-Shot Text-to-3D Generation
par: Zhou, Yuan, et autres
Publié: (2025)
par: Zhou, Yuan, et autres
Publié: (2025)
Information Bottleneck-based Causal Attention for Multi-label Medical Image Recognition
par: Cui, Xiaoxiao, et autres
Publié: (2025)
par: Cui, Xiaoxiao, et autres
Publié: (2025)
Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
par: Wang, Shida, et autres
Publié: (2026)
par: Wang, Shida, et autres
Publié: (2026)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
par: Yu, Rongyi, et autres
Publié: (2026)
par: Yu, Rongyi, et autres
Publié: (2026)
Video Anomaly Detection with Semantics-Aware Information Bottleneck
par: Li, Juntong, et autres
Publié: (2025)
par: Li, Juntong, et autres
Publié: (2025)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
par: Xie, Yuan, et autres
Publié: (2025)
par: Xie, Yuan, et autres
Publié: (2025)
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
par: Li, Xuchen, et autres
Publié: (2025)
par: Li, Xuchen, et autres
Publié: (2025)
Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning
par: Liu, Ming, et autres
Publié: (2026)
par: Liu, Ming, et autres
Publié: (2026)
State Space Prompting via Gathering and Spreading Spatio-Temporal Information for Video Understanding
par: Zhou, Jiahuan, et autres
Publié: (2025)
par: Zhou, Jiahuan, et autres
Publié: (2025)
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
par: Pan, Junwen, et autres
Publié: (2025)
par: Pan, Junwen, et autres
Publié: (2025)
Extending Information Bottleneck Attribution to Video Sequences
par: Solopova, Veronika, et autres
Publié: (2025)
par: Solopova, Veronika, et autres
Publié: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
par: Qi, Ji, et autres
Publié: (2025)
par: Qi, Ji, et autres
Publié: (2025)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
par: Pan, Junwen, et autres
Publié: (2025)
par: Pan, Junwen, et autres
Publié: (2025)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
par: Zhu, Zhiyu, et autres
Publié: (2025)
par: Zhu, Zhiyu, et autres
Publié: (2025)
VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation
par: Ma, Wentao, et autres
Publié: (2025)
par: Ma, Wentao, et autres
Publié: (2025)
On the Perception Bottleneck of VLMs for Chart Understanding
par: Liu, Junteng, et autres
Publié: (2025)
par: Liu, Junteng, et autres
Publié: (2025)
Causality Model for Semantic Understanding on Videos
par: Yicong, Li
Publié: (2025)
par: Yicong, Li
Publié: (2025)
Vamba: Understanding Hour-Long Videos with Hybrid Mamba-Transformers
par: Ren, Weiming, et autres
Publié: (2025)
par: Ren, Weiming, et autres
Publié: (2025)
Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
par: Zhu, Wentao
Publié: (2024)
par: Zhu, Wentao
Publié: (2024)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
par: Ye, Jinhui, et autres
Publié: (2025)
par: Ye, Jinhui, et autres
Publié: (2025)
Cell Variational Information Bottleneck Network
par: Zhai, Zhonghua, et autres
Publié: (2024)
par: Zhai, Zhonghua, et autres
Publié: (2024)
THU-Warwick Submission for EPIC-KITCHEN Challenge 2025: Semi-Supervised Video Object Segmentation
par: Gao, Mingqi, et autres
Publié: (2025)
par: Gao, Mingqi, et autres
Publié: (2025)
Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
par: Wang, Shijian, et autres
Publié: (2025)
par: Wang, Shijian, et autres
Publié: (2025)
ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking
par: Chen, Sijia, et autres
Publié: (2025)
par: Chen, Sijia, et autres
Publié: (2025)
Radiologist-Guided Causal Concept Bottleneck Models for Chest X-Ray Interpretation
par: Rafferty, Amy, et autres
Publié: (2026)
par: Rafferty, Amy, et autres
Publié: (2026)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Searching Priors Makes Text-to-Video Synthesis Better
par: Cheng, Haoran, et autres
Publié: (2024)
par: Cheng, Haoran, et autres
Publié: (2024)
Reinforcing Structured Chain-of-Thought for Video Understanding
par: Wang, Peiyao, et autres
Publié: (2026)
par: Wang, Peiyao, et autres
Publié: (2026)
DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents
par: Wang, Shengqin, et autres
Publié: (2026)
par: Wang, Shengqin, et autres
Publié: (2026)
Motion4D: Learning 3D-Consistent Motion and Semantics for 4D Scene Understanding
par: Zhou, Haoran, et autres
Publié: (2025)
par: Zhou, Haoran, et autres
Publié: (2025)
Co-VisiON: Co-Visibility ReasONing on Sparse Image Sets of Indoor Scenes
par: Chen, Chao, et autres
Publié: (2025)
par: Chen, Chao, et autres
Publié: (2025)
Spatial Information Bottleneck for Interpretable Visual Recognition
par: Shu, Kaixiang, et autres
Publié: (2025)
par: Shu, Kaixiang, et autres
Publié: (2025)
Information Bottleneck Approach to Spatial Attention Learning
par: Lai, Qiuxia, et autres
Publié: (2021)
par: Lai, Qiuxia, et autres
Publié: (2021)
InfoBFR: Real-World Blind Face Restoration via Information Bottleneck
par: Gao, Nan, et autres
Publié: (2025)
par: Gao, Nan, et autres
Publié: (2025)
VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition
par: Jin, Hongbo, et autres
Publié: (2025)
par: Jin, Hongbo, et autres
Publié: (2025)
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
par: Xu, Zhiyang, et autres
Publié: (2026)
par: Xu, Zhiyang, et autres
Publié: (2026)
Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
par: Zhang, Songchun, et autres
Publié: (2026)
par: Zhang, Songchun, et autres
Publié: (2026)
Documents similaires
-
Debiasing Diffusion Priors via 3D Attention for Consistent Gaussian Splatting
par: Jin, Shilong, et autres
Publié: (2025) -
ConsDreamer: Advancing Multi-View Consistency for Zero-Shot Text-to-3D Generation
par: Zhou, Yuan, et autres
Publié: (2025) -
Information Bottleneck-based Causal Attention for Multi-label Medical Image Recognition
par: Cui, Xiaoxiao, et autres
Publié: (2025) -
Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
par: Wang, Shida, et autres
Publié: (2026) -
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)