APPO: Attention-guided Perception Policy Optimization for Video Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Henghui, Zhou, Chang, Chen, Xi, Hu, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos
par: Du, Henghui, et autres
Publié: (2025)
par: Du, Henghui, et autres
Publié: (2025)
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
par: He, Shuting, et autres
Publié: (2024)
par: He, Shuting, et autres
Publié: (2024)
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
par: Du, Henghui, et autres
Publié: (2025)
par: Du, Henghui, et autres
Publié: (2025)
SAM3-DMS: Decoupled Memory Selection for Multi-target Video Segmentation of SAM3
par: Shen, Ruiqi, et autres
Publié: (2026)
par: Shen, Ruiqi, et autres
Publié: (2026)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
par: Li, Guangyao, et autres
Publié: (2024)
par: Li, Guangyao, et autres
Publié: (2024)
MOVE: Motion-Guided Few-Shot Video Object Segmentation
par: Ying, Kaining, et autres
Publié: (2025)
par: Ying, Kaining, et autres
Publié: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
par: Cai, Dongnuan, et autres
Publié: (2026)
par: Cai, Dongnuan, et autres
Publié: (2026)
KVQ: Boosting Video Quality Assessment via Saliency-guided Local Perception
par: Qu, Yunpeng, et autres
Publié: (2025)
par: Qu, Yunpeng, et autres
Publié: (2025)
Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval
par: Jeong, Boseung, et autres
Publié: (2025)
par: Jeong, Boseung, et autres
Publié: (2025)
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
CPPO: Contrastive Perception Policy Optimization for VLM Agents
par: Rezaei, Ahmad, et autres
Publié: (2026)
par: Rezaei, Ahmad, et autres
Publié: (2026)
Segment Anything Across Shots: A Method and Benchmark
par: Hu, Hengrui, et autres
Publié: (2025)
par: Hu, Hengrui, et autres
Publié: (2025)
Artemis: Structured Visual Reasoning for Perception Policy Learning
par: Tang, Wei, et autres
Publié: (2025)
par: Tang, Wei, et autres
Publié: (2025)
Decoupling Perception from Reasoning for Hallucination-Resistant Video Understanding
par: Pu, Bowei, et autres
Publié: (2025)
par: Pu, Bowei, et autres
Publié: (2025)
Transferable-guided Attention Is All You Need for Video Domain Adaptation
par: Sacilotti, André, et autres
Publié: (2024)
par: Sacilotti, André, et autres
Publié: (2024)
EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing
par: Fu, Yang, et autres
Publié: (2026)
par: Fu, Yang, et autres
Publié: (2026)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
par: Ding, Henghui, et autres
Publié: (2025)
par: Ding, Henghui, et autres
Publié: (2025)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
par: Ying, Kaining, et autres
Publié: (2025)
par: Ying, Kaining, et autres
Publié: (2025)
Hybrid Latent Reasoning with Decoupled Policy Optimization
par: Cheng, Tao, et autres
Publié: (2026)
par: Cheng, Tao, et autres
Publié: (2026)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
par: Wu, Xueqing, et autres
Publié: (2026)
par: Wu, Xueqing, et autres
Publié: (2026)
Rate-Distortion Optimized Communication for Collaborative Perception
par: Liu, Genjia, et autres
Publié: (2025)
par: Liu, Genjia, et autres
Publié: (2025)
Video-based Heart Rate Estimation with Angle-guided ROI Optimization and Graph Signal Denoising
par: Pei, Gan, et autres
Publié: (2026)
par: Pei, Gan, et autres
Publié: (2026)
On-the-fly Modulation for Balanced Multimodal Learning
par: Wei, Yake, et autres
Publié: (2024)
par: Wei, Yake, et autres
Publié: (2024)
SteerSeg: Attention Steering for Reasoning Video Segmentation
par: Cheraghian, Ali, et autres
Publié: (2026)
par: Cheraghian, Ali, et autres
Publié: (2026)
Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video
par: Li, Chenxing, et autres
Publié: (2026)
par: Li, Chenxing, et autres
Publié: (2026)
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
par: He, Shuting, et autres
Publié: (2024)
par: He, Shuting, et autres
Publié: (2024)
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
par: Shuai, Xincheng, et autres
Publié: (2026)
par: Shuai, Xincheng, et autres
Publié: (2026)
LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization
par: Huang, Zhenpeng, et autres
Publié: (2026)
par: Huang, Zhenpeng, et autres
Publié: (2026)
SEAL: Semantic Attention Learning for Long Video Representation
par: Wang, Lan, et autres
Publié: (2024)
par: Wang, Lan, et autres
Publié: (2024)
GHR-VQA: Graph-guided Hierarchical Relational Reasoning for Video Question Answering
par: Brilli, Dionysia Danai, et autres
Publié: (2025)
par: Brilli, Dionysia Danai, et autres
Publié: (2025)
Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
par: Hao, Yutong, et autres
Publié: (2025)
par: Hao, Yutong, et autres
Publié: (2025)
Appearance Blur-driven AutoEncoder and Motion-guided Memory Module for Video Anomaly Detection
par: Lyu, Jiahao, et autres
Publié: (2024)
par: Lyu, Jiahao, et autres
Publié: (2024)
LDA-AQU: Adaptive Query-guided Upsampling via Local Deformable Attention
par: Du, Zewen, et autres
Publié: (2024)
par: Du, Zewen, et autres
Publié: (2024)
MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding
par: Zhang, Zhicheng, et autres
Publié: (2025)
par: Zhang, Zhicheng, et autres
Publié: (2025)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
par: Shi, Yudi, et autres
Publié: (2024)
par: Shi, Yudi, et autres
Publié: (2024)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
par: Shi, Yudi, et autres
Publié: (2026)
par: Shi, Yudi, et autres
Publié: (2026)
Act2See: Emergent Active Visual Perception for Video Reasoning
par: Ma, Martin Q., et autres
Publié: (2026)
par: Ma, Martin Q., et autres
Publié: (2026)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
par: Sinha, Sanchit, et autres
Publié: (2026)
par: Sinha, Sanchit, et autres
Publié: (2026)
G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
par: Xun, Shuhang, et autres
Publié: (2025)
par: Xun, Shuhang, et autres
Publié: (2025)
Documents similaires
-
Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos
par: Du, Henghui, et autres
Publié: (2025) -
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
par: He, Shuting, et autres
Publié: (2024) -
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
par: Du, Henghui, et autres
Publié: (2025) -
SAM3-DMS: Decoupled Memory Selection for Multi-target Video Segmentation of SAM3
par: Shen, Ruiqi, et autres
Publié: (2026) -
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
par: Li, Guangyao, et autres
Publié: (2024)